第 18 周学习包:动物研究设计与偏倚控制
本周核心问题
在看到肿瘤曲线之前,如何把研究设计成无论结果“好看”或“不好看”都能可信解释?
一、学习目标
完成本周后,应能够:
- 把项目问题转化为 primary endpoint 和预设 decision rule;
- 识别 experimental unit、technical observation 和 pseudoreplication;
- 用预期效应、变异和错误率讨论样本量依据;
- 设计分层/区组随机并平衡 baseline tumor volume;
- 区分 allocation concealment、conduct blinding、outcome blinding 和 analysis blinding;
- 预设 inclusion/exclusion、humane endpoint 和 missing-data 处理;
- 选择 vehicle、isotype、reference、阳性和机制对照;
- 按 ARRIVE 2.0 审查完整性和可重复性。
二、伦理与执行边界
动物研究只可在审批通过的 protocol 下由受训人员执行。科学设计、3Rs(Replacement、Reduction、Refinement)和动物福利不是相互独立:无法回答问题的动物实验也构成不必要使用。
三、学习时间安排
标准版:4 小时
| 学习块 | 时间 | 任务 | 产出 |
|---|---|---|---|
| 诊断 | 15 min | 10 题 | 盲点清单 |
| 问题与 endpoint | 45 min | hypothesis/estimand/decision | protocol skeleton |
| n 与随机 | 65 min | power、block、baseline | allocation plan |
| 盲法与缺失 | 55 min | bias control/退出 | rules table |
| 案例与验收 | 60 min | 评审缺陷方案 | revised design |
深入版:6 小时
- 阅读 ARRIVE Essential 10 与 explanation 60 分钟;
- 使用 NC3Rs Experimental Design Assistant 思路重画研究结构 45 分钟;
- 对历史模型估计 baseline variability 和 effect size 30 分钟;
- 与 in vivo/统计同事完成 protocol review 45 分钟。
四、课前诊断
- 每只动物测 10 次肿瘤体积,n 是 10 吗?
- “每组 8 只,因为以前都这样”是样本量依据吗?
- 随机分组是否自动保证 baseline 完全相同?
- 先按肿瘤大小排序再轮流分组是否等于随机?
- 给药人员不能盲法时,研究就无法进行任何盲法吗?
- 看完数据后删除“异常动物”有何风险?
- body-weight loss 只属于安全数据吗?
- isotype control 在所有研究中都必要吗?
- 组均值相同但退出率不同,结论会怎样?
- primary endpoint 与 exploratory endpoint 有何不同?
五、从一句决策问题开始
示例:
在 exposure 可比且耐受可接受的条件下,候选 A 是否相对 vehicle 显著延缓该模型的肿瘤生长,并达到预设的最小有意义效应?
这句话定义了:
- 比较对象;
- 模型;
- exposure/tolerability 条件;
- primary outcome;
- “统计显著”之外的 biological relevance。
避免模糊问题:“看看有没有药效”“比较几个剂量哪个最好”。
六、Primary endpoint、estimand 与 decision rule
需要预先写清:
- Population:哪些动物进入分析;
- Treatment:剂量、路线、频次和时段;
- Endpoint:某日 tumor-volume change、纵向 growth rate、event-free survival 等;
- Intercurrent events:死亡、超 humane endpoint、给药失败、不可测肿瘤如何处理;
- Contrast:treated vs control 的差、比或模型参数;
- Decision rule:统计区间和最小生物效应怎样触发决策。
Primary endpoint 只宜少而明确。Secondary/exploratory endpoints 可用于机制与假设生成,但不应事后替代失败的 primary endpoint 而不说明。
七、Experimental unit 与重复
在多数给药肿瘤研究中,接受独立处理分配的单只动物是 experimental unit。以下不是额外 n:
- 同一肿瘤重复卡尺测量;
- 同一动物多个视野;
- 同一样本多个 assay wells;
- 同一动物多个肿瘤(若治疗分配在动物层)。
若动物共享笼位、donor、tumor batch 或配液 batch,这些可能形成 block/cluster,需要在设计和分析中考虑。
八、样本量依据
8.1 至少需要四个输入
- primary endpoint;
- 最小有意义效应;
- 历史/先导研究的变异;
- 预设 alpha、power 和分析方法。
还需估计:
- engraftment failure;
- humane endpoint/非肿瘤死亡;
- 采样失败;
- 多重比较;
- block/sex/donor 结构。
不能用“多一点总比少一点好”替代 power 和 3Rs;也不能为了节省动物而设计一个几乎不可能区分有意义效应的研究。
8.2 Pilot 与 confirmatory study
探索性先导研究可用于估计 variability、dose/exposure 和模型可行性,但不应以小样本偶然效应直接形成强候选结论。确认性研究需要更明确的 endpoint、power、bias control 和复现。
九、随机、基线平衡与 allocation concealment
9.1 为什么只写“随机”不够
报告需要说明:
- 随机序列如何生成;
- 是否按 baseline tumor volume、sex、donor 或 cage block;
- 谁生成序列;
- 何时揭盲;
- 分配时是否隐藏下一组别。
9.2 肿瘤研究的常见做法
先筛选满足预设 tumor-volume window 的动物,再按基线体积分层/区组,在区组内随机到各组。这样兼顾随机性和 baseline 平衡。
仅按体积排序后 A-B-C-A-B-C 轮流分配是确定性分配,容易被预测,不等同于随机。
9.3 Baseline 不要只看 p 值
小样本中非显著不等于平衡。应展示 individual baseline、均值/中位数和范围,并评估是否存在会改变结论的系统差异。
十、盲法分阶段设计
| 阶段 | 盲法问题 |
|---|---|
| Allocation | 分配者是否知道下一处理? |
| Conduct | 给药/照料者是否知道组别,是否会差别处理? |
| Outcome | 卡尺、影像、病理和行为评估者是否盲? |
| Analysis | 组别能否编码后再进行清洗、异常值和模型选择? |
若给药外观或路线不同无法完全盲,仍可对 tumor measurement、pathology 和 analysis 实施盲法,并明确哪些阶段未盲及原因。
十一、对照组
| 对照 | 回答的问题 |
|---|---|
| Vehicle | 制剂/操作背景与自然进程 |
| Isotype/non-binding | 相同 Fc/格式的非特异效应;是否必要取决于机制 |
| Reference molecule | assay/model sensitivity 与相对定位 |
| Positive control | 模型是否能对已知有效干预响应 |
| Mechanism control | 单臂、Fc-silent、blocking 等验证因果链 |
| Untreated | 某些情况下区分 vehicle 影响,但不是总需设置 |
对照应直接对应主要替代解释,避免为“看起来完整”无目的增加组别。
十二、Dose、schedule、PK/PD 与采样
研究设计必须同时回答:
- 给药 dose/route/schedule 是否获得目标 exposure;
- 不同组是否 exposure 可比;
- PK、ADA、RO、PD 和 tumor measurement 是否在可解释时间点对齐;
- 终点 tissue 是否受最后一次给药时间影响;
- serial blood collection 是否本身影响动物;
- satellite group 是否必要。
只给 mg/kg 不测 exposure,会把“分子无效”和“未达到暴露”混在一起。
十三、Inclusion、Exclusion 与 Humane Endpoints
在研究开始前定义:
- enrollment tumor-volume window;
- 非成功 engraftment;
- 给药/采样技术失败;
- ulceration、体重和临床状态 humane criteria;
- 非肿瘤相关死亡;
- 超出测量范围或达到 endpoint;
- 哪些动物保留在 primary analysis;
- censoring/last observation 等处理原则。
Humane removal 是必要伦理措施,不应被当作普通 missing value 静默删除。退出原因和时间是结果的一部分。
十四、Tolerability
最低监测:
- individual body weight change;
- clinical observations;
- 给药部位;
- food/water/behavior(按方案);
- 必要时 hematology、chemistry、cytokine;
- unexpected death/necropsy。
肿瘤抑制只在明显毒性剂量出现时,治疗窗解释受限。体重稳定也不能证明“无毒”,但体重下降可能混杂肿瘤曲线和生存终点。
十五、研究启动前清单
十六、综合案例
方案:每组 6 只;肿瘤长到 80–250 mm³ 后研究者按当天笼位顺序分组;实验员知道候选组;Day 21 比较均值,届时 vehicle 已有 3 只因肿瘤过大退出;候选组 1 只因体重下降被删除;无 PK;只展示均值±SEM。
参考分析
主要问题:baseline window 太宽且未分层随机;allocation 可预测;outcome 未盲;退出造成 informative missingness;候选 toxic animal 事后删除;固定 Day 21 只剩选择性幸存动物;无 individual curves/PK,不能区分暴露与活性。应预设 endpoint/退出处理,做区组随机和盲测,展示个体与 event endpoint,保留 tolerability 动物信息并增加适当 PK/PD。
十七、闭卷验收与答案
- experimental unit?——独立接受处理分配的单位,常为单只动物。
- 多次测量增加 n 吗?——不增加独立 n。
- n 的四个输入?——endpoint、effect、variance、alpha/power/analysis。
- baseline block 后还需什么?——区组内随机。
- 盲法有几阶段?——allocation、conduct、outcome、analysis。
- 退出动物如何处理?——按预设规则、报告原因/时间并考虑 informative censoring。
- 只看 body weight 足够吗?——不够,是最低线索之一。
- 为什么测 PK?——确认 exposure,区分无效与未暴露。
- primary 与 exploratory?——预设主要决策终点 vs 次要/假设生成。
- ARRIVE 用途?——规划与透明报告,减少偏倚并提高可重复性。
十八、本周最终交付物
把一份已脱敏方案重写成两页 pre-study design memo:decision、endpoint、n rationale、randomization/blinding、controls、sampling、tolerability、exclusion/missing rules 和 ARRIVE checklist。