第 18 周学习包:动物研究设计与偏倚控制
本周核心问题
在看到肿瘤曲线之前,如何把研究设计成无论结果“好看”或“不好看”都能可信解释?
一、学习目标
完成本周后,应能够:
- 把项目问题转化为 primary endpoint 和预设 decision rule;
- 识别 experimental unit、technical observation 和 pseudoreplication;
- 用预期效应、变异和错误率讨论样本量依据;
- 设计分层/区组随机并平衡 baseline tumor volume;
- 区分 allocation concealment、conduct blinding、outcome blinding 和 analysis blinding;
- 预设 inclusion/exclusion、humane endpoint 和 missing-data 处理;
- 选择 vehicle、isotype、reference、阳性和机制对照;
- 按 ARRIVE 2.0 审查完整性和可重复性。
二、伦理与执行边界
动物研究只可在审批通过的 protocol 下由受训人员执行。科学设计、3Rs(Replacement、Reduction、Refinement)和动物福利不是相互独立:无法回答问题的动物实验也构成不必要使用。
三、学习时间安排
标准版:4 小时
| 学习块 | 时间 | 任务 | 产出 |
|---|---|---|---|
| 诊断 | 15 min | 10 题 | 盲点清单 |
| 问题与 endpoint | 45 min | hypothesis/estimand/decision | protocol skeleton |
| n 与随机 | 65 min | power、block、baseline | allocation plan |
| 盲法与缺失 | 55 min | bias control/退出 | rules table |
| 案例与验收 | 60 min | 评审缺陷方案 | revised design |
深入版:6 小时
- 阅读 ARRIVE Essential 10 与 explanation 60 分钟;
- 使用 NC3Rs Experimental Design Assistant 思路重画研究结构 45 分钟;
- 对历史模型估计 baseline variability 和 effect size 30 分钟;
- 与 in vivo/统计同事完成 protocol review 45 分钟。
四、课前诊断
- 每只动物测 10 次肿瘤体积,n 是 10 吗?
- “每组 8 只,因为以前都这样”是样本量依据吗?
- 随机分组是否自动保证 baseline 完全相同?
- 先按肿瘤大小排序再轮流分组是否等于随机?
- 给药人员不能盲法时,研究就无法进行任何盲法吗?
- 看完数据后删除“异常动物”有何风险?
- body-weight loss 只属于安全数据吗?
- isotype control 在所有研究中都必要吗?
- 组均值相同但退出率不同,结论会怎样?
- primary endpoint 与 exploratory endpoint 有何不同?
课前诊断参考答案(先独立作答,再展开核对)
- 不是:experimental unit 是独立接受处理分配的单位,通常是单只动物;同一肿瘤的重复卡尺测量只是 technical observation,可降低测量变异,但不增加独立 n。
- 不是:样本量至少需要四个输入——primary endpoint、最小有意义效应、历史/先导变异、预设 alpha/power 与分析方法;“以前都这样”既不能证明 power,也不符合 3Rs 的 Reduction 原则。
- 不保证:随机只在期望上平衡,小样本中组间基线仍可能系统不同;非显著 p 值不等于平衡,应展示 individual baseline、均值/中位数和范围,并评估差异是否会改变结论。
- 不等于:按体积排序后 A-B-C 轮流分配是确定性分配,序列可被预测且与肿瘤大小系统相关;应先按基线体积分层/区组,再在区组内随机。
- 不是:盲法分为 allocation、conduct、outcome、analysis 四个阶段;给药外观或路线受限时,仍可对 tumor measurement、pathology 和 analysis 编码实施盲法,并明确哪些阶段未盲及原因。
- 事后排除偏倚:数据驱动的 exclusion 会引入 selection bias,当“异常”与结果相关时构成 informative missingness;排除规则必须在研究开始前预设,退出原因和时间本身是结果的一部分。
- 不只是:体重下降混杂药效解释——毒性可抑制进食与整体生长、制造“假药效”,也会干扰肿瘤曲线和生存终点;efficacy 与 tolerability 必须联读。
- 不是:isotype 回答相同 Fc/格式的非特异效应,是否设置取决于机制与主要替代解释;对照应直接对应替代解释,避免为“看起来完整”无目的增加组别。
- 结论不可信:退出率不同提示 attrition 与处理相关,均值只在幸存动物间比较,产生 survivor bias;需报告各组各时点 n 与退出原因,并用 event endpoint 和 sensitivity analysis。
- 预设与决策地位不同:primary endpoint 是预先设定的主要决策终点,宜少而明确;exploratory endpoint 用于机制与假设生成,不应事后替代失败的 primary endpoint。
五、从一句决策问题开始
示例:
在 exposure 可比且耐受可接受的条件下,候选 A 是否相对 vehicle 显著延缓该模型的肿瘤生长,并达到预设的最小有意义效应?
这句话定义了:
- 比较对象;
- 模型;
- exposure/tolerability 条件;
- primary outcome;
- “统计显著”之外的 biological relevance。
避免模糊问题:“看看有没有药效”“比较几个剂量哪个最好”。
六、Primary endpoint、estimand 与 decision rule
需要预先写清:
- Population:哪些动物进入分析;
- Treatment:剂量、路线、频次和时段;
- Endpoint:某日 tumor-volume change、纵向 growth rate、event-free survival 等;
- Intercurrent events:死亡、超 humane endpoint、给药失败、不可测肿瘤如何处理;
- Contrast:treated vs control 的差、比或模型参数;
- Decision rule:统计区间和最小生物效应怎样触发决策。
Primary endpoint 只宜少而明确。Secondary/exploratory endpoints 可用于机制与假设生成,但不应事后替代失败的 primary endpoint 而不说明。
七、Experimental unit 与重复
在多数给药肿瘤研究中,接受独立处理分配的单只动物是 experimental unit。以下不是额外 n:
- 同一肿瘤重复卡尺测量;
- 同一动物多个视野;
- 同一样本多个 assay wells;
- 同一动物多个肿瘤(若治疗分配在动物层)。
若动物共享笼位、donor、tumor batch 或配液 batch,这些可能形成 block/cluster,需要在设计和分析中考虑。
八、样本量依据
8.1 至少需要四个输入
- primary endpoint;
- 最小有意义效应;
- 历史/先导研究的变异;
- 预设 alpha、power 和分析方法。
还需估计:
- engraftment failure;
- humane endpoint/非肿瘤死亡;
- 采样失败;
- 多重比较;
- block/sex/donor 结构。
不能用“多一点总比少一点好”替代 power 和 3Rs;也不能为了节省动物而设计一个几乎不可能区分有意义效应的研究。
8.2 Pilot 与 confirmatory study
探索性先导研究可用于估计 variability、dose/exposure 和模型可行性,但不应以小样本偶然效应直接形成强候选结论。确认性研究需要更明确的 endpoint、power、bias control 和复现。
九、随机、基线平衡与 allocation concealment
9.1 为什么只写“随机”不够
报告需要说明:
- 随机序列如何生成;
- 是否按 baseline tumor volume、sex、donor 或 cage block;
- 谁生成序列;
- 何时揭盲;
- 分配时是否隐藏下一组别。
9.2 肿瘤研究的常见做法
先筛选满足预设 tumor-volume window 的动物,再按基线体积分层/区组,在区组内随机到各组。这样兼顾随机性和 baseline 平衡。
仅按体积排序后 A-B-C-A-B-C 轮流分配是确定性分配,容易被预测,不等同于随机。
9.3 Baseline 不要只看 p 值
小样本中非显著不等于平衡。应展示 individual baseline、均值/中位数和范围,并评估是否存在会改变结论的系统差异。
十、盲法分阶段设计
| 阶段 | 盲法问题 |
|---|---|
| Allocation | 分配者是否知道下一处理? |
| Conduct | 给药/照料者是否知道组别,是否会差别处理? |
| Outcome | 卡尺、影像、病理和行为评估者是否盲? |
| Analysis | 组别能否编码后再进行清洗、异常值和模型选择? |
若给药外观或路线不同无法完全盲,仍可对 tumor measurement、pathology 和 analysis 实施盲法,并明确哪些阶段未盲及原因。
十一、对照组
| 对照 | 回答的问题 |
|---|---|
| Vehicle | 制剂/操作背景与自然进程 |
| Isotype/non-binding | 相同 Fc/格式的非特异效应;是否必要取决于机制 |
| Reference molecule | assay/model sensitivity 与相对定位 |
| Positive control | 模型是否能对已知有效干预响应 |
| Mechanism control | 单臂、Fc-silent、blocking 等验证因果链 |
| Untreated | 某些情况下区分 vehicle 影响,但不是总需设置 |
对照应直接对应主要替代解释,避免为“看起来完整”无目的增加组别。
十二、Dose、schedule、PK/PD 与采样
研究设计必须同时回答:
- 给药 dose/route/schedule 是否获得目标 exposure;
- 不同组是否 exposure 可比;
- PK、ADA、RO、PD 和 tumor measurement 是否在可解释时间点对齐;
- 终点 tissue 是否受最后一次给药时间影响;
- serial blood collection 是否本身影响动物;
- satellite group 是否必要。
只给 mg/kg 不测 exposure,会把“分子无效”和“未达到暴露”混在一起。
十三、Inclusion、Exclusion 与 Humane Endpoints
在研究开始前定义:
- enrollment tumor-volume window;
- 非成功 engraftment;
- 给药/采样技术失败;
- ulceration、体重和临床状态 humane criteria;
- 非肿瘤相关死亡;
- 超出测量范围或达到 endpoint;
- 哪些动物保留在 primary analysis;
- censoring/last observation 等处理原则。
Humane removal 是必要伦理措施,不应被当作普通 missing value 静默删除。退出原因和时间是结果的一部分。
十四、Tolerability
最低监测:
- individual body weight change;
- clinical observations;
- 给药部位;
- food/water/behavior(按方案);
- 必要时 hematology、chemistry、cytokine;
- unexpected death/necropsy。
肿瘤抑制只在明显毒性剂量出现时,治疗窗解释受限。体重稳定也不能证明“无毒”,但体重下降可能混杂肿瘤曲线和生存终点。
十五、研究启动前清单
十六、综合案例
方案:每组 6 只;肿瘤长到 80–250 mm³ 后研究者按当天笼位顺序分组;实验员知道候选组;Day 21 比较均值,届时 vehicle 已有 3 只因肿瘤过大退出;候选组 1 只因体重下降被删除;无 PK;只展示均值±SEM。
参考分析
主要问题:baseline window 太宽且未分层随机;allocation 可预测;outcome 未盲;退出造成 informative missingness;候选 toxic animal 事后删除;固定 Day 21 只剩选择性幸存动物;无 individual curves/PK,不能区分暴露与活性。应预设 endpoint/退出处理,做区组随机和盲测,展示个体与 event endpoint,保留 tolerability 动物信息并增加适当 PK/PD。
十七、闭卷验收
- experimental unit?
- 多次测量增加 n 吗?
- n 的四个输入?
- baseline block 后还需什么?
- 盲法有几阶段?
- 退出动物如何处理?
- 只看 body weight 足够吗?
- 为什么测 PK?
- primary 与 exploratory?
- ARRIVE 用途?
闭卷验收参考答案(先闭卷作答,再展开核对)
- Experimental unit:独立接受处理分配的单位,在多数给药肿瘤研究中是单只动物;同一动物的重复测量、多视野、多 assay wells 或多肿瘤不构成额外独立 n。
- 不增加独立 n:同一肿瘤反复卡尺测量、同一动物多个视野、同一样本多个 wells 都是 technical observation,只能降低测量变异,不能当作生物重复。
- 四个输入:primary endpoint、最小有意义效应、历史/先导变异,以及预设的 alpha、power 和分析方法;还需估计 engraftment failure、humane endpoint、采样失败、多重比较和 block/sex/donor 结构。
- 区组内随机:先按 baseline tumor volume、sex、donor 或 cage 分层/区组,再在区组内随机分配,同时获得随机性和基线平衡。
- 四个阶段:allocation(分配隐藏)、conduct(给药/照料盲)、outcome(卡尺、影像、病理、行为评估盲)和 analysis(组别编码后再清洗、异常值处理与建模)。
- 按预设规则处理:Humane removal 是必要伦理措施而非普通 missing value;应报告退出原因与时间、各组各时点 n,考虑 informative censoring 并做 sensitivity analysis,不能静默删除。
- 不够:body weight 只是最低 tolerability 监测线索之一,还需 clinical observations、给药部位、food/water/behavior 及必要时 hematology/chemistry/cytokine;且体重稳定不能证明“无毒”。
- 确认 exposure:把“分子无效”与“未达到暴露”区分开,并核查不同组 exposure 是否可比;只给 mg/kg 不测 PK 时这两种解释无法分离。
- 预设 vs 假设生成:primary endpoint 是预先设定的主要决策终点,直接触发 decision rule;exploratory endpoint 服务于机制与假设生成,不应事后替代失败的 primary endpoint 而不说明。
- 规划与透明报告:按 ARRIVE 2.0 审查随机、盲法、样本量依据、对照与数据分析等设计完整性和可重复性,系统减少偏倚并提高研究可重复性。
十八、本周最终交付物
把一份已脱敏方案重写成两页 pre-study design memo:decision、endpoint、n rationale、randomization/blinding、controls、sampling、tolerability、exclusion/missing rules 和 ARRIVE checklist。