WEEK 18动物模型与转化

动物研究设计与偏倚控制

在看数据前定义 endpoint、样本量、分层随机、盲法、退出规则和耐受监测。

透明报告不能修复有偏设计;偏倚控制必须从研究启动前开始。

Hypothesis到Endpoint到Sample size到Randomise到Blind到Analyse的概念证据链
本周概念图:从输入、实验到可解释结论。箭头表示审查顺序,不代表单向因果。
Data Clinic · Case 18标本编号 BIO-W18

均值相近是否代表个体一致?

先回答:两组各 4 只小鼠的个体肿瘤生长曲线(相对基线 %)如图。两组 d15 均值接近,这对分组、分析和结论意味着什么?

个体肿瘤生长曲线:两组各 4 鼠(相对基线 %)教学数据图
教学合成数据可视化。读图时先确认单位、坐标、对照和统计层级。
组别d15 均值d15 个体范围个体极差
组A(4 鼠)350%180–500%320 个百分点
组B(4 鼠)309%300–315%15 个百分点
  1. 组A d15 均值 = (430+180+500+290)/4 = 350%
  2. 组B d15 均值 = (310+315+300+312)/4 ≈ 309%
  3. 均值差 41 个百分点看似接近,但个体极差 A=320、B=15,相差约 21 倍
  4. 组A 实际是“两快两慢”的混合群体,均值曲线完全掩盖了这一结构
计算结果两组均值相近(350% vs 309%),但组A 的个体离散度约为组B 的 21 倍。
项目解读分组应按基线体积分层随机;分析需报告个体曲线或中位数+范围;“疗效稳定”的证据来自个体一致性而非均值相近。
证据边界内推边界:仅描述教学合成数据的离散度差异;外推边界:不能据此推断真实疗效或样本量;伪差风险:n 小且偏态时均值±SEM 严重低估离散度,截断 y 轴会放大表观差异。

第 18 周学习包:动物研究设计与偏倚控制

本周核心问题

在看到肿瘤曲线之前,如何把研究设计成无论结果“好看”或“不好看”都能可信解释?

一、学习目标

完成本周后,应能够:

  1. 把项目问题转化为 primary endpoint 和预设 decision rule;
  2. 识别 experimental unit、technical observation 和 pseudoreplication;
  3. 用预期效应、变异和错误率讨论样本量依据;
  4. 设计分层/区组随机并平衡 baseline tumor volume;
  5. 区分 allocation concealment、conduct blinding、outcome blinding 和 analysis blinding;
  6. 预设 inclusion/exclusion、humane endpoint 和 missing-data 处理;
  7. 选择 vehicle、isotype、reference、阳性和机制对照;
  8. 按 ARRIVE 2.0 审查完整性和可重复性。

二、伦理与执行边界

动物研究只可在审批通过的 protocol 下由受训人员执行。科学设计、3Rs(Replacement、Reduction、Refinement)和动物福利不是相互独立:无法回答问题的动物实验也构成不必要使用。

三、学习时间安排

标准版:4 小时

学习块 时间 任务 产出
诊断 15 min 10 题 盲点清单
问题与 endpoint 45 min hypothesis/estimand/decision protocol skeleton
n 与随机 65 min power、block、baseline allocation plan
盲法与缺失 55 min bias control/退出 rules table
案例与验收 60 min 评审缺陷方案 revised design

深入版:6 小时

  • 阅读 ARRIVE Essential 10 与 explanation 60 分钟;
  • 使用 NC3Rs Experimental Design Assistant 思路重画研究结构 45 分钟;
  • 对历史模型估计 baseline variability 和 effect size 30 分钟;
  • 与 in vivo/统计同事完成 protocol review 45 分钟。

四、课前诊断

  1. 每只动物测 10 次肿瘤体积,n 是 10 吗?
  2. “每组 8 只,因为以前都这样”是样本量依据吗?
  3. 随机分组是否自动保证 baseline 完全相同?
  4. 先按肿瘤大小排序再轮流分组是否等于随机?
  5. 给药人员不能盲法时,研究就无法进行任何盲法吗?
  6. 看完数据后删除“异常动物”有何风险?
  7. body-weight loss 只属于安全数据吗?
  8. isotype control 在所有研究中都必要吗?
  9. 组均值相同但退出率不同,结论会怎样?
  10. primary endpoint 与 exploratory endpoint 有何不同?
课前诊断参考答案(先独立作答,再展开核对)
  1. 不是:experimental unit 是独立接受处理分配的单位,通常是单只动物;同一肿瘤的重复卡尺测量只是 technical observation,可降低测量变异,但不增加独立 n。
  2. 不是:样本量至少需要四个输入——primary endpoint、最小有意义效应、历史/先导变异、预设 alpha/power 与分析方法;“以前都这样”既不能证明 power,也不符合 3Rs 的 Reduction 原则。
  3. 不保证:随机只在期望上平衡,小样本中组间基线仍可能系统不同;非显著 p 值不等于平衡,应展示 individual baseline、均值/中位数和范围,并评估差异是否会改变结论。
  4. 不等于:按体积排序后 A-B-C 轮流分配是确定性分配,序列可被预测且与肿瘤大小系统相关;应先按基线体积分层/区组,再在区组内随机。
  5. 不是:盲法分为 allocation、conduct、outcome、analysis 四个阶段;给药外观或路线受限时,仍可对 tumor measurement、pathology 和 analysis 编码实施盲法,并明确哪些阶段未盲及原因。
  6. 事后排除偏倚:数据驱动的 exclusion 会引入 selection bias,当“异常”与结果相关时构成 informative missingness;排除规则必须在研究开始前预设,退出原因和时间本身是结果的一部分。
  7. 不只是:体重下降混杂药效解释——毒性可抑制进食与整体生长、制造“假药效”,也会干扰肿瘤曲线和生存终点;efficacy 与 tolerability 必须联读。
  8. 不是:isotype 回答相同 Fc/格式的非特异效应,是否设置取决于机制与主要替代解释;对照应直接对应替代解释,避免为“看起来完整”无目的增加组别。
  9. 结论不可信:退出率不同提示 attrition 与处理相关,均值只在幸存动物间比较,产生 survivor bias;需报告各组各时点 n 与退出原因,并用 event endpoint 和 sensitivity analysis。
  10. 预设与决策地位不同:primary endpoint 是预先设定的主要决策终点,宜少而明确;exploratory endpoint 用于机制与假设生成,不应事后替代失败的 primary endpoint。

五、从一句决策问题开始

示例:

在 exposure 可比且耐受可接受的条件下,候选 A 是否相对 vehicle 显著延缓该模型的肿瘤生长,并达到预设的最小有意义效应?

这句话定义了:

  • 比较对象;
  • 模型;
  • exposure/tolerability 条件;
  • primary outcome;
  • “统计显著”之外的 biological relevance。

避免模糊问题:“看看有没有药效”“比较几个剂量哪个最好”。

六、Primary endpoint、estimand 与 decision rule

需要预先写清:

  • Population:哪些动物进入分析;
  • Treatment:剂量、路线、频次和时段;
  • Endpoint:某日 tumor-volume change、纵向 growth rate、event-free survival 等;
  • Intercurrent events:死亡、超 humane endpoint、给药失败、不可测肿瘤如何处理;
  • Contrast:treated vs control 的差、比或模型参数;
  • Decision rule:统计区间和最小生物效应怎样触发决策。

Primary endpoint 只宜少而明确。Secondary/exploratory endpoints 可用于机制与假设生成,但不应事后替代失败的 primary endpoint 而不说明。

七、Experimental unit 与重复

在多数给药肿瘤研究中,接受独立处理分配的单只动物是 experimental unit。以下不是额外 n:

  • 同一肿瘤重复卡尺测量;
  • 同一动物多个视野;
  • 同一样本多个 assay wells;
  • 同一动物多个肿瘤(若治疗分配在动物层)。

若动物共享笼位、donor、tumor batch 或配液 batch,这些可能形成 block/cluster,需要在设计和分析中考虑。

八、样本量依据

8.1 至少需要四个输入

  1. primary endpoint;
  2. 最小有意义效应;
  3. 历史/先导研究的变异;
  4. 预设 alpha、power 和分析方法。

还需估计:

  • engraftment failure;
  • humane endpoint/非肿瘤死亡;
  • 采样失败;
  • 多重比较;
  • block/sex/donor 结构。

不能用“多一点总比少一点好”替代 power 和 3Rs;也不能为了节省动物而设计一个几乎不可能区分有意义效应的研究。

8.2 Pilot 与 confirmatory study

探索性先导研究可用于估计 variability、dose/exposure 和模型可行性,但不应以小样本偶然效应直接形成强候选结论。确认性研究需要更明确的 endpoint、power、bias control 和复现。

九、随机、基线平衡与 allocation concealment

9.1 为什么只写“随机”不够

报告需要说明:

  • 随机序列如何生成;
  • 是否按 baseline tumor volume、sex、donor 或 cage block;
  • 谁生成序列;
  • 何时揭盲;
  • 分配时是否隐藏下一组别。

9.2 肿瘤研究的常见做法

先筛选满足预设 tumor-volume window 的动物,再按基线体积分层/区组,在区组内随机到各组。这样兼顾随机性和 baseline 平衡。

仅按体积排序后 A-B-C-A-B-C 轮流分配是确定性分配,容易被预测,不等同于随机。

9.3 Baseline 不要只看 p 值

小样本中非显著不等于平衡。应展示 individual baseline、均值/中位数和范围,并评估是否存在会改变结论的系统差异。

十、盲法分阶段设计

阶段 盲法问题
Allocation 分配者是否知道下一处理?
Conduct 给药/照料者是否知道组别,是否会差别处理?
Outcome 卡尺、影像、病理和行为评估者是否盲?
Analysis 组别能否编码后再进行清洗、异常值和模型选择?

若给药外观或路线不同无法完全盲,仍可对 tumor measurement、pathology 和 analysis 实施盲法,并明确哪些阶段未盲及原因。

十一、对照组

对照 回答的问题
Vehicle 制剂/操作背景与自然进程
Isotype/non-binding 相同 Fc/格式的非特异效应;是否必要取决于机制
Reference molecule assay/model sensitivity 与相对定位
Positive control 模型是否能对已知有效干预响应
Mechanism control 单臂、Fc-silent、blocking 等验证因果链
Untreated 某些情况下区分 vehicle 影响,但不是总需设置

对照应直接对应主要替代解释,避免为“看起来完整”无目的增加组别。

十二、Dose、schedule、PK/PD 与采样

研究设计必须同时回答:

  • 给药 dose/route/schedule 是否获得目标 exposure;
  • 不同组是否 exposure 可比;
  • PK、ADA、RO、PD 和 tumor measurement 是否在可解释时间点对齐;
  • 终点 tissue 是否受最后一次给药时间影响;
  • serial blood collection 是否本身影响动物;
  • satellite group 是否必要。

只给 mg/kg 不测 exposure,会把“分子无效”和“未达到暴露”混在一起。

十三、Inclusion、Exclusion 与 Humane Endpoints

在研究开始前定义:

  • enrollment tumor-volume window;
  • 非成功 engraftment;
  • 给药/采样技术失败;
  • ulceration、体重和临床状态 humane criteria;
  • 非肿瘤相关死亡;
  • 超出测量范围或达到 endpoint;
  • 哪些动物保留在 primary analysis;
  • censoring/last observation 等处理原则。

Humane removal 是必要伦理措施,不应被当作普通 missing value 静默删除。退出原因和时间是结果的一部分。

十四、Tolerability

最低监测:

  • individual body weight change;
  • clinical observations;
  • 给药部位;
  • food/water/behavior(按方案);
  • 必要时 hematology、chemistry、cytokine;
  • unexpected death/necropsy。

肿瘤抑制只在明显毒性剂量出现时,治疗窗解释受限。体重稳定也不能证明“无毒”,但体重下降可能混杂肿瘤曲线和生存终点。

十五、研究启动前清单

十六、综合案例

方案:每组 6 只;肿瘤长到 80–250 mm³ 后研究者按当天笼位顺序分组;实验员知道候选组;Day 21 比较均值,届时 vehicle 已有 3 只因肿瘤过大退出;候选组 1 只因体重下降被删除;无 PK;只展示均值±SEM。

参考分析

主要问题:baseline window 太宽且未分层随机;allocation 可预测;outcome 未盲;退出造成 informative missingness;候选 toxic animal 事后删除;固定 Day 21 只剩选择性幸存动物;无 individual curves/PK,不能区分暴露与活性。应预设 endpoint/退出处理,做区组随机和盲测,展示个体与 event endpoint,保留 tolerability 动物信息并增加适当 PK/PD。

十七、闭卷验收

  1. experimental unit?
  2. 多次测量增加 n 吗?
  3. n 的四个输入?
  4. baseline block 后还需什么?
  5. 盲法有几阶段?
  6. 退出动物如何处理?
  7. 只看 body weight 足够吗?
  8. 为什么测 PK?
  9. primary 与 exploratory?
  10. ARRIVE 用途?
闭卷验收参考答案(先闭卷作答,再展开核对)
  1. Experimental unit:独立接受处理分配的单位,在多数给药肿瘤研究中是单只动物;同一动物的重复测量、多视野、多 assay wells 或多肿瘤不构成额外独立 n。
  2. 不增加独立 n:同一肿瘤反复卡尺测量、同一动物多个视野、同一样本多个 wells 都是 technical observation,只能降低测量变异,不能当作生物重复。
  3. 四个输入:primary endpoint、最小有意义效应、历史/先导变异,以及预设的 alpha、power 和分析方法;还需估计 engraftment failure、humane endpoint、采样失败、多重比较和 block/sex/donor 结构。
  4. 区组内随机:先按 baseline tumor volume、sex、donor 或 cage 分层/区组,再在区组内随机分配,同时获得随机性和基线平衡。
  5. 四个阶段:allocation(分配隐藏)、conduct(给药/照料盲)、outcome(卡尺、影像、病理、行为评估盲)和 analysis(组别编码后再清洗、异常值处理与建模)。
  6. 按预设规则处理:Humane removal 是必要伦理措施而非普通 missing value;应报告退出原因与时间、各组各时点 n,考虑 informative censoring 并做 sensitivity analysis,不能静默删除。
  7. 不够:body weight 只是最低 tolerability 监测线索之一,还需 clinical observations、给药部位、food/water/behavior 及必要时 hematology/chemistry/cytokine;且体重稳定不能证明“无毒”。
  8. 确认 exposure:把“分子无效”与“未达到暴露”区分开,并核查不同组 exposure 是否可比;只给 mg/kg 不测 PK 时这两种解释无法分离。
  9. 预设 vs 假设生成:primary endpoint 是预先设定的主要决策终点,直接触发 decision rule;exploratory endpoint 服务于机制与假设生成,不应事后替代失败的 primary endpoint 而不说明。
  10. 规划与透明报告:按 ARRIVE 2.0 审查随机、盲法、样本量依据、对照与数据分析等设计完整性和可重复性,系统减少偏倚并提高研究可重复性。

十八、本周最终交付物

把一份已脱敏方案重写成两页 pre-study design memo:decision、endpoint、n rationale、randomization/blinding、controls、sampling、tolerability、exclusion/missing rules 和 ARRIVE checklist。

十九、延伸阅读

  1. ARRIVE Guidelines 2.0
  2. ARRIVE 2.0 explanation and elaboration
  3. NC3Rs key elements of a well-designed experiment
  4. Statistical considerations for preclinical studies