WEEK 18动物模型与转化

动物研究设计与偏倚控制

在看数据前定义 endpoint、样本量、分层随机、盲法、退出规则和耐受监测。

透明报告不能修复有偏设计;偏倚控制必须从研究启动前开始。

Hypothesis到Endpoint到Sample size到Randomise到Blind到Analyse的概念证据链
本周概念图:从输入、实验到可解释结论。箭头表示审查顺序,不代表单向因果。
Data clinic

均值相近是否代表基线平衡?

CASE 18

先回答:两组基线均值都约 150 mm³,但 A 范围 90–210,B 范围 135–165。应如何分组和分析?

基线肿瘤体积分布范围教学数据图
教学合成数据可视化。读图时先确认单位、坐标、对照和统计层级。
均值范围风险
A150 mm³90–210异质性大
B150 mm³135–165较集中
  1. A range = 120 mm³
  2. B range = 30 mm³
  3. A 的范围宽度为 B 的 4×
计算结果均值相同掩盖了分布和潜在 growth-rate 差异。
项目解读按 baseline tumor volume 分层/区组后随机,展示 individual baseline,并在纵向模型中考虑 baseline。
证据边界小样本中 baseline p>0.05 不证明平衡;不能事后移动动物让曲线更整齐。

第 18 周学习包:动物研究设计与偏倚控制

本周核心问题

在看到肿瘤曲线之前,如何把研究设计成无论结果“好看”或“不好看”都能可信解释?

一、学习目标

完成本周后,应能够:

  1. 把项目问题转化为 primary endpoint 和预设 decision rule;
  2. 识别 experimental unit、technical observation 和 pseudoreplication;
  3. 用预期效应、变异和错误率讨论样本量依据;
  4. 设计分层/区组随机并平衡 baseline tumor volume;
  5. 区分 allocation concealment、conduct blinding、outcome blinding 和 analysis blinding;
  6. 预设 inclusion/exclusion、humane endpoint 和 missing-data 处理;
  7. 选择 vehicle、isotype、reference、阳性和机制对照;
  8. 按 ARRIVE 2.0 审查完整性和可重复性。

二、伦理与执行边界

动物研究只可在审批通过的 protocol 下由受训人员执行。科学设计、3Rs(Replacement、Reduction、Refinement)和动物福利不是相互独立:无法回答问题的动物实验也构成不必要使用。

三、学习时间安排

标准版:4 小时

学习块 时间 任务 产出
诊断 15 min 10 题 盲点清单
问题与 endpoint 45 min hypothesis/estimand/decision protocol skeleton
n 与随机 65 min power、block、baseline allocation plan
盲法与缺失 55 min bias control/退出 rules table
案例与验收 60 min 评审缺陷方案 revised design

深入版:6 小时

  • 阅读 ARRIVE Essential 10 与 explanation 60 分钟;
  • 使用 NC3Rs Experimental Design Assistant 思路重画研究结构 45 分钟;
  • 对历史模型估计 baseline variability 和 effect size 30 分钟;
  • 与 in vivo/统计同事完成 protocol review 45 分钟。

四、课前诊断

  1. 每只动物测 10 次肿瘤体积,n 是 10 吗?
  2. “每组 8 只,因为以前都这样”是样本量依据吗?
  3. 随机分组是否自动保证 baseline 完全相同?
  4. 先按肿瘤大小排序再轮流分组是否等于随机?
  5. 给药人员不能盲法时,研究就无法进行任何盲法吗?
  6. 看完数据后删除“异常动物”有何风险?
  7. body-weight loss 只属于安全数据吗?
  8. isotype control 在所有研究中都必要吗?
  9. 组均值相同但退出率不同,结论会怎样?
  10. primary endpoint 与 exploratory endpoint 有何不同?

五、从一句决策问题开始

示例:

在 exposure 可比且耐受可接受的条件下,候选 A 是否相对 vehicle 显著延缓该模型的肿瘤生长,并达到预设的最小有意义效应?

这句话定义了:

  • 比较对象;
  • 模型;
  • exposure/tolerability 条件;
  • primary outcome;
  • “统计显著”之外的 biological relevance。

避免模糊问题:“看看有没有药效”“比较几个剂量哪个最好”。

六、Primary endpoint、estimand 与 decision rule

需要预先写清:

  • Population:哪些动物进入分析;
  • Treatment:剂量、路线、频次和时段;
  • Endpoint:某日 tumor-volume change、纵向 growth rate、event-free survival 等;
  • Intercurrent events:死亡、超 humane endpoint、给药失败、不可测肿瘤如何处理;
  • Contrast:treated vs control 的差、比或模型参数;
  • Decision rule:统计区间和最小生物效应怎样触发决策。

Primary endpoint 只宜少而明确。Secondary/exploratory endpoints 可用于机制与假设生成,但不应事后替代失败的 primary endpoint 而不说明。

七、Experimental unit 与重复

在多数给药肿瘤研究中,接受独立处理分配的单只动物是 experimental unit。以下不是额外 n:

  • 同一肿瘤重复卡尺测量;
  • 同一动物多个视野;
  • 同一样本多个 assay wells;
  • 同一动物多个肿瘤(若治疗分配在动物层)。

若动物共享笼位、donor、tumor batch 或配液 batch,这些可能形成 block/cluster,需要在设计和分析中考虑。

八、样本量依据

8.1 至少需要四个输入

  1. primary endpoint;
  2. 最小有意义效应;
  3. 历史/先导研究的变异;
  4. 预设 alpha、power 和分析方法。

还需估计:

  • engraftment failure;
  • humane endpoint/非肿瘤死亡;
  • 采样失败;
  • 多重比较;
  • block/sex/donor 结构。

不能用“多一点总比少一点好”替代 power 和 3Rs;也不能为了节省动物而设计一个几乎不可能区分有意义效应的研究。

8.2 Pilot 与 confirmatory study

探索性先导研究可用于估计 variability、dose/exposure 和模型可行性,但不应以小样本偶然效应直接形成强候选结论。确认性研究需要更明确的 endpoint、power、bias control 和复现。

九、随机、基线平衡与 allocation concealment

9.1 为什么只写“随机”不够

报告需要说明:

  • 随机序列如何生成;
  • 是否按 baseline tumor volume、sex、donor 或 cage block;
  • 谁生成序列;
  • 何时揭盲;
  • 分配时是否隐藏下一组别。

9.2 肿瘤研究的常见做法

先筛选满足预设 tumor-volume window 的动物,再按基线体积分层/区组,在区组内随机到各组。这样兼顾随机性和 baseline 平衡。

仅按体积排序后 A-B-C-A-B-C 轮流分配是确定性分配,容易被预测,不等同于随机。

9.3 Baseline 不要只看 p 值

小样本中非显著不等于平衡。应展示 individual baseline、均值/中位数和范围,并评估是否存在会改变结论的系统差异。

十、盲法分阶段设计

阶段 盲法问题
Allocation 分配者是否知道下一处理?
Conduct 给药/照料者是否知道组别,是否会差别处理?
Outcome 卡尺、影像、病理和行为评估者是否盲?
Analysis 组别能否编码后再进行清洗、异常值和模型选择?

若给药外观或路线不同无法完全盲,仍可对 tumor measurement、pathology 和 analysis 实施盲法,并明确哪些阶段未盲及原因。

十一、对照组

对照 回答的问题
Vehicle 制剂/操作背景与自然进程
Isotype/non-binding 相同 Fc/格式的非特异效应;是否必要取决于机制
Reference molecule assay/model sensitivity 与相对定位
Positive control 模型是否能对已知有效干预响应
Mechanism control 单臂、Fc-silent、blocking 等验证因果链
Untreated 某些情况下区分 vehicle 影响,但不是总需设置

对照应直接对应主要替代解释,避免为“看起来完整”无目的增加组别。

十二、Dose、schedule、PK/PD 与采样

研究设计必须同时回答:

  • 给药 dose/route/schedule 是否获得目标 exposure;
  • 不同组是否 exposure 可比;
  • PK、ADA、RO、PD 和 tumor measurement 是否在可解释时间点对齐;
  • 终点 tissue 是否受最后一次给药时间影响;
  • serial blood collection 是否本身影响动物;
  • satellite group 是否必要。

只给 mg/kg 不测 exposure,会把“分子无效”和“未达到暴露”混在一起。

十三、Inclusion、Exclusion 与 Humane Endpoints

在研究开始前定义:

  • enrollment tumor-volume window;
  • 非成功 engraftment;
  • 给药/采样技术失败;
  • ulceration、体重和临床状态 humane criteria;
  • 非肿瘤相关死亡;
  • 超出测量范围或达到 endpoint;
  • 哪些动物保留在 primary analysis;
  • censoring/last observation 等处理原则。

Humane removal 是必要伦理措施,不应被当作普通 missing value 静默删除。退出原因和时间是结果的一部分。

十四、Tolerability

最低监测:

  • individual body weight change;
  • clinical observations;
  • 给药部位;
  • food/water/behavior(按方案);
  • 必要时 hematology、chemistry、cytokine;
  • unexpected death/necropsy。

肿瘤抑制只在明显毒性剂量出现时,治疗窗解释受限。体重稳定也不能证明“无毒”,但体重下降可能混杂肿瘤曲线和生存终点。

十五、研究启动前清单

十六、综合案例

方案:每组 6 只;肿瘤长到 80–250 mm³ 后研究者按当天笼位顺序分组;实验员知道候选组;Day 21 比较均值,届时 vehicle 已有 3 只因肿瘤过大退出;候选组 1 只因体重下降被删除;无 PK;只展示均值±SEM。

参考分析

主要问题:baseline window 太宽且未分层随机;allocation 可预测;outcome 未盲;退出造成 informative missingness;候选 toxic animal 事后删除;固定 Day 21 只剩选择性幸存动物;无 individual curves/PK,不能区分暴露与活性。应预设 endpoint/退出处理,做区组随机和盲测,展示个体与 event endpoint,保留 tolerability 动物信息并增加适当 PK/PD。

十七、闭卷验收与答案

  1. experimental unit?——独立接受处理分配的单位,常为单只动物。
  2. 多次测量增加 n 吗?——不增加独立 n。
  3. n 的四个输入?——endpoint、effect、variance、alpha/power/analysis。
  4. baseline block 后还需什么?——区组内随机。
  5. 盲法有几阶段?——allocation、conduct、outcome、analysis。
  6. 退出动物如何处理?——按预设规则、报告原因/时间并考虑 informative censoring。
  7. 只看 body weight 足够吗?——不够,是最低线索之一。
  8. 为什么测 PK?——确认 exposure,区分无效与未暴露。
  9. primary 与 exploratory?——预设主要决策终点 vs 次要/假设生成。
  10. ARRIVE 用途?——规划与透明报告,减少偏倚并提高可重复性。

十八、本周最终交付物

把一份已脱敏方案重写成两页 pre-study design memo:decision、endpoint、n rationale、randomization/blinding、controls、sampling、tolerability、exclusion/missing rules 和 ARRIVE checklist。

十九、延伸阅读

  1. ARRIVE Guidelines 2.0
  2. ARRIVE 2.0 explanation and elaboration
  3. NC3Rs key elements of a well-designed experiment
  4. Statistical considerations for preclinical studies