WEEK 23跨学科决策

候选选择决策模拟

先过 gates 与 veto risks,再用权重、证据强度和 value of information 处理权衡。

加权分数用于暴露偏好,不用于把非靶杀伤或不可制造性平均掉。

TPP到Gates到Evidence到Uncertainty到VoI到Decision的概念证据链
本周概念图:从输入、实验到可解释结论。箭头表示审查顺序,不代表单向因果。
Data Clinic · Case 23标本编号 BIO-W23

加权分数高但触发 veto

先回答:A potency、PK、CMC 分数为 9/4/3;B 为 7/8/8。权重 40%/30%/30%,但 A target-negative killing=15%。应如何决策?

候选加权分教学数据图
教学合成数据可视化。读图时先确认单位、坐标、对照和统计层级。
候选PotencyPKCMC加权分
A9435.7
B7887.6
  1. A = 9×0.4 + 4×0.3 + 3×0.3 = 3.6 + 1.2 + 0.9 = 5.7
  2. B = 7×0.4 + 8×0.3 + 8×0.3 = 2.8 + 2.4 + 2.4 = 7.6
  3. A 的 target-negative killing 15% 触发预设 veto,先于任何加权分讨论
  4. 敏感性检查:即使把 potency 权重提高到 60%(20/20 其余),A = 9×0.6+4×0.2+3×0.2 = 6.8 仍低于 B 同权重 7.4——结论对权重不敏感
计算结果B 总体明显更优;A 还存在 target-negative killing veto,不能靠 potency 高分抵消。
项目解读推进 B;A 仅在非靶效应可由样品伪差或快速工程 rescue 解释时保留 backup。
证据边界内推边界:分数只暴露该组权重下的团队偏好;外推边界:missing data 不是中间分,veto 不能被总分抵消;伪差风险:事后调整权重“让心仪候选赢”会把决策工具变成装饰。

第 23 周学习包:候选选择决策模拟

本周核心问题

A 的 affinity/potency 更好,B 的表达、选择性和 PK 更好:怎样在不被单一“明星指标”绑架的情况下做出可解释、可复盘的候选选择?

一、学习目标

完成本周后,应能够:

  1. 从 target product profile 和临床机制反推候选标准;
  2. 区分 minimum gate、trade-off criterion、veto risk 和 information gap;
  3. 建立 potency、selectivity、developability、PK、efficacy 和 safety evidence matrix;
  4. 使用权重与 sensitivity analysis,而不让加权分数掩盖致命风险;
  5. 区分 evidence strength、effect size 和 uncertainty;
  6. 识别样品/assay/model 不可比导致的假排名;
  7. 选择 value-of-information 最高的补实验;
  8. 主持一次 60 分钟 candidate nomination meeting。

二、学习时间安排

标准版:4 小时

学习块 时间 任务 产出
诊断 15 min 10 题 盲点清单
决策框架 55 min gates/criteria/uncertainty scorecard
数据包审查 60 min A vs B evidence matrix
补实验选择 45 min value of information experiment ranking
模拟会议 45 min roles/debate/decision minutes
验收 20 min 闭卷 得分

深入版:6 小时

  • 将一个历史项目用本框架回顾,检查 hindsight bias 45 分钟;
  • 对权重和缺失数据做 sensitivity analysis 45 分钟;
  • 邀请细胞、DMPK、CMC/in vivo 同事进行 60 分钟模拟;
  • 写一页 pre-read 和一页 decision record 30 分钟。

三、课前诊断

  1. Affinity 最好是否应自动胜出?
  2. 所有指标归一化加权后总分最高是否足以 nomination?
  3. 缺失数据可以按中间分填吗?
  4. Potency 与 PK 能否相互补偿?
  5. 高表达是否能抵消 target-negative killing?
  6. 两个候选来自不同样品批次时可直接比较吗?
  7. 一个 p<0.05 的小鼠结果比重复方向一致但 p>0.05 更可靠吗?
  8. 补实验应优先做最容易的还是最能改变决策的?
  9. 会议中“暂不决策”何时合理?
  10. Decision record 为什么要写反方证据?
课前诊断参考答案(先独立作答,再展开核对)
  1. 不应:affinity 只是单一维度;实体瘤 TCE 的 TPP 更强调 target-low killing、安全窗、可开发性与 exposure。应先从 TPP 反推候选标准,再比较数据。
  2. 不足以:加权分可能掩盖 veto 风险与未关闭的 minimum gate;必须先过 gates/veto,missing 单独处理,分数附证据强度与不确定性。
  3. 不应:未测不是“中等”;缺失是 information gap,应标记 uncertainty 并评估其可能改变排名的程度。
  4. 有限度:作为 trade-off 指标,更高 exposure 可部分弥补 potency 不足,但需 exposure–response 数据支撑;veto 级风险(如非靶激活)不能被平均掉。
  5. 不能抵消:target-negative killing 属 safety/veto 风险,不能被 efficacy 或表达优势平均化;需独立评估,必要时一票否决。
  6. 不可直接比较:批次、QC 状态、assay run 和模型差异会造成假排名;需先确认可比性(同板/同 donor/同批),必要时同批重测。
  7. 不一定:证据强度看独立批次、正交方法、样本质量与方向一致性;重复且方向一致但未达显著的结果,可能比单次 p<0.05 更可靠。
  8. 最能改变决策的:按 value of information 排序——能否改变候选选择、结果区分度、成功概率,除以时间/样品/成本/动物负担;不是“最容易”或“最完整”。
  9. 当低成本实验可能改变结论时:若一个高 VoI、低成本的补实验(如 target-negative 重复)可能翻转排名,“暂不决策 + 补实验”优于在错误候选上继续沉没投入。
  10. 透明复盘:显式记录最强反证、未决 veto 与接受的假设,便于日后复盘、设置 revisit trigger,防止确认偏误和事后改写决策依据。

四、从 Target Product Profile 反推

候选标准应服务于预期用途。例如实体瘤 TCE 可能强调:

  • clinically relevant target-low killing;
  • target-negative safety window;
  • controlled cytokine at matched killing;
  • 足够的 exposure 与 tumor penetration;
  • 可生产、正确装配与高浓度稳定性;
  • 适合给药频次;
  • 与正常组织表达/风险假设相容。

若目标是血液瘤、ADC、阻断 mAb 或长效替代蛋白,权重会改变。不要先看谁数据漂亮再写标准。

五、四类决策字段

5.1 Minimum gates

不满足则不能在当前阶段推进,例如:

  • 身份/正确装配可确认;
  • 主要机制活性;
  • target-negative 基本选择性;
  • 样品质量足以解释;
  • 无已知不可接受的 sequence liability(按项目标准)。

5.2 Trade-off criteria

可以权衡:potency、表达、稳定性、PK、dose frequency、成本等。

5.3 Veto risks

即使总分高也可能阻止推进:

  • 不可解释的非靶 activation;
  • 无法正确装配或活性物种无法规模制备;
  • 与临床相关组织的明确高风险交叉反应;
  • 关键机制在相关物种/模型完全不可评价且无替代路径;
  • 严重、重复的 molecule-intrinsic fast clearance。

5.4 Information gaps

未测不是“中等”。应标记 uncertainty,并评估其可能改变排名的程度。

六、Evidence matrix

维度 指标 A B 可比性 证据强度 不确定性
Identity/QC correct assembly/monomer
Binding KD/kinetics/cell binding
Function target-low killing/Emax
Selectivity target-neg/cytokine
Expression titer/recovery/yield
Developability aggregation/polyspecificity/viscosity
PK CL/AUC/F/ADA
PKPD RO/PD/exposure coverage
Efficacy individual response/exposure
Translation model/species/human tissue

“证据强度”应考虑独立批次、正交方法、样本质量、assay validation 和模型相关性。

七、加权评分如何正确使用

7.1 基本方法

weighted score = Σ(weight_i × score_i)

用途是暴露团队偏好、比较情景和识别冲突,不是制造客观真理。

7.2 五条护栏

  1. 先过 minimum gates 和 veto,再计算分数;
  2. 权重在看最终排名前定义;
  3. missing 单独处理,不自动填中值;
  4. 分数附证据强度和 uncertainty;
  5. 改变权重/假设做 sensitivity analysis。

若候选选择对小幅权重变化极敏感,结论不稳,说明需要补关键数据或明确战略偏好。

八、Value of Information(VoI)

补实验优先级不是“最科学”或“最完整”,而是:

能否改变候选选择
× 结果区分度
× 成功概率
÷ 时间、样品、成本和动物负担

高 VoI 实验的特征:

  • 针对排名反转的关键不确定性;
  • 结果 A/B 明确导向不同决策;
  • 方法成熟、周期与样品可接受;
  • 不重复已有同一伪差;
  • 能排除 veto risk。

九、教学数据包

两款 100 kDa TCE,数据均来自至少两批样品,除注明外同板/同 donor 比较:

维度 候选 A 候选 B
Target arm KD 0.2 nM 1.0 nM
Target-high killing EC50 5 pM 18 pM
Target-low killing EC50 450 pM 90 pM
Target-low Emax 65% 88%
Target-negative killing Emax 12% 2%
IFN-γ at matched 80% killing 高 中
Transient titer 35 mg/L 180 mg/L
Final recovery 28% 68%
SEC monomer after one freeze–thaw 91% 98%
Polyspecificity 高 低
Mouse IV CL(无 target cross-reactivity) 24 mL/day/kg 6 mL/day/kg
Humanized target-high efficacy regression regression
Humanized target-low efficacy 未测 stasis/regression mix
ADA 阴性 阴性

9.1 初步决策

B 更符合整体候选特征:在 target-low 情境 potency/Emax 更好、非靶窗口更宽、matched killing cytokine 更低、表达/回收/单体/非特异和 PK 更优。A 的高 affinity 和 target-high EC50 未转化为更好的相关条件表现。

9.2 仍需补的数据

在 nomination 前按项目风险考虑:

  • B 的多 donor target-low killing/cytokine 复现;
  • B 的 repeat-dose PK/ADA 和 tumor RO/PD;
  • 正常组织/低靶安全相关 assay;
  • B 的高浓度制剂与更完整 developability;
  • A 的工程 rescue 是否能降低 polyspecificity(若保留 backup)。

不建议仅为了“公平”把所有未测项都补齐;重点是 B 的 veto risks 与 A 是否存在可快速 rescue 的差异。

十、模拟会议角色

角色 必须回答
Project lead 当前 decision 和时间窗口是什么?
CADD/AIDD lead 设计假设、结构风险和 rescue 路径?
Cell pharmacology potency/selectivity 是否可比、assay variance?
Protein/CMC 表达、装配、稳定性和 scale risk?
DMPK/Bioanalysis PK 差异是否可信、机制是什么?
In vivo 模型相关性、exposure 和个体反应?
Safety/translational 哪些是 veto risk、物种/组织缺口?
Independent challenger 哪个结论最依赖未经验证的假设?

十一、60 分钟会议议程

  1. 0–5 min:decision、TPP 和预设 gates;
  2. 5–15 min:样品/QC/assay/model 可比性;
  3. 15–30 min:evidence matrix,只讲区分项;
  4. 30–40 min:veto risks 与 uncertainty;
  5. 40–50 min:A、B、backup/hold/stop 选项;
  6. 50–57 min:decision 与补实验;
  7. 57–60 min:owner、deadline、触发条件和记录。

十二、Decision record 模板

Decision date / participants:
Decision question:
TPP-critical criteria:
Selected candidate / backup:
Top five supporting facts:
Strongest contrary evidence:
Unresolved veto risks:
Assumptions accepted:
Required pre-nomination actions:
Experiments explicitly not required and why:
Revisit triggers:
Data/manifest links:

十三、决策错在哪里:一份(虚构的)评审纪要

以下纪要为教学合成的典型错误示范。先自己挑错(至少 5 处),再对照参考清单。

候选选择会议纪要(节选):候选 A 与 B 各有完整数据包。团队按亲和力(30%)、体外杀伤(30%)、表达量(20%)、稳定性(20%)加权打分,A 总分 8.2、B 7.6,选择 A。B 的 target-low 细胞杀伤略优但权重低,不影响排序。A 在 target-negative 细胞上有微弱激活信号,体外团队认为是"实验噪音",不写入纪要。A 的 polyspecificity 初筛阳性,但该指标不在打分表里。会上有人提议先做 target-negative 重复实验,被否决——项目排期紧,且 A 已投入 8 个月。B 的数据更完整,但"没理由中途换人"。结论:A 进入 IND-enabling。

参考错误清单

# 纪要中的错误 为什么错 替代做法
1 权重体系未审即使用 权重决定结论;亲和力 30% 对实体瘤 TCE 明显过高(target-low 功能更相关,本周 §五、§七) 看排名前定权重 + 敏感性分析,检验结论是否随权重翻转
2 target-negative 激活信号当噪音且不记录 安全信号是 veto 候选,不能靠口头排除,更不能从记录中消失(本周 §四;W9/W10) 作为 veto 项显式评估;写 decision record 反证区
3 polyspecificity "不在表里"就跳过 veto/红旗维度不进加权表是设计错误——均分会稀释一票否决项(本周 §四) 红旗独立于加权分处理,见可开发性评估
4 沉没成本驱动决策("已投入 8 个月") 沉没成本与 A/B 未来价值无关;继续错误候选的边际成本更高(本周 §八) 决策只基于未来信息价值与风险
5 拒绝低成本 VoI 实验 target-negative 重复实验便宜且可能直接改变决策——VoI 极高(本周 §八) 高 VoI/低成本实验应在决策前强制完成
6 "没理由中途换人" 现状偏差;B 证据更完整本身就影响 evidence strength 计分 用同一 evidence matrix 透明比较
7 IND-enabling 前未过安全 gate 广泛组织交叉、免疫激活等 veto 信号在 GLP 阶段才发现,损失以百万计(见非临床安全路径 §6) nomination 前完成 veto 清单检查

替代决策路径:冻结"选 A"结论;补 target-negative 重复(3 独立 donor)与 polyspecificity 确认实验(1–2 周、成本低);重跑带 veto gate 的 evidence matrix 与权重敏感性分析;若红旗确认,A 退出、B 补齐数据进入候选。

十四、闭卷验收

  1. 先 score 还是先 gate?
  2. Missing 可填中值吗?
  3. Affinity 与 target-low potency 谁更接近目标?
  4. 总分能抵消非靶 killing 吗?
  5. Evidence strength 看什么?
  6. 权重何时定义?
  7. Sensitivity analysis 用途?
  8. VoI 核心?
  9. 为什么设 challenger?
  10. Decision record 为什么写反证?
闭卷验收参考答案(先闭卷作答,再展开核对)
  1. 先 gates/veto:先过 minimum gates 和 veto 风险再计算加权分数;否则均分会稀释一票否决项,让致命风险被平均掉。
  2. 不应自动填:missing 是 information gap,应作为不确定性显式处理,并评估其可能改变排名的程度;未测不等于“中等”。
  3. 依 TPP 而定:实体瘤 TCE 常更重相关 target-low function(如教学数据包中 B 的 target-low EC50/Emax 优于 A),纯 affinity 优势未必转化为相关条件表现。
  4. 不能:veto 风险(不可解释的非靶 activation 等)不能被加权平均抵消,须独立评估甚至直接否决推进。
  5. 多维度证据:独立批次、正交方法、样本质量/QC、assay validation 和模型相关性,共同决定某条证据的可信度。
  6. 看排名前:权重在看到最终排名之前定义并冻结,防止事后按偏好调整权重得出想要的结论。
  7. 稳健性检验:改变权重/假设重算排名,判断结论是否翻转;对小幅权重变化极敏感的结论不稳,需补关键数据或明确战略偏好。
  8. 能否改变决策:VoI = 实验结果高概率改变候选选择 × 结果区分度 × 成功概率 ÷ 时间、样品、成本和动物负担。
  9. 对抗确认偏误:independent challenger 显式挑战团队共同假设,指出哪个结论最依赖未经验证的前提。
  10. 便于复盘与触发:反证与替代解释显式入档,配合 revisit trigger,使决策可审计、可复盘,而非事后合理化。

十五、本周最终交付物

完成一次候选选择模拟,提交:一页 pre-read、evidence matrix、weighted sensitivity、会议纪要和 decision record。口头汇报 15 分钟,答辩 15 分钟。

十六、延伸阅读

  1. NIH Assay Guidance Manual
  2. Tutorial on monoclonal antibody pharmacokinetics
  3. FDA/ICH M15: Model-Informed Drug Development