第 23 周学习包:候选选择决策模拟
本周核心问题
A 的 affinity/potency 更好,B 的表达、选择性和 PK 更好:怎样在不被单一“明星指标”绑架的情况下做出可解释、可复盘的候选选择?
一、学习目标
完成本周后,应能够:
- 从 target product profile 和临床机制反推候选标准;
- 区分 minimum gate、trade-off criterion、veto risk 和 information gap;
- 建立 potency、selectivity、developability、PK、efficacy 和 safety evidence matrix;
- 使用权重与 sensitivity analysis,而不让加权分数掩盖致命风险;
- 区分 evidence strength、effect size 和 uncertainty;
- 识别样品/assay/model 不可比导致的假排名;
- 选择 value-of-information 最高的补实验;
- 主持一次 60 分钟 candidate nomination meeting。
二、学习时间安排
标准版:4 小时
| 学习块 | 时间 | 任务 | 产出 |
|---|---|---|---|
| 诊断 | 15 min | 10 题 | 盲点清单 |
| 决策框架 | 55 min | gates/criteria/uncertainty | scorecard |
| 数据包审查 | 60 min | A vs B | evidence matrix |
| 补实验选择 | 45 min | value of information | experiment ranking |
| 模拟会议 | 45 min | roles/debate/decision | minutes |
| 验收 | 20 min | 闭卷 | 得分 |
深入版:6 小时
- 将一个历史项目用本框架回顾,检查 hindsight bias 45 分钟;
- 对权重和缺失数据做 sensitivity analysis 45 分钟;
- 邀请细胞、DMPK、CMC/in vivo 同事进行 60 分钟模拟;
- 写一页 pre-read 和一页 decision record 30 分钟。
三、课前诊断
- Affinity 最好是否应自动胜出?
- 所有指标归一化加权后总分最高是否足以 nomination?
- 缺失数据可以按中间分填吗?
- Potency 与 PK 能否相互补偿?
- 高表达是否能抵消 target-negative killing?
- 两个候选来自不同样品批次时可直接比较吗?
- 一个 p<0.05 的小鼠结果比重复方向一致但 p>0.05 更可靠吗?
- 补实验应优先做最容易的还是最能改变决策的?
- 会议中“暂不决策”何时合理?
- Decision record 为什么要写反方证据?
课前诊断参考答案(先独立作答,再展开核对)
- 不应:affinity 只是单一维度;实体瘤 TCE 的 TPP 更强调 target-low killing、安全窗、可开发性与 exposure。应先从 TPP 反推候选标准,再比较数据。
- 不足以:加权分可能掩盖 veto 风险与未关闭的 minimum gate;必须先过 gates/veto,missing 单独处理,分数附证据强度与不确定性。
- 不应:未测不是“中等”;缺失是 information gap,应标记 uncertainty 并评估其可能改变排名的程度。
- 有限度:作为 trade-off 指标,更高 exposure 可部分弥补 potency 不足,但需 exposure–response 数据支撑;veto 级风险(如非靶激活)不能被平均掉。
- 不能抵消:target-negative killing 属 safety/veto 风险,不能被 efficacy 或表达优势平均化;需独立评估,必要时一票否决。
- 不可直接比较:批次、QC 状态、assay run 和模型差异会造成假排名;需先确认可比性(同板/同 donor/同批),必要时同批重测。
- 不一定:证据强度看独立批次、正交方法、样本质量与方向一致性;重复且方向一致但未达显著的结果,可能比单次 p<0.05 更可靠。
- 最能改变决策的:按 value of information 排序——能否改变候选选择、结果区分度、成功概率,除以时间/样品/成本/动物负担;不是“最容易”或“最完整”。
- 当低成本实验可能改变结论时:若一个高 VoI、低成本的补实验(如 target-negative 重复)可能翻转排名,“暂不决策 + 补实验”优于在错误候选上继续沉没投入。
- 透明复盘:显式记录最强反证、未决 veto 与接受的假设,便于日后复盘、设置 revisit trigger,防止确认偏误和事后改写决策依据。
四、从 Target Product Profile 反推
候选标准应服务于预期用途。例如实体瘤 TCE 可能强调:
- clinically relevant target-low killing;
- target-negative safety window;
- controlled cytokine at matched killing;
- 足够的 exposure 与 tumor penetration;
- 可生产、正确装配与高浓度稳定性;
- 适合给药频次;
- 与正常组织表达/风险假设相容。
若目标是血液瘤、ADC、阻断 mAb 或长效替代蛋白,权重会改变。不要先看谁数据漂亮再写标准。
五、四类决策字段
5.1 Minimum gates
不满足则不能在当前阶段推进,例如:
- 身份/正确装配可确认;
- 主要机制活性;
- target-negative 基本选择性;
- 样品质量足以解释;
- 无已知不可接受的 sequence liability(按项目标准)。
5.2 Trade-off criteria
可以权衡:potency、表达、稳定性、PK、dose frequency、成本等。
5.3 Veto risks
即使总分高也可能阻止推进:
- 不可解释的非靶 activation;
- 无法正确装配或活性物种无法规模制备;
- 与临床相关组织的明确高风险交叉反应;
- 关键机制在相关物种/模型完全不可评价且无替代路径;
- 严重、重复的 molecule-intrinsic fast clearance。
5.4 Information gaps
未测不是“中等”。应标记 uncertainty,并评估其可能改变排名的程度。
六、Evidence matrix
| 维度 | 指标 | A | B | 可比性 | 证据强度 | 不确定性 |
|---|---|---|---|---|---|---|
| Identity/QC | correct assembly/monomer | |||||
| Binding | KD/kinetics/cell binding | |||||
| Function | target-low killing/Emax | |||||
| Selectivity | target-neg/cytokine | |||||
| Expression | titer/recovery/yield | |||||
| Developability | aggregation/polyspecificity/viscosity | |||||
| PK | CL/AUC/F/ADA | |||||
| PKPD | RO/PD/exposure coverage | |||||
| Efficacy | individual response/exposure | |||||
| Translation | model/species/human tissue |
“证据强度”应考虑独立批次、正交方法、样本质量、assay validation 和模型相关性。
七、加权评分如何正确使用
7.1 基本方法
weighted score = Σ(weight_i × score_i)
用途是暴露团队偏好、比较情景和识别冲突,不是制造客观真理。
7.2 五条护栏
- 先过 minimum gates 和 veto,再计算分数;
- 权重在看最终排名前定义;
- missing 单独处理,不自动填中值;
- 分数附证据强度和 uncertainty;
- 改变权重/假设做 sensitivity analysis。
若候选选择对小幅权重变化极敏感,结论不稳,说明需要补关键数据或明确战略偏好。
八、Value of Information(VoI)
补实验优先级不是“最科学”或“最完整”,而是:
能否改变候选选择
× 结果区分度
× 成功概率
÷ 时间、样品、成本和动物负担
高 VoI 实验的特征:
- 针对排名反转的关键不确定性;
- 结果 A/B 明确导向不同决策;
- 方法成熟、周期与样品可接受;
- 不重复已有同一伪差;
- 能排除 veto risk。
九、教学数据包
两款 100 kDa TCE,数据均来自至少两批样品,除注明外同板/同 donor 比较:
| 维度 | 候选 A | 候选 B |
|---|---|---|
| Target arm KD | 0.2 nM | 1.0 nM |
| Target-high killing EC50 | 5 pM | 18 pM |
| Target-low killing EC50 | 450 pM | 90 pM |
| Target-low Emax | 65% | 88% |
| Target-negative killing Emax | 12% | 2% |
| IFN-γ at matched 80% killing | 高 | 中 |
| Transient titer | 35 mg/L | 180 mg/L |
| Final recovery | 28% | 68% |
| SEC monomer after one freeze–thaw | 91% | 98% |
| Polyspecificity | 高 | 低 |
| Mouse IV CL(无 target cross-reactivity) | 24 mL/day/kg | 6 mL/day/kg |
| Humanized target-high efficacy | regression | regression |
| Humanized target-low efficacy | 未测 | stasis/regression mix |
| ADA | 阴性 | 阴性 |
9.1 初步决策
B 更符合整体候选特征:在 target-low 情境 potency/Emax 更好、非靶窗口更宽、matched killing cytokine 更低、表达/回收/单体/非特异和 PK 更优。A 的高 affinity 和 target-high EC50 未转化为更好的相关条件表现。
9.2 仍需补的数据
在 nomination 前按项目风险考虑:
- B 的多 donor target-low killing/cytokine 复现;
- B 的 repeat-dose PK/ADA 和 tumor RO/PD;
- 正常组织/低靶安全相关 assay;
- B 的高浓度制剂与更完整 developability;
- A 的工程 rescue 是否能降低 polyspecificity(若保留 backup)。
不建议仅为了“公平”把所有未测项都补齐;重点是 B 的 veto risks 与 A 是否存在可快速 rescue 的差异。
十、模拟会议角色
| 角色 | 必须回答 |
|---|---|
| Project lead | 当前 decision 和时间窗口是什么? |
| CADD/AIDD lead | 设计假设、结构风险和 rescue 路径? |
| Cell pharmacology | potency/selectivity 是否可比、assay variance? |
| Protein/CMC | 表达、装配、稳定性和 scale risk? |
| DMPK/Bioanalysis | PK 差异是否可信、机制是什么? |
| In vivo | 模型相关性、exposure 和个体反应? |
| Safety/translational | 哪些是 veto risk、物种/组织缺口? |
| Independent challenger | 哪个结论最依赖未经验证的假设? |
十一、60 分钟会议议程
- 0–5 min:decision、TPP 和预设 gates;
- 5–15 min:样品/QC/assay/model 可比性;
- 15–30 min:evidence matrix,只讲区分项;
- 30–40 min:veto risks 与 uncertainty;
- 40–50 min:A、B、backup/hold/stop 选项;
- 50–57 min:decision 与补实验;
- 57–60 min:owner、deadline、触发条件和记录。
十二、Decision record 模板
Decision date / participants:
Decision question:
TPP-critical criteria:
Selected candidate / backup:
Top five supporting facts:
Strongest contrary evidence:
Unresolved veto risks:
Assumptions accepted:
Required pre-nomination actions:
Experiments explicitly not required and why:
Revisit triggers:
Data/manifest links:
十三、决策错在哪里:一份(虚构的)评审纪要
以下纪要为教学合成的典型错误示范。先自己挑错(至少 5 处),再对照参考清单。
候选选择会议纪要(节选):候选 A 与 B 各有完整数据包。团队按亲和力(30%)、体外杀伤(30%)、表达量(20%)、稳定性(20%)加权打分,A 总分 8.2、B 7.6,选择 A。B 的 target-low 细胞杀伤略优但权重低,不影响排序。A 在 target-negative 细胞上有微弱激活信号,体外团队认为是"实验噪音",不写入纪要。A 的 polyspecificity 初筛阳性,但该指标不在打分表里。会上有人提议先做 target-negative 重复实验,被否决——项目排期紧,且 A 已投入 8 个月。B 的数据更完整,但"没理由中途换人"。结论:A 进入 IND-enabling。
参考错误清单
| # | 纪要中的错误 | 为什么错 | 替代做法 |
|---|---|---|---|
| 1 | 权重体系未审即使用 | 权重决定结论;亲和力 30% 对实体瘤 TCE 明显过高(target-low 功能更相关,本周 §五、§七) | 看排名前定权重 + 敏感性分析,检验结论是否随权重翻转 |
| 2 | target-negative 激活信号当噪音且不记录 | 安全信号是 veto 候选,不能靠口头排除,更不能从记录中消失(本周 §四;W9/W10) | 作为 veto 项显式评估;写 decision record 反证区 |
| 3 | polyspecificity "不在表里"就跳过 | veto/红旗维度不进加权表是设计错误——均分会稀释一票否决项(本周 §四) | 红旗独立于加权分处理,见可开发性评估 |
| 4 | 沉没成本驱动决策("已投入 8 个月") | 沉没成本与 A/B 未来价值无关;继续错误候选的边际成本更高(本周 §八) | 决策只基于未来信息价值与风险 |
| 5 | 拒绝低成本 VoI 实验 | target-negative 重复实验便宜且可能直接改变决策——VoI 极高(本周 §八) | 高 VoI/低成本实验应在决策前强制完成 |
| 6 | "没理由中途换人" | 现状偏差;B 证据更完整本身就影响 evidence strength 计分 | 用同一 evidence matrix 透明比较 |
| 7 | IND-enabling 前未过安全 gate | 广泛组织交叉、免疫激活等 veto 信号在 GLP 阶段才发现,损失以百万计(见非临床安全路径 §6) | nomination 前完成 veto 清单检查 |
替代决策路径:冻结"选 A"结论;补 target-negative 重复(3 独立 donor)与 polyspecificity 确认实验(1–2 周、成本低);重跑带 veto gate 的 evidence matrix 与权重敏感性分析;若红旗确认,A 退出、B 补齐数据进入候选。
十四、闭卷验收
- 先 score 还是先 gate?
- Missing 可填中值吗?
- Affinity 与 target-low potency 谁更接近目标?
- 总分能抵消非靶 killing 吗?
- Evidence strength 看什么?
- 权重何时定义?
- Sensitivity analysis 用途?
- VoI 核心?
- 为什么设 challenger?
- Decision record 为什么写反证?
闭卷验收参考答案(先闭卷作答,再展开核对)
- 先 gates/veto:先过 minimum gates 和 veto 风险再计算加权分数;否则均分会稀释一票否决项,让致命风险被平均掉。
- 不应自动填:missing 是 information gap,应作为不确定性显式处理,并评估其可能改变排名的程度;未测不等于“中等”。
- 依 TPP 而定:实体瘤 TCE 常更重相关 target-low function(如教学数据包中 B 的 target-low EC50/Emax 优于 A),纯 affinity 优势未必转化为相关条件表现。
- 不能:veto 风险(不可解释的非靶 activation 等)不能被加权平均抵消,须独立评估甚至直接否决推进。
- 多维度证据:独立批次、正交方法、样本质量/QC、assay validation 和模型相关性,共同决定某条证据的可信度。
- 看排名前:权重在看到最终排名之前定义并冻结,防止事后按偏好调整权重得出想要的结论。
- 稳健性检验:改变权重/假设重算排名,判断结论是否翻转;对小幅权重变化极敏感的结论不稳,需补关键数据或明确战略偏好。
- 能否改变决策:VoI = 实验结果高概率改变候选选择 × 结果区分度 × 成功概率 ÷ 时间、样品、成本和动物负担。
- 对抗确认偏误:independent challenger 显式挑战团队共同假设,指出哪个结论最依赖未经验证的前提。
- 便于复盘与触发:反证与替代解释显式入档,配合 revisit trigger,使决策可审计、可复盘,而非事后合理化。
十五、本周最终交付物
完成一次候选选择模拟,提交:一页 pre-read、evidence matrix、weighted sensitivity、会议纪要和 decision record。口头汇报 15 分钟,答辩 15 分钟。