第 21 周学习包:从序列设计到实验样品
本周核心问题
当一个设计在功能实验中失败时,如何证明被测试的样品确实是正确版本、正确装配、足够纯且浓度可信的分子,而不是把交付链错误误判成设计失败?
一、端到端证据链
项目假设
→ 序列/结构设计与版本
→ DNA/质粒构建
→ 表达与收获
→ 纯化与回收
→ identity/quantity/quality
→ assay-specific sample release
→ binding
→ cell function
→ 数据解释与下一轮设计
任何一环失真,错误都可能向后传播并被包装成一个合理但错误的生物学故事。
二、学习目标
完成本周后,应能够:
- 建立 sequence–construct–plasmid–batch–sample–assay 的唯一追溯链;
- 为计算设计定义可执行的 wet-lab handoff package;
- 识别链定义、信号肽、连接肽、Fc、标签和工程位点的版本风险;
- 区分 titer、recovery、identity、assembly、purity 和 functional concentration;
- 根据 assay 风险设定样品放行要求;
- 识别 concentration normalization 和 molar conversion 的错误;
- 设计失败归因的 stage-gate 和最小 rescue experiment;
- 组织一次 sequence-to-sample cross-functional review。
三、学习时间安排
标准版:4 小时
| 学习块 | 时间 | 任务 | 产出 |
|---|---|---|---|
| 诊断 | 15 min | 10 题 | 盲点清单 |
| Handoff contract | 55 min | 设计交付字段 | manifest |
| Stage gates | 65 min | 构建—表达—QC—assay | gate map |
| Failure propagation | 55 min | 错误树与 rescue | root-cause table |
| 案例与验收 | 50 min | 复盘错误样品 | CAPA/decision |
深入版:6 小时
- 选择 10 个历史候选,审计序列到 assay 的追溯完整度 60 分钟;
- 将一个实验异常追溯到原始 construct 和 QC 45 分钟;
- 与表达/纯化/分析/细胞团队做一次 45 分钟 handoff review;
- 建立内部命名与版本控制约定 30 分钟。
四、课前诊断
- 一个 FASTA 文件能否完整定义双抗构建?
- amino-acid sequence 相同是否保证表达构建相同?
- Protein A 主峰能否确认所有链正确配对?
- A280 浓度能否直接作为活性双抗浓度?
- 两个不同分子量分子按 µg/mL 比较是否是等摩尔?
- 样品 SEC monomer 98% 是否证明序列版本正确?
- assay plate 上名称相同是否足以完成追溯?
- 样品在 QC 后多次冻融,原 QC 还能完全代表上机状态吗?
- 构建错误为何可能产生“表位丢失”假结论?
- Stage gate 的目的是什么?
课前诊断参考答案(先独立作答,再展开核对)
- 不能:FASTA 只含氨基酸序列,缺少链配对关系、异二聚化策略、linker 方向/长度、Fc 形式、信号肽、标签与风险标记等 construct/format 信息;序列文件、结构模型和汇总表必须引用同一 design ID 和版本。
- 不保证:AA 设计正确不保证 DNA 构建、读框、方向和信号肽连接正确;质粒身份与完整序列需在构建层(Gate 1)独立确认。
- 不能:Protein A 主峰只证明存在可结合 Fc 的物种,不区分正确配对与错配/单臂等副产物;需要 intact mass、CE-SDS 等 identity/assembly 方法确认。
- 不能直接:A280 是总蛋白,不反映正确装配分数;若只有 70% 正确装配,名义 10 nM 的预期物种只有约 7 nM,且不能随意“按纯度百分比修正”。
- 不是:质量浓度相同时分子数不同——150 kDa IgG 的 1 µg/mL≈6.67 nM,而 50 kDa fragment 同浓度为 20 nM;比较应换算成摩尔浓度。
- 不能:SEC 只反映 size homogeneity,不提供序列/身份信息;序列版本错或标签丢失的分子仍可能表现为单一 monomer 峰。
- 不足:自由文本昵称会混淆 design 版本与 vial 批次(如“D3”可能是不同批次、不同物种组成的样品);必须用唯一 sample ID/aliquot ID 贯穿 design—batch—QC—assay 链。
- 不能完全:冻融可引起聚集或活性损失,QC 是特定时点的快照;manifest 应记录 freeze–thaw 次数与使用窗口,上机前必要时复测关键指标。
- 错误向后传播:序列/构建错误使被测样品并非预期分子,binding/function 全失会被包装成“设计破坏表位”的生物学故事;先过 stage gates 排除交付链错误,再归因于设计。
- 失败归因定位:在设计、构建、表达/QC、样品放行、assay 各节点设置通过标准,使失败可定位到机制层而非前置质量,并指导最小 rescue 实验。
五、设计交付合同
5.1 计算团队最低交付字段
| 类别 | 必须字段 |
|---|---|
| Project | project ID、target、mechanism、requester |
| Design | design ID、parent、round、design rationale |
| Sequence | 每条链 AA/核酸版本、链名、方向、checksum/长度 |
| Format | IgG subtype、Fc、valency、geometry、linker、tag |
| Engineering | mutations、目的、预期影响、不可变位点 |
| Construct | signal peptide、expression cassette、cleavage site |
| Expected product | theoretical MW、chain count、disulfide/assembly expectation |
| Controls | parent、reference、negative、rescue variants |
| Risk flags | glycosylation、deamidation、isomerization、unpaired Cys、hydrophobicity 等 |
| Assay plan | primary hypothesis、assay、关键对照和 success criteria |
序列文件、结构模型和汇总表必须引用同一 design ID 和版本。不要用“final_v2_new”式文件名承担版本控制。
5.2 对双抗/多特异分子
额外明确:
- 哪条重链与哪条轻链配对;
- heavy-chain heterodimerization 策略;
- common light chain、CrossMab 或其他防错配策略;
- linker 方向和长度;
- Fc active/silent/half-life mutations;
- 预期副产物与可区分分析方法;
- 两臂功能如何分别和同时验证。
六、命名与追溯
6.1 建议的对象层级
DESIGN-001-v03
└─ CONSTRUCT-HC01 / LC01
└─ PLASMID lot P2401
└─ EXPRESSION batch E2407
└─ PURIFICATION batch U2407
└─ SAMPLE vial S2407-01
└─ ASSAY run A2410 / plate 02 / wells
每层有唯一 ID,且不可用自由文本名称替代。
6.2 Sample manifest
最低字段:
- sample ID 和 parent batch;
- molecule/design/construct version;
- concentration、volume、total amount;
- buffer、pH、excipient;
- storage、freeze–thaw、date/time;
- identity、SEC、CE-SDS、endotoxin 等结果和报告链接;
- intended assay 与 release status;
- aliquot/vial ID;
- deviation/remark。
Assay raw data 应保存 plate-map 中 sample ID,而不只是候选昵称。
七、五个 stage gates
Gate 0:设计可执行
- 序列完整、版本冻结;
- 分子形式和链关系明确;
- 风险与对照定义;
- success/failure 可被实验区分。
Gate 1:构建正确
- 质粒身份与完整序列确认;
- 方向、读框、信号肽/连接肽正确;
- 关键工程位点存在且无意外突变。
Gate 2:表达/纯化可解释
- 有平台 positive control;
- titer、harvest amount、recovery 可重建;
- 异常损失位置明确;
- 样品未被错误池或峰混入。
Gate 3:样品 fit-for-purpose
- identity 与 assembly;
- concentration 和 active fraction;
- monomer/fragment/aggregate;
- assay-specific endotoxin/buffer/stability;
- aliquot 与使用窗口。
Gate 4:assay 有效
- controls/reference 通过;
- sample 上机状态与 manifest 一致;
- 关键结论跨独立批次/正交方法;
- failure 可定位到机制层,而非前置质量。
八、浓度与摩尔归一化
8.1 质量浓度转摩尔浓度
molar concentration (mol/L)
= mass concentration (g/L) / molecular weight (g/mol)
对 150 kDa IgG:
1 µg/mL = 1 mg/L = 0.001 g/L
0.001 / 150,000 = 6.67×10⁻9 mol/L = 6.67 nM
对 50 kDa fragment,相同 1 µg/mL 为 20 nM。按质量浓度比较会给不同 molecule counts。
8.2 Total protein vs active molecule
若双抗样品只有 70% 正确装配,但按总 A280 浓度计算 dose,名义 10 nM 可能只有约 7 nM 预期物种;剩余物种还可能竞争单臂结合或带来安全混杂。
不要随意“用纯度百分比修正”而忽略不同杂质的吸收和功能;需要经过验证的 active/assembly quantitation。
九、失败怎样向后传播
| 上游错误 | 下游表象 | 容易产生的错误故事 |
|---|---|---|
| 序列版本错 | binding/function 全失 | “设计破坏表位” |
| 轻链错配 | 单臂/双臂功能低 | “几何不适合” |
| titer assay 偏差 | dose normalization 错 | “potency 提升/下降” |
| 聚集 | binding/activation 偏高 | “affinity/agonism 更强” |
| 内毒素 | cytokine 偏高 | “分子有 CRS 风险” |
| buffer 不相容 | cell viability 下降 | “直接细胞毒” |
| freeze–thaw | 批次间漂移 | “模型不可重复” |
| plate-map 错 | 排名反转 | “AI 设计成功/失败” |
十、最小 rescue 实验原则
- 先确认身份和样品状态;
- 与 parent/reference 在同批重制或同板比较;
- 只改变一个最关键变量;
- 选择能区分两个首要机制的实验;
- 不用十个探索实验替代一个明确判别实验;
- 预先写出每种结果如何改变决策。
示例:候选 binding 下降。先用 LC-MS/链级身份 + 新鲜单体批次确认;再分别测纯化抗原和 cell binding。若两者均低,偏向 paratope/结构问题;若抗原正常而细胞低,转向构象/靶密度/几何。
十一、跨团队 review 议程
- 5 分钟:项目假设和设计版本;
- 5 分钟:construct/质粒身份;
- 5 分钟:表达与物料平衡;
- 5 分钟:QC 和 assay release;
- 10 分钟:binding/function 原始数据;
- 10 分钟:矛盾与 root-cause tree;
- 5 分钟:决策、owner、due date 和成功标准。
会议结论必须关联 sample ID 和 raw-data location。
十二、综合案例
Design D3 相比 parent 的 BLI KD 好 5 倍,但 cell binding 和 killing 均差。调查发现:
- BLI 使用的是 98% 单体 SEC fraction;
- cell assay 使用未经过 SEC 的 Protein A pool,monomer 72%;
- intact mass 有两个主物种;
- plate map 只写 “D3”,未记录 vial ID;
- D3 为双抗,A280 按全蛋白定量。
参考分析
现阶段不能归因于“affinity 提升损害 cell geometry”。不同 assay 使用不同物种组成的样品,且双抗装配/浓度不确定、追溯不足。优先确认两个主物种身份,获得正确装配/高单体新鲜批次,用唯一 sample ID 在 BLI、cell binding 和 killing 同步复测;再讨论生物机制。
十三、闭卷验收
- Handoff 最低核心?
- 质粒层为何独立?
- Protein A 证明什么?
- Stage Gate 3?
- 1 µg/mL 150 kDa IgG 约多少 nM?
- 为什么按质量比较片段和 IgG 不公平?
- sample manifest 连接什么?
- plate-map 为什么要 sample ID?
- failure first step?
- rescue experiment 原则?
闭卷验收参考答案(先闭卷作答,再展开核对)
- 五个核心:唯一 design ID 与版本、链/格式信息(配对、linker、Fc、风险标记)、对照(parent/reference/negative/rescue)和 assay hypothesis 与 success criteria。
- DNA 层有独立失败模式:AA 设计正确不保证质粒读框、方向、信号肽连接和关键工程位点正确,需质粒身份与完整序列确认(Gate 1)。
- 含可结合 Fc 的物种:Protein A 主峰不能区分正确配对与单臂/错配副产物,需 intact mass、CE-SDS 等 identity/assembly 正交方法。
- 样品 fit-for-purpose release:确认 identity 与 assembly、浓度和 active fraction、monomer/fragment/aggregate、assay 相关 endotoxin/buffer/稳定性,以及 aliquot 与使用窗口(Gate 3)。
- 约 6.67 nM:1 µg/mL = 1 mg/L = 0.001 g/L;0.001 g/L ÷ 150,000 g/mol ≈ 6.67×10⁻⁹ mol/L。
- 分子数不同:同质量浓度下 50 kDa fragment(20 nM)的分子数约为 150 kDa IgG(6.67 nM)的 3 倍,µg/mL 比较会系统性偏袒大分子。
- 端到端追溯链:连接 design/construct 版本、表达/纯化批次、QC 结果与报告链接、concentration/buffer/freeze–thaw 状态、aliquot/vial ID 和 intended assay 与 release status。
- 防止昵称混淆:唯一 sample ID 使每个结论可回溯到具体 vial、批次与 QC 状态,避免把不同批次或不同物种组成的样品当成同一分子。
- 先查身份与状态:确认样品身份(LC-MS/链级)、状态(聚集/冻融)、浓度和 assay validity(controls/reference 是否通过),再讨论生物学机制。
- 最小且判别性:与 parent/reference 同批或同板比较,只改变一个最关键变量,选择能区分两个首要机制的实验,并预先写出每种结果如何改变决策;不用十个探索实验替代一个明确判别实验。
十四、本周最终交付物
提交三份可直接使用的模板:Design Handoff、Sample Manifest、Sequence-to-Sample Stage-Gate Checklist;再用一个历史案例完成一次追溯审计。