WEEK 21跨学科决策

从序列设计到实验样品

建立 design、construct、plasmid、batch、sample、QC 和 assay 的唯一追溯链。

只有被测试样品的身份、装配和活性浓度可信,实验失败才有资格被解释为设计失败。

Design ID到Construct到Expression batch到Purification到Sample QC到Assay run的概念证据链
本周概念图:从输入、实验到可解释结论。箭头表示审查顺序,不代表单向因果。
Data Clinic · Case 21标本编号 BIO-W21

总浓度与活性物种浓度

先回答:双抗 A280 总浓度 1.0 mg/mL,MW 100 kDa,正确装配 70%。名义与粗略活性摩尔浓度是多少?

Stock 物种构成(粗略)教学数据图
教学合成数据可视化。读图时先确认单位、坐标、对照和统计层级。
量计算结果
总摩尔浓度1000 µg/mL×1000/10010000 nM = 10 µM
粗略正确装配10×0.707 µM
非主物种10×0.303 µM equivalent
  1. 先统一单位:1.0 mg/mL = 1000 µg/mL
  2. 总浓度 = 1000 × 1000 / 100 = 10,000 nM = 10 µM
  3. 粗略主物种浓度 = 10 µM × 70% = 7 µM;常见错误是把 1 mg/mL 当成 1 µg/mL,造成 1000 倍稀释表偏差
计算结果题面单位很容易造成 1000× 错误;1.0 mg/mL 的 100 kDa 分子是 10 µM,而不是 10 nM。
项目解读功能实验稀释表必须从 stock 单位逐级复核;正确装配比例只能做风险提示,需 active/assembly-specific assay。
证据边界内推边界:µM 换算仅是单位算术;外推边界:CE-SDS/SEC 百分比不能机械当作活性比例;伪差风险:把 1 mg/mL 当 1 µg/mL 会造成 1000 倍稀释表错误。

第 21 周学习包:从序列设计到实验样品

本周核心问题

当一个设计在功能实验中失败时,如何证明被测试的样品确实是正确版本、正确装配、足够纯且浓度可信的分子,而不是把交付链错误误判成设计失败?

一、端到端证据链

项目假设
→ 序列/结构设计与版本
→ DNA/质粒构建
→ 表达与收获
→ 纯化与回收
→ identity/quantity/quality
→ assay-specific sample release
→ binding
→ cell function
→ 数据解释与下一轮设计

任何一环失真,错误都可能向后传播并被包装成一个合理但错误的生物学故事。

二、学习目标

完成本周后,应能够:

  1. 建立 sequence–construct–plasmid–batch–sample–assay 的唯一追溯链;
  2. 为计算设计定义可执行的 wet-lab handoff package;
  3. 识别链定义、信号肽、连接肽、Fc、标签和工程位点的版本风险;
  4. 区分 titer、recovery、identity、assembly、purity 和 functional concentration;
  5. 根据 assay 风险设定样品放行要求;
  6. 识别 concentration normalization 和 molar conversion 的错误;
  7. 设计失败归因的 stage-gate 和最小 rescue experiment;
  8. 组织一次 sequence-to-sample cross-functional review。

三、学习时间安排

标准版:4 小时

学习块 时间 任务 产出
诊断 15 min 10 题 盲点清单
Handoff contract 55 min 设计交付字段 manifest
Stage gates 65 min 构建—表达—QC—assay gate map
Failure propagation 55 min 错误树与 rescue root-cause table
案例与验收 50 min 复盘错误样品 CAPA/decision

深入版:6 小时

  • 选择 10 个历史候选,审计序列到 assay 的追溯完整度 60 分钟;
  • 将一个实验异常追溯到原始 construct 和 QC 45 分钟;
  • 与表达/纯化/分析/细胞团队做一次 45 分钟 handoff review;
  • 建立内部命名与版本控制约定 30 分钟。

四、课前诊断

  1. 一个 FASTA 文件能否完整定义双抗构建?
  2. amino-acid sequence 相同是否保证表达构建相同?
  3. Protein A 主峰能否确认所有链正确配对?
  4. A280 浓度能否直接作为活性双抗浓度?
  5. 两个不同分子量分子按 µg/mL 比较是否是等摩尔?
  6. 样品 SEC monomer 98% 是否证明序列版本正确?
  7. assay plate 上名称相同是否足以完成追溯?
  8. 样品在 QC 后多次冻融,原 QC 还能完全代表上机状态吗?
  9. 构建错误为何可能产生“表位丢失”假结论?
  10. Stage gate 的目的是什么?
课前诊断参考答案(先独立作答,再展开核对)
  1. 不能:FASTA 只含氨基酸序列,缺少链配对关系、异二聚化策略、linker 方向/长度、Fc 形式、信号肽、标签与风险标记等 construct/format 信息;序列文件、结构模型和汇总表必须引用同一 design ID 和版本。
  2. 不保证:AA 设计正确不保证 DNA 构建、读框、方向和信号肽连接正确;质粒身份与完整序列需在构建层(Gate 1)独立确认。
  3. 不能:Protein A 主峰只证明存在可结合 Fc 的物种,不区分正确配对与错配/单臂等副产物;需要 intact mass、CE-SDS 等 identity/assembly 方法确认。
  4. 不能直接:A280 是总蛋白,不反映正确装配分数;若只有 70% 正确装配,名义 10 nM 的预期物种只有约 7 nM,且不能随意“按纯度百分比修正”。
  5. 不是:质量浓度相同时分子数不同——150 kDa IgG 的 1 µg/mL≈6.67 nM,而 50 kDa fragment 同浓度为 20 nM;比较应换算成摩尔浓度。
  6. 不能:SEC 只反映 size homogeneity,不提供序列/身份信息;序列版本错或标签丢失的分子仍可能表现为单一 monomer 峰。
  7. 不足:自由文本昵称会混淆 design 版本与 vial 批次(如“D3”可能是不同批次、不同物种组成的样品);必须用唯一 sample ID/aliquot ID 贯穿 design—batch—QC—assay 链。
  8. 不能完全:冻融可引起聚集或活性损失,QC 是特定时点的快照;manifest 应记录 freeze–thaw 次数与使用窗口,上机前必要时复测关键指标。
  9. 错误向后传播:序列/构建错误使被测样品并非预期分子,binding/function 全失会被包装成“设计破坏表位”的生物学故事;先过 stage gates 排除交付链错误,再归因于设计。
  10. 失败归因定位:在设计、构建、表达/QC、样品放行、assay 各节点设置通过标准,使失败可定位到机制层而非前置质量,并指导最小 rescue 实验。

五、设计交付合同

5.1 计算团队最低交付字段

类别 必须字段
Project project ID、target、mechanism、requester
Design design ID、parent、round、design rationale
Sequence 每条链 AA/核酸版本、链名、方向、checksum/长度
Format IgG subtype、Fc、valency、geometry、linker、tag
Engineering mutations、目的、预期影响、不可变位点
Construct signal peptide、expression cassette、cleavage site
Expected product theoretical MW、chain count、disulfide/assembly expectation
Controls parent、reference、negative、rescue variants
Risk flags glycosylation、deamidation、isomerization、unpaired Cys、hydrophobicity 等
Assay plan primary hypothesis、assay、关键对照和 success criteria

序列文件、结构模型和汇总表必须引用同一 design ID 和版本。不要用“final_v2_new”式文件名承担版本控制。

5.2 对双抗/多特异分子

额外明确:

  • 哪条重链与哪条轻链配对;
  • heavy-chain heterodimerization 策略;
  • common light chain、CrossMab 或其他防错配策略;
  • linker 方向和长度;
  • Fc active/silent/half-life mutations;
  • 预期副产物与可区分分析方法;
  • 两臂功能如何分别和同时验证。

六、命名与追溯

6.1 建议的对象层级

DESIGN-001-v03
└─ CONSTRUCT-HC01 / LC01
   └─ PLASMID lot P2401
      └─ EXPRESSION batch E2407
         └─ PURIFICATION batch U2407
            └─ SAMPLE vial S2407-01
               └─ ASSAY run A2410 / plate 02 / wells

每层有唯一 ID,且不可用自由文本名称替代。

6.2 Sample manifest

最低字段:

  • sample ID 和 parent batch;
  • molecule/design/construct version;
  • concentration、volume、total amount;
  • buffer、pH、excipient;
  • storage、freeze–thaw、date/time;
  • identity、SEC、CE-SDS、endotoxin 等结果和报告链接;
  • intended assay 与 release status;
  • aliquot/vial ID;
  • deviation/remark。

Assay raw data 应保存 plate-map 中 sample ID,而不只是候选昵称。

七、五个 stage gates

Gate 0:设计可执行

  • 序列完整、版本冻结;
  • 分子形式和链关系明确;
  • 风险与对照定义;
  • success/failure 可被实验区分。

Gate 1:构建正确

  • 质粒身份与完整序列确认;
  • 方向、读框、信号肽/连接肽正确;
  • 关键工程位点存在且无意外突变。

Gate 2:表达/纯化可解释

  • 有平台 positive control;
  • titer、harvest amount、recovery 可重建;
  • 异常损失位置明确;
  • 样品未被错误池或峰混入。

Gate 3:样品 fit-for-purpose

  • identity 与 assembly;
  • concentration 和 active fraction;
  • monomer/fragment/aggregate;
  • assay-specific endotoxin/buffer/stability;
  • aliquot 与使用窗口。

Gate 4:assay 有效

  • controls/reference 通过;
  • sample 上机状态与 manifest 一致;
  • 关键结论跨独立批次/正交方法;
  • failure 可定位到机制层,而非前置质量。

八、浓度与摩尔归一化

8.1 质量浓度转摩尔浓度

molar concentration (mol/L)
= mass concentration (g/L) / molecular weight (g/mol)

对 150 kDa IgG:

1 µg/mL = 1 mg/L = 0.001 g/L
0.001 / 150,000 = 6.67×10⁻9 mol/L = 6.67 nM

对 50 kDa fragment,相同 1 µg/mL 为 20 nM。按质量浓度比较会给不同 molecule counts。

8.2 Total protein vs active molecule

若双抗样品只有 70% 正确装配,但按总 A280 浓度计算 dose,名义 10 nM 可能只有约 7 nM 预期物种;剩余物种还可能竞争单臂结合或带来安全混杂。

不要随意“用纯度百分比修正”而忽略不同杂质的吸收和功能;需要经过验证的 active/assembly quantitation。

九、失败怎样向后传播

上游错误 下游表象 容易产生的错误故事
序列版本错 binding/function 全失 “设计破坏表位”
轻链错配 单臂/双臂功能低 “几何不适合”
titer assay 偏差 dose normalization 错 “potency 提升/下降”
聚集 binding/activation 偏高 “affinity/agonism 更强”
内毒素 cytokine 偏高 “分子有 CRS 风险”
buffer 不相容 cell viability 下降 “直接细胞毒”
freeze–thaw 批次间漂移 “模型不可重复”
plate-map 错 排名反转 “AI 设计成功/失败”

十、最小 rescue 实验原则

  1. 先确认身份和样品状态;
  2. 与 parent/reference 在同批重制或同板比较;
  3. 只改变一个最关键变量;
  4. 选择能区分两个首要机制的实验;
  5. 不用十个探索实验替代一个明确判别实验;
  6. 预先写出每种结果如何改变决策。

示例:候选 binding 下降。先用 LC-MS/链级身份 + 新鲜单体批次确认;再分别测纯化抗原和 cell binding。若两者均低,偏向 paratope/结构问题;若抗原正常而细胞低,转向构象/靶密度/几何。

十一、跨团队 review 议程

  1. 5 分钟:项目假设和设计版本;
  2. 5 分钟:construct/质粒身份;
  3. 5 分钟:表达与物料平衡;
  4. 5 分钟:QC 和 assay release;
  5. 10 分钟:binding/function 原始数据;
  6. 10 分钟:矛盾与 root-cause tree;
  7. 5 分钟:决策、owner、due date 和成功标准。

会议结论必须关联 sample ID 和 raw-data location。

十二、综合案例

Design D3 相比 parent 的 BLI KD 好 5 倍,但 cell binding 和 killing 均差。调查发现:

  • BLI 使用的是 98% 单体 SEC fraction;
  • cell assay 使用未经过 SEC 的 Protein A pool,monomer 72%;
  • intact mass 有两个主物种;
  • plate map 只写 “D3”,未记录 vial ID;
  • D3 为双抗,A280 按全蛋白定量。

参考分析

现阶段不能归因于“affinity 提升损害 cell geometry”。不同 assay 使用不同物种组成的样品,且双抗装配/浓度不确定、追溯不足。优先确认两个主物种身份,获得正确装配/高单体新鲜批次,用唯一 sample ID 在 BLI、cell binding 和 killing 同步复测;再讨论生物机制。

十三、闭卷验收

  1. Handoff 最低核心?
  2. 质粒层为何独立?
  3. Protein A 证明什么?
  4. Stage Gate 3?
  5. 1 µg/mL 150 kDa IgG 约多少 nM?
  6. 为什么按质量比较片段和 IgG 不公平?
  7. sample manifest 连接什么?
  8. plate-map 为什么要 sample ID?
  9. failure first step?
  10. rescue experiment 原则?
闭卷验收参考答案(先闭卷作答,再展开核对)
  1. 五个核心:唯一 design ID 与版本、链/格式信息(配对、linker、Fc、风险标记)、对照(parent/reference/negative/rescue)和 assay hypothesis 与 success criteria。
  2. DNA 层有独立失败模式:AA 设计正确不保证质粒读框、方向、信号肽连接和关键工程位点正确,需质粒身份与完整序列确认(Gate 1)。
  3. 含可结合 Fc 的物种:Protein A 主峰不能区分正确配对与单臂/错配副产物,需 intact mass、CE-SDS 等 identity/assembly 正交方法。
  4. 样品 fit-for-purpose release:确认 identity 与 assembly、浓度和 active fraction、monomer/fragment/aggregate、assay 相关 endotoxin/buffer/稳定性,以及 aliquot 与使用窗口(Gate 3)。
  5. 约 6.67 nM:1 µg/mL = 1 mg/L = 0.001 g/L;0.001 g/L ÷ 150,000 g/mol ≈ 6.67×10⁻⁹ mol/L。
  6. 分子数不同:同质量浓度下 50 kDa fragment(20 nM)的分子数约为 150 kDa IgG(6.67 nM)的 3 倍,µg/mL 比较会系统性偏袒大分子。
  7. 端到端追溯链:连接 design/construct 版本、表达/纯化批次、QC 结果与报告链接、concentration/buffer/freeze–thaw 状态、aliquot/vial ID 和 intended assay 与 release status。
  8. 防止昵称混淆:唯一 sample ID 使每个结论可回溯到具体 vial、批次与 QC 状态,避免把不同批次或不同物种组成的样品当成同一分子。
  9. 先查身份与状态:确认样品身份(LC-MS/链级)、状态(聚集/冻融)、浓度和 assay validity(controls/reference 是否通过),再讨论生物学机制。
  10. 最小且判别性:与 parent/reference 同批或同板比较,只改变一个最关键变量,选择能区分两个首要机制的实验,并预先写出每种结果如何改变决策;不用十个探索实验替代一个明确判别实验。

十四、本周最终交付物

提交三份可直接使用的模板:Design Handoff、Sample Manifest、Sequence-to-Sample Stage-Gate Checklist;再用一个历史案例完成一次追溯审计。

十五、延伸阅读

  1. Transient gene expression in HEK293 and CHO cells
  2. Cytiva protein purification handbooks
  3. NIH Assay Guidance Manual