WEEK 05基础语言与样品

重组抗体与蛋白表达

从质粒、转染、折叠装配到分泌,定位低表达究竟发生在哪一层。

最终得量低不等于表达低;先重建从收获液到最终样品的物料平衡。

构建体到转染到细胞状态到折叠装配到分泌到Titer的概念证据链
本周概念图:从输入、实验到可解释结论。箭头表示审查顺序,不代表单向因果。
Data Clinic · Case 05标本编号 BIO-W05

低 titer 还是低 recovery?

先回答:A、B 在相同 80 mL 表达规模下最终都只有约 6 mg,原因是否相同?

Harvest 与 final amount教学数据图
教学合成数据可视化。读图时先确认单位、坐标、对照和统计层级。
候选TiterHarvest amountFinal amount
A80 mg/L6.4 mg5.5 mg
B300 mg/L24.0 mg6.0 mg
  1. A harvest = 80 mg/L × 0.080 L = 6.4 mg;overall recovery = 5.5 / 6.4 = 86%
  2. B harvest = 300 × 0.080 = 24 mg;overall recovery = 6 / 24 = 25%
  3. B 的纯化损失 = 24 − 6 = 18 mg,是 A(0.9 mg)的 20 倍
  4. 结论分流:A 的问题在上游表达,B 的问题在下游回收与样品状态
计算结果A 是上游低表达但下游回收良好;B 表达正常、主要损失在纯化/样品状态。
项目解读A 优先查构建、转染、折叠分泌;B 优先查聚集、流穿、峰收集和过滤/浓缩损失。
证据边界内推边界:仅基于 A280/titer 这一层物料平衡;外推边界:titer assay 本身需校准,多特异分子的总 titer 可能包含错配体;伪差风险:把收获体积误差、浓度测定偏差与过滤吸附混入“表达低”的判断。

第 5 周学习包:重组抗体与蛋白表达

本周核心问题

一个候选表达量低,究竟是偶然的生产波动,还是序列、结构与分子形式暴露出的真实开发风险?

本周建立从计算设计到可检测样品的第一段证据链:

序列与构建体
→ 质粒质量与转染
→ 细胞生长和蛋白合成
→ 折叠、装配与分泌
→ 收获液 titer
→ 纯化 recovery
→ 最终可用样品

表达量不是一个孤立数字。只有把上述阶段拆开,才能判断问题属于序列设计、表达体系还是下游损失。

一、学习目标

完成本周后,应能够:

  1. 解释 HEK293 与 CHO、瞬时表达与稳定细胞株的主要差异;
  2. 说明质粒、启动子、信号肽、轻重链比例和培养状态如何影响表达;
  3. 区分 transfection efficiency、viability、titer、harvest amount、recovery 和 final yield;
  4. 用质量守恒思维定位“表达低”和“纯化后得量低”;
  5. 识别折叠、装配、分泌、降解和细胞毒性相关风险;
  6. 理解双抗、多特异抗体和 Fc 融合蛋白的额外装配难题;
  7. 为低表达候选建立分层问题树和最小补实验集;
  8. 写出一份表达报告必须包含的元数据。

二、学习时间安排

标准版:4 小时

学习块 时间 任务 产出
课前诊断 15 min 完成 10 道题 盲点清单
表达体系 45 min 学习 HEK/CHO 与 transient/stable 选择对照表
表达链条 60 min 学习构建、转染、折叠与分泌 因果链
指标与归因 60 min 学习 titer、recovery、yield 质量平衡表
综合案例 40 min 分析三个低得量候选 问题树与实验
闭卷验收 20 min 完成测验 得分与错题

深入版:6 小时

额外增加:

  • 45 分钟:阅读 HEK/CHO 瞬时表达综述;
  • 45 分钟:找一份真实、已脱敏的表达与纯化报告,重建物料平衡;
  • 30 分钟:比较同一序列在两个表达批次的 transfection、viability 和 titer;
  • 30 分钟:向实验同事讲解“final yield 低不等于表达低”。

三、课前诊断

  1. CHO 是否在所有情况下都比 HEK293 表达高?
  2. 瞬时表达结果能否直接代表稳定细胞株产能?
  3. 收获液中抗体浓度为 100 mg/L,是否足以计算最终获得多少毫克?
  4. Protein A 纯化后得量低,是否一定说明细胞表达低?
  5. 细胞活率高,是否足以证明转染成功?
  6. 重链和轻链质粒投料相同,是否保证正确装配?
  7. 单体比例低是否可能反过来影响“可回收得量”?
  8. 同一候选的两个批次表达差两倍,首先应核对哪些元数据?
  9. 双抗为何比常规 IgG 更容易出现错误配对?
  10. 计算预测认为结构稳定,为什么实验仍可能表达低?
课前诊断参考答案(先独立作答,再展开核对)
  1. 不是。HEK293 与 CHO 的分工取决于用途:HEK293 常用于快速研究级瞬时表达和构建筛选,CHO 是瞬时表达、工艺开发和商业生产的主流宿主;表达高低受细胞株、构建和工艺共同影响,平台选择是“速度与并行度”对“稳定性与可放大性”的权衡,不存在“谁更高级”。
  2. 不能。瞬时 titer 的主要变异源是转染、质粒、细胞状态和培养批次,对商业产能的预测有限;稳定株产能还取决于克隆差异、遗传稳定性与工艺开发。但持续、跨批次的瞬时低表达仍是值得追查的开发风险信号。
  3. 不足以。还需要收获体积和各步回收率:harvest amount (mg) = C_titer (mg/L) × V_harvest (L)。例如 100 mg/L × 0.08 L = 8 mg,再乘以 capture 与后续各步 recovery 才得到最终毫克数;只报浓度无法重建物料平衡。
  4. 不一定。得量低可能来自表达层(titer 低),也可能来自下游:capture 结合/洗脱损失、沉淀聚集、过滤损失、polishing 分流或峰收集过窄、浓缩/换液吸附、定量或记录不一致。应先用 titer 和每步输入/输出质量定位损失发生在哪一层。
  5. 不足以。三个问题必须分开:DNA 是否进入细胞(transfection efficiency)、细胞是否健康并继续生产(viability、viable cell density、生长曲线)、进入细胞的构建是否产生并分泌正确蛋白(上清 titer 与样品质量)。高活率不能替代转染效率,高转染效率也不能证明正确折叠和分泌。
  6. 不保证。重链/轻链比例不合适本身就是表达风险;即使等量投料,两条链的翻译、折叠、装配与分泌效率也可能不同,产物中可含错配体、半抗体或聚集体。需要用 CE-SDS、LC-MS、SEC 等确认预期分子量与链组合。
  7. 可能。聚集与异质性会在纯化中造成沉淀、过滤损失、峰分流或 QC 不合格丢弃,直接拉低 recovery(案例 C:titer 接近 A,但 SEC monomer 仅 62%,最终得量远低于 A)——即“表达量正常,可回收得量低”。
  8. 先核元数据。序列版本、质粒图谱与链标签;同批平台阳性对照;转染效率与细胞状态(活率、VCD、passage);培养规模、收获体积与培养天数;titer assay、标准品与稀释范围;每步输入输出 recovery。一次只改变关键变量并保留阳性对照,才能区分序列效应与批次效应。
  9. 链组合更复杂。双抗的两条不同重链可形成同源二聚体,轻链可与错误重链配对,产生半抗体、错配体和聚集体;Protein A 只能富集“含 Fc 的所有物种”,不能区分正确装配,工程策略本身还可能引入额外疏水性或局部不稳定性。
  10. 计算有边界。计算稳定性评分只覆盖序列/结构层面的假设,不能覆盖宿主细胞的翻译速率、内质网折叠与二硫键形成、装配与分泌通路、培养条件以及蛋白酶降解;计算结果用于提出假设,表达结论必须由上清/胞内对比、SEC、CE-SDS 等实验证据支持。

四、表达体系:先问用途,再选平台

4.1 HEK293 与 CHO 的常见定位

维度 HEK293 CHO
常见用途 快速研究级瞬时表达、构建筛选 瞬时表达、工艺开发和商业生产主流宿主
开发速度 通常较快 瞬时体系可快,稳定株开发更长
糖基化 人源细胞背景,但仍受具体细胞株和工艺影响 工业经验丰富,糖型可通过细胞株和工艺控制
放大与监管经验 有应用,但产品相关经验依体系而异 产业化经验最丰富
主要用途问题 能否快速得到足量、可比较样品 能否形成可放大、稳定和一致的生产过程

平台选择不是“谁更高级”。研究早期常优先速度和并行度;候选进入开发阶段后,稳定性、工艺可放大性和产品质量可控性权重上升。

4.2 瞬时表达与稳定细胞株

瞬时表达(transient expression):外源 DNA 进入细胞后短期表达,适合数十到数百个候选的快速制样。

稳定细胞株(stable cell line):表达构建体稳定整合或维持,经筛选和克隆化后长期生产,适合工艺开发和规模化。

问题 瞬时表达 稳定株
速度 天到数周级 通常数月级,依平台和标准而变
候选通量 高 低于瞬时筛选
早期序列排序 合适 一般不作为大规模首筛
预测商业产能 有限 更相关,但仍需工艺开发
主要变异源 转染、质粒、细胞状态、培养批次 克隆差异、遗传稳定性、工艺和培养条件

不能把一次小规模瞬时 titer 当作最终 manufacturability 结论;但持续、跨批次低表达仍是值得追查的风险信号。

五、从质粒到分泌蛋白

5.1 构建体层

表达构建体通常涉及:

  • 正确的 VH/VL、CH/CL、Fc 或融合结构域序列;
  • 启动子、增强元件和转录终止信号;
  • 信号肽及其切割;
  • 重链、轻链或多条链的表达盒组织方式;
  • 密码子、异常重复序列和潜在剪接位点;
  • 筛选标记;
  • 完整序列验证和质粒身份确认。

计算团队交付序列时,不能只给氨基酸 FASTA。最低应同时给出链定义、分子形式、预期分子量、连接肽、关键工程位点、对照序列和版本号。

5.2 转染与细胞状态层

需要区分三个问题:

  1. DNA 是否进入细胞:transfection efficiency;
  2. 细胞是否健康并继续生产:viability、viable cell density 和生长曲线;
  3. 进入细胞的构建是否产生并分泌正确蛋白:上清 titer 与样品质量。

高活率不能替代转染效率;高转染效率也不能证明正确折叠和分泌。

5.3 折叠、装配与分泌层

蛋白在内质网内折叠、形成二硫键、装配并通过质量控制后才能有效分泌。常见风险包括:

  • VH/VL 或融合结构域本身稳定性不足;
  • 暴露疏水面引起聚集或胞内滞留;
  • 未配对半胱氨酸或二硫键错配;
  • 重链/轻链比例不合适;
  • 多特异分子的重链同源二聚或轻链错配;
  • 蛋白对宿主细胞产生应激或毒性;
  • 分泌后在培养液中被蛋白酶降解;
  • 非预期糖基化或剪切影响异质性与回收。

计算稳定性评分可用于提出假设,但不能覆盖宿主细胞加工、翻译速率、分泌通路和培养条件。

六、指标:不要把四个数字叫成一个“表达量”

6.1 基本物料平衡

若收获体积为 V_harvest,上清滴度为 C_titer:

harvest amount (mg) = C_titer (mg/L) × V_harvest (L)

若捕获后获得的产品量为 M_capture:

capture recovery (%) = M_capture / harvest amount × 100%

若最终配制后的可用产品量为 M_final:

overall recovery (%) = M_final / harvest amount × 100%

需要同时报告:

  • 培养规模和实际收获体积;
  • titer 的 assay 与标准品;
  • 捕获前理论总量;
  • 每一步实际回收量;
  • 纯化池和最终样品的浓度、体积与质量;
  • 因 QC 不合格被丢弃或分流的部分。

6.2 一个例子

收获体积 0.080 L,titer 250 mg/L:

harvest amount = 0.080 L × 250 mg/L = 20 mg

Protein A 后 14 mg,最终 SEC 后 10 mg:

capture recovery = 14/20 = 70%
overall recovery = 10/20 = 50%

如果实验员只说“最后拿到 10 mg”,无法判断 10 mg 来自高表达低回收,还是低表达高回收。

七、低表达/低得量问题树

7.1 第一层:先定位损失发生在哪里

最终得量低
├─ 收获液 titer 低
│  ├─ 构建体/质粒问题
│  ├─ 转染或细胞状态问题
│  ├─ 合成、折叠、装配、分泌问题
│  └─ 培养期降解或检测偏差
└─ 收获液 titer 正常,但纯化后低
   ├─ capture 结合或洗脱损失
   ├─ 沉淀、聚集或过滤损失
   ├─ polishing 分流或峰收集过窄
   ├─ 浓缩/换液吸附损失
   └─ 定量方法或物料记录不一致

7.2 最小排查集

层级 首批核对 可能的判别实验
身份 序列版本、质粒图谱、链标签 测序/身份确认
转染 阳性表达对照、细胞状态、批次 转染标记或平台内部控制
合成/分泌 上清与细胞内信号 上清/细胞裂解物对比、还原/非还原分析
装配 预期分子量和链组合 CE-SDS、LC-MS、SEC 等
稳定性 聚集、沉淀、剪切 SEC、DLS/浊度、质谱或电泳
下游 每一步输入/输出质量 物料平衡与峰回收

一次只改变关键变量,并保留平台阳性对照,才能区分序列效应和批次效应。

八、多特异分子的额外问题

双抗或多特异抗体除“表达多少”外,还要问“表达的是什么”:

  • 预期重链异源二聚比例;
  • 轻链是否错配;
  • 半抗体、错配体和聚集体比例;
  • 纯化步骤是否只富集“含 Fc 的所有物种”,而不能区分正确装配;
  • 工程策略是否引入额外疏水性、等电点或局部不稳定性;
  • 功能 assay 使用的是总蛋白浓度还是正确装配的活性分子浓度。

Protein A 可捕获并不等于正确配对。对多特异分子,identity 和 intact mass/链级分析往往比单一纯度百分比更关键。

九、表达报告审查清单

十、综合案例

同一批次表达三个 IgG 类候选:

指标 A B C
收获体积 80 mL 80 mL 80 mL
titer 300 mg/L 90 mg/L 280 mg/L
harvest amount 24.0 mg 7.2 mg 22.4 mg
Protein A 后 18.0 mg 6.0 mg 8.0 mg
SEC 后 15.5 mg 5.4 mg 3.5 mg
SEC monomer 97% 96% 62%

任务

  1. A、B、C 的主要问题分别在哪一层?
  2. 哪个候选最像真正的表达问题?
  3. C 的最终得量低,为什么不能简单归因于转染?
  4. 为 B 和 C 各设计三项最优先的补充检查。

参考分析

  • A:表达和回收均正常,可作为本批次过程参考;
  • B:收获液 titer 明显低,但捕获与 SEC recovery 较好,优先排查构建/转染/折叠分泌;
  • C:收获液 titer 接近 A,但捕获和 SEC 损失大且单体比例低,更像产品异质性、聚集或下游回收问题;
  • B 应先核对质粒身份、同批转染/细胞状态和上清/胞内蛋白;
  • C 应先检查 Protein A 流穿与洗脱、聚集/沉淀和身份/装配状态。

十一、闭卷验收

  1. 用一句话区分 transient expression 与 stable cell line。
  2. 写出 harvest amount 的计算式。
  3. 为什么 final yield 低不能直接写成“low expression”?
  4. 至少列出四个收获液 titer 低的原因层级。
  5. 为什么需要平台阳性对照?
  6. 多特异抗体为何必须确认正确装配比例?
  7. titer assay 为什么可能对候选比较产生偏差?
  8. 捕获后 recovery 低,首先需要哪两类数据?
  9. “细胞活率 95%”不能证明什么?
  10. 计算团队交付序列时至少应附带哪些元数据?

建议满分 20 分,每题 2 分;16 分及以上通过。

闭卷验收参考答案(先闭卷作答,再展开核对)
  1. 短期 vs 长期:transient expression 是外源 DNA 进入细胞后短期表达,适合数十到数百个候选的快速制样;stable cell line 是表达构建体稳定整合、经筛选和克隆化后长期生产,适合工艺开发和规模化。
  2. harvest amount (mg) = C_titer (mg/L) × V_harvest (L),单位必须一致。例如 250 mg/L × 0.080 L = 20 mg;再由 M_capture / harvest amount 得到 capture recovery(如 14/20 = 70%),由 M_final / harvest amount 得到 overall recovery(如 10/20 = 50%)。
  3. 四个数字不是一个数:final yield = 表达量 × 各步回收率;低得量可能来自纯化损失(capture 结合/洗脱、沉淀聚集、过滤、polishing 分流、浓缩吸附)或定量/记录问题,而非细胞表达低。必须先用物料平衡定位损失层级,再决定写“low expression”还是“low recovery”。
  4. 四个层级:①构建体/质粒问题(序列、信号肽、链比例、质粒质量);②转染或细胞状态问题(效率、活率、培养状态);③合成、折叠、装配、分泌问题(结构域稳定性、二硫键错配、聚集、胞内滞留);④培养期降解或检测偏差(蛋白酶降解、titer assay 偏差)。
  5. 区分序列效应与平台失败:若同批平台阳性对照也低表达,问题在转染、细胞状态或培养批次,而非候选序列;没有阳性对照,一次低 titer 无法区分偶然生产波动与真实开发风险,跨候选比较也失去锚点。
  6. 总蛋白 ≠ 正确装配:总蛋白浓度中可能包含错配体、半抗体或同源二聚体;Protein A 捕获不等于正确配对,纯度百分比也不能区分链组合。功能 assay 若按总蛋白浓度计算会误估活性,identity 与 intact mass/链级分析(CE-SDS、LC-MS、SEC)比单一纯度更关键。
  7. assay 并非完全中立:titer assay 依赖标准品与识别表位,不同候选的亚型、物种或表位差异可使响应不同;稀释线性范围、基质效应和样品异质性(聚集、剪切)也会引入偏差。比较候选必须明确 assay、标准品与稀释范围,并在相同条件下测定。
  8. 两类数据:①物料平衡——上样理论量与流穿/洗涤/洗脱中的产品分布,逐步重建输入与输出;②产品状态——聚集/沉淀情况、纯化池与最终样品的浓度体积质量,以及是否因 QC 不合格被丢弃或分流。前者定位损失环节,后者解释损失原因。
  9. 不能证明表达成功:95% 活率只说明细胞当时健康,不能证明 DNA 已进入细胞(transfection efficiency),也不能证明构建已正确表达并分泌目标蛋白(titer 与样品质量);活率必须与转染效率、VCD/生长曲线和上清 titer 联读。
  10. 最低元数据:链定义、分子形式、预期分子量、连接肽与关键工程位点、对照序列、版本号(以及交付日期);只给氨基酸 FASTA 不足以支撑构建设计、问题归因和批次追溯。

十二、本周最终交付物

提交一页《低表达/低得量问题树》,必须包括:

  1. 质粒与序列层;
  2. 转染与细胞状态层;
  3. 折叠、装配与分泌层;
  4. 收获液与 titer 检测层;
  5. capture/polishing/浓缩回收层;
  6. 每层一个最小判别实验;
  7. 一张可重建的物料平衡表。

十三、延伸阅读

  1. Transient gene expression in HEK293 and CHO cells: a review
  2. CHO and HEK293 antibody manufacturing systems review
  3. Cytiva protein purification handbooks