第 5 周学习包:重组抗体与蛋白表达
本周核心问题
一个候选表达量低,究竟是偶然的生产波动,还是序列、结构与分子形式暴露出的真实开发风险?
本周建立从计算设计到可检测样品的第一段证据链:
序列与构建体
→ 质粒质量与转染
→ 细胞生长和蛋白合成
→ 折叠、装配与分泌
→ 收获液 titer
→ 纯化 recovery
→ 最终可用样品
表达量不是一个孤立数字。只有把上述阶段拆开,才能判断问题属于序列设计、表达体系还是下游损失。
一、学习目标
完成本周后,应能够:
- 解释 HEK293 与 CHO、瞬时表达与稳定细胞株的主要差异;
- 说明质粒、启动子、信号肽、轻重链比例和培养状态如何影响表达;
- 区分 transfection efficiency、viability、titer、harvest amount、recovery 和 final yield;
- 用质量守恒思维定位“表达低”和“纯化后得量低”;
- 识别折叠、装配、分泌、降解和细胞毒性相关风险;
- 理解双抗、多特异抗体和 Fc 融合蛋白的额外装配难题;
- 为低表达候选建立分层问题树和最小补实验集;
- 写出一份表达报告必须包含的元数据。
二、学习时间安排
标准版:4 小时
| 学习块 | 时间 | 任务 | 产出 |
|---|---|---|---|
| 课前诊断 | 15 min | 完成 10 道题 | 盲点清单 |
| 表达体系 | 45 min | 学习 HEK/CHO 与 transient/stable | 选择对照表 |
| 表达链条 | 60 min | 学习构建、转染、折叠与分泌 | 因果链 |
| 指标与归因 | 60 min | 学习 titer、recovery、yield | 质量平衡表 |
| 综合案例 | 40 min | 分析三个低得量候选 | 问题树与实验 |
| 闭卷验收 | 20 min | 完成测验 | 得分与错题 |
深入版:6 小时
额外增加:
- 45 分钟:阅读 HEK/CHO 瞬时表达综述;
- 45 分钟:找一份真实、已脱敏的表达与纯化报告,重建物料平衡;
- 30 分钟:比较同一序列在两个表达批次的 transfection、viability 和 titer;
- 30 分钟:向实验同事讲解“final yield 低不等于表达低”。
三、课前诊断
- CHO 是否在所有情况下都比 HEK293 表达高?
- 瞬时表达结果能否直接代表稳定细胞株产能?
- 收获液中抗体浓度为 100 mg/L,是否足以计算最终获得多少毫克?
- Protein A 纯化后得量低,是否一定说明细胞表达低?
- 细胞活率高,是否足以证明转染成功?
- 重链和轻链质粒投料相同,是否保证正确装配?
- 单体比例低是否可能反过来影响“可回收得量”?
- 同一候选的两个批次表达差两倍,首先应核对哪些元数据?
- 双抗为何比常规 IgG 更容易出现错误配对?
- 计算预测认为结构稳定,为什么实验仍可能表达低?
四、表达体系:先问用途,再选平台
4.1 HEK293 与 CHO 的常见定位
| 维度 | HEK293 | CHO |
|---|---|---|
| 常见用途 | 快速研究级瞬时表达、构建筛选 | 瞬时表达、工艺开发和商业生产主流宿主 |
| 开发速度 | 通常较快 | 瞬时体系可快,稳定株开发更长 |
| 糖基化 | 人源细胞背景,但仍受具体细胞株和工艺影响 | 工业经验丰富,糖型可通过细胞株和工艺控制 |
| 放大与监管经验 | 有应用,但产品相关经验依体系而异 | 产业化经验最丰富 |
| 主要用途问题 | 能否快速得到足量、可比较样品 | 能否形成可放大、稳定和一致的生产过程 |
平台选择不是“谁更高级”。研究早期常优先速度和并行度;候选进入开发阶段后,稳定性、工艺可放大性和产品质量可控性权重上升。
4.2 瞬时表达与稳定细胞株
瞬时表达(transient expression):外源 DNA 进入细胞后短期表达,适合数十到数百个候选的快速制样。
稳定细胞株(stable cell line):表达构建体稳定整合或维持,经筛选和克隆化后长期生产,适合工艺开发和规模化。
| 问题 | 瞬时表达 | 稳定株 |
|---|---|---|
| 速度 | 天到数周级 | 通常数月级,依平台和标准而变 |
| 候选通量 | 高 | 低于瞬时筛选 |
| 早期序列排序 | 合适 | 一般不作为大规模首筛 |
| 预测商业产能 | 有限 | 更相关,但仍需工艺开发 |
| 主要变异源 | 转染、质粒、细胞状态、培养批次 | 克隆差异、遗传稳定性、工艺和培养条件 |
不能把一次小规模瞬时 titer 当作最终 manufacturability 结论;但持续、跨批次低表达仍是值得追查的风险信号。
五、从质粒到分泌蛋白
5.1 构建体层
表达构建体通常涉及:
- 正确的 VH/VL、CH/CL、Fc 或融合结构域序列;
- 启动子、增强元件和转录终止信号;
- 信号肽及其切割;
- 重链、轻链或多条链的表达盒组织方式;
- 密码子、异常重复序列和潜在剪接位点;
- 筛选标记;
- 完整序列验证和质粒身份确认。
计算团队交付序列时,不能只给氨基酸 FASTA。最低应同时给出链定义、分子形式、预期分子量、连接肽、关键工程位点、对照序列和版本号。
5.2 转染与细胞状态层
需要区分三个问题:
- DNA 是否进入细胞:transfection efficiency;
- 细胞是否健康并继续生产:viability、viable cell density 和生长曲线;
- 进入细胞的构建是否产生并分泌正确蛋白:上清 titer 与样品质量。
高活率不能替代转染效率;高转染效率也不能证明正确折叠和分泌。
5.3 折叠、装配与分泌层
蛋白在内质网内折叠、形成二硫键、装配并通过质量控制后才能有效分泌。常见风险包括:
- VH/VL 或融合结构域本身稳定性不足;
- 暴露疏水面引起聚集或胞内滞留;
- 未配对半胱氨酸或二硫键错配;
- 重链/轻链比例不合适;
- 多特异分子的重链同源二聚或轻链错配;
- 蛋白对宿主细胞产生应激或毒性;
- 分泌后在培养液中被蛋白酶降解;
- 非预期糖基化或剪切影响异质性与回收。
计算稳定性评分可用于提出假设,但不能覆盖宿主细胞加工、翻译速率、分泌通路和培养条件。
六、指标:不要把四个数字叫成一个“表达量”
6.1 基本物料平衡
若收获体积为 V_harvest,上清滴度为 C_titer:
harvest amount (mg) = C_titer (mg/L) × V_harvest (L)
若捕获后获得的产品量为 M_capture:
capture recovery (%) = M_capture / harvest amount × 100%
若最终配制后的可用产品量为 M_final:
overall recovery (%) = M_final / harvest amount × 100%
需要同时报告:
- 培养规模和实际收获体积;
- titer 的 assay 与标准品;
- 捕获前理论总量;
- 每一步实际回收量;
- 纯化池和最终样品的浓度、体积与质量;
- 因 QC 不合格被丢弃或分流的部分。
6.2 一个例子
收获体积 0.080 L,titer 250 mg/L:
harvest amount = 0.080 L × 250 mg/L = 20 mg
Protein A 后 14 mg,最终 SEC 后 10 mg:
capture recovery = 14/20 = 70%
overall recovery = 10/20 = 50%
如果实验员只说“最后拿到 10 mg”,无法判断 10 mg 来自高表达低回收,还是低表达高回收。
七、低表达/低得量问题树
7.1 第一层:先定位损失发生在哪里
最终得量低
├─ 收获液 titer 低
│ ├─ 构建体/质粒问题
│ ├─ 转染或细胞状态问题
│ ├─ 合成、折叠、装配、分泌问题
│ └─ 培养期降解或检测偏差
└─ 收获液 titer 正常,但纯化后低
├─ capture 结合或洗脱损失
├─ 沉淀、聚集或过滤损失
├─ polishing 分流或峰收集过窄
├─ 浓缩/换液吸附损失
└─ 定量方法或物料记录不一致
7.2 最小排查集
| 层级 | 首批核对 | 可能的判别实验 |
|---|---|---|
| 身份 | 序列版本、质粒图谱、链标签 | 测序/身份确认 |
| 转染 | 阳性表达对照、细胞状态、批次 | 转染标记或平台内部控制 |
| 合成/分泌 | 上清与细胞内信号 | 上清/细胞裂解物对比、还原/非还原分析 |
| 装配 | 预期分子量和链组合 | CE-SDS、LC-MS、SEC 等 |
| 稳定性 | 聚集、沉淀、剪切 | SEC、DLS/浊度、质谱或电泳 |
| 下游 | 每一步输入/输出质量 | 物料平衡与峰回收 |
一次只改变关键变量,并保留平台阳性对照,才能区分序列效应和批次效应。
八、多特异分子的额外问题
双抗或多特异抗体除“表达多少”外,还要问“表达的是什么”:
- 预期重链异源二聚比例;
- 轻链是否错配;
- 半抗体、错配体和聚集体比例;
- 纯化步骤是否只富集“含 Fc 的所有物种”,而不能区分正确装配;
- 工程策略是否引入额外疏水性、等电点或局部不稳定性;
- 功能 assay 使用的是总蛋白浓度还是正确装配的活性分子浓度。
Protein A 可捕获并不等于正确配对。对多特异分子,identity 和 intact mass/链级分析往往比单一纯度百分比更关键。
九、表达报告审查清单
十、综合案例
同一批次表达三个 IgG 类候选:
| 指标 | A | B | C |
|---|---|---|---|
| 收获体积 | 80 mL | 80 mL | 80 mL |
| titer | 300 mg/L | 90 mg/L | 280 mg/L |
| harvest amount | 24.0 mg | 7.2 mg | 22.4 mg |
| Protein A 后 | 18.0 mg | 6.0 mg | 8.0 mg |
| SEC 后 | 15.5 mg | 5.4 mg | 3.5 mg |
| SEC monomer | 97% | 96% | 62% |
任务
- A、B、C 的主要问题分别在哪一层?
- 哪个候选最像真正的表达问题?
- C 的最终得量低,为什么不能简单归因于转染?
- 为 B 和 C 各设计三项最优先的补充检查。
参考分析
- A:表达和回收均正常,可作为本批次过程参考;
- B:收获液 titer 明显低,但捕获与 SEC recovery 较好,优先排查构建/转染/折叠分泌;
- C:收获液 titer 接近 A,但捕获和 SEC 损失大且单体比例低,更像产品异质性、聚集或下游回收问题;
- B 应先核对质粒身份、同批转染/细胞状态和上清/胞内蛋白;
- C 应先检查 Protein A 流穿与洗脱、聚集/沉淀和身份/装配状态。
十一、闭卷验收
- 用一句话区分 transient expression 与 stable cell line。
- 写出 harvest amount 的计算式。
- 为什么 final yield 低不能直接写成“low expression”?
- 至少列出四个收获液 titer 低的原因层级。
- 为什么需要平台阳性对照?
- 多特异抗体为何必须确认正确装配比例?
- titer assay 为什么可能对候选比较产生偏差?
- 捕获后 recovery 低,首先需要哪两类数据?
- “细胞活率 95%”不能证明什么?
- 计算团队交付序列时至少应附带哪些元数据?
答案与评分关键词
- transient 是短期高通量制样;stable 是经过筛选、可长期稳定生产的细胞株;
titer × 收获体积,单位必须一致;- 可能是纯化、聚集、过滤、分流或定量损失;
- 构建/质粒、转染/细胞、合成折叠装配分泌、培养期降解或检测偏差;
- 区分候选效应和平台/批次失败;
- 总蛋白中可能包含错配体、半抗体或同源二聚体;
- 标准品、识别表位、稀释线性或对不同物种响应不同;
- 上样理论量/流穿洗涤洗脱分布,以及产品状态/聚集沉淀;
- 不能证明 DNA 已进入、蛋白已正确表达并分泌;
- 版本、链定义、分子形式、预期分子量、工程位点、对照与交付日期。
建议满分 20 分,每题 2 分;16 分及以上通过。
十二、本周最终交付物
提交一页《低表达/低得量问题树》,必须包括:
- 质粒与序列层;
- 转染与细胞状态层;
- 折叠、装配与分泌层;
- 收获液与 titer 检测层;
- capture/polishing/浓缩回收层;
- 每层一个最小判别实验;
- 一张可重建的物料平衡表。