第 12 周学习包:Assay Validation 与跨实验室可比性
本周核心问题
候选 A 比 B 强 2 倍,这个差异是否大于 assay 自身的日间、donor、试剂和实验室变异,足以改变项目决策?
一、学习目标
完成本周后,应能够:
- 区分 exploratory、qualified、validated assay 的证据强度;
- 依据 intended use 设定 fit-for-purpose 性能要求;
- 解释 accuracy/trueness、precision、specificity、range、robustness 和 stability;
- 预设 system suitability、plate acceptance 和 sample acceptance;
- 用 reference molecule 和 control chart 监测 assay drift;
- 判断 2-fold 差异是否超过方法变异;
- 设计 assay transfer、bridging、试剂/细胞批次更换方案;
- 完成一页可执行 assay card。
二、学习时间安排
标准版:4 小时
| 学习块 | 时间 | 任务 | 产出 |
|---|---|---|---|
| 诊断 | 15 min | 10 题 | 盲点清单 |
| Fit-for-purpose | 45 min | intended use 与验证层级 | 风险表 |
| 性能参数 | 75 min | precision/range/robustness 等 | 参数矩阵 |
| 可比与转移 | 60 min | control chart/bridging | 转移计划 |
| 案例 | 30 min | 判断 2-fold 差异 | 决策结论 |
| 验收 | 15 min | 闭卷测验 | 得分 |
深入版:6 小时
- 阅读 NIH HTS Assay Validation 章节 60 分钟;
- 用历史 reference control 数据画控制图 45 分钟;
- 对一个 assay 计算 intra-/inter-assay CV 与 log-scale fold variability 30 分钟;
- 与实验团队完成一次 assay card 审评 45 分钟。
三、课前诊断
- 探索性 assay 是否必须达到临床生物分析验证要求?
- technical replicate CV 低是否证明跨日精密度高?
- reference control 每次都通过,是否代表样本值一定正确?
- acceptance criteria 应在看数据前还是后设定?
- EC50 的算术 CV 适合所有情况吗?
- 细胞换批后 reference EC50 相同是否足以证明 assay 等价?
- method transfer 是把 SOP 发给 CRO 就结束吗?
- 两个实验室的绝对 EC50 不同,候选排名一致,有何意义?
- orthogonal assay 和 replicate 的区别?
- “2 倍更强”至少需要哪些不确定性信息?
课前诊断参考答案(先独立作答,再展开核对)
- 不必。验证强度由 intended use 和决策风险决定:exploratory mechanism 场景只需能回答方向性问题、关键对照正常且局限透明;只有 release/comparability/regulatory support 等高风险用途才要求预定义、更系统的验证。
- 不能。Technical replicate CV 只反映同一板/同一运行内的孔间变异;跨日精密度处于精密度层级更上层(between-run、between-analyst/day/instrument、between-lab),需要独立日期的重复实验来估计。
- 不一定。Reference control 通过只覆盖 system suitability 和 plate acceptance 两层;样本值还受 matrix/interference、稀释、cytotoxicity 和复测规则等 sample acceptance 层因素影响,仍需逐项核查。
- 看数据前。System/plate/sample 三层接受标准都应在数据揭盲或查看候选排名之前预设并书面记录;事后设定会失去统计与诚信意义。
- 不适合。EC50 常跨数量级并呈右偏分布,应在 log scale 上评估离散度(log-scale SD 或 inter-assay fold variability);算术 CV 会随数值量级失真。
- 不足。只比较一个 reference EC50 不能证明全范围可比;bridging 应用代表性 panel(reference、高/中/低 potency 样本、阴性样本)在旧/新条件下并行比较 absolute values、fold、ranking、Emax、precision 和 failure rate。
- 不是。Transfer package 至少还应包含 critical reagents 与 cell bank(来源、lot qualification、保存)、仪器设置、reference 历史范围、training run 与预设成功标准、raw data/curve fit 和审计规则,以及偏差、失败和复测规则。
- 支持相对决策。绝对 EC50 可因细胞、试剂和仪器发生系统偏移;若 A>B>C 排名、fold 关系和 Emax 结论稳定,仍可支持候选排序;反之绝对数值相近但排名频繁反转,说明方法区分能力不足。
- 不同原理 vs 同一方法重复。Orthogonal assay 用不同原理回答同一机制问题(如 reporter activation + phospho-flow + 下游表型),可降低共同伪差;replicate 只是同一 assay 的技术重复,无法暴露方法级系统误差。
- 独立实验与变异度量:至少需要独立实验数(而非技术复孔数)、每次是否成对同板/同 donor、inter-assay fold variability 或 log-scale SD、log fold 的置信区间、Emax 与曲线质量,以及正交 assay 是否同方向。
四、从 intended use 开始
4.1 三种常见使用场景
| 场景 | 决策风险 | 典型要求 |
|---|---|---|
| Exploratory mechanism | 低到中 | 能回答方向性问题,关键对照正常,局限透明 |
| Candidate ranking | 中到高 | 跨日/跨 donor 可重复、reference 稳定、候选同批比较 |
| Release/comparability/regulatory support | 高 | 预定义且更系统的验证、受控试剂/SOP/变更管理 |
“Validated” 不是对 assay 的永久称号;它相对于 analyte、matrix、range、平台和 intended use 成立。
4.2 Fit-for-purpose 的三个问题
- 结果将触发什么决策?
- 错选/漏选的代价是什么?
- 方法不确定性多大才不会改变该决策?
高风险候选淘汰通常需要更强的重复、正交证据和样品质量确认。
五、关键性能参数
| 参数 | 问题 | 常见评估方式 |
|---|---|---|
| Specificity/selectivity | 信号是否来自目标机制? | negative/KO、blocking、matrix/interferent |
| Accuracy/trueness | 结果离已知/参考值多远? | spike recovery、reference standard;某些 cell assay 无真值 |
| Precision | 重复结果有多分散? | within-run、between-run、analyst/day/instrument |
| Range | 哪个区间内结果可信? | 完整曲线、LLOQ/ULOQ 或 reportable range |
| Linearity/dilutional parallelism | 稀释是否按预期响应? | dilution series、parallelism |
| Robustness | 小的合理条件变化会否改变结论? | 时间、细胞密度、reagent lot、temperature 等 |
| Stability | 样本/试剂随时间与冻融是否稳定? | bench-top、freeze–thaw、storage |
| Reproducibility | 不同实验室/条件能否得到相容结论? | transfer/bridging study |
5.1 Precision 不是只有 technical CV
Within-plate precision
< Within-run precision
< Between-run precision
< Between-analyst/day/instrument
< Between-lab reproducibility
候选决策应使用与未来真实变异源匹配的精密度,而不是只引用同一板三个孔的 CV。
5.2 4PL/5PL 曲线参数
细胞和结合 assay 常用 4PL/5PL。需要预定义:
- 权重和参数约束;
- Top/Bottom 是否固定;
- 有效点数和浓度覆盖;
- replicate 合并方式;
- outlier 规则;
- EC50/IC50 何时不报告;
- Emax 和 reference-normalized potency 如何计算。
曲线“能拟合”不等于参数可决策。若上下平台不完整或 Hill slope 异常,EC50 可能不稳。
六、三级接受标准
6.1 System suitability
仪器、细胞和关键试剂是否处于可用状态,例如:
- instrument QC;
- 细胞 viability/靶表达;
- 标准曲线范围;
- 阳性/阴性信号分离。
6.2 Plate/run acceptance
- reference EC50/Emax 在历史范围;
- background/vehicle 可接受;
- control signal window 足够;
- replicate precision 合格;
- 无明显 spatial/edge pattern。
6.3 Sample acceptance
- 样品浓度和 QC 合格;
- 曲线覆盖有效范围;
- 重复一致;
- 无明显 cytotoxicity/interference;
- 复测和报告规则满足。
三层都应在数据揭盲或看候选排名前定义。
七、Reference molecule 与 control chart
Reference molecule 用于监测 assay 随时间变化,不应频繁更换。每次运行可跟踪:
- EC50/IC50(通常在 log scale 更合适);
- Emax/Top;
- background;
- signal window;
- positive/negative control;
- cell target expression 和 viability。
控制图用于识别:
- 单点超限;
- 连续向一个方向偏移;
- reagent/cell lot 更换后的 step change;
- 方差逐渐增大。
历史范围必须来自稳定方法阶段,并说明均值、SD/容限和纳入规则,不能在每次失败后重算范围让它通过。
八、如何判断“2 倍差异”
8.1 先在 log scale 思考
EC50 通常跨数量级并呈右偏。候选 fold difference:
fold difference = EC50_B / EC50_A
log10 fold difference = log10(EC50_B) − log10(EC50_A)
判断需要:
- 独立实验数,而非只看技术复孔;
- 每次是否成对在同板/同 donor;
- inter-assay fold variability 或 log-scale SD;
- 置信区间;
- Emax、curve quality 和 biological relevance;
- 正交 assay 是否同方向。
如果 reference molecule 的日间 EC50 自身经常在 0.5×–2× 范围漂移,单次 2 倍候选差异证据较弱。
8.2 排名一致性也很重要
跨实验室绝对 EC50 可因细胞、试剂和仪器发生系统偏移。如果 A>B>C 排名、fold 关系和 Emax 结论稳定,可能仍支持候选决策;反之绝对数值相近但排名频繁反转,方法区分能力不足。
九、Robustness、Transfer 与 Bridging
9.1 Robustness
优先扰动最可能发生的小变化:
- cell passage/density;
- target expression;
- incubation time;
- wash timing;
- reagent lot;
- operator/instrument;
- edge position;
- fresh/frozen donor cells。
目的是找到 critical assay parameters,而不是证明所有变化都无影响。
9.2 Transfer package
至少包含:
- current SOP 和数据分析模板;
- critical reagents、来源、lot qualification 和保存;
- cell bank、passage window、identity/mycoplasma;
- instrument settings;
- reference/control 历史范围;
- training run 和预设成功标准;
- raw data、curve fit 和审计规则;
- 偏差、失败和复测规则。
9.3 Bridging study
应在旧/新条件下并行比较代表性 panel:
- reference;
- high/mid/low potency samples;
- negative sample;
- 若相关,困难 matrix 或边界样本。
比较 absolute values、fold、ranking、Emax、precision 和 failure rate。只比较一个 reference EC50 不足以证明全范围可比。
十、Orthogonal assay
Orthogonal assay 通过不同原理回答同一机制问题。例如:
Reporter pathway activation
+ phospho-flow proximal signal
+ downstream cell phenotype
它与“同一 assay 多做三孔”不同。正交方法可降低共同伪差,但也可能回答机制链的不同节点,因此结果不一致时先确认问题是否真的相同。
十一、Assay card 模板
名称/版本:
Intended use 与决策:
Biological principle:
样品与 matrix:
细胞/关键试剂:
Primary readout:
Controls/reference:
浓度范围和重复:
System/plate/sample acceptance:
性能摘要:precision、range、specificity、robustness
数据分析:模型、归一化、异常值、BLQ
Critical parameters:
已知局限:
变更与 bridging 规则:
负责人/复核人:
十二、综合案例
实验室 1:A EC50=40 pM,B=80 pM;实验室 2:A=120 pM,B=210 pM。两地各做一次,技术复孔 CV 均 <10%。历史 reference 的 inter-day EC50 范围为名义值的 0.55×–1.9×。
参考分析
两地均显示 A 约优于 B,但独立实验不足,2 倍差异接近方法历史变异;低 technical CV 不能证明跨日差异可靠。建议进行预设的成对跨日/多 donor 重复,报告 log fold CI、Emax 与正交功能结果。现阶段可称“方向一致的初步排序”,不宜称“已证明 A potency 提升 2 倍”。
十三、决策错在哪里:一份(虚构的)评审纪要
以下纪要为教学合成的典型错误示范。先自己挑错(至少 5 处),再对照参考清单。
项目评审纪要(节选):Lab A 报告候选 X 的 killing EC50 为 0.5 nM,比 benchmark 的 1.2 nM 强 2.4 倍,技术复孔 CV 8%,数据可信。Lab B 上周测 X 得到 0.9 nM,但我们认为 Lab A 平台更新,采用 Lab A 结果。接受标准方面,团队同意将 2 倍差异设为显著(看完数据后大家觉得合理)。历史 reference 这次没跑,因为细胞状态不好,但复孔 CV 小说明系统稳定。结论:X potency 显著优于 benchmark,建议直接进入动物实验。
参考错误清单
| # | 纪要中的错误 | 为什么错 | 替代做法 |
|---|---|---|---|
| 1 | "CV 8% → 数据可信" | 技术复孔 CV 只覆盖孔间变异,不含日间/操作者/细胞批次变异(本周 §5) | 用独立日期重复 + 跨日 SD 判断 |
| 2 | 择优采用 Lab A 结果 | 两个实验室数据矛盾时选择性采信是确认偏误;差异本身是信息(本周 §9) | 成对设计 bridging,解释差异来源后再合并结论 |
| 3 | "2 倍 = 显著" 的依据缺失 | 显著性阈值必须相对方法历史变异(reference range 0.55×–1.9× 时 2.4 倍区分窗很窄,见 §八) | 与 historical range 对照 + log fold CI |
| 4 | 看完数据后设接受标准 | 事后标准失去统计与诚信意义(本周 §六) | 分析前预设接受标准并书面记录 |
| 5 | reference 未跑 | 无 reference 的 run 无法判断系统是否在控(本周 §七) | 该 run 只能算探索性数据,不应支持决策 |
| 6 | "细胞状态不好"未深究 | 细胞状态差本身就是数据质量红旗,可能解释 Lab B 偏低 | 记录细胞批次/传代,状态异常时重排实验 |
| 7 | 跳过正交确认直接进动物 | 单 assay 单 run 的 2.4 倍不足以支撑体内研究投入(本周 §十) | 正交 assay + 至少两个独立 run 后再决策 |
替代决策路径:本轮数据标记为"探索性";补做含 reference 的成对跨日实验(X、benchmark、reference 同板),预设接受标准与 log fold CI 报告;两实验室差异作为 bridging 计划输入而非择一采信。
十四、闭卷验收
- Fit-for-purpose 从什么开始?
- technical CV 代表什么?
- acceptance criteria 何时设?
- control chart 监测什么?
- EC50 为什么常用 log scale?
- 2-fold 是否必然有意义?
- transfer package 核心?
- bridging 为什么需 panel?
- orthogonal 与 replicate 区别?
- validated 是永久标签吗?
闭卷验收参考答案(先闭卷作答,再展开核对)
- Intended use 与错误决策风险:fit-for-purpose 从“结果将触发什么决策、错选/漏选的代价是什么、方法不确定性多大才不会改变决策”三个问题开始;高风险候选淘汰需要更强的重复和正交证据。
- 同一运行内孔间精密度:technical CV 只覆盖孔间变异,不含日间、操作者、仪器和跨实验室变异,不能单独支持候选决策。
- 看结果前:接受标准应在数据揭盲或查看候选排名之前预设并书面记录,事后标准失去统计与诚信意义。
- 漂移、step change 和方差变化:control chart 跟踪 reference 的 EC50/Emax/background/signal window 等指标,识别单点超限、连续单向偏移、lot 更换后的阶跃和方差逐渐增大。
- 跨数量级且比值意义更自然:EC50 常跨数量级并右偏,log scale 上 fold difference 即为对数差值,变异与置信区间的计算更合理。
- 不必然:2 倍差异需相对方法历史变异(如 reference 日间 0.5×–2× 漂移时单次 2 倍证据较弱)、log fold 置信区间、独立重复、Emax 与生物意义以及正交 assay 方向综合判断。
- SOP、试剂/细胞、设置、分析、历史范围和培训:transfer package 还应包含 critical reagents/cell bank 的 lot qualification、仪器设置、reference 历史范围、training run 与预设成功标准、raw data 与偏差/复测规则。
- 验证全范围和样本类型:bridging 需代表性 panel(reference、高/中/低 potency、阴性样本)在旧/新条件下并行比较绝对值、fold、ranking、Emax、precision 和 failure rate,而非只看单点 reference。
- 不同原理 vs 同一方法重复:orthogonal 用不同原理回答同一机制问题、降低共同伪差;replicate 只是同一 assay 内的技术重复。
- 不是:validated 只对定义的 analyte、matrix、range、平台和 intended use 成立;条件或用途变更后需重新评估或 bridging。
十五、本周最终交付物
选择一个现有细胞 assay,完成一页 assay card,并附一页 bridging plan:代表性样本、并行设计、预设接受标准、统计展示、失败处理和变更管理。