决策统计学基础——给非统计背景的决策人
目标不是教你推导公式,而是让你在评审实验数据时问对三个问题:效应有多大(方向与效应量)?不确定性多宽(置信区间/重复性)?这个证据够做什么决策? 所有示例数据为教学合成。
1. 为什么决策不应围绕 p 值
「p<0.05」只回答:如果真实差异为零,观察到当前或更极端数据的概率。它不回答:
- 差异有多大(效应量);
- 差异的范围在哪里(置信区间);
- 换一批实验/动物/donor 是否仍成立(重复性);
- 值不值得为它花钱(决策价值)。
小样本下 p 值极不稳定:n=3 时同一分子两次独立实验可能一次 p=0.04、一次 p=0.4,而效应量几乎没变。决策语言应当是"方向一致 + 效应量 X + 95% CI [a, b] + 独立重复次数"。
2. 描述统计:先分清四个数
| 统计量 | 回答什么 | 常见误用 |
|---|---|---|
| Mean ± SD | 个体围绕均值的散布 | 把 SD 当"实验误差"报告 |
| Mean ± SEM | 均值本身的精密度 | 用 SEM 画误差棒让差异"看起来显著" |
| Median (range/IQR) | 典型值与分布范围,偏态/小样本更稳健 | 正态默认下被忽略 |
| CV% | 相对变异,跨量纲比较(assay 常用) | 混淆技术 CV 与生物学 CV |
换算关系与直觉:
SEM = SD / √n # n 越大 SEM 越小,但个体变异没变
CV% = SD / mean × 100%
经验阈值(assay 精密度语境):同一板内技术复孔 CV <10–15% 常见;日间/操作者间 CV 是另一层级;小鼠药效个体 SD 常常与均值同量级——这是用个体点而非误差棒的核心理由(W19)。
3. 技术重复 vs 生物学重复(嵌套结构)
实验日期(生物学重复)
└── 板(生物学重复)
└── 孔(技术重复)
- 技术重复降低测量噪声,不增加结论的自由度;
- 生物学重复才支持外推("该分子在系统中效应为 X");
- 把 30 个孔当 n=30 是伪重复——统计单位是独立实验/独立动物/独立 donor,不是孔(W1、W10、W19 反复出现)。
4. 置信区间比 p 值更有用
以 W1 案例(合成数据)重做:A/B 的 log10 EC50 差 = 0.30(2 倍),跨日参考分子 log EC50 的 SD = 0.11。
95% CI for 差值(单次比较,t 分布,示例简化):
差值 = log10(EC50_B) − log10(EC50_A) = 0.301
SE = SD × √(1/nA + 1/nB) = 0.11 × √2 ≈ 0.156(每边单次测定)
95% CI ≈ 0.301 ± 2.78 × 0.156 ≈ [−0.13, +0.73]
读法:CI 跨过 0 → 单次实验不足以宣布方向;CI 上界 0.73(≈5.4 倍)→ 差异可能很大,值得补独立日期的配对实验。这与「p=0.10 不显著」的结论完全不同——CI 同时给出方向证据与不确定性宽度,直接映射到下一步决策。
5. EC50/亲和力为什么用 log scale
- EC50、KD、AUC 跨数量级,分布右偏;算术均值被大值主导;
- 标准实践:log10(或 ln)变换后做均值、SD、t 检验,报告几何均值与倍数 CI;
- 「2 倍差异」= log10 差 0.301,恰是 W1 案例的核心计算;
- fold change 的 CI 在 log scale 上对称,反变换后为 [ratio/÷k, ratio×k]。
6. 小样本检验怎么选(动物/细胞实验)
| 场景 | 合理选择 | 备注 |
|---|---|---|
| 两组小鼠 n=5–10,近似正态 | 非配对 t 检验(双侧,先验不设方向) | 报告效应量 + CI |
| 两组,明显偏态/有离群/删失 | Mann–Whitney U | 中位数差 + bootstrap CI 更直观 |
| 多剂量组 vs 对照 | ANOVA + Dunnett(只与对照比) | 不要两两 t 检验 |
| 多组两两比较 | Tukey / Holm 校正 | 不校正则假阳性按次数累积 |
| 同一动物给药前后 | 配对 t / Wilcoxon 符号秩 | 配对设计提高效率的前提是配对合理 |
| 计数/事件(响应率) | Fisher 精确检验 | 小 n 卡方不可靠 |
多重比较规则:方案预定义一个主要终点;次要/探索终点全部标注为探索性,其"显著"结果只用于生成假设(W18)。
7. 三类重复性证据
- 内部重复性:同一实验内独立单元(动物、donor)的一致方向;
- 外部重复性:不同日期/操作者/实验室的重现(W12 bridging 的统计学本质);
- 方法间一致性:正交 assay 的方向一致(W12、W13)。
决策权重:内部重复性 < 外部重复性 < 方法间一致性。单一层级再"显著",都不足以支撑 go/no-go。
8. 频率学派 vs 贝叶斯——决策人只需知道的事
| frequentist(p 值/CI) | Bayesian | |
|---|---|---|
| 回答 | 数据在"无差异"假设下的概率 | 给定数据后假设为真的概率 |
| 输出 | p 值、95% CI | 后验分布、 credible interval |
| 决策语言 | "差异的 95% CI 不含 0" | "B 优于 A 的概率 93%" |
| 常见坑 | 把 p 当"真差异概率" | 先验选择影响结论,需敏感性分析 |
「B 优于 A 的概率 95%」与「p=0.05」不是同一句话,数值上也不可换算。项目沟通中明确标注使用的是哪一种,避免把"不可拒绝零假设"说成"证明两者相同"。
9. 检验力与"阴性结论"
n=3 的 t 检验几乎不可能检出 <2 SD 的差异——"没测出差异"经常只是"没测"。评审阴性结论时先问:
- 该设计能检出多大差异(最小可检出效应)?
- 效应量估计的 CI 宽到什么程度?
- 结论应该写成"未观察到差异"而不是"证明无差异"。
这也是 W23 value of information 的统计基础:CI 太宽 = 信息价值高 = 值得补实验。
10. 决策人的一页速查
评审任何数据包,按顺序问五个问题:
- 单位与层级:n 是孔、动物、donor 还是独立日期?统计单位是什么?
- 效应量:差异多大?在 log scale 还是原始 scale?
- 不确定性:CI 多宽?跨不跨决策阈值(不只是跨 0)?
- 重复性:几个独立层级支持同一方向?
- 决策映射:这个证据宽度支持继续、加实验还是停止?
任一问题答不出,先补该信息再讨论结论。
与课程联动
- W1:2 倍差异与区分窗口的原始案例;
- W12:精密度、control chart 与 2-fold rule 的统计学基础;
- W16/W19:PK 与药效数据的个体 vs 均值;
- W18:动物研究的终点预定义与多重比较;
- W23:VoI 与加权决策;
- 公式换算:剂量、PK 与肿瘤药效速查 附录 B。
本参考为教学简化,不替代生物统计学专业评审;正式研究方案应包含统计学分析计划并由统计学家审阅。