← 返回课程首页

决策统计学基础——给非统计背景的决策人

目标不是教你推导公式,而是让你在评审实验数据时问对三个问题:效应有多大(方向与效应量)?不确定性多宽(置信区间/重复性)?这个证据够做什么决策? 所有示例数据为教学合成。

1. 为什么决策不应围绕 p 值

「p<0.05」只回答:如果真实差异为零,观察到当前或更极端数据的概率。它不回答:

小样本下 p 值极不稳定:n=3 时同一分子两次独立实验可能一次 p=0.04、一次 p=0.4,而效应量几乎没变。决策语言应当是"方向一致 + 效应量 X + 95% CI [a, b] + 独立重复次数"

2. 描述统计:先分清四个数

统计量 回答什么 常见误用
Mean ± SD 个体围绕均值的散布 把 SD 当"实验误差"报告
Mean ± SEM 均值本身的精密度 用 SEM 画误差棒让差异"看起来显著"
Median (range/IQR) 典型值与分布范围,偏态/小样本更稳健 正态默认下被忽略
CV% 相对变异,跨量纲比较(assay 常用) 混淆技术 CV 与生物学 CV

换算关系与直觉:

SEM = SD / √n          # n 越大 SEM 越小,但个体变异没变
CV% = SD / mean × 100%

经验阈值(assay 精密度语境):同一板内技术复孔 CV <10–15% 常见;日间/操作者间 CV 是另一层级;小鼠药效个体 SD 常常与均值同量级——这是用个体点而非误差棒的核心理由(W19)。

3. 技术重复 vs 生物学重复(嵌套结构)

实验日期(生物学重复)
 └── 板(生物学重复)
      └── 孔(技术重复)

4. 置信区间比 p 值更有用

以 W1 案例(合成数据)重做:A/B 的 log10 EC50 差 = 0.30(2 倍),跨日参考分子 log EC50 的 SD = 0.11。

95% CI for 差值(单次比较,t 分布,示例简化):

差值 = log10(EC50_B) − log10(EC50_A) = 0.301
SE  = SD × √(1/nA + 1/nB) = 0.11 × √2 ≈ 0.156(每边单次测定)
95% CI ≈ 0.301 ± 2.78 × 0.156 ≈ [−0.13, +0.73]

读法:CI 跨过 0 → 单次实验不足以宣布方向;CI 上界 0.73(≈5.4 倍)→ 差异可能很大,值得补独立日期的配对实验。这与「p=0.10 不显著」的结论完全不同——CI 同时给出方向证据与不确定性宽度,直接映射到下一步决策

5. EC50/亲和力为什么用 log scale

6. 小样本检验怎么选(动物/细胞实验)

场景 合理选择 备注
两组小鼠 n=5–10,近似正态 非配对 t 检验(双侧,先验不设方向) 报告效应量 + CI
两组,明显偏态/有离群/删失 Mann–Whitney U 中位数差 + bootstrap CI 更直观
多剂量组 vs 对照 ANOVA + Dunnett(只与对照比) 不要两两 t 检验
多组两两比较 Tukey / Holm 校正 不校正则假阳性按次数累积
同一动物给药前后 配对 t / Wilcoxon 符号秩 配对设计提高效率的前提是配对合理
计数/事件(响应率) Fisher 精确检验 小 n 卡方不可靠

多重比较规则:方案预定义一个主要终点;次要/探索终点全部标注为探索性,其"显著"结果只用于生成假设(W18)。

7. 三类重复性证据

  1. 内部重复性:同一实验内独立单元(动物、donor)的一致方向;
  2. 外部重复性:不同日期/操作者/实验室的重现(W12 bridging 的统计学本质);
  3. 方法间一致性:正交 assay 的方向一致(W12、W13)。

决策权重:内部重复性 < 外部重复性 < 方法间一致性。单一层级再"显著",都不足以支撑 go/no-go。

8. 频率学派 vs 贝叶斯——决策人只需知道的事

frequentist(p 值/CI) Bayesian
回答 数据在"无差异"假设下的概率 给定数据后假设为真的概率
输出 p 值、95% CI 后验分布、 credible interval
决策语言 "差异的 95% CI 不含 0" "B 优于 A 的概率 93%"
常见坑 把 p 当"真差异概率" 先验选择影响结论,需敏感性分析

「B 优于 A 的概率 95%」与「p=0.05」不是同一句话,数值上也不可换算。项目沟通中明确标注使用的是哪一种,避免把"不可拒绝零假设"说成"证明两者相同"。

9. 检验力与"阴性结论"

n=3 的 t 检验几乎不可能检出 <2 SD 的差异——"没测出差异"经常只是"没测"。评审阴性结论时先问:

这也是 W23 value of information 的统计基础:CI 太宽 = 信息价值高 = 值得补实验。

10. 决策人的一页速查

评审任何数据包,按顺序问五个问题:

  1. 单位与层级:n 是孔、动物、donor 还是独立日期?统计单位是什么?
  2. 效应量:差异多大?在 log scale 还是原始 scale?
  3. 不确定性:CI 多宽?跨不跨决策阈值(不只是跨 0)?
  4. 重复性:几个独立层级支持同一方向?
  5. 决策映射:这个证据宽度支持继续、加实验还是停止?

任一问题答不出,先补该信息再讨论结论。

与课程联动

本参考为教学简化,不替代生物统计学专业评审;正式研究方案应包含统计学分析计划并由统计学家审阅。