本页目录

循证 III · 偏倚目录

偏倚是系统性误差,不会因样本量增大而消失——这是它与随机误差的根本区别,也是"大数据不能解决因果问题"的一句话总结。本页把临床研究中反复出现的偏倚整理成可检索的目录,并对每一条给出识别信号

1. 三大类

选择偏倚(谁进入了研究/谁被比较)、信息偏倚(怎么测量的)、混杂(第三因素同时影响暴露与结局)。外加一类近年才被系统化的:与时间处理有关的偏倚。

2. 选择偏倚

名称 机制 识别信号
健康使用者偏倚 采用预防措施者本身更健康 观察性研究中"任何预防行为都有效"
健康工人效应 在职人群比一般人群健康 职业暴露研究低估危害
Berkson 悖论 住院人群中两种病看似负相关(因为各自都增加住院概率) 单中心住院样本
易感者耗竭(depletion of susceptibles) 长期用药者是已耐受者 流行用药的"长期安全"假象
失访偏倚 失访与结局相关 失访率高且组间不均
志愿者偏倚 自愿参加者不同于总体 筛查项目的参与者
谱偏倚 研究人群病情谱与应用人群不同 诊断准确性研究(第 02 页)
验证偏倚 只有阳性者做金标准 同上

Berkson 悖论值得展开一句,因为它极隐蔽:假设疾病 A 与疾病 B 各自独立地增加住院概率。在住院患者中,患 A 会"预测"不患 B(因为已有 A 就足以解释住院)。结果:单纯基于住院样本得出的关联可能完全是假的,甚至方向相反。🔗 这与选择性样本上的相关性估计问题同构(数学站统计线的碰撞变量 collider)。

3. 信息偏倚

名称 机制 对策
回忆偏倚 患病者更努力回忆暴露(病例对照的核心弱点) 用客观记录(处方数据库)
观察者/确认偏倚 判读者知道分组 盲法判读
诊断怀疑偏倚 已知暴露者被查得更仔细 标准化随访
错分(misclassification) 测量不准 非差异性错分 → 效应向零偏(保守)差异性错分 → 方向不可预测(危险)
Hawthorne 效应 被观察改变行为 对照组同等关注
社会期许偏倚 自报行为(吸烟、饮酒、依从)系统性美化 客观指标

"非差异性错分使效应向零偏"是一条有用的定理如果一项研究测量粗糙但仍发现了效应,真实效应通常更大反之,一项粗糙研究的"阴性"结果说服力很弱

4. 混杂

定义\(C\) 同时影响暴露 \(A\) 与结局 \(Y\),且不在 \(A \to Y\) 的因果路径上(若在路径上,它是中介,调整它会遮蔽真实效应)。

经典例子:咖啡与肺癌的关联由吸烟混杂。

处理方法设计阶段——随机化(最彻底)、限制、匹配;分析阶段——分层、多变量回归、倾向评分、工具变量(第 05 页)。

两条常被违反的规则

  1. 不要调整中介变量(如研究肥胖对心血管的影响时调整血压——血压是机制的一部分,调整它会低估肥胖的总效应);
  2. 不要调整碰撞变量(collider:被暴露与结局共同影响的变量)——调整它会凭空制造关联。这是"多放几个协变量总没坏处"这一直觉的致命反例。

残余混杂永远存在:测量误差、未测量因素、分类过粗。这就是为什么观察性研究的中等效应(RR 1.2–1.5)通常不足以支持因果结论,而 RR > 3 的稳健关联更难被残余混杂完全解释。

5. 与时间有关的偏倚(近年最常被发现的一类)

1. 不朽时间偏倚(immortal time bias)——最重要的一个

机制:把"从时间零点到暴露开始"的这段时间错误地算给暴露组。在这段时间里,患者按定义必须存活(否则不会被归为暴露组),因此暴露组凭空获得一段"不朽时间"

典型案例:多项观察性研究曾报告"接受某药物治疗的患者生存更好",重新分析后发现效应大部分或全部来自不朽时间。同类结构还出现在"依从性好的患者结局更好"(包括安慰剂组的依从者也结局更好——这本身证明依从性是健康的指标而非原因)。

识别信号暴露状态在随访开始后一段时间才确定对策:靶试验模拟(第 05 页),把时间零点与处理策略定义清楚,或用时依协变量分析。

2. 领先时间偏倚(第 03 页);3. 幸存者偏倚4. 时间窗偏倚(暴露窗定义不对称)。

6. 发表与报告层面的偏倚

名称 机制
发表偏倚 阳性结果更容易发表(尤其小型研究)
结局报告偏倚 只报告显著的终点
时滞偏倚 阴性结果发表更晚
语言/引用偏倚 阳性结果更多被引用、被译成英文
重复发表 同一数据多次发表 → meta 分析重复计数
资助偏倚 行业资助的试验更可能得出有利于资助方的结论(多项 meta 研究一致支持这一点)

对策强制性试验注册(ClinicalTrials.gov 等)与结果上报发表前预注册分析计划、meta 分析中的漏斗图与统计检验(第 08 页)。注册制度确实起了作用——一项被广泛引用的分析显示,某资助机构要求注册后,心血管试验报告阳性主要结局的比例大幅下降。

7. 数据分析阶段的自由度

同一份数据,不同的合理分析选择可以得出不同结论("研究者自由度"、"分叉路径花园")。选择包括:结局定义、协变量集合、离群值处理、亚组划分、时间窗。

多分析者研究(同一数据交给多个独立团队分析)显示,结论的离散程度远超一般人的预期——这是复现危机在方法学上的核心发现之一(🔗 心智与证据站第 03 页给出心理学侧的完整证据)。

对策:预注册、敏感性分析(报告"如果换一种合理选择,结论会怎样")、公开数据与代码。

8. 亚组分析:为什么它几乎总是错的

问题:亚组多 → 多重比较;亚组样本小 → 功效不足且估计不稳;事后划分的亚组容易被数据驱动

著名的教学例子ISIS-2 试验的作者应审稿人对亚组分析的要求,按星座划分亚组,结果显示阿司匹林对双子座与天秤座患者"无效"甚至有害,对其他星座有效。这是用一个荒谬结果来演示方法学问题的经典手法。

可信亚组效应的判据预先设定数量少有先验生物学理由交互作用检验显著(而非"一个亚组显著另一个不显著")、在其他试验中可复现效应量差异大

最后一条要强调"A 组 p=0.04、B 组 p=0.09" 不构成亚组差异的证据——必须检验交互作用本身。这是医学文献中最常见的统计错误之一。

9. 一张读文献的检查表

  1. 随机化了吗?分配隐藏了吗?
  2. 盲法覆盖了谁?主要终点是否主观?
  3. ITT 分析吗?失访多少?
  4. 主要终点是预注册的那个吗?(去 ClinicalTrials.gov 对一下——这一步比想象中更常发现问题
  5. 对照组是什么?
  6. 报告了绝对效应吗?
  7. 亚组结论是预设的吗?
  8. 谁出的钱?
  9. 观察性研究:暴露状态何时确定?有没有不朽时间?

参考与更新

复审记录:最后复审 2026-08-02;按六个月规则,下一次常规复审不晚于 2027-02-02。若安全信号、指南/监管更新或动态清单变化,则提前复审;具体适用地区以各条来源与当地最新版本为准。


下一页:把多项研究合起来看——系统综述、meta 分析与 GRADE 分级。