本页目录
循证 III · 偏倚目录
偏倚是系统性误差,不会因样本量增大而消失——这是它与随机误差的根本区别,也是"大数据不能解决因果问题"的一句话总结。本页把临床研究中反复出现的偏倚整理成可检索的目录,并对每一条给出识别信号。
1. 三大类
选择偏倚(谁进入了研究/谁被比较)、信息偏倚(怎么测量的)、混杂(第三因素同时影响暴露与结局)。外加一类近年才被系统化的:与时间处理有关的偏倚。
2. 选择偏倚
| 名称 | 机制 | 识别信号 |
|---|---|---|
| 健康使用者偏倚 | 采用预防措施者本身更健康 | 观察性研究中"任何预防行为都有效" |
| 健康工人效应 | 在职人群比一般人群健康 | 职业暴露研究低估危害 |
| Berkson 悖论 | 住院人群中两种病看似负相关(因为各自都增加住院概率) | 单中心住院样本 |
| 易感者耗竭(depletion of susceptibles) | 长期用药者是已耐受者 | 流行用药的"长期安全"假象 |
| 失访偏倚 | 失访与结局相关 | 失访率高且组间不均 |
| 志愿者偏倚 | 自愿参加者不同于总体 | 筛查项目的参与者 |
| 谱偏倚 | 研究人群病情谱与应用人群不同 | 诊断准确性研究(第 02 页) |
| 验证偏倚 | 只有阳性者做金标准 | 同上 |
Berkson 悖论值得展开一句,因为它极隐蔽:假设疾病 A 与疾病 B 各自独立地增加住院概率。在住院患者中,患 A 会"预测"不患 B(因为已有 A 就足以解释住院)。结果:单纯基于住院样本得出的关联可能完全是假的,甚至方向相反。🔗 这与选择性样本上的相关性估计问题同构(数学站统计线的碰撞变量 collider)。
3. 信息偏倚
| 名称 | 机制 | 对策 |
|---|---|---|
| 回忆偏倚 | 患病者更努力回忆暴露(病例对照的核心弱点) | 用客观记录(处方数据库) |
| 观察者/确认偏倚 | 判读者知道分组 | 盲法判读 |
| 诊断怀疑偏倚 | 已知暴露者被查得更仔细 | 标准化随访 |
| 错分(misclassification) | 测量不准 | 非差异性错分 → 效应向零偏(保守);差异性错分 → 方向不可预测(危险) |
| Hawthorne 效应 | 被观察改变行为 | 对照组同等关注 |
| 社会期许偏倚 | 自报行为(吸烟、饮酒、依从)系统性美化 | 客观指标 |
"非差异性错分使效应向零偏"是一条有用的定理:如果一项研究测量粗糙但仍发现了效应,真实效应通常更大;反之,一项粗糙研究的"阴性"结果说服力很弱。
4. 混杂
定义:\(C\) 同时影响暴露 \(A\) 与结局 \(Y\),且不在 \(A \to Y\) 的因果路径上(若在路径上,它是中介,调整它会遮蔽真实效应)。
经典例子:咖啡与肺癌的关联由吸烟混杂。
处理方法:设计阶段——随机化(最彻底)、限制、匹配;分析阶段——分层、多变量回归、倾向评分、工具变量(第 05 页)。
两条常被违反的规则:
- 不要调整中介变量(如研究肥胖对心血管的影响时调整血压——血压是机制的一部分,调整它会低估肥胖的总效应);
- 不要调整碰撞变量(collider:被暴露与结局共同影响的变量)——调整它会凭空制造关联。这是"多放几个协变量总没坏处"这一直觉的致命反例。
残余混杂永远存在:测量误差、未测量因素、分类过粗。这就是为什么观察性研究的中等效应(RR 1.2–1.5)通常不足以支持因果结论,而 RR > 3 的稳健关联更难被残余混杂完全解释。
5. 与时间有关的偏倚(近年最常被发现的一类)
1. 不朽时间偏倚(immortal time bias)——最重要的一个。
机制:把"从时间零点到暴露开始"的这段时间错误地算给暴露组。在这段时间里,患者按定义必须存活(否则不会被归为暴露组),因此暴露组凭空获得一段"不朽时间"。
典型案例:多项观察性研究曾报告"接受某药物治疗的患者生存更好",重新分析后发现效应大部分或全部来自不朽时间。同类结构还出现在"依从性好的患者结局更好"(包括安慰剂组的依从者也结局更好——这本身证明依从性是健康的指标而非原因)。
识别信号:暴露状态在随访开始后一段时间才确定。对策:靶试验模拟(第 05 页),把时间零点与处理策略定义清楚,或用时依协变量分析。
2. 领先时间偏倚(第 03 页);3. 幸存者偏倚;4. 时间窗偏倚(暴露窗定义不对称)。
6. 发表与报告层面的偏倚
| 名称 | 机制 |
|---|---|
| 发表偏倚 | 阳性结果更容易发表(尤其小型研究) |
| 结局报告偏倚 | 只报告显著的终点 |
| 时滞偏倚 | 阴性结果发表更晚 |
| 语言/引用偏倚 | 阳性结果更多被引用、被译成英文 |
| 重复发表 | 同一数据多次发表 → meta 分析重复计数 |
| 资助偏倚 | 行业资助的试验更可能得出有利于资助方的结论(多项 meta 研究一致支持这一点) |
对策:强制性试验注册(ClinicalTrials.gov 等)与结果上报、发表前预注册分析计划、meta 分析中的漏斗图与统计检验(第 08 页)。注册制度确实起了作用——一项被广泛引用的分析显示,某资助机构要求注册后,心血管试验报告阳性主要结局的比例大幅下降。
7. 数据分析阶段的自由度
同一份数据,不同的合理分析选择可以得出不同结论("研究者自由度"、"分叉路径花园")。选择包括:结局定义、协变量集合、离群值处理、亚组划分、时间窗。
多分析者研究(同一数据交给多个独立团队分析)显示,结论的离散程度远超一般人的预期——这是复现危机在方法学上的核心发现之一(🔗 心智与证据站第 03 页给出心理学侧的完整证据)。
对策:预注册、敏感性分析(报告"如果换一种合理选择,结论会怎样")、公开数据与代码。
8. 亚组分析:为什么它几乎总是错的
问题:亚组多 → 多重比较;亚组样本小 → 功效不足且估计不稳;事后划分的亚组容易被数据驱动。
著名的教学例子:ISIS-2 试验的作者应审稿人对亚组分析的要求,按星座划分亚组,结果显示阿司匹林对双子座与天秤座患者"无效"甚至有害,对其他星座有效。这是用一个荒谬结果来演示方法学问题的经典手法。
可信亚组效应的判据:预先设定、数量少、有先验生物学理由、交互作用检验显著(而非"一个亚组显著另一个不显著")、在其他试验中可复现、效应量差异大。
最后一条要强调:"A 组 p=0.04、B 组 p=0.09" 不构成亚组差异的证据——必须检验交互作用本身。这是医学文献中最常见的统计错误之一。
9. 一张读文献的检查表
- 随机化了吗?分配隐藏了吗?
- 盲法覆盖了谁?主要终点是否主观?
- ITT 分析吗?失访多少?
- 主要终点是预注册的那个吗?(去 ClinicalTrials.gov 对一下——这一步比想象中更常发现问题)
- 对照组是什么?
- 报告了绝对效应吗?
- 亚组结论是预设的吗?
- 谁出的钱?
- 观察性研究:暴露状态何时确定?有没有不朽时间?
参考与更新
复审记录:最后复审 2026-08-02;按六个月规则,下一次常规复审不晚于 2027-02-02。若安全信号、指南/监管更新或动态清单变化,则提前复审;具体适用地区以各条来源与当地最新版本为准。
- Cochrane Risk of Bias 2(随机试验偏倚评估;当前资源页面;国际。)
- Cochrane Handbook(系统综述与偏倚判断方法;当前版本页面;国际。)
下一页:把多项研究合起来看——系统综述、meta 分析与 GRADE 分级。