本页目录

循证 I · 研究设计阶梯与因果推断

医学要回答的核心因果问题只有一个形式:如果给这个人这个治疗,与不给相比,会怎样?——而这两件事永远无法同时观察。整个临床研究方法学就是围绕这个"反事实缺失"建立的补偿机制。🔗 研究生数学站统计学习线与数学站数理统计线是本页的形式化母体。

1. 反事实框架

对个体 \(i\),定义潜在结局 \(Y_i(1)\)(接受治疗)与 \(Y_i(0)\)(未接受)。个体因果效应 \(\tau_i = Y_i(1) - Y_i(0)\) 不可观测(只能看到其中一个)。

可估计的是平均因果效应

\[ATE = E[Y(1) - Y(0)]\]

朴素的组间比较给出的是

\[E[Y \mid A=1] - E[Y \mid A=0]\]

两者相等当且仅当可交换性\(Y(1),Y(0) \perp A\),即处理分配与潜在结局独立)、正性(每个人都有非零概率接受两种处理)、一致性(干预定义明确)。

随机化的全部意义在于它以设计强制满足可交换性——包括对我们没测量、甚至没想到的混杂因素。这是随机化不可替代的原因:任何统计调整只能处理已测量的混杂。

2. 设计阶梯

设计 结构 主要威胁 适用
病例报告/系列 无对照 一切 生成假设、罕见事件
横断面 同时测暴露与结局 无法定时序 患病率、诊断准确性
病例对照 由结局回溯暴露 选择与回忆偏倚 罕见病、长潜伏期(效率高)
队列 由暴露前瞻至结局 混杂、失访 罕见暴露、多结局、可算发病率
随机对照试验 RCT 随机分配 外推性、依从、成本、伦理 因果推断的标准
系统综述/meta 综合 受纳入研究质量限制 第 08 页

"阶梯"这个比喻要小心它不是说 RCT 永远更好。对罕见结局、长期危害、真实世界依从性,大型队列常是唯一可行的证据来源;而对已明确的巨大效应,RCT 既不必要也不道德(下节)。

3. 什么时候不需要 RCT

降落伞论证:2003 年一篇著名的讽刺论文指出,没有 RCT 证明降落伞能防止跳伞死亡。它的正确教训不是"RCT 不重要",而是"当效应量极大、结局明确、无合理替代解释时,观察性证据已经足够"。

判据(Bradford Hill 视角的现代版)效应量巨大(如青霉素对细菌性心内膜炎、胰岛素对 1 型糖尿病酮症酸中毒、除颤对室颤)、结局在无干预时几乎必然发生时间关系紧密有可信机制

但请注意这个论证被滥用的频率极高——几乎所有被后来 RCT 推翻的疗法,当初都被支持者形容为"显然有效,做试验不道德"。第 19、20 页给出一串这样的例子。"降落伞"的门槛应该是效应量至少一个数量级,而不是"我们都觉得它有用"。

4. RCT 的解剖:哪些细节决定可信度

要素 作用 失败形态
随机序列生成 可交换性 交替分配、按生日——可预测即失效
分配隐藏(allocation concealment) 防止招募者操纵入组 比盲法更关键,且更常被忽略
盲法(患者/执行者/评估者) 防止实施与测量偏倚 主观终点未盲 → 效应被夸大
意向性治疗分析 ITT 保持随机化的可比性 只分析"完成者"(per-protocol)→ 重新引入混杂
失访 破坏随机化 > 20% 失访通常严重威胁效度
预注册与统计分析计划 防止结果依赖的选择 换主要终点是最常见的问题
样本量与功效 避免假阴性 小样本"阴性"常被误读为"无效"

ITT 值得多说一句ITT 回答"提供这个治疗策略的效果"(政策相关),per-protocol 回答"实际服用的效果"(生物学相关)两者都有意义,但只有 ITT 保持随机化。当依从性差异很大时,两者可能给出截然不同的结论,报告二者并解释差异是良好实践

5. 对照组的选择:一个被严重低估的问题

"与什么比"往往决定了结论

对照 问题
安慰剂 回答"有没有超过安慰剂效应";但当已有有效治疗时不使用它可能不道德
等待名单 系统性高估效应——它不控制关注、期望与自然史(🔗 心智与证据站第 17、20 页反复标注这一点)
常规护理 定义模糊,跨研究不可比
活性对照(非劣效) 需预设非劣效界值;界值定得宽 = 结论廉价
剂量不足的活性对照 一种隐蔽的操纵:用不足剂量的比较药
有生物活性的"安慰剂" 如某降甘油三酯试验用矿物油作安慰剂,若其本身升高炎症标志物,则夸大了治疗组的相对获益

"读一篇 RCT 先看对照组"是本页最实用的一条操作规则。

6. 观察性研究的因果工具

当 RCT 不可行时,有一组方法可以逼近因果,但每一种都有其识别假设

方法 核心思想 关键假设
多变量回归/分层 调整已测混杂 无未测混杂(无法检验)
倾向评分(匹配/加权) 平衡协变量分布 同上;只平衡已测变量
工具变量 找一个只通过暴露影响结局的变量 排他性限制(难验证)
孟德尔随机化 用基因型作工具变量(随机分配于受孕时) 多效性、连锁
断点回归 利用阈值附近的准随机分配 阈值附近可比
双重差分 政策变化前后 × 处理/对照 平行趋势
靶试验模拟(target trial emulation) 把观察性分析明确对照到一个假想 RCT 的方案 使隐含假设显式化

靶试验框架是过去十年最重要的方法论进步:它强制研究者写清楚"时间零点、纳入标准、处理策略、随访、分析",从而暴露了观察性研究中最隐蔽的一类错误——不朽时间偏倚(第 07 页)。

孟德尔随机化的实际战果值得一提:它支持了 LDL 因果性(LDL 相关变异与心血管风险剂量相关,与他汀试验一致),也预示了某些疗法的失败(如 HDL 相关变异与心血管风险无因果关联,与后来 CETP 抑制剂试验的失败吻合)。这是观察性方法成功做出前瞻性预测的少数干净案例。

7. 一个被反复验证的教训:观察性研究与 RCT 的系统性分歧

最著名的案例是绝经激素治疗:大型观察性研究一致显示它降低冠心病风险约 40–50%;随后的随机试验(WHI 等)显示并无心血管保护,且在特定人群与时机下有害。主要解释是健康使用者偏倚(使用激素的女性系统性更健康、更富裕、更依从)。

另一批例子:β-胡萝卜素与维生素 E(观察性关联好,试验中无效甚至有害)、抗氧化剂、绝大多数膳食补充剂。

共同结构"做某件被认为健康的事"这个行为本身与大量未测量的健康优势相关统计调整无法消除它,因为它作用于未测量维度。

🔗 这条教训对你的研报工作直接相关"采用某策略的机构表现更好"与"该策略有效"之间,隔着完全相同的健康使用者偏倚结构。

8. 外推性:内部有效 ≠ 对你的患者有效

一项 RCT 内部效度完美,仍需问:

  1. 纳入了谁? 试验人群常比真实患者更年轻、合并症更少、依从性更好老年、肾功能不全、多病共存者被系统性排除);
  2. 干预在你的环境可复制吗?(术者经验、设备、随访强度);
  3. 对照组代表你的常规做法吗?
  4. 效应在亚组中是否可能不同?(第 07 页:亚组分析的陷阱)
  5. 随访够长吗? 尤其对预防性长期用药。

一条实用启发相对效应(RR)在人群间通常比较稳定,而绝对效应(ARR)随基线风险大幅变化——所以外推时用相对效应 × 你的患者的基线风险,得到属于他的绝对获益。这正是下一页的主题。

参考与更新

复审记录:最后复审 2026-08-02;按六个月规则,下一次常规复审不晚于 2027-02-02。若安全信号、指南/监管更新或动态清单变化,则提前复审;具体适用地区以各条来源与当地最新版本为准。


下一页:效应量——把"有效"翻译成"多有效",本站核心装置 NNT 的定义与用法。