本页目录
循证 I · 研究设计阶梯与因果推断
医学要回答的核心因果问题只有一个形式:如果给这个人这个治疗,与不给相比,会怎样?——而这两件事永远无法同时观察。整个临床研究方法学就是围绕这个"反事实缺失"建立的补偿机制。🔗 研究生数学站统计学习线与数学站数理统计线是本页的形式化母体。
1. 反事实框架
对个体 \(i\),定义潜在结局 \(Y_i(1)\)(接受治疗)与 \(Y_i(0)\)(未接受)。个体因果效应 \(\tau_i = Y_i(1) - Y_i(0)\) 不可观测(只能看到其中一个)。
可估计的是平均因果效应:
朴素的组间比较给出的是:
两者相等当且仅当:可交换性(\(Y(1),Y(0) \perp A\),即处理分配与潜在结局独立)、正性(每个人都有非零概率接受两种处理)、一致性(干预定义明确)。
随机化的全部意义在于它以设计强制满足可交换性——包括对我们没测量、甚至没想到的混杂因素。这是随机化不可替代的原因:任何统计调整只能处理已测量的混杂。
2. 设计阶梯
| 设计 | 结构 | 主要威胁 | 适用 |
|---|---|---|---|
| 病例报告/系列 | 无对照 | 一切 | 生成假设、罕见事件 |
| 横断面 | 同时测暴露与结局 | 无法定时序 | 患病率、诊断准确性 |
| 病例对照 | 由结局回溯暴露 | 选择与回忆偏倚 | 罕见病、长潜伏期(效率高) |
| 队列 | 由暴露前瞻至结局 | 混杂、失访 | 罕见暴露、多结局、可算发病率 |
| 随机对照试验 RCT | 随机分配 | 外推性、依从、成本、伦理 | 因果推断的标准 |
| 系统综述/meta | 综合 | 受纳入研究质量限制 | 第 08 页 |
"阶梯"这个比喻要小心:它不是说 RCT 永远更好。对罕见结局、长期危害、真实世界依从性,大型队列常是唯一可行的证据来源;而对已明确的巨大效应,RCT 既不必要也不道德(下节)。
3. 什么时候不需要 RCT
降落伞论证:2003 年一篇著名的讽刺论文指出,没有 RCT 证明降落伞能防止跳伞死亡。它的正确教训不是"RCT 不重要",而是"当效应量极大、结局明确、无合理替代解释时,观察性证据已经足够"。
判据(Bradford Hill 视角的现代版):效应量巨大(如青霉素对细菌性心内膜炎、胰岛素对 1 型糖尿病酮症酸中毒、除颤对室颤)、结局在无干预时几乎必然发生、时间关系紧密、有可信机制。
但请注意这个论证被滥用的频率极高——几乎所有被后来 RCT 推翻的疗法,当初都被支持者形容为"显然有效,做试验不道德"。第 19、20 页给出一串这样的例子。"降落伞"的门槛应该是效应量至少一个数量级,而不是"我们都觉得它有用"。
4. RCT 的解剖:哪些细节决定可信度
| 要素 | 作用 | 失败形态 |
|---|---|---|
| 随机序列生成 | 可交换性 | 交替分配、按生日——可预测即失效 |
| 分配隐藏(allocation concealment) | 防止招募者操纵入组 | 比盲法更关键,且更常被忽略 |
| 盲法(患者/执行者/评估者) | 防止实施与测量偏倚 | 主观终点未盲 → 效应被夸大 |
| 意向性治疗分析 ITT | 保持随机化的可比性 | 只分析"完成者"(per-protocol)→ 重新引入混杂 |
| 失访 | 破坏随机化 | > 20% 失访通常严重威胁效度 |
| 预注册与统计分析计划 | 防止结果依赖的选择 | 换主要终点是最常见的问题 |
| 样本量与功效 | 避免假阴性 | 小样本"阴性"常被误读为"无效" |
ITT 值得多说一句:ITT 回答"提供这个治疗策略的效果"(政策相关),per-protocol 回答"实际服用的效果"(生物学相关)。两者都有意义,但只有 ITT 保持随机化。当依从性差异很大时,两者可能给出截然不同的结论,报告二者并解释差异是良好实践。
5. 对照组的选择:一个被严重低估的问题
"与什么比"往往决定了结论:
| 对照 | 问题 |
|---|---|
| 安慰剂 | 回答"有没有超过安慰剂效应";但当已有有效治疗时不使用它可能不道德 |
| 等待名单 | 系统性高估效应——它不控制关注、期望与自然史(🔗 心智与证据站第 17、20 页反复标注这一点) |
| 常规护理 | 定义模糊,跨研究不可比 |
| 活性对照(非劣效) | 需预设非劣效界值;界值定得宽 = 结论廉价 |
| 剂量不足的活性对照 | 一种隐蔽的操纵:用不足剂量的比较药 |
| 有生物活性的"安慰剂" | 如某降甘油三酯试验用矿物油作安慰剂,若其本身升高炎症标志物,则夸大了治疗组的相对获益 |
"读一篇 RCT 先看对照组"是本页最实用的一条操作规则。
6. 观察性研究的因果工具
当 RCT 不可行时,有一组方法可以逼近因果,但每一种都有其识别假设:
| 方法 | 核心思想 | 关键假设 |
|---|---|---|
| 多变量回归/分层 | 调整已测混杂 | 无未测混杂(无法检验) |
| 倾向评分(匹配/加权) | 平衡协变量分布 | 同上;只平衡已测变量 |
| 工具变量 | 找一个只通过暴露影响结局的变量 | 排他性限制(难验证) |
| 孟德尔随机化 | 用基因型作工具变量(随机分配于受孕时) | 多效性、连锁 |
| 断点回归 | 利用阈值附近的准随机分配 | 阈值附近可比 |
| 双重差分 | 政策变化前后 × 处理/对照 | 平行趋势 |
| 靶试验模拟(target trial emulation) | 把观察性分析明确对照到一个假想 RCT 的方案 | 使隐含假设显式化 |
靶试验框架是过去十年最重要的方法论进步:它强制研究者写清楚"时间零点、纳入标准、处理策略、随访、分析",从而暴露了观察性研究中最隐蔽的一类错误——不朽时间偏倚(第 07 页)。
孟德尔随机化的实际战果值得一提:它支持了 LDL 因果性(LDL 相关变异与心血管风险剂量相关,与他汀试验一致),也预示了某些疗法的失败(如 HDL 相关变异与心血管风险无因果关联,与后来 CETP 抑制剂试验的失败吻合)。这是观察性方法成功做出前瞻性预测的少数干净案例。
7. 一个被反复验证的教训:观察性研究与 RCT 的系统性分歧
最著名的案例是绝经激素治疗:大型观察性研究一致显示它降低冠心病风险约 40–50%;随后的随机试验(WHI 等)显示并无心血管保护,且在特定人群与时机下有害。主要解释是健康使用者偏倚(使用激素的女性系统性更健康、更富裕、更依从)。
另一批例子:β-胡萝卜素与维生素 E(观察性关联好,试验中无效甚至有害)、抗氧化剂、绝大多数膳食补充剂。
共同结构:"做某件被认为健康的事"这个行为本身与大量未测量的健康优势相关。统计调整无法消除它,因为它作用于未测量维度。
🔗 这条教训对你的研报工作直接相关:"采用某策略的机构表现更好"与"该策略有效"之间,隔着完全相同的健康使用者偏倚结构。
8. 外推性:内部有效 ≠ 对你的患者有效
一项 RCT 内部效度完美,仍需问:
- 纳入了谁? 试验人群常比真实患者更年轻、合并症更少、依从性更好(老年、肾功能不全、多病共存者被系统性排除);
- 干预在你的环境可复制吗?(术者经验、设备、随访强度);
- 对照组代表你的常规做法吗?
- 效应在亚组中是否可能不同?(第 07 页:亚组分析的陷阱)
- 随访够长吗? 尤其对预防性长期用药。
一条实用启发:相对效应(RR)在人群间通常比较稳定,而绝对效应(ARR)随基线风险大幅变化——所以外推时用相对效应 × 你的患者的基线风险,得到属于他的绝对获益。这正是下一页的主题。
参考与更新
复审记录:最后复审 2026-08-02;按六个月规则,下一次常规复审不晚于 2027-02-02。若安全信号、指南/监管更新或动态清单变化,则提前复审;具体适用地区以各条来源与当地最新版本为准。
- CONSORT 2010 statement(随机试验报告规范;2010;国际。)
- STROBE statement(观察性研究报告规范;2007;国际。)
下一页:效应量——把"有效"翻译成"多有效",本站核心装置 NNT 的定义与用法。