本页目录

前沿 I · AI 进入临床:证据现状

⚠️ 高风险内容,最后复审于 2026-08-02。本站更新最快的一页。 本页的写法与前二十一页完全一致:不问"AI 有多强",只问"有没有证据表明它改善了患者结局,以及在什么条件下"。 这个标准同时挡住了炒作与不必要的怀疑。

地区、年份与监管边界:监管示例以美国 FDA 为范围;其 AI-enabled medical device 清单 是动态、非穷尽且定期更新的美国市场授权清单,正文不固定写设备数量。WHO 2021 伦理建议是全球框架,不等于任何国家的上市许可;其他地区的审批、数据保护和临床验证规则可能不同。

1. 三个层次,证据强度递减

层次 典型任务 证据现状
1. 感知类(影像、病理、心电、内镜) 检出病灶、分类 已有获批产品与前瞻研究;部分领域有 RCT
2. 推理类(鉴别诊断、处置建议) LLM 辅助诊断与管理 有 RCT,但多为情景题(vignette),结局是评分而非患者结局
3. 系统类(分诊、文书、风险预测) 减少行政负担、预警 应用最广,结局证据最弱

层次 1 是唯一有较成熟证据的一类:结肠镜的计算机辅助检出(CADe)在多项 RCT 中提高腺瘤检出率——这是少见的、以真实患者为对象的随机证据但请立刻套用第 09 页腺瘤检出率是替代终点,"降低结直肠癌死亡率"是硬终点,后者尚未证明。且有分析指出增加的多为微小腺瘤,其临床意义有限,同时增加了随访负担。

2. 层次 2:LLM 辅助诊断的 RCT 说了什么

截至 2026-08-02,已核验的随机试验结果比两边的宣传都更细致

1. 单纯给医生 LLM 工具,收益不必然出现。 多项情景题试验报告了管理推理任务的改善,但效应大小依赖题目、模型版本、对照资源与交互设计;诊断准确性上的改善不总是出现,部分试验中"LLM 单独作答"的表现甚至优于"医生 + LLM"。这一现象本身极其重要:它说明人机结合不是自动增益,交互方式才是关键变量。

2. AI 素养训练似乎是有效的调节变量。 在一项对完成 20 小时 AI 素养课程的医生进行的随机试验中,LLM 辅助使临床情景题的诊断推理表现有所提升;但该结果来自特定课程、受训人群和情景题,不能把单一百分点外推为临床结局或通用效应

3. 自动化偏倚(automation bias)是可测量的真实风险。 同一类受过训练的医生,当 LLM 给出的建议中被故意植入临床上重要的错误时,诊断推理得分显著下降;下降幅度依赖错误设计、任务和交互,不能外推成固定的百分点效应换言之:受过 AI 素养训练的医生,仍然会被自信的错误建议带偏。

4. 真实世界的实用型试验尚未显示结局改善。 一项在肯尼亚基层医疗机构进行的整群随机实用型试验(这是设计上最接近真实场景的一类),未发现 LLM 辅助显著降低 14 天治疗失败率

把四条放在一起的结论情景题上的收益是真实的,但它是替代终点;到目前为止,在真实患者结局上的随机证据仍是中性的。 这与本站前面讲过的每一个新技术引入的模式完全一致(第 09 页)。

3. 评价一篇"AI 超过医生"论文的检查清单

这是本页最实用的产物,每一条都对应本站前面的某一页:

  1. 终点是什么? 诊断准确率 / 情景题得分 = 替代终点;患者结局 = 硬终点(第 09 页);
  2. 对照是什么? "AI vs 医生单独" 常常不是临床相关的比较——真实问题是"医生 + AI vs 医生"(第 05 页);
  3. 数据是回顾性还是前瞻性? 绝大多数是回顾性数据集;
  4. 验证集独立吗? 同院同设备的内部验证会严重高估外部验证的性能下降通常很明显
  5. 谱偏倚:训练与评估集中的病例是否比真实工作流中更"干净"(第 02 页);
  6. 患病率与 PPV:在真实低患病率场景中,报告的高 AUC 会转化为什么样的 PPV?(第 02 页算术)
  7. 人机交互怎么设计的? 输出置信度、给不给理由、能否被覆盖——这些细节决定自动化偏倚的大小
  8. 谁做的研究、谁出的钱?(第 07 页)
  9. 有没有前瞻性 RCT 与结局终点? 若无,结论只能是"有前景"。

4. 结构性风险

1. 自动化偏倚与技能退化:上文的 RCT 已经量化了前者;后者(长期依赖导致独立判断能力下降)目前缺乏长期数据,但在其他领域(航空、放射)有先例

2. 分布偏移:模型在部署环境与训练环境不同时性能下降;且医疗数据分布随时间漂移(编码规则、检验方法、疾病谱变化)。这要求持续监测而非一次性验证。

3. 公平性:训练数据的人群构成决定性能边界。已有多个记录在案的案例:以医疗费用作为"健康需求"代理变量的风险预测算法,系统性低估了某些群体的需求——因为该群体历史上获得的医疗支出较少,而算法把"花钱少"读成了"更健康"这是一个纯粹的替代终点错误(第 09 页):用可测量的代理量替换了真正关心的量。

4. 谄媚性(sycophancy):语言模型倾向于同意用户。在临床场景中,这意味着它可能强化医生已有的错误假设——恰好是第 04 页确认偏差的自动化放大器

5. 责任与监管自适应(持续学习)系统的监管框架仍在建立中;责任归属、知情同意、以及模型更新后是否需要重新验证,都尚无统一答案。

5. AI 已经确实有用的地方

为了不落入无差别怀疑,也要说清哪些是真的

6. 本页的立场

用一句话概括目前的证据支持"AI 作为特定任务上的工具",不支持"AI 作为诊断决策的替代";而人机结合的收益不是自动的,它取决于训练、交互设计与监测——这三者本身需要被随机试验检验,而不是被假定。

对读者最实用的一条如果你用 LLM 查自己的健康问题,请记住那批 RCT 的核心发现——它会自信地给出错误建议,而受过专门训练的医生也会被这种自信带偏。 把它当作"帮你准备问题的工具",而不是"给你答案的工具"。

参考与更新

复审记录:最后复审 2026-08-02;按六个月规则,下一次常规复审不晚于 2027-02-02。FDA 清单等动态内容如有更新则提前复审;具体适用地区以各条来源与当地最新版本为准。


下一页:成本效果与 QALY——把"值不值得"从个体层面推到系统层面。