本页目录
前沿 I · AI 进入临床:证据现状
⚠️ 高风险内容,最后复审于 2026-08-02。本站更新最快的一页。 本页的写法与前二十一页完全一致:不问"AI 有多强",只问"有没有证据表明它改善了患者结局,以及在什么条件下"。 这个标准同时挡住了炒作与不必要的怀疑。
地区、年份与监管边界:监管示例以美国 FDA 为范围;其 AI-enabled medical device 清单 是动态、非穷尽且定期更新的美国市场授权清单,正文不固定写设备数量。WHO 2021 伦理建议是全球框架,不等于任何国家的上市许可;其他地区的审批、数据保护和临床验证规则可能不同。
1. 三个层次,证据强度递减
| 层次 | 典型任务 | 证据现状 |
|---|---|---|
| 1. 感知类(影像、病理、心电、内镜) | 检出病灶、分类 | 已有获批产品与前瞻研究;部分领域有 RCT |
| 2. 推理类(鉴别诊断、处置建议) | LLM 辅助诊断与管理 | 有 RCT,但多为情景题(vignette),结局是评分而非患者结局 |
| 3. 系统类(分诊、文书、风险预测) | 减少行政负担、预警 | 应用最广,结局证据最弱 |
层次 1 是唯一有较成熟证据的一类:结肠镜的计算机辅助检出(CADe)在多项 RCT 中提高腺瘤检出率——这是少见的、以真实患者为对象的随机证据。但请立刻套用第 09 页:腺瘤检出率是替代终点,"降低结直肠癌死亡率"是硬终点,后者尚未证明。且有分析指出增加的多为微小腺瘤,其临床意义有限,同时增加了随访负担。
2. 层次 2:LLM 辅助诊断的 RCT 说了什么
截至 2026-08-02,已核验的随机试验结果比两边的宣传都更细致:
1. 单纯给医生 LLM 工具,收益不必然出现。 多项情景题试验报告了管理推理任务的改善,但效应大小依赖题目、模型版本、对照资源与交互设计;诊断准确性上的改善不总是出现,部分试验中"LLM 单独作答"的表现甚至优于"医生 + LLM"。这一现象本身极其重要:它说明人机结合不是自动增益,交互方式才是关键变量。
2. AI 素养训练似乎是有效的调节变量。 在一项对完成 20 小时 AI 素养课程的医生进行的随机试验中,LLM 辅助使临床情景题的诊断推理表现有所提升;但该结果来自特定课程、受训人群和情景题,不能把单一百分点外推为临床结局或通用效应。
3. 自动化偏倚(automation bias)是可测量的真实风险。 同一类受过训练的医生,当 LLM 给出的建议中被故意植入临床上重要的错误时,诊断推理得分显著下降;下降幅度依赖错误设计、任务和交互,不能外推成固定的百分点效应。换言之:受过 AI 素养训练的医生,仍然会被自信的错误建议带偏。
4. 真实世界的实用型试验尚未显示结局改善。 一项在肯尼亚基层医疗机构进行的整群随机实用型试验(这是设计上最接近真实场景的一类),未发现 LLM 辅助显著降低 14 天治疗失败率。
把四条放在一起的结论:情景题上的收益是真实的,但它是替代终点;到目前为止,在真实患者结局上的随机证据仍是中性的。 这与本站前面讲过的每一个新技术引入的模式完全一致(第 09 页)。
3. 评价一篇"AI 超过医生"论文的检查清单
这是本页最实用的产物,每一条都对应本站前面的某一页:
- 终点是什么? 诊断准确率 / 情景题得分 = 替代终点;患者结局 = 硬终点(第 09 页);
- 对照是什么? "AI vs 医生单独" 常常不是临床相关的比较——真实问题是"医生 + AI vs 医生"(第 05 页);
- 数据是回顾性还是前瞻性? 绝大多数是回顾性数据集;
- 验证集独立吗? 同院同设备的内部验证会严重高估;外部验证的性能下降通常很明显;
- 谱偏倚:训练与评估集中的病例是否比真实工作流中更"干净"(第 02 页);
- 患病率与 PPV:在真实低患病率场景中,报告的高 AUC 会转化为什么样的 PPV?(第 02 页算术)
- 人机交互怎么设计的? 输出置信度、给不给理由、能否被覆盖——这些细节决定自动化偏倚的大小;
- 谁做的研究、谁出的钱?(第 07 页)
- 有没有前瞻性 RCT 与结局终点? 若无,结论只能是"有前景"。
4. 结构性风险
1. 自动化偏倚与技能退化:上文的 RCT 已经量化了前者;后者(长期依赖导致独立判断能力下降)目前缺乏长期数据,但在其他领域(航空、放射)有先例。
2. 分布偏移:模型在部署环境与训练环境不同时性能下降;且医疗数据分布随时间漂移(编码规则、检验方法、疾病谱变化)。这要求持续监测而非一次性验证。
3. 公平性:训练数据的人群构成决定性能边界。已有多个记录在案的案例:以医疗费用作为"健康需求"代理变量的风险预测算法,系统性低估了某些群体的需求——因为该群体历史上获得的医疗支出较少,而算法把"花钱少"读成了"更健康"。这是一个纯粹的替代终点错误(第 09 页):用可测量的代理量替换了真正关心的量。
4. 谄媚性(sycophancy):语言模型倾向于同意用户。在临床场景中,这意味着它可能强化医生已有的错误假设——恰好是第 04 页确认偏差的自动化放大器。
5. 责任与监管:自适应(持续学习)系统的监管框架仍在建立中;责任归属、知情同意、以及模型更新后是否需要重新验证,都尚无统一答案。
5. AI 已经确实有用的地方
为了不落入无差别怀疑,也要说清哪些是真的:
- 文书与转录:环境语音记录生成病历草稿——证据主要在时间节省与医生倦怠,这是真实且重要的结局,虽然不是患者结局;
- 影像的量化测量(体积、狭窄程度、骨龄)——替代人工测量,可重复性更好;
- 排班、分诊、编码、检索等运营任务;
- 患者侧的信息可及性:让人能读懂自己的报告、准备好问诊时的问题——这正是本站与姊妹站存在的理由之一。注意边界:它不能替代诊断(🔗 心智与证据站第 20 页记录了 AI 心理健康应用的同类边界与监管现状)。
6. 本页的立场
用一句话概括:目前的证据支持"AI 作为特定任务上的工具",不支持"AI 作为诊断决策的替代";而人机结合的收益不是自动的,它取决于训练、交互设计与监测——这三者本身需要被随机试验检验,而不是被假定。
对读者最实用的一条:如果你用 LLM 查自己的健康问题,请记住那批 RCT 的核心发现——它会自信地给出错误建议,而受过专门训练的医生也会被这种自信带偏。 把它当作"帮你准备问题的工具",而不是"给你答案的工具"。
参考与更新
复审记录:最后复审 2026-08-02;按六个月规则,下一次常规复审不晚于 2027-02-02。FDA 清单等动态内容如有更新则提前复审;具体适用地区以各条来源与当地最新版本为准。
- FDA AI-enabled medical devices(美国市场授权动态清单;定期更新、非穷尽;美国。正文不固定写设备数量。)
- WHO Ethics and governance of artificial intelligence for health(AI 健康伦理与治理框架;2021;国际,不等于上市许可。)
- Nature Medicine pragmatic cluster randomized trial(生成式 AI 临床决策支持的真实世界原始试验;2026;肯尼亚基层医疗。)
- Human–large language model collaboration systematic review and meta-analysis(人机协作证据综合;2026;国际,结论受场景与研究质量限制。)
下一页:成本效果与 QALY——把"值不值得"从个体层面推到系统层面。