前沿 V · AI 进入生物学
核对于 2026-07。本页是全线过期最快的一页。 证据地位:结构预测与图像分析【实】;基因组基础模型的能力边界【争】;"虚拟细胞"【未定】。 AI 已经成为生物学的通用工具。本页梳理它确实做成了什么、正在尝试什么、以及哪些宣称需要打折。判断标准始终是同一条:是否在独立的、未见过的数据上被检验过。
一、已经兑现的部分【实】
① 结构预测与蛋白设计(线六第一页)——最成功的案例,已改变日常研究方式,并获 2024 年诺贝尔化学奖。
② 图像分析:这是被低估但影响巨大的一块。
- 连接组学完全依赖深度学习做电镜图像的分割与神经突起追踪(线五第四页的果蝇与小鼠连接组,人工标注是不可能完成的);
- 细胞分割、表型筛选、病理切片分析、冷冻电镜的颗粒挑选与重建。
③ 变异效应预测:预测某个突变是否有害。基于序列保守性与蛋白语言模型的方法在分类致病性上表现良好,已被纳入临床变异解读的辅助证据(🔗 线三第三页从关联走向机制的难题)。
④ 蛋白语言模型:把氨基酸序列当"语言"训练(🔗 语言站 :8086 的分布假说——意义藏在上下文中,在这里成了"功能藏在序列上下文中")。它们学到的表征可用于结构、功能与突变效应预测。这是分布语义思想在生物序列上的直接移植,也是本站与语言站最漂亮的一处呼应。
二、正在推进的部分【争】
基因组基础模型:把 DNA 序列当作语言,用大规模自监督训练,目标是学出跨物种的"基因组语法"。近期的模型(如 Evo 2)在参数量与上下文长度上大幅扩展——据其发布材料,训练于跨真核与原核的数万亿碱基规模数据,具备长上下文,并被用于跨 DNA/RNA/蛋白的预测与设计任务。
该期待什么、该保留什么:
- 合理的期待:识别调控元件、预测变异对表达的影响、跨物种迁移知识;
- 需要保留的:基因组"语言"与自然语言差异很大——没有清晰的词边界、功能元件稀疏、长程相互作用由三维结构(线三第四页的 TAD)而非序列邻近决定;基准测试的设计也仍在争论(有工作报告,在若干下游任务上,简单的无参数表示可与单细胞基础模型相当甚至更好——这提示部分"基础模型优势"可能被高估)。
虚拟细胞【未定】:目标是建立能预测"扰动 → 细胞响应"的计算模型。这是把线六第三页那批海量描述性数据转化为预测能力的尝试,方向正确且雄心勃勃,但目前远未达到可靠预测未见扰动的水平。
AI 辅助的实验闭环:机器提出假设 → 自动化实验平台执行 → 结果反馈训练模型。已有系统在有限领域(如培养基优化、化合物筛选)展示了闭环能力,通用的"AI 科学家"仍是愿景。
三、判读 AI-生物学宣称的四个问题
这是本页最实用的产出。遇到"AI 攻克某某生物学问题"时:
① 训练集与测试集是否真正独立? 生物数据高度冗余(同源序列、同一家族的蛋白),随机划分会导致严重的信息泄漏——模型可能只是记住了近亲。正确做法是按序列同一性或时间点划分。这是该领域最常见的方法学错误。
② 与简单基线比了吗? 与 BLAST 同源检索、线性模型、或 PCA 这样的朴素方法相比,提升多少?很多"深度学习优势"在与强基线比较后大幅缩水。
③ 是预测还是理解? 高准确率的黑箱能加速研究,但不等于机制知识。两者都有价值,但不该混同。
④ 湿实验验证了吗?验证到哪一层? 计算预测 → 体外验证 → 细胞验证 → 动物验证,每一层的淘汰率都很高。
四、AI 改变的不只是方法,还有认识论
一个更深的问题,值得单独提出。
传统生物学的目标是可理解的机制:画一张通路图,讲一个因果故事。而深度学习模型可以准确预测却无法解释——AlphaFold 能给出结构,却说不出折叠为什么这样发生(承线一第三页)。
这带来一个真实的张力:
- 实用主义立场:预测能力本身就是科学的目标之一。如果模型能可靠预测突变效应、指导实验、设计分子,它就是好科学,可解释性是奢侈品;
- 传统立场:没有机制理解,就无法举一反三,无法在分布外泛化,也无法真正把知识整合进理论体系;
- 折中的实践:用模型做假设生成器——它提出候选,人做机制验证。这也是本课推荐的态度。
(🔗 这个争论与语言站 :8086 线六"预测是否等于理解"是同一个问题在不同学科的化身。那里给出的三层拆解——功能理解 / 指涉理解 / 现象理解——在这里同样适用:AlphaFold 有功能理解(能用结构做事),部分指涉理解(内部表征对应真实的物理约束),但没有我们通常所说的机制解释。两个讲义站在这里真正接上了。)
五、需要警惕的炒作模式
- "AI 解决了 X"——通常是"在某个基准上超过了先前方法";
- "AI 发现了新药"——多为"识别出候选化合物",而候选到获批的成功率极低,且目前尚无完全由 AI 主导发现并获批上市的药物(有多个 AI 参与发现的候选进入临床试验,进展需持续跟踪);
- 用未公开的数据或方法宣称突破——无法独立验证的结果,应暂缓采信;
- 把公司发布材料当作同行评议结果。
六、一个平衡的总结
AI 在生物学中的地位大致可以这样概括:
| 层次 | 状态 |
|---|---|
| 感知类任务(图像分割、序列比对、结构预测) | 已经改变了整个领域【实】 |
| 预测类任务(变异效应、表达调控) | 有实质进展,可用但需验证【实/争】 |
| 设计类任务(蛋白、分子) | 进展迅速,湿实验成功率仍是瓶颈【前沿】 |
| 理解与因果(虚拟细胞、机制发现) | 仍处早期【未定】 |
越靠近"感知与模式识别",AI 越成功;越靠近"因果与机制",越困难。 这个梯度与 AI 在其他领域的表现一致,也提示了生物学中真正的瓶颈——不是数据不够,而是我们缺乏能把数据转化为因果理解的理论框架。
下一页:前沿 VI——脑机接口。本线最后一站,也是把线五的神经科学与工程直接对接的地方。它已经从实验室走到了患者的日常生活。