本页目录

前沿 V · AI 进入生物学

核对于 2026-07。本页是全线过期最快的一页。 证据地位结构预测与图像分析【实】基因组基础模型的能力边界【争】"虚拟细胞"【未定】。 AI 已经成为生物学的通用工具。本页梳理它确实做成了什么正在尝试什么、以及哪些宣称需要打折。判断标准始终是同一条:是否在独立的、未见过的数据上被检验过。

一、已经兑现的部分【实】

① 结构预测与蛋白设计(线六第一页)——最成功的案例,已改变日常研究方式,并获 2024 年诺贝尔化学奖。

② 图像分析:这是被低估但影响巨大的一块。

③ 变异效应预测:预测某个突变是否有害。基于序列保守性与蛋白语言模型的方法在分类致病性上表现良好,已被纳入临床变异解读的辅助证据(🔗 线三第三页从关联走向机制的难题)。

④ 蛋白语言模型:把氨基酸序列当"语言"训练(🔗 语言站 :8086 的分布假说——意义藏在上下文中,在这里成了"功能藏在序列上下文中")。它们学到的表征可用于结构、功能与突变效应预测。这是分布语义思想在生物序列上的直接移植,也是本站与语言站最漂亮的一处呼应。

二、正在推进的部分【争】

基因组基础模型:把 DNA 序列当作语言,用大规模自监督训练,目标是学出跨物种的"基因组语法"。近期的模型(如 Evo 2)在参数量与上下文长度上大幅扩展——据其发布材料,训练于跨真核与原核的数万亿碱基规模数据,具备长上下文,并被用于跨 DNA/RNA/蛋白的预测与设计任务。

该期待什么、该保留什么

虚拟细胞【未定】:目标是建立能预测"扰动 → 细胞响应"的计算模型。这是把线六第三页那批海量描述性数据转化为预测能力的尝试,方向正确且雄心勃勃,但目前远未达到可靠预测未见扰动的水平

AI 辅助的实验闭环:机器提出假设 → 自动化实验平台执行 → 结果反馈训练模型。已有系统在有限领域(如培养基优化、化合物筛选)展示了闭环能力,通用的"AI 科学家"仍是愿景

三、判读 AI-生物学宣称的四个问题

这是本页最实用的产出。遇到"AI 攻克某某生物学问题"时:

① 训练集与测试集是否真正独立? 生物数据高度冗余(同源序列、同一家族的蛋白),随机划分会导致严重的信息泄漏——模型可能只是记住了近亲。正确做法是按序列同一性或时间点划分。这是该领域最常见的方法学错误。

② 与简单基线比了吗? 与 BLAST 同源检索、线性模型、或 PCA 这样的朴素方法相比,提升多少?很多"深度学习优势"在与强基线比较后大幅缩水。

③ 是预测还是理解? 高准确率的黑箱能加速研究,但不等于机制知识。两者都有价值,但不该混同。

④ 湿实验验证了吗?验证到哪一层? 计算预测 → 体外验证 → 细胞验证 → 动物验证,每一层的淘汰率都很高。

四、AI 改变的不只是方法,还有认识论

一个更深的问题,值得单独提出。

传统生物学的目标是可理解的机制:画一张通路图,讲一个因果故事。而深度学习模型可以准确预测无法解释——AlphaFold 能给出结构,却说不出折叠为什么这样发生(承线一第三页)。

这带来一个真实的张力:

(🔗 这个争论与语言站 :8086 线六"预测是否等于理解"是同一个问题在不同学科的化身。那里给出的三层拆解——功能理解 / 指涉理解 / 现象理解——在这里同样适用:AlphaFold 有功能理解(能用结构做事),部分指涉理解(内部表征对应真实的物理约束),但没有我们通常所说的机制解释两个讲义站在这里真正接上了。

五、需要警惕的炒作模式

六、一个平衡的总结

AI 在生物学中的地位大致可以这样概括:

层次 状态
感知类任务(图像分割、序列比对、结构预测) 已经改变了整个领域【实】
预测类任务(变异效应、表达调控) 有实质进展,可用但需验证【实/争】
设计类任务(蛋白、分子) 进展迅速,湿实验成功率仍是瓶颈【前沿】
理解与因果(虚拟细胞、机制发现) 仍处早期【未定】

越靠近"感知与模式识别",AI 越成功;越靠近"因果与机制",越困难。 这个梯度与 AI 在其他领域的表现一致,也提示了生物学中真正的瓶颈——不是数据不够,而是我们缺乏能把数据转化为因果理解的理论框架。


下一页:前沿 VI——脑机接口。本线最后一站,也是把线五的神经科学与工程直接对接的地方。它已经从实验室走到了患者的日常生活。