前沿 I · 结构预测与蛋白设计
核对于 2026-07。本线全程标注核对时间——它一定会过期。 证据地位:结构预测与设计成果【实】;"折叠问题已解决"【争】(承线一第三页);临床转化【未定】。 线六开始。第一站是过去五年生物学最耀眼的进展:AI 不仅学会了预测蛋白结构,还学会了设计自然界不存在的蛋白。2024 年诺贝尔化学奖同时授予结构预测与蛋白设计——Demis Hassabis 与 John Jumper(AlphaFold)、以及 David Baker(计算蛋白设计),标志着这个领域的成熟。
一、预测:AlphaFold 做到了什么
线一第三页讲过折叠问题的难度(Levinthal 悖论、能量漏斗)。半个世纪里,测定结构靠 X 射线晶体学、核磁、冷冻电镜——每个结构耗时数月到数年。
AlphaFold2(2020)在 CASP 竞赛中对大量单体蛋白达到接近实验精度的预测。随后发布的预测数据库覆盖了 2 亿以上的蛋白序列,把"查结构"变成了日常操作。AlphaFold3 进一步扩展到蛋白–配体、蛋白–核酸等复合物的建模。
为什么它有效(简化的直觉):
- 共演化信号:若两个残基在三维空间接触,它们的突变往往相关(一方变了,另一方需补偿性变化才能维持结构)。多序列比对(MSA)中的相关模式,编码了空间接触信息——这是深度学习之前就已知的思想,AlphaFold 把它用到了极致;
- 端到端几何建模:直接输出三维坐标,而非先预测接触图再重建;
- 注意力机制在残基对之间传递信息,隐式地做了类似三角不等式的几何一致性推理。
必须保留的限定(承线一第三页,仍然适用):
- 预测终态 ≠ 理解折叠动力学;
- 静态结构 ≠ 功能:许多蛋白依赖构象变化、柔性区、多态平衡;
- 内在无序蛋白本就没有固定结构,而它们在信号传导与相分离中极重要;
- 点突变的精细效应预测仍不可靠——这直接限制了它在解读遗传变异(线三第三页)中的用途;
- 置信度不均:必须看 pLDDT/PAE 等指标,不能一概信任。
二、设计:从预测到创造
比预测更激进的一步是从头设计(de novo design)——造一个自然界从未演化出的蛋白。
线一第三页给了它的理论空间:\(20^{100}\) 的序列空间中,演化只探索了极小一角,大量物理上可行且有用的蛋白从未被尝试。
方法的演进:
- 早期(Rosetta,基于物理能量函数):设计理想化的折叠(如 Top7,2003 年首个成功的全新折叠),费力且成功率低;
- 深度学习时代:RFdiffusion 用扩散模型——与图像生成同源的思想——从噪声中逐步"去噪"出合理的蛋白骨架,再用序列设计网络(如 ProteinMPNN)填上氨基酸序列。成功率与可及的复杂度大幅提升;
- 当前:Baker 实验室已发布后续版本(RFdiffusion2/3),其中酶设计的性能被报告为接近天然酶水平,通用性进一步提高。此处属快速变动区,具体版本与性能请查最新文献。
已实现的设计目标:
- 结合蛋白:针对指定靶点设计高亲和力结合剂(潜在用于药物、诊断、中和病毒);
- 酶:设计催化特定反应的活性位点(历史上最难的目标之一,近年有实质进展);
- 自组装纳米结构:设计蛋白笼、纤维、二十面体壳——可用作疫苗支架(多价展示抗原可增强免疫应答,承线二第四页);
- 传感器与开关:构象随配体切换的蛋白。
三、这为什么是范式转变
传统路径:在自然界寻找一个大致合适的蛋白 → 定向进化改造它。受限于起点。
新路径:指定功能需求 → 直接设计满足需求的分子。这把蛋白工程从"筛选与改良"转向"按需制造",与化学合成的历史地位类似——从采集天然产物,转向合成任意分子。
与本课其他部分的连接:
- 🔗 线一第三页:设计的可行性建立在"序列决定结构"与"能量漏斗"之上;
- 🔗 线四:定向进化本身是人工加速的自然选择(变异+选择+扩增),而从头设计绕过了演化——这是两种截然不同的搜索策略。演化受历史约束(线四第一页),设计不受,这正是它能探索演化未及之处的原因。
四、局限与现实检验
必须泼的冷水:
- 成功率仍是问题:设计需要湿实验验证,多数候选失败;报道通常突出成功案例;
- "设计出来"≠"能用":一个在试管中折叠正确、结合紧密的分子,距离药物还有免疫原性、稳定性、递送、毒性、药代动力学等一长串关卡——绝大多数在此止步;
- 动态与复杂功能仍难:设计静态结合容易,设计需要精确构象循环的分子机器(如线一第三页的马达)仍很困难;
- 临床验证尚早:已有设计蛋白进入临床研究阶段,但成熟的获批产品仍有限,此处标【未定】。
五、生物安全:必须正视的一面
能设计蛋白,原则上也能设计有害的蛋白。领域内已有实质性的应对讨论与实践:
- 核酸合成筛查:商业 DNA 合成公司筛查订单,识别与已知危险序列的相似性;
- 模型层面的防护:对结构预测/设计模型的开放程度进行分级,部分能力受限发布;
- 国际规范与自律:研究者社群就"哪些设计目标不应追求"发布过共同声明。
教学立场:本课讨论这些机制与治理框架,因为理解它们是负责任地从事生命科学的一部分;本课不提供任何可用于制造危害的具体操作信息。这条边界是明确且不可协商的。
六、判读这一领域的提示
读到"AI 设计出某某蛋白"的报道时:
- 是计算结果还是湿实验验证过?
- 验证到哪一层——折叠正确?结合有效?在细胞中有功能?在动物中有效?
- 成功率是多少——设计了多少个、成功几个?
- 与现有方法比,优势是速度、性能还是可及性?
这套问题同样适用于本线其余各页。
下一页:前沿 II——基因编辑。从 CRISPR 的机制,到已获批的疗法,再到 2025 年那个为单个婴儿定制的编辑治疗——以及生殖系编辑的红线。