本页目录

前沿 III · 计算材料学与 AI

状态提示:AI-for-materials 的模型、数据集、论文和产业状态变化很快;下文把可复现的方法框架与需要查原始证据的新闻性主张分开。具体模型版本、数据规模、验证结果和商业化状态都不应从这张讲义快照外推。

材料研发的传统节奏是"试错 + 经验 + 运气",从发现到应用常需多年。计算与 AI 可能改写其中的筛选环节——但改写到什么程度,是当前学界与产业界最值得较真的问题。本页给方法谱系、真实进展、以及一次值得记住的教训。

学习层:一个小数据代理模型,先问“哪里能内插”

1. 具体材料工程情境:用有限实验点挑下一次测量

假设 \(x\) 是归一化成分、\(y\) 是归一化工艺条件,手里只有六个带测量值的点。你要给一个新点预测无量纲性能 proxy,并决定下一次实验测哪里。真正的风险不是不会算一个数,而是把凸包外的外推当成和数据覆盖内的内插一样可靠。

2. 必须作答的预测门:不确定性、验证与主动学习

揭示前回答三题:凸包外的点应该被视为新颖高置信、与凸包内相同,还是必须提示 OOD/外推?为什么要做留一法验证?主动学习下一次测量应优先补哪里?三题完成后才显示训练点、凸包、验证误差和候选测量点。

3. 最小模型与假设:局部内插、不确定性 proxy 与验证

脚本对查询点取距离最近的最多三个观测,用逆距离加权估计

\[ \hat z(x,y)=\frac{\sum_{j\in N_3}w_jz_j}{\sum_{j\in N_3}w_j},\qquad w_j=\frac{1}{d_j+10^{-6}}. \]

局部观测值的加权离散度和最近邻距离合成 \(u\in[0,1]\) 的不确定性 proxy;查询点若不在训练点凸包内,脚本强制把 \(u\) 提高并标记 OOD。这里的“凸包内”只表示几何覆盖,不代表化学空间、温度空间或测量机制真的可内插。

验证用留一法:每次拿掉一个观测点,用其余点预测它,报告无量纲 proxy 的 RMSE。主动学习从固定的候选池中选择当前不确定性最高的位置,再用一个确定性的 toy ground truth 加入观测,方便检查闭环;这不是实验自动化或材料发现保证。

4. 动手实验:移动查询点并加入下一测量

JavaScript 失效时的静态 fallback:训练点的 \((x,y,z)\) 为 \((0.15,0.15,0.55)\)、\((0.50,0.15,0.72)\)、\((0.85,0.15,0.82)\)、\((0.20,0.65,0.40)\)、\((0.55,0.65,0.63)\)、\((0.80,0.65,0.72)\),其中 \(z\) 是无量纲性能 proxy。默认查询 \((x,y)=(0.50,0.40)\) 位于凸包内;逆距离三邻居代理预测为 \(z=0.608158\),不确定性为 \(u=0.472156\)(无量纲)。留一法 RMSE 为 \(0.110473\),当前候选池中不确定性最高的下一测量点为 \((0.50,0.80)\),它位于凸包外并应标为 OOD。

证据 静态读法 单位 / 边界
查询坐标 \((0.50,0.40)\) 无量纲归一化坐标
代理预测 \(\hat z\) 0.608158 无量纲性能 proxy,不是实测单位
不确定性 \(u\) 0.472156 无量纲教学 proxy
凸包状态 内插区域 仅表示训练坐标几何覆盖
验证 RMSE = 0.110473 无量纲;不是普遍泛化保证
下一测量 \((0.50,0.80)\) 凸包外 OOD 候选;需独立验证

5. 误区与模型边界:一个预测数不等于发现

  • 训练误差小、图表平滑或模型名字新,都不能替代独立验证、负结果、重复合成和原始表征。留一法也只是小数据集上的有限证据。
  • 凸包内不保证化学可行、相稳定或工艺可制造;凸包外并非一定错误,但必须把它读作外推并提高验证优先级。高不确定性是测量计划信号,不是“新材料”的证据。
  • 这里的逆距离加权、距离 proxy 和固定候选池是为审计因果链而选的最小模型,不代表神经网络、DFT、CALPHAD 或任何真实材料数据库的误差结构。
  • 生成式模型、高通量预测和自主实验室可以缩短部分候选筛选环节,但合成、相纯度、结构解析、性能测试、放大和认证仍是独立关卡;不能把候选数或预测数直接叫作发现数。

6. 正式回扣:从“AI 加速”回到可复现证据

一个可信的计算材料结论至少要能回答:训练数据覆盖哪里、查询点是内插还是外推、验证怎样做、预测量是什么单位、下一步如何用独立实验纠错。模型复杂度可以改变表达能力,但不会删除数据边界和合成鸿沟。

迁移问题:如果模型在凸包内 RMSE 很小,却在一个新元素组合上给出极高性能,你会先补训练点、做 DFT 交叉检查、做相稳定性/可制造性筛选,还是直接合成?你需要哪些独立证据才能把“候选”升级成“材料结果”?

1. 多尺度计算谱系(选工具的地图)

尺度 方法 能算什么 代价/局限
电子(Å, fs) DFT 第一性原理 能带、形成能、弹性常数、缺陷能、反应路径 数百原子上限;带隙系统性低估;泛函依赖
原子(nm, ns) 分子动力学 MD 扩散、界面、力学变形、非晶结构 依赖势函数(机器学习势正在改变这一点)
介观(μm, s) 相场、动力学蒙特卡洛、位错动力学 组织演化、枝晶、相变、位错集体行为 参数需上层输入
宏观 CALPHAD、有限元、ICME 相图外推、工艺-组织-性能贯通 依赖数据库质量

ICME(集成计算材料工程):把各尺度串成"成分-工艺-组织-性能-服役"的链条——这是计算材料学的工业形态,也是航空与汽车企业真正落地的部分(合金设计、工艺窗口、寿命预测)。

机器学习势(MLIP):用 DFT 数据训练势函数,目标是在受验证的成分和构型范围内接近参考势,同时获得比直接 DFT 更低的计算成本。它可能把可模拟的时空尺度扩大很多,但精度、稳定性和元素覆盖取决于训练集与验证集;“DFT 的精度、MD 的速度”只能当作目标性短语,不能当作无条件保证。

2. AI 的三种用法(按成熟度排序)

  1. 代理模型/性能预测:用已有数据训练"成分工艺 → 性能"的回归器,替代部分昂贵计算或实验;关键不在模型复杂度而在数据质量、独立验证与外推边界(🔗 数学站统计 V 的"外推危险"、SLT 线的泛化理论——材料数据集小、偏、缺负样本,这是本领域 ML 的根本约束);
  2. 高通量筛选:DFT + ML 可以在候选空间中排序稳定性或性能。GNoME 的公开记录应拆开读为约 2.2M predicted stable candidates,以及更新后的约 381k updated convex hull structures;这些是模型预测/数据库筛选与 hull 更新记录,不是 2.2M 个已经实验验证的材料,也不能直接读成已合成、已表征或已商业化的数量;定义和计数仍应回到原始论文/项目记录核对;
  3. 生成式/逆向设计:给定目标性能生成候选结构。MatterGen 等工作展示了研究原型路线(🔗 你的 comfy 站第 02 讲的扩散数学),但候选结构仍需稳定性、合成路径、表征和性能实验验证。

自主实验室(self-driving lab):把"生成假设 → 合成 → 表征 → 更新模型"闭环自动化。不同平台的设备、目标函数、失败率和吞吐量差别很大,不能用一个机构的候选数或周期替代跨平台证据。

3. 一次值得记住的教训(本页最重要的一段)

2023 年伯克利 A-Lab 论文评估了 57 个目标材料。2026 年作者更正后的记录为 36 个成功、4 个仅凭 XRD 仍属 inconclusive、17 个未获得;那 4 个原先被计入 40 个成功条目,不能继续写成已确认。成功也不等于高纯、全新结构原型或独立复现,仍要回到精修谱图、相含量与后续验证。

这件事的三条启示(不是要否定方向,而是校准判断):

4. 数据基础设施(低调但决定上限)

Materials Project、AFLOW、OQMD、NOMAD 等开放数据库是这一切的地基;FAIR 数据原则与统一的元数据标准正在成为共识。真正的稀缺资源不是算力也不是模型,而是:高质量的实验数据(尤其是失败与负结果)、标准化的工艺记录、以及表征原始数据的可获取性。谁把这三样做扎实,谁的 AI 才有真东西可学——这是给任何想入行者的最实用建议。

5. 判断框架(读 AI-for-materials 新闻的五问)

① 是预测还是合成验证?两者证据等级不同;② 数据从哪来、覆盖什么成分空间、外推还是内插?③ 有无独立复现?④ 性能是计算值还是实测值、测的是什么尺寸的样品?⑤ 距离可制造有多远(克级?公斤级?工艺窗口有多宽)?

总纲:AI 可能加速某些材料科学的筛选工作,但加速幅度依数据、工具和验证协议而变;合成、表征、放大、认证仍是独立关卡。更稳妥的说法是:模型可以缩短候选排序的部分时间,不能替代全程证据。


前沿了望结束。最后一页收官:把全站的知识收成一件可用的工具——材料选择的方法论。

Primary sources(访问快照:2026-08-25):GNoME 论文 · A-Lab 论文与 2026 correction 入口 · A-Lab Author Correction