本讲目录

第 13 讲 · 用 AI 促进科研

科研工作流的每个环节——选题、文献、推导、实验、写作——AI 都能显著提速,但每个环节的失败模式各不相同:文献环节它会编造引用,推导环节它会顺着你的错误走,写作环节它会把你带进学术不端的灰区。本讲按科研流程逐环节给出"怎么用 + 红线在哪"。

学习层:先把科研比较分层,再谈“AI 更好”

具体误判:把任务分配差异当成方法差异

一个课题组试用 AI 辅助文献筛选与代码分析。负责人把“通过预先盲评的任务数”当成功指标:基线组通过 85/150,AI 组通过 114/250。他于是写下结论:“AI 辅助把成功率从 56.7% 降到了 45.6%,不值得采用。”这个句子看似有分子、有分母、有对照,仍可能把任务难度的分配误认成工具效果。

在继续算之前先预测:如果把任务按“简单/困难”分层,AI 是否会在两个层内都更好?如果会,为什么总体率还可能更低?下面的玩具账本只用整数计数;它不是某项真实研究的证据,而是审计“分母从哪里来”的练习。

最小可审计对象:2×2×2 计数账本

两个方法(AI 辅助 \(A=1\)、基线 \(A=0\))× 两个任务层(简单/困难)× 两个结果(成功/失败)构成 2×2×2。每个率都写成“成功数 / 该格总数”,失败数不被隐藏:

\[ \begin{array}{c|ccc|ccc|c} &\multicolumn{3}{c|}{\text{简单任务}}&\multicolumn{3}{c|}{\text{困难任务}}&\\ \text{方法}&S&F&N&S&F&N&\text{粗率}\\ \hline \text{基线}&80&20&100&5&45&50&85/150=56.7\%\\ \text{AI 辅助}&90&10&100&24&126&150&114/250=45.6\% \end{array} \]

因此层内差(AI − 基线)是:简单层 \(90/100-80/100=+10\) 个百分点;困难层 \(24/150-5/50=+6\) 个百分点。两层都更好,但粗合并差是 \(114/250-85/150\approx-11.1\) 个百分点——这就是 Simpson 悖论在“方法 × 任务难度”混杂下的可审计版本。

粗合并、固定目标权重标准化:同一层内率,两个问题

  1. 粗合并:保留每个方法实际收到的任务构成,直接相加成功数与总数。它回答“这两组实际做过的任务总体通过率是多少”,但在任务分配不平衡时不回答“同一类任务上方法会怎样”。
  2. 标准化:先把目标构成固定为简单 100 个、困难 100 个(权重 50%/50%),再放入各层观察率。基线的投影成功数是 \(80/100\times100=80\) 与 \(5/50\times100=10\),合计 \(90/200=45\%\);AI 是 \(90+24/150\times100=106\),即 \(106/200=53\%\)。固定目标权重下的差是 +8 个百分点。

这里的 100/100 是事先固定的目标构成,不是把观察到的样本偷偷复制,也不是因为“标准化”这个词就获得了因果识别。这个示例特意选了能投影出整数成功数的计数,方便手算;真实分析应保留精确分数和不确定性,而不是为了好看四舍五入。

混杂账:先看分配,不要只看百分比

基线组的困难任务占比是 \(50/150=33.3\%\),AI 组是 \(150/250=60\%\),相差 +26.7 个百分点。困难任务成功率低,又更集中在 AI 组,于是它在粗合并分母中留下了更大的“困难任务权重”。这就是混杂的机制,而不是一个只需背诵的方向反转口诀。

换情景可以检验你是否理解了机制:无反转把 AI 困难层改成 12/75,粗合并差变为 +1.6 个百分点;平衡分配把 AI 困难层改成 8/50,两个方法的困难任务占比都为 33.3%,粗合并差变为 +8.7 个百分点。三套情景的层内差都仍是 +10 与 +6,固定 50/50 标准化差都仍是 +8;变的是任务构成,不是层内率。

三种读法与识别边界

  • 描述性分层:报告简单/困难层内的成功率和差异。它需要定义一致的成功判据、可靠的评分与非空分母;本身不声称 AI 导致了差异。
  • 描述性标准化:把观察到的层内率放到预先指定的目标权重上,回答“若构成相同,这些观察率会拼出什么总体率”。在观察性资料中,它不能自动变成因果效果;目标权重若由看过结果后选择,也会引入分析自由度。
  • 因果标准化:若要把 \(\sum_s w_s[\mathbb E(Y\mid A=1,S=s)-\mathbb E(Y\mid A=0,S=s)]\) 解释为目标人群的平均因果效果,还要明确并辩护识别假设:positivity(每个任务层都有两种方法的支持)、exchangeability / 无未测混杂(给定层后,方法分配与两种潜在结果独立:\(Y^a\perp A\mid S\))、consistency(实际接受的方法与定义清楚、版本唯一的处理一致,观察结果等于该处理下的潜在结果)。计数表只能显示“有没有支持”,不能证明后两项。
  • 随机试验:在每个难度层内随机分配 AI 或基线,可以由设计支持条件 exchangeability;仍须检查执行偏离、脱落、干扰/溢出、评分盲法和结果测量。观察性标准化与分层描述不能冒充随机试验。

交互实验:先预测,再展开计数

无 JavaScript 时的静态读法:默认“反转”账本见上方 2×2×2 表。粗合并为基线 85/150=56.7%、AI 114/250=45.6%,差为 −11.1 个百分点;逐层差为 +10、+6 个百分点;固定目标计数(简单 100、困难 100)后,基线为 (80+10)/200=45%,AI 为 (90+16)/200=53%,标准化差为 +8 个百分点。困难任务占比为基线 50/150=33.3%、AI 150/250=60%,分配差 +26.7 个百分点。切换“无反转”或“平衡分配”可复核上一段的三组结果。

预设AI 困难层AI 粗合并粗合并差标准化差困难占比分配差
反转24/150114/250−11.1 pp+8 pp+26.7 pp
无反转12/75102/175+1.6 pp+8 pp+9.5 pp
平衡8/5098/150+8.7 pp+8 pp0 pp

实验会记录你的总体方向预测并即时反馈;动态模型在 Node 无 DOM 环境也导出同一套计数算法,且会检查整数计数、成功/失败守恒、positivity、标准化投影与“每层更好”等不变量。表格在窄屏内自行滚动,不让账本把页面撑出横向滚动。

迁移到真实科研分析的验证纪律

在实际 A/B 或观察性比较中,把下面的顺序写进分析计划,而不是看到总体结果后才补分层:

  1. 在看结果前定义成功判据、任务难度分层、主估计量和目标权重;记录缺失、拒答、失败和分配流程,不能只导出“成功率”。
  2. 先列整数计数和每层分母,再报层内率、粗合并率、标准化率;用独立脚本或小样本手算核对汇总,防止 AI 生成的代码悄悄错配任务和结果。
  3. 把“分配不平衡”当作需要解释的研究结果:是随机化失败、研究者挑题、参与者自选,还是 AI 被安排了更难的剩余任务?没有机制说明时,不把方向性差异写成工具因果效果。
  4. 用独立评分者、盲法复核、预先登记的敏感性分析和新任务复现来验证;AI 可以帮你生成分层表和反例,但每个分子、分母、排除规则和假设都由研究者审计。

1. 文献:最大的提速点,最密的幻觉区

1.1 检索与发现

红线一:引用必须逐条验证

LLM 会编造以假乱真的参考文献——真实存在的作者 + 合理的标题 + 像模像样的期刊卷号,拼成一篇不存在的论文。这是幻觉最高发、后果最严重的场景(已有律师因引用 AI 编造的判例被制裁,学术圈同类事故层出不穷)。纪律:AI 给出的每一条文献,进 Google Scholar / DOI 核实存在性之后才允许进入你的笔记。让它"给出 DOI 链接"能过滤一部分,但不能替代核验。

1.2 精读

把 PDF 交给长上下文模型,但别只说"总结一下"(得到的是万金油摘要)。用结构化精读提示词:

逐节陪我读这篇论文。对每一节:
1. 用两句话说清这一节做了什么、在整体论证中的作用;
2. 指出关键假设(明说的和暗含的);
3. 数学部分:把跳步补全,标注哪一步最脆弱;
4. 我对照原文后会追问。
最后回答:这篇论文的核心贡献能否用一句话+一个公式概括?
它最可能被攻击的弱点是什么?如果让你设计后续工作,做什么?

原则:AI 的输出是你阅读的脚手架,不是阅读的替代——关键论文仍要亲读,AI 负责补背景、解跳步、陪讨论。

2. 数学推导:它会顺着你的错误走

LLM 做推导的特性必须先认清:它是似然机器(第 07 讲)——你递给它一个含错误的推导让它"继续",它大概率顺着错误往下走,因为"顺着走"在训练分布里最常见(谄媚 + 惯性双重作用)。正确用法全部围绕对抗性设计:

推理模型(第 10 讲)在此场景显著强于即答模型,难推导务必用推理档并给足思考时间。

3. 实验与代码复现

4. 写作:润色与代写的边界

能做(主流期刊普遍接受,个别期刊有申报要求):

不能做(红线三):

各期刊/会议的 AI 使用政策差异大且变动快,投稿前查最新版并按要求申报——申报使用 AI 润色如今是常规操作,无需羞于声明。

5. 把 AI 嵌进科研日常的三个习惯

  1. 研究日志喂给它:每周把进展/卡点日志发给 AI 做"每周复盘对话"——它记得你上周说过什么(只要在同一上下文/让它读日志),当你的"第二个自己";
  2. 审稿人模拟:投稿前"扮演最严苛的 Reviewer 2,写一份拒稿意见"——提前暴露弱点的成本远低于真拒稿;
  3. 跨领域翻译:读隔壁领域论文时让它当"双语导游"("用统计学的语言解释这个物理概念")——交叉研究的加速器。

本讲小结

环节 用法 红线
文献 语义检索建地图、结构化精读 每条引用逐一核实存在性
推导 独立验算、专职找茬、反例、数值检验 别给它你的答案再问"对不对"
代码 智能体复现、统计选择要说理 数据管线逐行理解 + 小样本核对
写作 润色对照表、结构诊断、审稿模拟 核心贡献必须出自你;按政策申报

动手:挑一篇你正在读(或早想读)的论文,完整走一遍 1.2 的结构化精读流程;再从中挑一个数学命题,用第 2 节的"独立验算 + 数值验证"双保险验一次。


下一讲把散落各处的技巧与坑系统盘点一遍——幻觉、谄媚、上下文腐烂、提示词注入,以及把"verify"变成肌肉记忆的清单。

跨课程实验

可复现练习:综合项目:从温度读数反推初态。从八参数监督回归开始,按完整轨迹划分训练、验证与测试,比较数值基线,再用分布外数据检查结论边界。