本讲目录

第 18 讲 · 实战:论文与长文写作

论文不是“文字很多的文档”,而是一条可追溯的论证链:论断、证据、限定词、来源定位与作者责任必须逐项对得上。AI 可以帮助检索分诊、结构检查与语言编辑,但不能替作者决定证据支持了什么,也不能承担署名、保密和投稿责任。

学习层:一句听起来正确的话,为什么还不能提交?

1. 具体谜题:四个“核对过”不是同一件事

假设候选来源有一个能打开的标识符,标题和作者也对得上。你能否据此写下“工具 A 因果性地提高了所有研究生的科研效率”?不能。至少还有四个互不替代的问题:

  1. 身份:标识符、标题、作者、年份和版本是否指向同一条记录?
  2. 支持:原文研究设计、样本和结果是否蕴含当前论断的强度与范围?
  3. 定位:直接引文、表格数字和页码能否由另一位读者复核?
  4. 溯源与政策:你是否回到原始来源,并核对了具体投稿目标的当前规则与保密环境?

DOI 或书目元数据能帮助识别和发现记录,但不替你判断研究是否可靠、结论是否为真,或者当前句子是否获得支持。反过来,标识符暂时未解析也不等于来源已被证伪;准确结论是“身份尚未建立,不能采纳”。

2. 先预测:哪一关会先失败?

实验台内置五组完全虚构的教学记录,不联网,也不冒充真实论文。先只读预设名,预测第一个非 PASS 的 guard:

预设 先预测的故障 正确处置
干净链条 无 提交限定的描述性论断
scope inflation 样本、因果或外推越界 把主张缩回证据覆盖范围
元数据不一致 / 未解析 身份未建立 留在候选池,不写入参考文献
引文定位 / 原文不匹配 quote 或 locator 不可复核 打开原文,按版本逐字重查
二手转引 未回到 primary source 沿引用链回到原始记录

3. 最小模型:claim-source matrix

把一个段落拆成原子论断,再为每条论断记录来源和支持边界:

论断维度 必须记什么 常见越界
样本与任务 人群、任务、时间、纳入标准 从 12 个固定任务外推到所有任务
关系强度 描述、相关、预测还是因果 把观察性差异改写成“导致”
外部效度 证据真正覆盖的场景 把单中心或单数据集写成普遍规律
数值与原话 分子、分母、单位、版本、locator 引用摘要转述,却标成正文原话

证据账本要同时输出两条状态:

  • 论断支持状态:SUPPORTED / UNSUPPORTED / UNVERIFIED,回答“当前证据链是否支持这句限定论断”;
  • 投稿就绪状态:READY / REVISE / BLOCKED,还要考虑目标政策、申报与保密环境。

这两条不能合并。比如一条限定论断已经得到虚构原始记录支持,但目标期刊的最新 AI 政策尚未核对,此时论断仍可为 SUPPORTED,稿件却必须是 REVISE、submission-ready = false。政策阻断不是事实性证伪。

4. 动手验证:逐关运行证据链

先选一个失败预设并提交预测,再逐次点击“运行下一关”。观察 claim-source matrix 中哪一行从 PASS 变成 WARN 或 BLOCK,然后比较原论断与限定论断。最后把目标政策切换为“具体投稿目标”,确认一个干净证据链为什么仍不能在未核对最新政策时直接提交。

无 JavaScript 时的静态读法:实验只使用虚构编号 FIC-SRC-01 至 FIC-SRC-05,不会访问 DOI、Crossref 或任何论文数据库。默认目标是“作者草稿”,四关结果如下:

预设 身份 范围 / 蕴含 引文 / 定位 溯源 / 政策 论断支持 投稿状态
干净链条 PASS PASS PASS PASS SUPPORTED READY
scope inflation PASS BLOCK PASS PASS UNSUPPORTED BLOCKED
元数据不一致 BLOCK WARN BLOCK WARN UNVERIFIED BLOCKED
定位不匹配 PASS PASS BLOCK PASS UNVERIFIED BLOCKED
二手转引 PASS PASS PASS BLOCK UNVERIFIED BLOCKED

干净预设的原句只声称:在 12 条虚构的固定任务记录中,A 的平均完成时间低于 B,不主张因果或外推。scope inflation 则把它夸张成“工具 A 因果性地提高了所有研究生在所有科研任务中的效率”。修订不是换几个同义词,而是把句子收回到“12 名参与者、固定任务、观察性描述、无外推”的证据范围。

若把干净预设的目标改为“具体投稿目标”,证据三关仍支持限定论断,但政策关给出 WARN:目标规则会变化,必须在投稿当天核对并留存版本。此时投稿状态为 REVISE,而不是把论断改判为假。

5. 误区与边界

  • 候选不是引用。 LLM 可以生成检索词、作者名变体或候选题目,语义检索也可排序候选;在作者打开来源、核对身份与原文前,候选不得直接进入参考文献。
  • 摘要不是全文证书。 摘要适合分诊是否值得精读,通常不足以核对限定条件、分析口径、表格数值和反例。把一段文字交给 AI 做 entailment 检查也只能当第二读者,不能替代作者回到原文。
  • 可解析不等于支持。 DOI 解析或 Crossref 元数据匹配解决的是身份与发现问题,不验证研究质量、统计设计或当前论断。
  • 声望不是证据质量。 期刊名、引用数和作者知名度都不能替代研究设计、数据、可复现性与相关领域的证据综合。
  • 政策不是永久常量。 投稿前查看具体期刊、会议、学校或资助方的当前页面,并记录日期与版本。不同目标可能要求不同的披露位置和粒度。
  • 保密先于便利。 未公开稿件、受限数据、审稿材料与合作方内容,只能进入机构和目标政策明确批准的环境;不确定时停止上传并询问负责人。

6. 回到写作:每段都能画成一条证据链

一段结果讨论可以按四句构造:先写观察到什么,再写证据位置,然后写限定条件,最后写仍未排除的替代解释。例如:

在固定任务集 T-12 的 12 条教学记录中,A 的平均完成时间为 82 秒,
B 为 97 秒(虚构记录 FIC-SRC-01,Table 2)。这是非随机描述性比较,
不能单独识别因果效应,也不外推到其他人群或任务。

AI 可以在你提供论断、证据与限制后检查跳步、术语一致性或语言表达;它若引入新数字、新来源或更强限定词,就必须回到账本重新验收。

7. 迁移任务

拿一段自己的课程报告,给每个可争论句标上 claim_id。为它填五列:来源身份、原文定位、支持范围、当前限定词、目标政策状态。删去任何找不到 locator 的直接引文;把“证明、导致、普遍”逐一改成与你的研究设计相称的动词。最后让同伴只看账本,尝试复核你的段落。

1. 从问题到成稿:按责任划分任务

不要用“AI 参与度高或低”替代判断。更稳定的做法是问:这一步需要什么输入证据、谁能验收、失败会造成什么后果?

任务 AI 可以协助 作者必须验收
选题与假设 扩展问题空间、生成反例、列替代解释 新颖性、可证伪性、资源与伦理边界
文献发现 检索词、同义词、候选排序、阅读提纲 每条来源身份、原文、版本和支持范围
方法与分析 代码草案、测试、可视化、异常检查 设计选择、数据来源、统计口径、复现记录
结果与论证 质疑跳步、比较多种解释 主论点、因果强度、限制与学术贡献
文字与格式 改写、翻译、压缩、格式检查 语义不漂移、引用不丢失、最终逐句负责

核心原则不是“越靠近结论就完全不用 AI”,而是任何无法由作者独立解释、验证与承担责任的内容都不能进入稿件。

2. 段落协作:先交论证包,再让模型改文字

给模型的最小论证包包含:本段主张、证据位置、限定词、替代解释和不可引入的新内容。例如:

主张:在数据集 D 的预注册分析中,方法 A 的中位误差低于 B。
证据:表 2 第 3、5 行;单位为 mm;95% 区间见附录 B。
边界:这是单数据集结果,不写成普遍优越;不作因果解释。
任务:改成 120 词结果段,不添加数字、来源或机制解释,逐项列出改动。

中译英也遵守同一验收:逐句检查否定、概率、数量词和限定词。may、is associated with、improves 与 causes 不是文风差异,而是不同强度的科学主张。

3. 引用工作流:发现、核对、采纳、生成格式

  1. 发现:数据库、引文网络或 AI 只生成候选集合;
  2. 核对身份:标题、作者、年份、版本、标识符相互一致;
  3. 核对支持:打开原文,记录具体表、页、段、方法与限制;
  4. 采纳:只有通过前面两关的来源才能进入证据账本和参考文献库;
  5. 生成格式:用引用管理器从已核对的库生成文中引用与参考文献表,再人工抽查。

“不要让 LLM 直接生成并提交参考文献列表”不等于禁止它帮助找候选。真正的红线是:未经逐条打开和核对的候选不能伪装成已采纳来源。

4. 多轮打磨:每轮只问一种失败

把每轮修改保存为可比较版本。一次要求“全面润色”会把论证修改和语言修改混在一起,反而难以验收。

5. 合规、披露与保密

投稿目标的 AI、署名、数据、图像、版权和披露政策可能变化,因此本页不给“多数期刊都如何”的永久结论。提交前查看目标官方说明,并保留核对日期。人类作者对稿件的准确性、完整性、原创性、引用、许可和披露负最终责任;AI 工具不能凭输出质量获得署名责任。

披露应写实际用途,而不是套用一个万能模板:使用了什么工具和版本、在哪些任务上使用、作者怎样复核、是否影响方法可复现性。若 AI 参与研究方法或数据分析,方法部分还要给出足够复现信息。不要把保密稿件、审稿材料或受限数据上传到未经明确批准的服务。

AI detector 的分数不是作者身份、抄袭或不当使用的可靠证据。合规判断应基于来源、版本、修改记录、政策和作者可解释性,而不是追逐一个不可复核的“AI 率”。

本讲小结


课程结语

从“找函数”的原理,到检索、写作、智能体和推理服务,本课程真正反复练习的是同一种能力:定义问题、记录证据、暴露假设、让失败可见。工具会快速变化,这套验收习惯不会。