本讲目录
第 18 讲 · 实战:论文与长文写作
论文不是“文字很多的文档”,而是一条可追溯的论证链:论断、证据、限定词、来源定位与作者责任必须逐项对得上。AI 可以帮助检索分诊、结构检查与语言编辑,但不能替作者决定证据支持了什么,也不能承担署名、保密和投稿责任。
学习层:一句听起来正确的话,为什么还不能提交?
1. 具体谜题:四个“核对过”不是同一件事
假设候选来源有一个能打开的标识符,标题和作者也对得上。你能否据此写下“工具 A 因果性地提高了所有研究生的科研效率”?不能。至少还有四个互不替代的问题:
- 身份:标识符、标题、作者、年份和版本是否指向同一条记录?
- 支持:原文研究设计、样本和结果是否蕴含当前论断的强度与范围?
- 定位:直接引文、表格数字和页码能否由另一位读者复核?
- 溯源与政策:你是否回到原始来源,并核对了具体投稿目标的当前规则与保密环境?
DOI 或书目元数据能帮助识别和发现记录,但不替你判断研究是否可靠、结论是否为真,或者当前句子是否获得支持。反过来,标识符暂时未解析也不等于来源已被证伪;准确结论是“身份尚未建立,不能采纳”。
2. 先预测:哪一关会先失败?
实验台内置五组完全虚构的教学记录,不联网,也不冒充真实论文。先只读预设名,预测第一个非 PASS 的 guard:
| 预设 | 先预测的故障 | 正确处置 |
|---|---|---|
| 干净链条 | 无 | 提交限定的描述性论断 |
| scope inflation | 样本、因果或外推越界 | 把主张缩回证据覆盖范围 |
| 元数据不一致 / 未解析 | 身份未建立 | 留在候选池,不写入参考文献 |
| 引文定位 / 原文不匹配 | quote 或 locator 不可复核 | 打开原文,按版本逐字重查 |
| 二手转引 | 未回到 primary source | 沿引用链回到原始记录 |
3. 最小模型:claim-source matrix
把一个段落拆成原子论断,再为每条论断记录来源和支持边界:
| 论断维度 | 必须记什么 | 常见越界 |
|---|---|---|
| 样本与任务 | 人群、任务、时间、纳入标准 | 从 12 个固定任务外推到所有任务 |
| 关系强度 | 描述、相关、预测还是因果 | 把观察性差异改写成“导致” |
| 外部效度 | 证据真正覆盖的场景 | 把单中心或单数据集写成普遍规律 |
| 数值与原话 | 分子、分母、单位、版本、locator | 引用摘要转述,却标成正文原话 |
证据账本要同时输出两条状态:
- 论断支持状态:
SUPPORTED / UNSUPPORTED / UNVERIFIED,回答“当前证据链是否支持这句限定论断”; - 投稿就绪状态:
READY / REVISE / BLOCKED,还要考虑目标政策、申报与保密环境。
这两条不能合并。比如一条限定论断已经得到虚构原始记录支持,但目标期刊的最新 AI 政策尚未核对,此时论断仍可为 SUPPORTED,稿件却必须是 REVISE、submission-ready = false。政策阻断不是事实性证伪。
4. 动手验证:逐关运行证据链
先选一个失败预设并提交预测,再逐次点击“运行下一关”。观察 claim-source matrix 中哪一行从 PASS 变成 WARN 或 BLOCK,然后比较原论断与限定论断。最后把目标政策切换为“具体投稿目标”,确认一个干净证据链为什么仍不能在未核对最新政策时直接提交。
无 JavaScript 时的静态读法:实验只使用虚构编号 FIC-SRC-01 至 FIC-SRC-05,不会访问 DOI、Crossref 或任何论文数据库。默认目标是“作者草稿”,四关结果如下:
| 预设 | 身份 | 范围 / 蕴含 | 引文 / 定位 | 溯源 / 政策 | 论断支持 | 投稿状态 |
|---|---|---|---|---|---|---|
| 干净链条 | PASS | PASS | PASS | PASS | SUPPORTED | READY |
| scope inflation | PASS | BLOCK | PASS | PASS | UNSUPPORTED | BLOCKED |
| 元数据不一致 | BLOCK | WARN | BLOCK | WARN | UNVERIFIED | BLOCKED |
| 定位不匹配 | PASS | PASS | BLOCK | PASS | UNVERIFIED | BLOCKED |
| 二手转引 | PASS | PASS | PASS | BLOCK | UNVERIFIED | BLOCKED |
干净预设的原句只声称:在 12 条虚构的固定任务记录中,A 的平均完成时间低于 B,不主张因果或外推。scope inflation 则把它夸张成“工具 A 因果性地提高了所有研究生在所有科研任务中的效率”。修订不是换几个同义词,而是把句子收回到“12 名参与者、固定任务、观察性描述、无外推”的证据范围。
若把干净预设的目标改为“具体投稿目标”,证据三关仍支持限定论断,但政策关给出 WARN:目标规则会变化,必须在投稿当天核对并留存版本。此时投稿状态为 REVISE,而不是把论断改判为假。
5. 误区与边界
- 候选不是引用。 LLM 可以生成检索词、作者名变体或候选题目,语义检索也可排序候选;在作者打开来源、核对身份与原文前,候选不得直接进入参考文献。
- 摘要不是全文证书。 摘要适合分诊是否值得精读,通常不足以核对限定条件、分析口径、表格数值和反例。把一段文字交给 AI 做 entailment 检查也只能当第二读者,不能替代作者回到原文。
- 可解析不等于支持。 DOI 解析或 Crossref 元数据匹配解决的是身份与发现问题,不验证研究质量、统计设计或当前论断。
- 声望不是证据质量。 期刊名、引用数和作者知名度都不能替代研究设计、数据、可复现性与相关领域的证据综合。
- 政策不是永久常量。 投稿前查看具体期刊、会议、学校或资助方的当前页面,并记录日期与版本。不同目标可能要求不同的披露位置和粒度。
- 保密先于便利。 未公开稿件、受限数据、审稿材料与合作方内容,只能进入机构和目标政策明确批准的环境;不确定时停止上传并询问负责人。
6. 回到写作:每段都能画成一条证据链
一段结果讨论可以按四句构造:先写观察到什么,再写证据位置,然后写限定条件,最后写仍未排除的替代解释。例如:
在固定任务集 T-12 的 12 条教学记录中,A 的平均完成时间为 82 秒,
B 为 97 秒(虚构记录 FIC-SRC-01,Table 2)。这是非随机描述性比较,
不能单独识别因果效应,也不外推到其他人群或任务。
AI 可以在你提供论断、证据与限制后检查跳步、术语一致性或语言表达;它若引入新数字、新来源或更强限定词,就必须回到账本重新验收。
7. 迁移任务
拿一段自己的课程报告,给每个可争论句标上 claim_id。为它填五列:来源身份、原文定位、支持范围、当前限定词、目标政策状态。删去任何找不到 locator 的直接引文;把“证明、导致、普遍”逐一改成与你的研究设计相称的动词。最后让同伴只看账本,尝试复核你的段落。
1. 从问题到成稿:按责任划分任务
不要用“AI 参与度高或低”替代判断。更稳定的做法是问:这一步需要什么输入证据、谁能验收、失败会造成什么后果?
| 任务 | AI 可以协助 | 作者必须验收 |
|---|---|---|
| 选题与假设 | 扩展问题空间、生成反例、列替代解释 | 新颖性、可证伪性、资源与伦理边界 |
| 文献发现 | 检索词、同义词、候选排序、阅读提纲 | 每条来源身份、原文、版本和支持范围 |
| 方法与分析 | 代码草案、测试、可视化、异常检查 | 设计选择、数据来源、统计口径、复现记录 |
| 结果与论证 | 质疑跳步、比较多种解释 | 主论点、因果强度、限制与学术贡献 |
| 文字与格式 | 改写、翻译、压缩、格式检查 | 语义不漂移、引用不丢失、最终逐句负责 |
核心原则不是“越靠近结论就完全不用 AI”,而是任何无法由作者独立解释、验证与承担责任的内容都不能进入稿件。
2. 段落协作:先交论证包,再让模型改文字
给模型的最小论证包包含:本段主张、证据位置、限定词、替代解释和不可引入的新内容。例如:
主张:在数据集 D 的预注册分析中,方法 A 的中位误差低于 B。
证据:表 2 第 3、5 行;单位为 mm;95% 区间见附录 B。
边界:这是单数据集结果,不写成普遍优越;不作因果解释。
任务:改成 120 词结果段,不添加数字、来源或机制解释,逐项列出改动。
中译英也遵守同一验收:逐句检查否定、概率、数量词和限定词。may、is associated with、improves 与 causes 不是文风差异,而是不同强度的科学主张。
3. 引用工作流:发现、核对、采纳、生成格式
- 发现:数据库、引文网络或 AI 只生成候选集合;
- 核对身份:标题、作者、年份、版本、标识符相互一致;
- 核对支持:打开原文,记录具体表、页、段、方法与限制;
- 采纳:只有通过前面两关的来源才能进入证据账本和参考文献库;
- 生成格式:用引用管理器从已核对的库生成文中引用与参考文献表,再人工抽查。
“不要让 LLM 直接生成并提交参考文献列表”不等于禁止它帮助找候选。真正的红线是:未经逐条打开和核对的候选不能伪装成已采纳来源。
4. 多轮打磨:每轮只问一种失败
- 论证轮:哪里跳步,证据与主张是否同强度,替代解释有没有被隐藏;
- 数字轮:正文、表格、图注、摘要的数值、单位、分母和版本是否一致;
- 引用轮:每条引文能否定位,二手转引是否已回到原始来源;
- 语言轮:术语、时态、代词、否定和限定词是否漂移;
- 审稿轮:让 AI 或同伴扮演批评者列问题,但由作者判断哪些意见成立;
- 压缩轮:删重复和背景,不删限制条件、失败结果或必要证据。
把每轮修改保存为可比较版本。一次要求“全面润色”会把论证修改和语言修改混在一起,反而难以验收。
5. 合规、披露与保密
投稿目标的 AI、署名、数据、图像、版权和披露政策可能变化,因此本页不给“多数期刊都如何”的永久结论。提交前查看目标官方说明,并保留核对日期。人类作者对稿件的准确性、完整性、原创性、引用、许可和披露负最终责任;AI 工具不能凭输出质量获得署名责任。
披露应写实际用途,而不是套用一个万能模板:使用了什么工具和版本、在哪些任务上使用、作者怎样复核、是否影响方法可复现性。若 AI 参与研究方法或数据分析,方法部分还要给出足够复现信息。不要把保密稿件、审稿材料或受限数据上传到未经明确批准的服务。
AI detector 的分数不是作者身份、抄袭或不当使用的可靠证据。合规判断应基于来源、版本、修改记录、政策和作者可解释性,而不是追逐一个不可复核的“AI 率”。
本讲小结
- 把论文看成 claim-source-provenance 链,而不只是流畅文本;
- 身份解析、论断支持、引文定位与投稿政策是四个不同检查;
- AI 可帮助发现候选和编辑文字,作者必须逐条核对并承担责任;
- 论断支持与投稿就绪要分账,政策未知不等于论断被证伪;
- 保密材料只进入明确获批准的环境。
课程结语
从“找函数”的原理,到检索、写作、智能体和推理服务,本课程真正反复练习的是同一种能力:定义问题、记录证据、暴露假设、让失败可见。工具会快速变化,这套验收习惯不会。