本讲目录

导览:你的机器现状与路线图

这是《从找函数到智能体》的姊妹课程,讲生图:上篇把扩散模型的原理推透(为什么是加噪去噪、采样器下拉框里那些名字是什么数学、LoRA/ControlNet 为什么长那样),下篇在你 Win 机器的 E:\AI 真实安装上把 ComfyUI 用顺。目标只有一个:画布上每个节点、每个参数,你都知道它对应哪个数学对象、为什么非它不可——到那时 ComfyUI 就不再是"看着别人抄工作流",而是你自己的乐高。

你的机器现状(2026-07-10 实机核查)

以下清单是我通过 tailscale 连上你的 Win 机器逐项核实的,不是猜的:

项目 现状
硬件 RTX 4060 Ti 16GB 显存 + 32GB 内存(够跑 SDXL 全家桶 + FLUX fp8)
安装 E:\AI\ComfyUI_windows_portable,portable 版 ComfyUI 0.22.0,内嵌 Python 3.13 + PyTorch 2.11/cu130
运行方式 桌面快捷方式 / E:\AI\Start_ComfyUI.bat,服务在 http://127.0.0.1:8188,带 Manager
目录组织 模型/输入/输出/缓存/用户数据全部外置在 E:\AI 下,结构干净(第 06 讲逐目录讲)
已有模型 仅 3 个底模:SD1.5、SDXL base 1.0、SD2.0-inpainting
缺口 LoRA / ControlNet / VAE / IP-Adapter / 放大模型 全空;自定义节点
已有工作流 只有一个 Codex 桥接用的 API 工作流(第 15 讲解释它是什么)

诊断一句话:你的"操作系统"装好了,但"软件生态"还没装,而教程里看到的效果大多依赖生态——这是学得吃力的客观原因之一,不全是你的问题。第 10 讲有为这台机器和动漫素材场景定制的第一批下载清单。

课程地图

上篇 · 原理 5 讲(全量推导,发挥你的数学背景)

讲次 主题 回答的问题
01 生成模型:学分布与采样 生图和 LLM 是什么关系?四条技术路线为何扩散胜出?
02 DDPM 全推导 为什么"学去噪"就能生成?ELBO 怎么落到一个平方损失?
03 采样器与 CFG euler/dpmpp_2m/karras 这些下拉框选项是什么数学?CFG 为什么默认 5–8?
04 潜空间与整机架构 VAE/CLIP/U-Net 各干什么?SD1.5/SDXL/FLUX 差在哪?checkpoint 和分体模型是什么关系?
05 控制与定制的数学 LoRA 为什么只有几十 MB?ControlNet 怎么"看着骨架画"?

下篇 · 实战 10 讲(每讲都在你的 E:\AI 上操作)

06 你的机器与安装 → 07 逐节点拆解第一个工作流 → 08 参数手册 → 09 图生图与重绘 → 10 模型生态与下载清单 → 11 LoRA → 12 ControlNet(衔接你 Mac 上已有的 controlnet_aux 工具链和 VRChat 素材)→ 13 IP-Adapter 与角色一致性 → 14 放大与精修 → 15 工程化与排障。

拓展篇 · AIGC 全景 6 讲(16–21)

图像之外的整个 AIGC 版图:16 全景地图("四步框架"一次看穿所有模态)→ 17/18 视频生成(原理 + 你的 16GB 实机跑 Wan/LTX/HunyuanVideo,含把 VRChat 角色图变动画)→ 19 语音(TTS 三代范式、声音克隆、GPT-SoVITS/F5-TTS 本地部署)→ 20 音乐与音效(ACE-Step 在 ComfyUI 里直接出带人声的歌)→ 21 3D 与数字人,最终串成一条"角色图 → 动画 → 配音 → 口型 → 配乐"的全本地短片流水线。你的 ComfyUI 0.22 对视频/音乐/3D 的原生节点支持我已逐一核实——拓展篇实战零自定义节点即可起步。

工作流实验室workflows/ 里是我写好的分级工作流 JSON——wf01–wf04 用你现有的 3 个模型就能跑,wf05–wf07 等第 10 讲补完模型后跑。每个都在你的机器上实测过。加载方式见工作流页。

怎么学

  1. 原理和实操交替:推荐顺序 01→07(先懂骨架再上手)→02→03→08→09(原理支撑参数)→10 以后按需。赶时间可以先走实操线 06→07→08→09→10,回头补原理;
  2. 每讲的操作跟着做:下篇每讲结尾有"上机任务",在你的 ComfyUI 里完成再进下一讲;
  3. 固定种子做实验:全课程反复用一个方法——固定 seed、每次只改一个参数、对比出图。这是把"玄学"变"科学"的唯一路径。

之前 GPT 给你写的《ComfyUI 入门指南》(在 E:\AI\ComfyUI_操作指南.md)是份合格的速查手册,本课程完全覆盖并深化了它的内容:它告诉你"按哪里",本课程告诉你"为什么按这里、按下去发生了什么"。速查时翻它,学习时读这里。

与《从找函数到智能体》的衔接

如果你已读过姊妹课程:第 01 讲的生成式建模、第 06 讲的 attention、第 08 讲的 CFG 一句话版都会在这里展开成完整推导;没读过也不影响——本课程自成一体,需要的前置会现场补。


第一讲从一个反差开始:LLM 逐词写句子,生图模型却是"从一团雪花噪声里显影出图像"——为什么图像选择了完全不同的生成方式?