导览:你的机器现状与路线图
这是《从找函数到智能体》的姊妹课程,讲生图:上篇把扩散模型的原理推透(为什么是加噪去噪、采样器下拉框里那些名字是什么数学、LoRA/ControlNet 为什么长那样),下篇在你 Win 机器的 E:\AI 真实安装上把 ComfyUI 用顺。目标只有一个:画布上每个节点、每个参数,你都知道它对应哪个数学对象、为什么非它不可——到那时 ComfyUI 就不再是"看着别人抄工作流",而是你自己的乐高。
你的机器现状(2026-07-10 实机核查)
以下清单是我通过 tailscale 连上你的 Win 机器逐项核实的,不是猜的:
| 项目 | 现状 |
|---|---|
| 硬件 | RTX 4060 Ti 16GB 显存 + 32GB 内存(够跑 SDXL 全家桶 + FLUX fp8) |
| 安装 | E:\AI\ComfyUI_windows_portable,portable 版 ComfyUI 0.22.0,内嵌 Python 3.13 + PyTorch 2.11/cu130 |
| 运行方式 | 桌面快捷方式 / E:\AI\Start_ComfyUI.bat,服务在 http://127.0.0.1:8188,带 Manager |
| 目录组织 | 模型/输入/输出/缓存/用户数据全部外置在 E:\AI 下,结构干净(第 06 讲逐目录讲) |
| 已有模型 | 仅 3 个底模:SD1.5、SDXL base 1.0、SD2.0-inpainting |
| 缺口 | LoRA / ControlNet / VAE / IP-Adapter / 放大模型 全空;自定义节点 零 |
| 已有工作流 | 只有一个 Codex 桥接用的 API 工作流(第 15 讲解释它是什么) |
诊断一句话:你的"操作系统"装好了,但"软件生态"还没装,而教程里看到的效果大多依赖生态——这是学得吃力的客观原因之一,不全是你的问题。第 10 讲会用兼容矩阵和核验卡,把模型、loader、模板、许可与 16GB 实测拆开记录。
版本双账本(2026-08-20):上表记录的是 2026-07-10 的真实机器快照,不代表机器已经升级。当日核验的 ComfyUI 稳定版为 v0.33.1(2026-08-13),本课程对快速变化章节的兼容性检查以该版本和配套官方模板为基线。实际升级仍需先备份工作流与
user/,再让模板预检缺失模型和节点;“版本号够新”本身不是工作流可运行的证明。查看 ComfyUI 官方 Releases
课程地图
上篇 · 原理 5 讲(全量推导,发挥你的数学背景)
| 讲次 | 主题 | 回答的问题 |
|---|---|---|
| 01 | 生成模型:学分布与采样 | 生图和 LLM 是什么关系?四条技术路线为何扩散胜出? |
| 02 | DDPM 全推导 | 为什么"学去噪"就能生成?ELBO 怎么落到一个平方损失? |
| 03 | 采样器与 CFG | euler/dpmpp_2m/karras 这些下拉框选项是什么数学?CFG 为什么默认 5–8? |
| 04 | 潜空间与整机架构 | VAE/CLIP/U-Net 各干什么?SD1.5/SDXL/FLUX 差在哪?checkpoint 和分体模型是什么关系? |
| 05 | 控制与定制的数学 | LoRA 为什么只有几十 MB?ControlNet 怎么"看着骨架画"? |
下篇 · 实战 10 讲(每讲都在你的 E:\AI 上操作)
06 你的机器与安装 → 07 逐节点拆解第一个工作流 → 08 参数手册 → 09 图生图与重绘 → 10 模型生态与下载清单 → 11 LoRA → 12 ControlNet(衔接你 Mac 上已有的 controlnet_aux 工具链和 VRChat 素材)→ 13 IP-Adapter 与角色一致性 → 14 放大与精修 → 15 工程化与排障。
拓展篇 · AIGC 全景 8 讲(16–23)
图像之外的整个 AIGC 版图:16 全景地图(用 representation、generation rule、conditioning、decoder/output 四问拆解新模型)→ 17/18 视频生成(原理 + 16GB 最小模板实验)→ 19 语音(TTS 范式、声音克隆与权利边界)→ 20 音乐与音效 → 21 3D 与数字人,最终串成一条"角色图 → 动画 → 配音 → 口型 → 配乐"的多模态流水线。第 22 讲是 2026-08 新增的 MiniMax H3 专题:把身份图、动作视频、声音参考与镜头脚本编排成原生双声道视频,并如实评估 16GB 本地运行边界。原 16–21 讲保留 ComfyUI 0.22 实机快照作为历史证据;H3 等新模板不能沿用旧版本结论,当时按 v0.33.1 与配套模板做兼容性检查。
2026-09-21 新增:第23讲 Qwen-Image 2.1。公开权重后,从配套三件套、原生模板、双图编辑到透明PNG验收完整练习;使用该讲独立记录的核心与模板快照,不能沿用0.22或0.33.1的兼容结论。你的Win机器尚未为本讲实测。
工作流实验室:workflows/ 提供 wf01–wf07 的 UI/API 两种 JSON。构建器会验证 14 个文件的结构、引用和正向条件支路,但这不等于当前机器已满足模型、节点与版本依赖;部分流程曾在旧环境实测,今天运行前仍要按工作流页补齐五层依赖账本并做冒烟测试。
怎么学
- 原理和实操交替:推荐顺序 01→07(先懂骨架再上手)→02→03→08→09(原理支撑参数)→10 以后按需。赶时间可以先走实操线 06→07→08→09→10,回头补原理;
- 每讲的操作跟着做:下篇每讲结尾有"上机任务",在你的 ComfyUI 里完成再进下一讲;
- 固定种子做实验:全课程反复用一个方法——固定 seed、每次只改一个参数、对比出图。这是把"玄学"变"科学"的唯一路径。
之前 GPT 给你写的《ComfyUI 入门指南》(在
E:\AI\ComfyUI_操作指南.md)是份合格的速查手册,本课程完全覆盖并深化了它的内容:它告诉你"按哪里",本课程告诉你"为什么按这里、按下去发生了什么"。速查时翻它,学习时读这里。
与《从找函数到智能体》的衔接
如果你已读过姊妹课程:第 01 讲的生成式建模、第 06 讲的 attention、第 08 讲的 CFG 一句话版都会在这里展开成完整推导;没读过也不影响——本课程自成一体,需要的前置会现场补。
第一讲从一个反差开始:LLM 逐词写句子,生图模型却是"从一团雪花噪声里显影出图像"——为什么图像选择了完全不同的生成方式?