本讲目录
第 18 讲 · 视频生成 II:16GB 实机实战
原理归位,开机干活。本讲全部围绕你的 4060 Ti 16GB 展开:装什么模型、用哪个内置模板、参数怎么起步、显存怎么省、一条视频要等多久——以及把 VRChat 角色图变成动画的完整路径。你的 ComfyUI 0.22 已原生支持本讲全部节点(核实过),不需要装任何自定义节点就能出第一条视频。
1. 选型:16GB 的三条路线
| 路线 | 模型 | 显存策略 | 定位 |
|---|---|---|---|
| 练手首选 | LTX-Video 2B | 直接跑 | 分钟级甚至秒级出片,迭代飞快,质量"够看" |
| 主力推荐 | Wan 2.2 TI2V-5B(fp8) | fp8 + 省显存技巧 | 质量/功能/速度的平衡点,T2V 和 I2V 一个模型全包 |
| 画质上限 | HunyuanVideo 1.5(fp8/量化) | 量化 + 耐心 | 单条精品,慢 |
建议顺序:先 LTX 跑通全流程建立手感(当天见效),再上 Wan 5B 当主力。14B 级模型(Wan 14B 全量)超出 16GB 舒适区,等你需要时用 GGUF 量化版再战。
2. 下载与就位(对照第 06 讲目录 + 第 04 讲散件知识)
视频模型全部走散件分发(第 04 讲 4.2 节的知识在此上岗)。以 Wan 2.2 5B 为例,三件套:
E:\AI\Models\diffusion_models\ ← wan2.2_ti2v_5B_fp8_*.safetensors (去噪 DiT, ~6GB)
E:\AI\Models\text_encoders\ ← umt5_xxl_fp8_*.safetensors (文本编码器, ~6GB)
E:\AI\Models\vae\ ← wan2.2_vae.safetensors (3D VAE, ~1.4GB)
LTX 则常见单文件 checkpoint(放 checkpoints\)+ 文本编码器。精确文件名和链接以 ComfyUI 官方文档(docs.comfy.org 的 video tutorials 页)为准——模板与模型是配套发布的,从模板页下载最不容易错版本。下载用 E:\AI\Tools 的 aria2(第 10 讲)。
3. 第一条视频:从内置模板出发
菜单 → Workflow → Browse Templates → Video 分区——Wan 2.2 T2V/I2V、LTX 的官方模板都在(你的 templates 包 0.9.79 已含)。模板加载后是熟悉的骨架(第 07 讲的读法完全适用):
UNETLoader(fp8) ┐
CLIPLoader ├─▶ [文本编码 → WanImageToVideo/EmptyLatentVideo → KSampler → VAEDecode] ─▶ SaveVideo
VAELoader ┘ (橙线/粉线的语义与图像完全一致, 只是张量多了时间维)
首跑参数纪律(重要,直接决定体验):
- 从小从短开始:480p 级分辨率 + 2–3 秒(约 49 帧@24fps)——第 17 讲的平方律意味着 720p×5s 的成本是它的近十倍。先小样验证提示词与运动,满意再放大重跑;
- steps 20–30、CFG 按模板默认(Wan 常用 5 左右);采样器按模板给的来(视频模型对采样器/日程的搭配比图像敏感,别急着自由发挥);
- 时间预期(4060 Ti 实测量级):LTX 短片分钟内;Wan 5B fp8 的 480p×3s 约几分钟,720p×5s 上到十几分钟——排队生成时避开 Medusa 的 07:30–09:00 窗口(第 06 讲);
- 首次运行会长时间"卡"在加载(十几 GB 权重进显存/内存),看日志别慌(第 15 讲)。
4. I2V:让你的 VRChat 角色动起来(本讲靶心)
图生视频是你素材库的最大增值项。用 Wan 2.2 的 I2V 模板(核心节点 WanImageToVideo——第 17 讲讲过的"钉首帧"):
- 参考图:第 12/13 讲产出的角色图(或直接 VRChat 截图),分辨率贴近目标输出,放
E:\AI\Inputs; - 提示词写"运动"而不是"画面"——画面已经被首帧钉死了,文字的职责是描述接下来发生什么:
镜头缓缓推近,女孩转头看向镜头微笑,长发随风轻轻飘动,樱花花瓣飘落
(镜头语言 + 主体动作 + 环境动态, 三件套)
- 运动幅度失控的两个方向:画面几乎不动 → 提示词加更明确的动作动词、检查模板里的运动强度参数;动得撕裂变形 → 降低运动描述的激烈程度、缩短时长;
- 角色一致性问题在视频里被时间维放大(长视频后段容易"换人")——3–5 秒内是开源模型的舒适区,更长的叙事用"多段生成 + 首尾帧衔接"(
WanFirstLastFrameToVideo:上一段的尾帧当下一段的首帧)。
5. 显存与速度的工具箱
按无痛程度排序,OOM 或太慢时逐级启用:
- 降帧数(第一杠杆,平方律,49 帧不行降 33)→ 降分辨率(第二杠杆);
- fp8 权重:UNETLoader 的
weight_dtype选 fp8 系(省一半显存,质量微损); - Tiled VAE 解码:VAE Decode 换
VAEDecodeTiled——3D VAE 解码是显存峰值大户(第 17 讲),分块解码专治"生成完了、解码时 OOM"; - 自动卸载:ComfyUI 检测到显存不足会自动把文本编码器等挪去内存(你 32GB 内存是后备队,第 06 讲)——表现为变慢而不是崩溃,属正常;
- GGUF 量化(进阶):装
ComfyUI-GGUF扩展后可加载 Q4/Q5 量化版大模型——14B 级模型进 16GB 的唯一通道,质量损失换规模; - 生成期间别开浏览器看 4K 视频(真实建议——显卡是共享的)。
6. 后处理两件套
- 帧插值:装
ComfyUI-Frame-Interpolation(RIFE,第 15 讲的安装流程),24fps 一键补 48/60fps,丝滑度立涨且几乎零成本——永远比多生成帧便宜(第 17 讲的账); - 视频放大:HunyuanVideo 1.5 有配套超分节点(
HunyuanVideo15SuperResolution);通用路线是逐帧过第 14 讲的放大管线再合成(Ultimate 系扩展有视频版)。顺序:先插帧后放大(插帧在小分辨率上算,省)。
7. 排障速查(视频特有部分,通用部分回第 15 讲)
| 症状 | 原因 → 解法 |
|---|---|
| 生成完成、解码时 OOM | 3D VAE 峰值 → VAEDecodeTiled |
| 画面闪烁/糊成一团 | 模型三件套版本不配(VAE 尤其)→ 按官方模板页重新核对文件 |
| 几乎静止 | 运动描述太弱 / I2V 参考图与提示词矛盾 |
| 后段崩坏变形 | 时长超出舒适区 → 缩短或分段衔接 |
| 首帧和参考图不一致 | 参考图分辨率/比例与输出不符 → 先裁到目标比例 |
| 极慢且显存未满 | 权重被卸载到内存在爬行 → 降配置让它整体进显存 |
上机任务
- 装 LTX(或 Wan 5B 三件套),从内置模板跑通第一条 T2V:480p、3 秒、模板默认参数——今天就要看到自己的第一条视频;
- 用你最满意的一张 VRChat 角色图跑 I2V,按第 4 节写三种不同的运动提示词,各出一条对比;
- 固定一切,只把帧数从 49 改到 97,记录生成时间——亲手验证平方律;
- (装好插帧扩展后)给最好的一条补到 48fps,前后对比。
画面会动了,下一步给它声音。语音生成是 AIGC 里"本地开源最接近商业水准"的领域——你的声音克隆、角色配音,一张 16GB 卡绰绰有余。