本讲目录

第 18 讲 · 视频生成 II:16GB 实机实战

原理归位,开机干活。本讲全部围绕你的 4060 Ti 16GB 展开:装什么模型、用哪个内置模板、参数怎么起步、显存怎么省、一条视频要等多久——以及把 VRChat 角色图变成动画的完整路径。你的 ComfyUI 0.22 已原生支持本讲全部节点(核实过),不需要装任何自定义节点就能出第一条视频

1. 选型:16GB 的三条路线

路线 模型 显存策略 定位
练手首选 LTX-Video 2B 直接跑 分钟级甚至秒级出片,迭代飞快,质量"够看"
主力推荐 Wan 2.2 TI2V-5B(fp8) fp8 + 省显存技巧 质量/功能/速度的平衡点,T2V 和 I2V 一个模型全包
画质上限 HunyuanVideo 1.5(fp8/量化) 量化 + 耐心 单条精品,慢

建议顺序:先 LTX 跑通全流程建立手感(当天见效),再上 Wan 5B 当主力。14B 级模型(Wan 14B 全量)超出 16GB 舒适区,等你需要时用 GGUF 量化版再战。

2. 下载与就位(对照第 06 讲目录 + 第 04 讲散件知识)

视频模型全部走散件分发(第 04 讲 4.2 节的知识在此上岗)。以 Wan 2.2 5B 为例,三件套:

E:\AI\Models\diffusion_models\  ← wan2.2_ti2v_5B_fp8_*.safetensors   (去噪 DiT, ~6GB)
E:\AI\Models\text_encoders\     ← umt5_xxl_fp8_*.safetensors          (文本编码器, ~6GB)
E:\AI\Models\vae\               ← wan2.2_vae.safetensors              (3D VAE, ~1.4GB)

LTX 则常见单文件 checkpoint(放 checkpoints\)+ 文本编码器。精确文件名和链接以 ComfyUI 官方文档(docs.comfy.org 的 video tutorials 页)为准——模板与模型是配套发布的,从模板页下载最不容易错版本。下载用 E:\AI\Tools 的 aria2(第 10 讲)。

3. 第一条视频:从内置模板出发

菜单 → Workflow → Browse Templates → Video 分区——Wan 2.2 T2V/I2V、LTX 的官方模板都在(你的 templates 包 0.9.79 已含)。模板加载后是熟悉的骨架(第 07 讲的读法完全适用):

UNETLoader(fp8) ┐
CLIPLoader      ├─▶ [文本编码 → WanImageToVideo/EmptyLatentVideo → KSampler → VAEDecode] ─▶ SaveVideo
VAELoader       ┘        (橙线/粉线的语义与图像完全一致, 只是张量多了时间维)

首跑参数纪律(重要,直接决定体验)

  1. 从小从短开始:480p 级分辨率 + 2–3 秒(约 49 帧@24fps)——第 17 讲的平方律意味着 720p×5s 的成本是它的近十倍。先小样验证提示词与运动,满意再放大重跑;
  2. steps 20–30、CFG 按模板默认(Wan 常用 5 左右);采样器按模板给的来(视频模型对采样器/日程的搭配比图像敏感,别急着自由发挥);
  3. 时间预期(4060 Ti 实测量级):LTX 短片分钟内;Wan 5B fp8 的 480p×3s 约几分钟,720p×5s 上到十几分钟——排队生成时避开 Medusa 的 07:30–09:00 窗口(第 06 讲);
  4. 首次运行会长时间"卡"在加载(十几 GB 权重进显存/内存),看日志别慌(第 15 讲)。

4. I2V:让你的 VRChat 角色动起来(本讲靶心)

图生视频是你素材库的最大增值项。用 Wan 2.2 的 I2V 模板(核心节点 WanImageToVideo——第 17 讲讲过的"钉首帧"):

  1. 参考图:第 12/13 讲产出的角色图(或直接 VRChat 截图),分辨率贴近目标输出,放 E:\AI\Inputs
  2. 提示词写"运动"而不是"画面"——画面已经被首帧钉死了,文字的职责是描述接下来发生什么:
镜头缓缓推近,女孩转头看向镜头微笑,长发随风轻轻飘动,樱花花瓣飘落
(镜头语言 + 主体动作 + 环境动态, 三件套)
  1. 运动幅度失控的两个方向:画面几乎不动 → 提示词加更明确的动作动词、检查模板里的运动强度参数;动得撕裂变形 → 降低运动描述的激烈程度、缩短时长;
  2. 角色一致性问题在视频里被时间维放大(长视频后段容易"换人")——3–5 秒内是开源模型的舒适区,更长的叙事用"多段生成 + 首尾帧衔接"(WanFirstLastFrameToVideo:上一段的尾帧当下一段的首帧)。

5. 显存与速度的工具箱

按无痛程度排序,OOM 或太慢时逐级启用:

  1. 降帧数(第一杠杆,平方律,49 帧不行降 33)→ 降分辨率(第二杠杆);
  2. fp8 权重:UNETLoader 的 weight_dtype 选 fp8 系(省一半显存,质量微损);
  3. Tiled VAE 解码:VAE Decode 换 VAEDecodeTiled——3D VAE 解码是显存峰值大户(第 17 讲),分块解码专治"生成完了、解码时 OOM";
  4. 自动卸载:ComfyUI 检测到显存不足会自动把文本编码器等挪去内存(你 32GB 内存是后备队,第 06 讲)——表现为变慢而不是崩溃,属正常;
  5. GGUF 量化(进阶):装 ComfyUI-GGUF 扩展后可加载 Q4/Q5 量化版大模型——14B 级模型进 16GB 的唯一通道,质量损失换规模;
  6. 生成期间别开浏览器看 4K 视频(真实建议——显卡是共享的)。

6. 后处理两件套

7. 排障速查(视频特有部分,通用部分回第 15 讲)

症状 原因 → 解法
生成完成、解码时 OOM 3D VAE 峰值 → VAEDecodeTiled
画面闪烁/糊成一团 模型三件套版本不配(VAE 尤其)→ 按官方模板页重新核对文件
几乎静止 运动描述太弱 / I2V 参考图与提示词矛盾
后段崩坏变形 时长超出舒适区 → 缩短或分段衔接
首帧和参考图不一致 参考图分辨率/比例与输出不符 → 先裁到目标比例
极慢且显存未满 权重被卸载到内存在爬行 → 降配置让它整体进显存

上机任务

  1. 装 LTX(或 Wan 5B 三件套),从内置模板跑通第一条 T2V:480p、3 秒、模板默认参数——今天就要看到自己的第一条视频;
  2. 用你最满意的一张 VRChat 角色图跑 I2V,按第 4 节写三种不同的运动提示词,各出一条对比;
  3. 固定一切,只把帧数从 49 改到 97,记录生成时间——亲手验证平方律;
  4. (装好插帧扩展后)给最好的一条补到 48fps,前后对比。

画面会动了,下一步给它声音。语音生成是 AIGC 里"本地开源最接近商业水准"的领域——你的声音克隆、角色配音,一张 16GB 卡绰绰有余。