本讲目录

第 17 讲 · 视频生成 I:原理

视频 = 图像 + 时间维。听起来只是加一维,但这一维引爆了三个新问题:数据量立方级膨胀、帧间必须连贯、物理要说得通。本讲按第 16 讲的四步框架把视频生成拆开——你会发现 80% 的零件在前 15 讲都见过,真正的新东西集中在"时间"上。

视频扩散:时空注意力/帧间一致性(图像扩散 + 时间维)。

图 17.1视频扩散:时空注意力/帧间一致性(图像扩散 + 时间维)。

1. 先算账:为什么视频难

一段 5 秒、24fps、720p 的视频 = 120 帧 × 1280×720×3 ≈ 3.3 亿个数——是一张 1024 图的百倍。直接在上面跑扩散,显存和算力都是灾难。更要命的是一致性:逐帧独立生成的图各自都好看,连起来就是闪烁的幻灯片——角色换脸、物体瞬移。视频生成的全部架构设计,都在回答"怎么让一百多帧共享同一个世界"。

2. 四步框架逐步过

2.1 表示:3D 因果 VAE(时空一起压)

图像 VAE 只压空间(8×8),视频 VAE 在时间轴上也压。主流配置(Wan/HunyuanVideo 一族):

\[ T \times H \times W \times 3 \;\xrightarrow{\;\text{3D VAE}\;}\; \frac{T}{4} \times \frac{H}{8} \times \frac{W}{8} \times C \]

时间 4×、空间 8×8,总压缩率 256 倍(对比图像的 48×)——120 帧的 720p 进潜空间后只剩约 31 帧的 90×160 小方块。两个设计细节值得知道:

2.2 范式:扩散 DiT,全时空注意力

在这个 3D 潜空间上跑扩散/流匹配(第 02–03 讲的数学原封不动——加噪、去噪、CFG、采样器全部照旧,只是张量多了个时间维)。去噪网络是 DiT(第 04 讲):把 \(\frac{T}{4}\times\frac{H}{8}\times\frac{W}{8}\) 的潜空间切成时空 patch 拉平成序列,上 Transformer。

关键演化在注意力的范围:

由此立刻推出实操规律(第 18 讲反复用):视频生成的成本对"时长 × 分辨率"极其敏感——帧数翻倍 ≈ 计算量四倍。先短后长、先小后大不是建议,是数学。

2.3 条件:文/图/音/结构四路

2.4 解码与后处理

3D VAE 解码回像素(显存峰值大户——第 18 讲的 tiled 解码就是为它准备的),再接后处理链:帧插值(RIFE 类光流网络,24fps 补到 48/60fps,比多生成帧便宜得多)和视频超分(第 14 讲思想的时序版)。

3. 模型系谱(2026 初快照)

闭源标杆:Sora 2(OpenAI,音视频联合生成)、Veo 3(Google,原生带音轨)、可灵/海螺/即梦(国内三强,商用成熟)。共同点:分钟级时长、原生音频、物理一致性显著领先——但只能网页/API 用,不可控不可组合。

开源三家(都已原生进驻你的 ComfyUI 0.22,节点表核实过)

系列 出品 规格 特点与定位
Wan 2.x 阿里 1.3B / 5B / 14B 生态最全:T2V/I2V/首尾帧/VACE 控制/音驱动全套;5B(TI2V)是 16GB 卡的甜点;中文提示词友好
HunyuanVideo 1.5 腾讯 8B 级 画质口碑好,1.5 版大幅减负;配套超分节点
LTX-Video / LTXV Lightricks 2B 级起 字当头(实时级),新版支持音视频联合;质量换速度的极致

选型直觉(第 18 讲展开):要快速迭代练手 → LTX;要质量与全功能 → Wan;要画质天花板 → HunyuanVideo 1.5

4. 与图像知识的对照总表

概念 图像版(前 15 讲) 视频版(本讲)
压缩表示 2D VAE,8×8 3D 因果 VAE,4×8×8
去噪网络 U-Net / DiT 时空 DiT(全 3D 注意力)
数学内核 DDPM/流匹配 + CFG + 采样器 完全相同
图生 X img2img(denoise 控制保留度) I2V(首帧钉死,全程生成)
结构控制 ControlNet Fun-Control / VACE
后处理 放大 + 修脸 插帧 + 视频超分
成本敏感度 分辨率平方 帧数×分辨率 平方

本讲小结


原理清楚了,下一讲开机实战:在 16GB 显存里跑通文生视频和图生视频——量化怎么选、显存怎么省、多久能出一条、以及把你的 VRChat 角色图变成动画。