本讲目录
第 17 讲 · 视频生成 I:原理
视频 = 图像 + 时间维。听起来只是加一维,但这一维引爆了三个新问题:数据量立方级膨胀、帧间必须连贯、物理要说得通。本讲按第 16 讲的四步框架把视频生成拆开——你会发现 80% 的零件在前 15 讲都见过,真正的新东西集中在"时间"上。
1. 先算账:为什么视频难
一段 5 秒、24fps、720p 的视频 = 120 帧 × 1280×720×3 ≈ 3.3 亿个数——是一张 1024 图的百倍。直接在上面跑扩散,显存和算力都是灾难。更要命的是一致性:逐帧独立生成的图各自都好看,连起来就是闪烁的幻灯片——角色换脸、物体瞬移。视频生成的全部架构设计,都在回答"怎么让一百多帧共享同一个世界"。
2. 四步框架逐步过
2.1 表示:3D 因果 VAE(时空一起压)
图像 VAE 只压空间(8×8),视频 VAE 在时间轴上也压。主流配置(Wan/HunyuanVideo 一族):
时间 4×、空间 8×8,总压缩率 256 倍(对比图像的 48×)——120 帧的 720p 进潜空间后只剩约 31 帧的 90×160 小方块。两个设计细节值得知道:
- 因果(causal)卷积:时间方向只看过去不看未来——好处是首帧可以独立编码,图生视频(I2V)时参考图无损进潜空间,且理论上支持流式;
- 压缩掉的时间信息 = 运动的高频细节,所以视频 VAE 的重建质量(快速运动是否糊)同样是各家的隐形战场(第 16 讲的规律重现)。
2.2 范式:扩散 DiT,全时空注意力
在这个 3D 潜空间上跑扩散/流匹配(第 02–03 讲的数学原封不动——加噪、去噪、CFG、采样器全部照旧,只是张量多了个时间维)。去噪网络是 DiT(第 04 讲):把 \(\frac{T}{4}\times\frac{H}{8}\times\frac{W}{8}\) 的潜空间切成时空 patch 拉平成序列,上 Transformer。
关键演化在注意力的范围:
- 早期(分解式):空间注意力(帧内互看)+ 时间注意力(同位置跨帧互看)交替——省算力(两个小注意力代替一个大的),但"斜向"的信息流通不畅,长距离运动容易断;给图像模型加时间层改装成视频模型(AnimateDiff 路线)就是这一代;
- 现代(全 3D 注意力):所有时空 patch 两两互看,序列长度 = \(\frac{T}{4}\cdot\frac{H}{8p}\cdot\frac{W}{8p}\)(数千到数万),\(O(n^2)\) 硬算——一致性由架构保证(任何一帧的任何位置都能直接"看到"其它所有帧),代价是算力按帧数平方增长。Sora 证明了这条暴力路线配合大数据能涌现出惊人的物理合理性,此后 Wan/HunyuanVideo/LTX 全部跟进。
由此立刻推出实操规律(第 18 讲反复用):视频生成的成本对"时长 × 分辨率"极其敏感——帧数翻倍 ≈ 计算量四倍。先短后长、先小后大不是建议,是数学。
2.3 条件:文/图/音/结构四路
- 文生视频(T2V):文本经编码器(视频模型普遍用大语言模型级编码器,如 umT5)注入——机制同第 04 讲;
- 图生视频(I2V,实用价值最高):参考图经 VAE 编码后钉在潜空间第一帧的位置,扩散只负责"把后面的帧长出来"。首尾帧模式(Wan 的 FirstLastFrame)同理钉两头,中间插值生成——你画布上见过的
WanImageToVideo/WanFirstLastFrameToVideo节点就是在做这个"钉帧"操作; - 结构控制:ControlNet 思想的视频版(Wan 的 Fun-Control / VACE):骨架序列、深度序列、参考视频的运动轨迹——第 05/12 讲的知识直接平移;
- 音频驱动:给一段语音让人像开口说话(Wan 的 SoundImageToVideo 一族),数字人的核心部件(第 21 讲)。
2.4 解码与后处理
3D VAE 解码回像素(显存峰值大户——第 18 讲的 tiled 解码就是为它准备的),再接后处理链:帧插值(RIFE 类光流网络,24fps 补到 48/60fps,比多生成帧便宜得多)和视频超分(第 14 讲思想的时序版)。
3. 模型系谱(2026 初快照)
闭源标杆:Sora 2(OpenAI,音视频联合生成)、Veo 3(Google,原生带音轨)、可灵/海螺/即梦(国内三强,商用成熟)。共同点:分钟级时长、原生音频、物理一致性显著领先——但只能网页/API 用,不可控不可组合。
开源三家(都已原生进驻你的 ComfyUI 0.22,节点表核实过):
| 系列 | 出品 | 规格 | 特点与定位 |
|---|---|---|---|
| Wan 2.x | 阿里 | 1.3B / 5B / 14B | 生态最全:T2V/I2V/首尾帧/VACE 控制/音驱动全套;5B(TI2V)是 16GB 卡的甜点;中文提示词友好 |
| HunyuanVideo 1.5 | 腾讯 | 8B 级 | 画质口碑好,1.5 版大幅减负;配套超分节点 |
| LTX-Video / LTXV | Lightricks | 2B 级起 | 快字当头(实时级),新版支持音视频联合;质量换速度的极致 |
选型直觉(第 18 讲展开):要快速迭代练手 → LTX;要质量与全功能 → Wan;要画质天花板 → HunyuanVideo 1.5。
4. 与图像知识的对照总表
| 概念 | 图像版(前 15 讲) | 视频版(本讲) |
|---|---|---|
| 压缩表示 | 2D VAE,8×8 | 3D 因果 VAE,4×8×8 |
| 去噪网络 | U-Net / DiT | 时空 DiT(全 3D 注意力) |
| 数学内核 | DDPM/流匹配 + CFG + 采样器 | 完全相同 |
| 图生 X | img2img(denoise 控制保留度) | I2V(首帧钉死,全程生成) |
| 结构控制 | ControlNet | Fun-Control / VACE |
| 后处理 | 放大 + 修脸 | 插帧 + 视频超分 |
| 成本敏感度 | 分辨率平方 | 帧数×分辨率 平方 |
本讲小结
- 视频 = 3D 潜空间上的扩散:VAE 多压一个时间维(256×),DiT 的注意力扩到全时空;
- 一致性靠"所有帧互相看见"的全 3D 注意力保证,代价是成本按帧数平方涨;
- I2V = 把参考图钉在第一帧;控制与后处理是图像知识的时序平移;
- 开源三家 Wan/HunyuanVideo/LTX 已原生进驻你的 ComfyUI。
原理清楚了,下一讲开机实战:在 16GB 显存里跑通文生视频和图生视频——量化怎么选、显存怎么省、多久能出一条、以及把你的 VRChat 角色图变成动画。