论文与图源¶
本页保存原始文献与图源;逐篇阅读重点见论文导读,配套录像见视频课程。
视频建模与因果生成补充¶
新增导读核对日期:2026-09-13。
| 论文 | 本轮固定版本 | 导读 |
|---|---|---|
| Video Diffusion Models | 2204.03458v2 | 时空建模 |
| Stable Video Diffusion | 2311.15127v1 | 视频数据与训练 |
| Diffusion Forcing | 2407.01392v1 | 各 token 的噪声水平 |
| Self Forcing | 2506.08009v1 | 自生成历史 |
基础论文¶
| 论文 | 在本系列中解决的问题 | 首读位置 |
|---|---|---|
| Auto-Encoding Variational Bayes · Kingma & Welling | VAE、ELBO、重参数化 | §2、Appendix B |
| Attention Is All You Need · Vaswani et al. | Transformer、Q/K/V、多头注意力 | Figure 1–2、§3 |
| Denoising Diffusion Probabilistic Models · Ho et al. | 加噪、噪声预测、反向采样 | Figure 2、Algorithm 1–2、§2–3 |
| Denoising Diffusion Implicit Models · Song et al. | DDIM 与更少时刻的采样 | §3–4 |
| High-Resolution Image Synthesis with Latent Diffusion Models · Rombach et al. | 为什么在潜空间生成 | Figure 3、§3 |
| Scalable Diffusion Models with Transformers · Peebles & Xie | DiT 与 adaLN-Zero | Figure 3、§3 |
| Flow Matching for Generative Modeling · Lipman et al. | 条件速度场、ODE、概率路径 | §3 |
| Flow Straight and Fast: Learning to Generate and Transfer Data with Rectified Flow · Liu et al. | Rectified Flow 与线性路径 | §2 |
| Classifier-Free Diffusion Guidance · Ho & Salimans | 条件引导 | §3 |
| RoFormer · Su et al. | 旋转位置编码 | §3 |
| FlashAttention · Dao et al. | 精确注意力的 IO 优化 | §3、Algorithm 1 |
这些论文承担不同层次的解释;建议沿学习地图逐步阅读,不必按发表年份从头读到尾。
模型一手来源¶
HunyuanVideo¶
- HunyuanVideo: A Systematic Framework For Large Video Generative Models,本次图源固定
v1。 - 官方仓库快照,本次核验 HEAD 为
e748c73ac064728bf6bd15b1cdb8161e55a4f331。 - 主干与默认配置:双流拼接 QKV、单流块、20+40 层、patch 配置。
- 文本编码器准备脚本:语言模型部分与 tokenizer 的处理。
Wan¶
- Wan: Open and Advanced Large-Scale Video Generative Models,本次图源固定
v1。 - Wan 2.1 快照,核验 HEAD 为
9737cba9c1c3c4d04b33fcad41c111989865d315。 - Wan 2.1 主干:self-attention、cross-attention、共享时间调制和每层偏置。
- Wan 2.1 任务配置:1.3B / 14B 的层数、宽度与 VAE stride。
- Wan 2.2 快照与官方技术说明,核验 HEAD 为
42bf4cfaa384bc21833865abc2f9e6c0e67233dc。 - Wan 2.2 任务配置:A14B 使用旧 VAE;TI2V-5B 使用 \(4\times16\times16\) 新 VAE。
MiniMax-H3¶
- 官方发布博客,页面发布日期 2026-07-31。
- 官方仓库固定快照,commit
d21241f0a4b3acbb34c97dae47fa417b7065e438。 - 原始 Transformer 配置、VisualVAE 配置、AudioVAE 配置。
- 官方模型卡与许可原文。
- SGLang 主干源码,commit
12771786f23190b1845db33366eba09cb5eacf41:attention 内部扩维、主块调制、非因果 dense 路径。 - SGLang packed sequence:区间组织、padding、update mask。
- SGLang scheduler:RF velocity 转换和 Euler 更新。
本次未找到 H3 正式技术报告入口。公开推理实现是一手实现证据,但不是训练报告;完整训练 loss、噪声耦合、同步目标等未公开细节保留为未知。
14 处论文截图¶
下表页码为 PDF 文件页序,从 1 开始。截图保留原论文图示,仅裁去无关正文;中文解读为本笔记整理,不属于原作者原文。论文和图片版权归各作者或相应权利人,本笔记不赋予它们新的许可。
| 截图 | PDF 版本与页码 | 使用位置 |
|---|---|---|
| DDPM Figure 2 | 2006.11239v2,p.2 |
Diffusion |
| DDPM Algorithm 1 / 2 | 2006.11239v2,p.4 |
Diffusion |
| Transformer Figure 1 | 1706.03762v7,p.3 |
Transformer |
| Transformer Figure 2 | 1706.03762v7,p.4 |
Transformer |
| LDM Figure 3 | 2112.10752v2,p.4 |
VAE |
| DiT Figure 3 | 2212.09748v2,p.3 |
DiT |
| HunyuanVideo Figure 5 | 2412.03603v1,p.5 |
学习地图 |
| HunyuanVideo Figure 6 | 2412.03603v1,p.6 |
VAE |
| HunyuanVideo Figure 8 | 2412.03603v1,p.7 |
模型架构 |
| HunyuanVideo Figure 9 | 2412.03603v1,p.9 |
文本编码 |
| Wan Figure 5 | 2503.20314v1,p.10 |
VAE |
| Wan Figure 6 | 2503.20314v1,p.11 |
特征缓存 |
| Wan Figure 9 | 2503.20314v1,p.13 |
模型架构 |
| Wan Figure 10 | 2503.20314v1,p.14 |
Wan block |
精确裁切区域、渲染比例、PDF SHA-256 与来源记录在截图清单。
两张官方原图¶
| 原图 | 固定来源 | 使用位置 |
|---|---|---|
| H3 overview | 官方 assets/overview.png |
H3 完整系统 |
| H3 full architecture | 官方 assets/full-arch.png |
H3-Base |
上述两图原样保留,明确标注为官方仓库图。归属:MiniMax H3 is licensed under the MiniMax H3 Community License Agreement, Copyright © 2026 MiniMax. All Rights Reserved. 许可副本与NOTICE随图保存。
如何复核一条结论¶
优先检查本页固定版本和对应章节。若是论文披露的训练方式,回到论文;若是层数、张量或 attention 具体操作,回到任务配置与源码;若是本文标注的“推导”,把数字代入公式重新计算。模型生成质量和加速效果没有在本轮笔记整理中运行实验验证。