Created by Codex and Xiaodong Cun (Corresponding Author), from GVC Lab, Great Bay University
📖 在线阅读(带全文搜索):https://gvclab.github.io/Video-Generation-101/
一份面向初学者、研究者、工程师与创作者的视频生成知识体系。它不以堆叠模型和榜单为目标,而是试图建立一条从生成原理、系统能力、世界理解到真实应用与验证的完整学习路径。
资料更新时间:2026-08
English summary
Video Generation 101 is a structured knowledge base on video generation, written for learners, researchers, engineers and creators. Rather than ranking models, it builds one continuous path from generative principles, through system capabilities and world understanding, to real applications and the evidence needed to believe them.
Five layers organise the material: generation foundations, system capabilities, controllable creation, world understanding, and an evidence framework.
Every chapter carries an explicit evidence snapshot date and separates author-reported numbers from independently reproduced ones. The prose is in Chinese; paper titles, venues and links are in English, and reference metadata is checked in CI.
视频生成正在从“根据条件合成一段画面”,走向能够持续保持状态、接受复杂控制、理解动作后果并服务真实任务的通用视频系统。本仓库围绕五个层面组织内容:
- 生成基础:视频怎样被表示,时间与运动怎样被建模,生成过程怎样训练和加速
- 系统能力:模型怎样扩展到多条件、多模态、长视频、流式生成与后训练
- 可控创作:怎样完成个性化、编辑、多视角、故事、多模态音视频与细粒度控制
- 世界理解:怎样从视觉合成进一步走向推理、物理一致性、动作条件预测与交互环境
- 证据体系:怎样通过评测、复现、反事实测试和闭环实验判断能力是否真实成立
仓库本身也是一次人机协作研究实践:Coding Agent 负责广泛检索、结构化整理和初稿生成,研究者负责问题定义、证据核验、边界判断与最终质量控制。
Coding Agent 扩展研究覆盖面,研究者对结论与证据负责。
不需要从头到尾阅读。选择与你当前目标最接近的入口即可;如需按读者身份获得完整的阅读顺序、跳读原则与阶段性产出,请使用分读者阅读指引。
| 读者与目标 | 建议入口 | 你将获得什么 |
|---|---|---|
| 第一次接触视频生成 | 零基础入门 | 用直观例子理解视频如何从条件与噪声中生成 |
| 希望建立完整技术框架 | 生成模型路线 | 串起表示、时序、生成机制、骨干网络与推理系统 |
| 关注模型能力与创作控制 | 视频基础模型 | 理解规模化、多条件、多模态与可控生成系统 |
| 准备选择研究问题 | 任务地图 · World Action Model | 从输入、输出、约束、行动后果与证据定位研究方向 |
| 希望追踪领域演进 | 技术时间线 | 观察不同路线如何长期并行、汇合与分化 |
| 关注落地与可靠性 | 应用地图 · 评测指南 | 把模型能力映射到真实任务与可验证标准 |
仓库以“原理 → 系统 → 能力 → 世界 → 应用”为主轴,并让评测与治理贯穿每一层。
| 板块 | 核心入口 | 延伸专题 |
|---|---|---|
| 生成原理 | 生成模型路线 | 视频 Tokenizer · Video DiT · 后训练与对齐 · 因果与流式生成 |
| 基础模型与控制 | 视频基础模型 | 个性化 · 细粒度控制 · 多视角/4D · 原生音视频 |
| 编辑与时序任务 | 视频编辑 | 视频补全 · 视频修复 · 视频虚拟试衣 · 故事与多镜头 |
| 推理与世界模型 | Video Reasoning · World Model · World Action Model | 物理一致性 · 动作条件预测 · 交互式世界生成 |
| 应用与研究资源 | 应用地图 · 评测指南 | 精选阅读 · 开放模型 · 数据集 |
| 路径 | 建议顺序 |
|---|---|
| 建立直觉 | 零基础入门 → 应用地图 → 任务地图 |
| 掌握技术体系 | 生成模型 → 基础模型 → 评测 |
| 开展研究 | 任务地图 → World Action Model → 技术时间线 → 精选阅读 → 具体专题 |
| 面向系统与应用 | 选择任务专题 → 开放模型 → 数据集 → 评测指南 |
| 按身份获得完整路线 | 分读者阅读指引 → 选择通识、创作/产品、工程、研究、世界模型或教学路线 → 完成对应阶段产出 |
展开查看仓库结构
Video-Generation-101/
├── README.md # 项目总览与学习入口
├── docs/
│ ├── getting-started.md # 零基础导览
│ ├── reader-guides.md # 分读者阅读顺序与阶段产出
│ ├── generative-models.md # 生成机制主线
│ ├── foundation-models.md # 视频基础模型
│ ├── video-reasoning.md # 视频推理
│ ├── world-models.md # 世界模型
│ ├── world-action-model.md # 世界—动作模型
│ ├── applications.md # 应用地图
│ ├── evaluation.md # 评测体系
│ ├── timeline.md # 技术时间线
│ ├── taxonomy.md # 任务地图
│ ├── tasks/ # 任务与能力专题
│ └── generative-models/ # 生成方法与系统专题
├── resources/ # 开放模型与数据集
├── bibliography/ # 结构化文献元数据
├── sources/ # 调研记录与证据审计
├── assets/ # 图片、图表与交互可视化
├── scripts/ # 文献与内容维护脚本
├── CONTRIBUTING.md
└── LICENSE
欢迎补充论文、开放模型、数据集、复现结果和勘误。提交前请阅读 贡献指南。
如果本仓库对您的研究、教学或项目有帮助,欢迎引用:
@software{video_generation_101_2026,
title = {Video Generation 101: From Pixel Animation to World Model},
author = {Cun, Xiaodong and Video Generation 101 contributors},
year = {2026},
version = {0.1.0},
url = {https://github.com/GVCLab/Video-Generation-101}
}完整引用元数据请参见 CITATION.cff。
本仓库以 MIT License 发布。论文、数据集、模型及第三方材料仍遵循各自的许可证和使用条款。

