Wener Notes

Video Generation Awesome

约 8 分钟阅读
标签:模型Video Generation资源精选

视频生成、视频编辑、图像到视频和视频修复资源索引。

2026 重点模型

查证截至 2026-10-06。重点补充 2026-02 以后的模型,同时保留 1 月关键版本。日期优先采用官方发布记录;上传时间与正式公告日分开记录,不把仓库创建日当成模型发布日。

  • T2V:Text-to-Video,文本生成视频。
  • I2V / TI2V:Image-to-Video / Text-and-Image-to-Video,图像或图文生成视频。
  • V2V:Video-to-Video,视频编辑、变换或续写,具体能力按 checkpoint 判断。
  • Audio-Video Generation:生成同步音视频;Audio-driven Video:以已有音频驱动画面,两者要区分。
  • 开放权重表示可下载部署。表中的许可指权重;代码、编码器、VAE、超分组件还需分别核对。
datemodelsizeauthor权重许可关注点
2026-08-11LTX-2.5HuggingFaceHF:Lightricks/LTX-2.5huggingface.co · huggingface.co/Lightricks/LTX-2.522B DiTLightricksLTX-2.x Community同步音视频、原生多镜头、生成/编辑管线、dev 与 8 步 distilled;另配 Gemma 4 12B 编码器
2026-08-03MiniMax H3 BaseHuggingFaceHF:MiniMaxAI/MiniMax-H3huggingface.co · huggingface.co/MiniMaxAI/MiniMax-H333B TransformerMiniMaxMiniMax H3 Community,含地域限制FL2VA / Ref2VA:首尾帧、多模态参考、编辑、768p 立体声音视频;完整 2K 系统仅部分开放
2026-07-20Cosmos3-Super-Image2Video-4StepHuggingFaceHF:nvidia/Cosmos3-Super-Image2Video-4Stephuggingface.co · huggingface.co/nvidia/Cosmos3-Super-Image2Video-4Step64B MoTNVIDIAOpenMDW-1.14 步 I2V、Physical AI 与合成数据;原始 Super 系列于 05-31 发布,需较大显存
2026-07,权重上传记录Wan-Dancer-14BHuggingFaceHF:Wan-AI/Wan-Dancer-14Bhuggingface.co · huggingface.co/Wan-AI/Wan-Dancer-14B14BWan-AIApache-2.0音乐、参考图与文本驱动舞蹈;专项模型,不等于 Wan3.0 通用权重
2026-05-21LongCat-Video-Avatar-1.5HuggingFaceHF:meituan-longcat/LongCat-Video-Avatar-1.5huggingface.co · huggingface.co/meituan-longcat/LongCat-Video-Avatar-1.5基座 13.6BMeituanMIT音频驱动人物、单/多音轨、长视频续写、Whisper-large-v3、8 步蒸馏
2026-03,权重上传记录daVinci-MagiHumanHuggingFaceHF:GAIR/daVinci-MagiHumanhuggingface.co · huggingface.co/GAIR/daVinci-MagiHuman15BSII-GAIR / Sand.aiApache-2.0,模型卡声明人物中心同步音视频、多语言对白;base、distilled、540p/1080p 超分模型栈
2026-03-05LTX-2.3HuggingFaceHF:Lightricks/LTX-2.3huggingface.co · huggingface.co/Lightricks/LTX-2.322B DiTLightricksLTX-2 Community同步音视频、T2V/I2V、dev 与 8 步 distilled、时空上采样器;重要历史版本
2026-03-04HeliosGitHubPKU-YuanGroup/Helios14BPKU-YuanGroupApache-2.0T2V/I2V/V2V、分钟级自回归长视频、低延迟;Base、Mid、Distilled
2026-01-29SkyReels-V3GitHubSkyworkAI/SkyReels-V3R2V/V2V 14B;A2V 19BSkyworkSkywork Community多参考图、视频续写、镜头切换、音频驱动 Avatar;720p

官方项目与开放范围

  • Lightricks/LTX-2GitHubLightricks/LTX-2
    • LTX-2 Community / LTX-2.x Community, Python, Audio-Video DiT
    • 2.3 与 2.5 均为 22B,区别于早期 19B 的 LTX-2。2.5 原生多镜头保持角色、环境与音色,并更新视频解码器和文本编码器;发布记录 区分模型与 API 更新。
    • 2.5 分组件权重包供 ComfyUI / ltx-pipelines 使用;Diffusers 权重包HuggingFaceHF:Lightricks/LTX-2.5-Diffusershuggingface.co · huggingface.co/Lightricks/LTX-2.5-Diffusers 采用另一种布局。ComfyUI INT8 文件不能直接当成 PyTorch BF16 checkpoint。
    • 权重采用社区许可。2.3 LICENSEHuggingFaceHF:Lightricks/LTX-2.3huggingface.co · huggingface.co/Lightricks/LTX-2.3/blob/main/LICENSE 与 2.5 LICENSEHuggingFaceHF:Lightricks/LTX-2.5huggingface.co · huggingface.co/Lightricks/LTX-2.5/blob/main/LICENSE 有营收等条件;2.5 的模型卡按组织及关联实体合计年营收 1,000 万美元划分许可路径,微调权重转让另有条件。
  • MiniMax H3HuggingFaceHF:MiniMaxAI/MiniMax-H3huggingface.co · huggingface.co/MiniMaxAI/MiniMax-H3
    • 开放公告:开放 H3-Base-FL2VA、H3-Base-Ref2VA、相关 VAE 与推理材料。33B 是生成主干,还需要 Qwen3-VL-32B 编码器。
    • Base 输出 768p、4–15 秒、24fps、原生立体声音频;H3-Context-IR 与 H3-Regenerate-2K 未包含在本次开放范围。完整官方 2K 工作流仍依赖托管服务。
    • MiniMax H3 Community LicenseHuggingFaceHF:MiniMaxAI/MiniMax-H3huggingface.co · huggingface.co/MiniMaxAI/MiniMax-H3/blob/main/LICENSE 排除欧盟、英国、韩国、美国;商业产品/服务年营收超过 2,000 万美元等情形需另行授权。该许可不能标为 Apache-2.0 或全球自由商用。
  • NVIDIA/cosmosGitHubNVIDIA/cosmos
    • Cosmos 3 是世界模型家族;Super 为 64B MoT(32B Reasoner + 32B Generator),另有 16B Nano、4B Edge。I2V-4Step 是具体生成 checkpoint,不等于 Edge 的机器人动作模型。
    • Super I2VHuggingFaceHF:nvidia/Cosmos3-Super-Image2Videohuggingface.co · huggingface.co/nvidia/Cosmos3-Super-Image2Video 于 2026-05-31 发布,4Step 于 07-20 发布;模型卡采用 OpenMDW-1.1,推荐配置需要多卡 H100/H200 或 B200 等较大显存硬件。
  • PKU-YuanGroup/HeliosGitHubPKU-YuanGroup/Helios
    • Apache-2.0, Python, Autoregressive Video Diffusion
    • BaseHuggingFaceHF:BestWishYsh/Helios-Basehuggingface.co · huggingface.co/BestWishYsh/Helios-Base 用于质量/训练,DistilledHuggingFaceHF:BestWishYsh/Helios-Distilledhuggingface.co · huggingface.co/BestWishYsh/Helios-Distilled 用于速度,Mid 是蒸馏中间 checkpoint。
    • 作者报告单 H100 约 19.5 FPS、分钟级长视频;速度受 CPU、内存、驱动与配置影响。Offload 降低显存需求不能同时保证这一速度,也没有据此验证原生音频生成。
  • GAIR-NLP/daVinci-MagiHumanGitHubGAIR-NLP/daVinci-MagiHuman
    • 单流 15B Transformer 联合处理文本、视频与音频;开放 base、8 步 distilled、超分与推理代码,外部文本编码器、音频模型和 VAE 的许可另看各自来源。
    • HF 提交记录HuggingFaceHF:GAIR/daVinci-MagiHumanhuggingface.co · huggingface.co/GAIR/daVinci-MagiHuman/commits/main 可核对 2026-03-21~22 权重上传;正式公告日未单独确认。
    • 对 Ovi 1.1 的 80.0%、对 LTX-2.3 的 60.9% 胜率来自作者组织的 2,000 次成对评测;不改写成独立榜单第一。
  • SkyworkAI/SkyReels-V3GitHubSkyworkAI/SkyReels-V3

研究预览

  • Tencent-Hunyuan/PrismGitHubTencent-Hunyuan/Prism
    • MIT, Python, Sparse Attention, Audio-Video Generation
    • 面向原生 2K 音视频训练的动态稀疏注意力框架;截至 2026-10-06,Prism 权重HuggingFaceHF:FrancisRing/Prismhuggingface.co · huggingface.co/FrancisRing/Prism 中可见 alpha / beta preview,支持 720p、1080p、2K。
    • 官方新闻日期仍未填完整,正式发布日期与总参数量不在此推断;Prism-pro 仍是待办,不标成 HunyuanVideo 新正式版。
    • LICENSEGitHub FileTencent-Hunyuan/Prism/LICENSE 明确自有代码、参数和权重为 MIT;MOVA 等第三方组件维持各自许可。不能仅凭 Tencent-Hunyuan 组织名套用社区许可证。

SOTA 与选型

  • AA-Video-T2V v2.0 区分有声与无声评测;开放权重筛选 也不等于 MIT/Apache-2.0 或任意地域可商用。
  • 2026-10-06 有声 T2V 榜单快照中,Wan 3.0、Dreamina Seedance 2.5、MiniMax H3 等处于前列;开放权重筛选中 H3 768p 为 1138±9 Elo,LTX-2.5 Fast/Pro 为 947±10 / 944±10。这里是具体服务配置的盲评,下载权重自行部署不保证复现同一分数。
  • 通用音视频与多镜头关注 LTX-2.5、H3 Base;分钟级低延迟关注 Helios;人物表演关注 MagiHuman;音频驱动数字人关注 LongCat Avatar / SkyReels A2V;世界模拟与合成数据关注 Cosmos 3。
  • 比较时固定分辨率、帧率、时长、采样步数、音频条件和硬件;分别检查提示词遵循、物理/运动一致性、角色保持、对白与口型、长视频漂移。区分原生高分辨率、超分与视频修复。

商业模型参照

以下为产品/API 版本;截至查证日,本页未找到对应生成 checkpoint 的官方开放权重证据。

model2026 更新与能力官方来源
Wan 3.08 月商业版本;30 秒、30fps、多模态参考、原生对白/BGM/音效、视频编辑Alibaba Cloud API
Seedance 2.507-31 发布;30 秒叙事、多模态参考、音视频联合生成、编辑与延长;区别于 02-12 发布的 2.0ByteDance 公告
FLUX 3 Video08-04 一般可用;20 秒、多镜头、关键帧、续写、原生音频;Dev 开放权重仍在路线图BFL 公告
Kling VIDEO 3.0 / 3.0 Omni2 月版本;多镜头、参考元素、同步音视频;产品配置与开放权重分别核对Kling 官方指南
Veo 3.1 Lite03-31 Gemini API 付费层开放;T2V/I2V、720p/1080p、4/6/8 秒,成本档位参照Google 公告

Video Models

datemodelsizeauthornotes
2026-01-05LTX-2HuggingFaceHF:Lightricks/LTX-2huggingface.co · huggingface.co/Lightricks/LTX-219BLightricks同步音视频、T2V/I2V、LTX-2 Community
2025-11-20HunyuanVideo-1.5HuggingFaceHF:tencent/HunyuanVideo-1.5huggingface.co · huggingface.co/tencent/HunyuanVideo-1.58.3BTencentT2V/I2V、Tencent Hunyuan Community;LICENSE 记 11-21
2025-10-25LongCat-VideoHuggingFaceHF:meituan-longcat/LongCat-Videohuggingface.co · huggingface.co/meituan-longcat/LongCat-Video13.6BMeituanT2V/I2V、Video continuation、MIT
2025-07-28Wan2.2-T2V-A14BHuggingFaceHF:Wan-AI/Wan2.2-T2V-A14Bhuggingface.co · huggingface.co/Wan-AI/Wan2.2-T2V-A14B14B active / MoEWan-AIT2V、Apache-2.0
2025-07-28Wan2.2-TI2V-5BHuggingFaceHF:Wan-AI/Wan2.2-TI2V-5Bhuggingface.co · huggingface.co/Wan-AI/Wan2.2-TI2V-5B5BWan-AIT2V/I2V、720p/24fps、Apache-2.0
2025-03-12Open-Sora-v2HuggingFaceHF:hpcai-tech/Open-Sora-v2huggingface.co · huggingface.co/hpcai-tech/Open-Sora-v211Bhpcai-techT2V、Apache-2.0
2025-02-25Wan2.1-T2V-14BHuggingFaceHF:Wan-AI/Wan2.1-T2V-14Bhuggingface.co · huggingface.co/Wan-AI/Wan2.1-T2V-14B14BWan-AIT2V、Apache-2.0
2025-02-25Wan2.1-T2V-1.3BHuggingFaceHF:Wan-AI/Wan2.1-T2V-1.3Bhuggingface.co · huggingface.co/Wan-AI/Wan2.1-T2V-1.3B1.3BWan-AIT2V、轻量部署
2024-12-01HunyuanVideoHuggingFaceHF:tencent/HunyuanVideohuggingface.co · huggingface.co/tencent/HunyuanVideoTencentT2V
2024-08-27CogVideoX-5bHuggingFaceHF:zai-org/CogVideoX-5bhuggingface.co · huggingface.co/zai-org/CogVideoX-5b5BZhipuAIT2V、CogVideoX License
2024-08-06CogVideoX-2bHuggingFaceHF:zai-org/CogVideoX-2bhuggingface.co · huggingface.co/zai-org/CogVideoX-2b2BZhipuAIT2V、Apache-2.0、轻量

Video Generation

Video Restoration

Avatar 与 Lip Sync

视频生成平台与工作流

相关资源

  • Artificial Analysis Video Leaderboards
    • 分别查看 T2V/I2V、有声/无声、开放权重过滤与榜单版本;记录评测配置与查证日期。
  • 图像生成模型笔记Image Generation Awesome图像生成、图像编辑、修复、放大和扩散模型资源索引。 · Image Generation / Text-to-Image(T2I) · Image Editing / Image-to-Image(I2I) · Image Inpainting / Outpainting打开:/notes/ai/model/image/awesome
    • 参考图生成、图像编辑、RGBA 与多图一致性。

关联信息

反向链接、本文链接的其他页面和外部资料。

反向链接

  • AI Model
    笔记 · 视频生成

    AI Model Awesome 总索引 · LLM 与开放模型 · 图像生成 · 视频生成 · OCR · ASR / STT · TTS · VAD · 音乐生成 · VLM / MLLM / Vision · Agent 与 Coding

  • AI Model Awesome
    笔记 · 视频生成

    按模型能力和使用场景组织的 AI 模型资源索引,保留模型架构、厂商、版本、推理资源、量化、微调和扩散模型历史资料。新增内容优先写入对应专题页面。 · LLM 与开放模型 · 图像生成 · 视频生成 · OCR 与文档理解 · ASR / STT

站内链接

  • Image Generation Awesome
    笔记 · 图像生成模型

    图像生成、图像编辑、修复、放大和扩散模型资源索引。 · Image Generation / Text-to-Image(T2I) · Image Editing / Image-to-Image(I2I) · Image Inpainting / Outpainting

References

GitHub20 条
HuggingFace36 条
其他外链16 条
最近更新commit 42c1983Edit

On this page