Wener Notes

Image Generation Awesome

约 7 分钟阅读
标签:模型Image GenerationDiffusion资源精选

图像生成、图像编辑、修复、放大和扩散模型资源索引。

能力范围

  • Image Generation / Text-to-Image(T2I)
  • Image Editing / Image-to-Image(I2I)
  • Image Inpainting / Outpainting
  • Image Upscaling / Super Resolution
  • Image Variation
  • Multimodal Understanding
  • 风格、角色、姿态和多图一致性

2026 重点模型

查证截至 2026-10-06。重点补充 2026-02 以后的发布,同时保留 1 月的重要基线。日期优先采用官方权重发布记录;只列月份的条目不推断具体发布日。

这里的“开放权重”表示可以下载并自行部署;研究许可、非商业许可和社区许可需分别看条款。表中的许可指权重,项目条目另列代码许可。规模采用作者口径,独立文本编码器、Prompt Enhancer、VAE 等不一定计入 DiT 参数量。

datemodelsizeauthor权重许可关注点
2026-09-20Qwen-Image-2.1HuggingFaceHF:Qwen/Qwen-Image-2.1huggingface.co · huggingface.co/Qwen/Qwen-Image-2.17B DiTQwenQwen Research License,非商业统一生成与编辑、原生 2K/RGBA、最多 10 张参考图、局部标注和 Mask 编辑
2026-09Ming-Image-0.1-DesignHuggingFaceHF:inclusionAI/Ming-Image-0.1-Designhuggingface.co · huggingface.co/inclusionAI/Ming-Image-0.1-Design6BinclusionAIMITUI、信息图、海报、密集文字、透明背景;另有 Design-Layer 图层分解模型
2026-07-20Cosmos3-Super-Text2Image-4StepHuggingFaceHF:nvidia/Cosmos3-Super-Text2Image-4Stephuggingface.co · huggingface.co/nvidia/Cosmos3-Super-Text2Image-4Step64B MoTNVIDIAOpenMDW-1.14 步蒸馏、Physical AI、合成数据;完整步数版于 05-31 发布,部署成本较高
2026-06-22Krea 2 Raw / TurboHuggingFaceHF:krea/Krea-2-Turbohuggingface.co · huggingface.co/krea/Krea-2-Turbo12BKreaKrea 2 Community License从头训练、审美与风格多样性;Raw 用于 LoRA/后训练,Turbo 用于 8 步推理
2026-05Lens / Lens-TurboHuggingFaceHF:microsoft/Lenshuggingface.co · huggingface.co/microsoft/Lens3.8B DiTMicrosoftMIT训练效率、最高 1440×1440;Lens 为 20 步,Turbo 为 4 步,Base 为 50 步
2026-05-08HiDream-O1-ImageHuggingFaceHF:HiDream-ai/HiDream-O1-Imagehuggingface.co · huggingface.co/HiDream-ai/HiDream-O1-Image8BHiDreamMITPixel-level UiT,无外部 VAE 或独立文本编码器;生成、编辑、主体个性化、2K
2026-04ERNIE-Image / TurboHuggingFaceHF:baidu/ERNIE-Imagehuggingface.co · huggingface.co/baidu/ERNIE-Image8B DiTBaiduApache-2.0中英文长文字、版式与结构化生成;SFT 为 50 步,Turbo 为 8 步,配套 Prompt Enhancer
2026-01-27Z-ImageHuggingFaceHF:Tongyi-MAI/Z-Imagehuggingface.co · huggingface.co/Tongyi-MAI/Z-Image6B DiTTongyi-MAIApache-2.0非蒸馏基础版,50 步、负面提示词、微调与多样性;区别于 2025 年的 Turbo
2026-01-26HunyuanImage-3.0-InstructHuggingFaceHF:tencent/HunyuanImage-3.0-Instructhuggingface.co · huggingface.co/tencent/HunyuanImage-3.0-Instruct80B MoE / 13B activeTencentTencent Hunyuan Community原生多模态、推理与提示词增强、多图编辑;另有 Instruct-Distil
2026-01-15FLUX.2 kleinGitHubblack-forest-labs/flux24B / 9B DiTBlack Forest Labs4B 为 Apache-2.0;9B 为非商业许可生成与多参考编辑,蒸馏版 4 步;Base 用于训练与 LoRA

官方项目与版本区别

  • QwenLM/Qwen-Image-2.1GitHubQwenLM/Qwen-Image-2.1
    • Qwen Research License, Python, DiT
    • 7B 指视觉生成主干;另有 Qwen3.5-VL 9B 的 T2I/I2I Prompt Rewriter。生成、编辑、RGBA 使用同一模型。
    • 权重 LICENSEHuggingFaceHF:Qwen/Qwen-Image-2.1huggingface.co · huggingface.co/Qwen/Qwen-Image-2.1/blob/main/LICENSE:仅研究/评估等非商业用途,商业使用需另获许可;不能沿用早期 Qwen-Image 的 Apache-2.0 标注。
  • inclusionAI/Ming-ImageGitHubinclusionAI/Ming-Image
    • MIT, Python, Image Generation
    • Design 与 Design-LayerHuggingFaceHF:inclusionAI/Ming-Image-0.1-Design-Layerhuggingface.co · huggingface.co/inclusionAI/Ming-Image-0.1-Design-Layer 是两个 6B 模型;前者生成设计稿,后者把已有设计拆为可编辑透明图层。官方验证的 BF16 部署使用至少 80 GiB 显存,6B 不代表完整管线显存很小。
  • NVIDIA/cosmosGitHubNVIDIA/cosmos
    • Cosmos 3 面向世界模拟、机器人和合成数据;Super 为 64B MoT,包含 32B Reasoner 与 32B Generator。Nano 为 16B,Edge 为 4B,能力需按具体模型卡判断。
    • Super Text2ImageHuggingFaceHF:nvidia/Cosmos3-Super-Text2Imagehuggingface.co · huggingface.co/nvidia/Cosmos3-Super-Text2Image 于 2026-05-31 发布;4Step 于 07-20 发布。4 步减少采样计算,不改变 64B 模型的显存需求。
  • krea-ai/krea-2GitHubkrea-ai/krea-2
    • Apache-2.0, Python, DiT
    • 代码为 Apache-2.0,两个开放 checkpoint 的权重采用 Krea 2 Community LicenseHuggingFaceHF:krea/Krea-2-Turbohuggingface.co · huggingface.co/krea/Krea-2-Turbo/blob/main/README.md。开放的 12B Raw/Turbo 与托管的 Krea 2 Large 不应混为同一版本。
    • 模型卡记权重发布于 06-22,技术报告 发布于 06-23;建议在 Raw 训练 LoRA、在 Turbo 推理。
  • microsoft/LensGitHubmicrosoft/Lens
    • MIT, Python, MMDiT
    • 组合 GPT-OSS 多层文本特征与 FLUX.2 semantic VAE;基座、RL 与 Turbo 三种 checkpoint 分别适合训练、质量与速度需求,外部组件许可另看各自模型卡。
  • HiDream-ai/HiDream-O1-ImageGitHubHiDream-ai/HiDream-O1-Image
    • MIT, Python, Pixel-level UiT
    • Full 与 Dev 于 05-08 开放;05-14 的 Dev-2604HuggingFaceHF:HiDream-ai/HiDream-O1-Image-Dev-2604huggingface.co · huggingface.co/HiDream-ai/HiDream-O1-Image-Dev-2604 专门优化 T2I。Dev-2604 不支持 Full 的全部编辑任务;编辑优先看 Full。
  • baidu/ERNIE-ImageGitHubbaidu/ERNIE-Image
    • Apache-2.0, Python, Single-stream DiT
    • TurboHuggingFaceHF:baidu/ERNIE-Image-Turbohuggingface.co · huggingface.co/baidu/ERNIE-Image-Turbo 使用 DMD 与 RL;长文字、复杂关系和多面板布局是重点。官方 GenEval、OneIG、LongTextBench 表格属于作者评测,Prompt Enhancer 的开关也是评测配置的一部分。
  • Tongyi-MAI/Z-ImageGitHubTongyi-MAI/Z-Image
    • Apache-2.0, Python, S3-DiT
    • 已发布 Z-Image 与 Z-Image-Turbo;截至查证日,官方 Model Zoo 中 Omni-Base、Edit 仍标记待发布,不能把能力展示当成已开放 checkpoint。
  • Tencent-Hunyuan/HunyuanImage-3.0GitHubTencent-Hunyuan/HunyuanImage-3.0
    • Tencent Hunyuan Community License, Python, MoE
    • Instruct 是 2026 年更新,3.0 原始 T2I 基座是 2025 年模型。许可HuggingFaceHF:tencent/HunyuanImage-3.0-Instructhuggingface.co · huggingface.co/tencent/HunyuanImage-3.0-Instruct/blob/main/LICENSE 有地域及规模限制,排除欧盟、英国、韩国。

商业模型参照

用于理解当前生成质量、编辑与服务能力;以下版本通过产品/API 提供,不列入开放权重模型表。

datemodel关注点官方来源
2026-09-08GPT Image 2.5 Sunburst / FlareSunburst 重精细编辑,Flare 重速度;T2I、多轮编辑、参考图保持OpenAI 公告
2026-08 / 09MAI-Image-2.6 / 2.6-Flash生成、精确编辑、不同吞吐/成本档位;区别于 MIT 的 LensMicrosoft 模型页
2026-07-08Seedream 5.0 Pro设计理解、复杂布局、多语言文字与多图编辑ByteDance 公告
2026-02-26Nano Banana 2 / Gemini 3.1 Flash ImageFlash 速度、世界知识、主体一致性、图像生成与编辑Google 公告

SOTA 怎么看

  • AA-Image-T2I v2.0 与 AA-Image-Editing v2.0 是不同任务的盲评榜单。2026-10-06 快照中,GPT Image 2.5 Sunburst/Flare 的 max 档位在两榜靠前;T2I 中 Qwen-Image-2.1 为 1036±10 Elo。这些结果要连同模型版本、质量档位与榜单版本一起看。
  • UI/文字排版、透明图层、主体一致性、微调成本与通用 T2I 偏好并非同一个目标。Ming 的设计任务、ERNIE 的长文字、HiDream 的原始像素架构、Krea 的审美与训练路径,各有收录价值,不能据此统一宣称“当前第一”。
  • 厂商 README 中的“发布时第一”、论文自测与独立榜单分别记录;不直接沿用历史排名。商业 API、社区许可权重、MIT/Apache-2.0 权重也分别判断。

Diffusion / Image Models

datemodelsizeauthornotes
2026-01-14GLM-ImageHuggingFaceHF:zai-org/GLM-Imagehuggingface.co · huggingface.co/zai-org/GLM-Image9B+7BZ.aiAR + Diffusion,T2I、I2I、文字渲染
2025-12-23Qwen-Image-Edit-2511HuggingFaceHF:Qwen/Qwen-Image-Edit-2511huggingface.co · huggingface.co/Qwen/Qwen-Image-Edit-2511AlibabaI2I、多图编辑
2025-11-26Z-Image-Turbo6BTongyi-MAIApache-2.0,8 NFE 快速生成
2025-11-25FLUX.2 dev32BBlack Forest LabsFLUX Non-Commercial License,多图编辑
2025-08-17Qwen-Image-EditAlibaba图像编辑、T2I、I2I
2025-08-04Qwen-ImageHuggingFaceHF:Qwen/Qwen-Imagehuggingface.co · huggingface.co/Qwen/Qwen-Image20BAlibabaApache-2.0,MMDiT,T2I、Editing、Text
2025-07-16HiDream-E1-1Image Editing
2025-06-16OmniGen27BVectorSpaceLabT2I、Editing、Composing
2025-05-29FLUX.1 Kontextdev 12BBlack Forest Labs上下文图像生成
2025-04-07HiDream-I117BFast / Dev / Full
2025-01-25Lumina-Image 2.02BOpenGVLabApache-2.0
2024-10-22SD 3.52.5B / 8BStability AIturbo / large / medium
2024-08-01FLUX.112BBlack Forest Labsdev / schnell
2023-07SDXL 1.03.5BStable Diffusion XL
2022-10SD 1.5983MRunwayMLStable Diffusion

常用模型与工具

FLUX

Stable Diffusion

Prompting

text
[人物描述] [场景构建] [摄影参数] [氛围强化] [细节补充]

评估关注点

  • Prompt adherence:提示词遵循度。
  • Generation quality:生成质量。
  • Consistency:风格、角色、场景和多图一致性。
  • Precise posing:角色和场景元素的精确姿态。
  • Compositing:多图、多层合成。
  • Relighting:重新打光。
  • Reference control:参考图、角色和风格控制。
  • Object insertion/deletion:对象插入、删除和替换。
  • Fine-tuning:是否适合针对业务数据进行微调。

相关资源

关联信息

反向链接、本文链接的其他页面和外部资料。

反向链接

  • AI Model
    笔记 · 图像生成

    AI Model Awesome 总索引 · LLM 与开放模型 · 图像生成 · 视频生成 · OCR · ASR / STT · TTS · VAD · 音乐生成 · VLM / MLLM / Vision · Agent 与 Coding

  • AI Model Awesome
    笔记 · 图像生成

    按模型能力和使用场景组织的 AI 模型资源索引,保留模型架构、厂商、版本、推理资源、量化、微调和扩散模型历史资料。新增内容优先写入对应专题页面。 · LLM 与开放模型 · 图像生成 · 视频生成 · OCR 与文档理解 · ASR / STT

  • Video Generation Awesome
    笔记 · 图像生成模型

    视频生成、视频编辑、图像到视频和视频修复资源索引。 · 查证截至 2026-10-06。重点补充 2026-02 以后的模型,同时保留 1 月关键版本。日期优先采用官方发布记录;上传时间与正式公告日分开记录,不把仓库创建日当成模型发布日。 · T2V:Text-to-Video,文本生成视频。

References

GitHub20 条
HuggingFace30 条
其他外链12 条
最近更新commit 42c1983Edit

On this page