Google 发布图像模型 Nano Banana 2.1,价格约为上一代一半
Google 发布图像生成与编辑模型 Nano Banana 2.1,取代 2026 年 2 月发布的 Nano Banana 2,1K 图像价格从 6.70 美分降至 3.36 美分,4K 从 15.10 降至 7.56 美分。
Google 发布图像生成与编辑模型 Nano Banana 2.1,取代 2026 年 2 月发布的 Nano Banana 2,1K 图像价格从 6.70 美分降至 3.36 美分,4K 从 15.10 降至 7.56 美分。
Black Forest Labs 发布 Flux 3 模型家族中的图像模型 Flux 3 Image,官方称其支持多步编辑且不改动图像其他部分,覆盖文生图、图生图、文字渲染和照片级真实感。
Ideogram 发布新模型 Ideogram 4.5,称其只修改用户指定的区域,换装等编辑不会改变人物身形和背景,早期测试者确认多次编辑后一致性较强。该模型提供四档质量档位,每张图 0.8 至 22 美分,均为原生 2K 分辨率,现已上线 Ideogram 平台和 API,合作方包括 Picsart、Runway、Pika 和 Leonardo AI。
蚂蚁百灵开源 Ming-Image-0.1-Design 系列模型,包含两个 6B 模型:Design 从文字需求生成 UI、信息图、海报等完整设计,Layer 将设计图拆成 2 至 9 个可独立编辑的 RGBA 图层,并同步开源 Design Skill 和 PPT Skill。
推荐理由:原文给出两个 6B 模型的能力划分、评测成绩和实际接入效果,读者可以据此评估设计生成加图层编辑链路的部署价值。
蚂蚁百灵开源 Ming-Image-0.1-Design 系列模型,包含两个 6B 模型,分别用于从文字生成 UI、信息图、海报等设计和将设计图拆为可编辑透明图层,同时开源 Design Skill 和 PPT Skill。
腾讯混元团队 9 月 22 日发布 Hy Image3.5 preview 模型,面向专业级生图,支持文生图、图生图和多轮对话创作,单次最多上传 5 张参考图,最高 2K 分辨率。
腾讯混元发布混元图像 3.5 预览版(Hy Image3.5 preview),官方称综合能力较 Hy Image3.0 提升约 30%,内部数百名设计师 GSB 盲测中与 Seedream 5.0 pro 持平,略优于 Nano-Banana Pro 和 Qwen-Image-3.0 Pro。
腾讯混元发布 Hy Image3.5 preview,支持文生图与图生图、最多 5 张参考图、多轮编辑和最高 2K 分辨率输出,经上百名专业设计师 GSB 盲测对上一代胜率综合提升 30% 以上。
推荐理由:原文给出了文本渲染、编辑一致性与定价等具体能力细节,以及多家腾讯内部产品的实测反馈,便于评估适用场景。
阿里 Qwen 团队发布 Qwen-Image-2.1,将文生图与图像编辑统一到一个 7B 单流 DiT 模型中,搭配 8B Qwen3-VL 编码器,支持原生 RGBA 透明输出和最多 10 张参考图编辑。
阿里 Qwen 团队发布开源权重图像生成与编辑模型 Qwen-Image-2.1,视觉生成部分仅 7B 参数,团队称在其自建基准上超过多数闭源模型,独立基准尚待验证,可在 RTX 3090 等消费级 GPU 上运行。
阿里千问开源图像模型 Qwen-Image-2.1,将文生图与图像编辑整合在同一模型中,视觉生成部分仅 7B 参数,原生支持透明图像的生成与编辑。更新亮点包括轻量结构与推理优化、支持最多 10 张参考图的局部编辑与人像商品保真,以及文字排版和人物光影表现提升,模型已上架 GitHub、HuggingFace 和 ModelScope。
Qwen 团队开源 Qwen-Image-2.1,将文生图与图像编辑统一到一个模型中,视觉生成组件仅 7B 参数,并原生支持生成和编辑透明图像。模型支持最多 10 张参考图、圆形/涂鸦/独立蒙版指定局部编辑,通过混合粒度注意力架构和 KV cache 复用提升推理效率,同时改进文字渲染、人像光照与人物产品保真度,并覆盖全景图、信息图和分镜等任务。
推荐理由:官方详解了 7B 统一图像模型的透明图像生成、10 图参考编辑与推理优化,读者可据此评估在设计等场景的可用性。
蚂蚁 inclusionAI 在 GitHub 开源 Ming-Image-0.1-Design 系列,包含两个 6B 参数模型:Ming-Image-0.1-Design 生成 UI、信息图、海报等文字丰富的完整视觉设计,Ming-Image-0.1-Design-Layer 将平面设计图分解为可独立编辑的透明图层。
SenseNova 团队发布 SenseNova-U1.5,一个 8B-MoT 原生统一多模态模型,在无编码器、无 VAE 架构内实现视觉理解、推理、生成和编辑。
Suno 发布 v6 AI 音乐模型,是首个获得唱片业支持的版本,训练数据包含来自 Warner Music Group、BMG 和 Believe 的授权内容及用户数据。
OpenAI 发布 ChatGPT Images 2.5,含 GPT-Image-2.5 Flare 和 GPT-Image-2.5 Sunburst 两个模型,主推更自然的光照、更可靠的参考图保留和局部编辑,Flare 延迟较 Images 2.0 降低最多 50%。
OpenAI 于 9 月 9 日发布图像生成模型 ChatGPT Images 2.5,在细节锐度、自然光照和纹理提升的同时,延迟较 2026 年 4 月的 Images 2 最多降低 50%。
OpenAI 推出 API 新图像模型 GPT-Image-2.5 Flare 和 Sunburst,主要改进包括更锐利的细节、更强的风格遵循,以及更多对图像编辑的控制。
推荐理由:原文给出两款新图像模型在细节、风格遵循和编辑控制上的能力变化,读者可以据此判断 API 图像工作流的升级点。
OpenAI 发布 ChatGPT Images 2.5 图像模型,生成延迟比 Images 2.0 降低最多 50%,细节、编辑精度、参考照片保真度和多轮编辑一致性均有提升。
推荐理由:官方原文给出与 Images 2.0 的具体对比数据、新功能入口和 API 双模型分工,读者可以据此评估是否迁移现有图像工作流。
微软于 9 月 4 日发布自研图像生成模型 MAI-Image-2.6-Flash,并通过 Microsoft Foundry 开放公开预览。该模型与旗舰版 MAI-Image-2.6 共享文生图和图像编辑核心能力,重点优化速度与成本;微软 AI 负责人 Mustafa Suleyman 称其生图速度是 GPT Image 2 的 2 倍,GPU 效率提高 72%。
Microsoft 于 9 月 4 日发布 MAI-Image-2.6,称其为迄今最强的图像模型,并面向开发者上线 Microsoft Foundry,同时推出面向低延迟、高吞吐场景的 MAI-Image-2.6-Flash。
推荐理由:原文给出排名、速度和效率数字,并说明两个版本分别面向精度与吞吐的不同场景,便于开发者按工作流选型。
蚂蚁 inclusionAI 发布开源统一图像生成与编辑模型 LLaDA-Image,提供 50 步 Base 和 4 步蒸馏 Turbo 两类 checkpoint,均有 BF16 与 FP8 版本。
蚂蚁 inclusionAI 发布开源统一图像生成与编辑模型 LLaDA-Image 家族,包括 6B 参数、50 步采样的 Base 版和 2-4 步的 Turbo 蒸馏版,同时提供 BF16 与 FP8 checkpoint 及 Diffusers 推理代码。
Meta Superintelligence Labs 首个图像模型 Muse Image 在 Artificial Analysis Image Arena 首次上榜。