跳到正文

#图像生成

今日 0 条
10月7日周三
10月2日周五
  1. The Decoder62

    Ideogram 发布 Ideogram 4.5,称局部编辑不破坏画面其余部分

    Ideogram 发布新模型 Ideogram 4.5,称其只修改用户指定的区域,换装等编辑不会改变人物身形和背景,早期测试者确认多次编辑后一致性较强。该模型提供四档质量档位,每张图 0.8 至 22 美分,均为原生 2K 分辨率,现已上线 Ideogram 平台和 API,合作方包括 Picsart、Runway、Pika 和 Leonardo AI。

9月24日周四
  1. 公众号:蚂蚁百灵(Ling)67

    蚂蚁开源 Ming-Image-0.1-Design 系列:两个 6B 模型打通设计生成与图层编辑

    蚂蚁百灵开源 Ming-Image-0.1-Design 系列模型,包含两个 6B 模型:Design 从文字需求生成 UI、信息图、海报等完整设计,Layer 将设计图拆成 2 至 9 个可独立编辑的 RGBA 图层,并同步开源 Design Skill 和 PPT Skill。

    推荐理由:原文给出两个 6B 模型的能力划分、评测成绩和实际接入效果,读者可以据此评估设计生成加图层编辑链路的部署价值。

9月23日周三
9月22日周二
  1. 腾讯混元:Research(API)60

    腾讯混元发布 Hy Image3.5 preview 图像生成模型

    腾讯混元发布 Hy Image3.5 preview,支持文生图与图生图、最多 5 张参考图、多轮编辑和最高 2K 分辨率输出,经上百名专业设计师 GSB 盲测对上一代胜率综合提升 30% 以上。

    推荐理由:原文给出了文本渲染、编辑一致性与定价等具体能力细节,以及多家腾讯内部产品的实测反馈,便于评估适用场景。

9月21日周一
9月20日周日
  1. IT之家(RSS)68

    阿里千问开源 Qwen-Image-2.1 图像模型,支持透明图像与最多 10 张参考图

    阿里千问开源图像模型 Qwen-Image-2.1,将文生图与图像编辑整合在同一模型中,视觉生成部分仅 7B 参数,原生支持透明图像的生成与编辑。更新亮点包括轻量结构与推理优化、支持最多 10 张参考图的局部编辑与人像商品保真,以及文字排版和人物光影表现提升,模型已上架 GitHub、HuggingFace 和 ModelScope。

  2. Qwen:Blog Retrieval(API)72

    Qwen 开源 Qwen-Image-2.1:7B 统一生成与编辑并原生支持透明图像

    Qwen 团队开源 Qwen-Image-2.1,将文生图与图像编辑统一到一个模型中,视觉生成组件仅 7B 参数,并原生支持生成和编辑透明图像。模型支持最多 10 张参考图、圆形/涂鸦/独立蒙版指定局部编辑,通过混合粒度注意力架构和 KV cache 复用提升推理效率,同时改进文字渲染、人像光照与人物产品保真度,并覆盖全景图、信息图和分镜等任务。

    推荐理由:官方详解了 7B 统一图像模型的透明图像生成、10 图参考编辑与推理优化,读者可据此评估在设计等场景的可用性。

9月17日周四
9月14日周一
9月11日周五
9月10日周四
9月9日周三
  1. OpenAI:官网动态(RSS · 排除企业/客户案例)79

    OpenAI 发布 ChatGPT Images 2.5 图像模型

    OpenAI 发布 ChatGPT Images 2.5 图像模型,生成延迟比 Images 2.0 降低最多 50%,细节、编辑精度、参考照片保真度和多轮编辑一致性均有提升。

    推荐理由:官方原文给出与 Images 2.0 的具体对比数据、新功能入口和 API 双模型分工,读者可以据此评估是否迁移现有图像工作流。

9月5日周六
  1. Microsoft AI:官方博客(网页)63

    Microsoft 发布 MAI-Image-2.6 与 MAI-Image-2.6-Flash 图像模型

    Microsoft 于 9 月 4 日发布 MAI-Image-2.6,称其为迄今最强的图像模型,并面向开发者上线 Microsoft Foundry,同时推出面向低延迟、高吞吐场景的 MAI-Image-2.6-Flash。

    推荐理由:原文给出排名、速度和效率数字,并说明两个版本分别面向精度与吞吐的不同场景,便于开发者按工作流选型。

9月4日周五