Google 与 XPRIZE 联办的 Future Vision XPRIZE 揭晓,独立电影人 Jeff Synthesized 凭《The Gifted》获大奖
Google 与 XPRIZE、Range Media Partners 合办的 Future Vision XPRIZE 在洛杉矶揭晓,独立电影人 Jeff Synthesized 凭《The Gifted》从全球 2500 多件参赛作品中获得大奖。
Google 与 XPRIZE、Range Media Partners 合办的 Future Vision XPRIZE 在洛杉矶揭晓,独立电影人 Jeff Synthesized 凭《The Gifted》从全球 2500 多件参赛作品中获得大奖。
火山引擎为 Seedance 2.5 API 推出 Draft(样片)模式,先用 480P 快速生成样片验证创意,选中后再通过样片 ID 生成 1080P 成片,复用提示词、参考素材、seed、ratio、duration 等参数保证一致性。
推荐理由:官方给出了具体的成本节约数字和两阶段工作流说明,创作者可以据此判断是否把 Draft 模式接入自己的视频生成管线。
蚂蚁百灵开源 Ming-Image-0.1-Design 系列模型,包含两个 6B 模型:Design 从文字需求生成 UI、信息图、海报等完整设计,Layer 将设计图拆成 2 至 9 个可独立编辑的 RGBA 图层,并同步开源 Design Skill 和 PPT Skill。
推荐理由:原文给出两个 6B 模型的能力划分、评测成绩和实际接入效果,读者可以据此评估设计生成加图层编辑链路的部署价值。
Viggle 发布面向开源社区的首个 Qwen-Image-2.1 turbo 模型 Viggle-Turbo,采用 DMD 蒸馏,可生成和编辑图像。
推荐理由:原文给出 Arena 两个榜单的开源第一排名和具体分数,读者可以据此比较开源图像模型的当前水平。
腾讯混元发布混元图像 3.5 预览版(Hy Image3.5 preview),官方称综合能力较 Hy Image3.0 提升约 30%,内部数百名设计师 GSB 盲测中与 Seedream 5.0 pro 持平,略优于 Nano-Banana Pro 和 Qwen-Image-3.0 Pro。
腾讯混元发布 Hy Image3.5 preview,支持文生图与图生图、最多 5 张参考图、多轮编辑和最高 2K 分辨率输出,经上百名专业设计师 GSB 盲测对上一代胜率综合提升 30% 以上。
推荐理由:原文给出了文本渲染、编辑一致性与定价等具体能力细节,以及多家腾讯内部产品的实测反馈,便于评估适用场景。
Meshy 官方宣布 Meshy 应用上线手机端,用户拍下照片即可在几秒内生成3D模型。作者以路边交通锥为例,称早上在人行道拍的照片已在桌面打印出来,并邀请用户下载 Meshy 应用体验。
SGLang-Diffusion 发布对 Qwen-Image 2.1 的 Day-0 支持,覆盖文本生成图像、多图编辑和透明 RGBA 输出,单 checkpoint 即可完成。
Qwen 团队开源 Qwen-Image-2.1,将文生图与图像编辑统一到一个模型中,视觉生成组件仅 7B 参数,并原生支持生成和编辑透明图像。模型支持最多 10 张参考图、圆形/涂鸦/独立蒙版指定局部编辑,通过混合粒度注意力架构和 KV cache 复用提升推理效率,同时改进文字渲染、人像光照与人物产品保真度,并覆盖全景图、信息图和分镜等任务。
推荐理由:官方详解了 7B 统一图像模型的透明图像生成、10 图参考编辑与推理优化,读者可据此评估在设计等场景的可用性。
OpenRouter 对其路由的 20 个图像生成模型用相同提示词实测计费,单张图片成本在 $0.006 到 $0.134 之间,相差 22 倍。
推荐理由:OpenRouter 用同一提示词实测 20 个图像生成模型的真实计费,读者可以借此绕开各不相同的计价单位直接比较成本。
Pawprint Studio 的《Aniimo》本周在 GeForce NOW 首发上线,这是一款免费开放世界捉宠 RPG,玩家可用 Aniipods 捕捉 Aniimo 并 Twine 变身,无需等待 45GB 下载即可在 Steam Deck 和新支持的 Firefox 浏览器上串流。
蚂蚁 inclusionAI 在 GitHub 开源 Ming-Image-0.1-Design 系列,包含两个 6B 参数模型:Ming-Image-0.1-Design 生成 UI、信息图、海报等文字丰富的完整视觉设计,Ming-Image-0.1-Design-Layer 将平面设计图分解为可独立编辑的透明图层。
Meshy 宣布 Ultra 4K 正式上线,称其为首个达到 4K 几何分辨率的 AI 3D 建模功能,生成细节为其历史最丰富水平。附演示视频展示生成效果。
Google 发布图像生成工具 Google Pics,基于 Nano Banana 构建,现已上线 pics.new。支持局部对象编辑、图内文字修改与翻译、多人协作创作和单提示词生成多个选项。
推荐理由:原文列出了 Pics 的四项具体编辑与协作能力及可用范围,读者可据此判断是否值得一试。
Hugging Face 发布 Workflow1111,用 gr.Workflow 以 73 个节点、11 条媒体管线重建 AUTOMATIC1111 的大部分功能,覆盖文本生成图像、高清修复、图生图、prompt matrix、VLM 反推提示词、检测生成 inpaint 蒙版、ControlNet 式预处理器、背景移除、PNG Info 和图生视频。
推荐理由:原文展示用 Gradio Workflow 重建 AUTOMATIC1111 主要功能的具体做法,并给出 REST 与 MCP 入口,读者可评估它与 ComfyUI 的取舍。
推荐理由:原文给出完整的 12 步 3D 角色制作工作流和截图生成参考图的修正方法,Blender 初学者可以照着复用。