摩尔线程“庐山”GPU 首发国产硬件光追,预计 2026 年底推出
摩尔线程在 2026 年半年度业绩说明会上表示,基于“花港”架构的“庐山”芯片预计 2026 年底推出,将实现 3A 游戏渲染提升 15 倍、AI 性能提升 64 倍、光线追踪性能提升 50 倍。该芯片的硬件光线追踪加速引擎支持 DirectX Raytracing (DXR),并配套全自研 MTAGR 1.0 AI 生成式渲染技术;具体销售时间以后续官方发布为准。
摩尔线程在 2026 年半年度业绩说明会上表示,基于“花港”架构的“庐山”芯片预计 2026 年底推出,将实现 3A 游戏渲染提升 15 倍、AI 性能提升 64 倍、光线追踪性能提升 50 倍。该芯片的硬件光线追踪加速引擎支持 DirectX Raytracing (DXR),并配套全自研 MTAGR 1.0 AI 生成式渲染技术;具体销售时间以后续官方发布为准。
LLaDA-Image 是一个统一框架,包含从零训练的 6B Diffusion Transformer 和基于 LLaDA2.0-Mini 扩散语言模型骨干的冻结视觉语言理解模块。
论文提出 Editable Visual Design 范式,由 Coding Agent 驱动,将 VLM 作为理解需求、规划任务和审美判断的创意大脑,将图像生成模型作为按需合成独立视觉素材的视觉世界模拟器。
蚂蚁 inclusionAI 发布开源统一图像生成与编辑模型 LLaDA-Image,提供 50 步 Base 和 4 步蒸馏 Turbo 两类 checkpoint,均有 BF16 与 FP8 版本。
蚂蚁 inclusionAI 发布开源统一图像生成与编辑模型 LLaDA-Image 家族,包括 6B 参数、50 步采样的 Base 版和 2-4 步的 Turbo 蒸馏版,同时提供 BF16 与 FP8 checkpoint 及 Diffusers 推理代码。
ZHO 发布创意系列新作《AGI》,标注由 GPT 4o Creation 生成。画面为一位佩戴黑色墨镜与 OpenAI 标志耳饰的女性含着写有 AGI 字样的红色棒棒糖,右下角带 O4Z 签名标识。
Meta Superintelligence Labs 首个图像模型 Muse Image 在 Artificial Analysis Image Arena 首次上榜。
Midjourney 向 alpha.midjourney.com 推送大型更新,新的 v8.2 编辑模型上线,lightbox 内置编辑器支持自然语言指令编辑、最多附 4 张参考图并集中查看会话编辑记录。同时测试 Change Style 风格探索功能,修复大量 bug,Niji 7 加 inpainting 已正常工作;下一步将设置默认参数和用提示词预览 sref。
Midjourney 员工 Caleb 宣布开始征集用户对后续优先事项的反馈和想法,提交入口为 midjourney.com/ideas,官方将在未来一两周内组织正式投票。
TestingCatalog 发现 OpenAI 正在准备图像模型的下一次升级,ChatGPT 内置的隐藏公告弹窗写着图像创作迎来重大升级,文案为更高质量结果、更快生成和更智能的创意工具。
小红书发布《关于 AI 制作医美、民宿等虚假内容治理公告》,将 AI 制作发布虚假内容纳入常态化治理。平台从细化管控重点、清理存量、严控新增三方面加大力度,今年 6-8 月清理 AI 虚假笔记近 12 万条,对发布 AI 虚假医美、民宿、教育内容的账号予以封禁或禁言处置,并要求创作者用 AI 内容声明功能标注 AI 生成内容。
开发者 Rick Brewster 于 9 月 1 日发布 Paint.NET 5.2 Build 9739 版,通过 Wine 首次实验性支持 Linux。最大障碍是 Paint.NET 长期依赖的 Direct2D 图形 API 在 Wine 上支持不完善,他自行开发了内部替代方案实现所需核心功能。
作者 Zho 发布 ENFINITY 演化系列视频作品《南瓜吸引子》。作者在引用中提到,用汉字阵做《攻壳机动队》(Ghost in the Shell)风格的转场再合适不过。
Grok Imagine 新增 Draw 功能,用户在菜单中选择 Draw 后画出任意内容,Grok 可在几秒内将其生成图像。作者称该功能适合儿童使用,并形容创造力因此成为超能力。
World Labs(李飞飞联合创立)发布世界模型 Atlas,可从几张照片完成 3D 场景生成、重建与仿真,输出最高 1440p、1 分钟的可控镜头视频,并支持点云与 3D Gaussian splats 等 3D 数据输出。
Zho 发布一段致敬草间弥生的创作,作品名为 ENFINITY,称持续进行中。附视频展示波点风格的南瓜与人物场景,正文仅此而已。
谷歌于9月1日宣布正式上线AI图像设计与编辑工具Google Pics,用户可通过 pics.new 使用网页版,并在 Google Docs 和 Google Slides 中直接调用编辑器。
李飞飞创办的 World Labs 发布多模态世界模型 Atlas,称其能以像素级精确相机控制生成图像和视频帧,并在 3D 中重建。Atlas 可输出最长 1 分钟的 1440p 视频,从一至数十张图像进行空间重建,支持时空模拟和文本生成图像与 360 度全景,部分合作伙伴已获抢先体验,未来几周内开放早期访问。
KAIST-VICLab 提出 ReFlowSET,一种条件潜空间流匹配框架,通过 SAR-EO 联合重建审计选择潜空间编解码器,并在该空间从零训练规模更小的条件 DiT。方法将中间噪声 EO 特征与冻结视觉基础模型提取的干净目标表征对齐,仅用于训练阶段,不增加推理成本;在 QXS-SAROPT 和 SAR2Opt 上取得 SOTA,代码与权重已在 GitHub 公开。
World Labs 发布新一代世界模型 Atlas,从零预训练,原生处理文本、图像、视频和 3D,架构为多模态自回归扩散 Transformer,输入以 3D 姿态形成空间上下文。模型支持相机控制生成(最长 1 分钟 1440p 视频)、稀疏视图 3D 重建、时空仿真和图像生成,在相机控制生成与 3D 重建任务上优于更专用的模型;现已开放早期访问申请,未来将驱动 Marble 等产品。
Miro 品牌团队分享如何完全用 Runway 制作 Canvas26 年度活动的开场视频,并本地化为四个城市的版本。此前年份依赖素材库加 3D 动效,今年每个镜头包括城市景观、人群和入场镜头都以 Runway 生成,再叠加基于 Miro Flows 节点连线设计的 3D 动效。
Google 发布图像创作与编辑工具 Google Pics,由 Nano Banana 图像生成模型驱动,将在未来几周内面向大多数 Workspace 客户及 Google AI Pro 或 Ultra 订阅用户推出。
这篇是 Google 团队 Elevating Antigravity Agent Skills 五部曲的第二部分,讲解如何在 agent skill 中使用 generate_image 工具,把结构化提示词合成与原生图像生成结合,让 agent 产出符合开发者规范的图像。
Google 发布 Workspace 图像创作与编辑工具 Google Pics,将在未来数周内面向所有 Google AI Pro 和 Ultra 订阅者及多数 Workspace 商业客户推出。
推荐理由:官方发布详解 Pics 的编辑控制与 Workspace 集成节奏,读者可据此判断它如何嵌入现有文档和幻灯片工作流。
OpenRouter 官方分享一条使用技巧:可在其基准浏览器(benchmark explorer)中浏览图像模型,并在 Agent 或 Chatroom 中快速编辑提示词。
Runway 公布 HORSE 活动结果,除大奖得主外另选出四名亚军,每人获得 50,000 credits,并向所有参与者致谢。