Cognition 发布 SWE-2 编码模型,以更低成本逼近前沿
Cognition 发布最先进编码模型 SWE-2,基于 2.8T 参数的 Kimi K33 后训练,在 FrontierCode 1.1 Main 取得 50.0%,仅比 Fable 5.1 低不到一分且便宜 64%。
推荐理由:官方详细公开了 SWE-2 的训练方法与成本惩罚公式,读者可以借此理解如何用 RL 推移整条成本性能前沿。
Cognition 发布最先进编码模型 SWE-2,基于 2.8T 参数的 Kimi K33 后训练,在 FrontierCode 1.1 Main 取得 50.0%,仅比 Fable 5.1 低不到一分且便宜 64%。
推荐理由:官方详细公开了 SWE-2 的训练方法与成本惩罚公式,读者可以借此理解如何用 RL 推移整条成本性能前沿。
Genspark 与 Fireworks Lab 合作,通过 RL 后训练将开源多模态模型 MiniMax M3 打造成 Gen-1 Slides,可端到端规划、撰写并自查幻灯片。
IBM 发布 Granite Time Series PatchTST-FM-r2,约 385M 参数,支持最长 8,192 上下文、99 分位数概率预测和缺失值插补。
Suno 发布 v6 音乐模型,与 Warner Music、BMG 和 Believe 共同开发,并用 v6、v6-wild 和 v6-mini 三档替换全部旧模型,v6-mini 免费开放。
欧洲 AI 实验室 Desert Ant Labs 正式成立并上线首批 18 个端侧专用模型(12 个稳定版、6 个 beta),覆盖音频、视觉和文本任务,通过 Swift、Kotlin 和 JavaScript 的统一 SDK 提供,在 GitHub 和 Hugging Face 开放。
DeepSeek 计划于北京时间2026年9月10日左右正式发布 V4.1 Flash,官方称其在性能、成本、速度和任务完成时间等关键指标上全面超越 V4 Pro。
OpenAI 发布 ChatGPT Images 2.5,含 GPT-Image-2.5 Flare 和 GPT-Image-2.5 Sunburst 两个模型,主推更自然的光照、更可靠的参考图保留和局部编辑,Flare 延迟较 Images 2.0 降低最多 50%。
Suno 推出 v6 系列 AI 音乐模型,包含 v6、v6-wild 和 v6-mini 三款,并与华纳音乐、BMG 等唱片公司达成合作。v6 主打旗舰,v6-wild 面向实验性音乐,仅 v6-mini 向免费用户开放,另两款需 Pro 或 Premier 订阅。生成速度更快,几秒即可出音乐,支持自然语言编辑歌曲片段、从多个音频源生成混音、单独提取采样,并可从音频或图片等多模态输入生成歌曲。
面壁智能联合 OpenBMB 开源 2B 端侧基座模型 MiniCPM5-2B,在 AA 榜单获 23 分,居全球 4B 以下开源基座模型第一,Agentic Index 达 20 分,同级模型如 LFM2.5-2.6B、Granite 4.2 3B、Mistral 3 3B 仅 2 分。
DeepSeek 开放平台发布通知,计划于北京时间 2026 年 9 月 10 日前后正式发布 V4.1 Flash 模型,官方称经内外部多方测试,其在性能、费用、速度、总用时等指标上全面超越 V4 Pro。
inclusionAI 在 ModelScope 发布开源视觉模型 Ling-3.0-flash-VL,采用 MIT 协议,提供 BF16 和 FP8 两种权重。
蚂蚁集团发布并开源百灵系列首个原生多模态大模型 Ling-3.0-flash-VL。模型基于 Ling-3.0-flash 的 MoE 架构,总参数 124B、单次推理激活 5.5B,原生支持图像、文本与视频输入,上下文窗口 256K Token,并引入观察、行动、验证、修正的视觉反馈闭环机制。
蚂蚁百灵发布并开源首个原生多模态大模型 Ling-3.0-flash-VL,基于 Ling-3.0-flash 的 MoE 架构,总参数 124B,单次推理激活 5.5B,原生支持图像、文本与视频输入,上下文窗口 256K Token。
LG AI Research 发布面向结构化表格数据的分类与回归基础模型 EXAONE Tabular,完全基于 SCM 合成数据预训练,未使用任何真实表格数据,通过上下文学习免重训直接预测。
OpenAI 于 9 月 9 日发布图像生成模型 ChatGPT Images 2.5,在细节锐度、自然光照和纹理提升的同时,延迟较 2026 年 4 月的 Images 2 最多降低 50%。
Inception 发布 Mercury 2.5,称其为目前最强扩散大语言模型,智能较 Mercury 2 提升 40%,在 NVIDIA GPU 上达 1,107 tokens 每秒,上下文 260K tokens,定价 $0.20/百万输入、$0.75/百万输出,发布期 8 折优惠。
OpenAI 推出 API 新图像模型 GPT-Image-2.5 Flare 和 Sunburst,主要改进包括更锐利的细节、更强的风格遵循,以及更多对图像编辑的控制。
推荐理由:原文给出两款新图像模型在细节、风格遵循和编辑控制上的能力变化,读者可以据此判断 API 图像工作流的升级点。
OpenAI 发布 ChatGPT Images 2.5 图像模型,生成延迟比 Images 2.0 降低最多 50%,细节、编辑精度、参考照片保真度和多轮编辑一致性均有提升。
推荐理由:官方原文给出与 Images 2.0 的具体对比数据、新功能入口和 API 双模型分工,读者可以据此评估是否迁移现有图像工作流。
Inception 发布扩散大语言模型 Mercury 2.5,官方称智力较 Mercury 2 提升 40%,在常见 NVIDIA GPU 上速度达 1107 tokens/sec。
智元发布原生世界—动作模型GE-Act 2.0,所有参数从随机初始化在具身操作数据上从头训练,不针对评测任务微调或示范。
DeepSeek 今日在官方交流群通知 DeepSeek V4.1 Flash 中间版本开启内测,采用新模型结构,原生多模态支持,能力更强、速度更快、成本更低。
OpenBMB 发布 MiniCPM5 端侧模型,采用 Apache 2.0 协议,1B 与 2B 版本支持 128K 上下文、编码、推理和智能体工具调用。
9 月 8 日,面壁智能联合 OpenBMB 开源 2B 端侧基座模型 MiniCPM5-2B,支持工具调用、深度搜索、代码生成。
微信 AI 于 9 月 4 日宣布开源通用多模态嵌入模型 WeMM-Embedding,包含 2B、4B、9B 三个版本,支持文本、图像、视频、视觉文档及任意交错的多模态输入。
OpenBMB 发布 MiniCPM5 系列第二个 checkpoint MiniCPM5-2B,2.52B 稠密模型,原生 131,072 token 上下文,Apache 2.0 权重,采用标准 LlamaForCausalLM 架构,可通过 vLLM、SGLang、llama.cpp、Ollama 等主流引擎直接运行。