DeepSeek 发布 V4.1 Flash 模型,V4 Pro 服务推迟至 9 月 14 日下线
DeepSeek 于北京时间 2026 年 9 月 10 日正式发布 V4.1 Flash 模型并执行新的 Flash 定价,V4 Pro 服务推迟至 9 月 14 日 12:00 下线,届时将路由到 V4.1 Flash 并按其计费。
DeepSeek 于北京时间 2026 年 9 月 10 日正式发布 V4.1 Flash 模型并执行新的 Flash 定价,V4 Pro 服务推迟至 9 月 14 日 12:00 下线,届时将路由到 V4.1 Flash 并按其计费。
DeepSeek 宣布将快速模式、专家模式和识图模式合并为统一的智能模式,模型可自动检测查询复杂度、在检测到图片输入时激活视觉能力并按任务难度调整处理能力。
Suno 发布 v6 模型,可将图片、视频和语音备忘录转化为音乐,并对已创建的歌曲进行精确修改。同时提供 v6-wild 版本供探索更多可能性,官方附有 2 分钟以内的功能演示视频。
推荐理由:官方宣布 v6 上线并给出多模态输入与歌曲精修能力,可据此了解音乐生成模型的最新变化。
Vidu 团队发布 Vidu S2,包含实时交互数字人模型 Vidu S2-Avatar 和实时视频编辑模型 Vidu S2-Editing,并探索了二者的实时空间视频生成。
OpenAI 发布 GPT-6 Astra,已在 ChatGPT Work、Codex 和 API 提供,定价为每百万输入 token $10、输出 token $50。
Suno 发布 v6 AI 音乐模型,是首个获得唱片业支持的版本,训练数据包含来自 Warner Music Group、BMG 和 Believe 的授权内容及用户数据。
蚂蚁百灵发布 Ling-3.0-flash-VL,并与 Day-0 合作伙伴 Novita 同步上线,限时免费 14 天。
DeepSeek 发布 V4.1 Flash,在新架构下加入原生视觉理解,并通过 deepseek-flash 接口提供。旧版 V4 Flash 与视觉实验版已退役,原名称暂时指向新版;公告还宣布下调 API 价格。本次发布没有提供可核实的权重开放信息。
推荐理由:原生视觉进入默认 Flash 接口,同时发生旧模型映射调整,使用方需要重新检查模型选择与多模态任务表现。
Cohere 发布机器翻译模型 North Small Translate,为 MoE 架构,总参数 218B、激活 25B,支持 50+ 语言,WMT26 全语言得分为 83.60,高于 DeepL NextGen 的 81.37 和 Google Translate 的 68.20,Agentic 版本达 84.36。
推荐理由:官方公布了 WMT26 各语言和分区域得分、吞吐与单任务成本数据,读者可据此评估其相对 DeepL 和开源模型的位置。
Cognition 发布最先进编码模型 SWE-2,基于 2.8T 参数的 Kimi K33 后训练,在 FrontierCode 1.1 Main 取得 50.0%,仅比 Fable 5.1 低不到一分且便宜 64%。
推荐理由:官方详细公开了 SWE-2 的训练方法与成本惩罚公式,读者可以借此理解如何用 RL 推移整条成本性能前沿。
Genspark 与 Fireworks Lab 合作,通过 RL 后训练将开源多模态模型 MiniMax M3 打造成 Gen-1 Slides,可端到端规划、撰写并自查幻灯片。
IBM 发布 Granite Time Series PatchTST-FM-r2,约 385M 参数,支持最长 8,192 上下文、99 分位数概率预测和缺失值插补。
Suno 发布 v6 音乐模型,与 Warner Music、BMG 和 Believe 共同开发,并用 v6、v6-wild 和 v6-mini 三档替换全部旧模型,v6-mini 免费开放。
欧洲 AI 实验室 Desert Ant Labs 正式成立并上线首批 18 个端侧专用模型(12 个稳定版、6 个 beta),覆盖音频、视觉和文本任务,通过 Swift、Kotlin 和 JavaScript 的统一 SDK 提供,在 GitHub 和 Hugging Face 开放。
DeepSeek 计划于北京时间2026年9月10日左右正式发布 V4.1 Flash,官方称其在性能、成本、速度和任务完成时间等关键指标上全面超越 V4 Pro。
OpenAI 发布 ChatGPT Images 2.5,含 GPT-Image-2.5 Flare 和 GPT-Image-2.5 Sunburst 两个模型,主推更自然的光照、更可靠的参考图保留和局部编辑,Flare 延迟较 Images 2.0 降低最多 50%。
Suno 推出 v6 系列 AI 音乐模型,包含 v6、v6-wild 和 v6-mini 三款,并与华纳音乐、BMG 等唱片公司达成合作。v6 主打旗舰,v6-wild 面向实验性音乐,仅 v6-mini 向免费用户开放,另两款需 Pro 或 Premier 订阅。生成速度更快,几秒即可出音乐,支持自然语言编辑歌曲片段、从多个音频源生成混音、单独提取采样,并可从音频或图片等多模态输入生成歌曲。
面壁智能联合 OpenBMB 开源 2B 端侧基座模型 MiniCPM5-2B,在 AA 榜单获 23 分,居全球 4B 以下开源基座模型第一,Agentic Index 达 20 分,同级模型如 LFM2.5-2.6B、Granite 4.2 3B、Mistral 3 3B 仅 2 分。
DeepSeek 开放平台发布通知,计划于北京时间 2026 年 9 月 10 日前后正式发布 V4.1 Flash 模型,官方称经内外部多方测试,其在性能、费用、速度、总用时等指标上全面超越 V4 Pro。
inclusionAI 在 ModelScope 发布开源视觉模型 Ling-3.0-flash-VL,采用 MIT 协议,提供 BF16 和 FP8 两种权重。
蚂蚁集团发布并开源百灵系列首个原生多模态大模型 Ling-3.0-flash-VL。模型基于 Ling-3.0-flash 的 MoE 架构,总参数 124B、单次推理激活 5.5B,原生支持图像、文本与视频输入,上下文窗口 256K Token,并引入观察、行动、验证、修正的视觉反馈闭环机制。
蚂蚁百灵发布并开源首个原生多模态大模型 Ling-3.0-flash-VL,基于 Ling-3.0-flash 的 MoE 架构,总参数 124B,单次推理激活 5.5B,原生支持图像、文本与视频输入,上下文窗口 256K Token。
LG AI Research 发布面向结构化表格数据的分类与回归基础模型 EXAONE Tabular,完全基于 SCM 合成数据预训练,未使用任何真实表格数据,通过上下文学习免重训直接预测。
OpenAI 于 9 月 9 日发布图像生成模型 ChatGPT Images 2.5,在细节锐度、自然光照和纹理提升的同时,延迟较 2026 年 4 月的 Images 2 最多降低 50%。
Inception 发布 Mercury 2.5,称其为目前最强扩散大语言模型,智能较 Mercury 2 提升 40%,在 NVIDIA GPU 上达 1,107 tokens 每秒,上下文 260K tokens,定价 $0.20/百万输入、$0.75/百万输出,发布期 8 折优惠。
OpenAI 推出 API 新图像模型 GPT-Image-2.5 Flare 和 Sunburst,主要改进包括更锐利的细节、更强的风格遵循,以及更多对图像编辑的控制。
推荐理由:原文给出两款新图像模型在细节、风格遵循和编辑控制上的能力变化,读者可以据此判断 API 图像工作流的升级点。
OpenAI 发布 ChatGPT Images 2.5 图像模型,生成延迟比 Images 2.0 降低最多 50%,细节、编辑精度、参考照片保真度和多轮编辑一致性均有提升。
推荐理由:官方原文给出与 Images 2.0 的具体对比数据、新功能入口和 API 双模型分工,读者可以据此评估是否迁移现有图像工作流。
Inception 发布扩散大语言模型 Mercury 2.5,官方称智力较 Mercury 2 提升 40%,在常见 NVIDIA GPU 上速度达 1107 tokens/sec。
智元发布原生世界—动作模型GE-Act 2.0,所有参数从随机初始化在具身操作数据上从头训练,不针对评测任务微调或示范。