智谱上线 GLM-5.3-FlashX,推理速度最高 200 tokens/s
智谱正式推出 GLM-5.3-FlashX,在 GLM-5.3-Flash 基础上加大对 Infra 侧投入与推理优化,速度最高 200 tokens/s,算力基于 10 万张国产芯片。该模型此前曾以 Ox Alpha 之名面向开发者,官方称其长期保持同尺寸最强智能水平并具备高性价比,API 已上线,Model Key:GLM-5.3-FlashX。
智谱正式推出 GLM-5.3-FlashX,在 GLM-5.3-Flash 基础上加大对 Infra 侧投入与推理优化,速度最高 200 tokens/s,算力基于 10 万张国产芯片。该模型此前曾以 Ox Alpha 之名面向开发者,官方称其长期保持同尺寸最强智能水平并具备高性价比,API 已上线,Model Key:GLM-5.3-FlashX。
阿里千问上线新一代原生全模态模型 Qwen3.8-Omni-Flash,可同时处理文本、图像、音频和视频输入,支持 1M 上下文。在 30 项评测上相比上一代 Qwen3.5-Omni-Plus 平均得分提升超过 26%,官方称音视频能力接近 Gemini 3.8 Flash、音频能力整体超过 Gemini 3.8 Flash。
通义千问发布 Qwen3.8-Omni-Flash,是 Qwen 首个以智能体能力为核心构建的全模态模型,支持原生音视频理解、推理和工具调用。
DeepSeek 发布 DeepSeek-V4.1-Flash,一个 552B 参数的多模态 MoE 模型,支持最长 100 万 token 上下文,模型权重已在 Hugging Face 开放。
推荐理由:论文给出了每 token KV cache 字节数等具体压缩指标,并与上一代模型直接对比,可评估长上下文 Agent 部署成本变化。
Figure 发布 Helix 2.5 模型,让人形机器人进入从未见过的家庭后立即自主完成整理客厅、折叠毛巾和整理床铺。Figure 在全球人类行为数据集 Index 上预训练该模型,并在湾区 30 户未收集过数据的家庭中实测;Index 预训练使任务成功率从 8% 提升到 56%,相比前代 Helix 02 只用一半任务专用数据即泛化到 30 个新环境。
PrismML 发布 Ternary Bonsai 2 27B,基于 Qwen3.8 27B,采用三值权重加 FP16 分组缩放,有效每权重 1.76 bit,模型体积 5.9GB,比全精度模型小 9 倍以上,基准综合得分 83.9,保留全精度模型 98.2% 的性能。
AI 实验室 PrismML 发布 Bonsai 2 27B,将阿里开源模型 Qwen3.8 27B 压缩到 5.9 GB,内存较原版减少 9 到 10 倍,可放进 PC 甚至高端智能手机。
Qwen 发布下一代原生全模态模型 Qwen3.8-Omni-Flash,支持文本、图像、音频和视频输入及 1M token 上下文窗口,29 项评测平均分较 Qwen3.5-Omni-Plus 提升超过 25%,音频输入每小时价格下降超过 98%,音视频输入每小时价格下降超过 93%。
推荐理由:官方发布同时开放 API 和开源插件与运行时,读者可以据此评估音视频智能体在剪辑、会议、实时交互等工作流中的落地方式。
蚂蚁 inclusionAI 在 GitHub 开源 Ming-Image-0.1-Design 系列,包含两个 6B 参数模型:Ming-Image-0.1-Design 生成 UI、信息图、海报等文字丰富的完整视觉设计,Ming-Image-0.1-Design-Layer 将平面设计图分解为可独立编辑的透明图层。
浙江大学等高校的外部研究者以 MiniCPM-o 4.5 为基座后训练,开源了端到端全模态交互智能体 Gander,论文、数据、代码和模型全部开放。
智谱 GLM 团队披露递归自我改进方向首个工程化实践,由 GLM-5.3 驱动的 Infra Agent 完成了 GLM-5.3-Flash 推理基础设施的设计、调试与优化。
TypeSafe AI 于 9 月 16 日发布 System One 模型 Jev,不生成文本,仅输出 Choice、Score、Noul 三类结构化决策,输入词元定价每百万 0.042 美元,输出词元免费。
Knowledgator Engineering 发布 schema 条件化编码器框架 GLiFormer,单个模型可在推理时按标签和 schema 完成 NER、分类、关系抽取、嵌套 JSON 结构化和文本嵌入。
Google 在 Gemini API 和 Google AI Studio 发布 Gemini 3.8 Live 与 3.8 Live Extended Thinking 语音模型,支持异步函数调用、视觉上下文、97+ 语言和可配置思考,Extended Thinking 版位列 Artificial Analysis 语音到语音榜单第一。
NVIDIA Vera Rubin NVL72 首次提交 MLPerf Inference v6.1 preview 结果,Qwen3-VL 上吞吐最高达 GB300 NVL72 的 3.7 倍,DeepSeek-R1 上最高 2.5 倍。
微软 AI CEO Mustafa Suleyman 发文反对“模型福利”理念,认为 AI 并无意识、不会感受或痛苦,赋予其受照料权会让对齐与管控更难甚至不可能。
由 ChatGPT 联合发明人 Diogo Almeida 创办的 TypeSafe 结束隐身模式,发布专用于程序化决策的 System One Model Jev。
科大讯飞上线语音基座大模型 Spark-Audio-1.0-Preview,采用 0.65B Dense 音频编码器搭配 30B-A3B MoE 大语言模型,使用 1300 万小时音频数据基于纯国产算力集群训练。
蚂蚁集团 inclusionAI 在 Hugging Face 发布 Realtime-Venus,包含 Realtime-Venus-Omni 和 Realtime-Venus-Audio 两个 9B 检查点,基于 MiniCPM-o 4.5 / Omni-Flow 架构,语言骨干为 Qwen3-8B。
Prior Labs 发布表格基础模型 TabPFN-3.5,参数量增至 220M,在 TabArena 等 7 个基准上排名第一。它在 2015 年 Otto Kaggle 竞赛上用原始数据和默认设置取得 0.375 的 private leaderboard log loss,优于冠军方案的 0.382,推理约 1 分钟。
Nums AI 发布预训练表格基础模型 Causilo,支持分类和回归,在 TabArena 单模型中取得最高 Elo,总体 1792.9,领先 Google Research 的 TabFM(1764.4)和 EXAONE Tabular(1758.8)。
火山引擎宣布豆包大模型 2.1 Pro 更新至 0915 版本,API 全量上线火山方舟,豆包 App 与 TRAE 已同步接入。
vivo 在 2026 开发者大会上发布四款蓝心大模型,包括端到端 MoE 架构的 BlueLM-RealTime、30 亿参数的 BlueLM-Nano 和搭载自研 Agentic 引擎的 BlueLM-Flash / Pro。同时推出系统级蓝心 Harness,深入原系统内核层,已增加 6000 多项原子技能,支持超万种任务,并预研蓝心 30B MoE 端侧大模型。
Google 发布 Gemini 3.8 Live 和 3.8 Live Extended Thinking 两个语音到语音模型,形态类似 OpenAI 的 GPT-Live 模型。
谷歌于 9 月 15 日推出 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking 两款实时对话模型,前者面向规模化部署与成本优化,后者面向高复杂度任务、强化多步推理。
Google 发布 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking 两款原生语音到语音对话模型,已在 Gemini Live API 和 Google AI Studio 上线,托管形式不提供开放权重。
Google 发布 Gemini 3.8 Live 与 Gemini 3.8 Live Extended Thinking 两款近实时语音对话模型,分别面向规模化成本效率和高复杂度多步推理任务。
Google DeepMind 发布 Gemini 3.8 Live 和 3.8 Live Extended Thinking 两款开发者语音模型,可通过 Gemini API 和 Google AI Studio 使用。