IBM 发布 Granite Time Series PatchTST-FM-r2,采用 Apache 2.0 与 OpenMDW 1.0 双许可
IBM 发布 Granite Time Series PatchTST-FM-r2,约 385M 参数,支持最长 8,192 上下文、99 分位数概率预测和缺失值插补。
IBM 发布 Granite Time Series PatchTST-FM-r2,约 385M 参数,支持最长 8,192 上下文、99 分位数概率预测和缺失值插补。
inclusionAI 在 ModelScope 发布开源视觉模型 Ling-3.0-flash-VL,采用 MIT 协议,提供 BF16 和 FP8 两种权重。
蚂蚁百灵发布并开源首个原生多模态大模型 Ling-3.0-flash-VL,基于 Ling-3.0-flash 的 MoE 架构,总参数 124B,单次推理激活 5.5B,原生支持图像、文本与视频输入,上下文窗口 256K Token。
LG AI Research 发布面向结构化表格数据的分类与回归基础模型 EXAONE Tabular,完全基于 SCM 合成数据预训练,未使用任何真实表格数据,通过上下文学习免重训直接预测。
Together AI 发布深度解析文章,介绍开发者从闭源模型转向开源模型所需的 AI 编码栈,提出由 Model、Inference、Gateways、Harness、Tools 组成的 MIGHT 框架。
推荐理由:原文给出开放权重模型编码栈的分层框架,读者可据此按任务选模型、按价格选供应商并保持工作流稳定。
Cohere 发布首个围绕 decode megakernel 构建的完整 LLM 文本生成服务系统,性能最高比 vLLM 快 1.58x。该系统为 North Mini Code 打造,完全开源。
LangChain 发布博客,介绍 deepagents 中的 context modes 如何帮助子智能体分叉 supervisor 的上下文或以隔离方式启动,从而让多智能体工作更快、更省、更聚焦。
本期开源模型汇总指出,2026 年开源模型竞争加剧带来许可证分化:Google 和 Meta 转向 Apache 2.0,而智谱 GLM-5.3 从 MIT 改为自定义许可证,要求年收入超 100 亿美元的推理或微调服务商通过 Z.AI 安全审查,且未定义关联方带来不确定性。
Berkeley RDI 推出开源平台 CUA-Lite,为计算机使用智能体提供三个标准化抽象。其环境接口下运行 15+ 个覆盖桌面、浏览器和移动端的基准,并提供含 30k+ 可验证任务的免 VM 桌面沙箱;统一监督数据格式已转换 10+ 个公开 CUA 数据集;每模型一个 harness 在评测、SFT 和 RL 间共享,支持 14 个模型族。
推荐理由:原文说明了平台的三项标准化抽象及覆盖规模,读者可以据此评估它在整合分散的计算机使用智能体资源上的可用性。
IBM Research 联合 Red Hat、Google 的开源项目 llm-d 展示在 544 块 NVIDIA H100 GPU 上部署 753B 参数的开放权重 MoE 模型 GLM-5.2(约 39B 激活),在数百到 3000 个并发编码智能体负载下峰值输出超 6.6M tokens 每分钟,零抢占。
Mistral 宣布完成 30 亿欧元 D 轮融资,投后估值超过 210 亿欧元,公司称这是欧洲科技公司有史以来最大的股权融资,距其成立三年。
推荐理由:融资公告由公司官方发布,给出了金额、估值、领投方和资金用途,读者可以据此了解欧洲主权 AI 阵营的资本动向。
OpenBMB 发布 MiniCPM5 端侧模型,采用 Apache 2.0 协议,1B 与 2B 版本支持 128K 上下文、编码、推理和智能体工具调用。
9 月 8 日,面壁智能联合 OpenBMB 开源 2B 端侧基座模型 MiniCPM5-2B,支持工具调用、深度搜索、代码生成。
vLLM 团队发布针对智能体负载优化的博客,基于 SemiAnalysis 的公开 AgentX 基准展示成果:DeepSeek V4 Pro 在 GB300 上达到 83K total tokens/GPU-秒。
推荐理由:vLLM 团队结合 AgentX 实测数据讲解智能体负载的全栈优化方法与失败教训,读者可以借此理解并行策略如何跟随模型架构调整。
蚂蚁 inclusionAI 在 Hugging Face 发布 LLaDA-UI,一个基于 MoE 的块扩散视觉语言 GUI 智能体,总参数约 16.7B,语言骨干为 LLaDA2.0-mini-base。
蚂蚁 inclusionAI 在 Hugging Face 发布 LLaDA2.2-mini,这是 LLaDA2 系列的轻量级智能体扩散语言模型,总参数 16B、推理仅激活 1.4B。
蚂蚁百灵发布 Ling-3.0-flash-Sante,一个基于 Ling-3.0-flash 构建、面向健康与医疗领域增强的 MoE 模型,名字取自法语 santé(健康)。
Anthropic 宣布 Claude 上月完成了 Fermat 大定理的首个形式化证明,这是迄今最大的 Lean 证明。
推荐理由:原文给出证明规模、验证范围和完整代码入口,读者可以据此了解 AI 形式化数学论证的实际能力边界。
Unsloth 宣布通过优化解码和新增 MTP 支持,让 GLM-5.3-Flash 的本地 GGUF 推理提速 1.6 至 3.4 倍,长上下文下最高达 3.3 倍。
推荐理由:原文给出本地运行 GLM-5.3-Flash 的具体加速倍数、显存需求表和现成 GGUF 资源,方法可直接复用。
蚂蚁 inclusionAI 发布开源统一图像生成与编辑模型 LLaDA-Image,提供 50 步 Base 和 4 步蒸馏 Turbo 两类 checkpoint,均有 BF16 与 FP8 版本。
蚂蚁 inclusionAI 发布开源统一图像生成与编辑模型 LLaDA-Image 家族,包括 6B 参数、50 步采样的 Base 版和 2-4 步的 Turbo 蒸馏版,同时提供 BF16 与 FP8 checkpoint 及 Diffusers 推理代码。
蚂蚁 inclusionAI 在 GitHub 发布 Choruz,一个本地优先的协作应用,让人类与 AI 智能体在类 Slack 空间中协作,每个 Agent 在独立工作区运行真实 CLI,可通过消息、线程、任务和文件交接工作。
Tom Tunguz 分析 Meta 发布 Muse Spark 模型及双轨 API 定价:Standard Tier(muse-spark-1.3)输入 $1.25/m。
推荐理由:作者用价差算出数据补贴的具体规模,把 Meta 双轨定价解读为 AI 数据供应链的垂直整合,提供了一种可迁移的分析视角。