Mistral 称 Le Chonk 可挑战顶级 AI 模型
Mistral 表示其新模型 Le Chonk 能够与顶级闭源模型竞争,同时保持开放权重。
Mistral 表示其新模型 Le Chonk 能够与顶级闭源模型竞争,同时保持开放权重。
Simon Willison 表示欣赏 EmbeddingGemma 2 采用 Apache 2.0 许可。他认为嵌入模型不适合用闭源、仅托管的形式:嵌入模型通常要计算并存储成千上万甚至数百万个向量,一旦厂商停供该模型,用户就得为重新计算这些已存向量付费。他本人不愿自托管,更愿意付费使用托管版本,同时知道厂商停托管后可以自行运行开放权重版本,或另找能运行的供应商。
Google DeepMind 发布 EmbeddingGemma 2,将文本、代码、图像、视频和音频映射到统一嵌入空间,采用 Apache 2.0 许可,参数量 7.4 亿。
推荐理由:EmbeddingGemma 2 把文本、图像、音频、视频统一到同一嵌入空间,并给出端侧内存与向量截断的具体数据,便于判断本地检索与 RAG 的可行性。
法国 AI 实验室 Mistral 于周二发布 Mistral Large 4(ML4),这是一个 1 万亿参数的大规模多模态模型,绰号 Le Chonk,目前仅通过公开的 guardrail 端点访问,计划在三周内完成安全测试后开放权重。
Mistral 发布迄今最大模型 Mistral Large 4,拥有 1 万亿参数、490 亿激活参数,已在 Mistral Studio 开放 API 预览,权重预计 10 月底发布。
AI 公司 Reflection 发布首款免费开放模型 Beam,采用 MoE 架构,每 token 激活 5010 亿总参数中的 230 亿,面向编码、逻辑推理和智能体任务。
推荐理由:Reflection 首款开源权重模型 Beam 以 MoE 架构和超大规模 RL 训练,在推理与编码基准上以更少算力对标 GLM 5.2 和 Qwen 3.8。
Reflection 发布 Beam,一个面向编码、智能体与科研任务的纯文本 MoE 模型,总参数 501B、激活 23B,从零训练,Apache 2.0 全量权重将于本月放出。
Reflection AI 发布首款前沿开源权重模型 Beam,称其在高级推理基准上追平 Z.ai 的 GLM-5.2,并比当前领先的西方开源模型表现更好,推理算力用量少 3-4 倍。
Cloudflare 发布面向 AI 智能体的决策模型 Clef 和 Clef-flash,返回带概率的简短分类而非长文本,并称智能体决策不再必须有人参与。
AWS 发布开源决策模型 Strands Decider 2B,基于 Qwen3.5-2B 构建,可在本地运行,用于在预设选项中做选择并给出置信度评分。该模型由 AWS 杰出工程师 Marc Brooker 在看过 TypeSafe 的 Jev 后自行开发,曾在同规模模型的 Jevbench 排名上短暂登顶,随后由 Strands Labs 整理发布。
NVIDIA 发布开源表格基础模型 Kumo Tabular,对带标签表格做单次前向推理即可完成分类和回归,无需训练、调参或特征工程。
推荐理由:官方技术博客披露了架构、纯人工数据预训练配方和四项基准成绩,读者可据此评估其替换梯度提升树的可行性。
蚂蚁百灵 Ling-3.0-flash-Fin 在 FrontierFinance System Performance 与 Vals AI Finance Agent v2 两项金融智能体评测中取得领先。
H Company 发布 Holo4 系列通用计算机使用模型,包含 Holo4 27B(dense)和 Holo4 35B-A3B(MoE,3B 激活)两个规格,支持 256K 上下文,可在桌面、网页、Android、代码沙箱和业务 API 上以同一方式调用。
Jeff 发布基于 Qwen3.5 与 Gemma 4 微调的零样本分类模型 Jeff-Qwen3.5-0.8B、Jeff-Qwen3.5-2B 和 Jeff-Gemma4-E2B,与 Jev 使用相同请求格式,单次前向输出各选项校准概率。
华为发布了 openPangu 2.0 的代码,涵盖预训练、监督微调及强化学习后训练环节。此次发布扩展了其基于昇腾硬件原生训练与推理的开放 AI 模型计划,相关模型组件正逐步添加至开源平台。
H Company 发布通用计算机使用智能体模型系列 Holo4,含 27B dense 和 35B-A3B MoE 两个尺寸,并基于 Nemotron 3 Nano Omni 推出 Holotron4 Nano。
推荐理由:原文给出跨 GUI、代码、MCP 和 API 的统一智能体模型设计、基准分数和成本对比,并开源权重与轨迹数据,读者可评估其实际可用性。
华为 9 月 28 日宣布,开源盘古 openPangu-2.0 的预训练、SFT 代码和后训练 RL 代码正式开源上线。openPangu 是华为开源 AI 模型品牌,通过昇腾原生训练与推理技术为业界提供最佳实践参考,相关代码已上线 gitcode.com 的 ascend-tribe/openPangu-2.0-Training 和 openPangu-2.0-RL 仓库。
H Company 发布 Holo4 的二百七十亿参数稠密模型和混合专家版本,提供 API、可下载权重与多种量化格式。模型把桌面、网页、安卓操作及代码和工具调用结合在同一智能体中;不同测试平台的分数不能直接横向比较。
推荐理由:开放权重和量化版本让团队能在自有环境尝试界面操作智能体,并对不同设备和工具组合开展实际任务评测。
巴西 AI 实验室 Supersonic Labs 发布 144.3M 参数的开源决策模型 Julia 1,权重以 Apache 2.0 协议托管在 Hugging Face,可在普通 CPU 上运行,不生成文本,只对 2 到 20 个候选答案输出选择和概率。
Aikido Security 发布首个开源权重安全模型 Altar-1,将 Z.AI 的 GLM-5.3 经 AWQ 4-bit 量化和 Cerebras REAP 专家剪枝(每层保留 168/256 个专家)从 1,506.7 GB 压缩到 328 GB,缩小 78.2%。
Black Forest Labs 发布 7B 开源权重世界动作模型 FLUX 3 Action,用于机器人控制,在 RoboLab-120 上以 42.92% 任务成功率排名第一,领先 Cosmos 3 Nano 6.1 个百分点且参数少 56%。
Black Forest Labs 发布 FLUX 3 Action,一个 7B 参数、开放权重的世界动作模型。官方称可将 FLUX 的视觉智能转化为动作能力,用于机器人、模拟器或游戏。
Black Forest Labs 发布面向机器人的开源模型 FLUX 3 Action,基于以视频数据训练的多模态 FLUX 3,可从机器人工作区的多机位视频预测智能体下一步动作及环境变化。BFL 称其仅 70 亿参数即在 RoboLab-120 排行榜创下成功率纪录,体积不到此前最佳开源模型一半,运行最快快至 3.95 倍;模型权重已上架 Hugging Face。
Stanford 与 NVIDIA Research 团队发布 Contrastive Language Models(CLM)及 CLM-8B,用对比学习连接状态与动作,作为快速决策的 System One 模型。
蚂蚁百灵开源 Ming-Image-0.1-Design 系列模型,包含两个 6B 模型:Design 从文字需求生成 UI、信息图、海报等完整设计,Layer 将设计图拆成 2 至 9 个可独立编辑的 RGBA 图层,并同步开源 Design Skill 和 PPT Skill。
推荐理由:原文给出两个 6B 模型的能力划分、评测成绩和实际接入效果,读者可以据此评估设计生成加图层编辑链路的部署价值。
Contrastive-LM 发布开放模型 CLM-8B,首个对比语言模型(CLM),不为生成文本而训练,而是对候选动作按当前状态打分并返回概率,主打与 TypeSafe AI 的 System One 模型 Jev 相同的接口。
NVIDIA 在 Hugging Face 发布开源权重模型 Nemotron 3 Diarization,参数量 100M,可实时追踪最多 8 个说话人并处理语音重叠,采用 OpenMDW License 1.1 许可证允许商用。
蚂蚁百灵开源 Ming-Image-0.1-Design 系列模型,包含两个 6B 模型,分别用于从文字生成 UI、信息图、海报等设计和将设计图拆为可编辑透明图层,同时开源 Design Skill 和 PPT Skill。
Kyutai 发布 Voice of Reason,两个基于 GLM-4-Voice-9B 的开源权重语音到语音模型,无需转写和独立文本 LLM 即可口头解数学题。
小米发布 MiMo-V2.6 系列,旗舰 MiMo-V2.6-Pro 在 Artificial Analysis Intelligence Index 得 46 分,居开源模型之首,价格为每百万输入 token $0.435、输出 $0.87。
小米发布 MiMo-V2.6 系列,包含原生全模态模型 MiMo-V2.6-Pro 与 MiMo-V2.6-Flash,并推出输出速度最高提升 20 倍的 MiMo-V2.6-Pro-UltraSpeed。
推荐理由:小米以约 300 万美元训练成本推出原生全模态开源模型,并公开 RL 环境与训练配方,可对照中国开源模型的成本路线。
小米发布并开源 Xiaomi MiMo-V2.6 系列,含 Pro 与 Flash 两个原生全模态模型,称这是探索 RSI(递归自我改进)路径的关键一步。
小米发布并开源 MiMo-V2.6 系列,含 Pro 与 Flash 两个原生全模态模型。MiMo-V2.6-Pro 在 AA 智能指数 v4.3.2 取得 46 分。