Arena 第 35 周 AI 大模型周榜:GLM-5.3-Flash 首秀进代码榜前十,Qwen3.8-Max-0902 登顶前端榜
Arena 平台发布 2026 年第 35 周(8 月 24 日至 8 月 30 日)AI 大模型盲测排行榜。智谱 GLM-5.3-Flash 首次入榜即列代码榜第 7 名(ELO 1535),阿里 Qwen3.8-max-0902 首次入榜以 1691 分登顶前端开发榜,将 Claude-Opus-5-Max 挤到第二。
Arena 平台发布 2026 年第 35 周(8 月 24 日至 8 月 30 日)AI 大模型盲测排行榜。智谱 GLM-5.3-Flash 首次入榜即列代码榜第 7 名(ELO 1535),阿里 Qwen3.8-max-0902 首次入榜以 1691 分登顶前端开发榜,将 Claude-Opus-5-Max 挤到第二。
阿里千问宣布 Qwen3.8-Max 升级到 0902 版本,围绕编程和专业办公进行后训练,CodeArena 前端编程总榜提升 22 分至 1691 分夺得冠军。
论文提出 DiagEvo,从求解器自身失败历史中提取反复出现的错误原因,存入分层错误原因记忆,并以此生成针对性问题,无需外部任务资源。其挑战者用记忆状态与复发次数平衡定向生成与自由探索,双重置信度过滤只保留中间难度问题。
Gary Marcus 发文警告 OpenAI 正准备越过一条 AI 安全红线,认为其正在探索的新技术可能令思维链监控变得困难甚至不可能。
Elon Musk 宣布 Grok 4.7 将在 10 天后发布。推文中还引用了他人对 Grok 4.6 表现的称赞作为背景。
据《华尔街日报》9 月 1 日报道,谷歌将发布编程能力大幅升级的 Gemini 3.8 Flash,内部代号 Skimaki,最早当地时间周三上线。内部工具 Jetski 对比测试中工程师对其偏好超过 Anthropic 的 Opus 模型,编程方面显著缩小了与 Anthropic 和 OpenAI 的差距。
OpenAI 宣布 Astra 在其 Preparedness Framework 下达到 Critical 网络安全能力阈值,是首个达到该水平的模型,并预告了评估方式与安全措施。
Simon Willison 实测 Claude Fable 5.1 在 pelican 基准上的表现。Anthropic 称该模型在 Terminal-Bench-Science 0.1 上得 52.6%,高于 Fable 5 的 24.7%。
Charlie O’Neill 撰文分析 LLM 持续学习问题,指出当前模型只有两种原生记忆形式:无损但昂贵的上下文与 KV cache,以及极难无损更新的权重。
论文提出 Calibrator-Output Repair for Top-1 Decision Preservation(CORD),一种后拟合适配器,通过修复完整校准概率向量,确保 argmax 恢复原始 top-1 预测,实现零 TPCR。
Hugging Face 博客介绍 BenchMIRT,一种基于多维 IRT 在单个题目层面审计 LLM 基准的方法,训练数据覆盖 100 个 LLM、16 个基准和超过 34K 道题。
Meta 发布论文 AI Research Preference Models,训练模型在任何候选方案执行前预测哪个最有前景,解决研究智能体想法多但 GPU 预算有限、缺乏原创性判断的问题。
Thomas Wolf 转发 @RemiFabreRobot 的视频,用 Microduck 鸭子学走路的过程讲解强化学习(RL),配乐由 @antoinepirrone 制作。
Anthropic 发布 Claude Fable 5.1 和 Claude Mythos 5.1,两者为同一底层模型加不同安全层,Fable 5.1 全面开放,Mythos 5.1 仅限 Project Glasswing 内经过审核的美国组织。
Anthropic 于周二发布 Fable 和 Mythos 5.1 双版本模型。Fable 5.1 即日起可在云平台和 Anthropic API 使用,Mythos 5.1 仍仅限网络安全或生命科学研究的注册合作伙伴。
Qwen 团队发布 E-Commerce Bench,让 LLM 智能体在 365 天的模拟环境中同时运营多家网店,评估 18 个前沿模型的七个维度,发现没有任何单一模型全面领先。
Every 发布对 Fable 5.1 的 Vibe Check 评测,标题称 Anthropic 又回来了,正文未提供更多细节。
Google DeepMind 负责人 Koray Kavukcuoglu 回应外界质疑,称“除了站在前沿,没有别的对我们重要的事”,并承认 Google 当前模型略低于前沿但具备团队、资源和全栈能力来缩小差距。
Elon Musk 宣布为所有 @Grok @Bot 用户再次提供免费 token 用量重置。原文未说明重置生效时间和具体额度细节。
Google DeepMind 发布 Gemini 3.8 Flash,在 Artificial Analysis Intelligence Index 上以 high 推理得分 59,较 Gemini 3.7 Flash 提升 3 分。
推荐理由:评测方一手数据给出了智能指数、单任务成本和速度的具体变化,可帮助读者判断该模型在实际任务中的性价比。
Meta 发布 Muse Spark 1.3,是其五个月内第四个 Muse Spark 版本。xhigh 版在 Artificial Analysis Intelligence Index 得 61 分。
推荐理由:独立评测方给出与同档模型的分数和单任务成本对比,读者可据此判断该模型在智能与成本上的位置。
据彭博社报道,百度 CFO 何海建表示,AI 领域的大规模投入有望很快带来与搜索业务相当的利润和现金回报。目前百度 AI 相关收入占公司总收入一半以上,覆盖云计算、应用等领域;支持 AI 服务的新 GPU 集群投资预计两到三年内收回成本,云业务收入未来几个季度的增速至少快于行业平均水平,资本开支低于市场预期。