微软研究员 Jennifer Neville:AI 评测的意外失败能教会我们什么
微软研究院合伙人研究经理 Jennifer Neville 在 Microsoft Research Podcast 中与首席应用科学家 Chad Atalla 对谈,讨论评测如何推动 AI 系统性能边界、以及模型在传统 benchmark 之外测试时出现的「意外失败」。她分享了使用当前 AI 系统的实用建议,并强调当结果与预期不符时应仔细审视数据。
微软研究院合伙人研究经理 Jennifer Neville 在 Microsoft Research Podcast 中与首席应用科学家 Chad Atalla 对谈,讨论评测如何推动 AI 系统性能边界、以及模型在传统 benchmark 之外测试时出现的「意外失败」。她分享了使用当前 AI 系统的实用建议,并强调当结果与预期不符时应仔细审视数据。
MIT 研究者 Alex Zhang 在 Latent Space 播客中详解递归语言模型(RLM),其基于 RLM 的 harness 是首个接近解决 ARC-AGI-3 的系统,早于 OpenAI 的 Astra。
推荐理由:原文给出智能指数与单任务成本的 Pareto 前沿新点位和具体分数价格,可用于横向比较各家模型性价比。
推荐理由:原文给出真实投票榜单的排名、价格和多分类变化,可以据此比较 GPT-6 Sol 在性能与成本上的位置。
Trail of Bits 发文批评 1Password 8月6日发布的 FLAWED 报告,称其 26% 的 AI 干净修复率受四项实验设计选择影响而失真,包括刻意指示智能体应用错误修复的提示词占 22% 数据、36% 的试验禁止编译测试,以及不同推理档位设置。
推荐理由:原文针对1Password基准的26%头条数字给出逐项方法学批评,并补充自身人类修复失败率与开源合并数据作对照。
Arena(arena.ai)平台发布 2026 年第 36 周(8 月 31 日~9 月 6 日)AI 大模型盲测排名。
Dex Horthy 以“这才是真正的 slop”为题转发 SlopCodeBench 更新,称 Astra 已加入该评测。
推荐理由:ARC Prize 作者基于自家标准 harness 的实测数据评估 GPT-6 Astra,读者可对比 66% 与近 100% 两种设置看模型与 harness 能力的边界变化。