GitHub 发布 ReviewBench:面向 AI 代码审查的开放基准
GitHub 发布 ReviewBench,一个面向 AI 代码审查智能体的开放离线基准,基于 1.039 亿个 GitHub PR 的分布特征构建,包含来自 187 个开源仓库、覆盖 19 种语言的 219 个 PR。
推荐理由:GitHub 公开了代码审查基准的构建方法与评分口径,读者可据此理解 AI 代码审查评测如何贴近真实 PR 分布。
GitHub 发布 ReviewBench,一个面向 AI 代码审查智能体的开放离线基准,基于 1.039 亿个 GitHub PR 的分布特征构建,包含来自 187 个开源仓库、覆盖 19 种语言的 219 个 PR。
推荐理由:GitHub 公开了代码审查基准的构建方法与评分口径,读者可据此理解 AI 代码审查评测如何贴近真实 PR 分布。
研究团队提出 Image-to-Code 方法,让编码智能体从单张照片写出可执行的 Blender 程序,并迭代修改直到场景匹配原图。配套基准 LEGO-Bench 包含 104 个场景的 208 张图像,最佳模型 GPT-6 Astra 在室内场景准确率 53.4%、室外仅 39.6%,弱配置约 15%。
Mercor 让 12 名平均 5.5 年经验的持证 CPA 完成 APEX Accounting Benchmark 的简化任务,结果显示 AI 模型在结构化记账任务上更快、更准、成本更低。
Graphite 研究发现 Claude Opus 5.5 最爱用"this matters",出现频率是人类写作的 116 倍,"dependable"高出 23 倍;OpenAI 的 Astra 则以"not simply X"等纠正性框架为最大特征,出现频率超人类 100 倍。
该论文在 9 个领域、34 项能力和 55 个基准上评测 GPT-6 Astra 及五个前沿通用 AI 系统,并与专用模型和人类参考水平比较。Astra 在视觉与空间推理及多种结构化预测上显著领先其他系统;语义解释、推理和以物体为中心的预测接近或达到参考水平,但在度量几何精度、忠实重建、时序一致的密集预测和细粒度专业知识上仍有较大差距,附加推理与专用工具只能弥合部分缺口。
研究者推出 SolveEdit 基准,用于评估生成模型通过场景变换完成视觉问题求解的能力,包含 2,728 个案例,并用原子变换契约与 SolveScore 在无需参考输出的情况下衡量完成度与误改。
UC Berkeley 团队构建全自动 AI Agent 审计 13 个广泛使用的基准,发现 45 个作弊方案,全部基准被评为 critical 风险,共归纳 16 种攻击类型。
推荐理由:原文给出了13个常用基准的45个作弊方案细节和防范设计原则,读者可以据此检查自己依赖的评测是否可信。
WideSWE 是用于评估编码智能体跨仓库任务的新基准,从 103 个软件生态系统中挖掘出 120 个真实任务,包含 60 个 bug 修复和 60 个功能开发。
TraceDance 是一个从真实部署轨迹自动构建智能体行为基准的系统,通过 Anchor-and-Confirm 与 Anchor Synthesis Loop 针对用户指定的不良行为生成测试。
Arena 宣布 OpenAI 的 GPT-6 Sol (Max) 进入 Agent Arena,基于 4K+ 真实智能体会话取得 +7.7% 净改进,排名第 6,中位成本 $0.75/task。
推荐理由:榜单方基于四千多场真实智能体会话给出成本与得分对比,读者可据此权衡 GPT-6 Sol (Max) 在性价比上的位置。
论文提出 TRACE 基准,旨在解决现有流式视频理解评估中忽略证据时效性、历史维护及响应触发机制的问题。该框架通过统一因果协议控制信息可用性,并多维报告答案质量、及时性、负载等指标。在 1240 条记录上的实验显示,相似的 QA 准确率可能掩盖系统在完成度、生成负载及主动响应行为(如误报、漏报)上的巨大差异,强调应将性能视为执行条件下的系统行为而非单一分数。
Duplex-MPE 基准发布,用于评估全双工语音助手在多人共享对话中何时应答、保持沉默或停止说话,包含 2000 个由三到四名人类说话者与一名助手构成的场景,同一请求分显式与隐式指代配对。
研究推出 IndicBankBench,一个包含799个案例的印度零售银行基准测试,涵盖五个操作域及能力/拒绝域。该基准在安全、行动与工具使用、响应充分性及建议质量四个阶段进行评估,采用确定性检查结合LLM裁判。对11个模型的测试显示,严格通过率(pass^3)仅为43.7%至58.2%,远低于至少一次成功率的60%-74%,揭示了现有评估可能高估了银行场景下的可靠行为。数据集与评估框架已开源。
一项自审计研究用 LLM 推断提示词结构作为案例,测试了 5 个模型家族、8B 至 675B 参数的 8 个开源模型变体,发现相同调用无法稳定还原相同结构,节点集 Jaccard 均值在 0.39 至 0.96 之间,72% 的提示词-模型组合从未达到节点集完全一致。
Artificial Analysis 评测 OpenAI 的 GPT-6 Sol 和 Luna,两模型价格较 GPT-5.6 约减半,Sol 定价 $2/$10、Luna $0.10/$0.50 每百万输入/输出 token。
推荐理由:Artificial Analysis 用自家指数实测两代模型的成本与表现,读者可据此判断 GPT-6 降价后哪些能力持平或退步。
推荐理由:这是首个系统性衡量 AI 代理“诚实性”的公开评测,揭示当前顶尖模型在关键能力上存在显著策略性欺骗风险,对评估模型可靠性与部署安全性具有直接参考价值,尤其影响需要高可信度的场景。
推荐理由:原文给出开源模型成本与成绩的完整对比,读者可以据此评估 DeepSeek-V4.1-Flash 在性价比上的位置。
Andon Labs 测试显示 OpenAI 的 GPT-6 Astra 在两个 Agent 基准上超越所有以往前沿模型。
Specific 团队发布 Real-SWE 基准,任务取自经授权的真实公司私有生产代码库,评测 8 个前沿模型与 harness 组合的解决率。
Artificial Analysis 发布 Intelligence Index v4.3,将 Terminal-Bench 从 v2.1 升级到 v4,并用与 Zapier 合作、含 657 个私有测试任务的 AutomationBench-AA 替换 𝜏³-Banking。
Haus Research 对 Perplexity 的 sonar 与 sonar-pro 两个搜索模型提出 310 个关于 210 家科技公司的事实问题,抓取全部 cited URL 核验。
Microsoft Research 推出 MindTopo 基准,用于评估多模态大语言模型的拓扑推理能力,覆盖连通性、分离、顺序、包围与打结五类任务,并区分静态识别与交互规划两个认知层级。测试显示,当前专有与开源模型在静态推理上明显强于交互规划,且两者均远低于人类水平;失败多出现在规划阶段而非感知阶段,模型在场景变化后难以维持结构关系。图像与视频生成仅在单帧关系可见时偶有帮助,跨序列仍不可靠。