跳到正文
原文
Epoch AI:研究、数据与评测·· 2026-09-07AI 评分48

Epoch AI 评测:DeepSWE v1.1 软件工程基准被判定为 Flawed

DeepSWE v1.1 - Benchmark Review

AI 导读

Epoch AI 用 Opus 5 和 Sol 5.6 扫描 DeepSWE v1.1 全部 113 个任务,在 23 个(超 20.3%)任务中发现假阴性错误,据此将该基准判定为 Flawed。其中 18 个(78%)源于模型修改现有测试文件,而验证器会丢弃这些改动并注入隐藏测试,导致符号重复定义或引用失效、测试包编译失败。

整理与数据来源:AIHOT

来源:Epoch AI:研究、数据与评测 · epoch.ai