#评测/基准
#评测/基准
今日 1 条
Rohan Paul@rohanpaul_aiAI 评分6161
Ethan Mollick@emollickAI 评分3838
Rohan Paul@rohanpaul_aiAI 评分5151Epoch AI:研究、数据与评测AI 评分5858 Epoch AI 评测 Terminal-Bench 4.0.0:45.5% 任务存在公开计分缺陷,定为 Flawed
Epoch AI 发布对 Terminal-Bench 4.0.0 的基准评测,因 66 个任务中 30 个(45.5%)存在公开记录的计分缺陷而将其定为 Flawed。
DogeDesigner@cb_dogeAI 评分3434
Sherwin Wu@sherwinwuAI 评分6060
🚨 AI News | TestingCatalog@testingcatalogAI 评分6767
jason@jxnlcoAI 评分1616
François Chollet@fchollet精选AI 评分8181推荐理由:ARC Prize 作者基于自家标准 harness 的实测数据评估 GPT-6 Astra,读者可对比 66% 与近 100% 两种设置看模型与 harness 能力的边界变化。
Epoch AI@EpochAIResearchAI 评分6464Every:最新文章(网页)AI 评分7070 GPT-6 Astra 实测:能力大升级但有坏习惯,Anthropic Fable 仍更擅长产品构建
Every 实测 OpenAI 新模型 GPT-6 Astra,认为其在写作、操作软件和视觉设计方面表现出色,但存在一些坏习惯;对比之下,Anthropic 的 Fable 在构建产品方面直觉仍然更好。
-Zho-@ZHO_ZHO_ZHOAI 评分2525
🚨 AI News | TestingCatalog@testingcatalogAI 评分6161
dex@dexhorthyAI 评分2222
Artificial Analysis@ArtificialAnlysAI 评分7070
Artificial Analysis@ArtificialAnlysAI 评分6161
Artificial Analysis@ArtificialAnlysAI 评分5959Epoch AI:研究、数据与评测精选AI 评分6969 Epoch AI 评测 SWE-bench Verified:审计发现超两成题目存在评分问题
Epoch AI 发布对 SWE-bench Verified 的基准评审,认定其为 Flawed。该基准用 500 道来自 12 个代码库的修复任务评测大语言模型;OpenAI 审计 27.6% 的任务后发现有缺陷测试的任务下限为 16.4%,59.4% 的被审任务测试用例会拒绝功能正确的提交,且所有受测前沿模型在训练中都见过部分题目。
推荐理由:Epoch 汇总了 OpenAI 与 RDI 的公开审计结论,说明 SWE-bench Verified 的测试缺陷和污染问题,读者可据此调整对该基准的解读。
Rohan Paul@rohanpaul_aiAI 评分6161
Artificial Analysis@ArtificialAnlysAI 评分5353elsewhere:文章(RSS)AI 评分3737 飞书有了新的工作搭子:「豆包工作」一手实测
作者对飞书中的「豆包工作」进行一手实测,称工作可以交给豆包工作了。原文信息有限,未给出更多功能或性能细节。
Hacker News 热门(buzzing.cc 中文翻译)AI 评分7272 Haus Research 审计:Perplexity 三分之一的引用页面并不包含被引数字
Haus Research 对 Perplexity 的 sonar 与 sonar-pro 两个搜索模型提出 310 个关于 210 家科技公司的事实问题,抓取全部 cited URL 核验。
Ethan Mollick@emollickAI 评分2929
Rohan Paul@rohanpaul_aiAI 评分6868公众号:卡尔的AI沃茨AI 评分7474 实测 Claude Fable 5.1:长时 Agent 任务与浏览器自动化表现突出
作者实测 Anthropic 新发布的 Claude Fable 5.1,认为其在长时间 Agent 任务和浏览器自动化上超过 GPT 5.6。
IT之家(RSS)AI 评分5757 Arena 第 35 周 AI 大模型周榜:GLM-5.3-Flash 首秀进代码榜前十,Qwen3.8-Max-0902 登顶前端榜
Arena 平台发布 2026 年第 35 周(8 月 24 日至 8 月 30 日)AI 大模型盲测排行榜。智谱 GLM-5.3-Flash 首次入榜即列代码榜第 7 名(ELO 1535),阿里 Qwen3.8-max-0902 首次入榜以 1691 分登顶前端开发榜,将 Claude-Opus-5-Max 挤到第二。
Yuchen Jin@Yuchenj_UWAI 评分4646IT之家(RSS)AI 评分3535 OPPO 联合多所高校推出端侧 AI 记忆评测基准 MobileMem
OPPO 联合 OpenKG 及浙江大学、同济大学、东南大学等高校团队推出端侧 AI 记忆评测基准 MobileMem,技术白皮书已公开,数据集和相关工具将陆续开源。OPPO 首席产品官刘作虎称,端侧 AI 记忆是 AI 手机从一问一答走向主动服务智能体的基础能力,此前行业缺少统一评价标准;ColorOS 17 发布暨开发者大会将于 2026 年 9 月 17 日在珠海举行。
Simon Willison 博客AI 评分7070 Simon Willison 用 pelican 基准实测 Claude Fable 5.1 的五个推理档位
Simon Willison 实测 Claude Fable 5.1 在 pelican 基准上的表现。Anthropic 称该模型在 Terminal-Bench-Science 0.1 上得 52.6%,高于 Fable 5 的 24.7%。
Epoch AI@EpochAIResearchAI 评分4141
Hao AI Lab@haoailabAI 评分4040
Rohan Paul@rohanpaul_aiAI 评分4545AI/ML API 用同样的提示词对 Anthropic 的 Fable 5.1 和 OpenAI 的 GPT-5.6 Sol 做了一次成型的 Three.js 测试,5 个独立场景组成私岛豪宅项目。
Every:最新文章(网页)AI 评分1818 Vibe Check:Fable 5.1 评测,称 Anthropic 又回来了
Every 发布对 Fable 5.1 的 Vibe Check 评测,标题称 Anthropic 又回来了,正文未提供更多细节。
DogeDesigner@cb_dogeAI 评分3030作者转述 LatchBio 对主流 AI 模型的生物安全基准测试结果,称 Grok 4.6 整体表现最强,在全部参测前沿模型中排名第一,是唯一在安全性和有用性两项均超过 50% 的模型。
xAI:News(网页)AI 评分4949 LatchBio 独立评测显示 Grok 4.6 在生物安全基准上表现领先
xAI 发布 LatchBio 对 Grok 4.6 生物能力的独立分析,涵盖 BioSecBench-Refusal 与 BioSecBench-Surveillance 两套基准。
SpaceXAI@SpaceXAIAI 评分3232
The Decoder:AI News(RSS)AI 评分6262 AlgorithmWatch 研究:Google 选举类 AI Overviews 触发不透明、来源集中且时有倾向性
AlgorithmWatch 借助欧盟 DSA 第 40(12) 条的研究数据访问权限,对德国东部三场选举相关搜索运行 4480 次查询并分析 Google 的 AI Overviews。
Hacker News 热门(buzzing.cc 中文翻译)AI 评分4242 博客文章展示以 67 美分成本在 ARC-AGI-1 上取得 44% 得分
Hacker News 热帖分享一篇博客文章,作者称以 67 美分的成本在 ARC-AGI-1 上取得 44% 的得分。该帖获得 122 个 HN Points,完整方法细节需查看原文链接 https://mvakde.github.io/blog/44-on-arc-1。
Epoch AI:研究、数据与评测精选AI 评分6767 Epoch AI 评审 SWE-Bench Pro:超 20% 任务存在评分缺陷,判定为 Flawed
Epoch AI 对 SWE-Bench Pro 的基准评审判定其为 Flawed,认为很可能超过 20% 的任务存在评分缺陷。
推荐理由:Epoch AI 汇总多方审计数据并给出 Flawed 判定,读者可据此决定是否还把 SWE-Bench Pro 当作可信的编码评测依据。
MarkTechPost(RSS)AI 评分5959 Keenable AI 开源 NEEDLE:每小时重建查询集的实时搜索基准
Keenable AI 开源实时搜索基准 NEEDLE,通过每小时(新闻)和每日(金融、学术、法律、长尾)从 RSS、Google Trends、SEC XBRL、arXiv、CourtListener 等公开来源重建查询集,避免模型记忆或下载答案作弊。