#评测/基准
#评测/基准
今日 1 条
Artificial Analysis@ArtificialAnlysAI 评分6464
Artificial Analysis@ArtificialAnlysAI 评分7676
Hacker News 热门(buzzing.cc 中文翻译)AI 评分5454 如何衡量 LLM 生成代码的粗糙程度:verbosity 与 erosion 指标
Earendil 工程师发文讨论如何量化 LLM 生成代码的粗糙程度,指出 AI as a judge 很难有效评估代码质量,而 LOC 变化、verbosity 和 erosion 是更可行的指标。
Hacker News:AI 热帖AI 评分7474 Quesma 实测 RTK 并未让 AI 编码更便宜:Terminal-Bench 2.1 成本基准与 1500 美元账单复盘
Quesma 在 Terminal-Bench 2.1 上用 Claude Code(Fable 5.0)和 OpenCode(DeepSeek V4 Pro 0813)实测 RTK(Rust Token Killer),共 1740 次尝试、花费超 1500 美元,结论是 RTK 并不普遍降低成本。
Hacker News 热门(buzzing.cc 中文翻译)AI 评分6868 九套编程线束在 MacBook 上实测 Qwen 3.8 27B:prefill 与上下文占用差异悬殊
作者用同一台 M4 MacBook Pro(24GB)和 llama.cpp 服务 Qwen 3.8 27B,对 9 套编程线束跑 8 道 Exercism 题目实测。
Artificial Analysis@ArtificialAnlysAI 评分5454
Epoch AI@EpochAIResearchAI 评分6363The Verge:AI(RSS)AI 评分6969 Meta Muse AI 智能体上手实测:任务能干,但隐私令人不安
The Verge 作者实测 Meta 新推出的 AI 智能体 Muse,它基于云端虚拟电脑执行任务,成功清理了数千封推广邮件并按指定要求完成 Amazon 购买,也能生成 AI 播客、图像视频和名为 artifacts 的交互网页。
公众号:卡尔的AI沃茨AI 评分6060 网易叭哥说语音输入法上手评测:E2E 平均 1683ms,对比 Typeless、豆包与闪电说
作者实测网易有道新上线的语音输入法叭哥说,与 Typeless、豆包输入法、闪电说横向对比。叭哥说采用双模型分工,E2E 平均 1683ms、P95 2134ms,并支持小声拾音、个人词典即刻生效和多语言翻译等功能。
Epoch AI:研究、数据与评测精选AI 评分6161 Epoch AI 评测 HealthBench Professional:50 个抽样任务中一半存在问题,判为 Flawed
Epoch AI 对基于 OpenAI HealthBench 的 HealthBench Professional 基准发布评测,从 525 个任务中分层随机抽样 50 个。
推荐理由:Epoch AI 抽检了 OpenAI HealthBench Professional 的任务质量,读者可以据此看待该基准分数的可靠性。
Epoch AI:研究、数据与评测AI 评分6060 Epoch AI 审查 BFCL v4 基准,抽样 50 题发现 48% 存在缺陷
Epoch AI 对 Berkeley Function Calling Leaderboard(BFCL)v4 进行质量审计,从 5,088 道题中按类别权重分层抽取 50 题,发现 24 题(48%)存在可能导致误判的缺陷。
Epoch AI:研究、数据与评测AI 评分5757 Epoch AI 公布 Benchmark Reviews 收录基准列表及审查判定结果
Epoch AI 发布 Benchmark Reviews 文档,列出已审查基准及判定结果,其中 SWE-bench Verified、Terminal-Bench 4.0.0。
Rohan Paul@rohanpaul_aiAI 评分5151
Rohan Paul@rohanpaul_aiAI 评分6262OpenRouter:Announcements(RSS)精选AI 评分7171 OpenRouter 评测 Seedance 2.5:长镜头与已有素材编辑的场景及成本解析
OpenRouter 发布对 ByteDance Seedance 2.5 视频模型的评测,该模型自 2026 年 8 月 7 日上线其视频 API,生成 4 到 30 秒、480p 或 720p 的片段,支持图像、视频、音频引用和首尾帧控制,音频同趟生成不加价。
推荐理由:原文基于自家端点数据给出 Seedance 2.5 的计费公式、能力边界和与 Seedance 2.0、Wan 3.0、Veo 3.1 的逐项对比,便于按需求选型。
Hacker News 热门(buzzing.cc 中文翻译)AI 评分6363 Qwen3.8 27B 量化方案基准实测:Q4_K_M 表现稳定,1 位接近随机水平
作者实测 Qwen3.8 27B 各档 Unsloth 量化(GGUF)在 GPQA Diamond、IFBench 和 Terminal-Bench 2.1 上的表现。
Hacker News 热门(buzzing.cc 中文翻译)AI 评分6565 7 个 AI 模型运营真实业务实验:开出 12,431 美元虚假发票,零收入亏损约 3,200 美元
Bottleneck Labs 让 7 个前沿模型各自获得 300 美元启动资金、一台解锁的 Mac mini 和 72 小时真实时间,指令是尽可能赚钱。
SemiAnalysis 长文 RSS(RSS)AI 评分6565 SemiAnalysis 发布 TPUv7 Ironwood 第三方推理评测,每美元性能最高比 B200/B300 高 50%
SemiAnalysis 在 InferenceX 上发布 TPUv7 Ironwood 的首批第三方推理结果,FP8 聚合服务下 Ironwood 每美元性能最高比 B200/B300 高 50%,在 20 tok/s/user 交互速度下每百万 token 成本约 0.181 美元,低于 B200 的 0.222 和 B300 的 0.276 美元。
Artificial Analysis@ArtificialAnlysAI 评分5555IT之家(RSS)AI 评分5353 Arena 第 36 周 AI 大模型盲测榜:国产多模型扎堆入榜前端开发榜,阿里 wan3.0 冲进视频榜前三
Arena(arena.ai)平台发布 2026 年第 36 周(8 月 31 日~9 月 6 日)AI 大模型盲测排名。
Artificial Analysis 完整文章(网页)AI 评分5757 Artificial Analysis 评测 OpenBMB MiniCPM5-2B,登顶 4B 以下开源权重模型
Artificial Analysis 评测显示,OpenBMB 的 MiniCPM5-2B 在 Intelligence Index v4.2 得分 15,为总参数量 4B 以下开源权重模型中最高。
Artificial Analysis 完整文章(网页)AI 评分5353 Artificial Analysis 发布 Intelligence Index v4.3,引入 Terminal-Bench v4 与 AutomationBench-AA
Artificial Analysis 发布 Intelligence Index v4.3,将 Terminal-Bench 从 v2.1 升级到 v4,并用与 Zapier 合作、含 657 个私有测试任务的 AutomationBench-AA 替换 𝜏³-Banking。
Hacker News 热门(buzzing.cc 中文翻译)AI 评分6969 GPT-6 Astra 与 Claude Fable 5/5.1 机械臂操作对比实测:碗任务 19/20 完成但拼图任务同样卡住
同一站点延续此前对 Claude Fable 5 和 Fable 5.1 的对比,让 OpenAI 的 GPT-6 Astra 在相同 YAM 机械臂、相同 Inspect Robots agent 策略下完成相同两项任务。
-Zho-@ZHO_ZHO_ZHOAI 评分5151一场耗时 13 小时的 GPT-6 Astra 地狱难度建筑专业任务测试总结,5 项任务总得分 60/100(及格线),消耗 2.1 亿 token。
Simon Willison 博客AI 评分6161 Simon Willison 实测 GPT-6 Astra 开发者版本
Simon Willison 分享对面向开发者的 GPT-6 Astra 的试用印象:Astra 在细节把握、理解用户提示词和构建更复杂输出方面全面提升,尤其擅长 3D 建模,他见过它生成花园、船厂、动物、城市景观甚至戴森球的精美渲染,并成功生成了骑自行车的鹈鹕戴红色领巾的场景。
Rohan Paul@rohanpaul_aiAI 评分7171The Decoder:AI News(RSS)AI 评分5858 Artificial Analysis 发布 Intelligence Index v4.2,GPT-6 Astra 评分争议后调整基准
Artificial Analysis 发布 Intelligence Index v4.2,此前其对 GPT-6 Astra 的评分与 Epoch AI、ARC-AGI-3 等评估结果相左而受到质疑。
-Zho-@ZHO_ZHO_ZHOAI 评分5353Zho 用 GPT-6 Astra 跑了超过 12 小时的地狱难度测试,输入为单张建筑照片加提示词,5 项任务总得分 60/100(及格线),消耗 token 2.1 亿。
公众号:数字生命卡兹克精选AI 评分7777 实测GPT-6 Astra:速度、前端与代码能力对比GPT-5.6 Sol的全面升级
GPT-6 Astra正式向所有订阅用户推送,作者实测后认为其综合能力追平Claude Fable 5,且额度100%可用。相比GPT-5.6 Sol,速度明显提升,大型系统审查从数小时缩短到约10分钟,代码扫描找出大量此前未发现的性能问题并2小时完成修复;前端3D生成和审美大幅强化,写作在白描和用词上更好但仍缺中文留白感。
推荐理由:作者实测了GPT-6 Astra在速度、前端生成、代码深度和写作上的具体变化,并给出可迁移的AGENT.md简化思路。
Hacker News 热门(buzzing.cc 中文翻译)AI 评分4949 Artificial Analysis 发布 Intelligence Index v4.2:新增 AA-Briefcase 与 GDP.pdf 评测
Artificial Analysis 发布 Intelligence Index v4.2 中期更新,新增私有测试集评测 AA-Briefcase(智能体知识工作)和 Surge AI 的 GDP.pdf(跨 100 份 PDF、4,592 页的长文文档推理,按 1,275 条专家标准全过评分),并移除已饱和的 GPQA Diamond。
dex@dexhorthyAI 评分2020Dex Horthy 以“这才是真正的 slop”为题转发 SlopCodeBench 更新,称 Astra 已加入该评测。
dex@dexhorthyAI 评分1111Hacker News 热门(buzzing.cc 中文翻译)AI 评分1919 人工智能现在能设计电路板了吗?
eebench.org 发布文章探讨 AI 目前能否设计电路板,原文链接为 https://eebench.org/blog/can-ai-design-circuit-boards-yet。该内容在 Hacker News 获得 134 分热度,feed 未提供完整正文。
Simon Willison 博客AI 评分6868 Simon Willison 用鹈鹕骑车 SVG 对比 GPT-6 Astra 与 GPT-5.6 各推理档位
Simon Willison 获得访问权限后,用 GPT-6 Astra 在 low 到 max 五个推理档位生成鹈鹕骑车 SVG,并与 GPT-5.6 Sol、Terra、Luna 渲染成对比网格。
Artificial Analysis@ArtificialAnlysAI 评分5353
Rohan Paul@rohanpaul_aiAI 评分5454AI/ML API 用四个场景简报测试 OpenAI 的 GPT‑6 Astra 与 Anthropic 的 Claude Fable 5.1,要求各自一次性生成独立 HTML 场景文件、不做修改。
Artificial Analysis@ArtificialAnlysAI 评分6161
The Verge:AI(RSS)AI 评分6464 Instagram AI 内容标签再陷混乱,The Verge 实测发现只有 Meta 自家信号能触发标注
The Verge 记者实测发现,Instagram 的 AI Content 标签持续误标普通照片,而带 C2PA 和 SynthID 信号的 Gemini 完全生成图片反而未被标注。
The Decoder:AI News(RSS)精选AI 评分7878 GPT-6 Astra 基准表现分歧,ARC-AGI-3 效率超人类令 Chollet 提前 AGI 预测
GPT-6 Astra 的基准结论相互矛盾:Epoch AI 以 169 分将其排在 267 个模型之首,Artificial Analysis 给出 61 分,仅与前代 Sol 持平、落后 Claude Fable 5.1 的 66 分。
推荐理由:原文汇总多家基准分歧数据并梳理 ARC-AGI-3 效率细节,读者可以借此理解 GPT-6 Astra 各项成绩的真实含义。
karminski-牙医@karminski3AI 评分3030