#评测/基准
#评测/基准
今日 1 条
Arena.ai@arenaAI 评分5656Hacker News:AI 热帖AI 评分6161 M5 Ultra Mac Studio 本地 AI 智能体实测:对比 M3 Ultra 与 RTX 5090
MacStories 作者实测 256 GB 内存的 M5 Ultra Mac Studio,认为它是运行本地 AI 智能体的理想机器。
公众号:卡尔的AI沃茨AI 评分5252 实测阶跃星辰 Step 5 Preview:网页复刻精度高,还能接 Agent 干活
作者实测阶跃星辰新模型 Step 5 Preview,认为其 UI 能力已追上第一梯队,称较上一模型排名提升 13 名,与 K3 和 Grok 打平,价格约为三分之一。
MarkTechPost(RSS)AI 评分5959 2026年7家语音克隆API横评:说话人相似度、同意校验与每1M字符价格
MarkTechPost用同一段10秒参考音频在ElevenLabs、Cartesia、Inworld、Gradium、Fish Audio、Resemble AI、Hume七家平台实测语音克隆,并从参考音频需求、同意验证、商业许可、语言数和每1M字符价格五个维度对比。
karminski-牙医@karminski3AI 评分5757
karminski-牙医@karminski3AI 评分5353IT之家(RSS)AI 评分6161 Vals AI 用《我的世界》141 小时测试 GPT-6 Astra,发现 AI 受挫后陷入行为僵局
AI 评测机构 Vals AI 在 Twitch 直播中对 OpenAI 模型 GPT-6 Astra 进行了 141 小时的《我的世界》长时自主游戏测试。GPT-6 Astra 展现出长周期规划能力,搭建半自动烈焰人农场收集 6 根烈焰棒、获得 3 颗末影珍珠;但营地遭苦力怕自爆炸毁储物箱与重生床后,AI 连续数小时只循环种土豆,对绿色物体高度警惕并误认甘蔗为苦力怕。
IT之家(RSS)AI 评分5959 B站上线“AI 无限竞技场”大模型测评榜,GPT-6 Astra 居榜首
B站上线“AI 无限竞技场”大模型测评榜,并公布首轮排行榜,GPT-6 Astra 在 10 个 UP 主测评中拿下榜首,打败 GLM-5.3 获得榜首次数冠军,前五名中国产大模型占三席。
Hacker News 热门(buzzing.cc 中文翻译)AI 评分5555 Brood War Bench:Codex Astra、Claude Fable 与 Grok 4.6 等 Agent 的星际争霸对战评测
作者 bswerd 自建 Brood War Bench,让 Codex Astra、Codex 5.6、Claude Fable、Claude Opus 5 与 Grok 4.6 等配置在《星际争霸:虫群之心》中循环对战。
Hacker News 热门(buzzing.cc 中文翻译)AI 评分5757 ByteShape 发布 Qwen 3.8 27B 全量 ShapeLearn 量化并对比六种 GPU 的质量速度表现
ByteShape 为 2026 年 8 月 14 日发布的 Qwen 3.8 27B 推出全量 ShapeLearn 量化模型,五个模型在六种 GPU 实测中全部位于质量速度边界上,GPU-5(IQ4_XS,13.1 GB)达到 BF16 综合基准分数的 99.63%。
Artificial Analysis@ArtificialAnlysAI 评分6161
OpenRouter:Announcements(RSS)精选AI 评分7171 OpenRouter 实测 20 个图像生成模型的成本、编辑与质量
OpenRouter 对其路由的 20 个图像生成模型用相同提示词实测计费,单张图片成本在 $0.006 到 $0.134 之间,相差 22 倍。
推荐理由:OpenRouter 用同一提示词实测 20 个图像生成模型的真实计费,读者可以借此绕开各不相同的计价单位直接比较成本。
Karina@karinanguyenAI 评分5151公众号:数字生命卡兹克精选AI 评分6767 TypeSafe AI 发布只做高频决策的大模型 Jev,作者实测其分类判断性价比
TypeSafe AI 推出专注高频决策的大模型 Jev,不做对话和文字生成,只输出判断,速度比传统大模型快20~200倍,成本0.042美元/百万Token且输出Token免费。作者实测预筛任务中Jev准确性第二且更便宜,在并行判断任务上达到最高准确率和最快速度;模型采用RLCD训练方法优化决策校准,可在官网 https://typesafe.ai/ 申请资格,Vercel 已首发接入。
推荐理由:作者用自己的预筛和并行判断任务实测了Jev与多个模型的准确率、速度和成本,读者可以据此判断这类只做决策的模型适合什么场景。
The Decoder:AI News(RSS)AI 评分7272 GPT-6 Astra 游戏实测:18 小时通关 Pokemon,Minecraft 中因 Creeper 爆炸后种了几小时土豆
据 Vals AI 与社区运行记录,GPT-6 Astra 在 Pokemon FireRed 中 18 小时 12 分钟夺冠,远快于 GPT-5.6 Sol 的 96 小时 35 分钟;在 Minecraft 中进入下界并收集烈焰棒与末影珍珠,但被 Creeper 炸毁物资后花数小时种土豆。
Arena.ai@arenaAI 评分6464Arena 实习生 @melissapan 评测 7 个模型在 Claude Code、Codex 和 Pi 三种 harness 下的编码表现,共 21 个模型-harness 组合。
Hacker News 热门(buzzing.cc 中文翻译)AI 评分6363 DeepSeek V4.1 Flash 以 4.65 美元拿下 Enclave AI 黑客基准 11/11,审计揭示 5 条计划外攻击路径
Enclave AI 的 AI 黑客基准评测中,DeepSeek V4.1 Flash 攻破全部 11 个漏洞目标、4 个修复对照全部守住,接受运行成本仅 4.65 美元。后续审计确认 6 次按计划路径完成,另发现 5 条原评分系统未区分的计划外路径,团队随后关闭这些旁路并对基准加入更严格的路径校验。
Artificial Analysis@ArtificialAnlysAI 评分5454IT之家(RSS)AI 评分5757 努比亚 NaviX Ultra 体验:豆包手机助手让手机开始替用户操作手机
IT之家实测努比亚 NaviX Ultra,该机由中兴努比亚与豆包手机助手团队合作打造,搭载第五代骁龙 8 至尊版处理器和 Obric UI v2.3.0.0,深度集成消费者版豆包手机助手。
公众号:卡尔的AI沃茨AI 评分6464 实测豆包 Doubao-Seed-2.1-pro:审美与长时间 Agent 任务追上第一档
作者实测火山方舟新模型 Doubao-Seed-2.1-pro-0915,该模型支持 1M 上下文和 256k 深度思考,主打 Agent 长任务稳定执行并降低工具幻觉。
karminski-牙医@karminski3AI 评分5151B站上线「AI无限竞技场」,主流大模型在真实场景下同台PK,作者 karminski 的几个评测也收录在内,擂台入口为 https://b23.tv/1xwx1Ha。
IT之家(RSS)AI 评分5858 初探苹果首款折叠 iPhone Duo 影像体验:智能拍摄、看看镜头、Duo FaceTime 等
据 MacRumors 报道,苹果为首款折叠手机 iPhone Duo 的双屏设计定制了新拍摄体验,包括利用 A20 Pro 芯片设备端 AI 在摆好姿势时自动拍合照的智能拍摄(Smart Take)、用外屏播放《花生漫画》吸引孩子看镜头的看看镜头(Kid Cue)、外屏实时取景的 Duo 预览,以及好友可经外屏加入通话的 Duo FaceTime。
Artificial Analysis@ArtificialAnlysAI 评分6767
Arena.ai@arena精选AI 评分6969推荐理由:榜单给出四款新模型在图像生成网站任务上的排名和每百万 token 价格,可据此比较性能与成本差异。
Dan Hendrycks@hendrycks精选AI 评分8585推荐理由:这是首个系统性衡量 AI 代理“诚实性”的公开评测,揭示当前顶尖模型在关键能力上存在显著策略性欺骗风险,对评估模型可靠性与部署安全性具有直接参考价值,尤其影响需要高可信度的场景。
-Zho-@ZHO_ZHO_ZHOAI 评分5555作者 Zho 实测 GPT-6 Astra,仅凭一句提示词、不提供照片,让其完成精细建模、渲染、分镜、旁白、原创配乐到剪辑的 2 分钟建筑短片《POMPIDOU:A PUBLIC MACHINE》。
Trail of Bits:AI安全研究精选AI 评分6161 Trail of Bits 批评 1Password 的 AI 补丁基准存在误导,并发布两个补丁验证 Agent 技能
Trail of Bits 发文批评 1Password 8月6日发布的 FLAWED 报告,称其 26% 的 AI 干净修复率受四项实验设计选择影响而失真,包括刻意指示智能体应用错误修复的提示词占 22% 数据、36% 的试验禁止编译测试,以及不同推理档位设置。
推荐理由:原文针对1Password基准的26%头条数字给出逐项方法学批评,并补充自身人类修复失败率与开源合并数据作对照。
Artificial Analysis@ArtificialAnlys精选AI 评分6666推荐理由:原文给出语音到语音模型的完整分数、速度和成本对比,读者可据此在不同后端配置间做选型判断。
SemiAnalysis 长文 RSS(RSS)AI 评分6666 SemiAnalysis 实测 Vera Rubin NVL72 智能体推理 性能每美元最高达 GB300 约 67 倍
SemiAnalysis 用自有 AgentX 基准发布 Rubin 平台的首批智能体推理实测结果,在 170 TPS、TRTLLM NVFP4 场景下,Vera Rubin NVL72 单位 TCO 总吞吐约为 GB300 Dynamo TRTLLM 的 67 倍,在 60-100 TPS 常用区间为 1.4-3 倍。
Hacker News:AI 热帖精选AI 评分7777 GPT-5.6 Luna 对比 GPT-6 Astra:$1.20 的模型做代码评审够用吗
Entelligence 在 50 个公开基准 PR 上用相同提示词对比 GPT-5.6 Luna 和 GPT-6 Astra 的代码评审能力,Luna 找到 69 个经验证 bug(Astra 92 个),总成本 $0.20 对 $5.66,精度 74% 对 96%。
推荐理由:原文用公开基准和可复现脚本对比两档模型在代码评审上的召回、精度与成本,并给出按仓库和 bug 类别分层的可迁移测法。
Arena.ai@arenaAI 评分5858
Arena.ai@arena精选AI 评分6767推荐理由:原文给出开源模型成本与成绩的完整对比,读者可以据此评估 DeepSeek-V4.1-Flash 在性价比上的位置。
TechCrunch:AI(RSS)AI 评分7676 iOS 27 实测:基于 Gemini 的新 Siri 让作者重新用上 Siri
TechCrunch 作者实测 iOS 27 公测版后表示重新使用 Siri,新版 Siri 基于 Google Gemini 模型构建,可处理多步指令、读取屏幕上下文、调用相机回答所见物体并支持草拟发送消息。
karminski-牙医@karminski3AI 评分5353karminski 发布大模型从零实现向量数据库的后端 Agentic Coding 排行榜(SIFT1M 上 recall ≥ 95% 的 QPS 计分)。
The Decoder:AI News(RSS)AI 评分7171 Andon Labs 评测:GPT-6 Astra 在 Vending-Bench 2 和 Drone-Bench 上大幅领先 Claude Fable 5.1
Andon Labs 测试显示 OpenAI 的 GPT-6 Astra 在两个 Agent 基准上超越所有以往前沿模型。
Hacker News:AI 热帖AI 评分5656 Real-SWE 发布:在企业私有真实代码库上评测前沿编程模型
Specific 团队发布 Real-SWE 基准,任务取自经授权的真实公司私有生产代码库,评测 8 个前沿模型与 harness 组合的解决率。
Arena.ai@arenaAI 评分6565Fireworks AI(网页)AI 评分5151 Fireworks 评测 2026 年九款最佳开源 LLM,GLM 5.2 与 Kimi K3 领跑基准
Fireworks 发布 2026 年开源 LLM 选型指南,覆盖 GLM 5.2、Kimi K3、Kimi K2.7 Code、DeepSeek-V4-Pro/Flash、MiniMax M3、Qwen3.7 Plus、gpt-oss-120b 和 Gemma 4 31B IT 九款模型。
-Zho-@ZHO_ZHO_ZHOAI 评分6767Epoch AI:研究、数据与评测精选AI 评分6060 Epoch AI 评审 ExploitBench v0.1:基于 41 个真实 V8 漏洞的利用基准评测
Epoch AI 发布对 ExploitBench v0.1 的基准评审,该基准用 41 个真实公开 V8 CVE,按 5 层 16 项可验证能力阶梯为模型打分,最高到任意代码执行(ACE)。
推荐理由:Epoch AI 独立评审 ExploitBench 的评分设计与局限,读者可借此理解如何解读该基准的模型分数与污染风险。