🚨 AI News | TestingCatalog· @testingcatalog · X·· 2026-09-04AI 评分61
AI 导读
Martian 发布 AI Frontier,一个交互式面板,衡量 44 个 LLM 在真实工作负载中的质量、成本以及跨重复运行解决同一问题的稳定性。面板分五个视图:单模型档案、一对一对比、标价 vs 实测成本、重复尝试一致性(得分约 0.74 到 0.96)和方法论。
整理与数据来源:AIHOT
来源:🚨 AI News | TestingCatalog · x.com