The Decoder:AI News(RSS)· Matthias Bastian·· 19 天前AI 评分62
RoboHarm 基准测试显示 GPT-6 Astra 与 Claude Fable 5.1 等模型很少拒绝危险机器人指令
GPT-6 Astra and Claude Fable turn robot arms into slapstick killer robots in new safety benchmark
AI 导读
Robocurve 团队发布 RoboHarm 安全基准,让 GPT-6 Astra、Claude Fable 5.1 和 MolmoAct2 分别控制一对 I2RT-YAM 机械臂,每条危险指令测试 20 次,共 300 次试验由人工审看视频评估。
整理与数据来源:AIHOT
来源:The Decoder:AI News(RSS) · the-decoder.com