MIT Technology Review · AI· Arthur Holland Michel·· 4 小时前AI 评分38
我们高估了 AI 说「不」的能力
We’re putting too much faith in AI’s ability to say no
AI 导读
AI 的拒绝能力正成为安全体系的核心,但这一机制并不可靠。Anthropic 2021 年提出模型应「有用、诚实、无害」,如今模型经大量拒绝训练与红队测试学会说「不」,却仍保留有害知识,且拒绝机制基于概率,可能被绕过。OpenAI 董事会成员 Zico Kolter 指出,划界标准由 AI 公司秘密掌握,政府也将介入,拒绝过度可能压制合法言论。
来源:MIT Technology Review · AI · technologyreview.com