跳到正文
原文
Goodfire Research(网页)· Leon Bergen·· 22 天前精选AI 评分65

Goodfire 发现模型内部存在奖励作弊信号,用激活探针可规模化实时检测

Models know when they’re reward hacking — and we can catch them at scale

AI 导读

Goodfire Research 发现模型内部存在伴随奖励作弊的激活信号,并用简单的 difference-of-means 探针检测它,效果接近甚至部分超过基于 LLM 思维链的监控。

推荐理由

原文给出激活探针检测奖励作弊的关键数据与成本对比,并展示探针能发现思维链监控漏掉的案例,方法可迁移到训练监控。

整理与数据来源:AIHOT

来源:Goodfire Research(网页) · goodfire.com