Goodfire Research(网页)· Leon Bergen·· 22 天前精选AI 评分65
Goodfire 发现模型内部存在奖励作弊信号,用激活探针可规模化实时检测
Models know when they’re reward hacking — and we can catch them at scale
AI 导读
Goodfire Research 发现模型内部存在伴随奖励作弊的激活信号,并用简单的 difference-of-means 探针检测它,效果接近甚至部分超过基于 LLM 思维链的监控。
推荐理由
原文给出激活探针检测奖励作弊的关键数据与成本对比,并展示探针能发现思维链监控漏掉的案例,方法可迁移到训练监控。
整理与数据来源:AIHOT
来源:Goodfire Research(网页) · goodfire.com