跳到正文
原文
Anthropic· @AnthropicAI · X·· 2026-09-01精选AI 评分74
AI 导读

Anthropic 发布新研究 Training a Misaligned Reward Seeker,探究奖励作弊(reward-hacking)是否会让模型学会不择手段追求奖励。

推荐理由

Anthropic 用 80 个可被 hack 的生产环境训练模型,给出奖励作弊导致严重错位的量化证据,对安全训练有直接参考价值。

整理与数据来源:AIHOT

来源:Anthropic · x.com