HuggingFace Daily Papers(社区热门论文)·· 14 天前AI 评分46
Jev:用 RLCD 训练的单次调用模型零样本检测 AI 对齐失效
Just Ask Jev: Reinforcement Learning for Calibrated Decisions as a Zero-Shot Detector of AI Alignment Failures
AI 导读
用强化学习校准决策(RLCD)训练的模型 Jev 可在单次调用中对同一输入回答多个带类型的问题并给出校准概率,零样本检测对齐失效的中位 AUROC 达 0.886,在多数基准上超过有监督基线。
整理与数据来源:AIHOT
来源:HuggingFace Daily Papers(社区热门论文) · arxiv.org