跳到正文
原文
HuggingFace Daily Papers(社区热门论文)·· 14 天前AI 评分46

Jev:用 RLCD 训练的单次调用模型零样本检测 AI 对齐失效

Just Ask Jev: Reinforcement Learning for Calibrated Decisions as a Zero-Shot Detector of AI Alignment Failures

AI 导读

用强化学习校准决策(RLCD)训练的模型 Jev 可在单次调用中对同一输入回答多个带类型的问题并给出校准概率,零样本检测对齐失效的中位 AUROC 达 0.886,在多数基准上超过有监督基线。

整理与数据来源:AIHOT

来源:HuggingFace Daily Papers(社区热门论文) · arxiv.org