跳到正文
原文
HuggingFace Daily Papers(社区热门论文)·· 10 天前AI 评分45

模型内部表征何时有用?表征工程在 LLM 安全中的角色评估

When Do Model Internals Help? Exploring the Role of Representation Engineering in LLM Safety

AI 导读

一项匹配评估对比了表征工程与行为安全防护在 LLM 安全控制与监控上的表现。安全控制方面,DPO 整体控制最强且随训练数据增加而提升,但后续良性微调会削弱其安全性;表征引导仅在低数据场景(尤其高质量对比数据)保持竞争力。安全监控方面,专用文本监控器检测准确率最高,表征探针则以更低边际成本保持竞争力,监控引导干预还能在几乎不增加过度拒答的情况下恢复 DPO 因良性微调损失的大部分安全性。

整理与数据来源:AIHOT

来源:HuggingFace Daily Papers(社区热门论文) · arxiv.org