HuggingFace Daily Papers(社区热门论文)·· 20 天前AI 评分60
PIR 方法通过模型内部状态识别被隐藏的知识,区分不愿答与不会答
A Lie Detector Test for Language Models: Reading Knowledge a Model Won't Reveal
AI 导读
论文提出 Probe of Internal Recognition(PIR),向模型呈现问题及候选答案,从内部状态读取模型识别为正确的选项,无需诚实参考模型或标注真值语料。
整理与数据来源:AIHOT
来源:HuggingFace Daily Papers(社区热门论文) · arxiv.org