Hugging Face:Blog(RSS)·· 2026-09-08AI 评分46
安全为谁而设?边界感知自蒸馏实现话题内精准拒绝
Safety for Whom? Refusing the Right Subset of a Topic, Not the Whole Topic
AI 导读
Hugging Face 新论文提出边界感知自蒸馏方法,解决模型安全对齐中“话题级拒绝”过于粗糙的问题。该方法通过升级重试策略将训练数据覆盖率从丢失 19.88% 提示词降至 0.20% 残差失败。
整理与数据来源:AIHOT
来源:Hugging Face:Blog(RSS) · huggingface.co