HuggingFace Daily Papers(社区热门论文)·· 24 天前AI 评分51
Decoy Direction Optimization 提出免微调的事后防御对抗 LLM 消融攻击
Decoy Direction Optimization: A Post-Hoc Defense Against LLM Abliteration
AI 导读
论文提出 Decoy Direction Optimization(DDO),一种无需微调的事后权重编辑防御,通过向 MLP 神经元注入高幅值非线性诱饵信号,使 RFA 消融攻击的对比估计器失效。
整理与数据来源:AIHOT
来源:HuggingFace Daily Papers(社区热门论文) · arxiv.org