跳到正文
原文
Ars Technica:AI(RSS)· Dan Goodin ·· 21 天前AI 评分61

研究显示 SynthID-Text 文本水印可能削弱模型对有害提示词的拒答

LLMs respond differently to harmful prompts when AI watermarking is used

AI 导读

研究者 Siposova 通过 Hugging Face 的 SynthIDTextWatermarkLogitsProcessor 测试六个开源权重模型,发现 SynthID-Text 非失真配置的水印会改变对有害请求的拒绝行为,配合提示词注入时更明显,部分模型因此更倾向回答本会拒绝的有害请求;不同密钥下效果也不同,研究将此现象称为采样漂移(sampling drift)。

整理与数据来源:AIHOT

来源:Ars Technica:AI(RSS) · arstechnica.com