Ars Technica:AI(RSS)·
Dan Goodin
·· 21 天前AI 评分61
研究显示 SynthID-Text 文本水印可能削弱模型对有害提示词的拒答
LLMs respond differently to harmful prompts when AI watermarking is used
AI 导读
研究者 Siposova 通过 Hugging Face 的 SynthIDTextWatermarkLogitsProcessor 测试六个开源权重模型,发现 SynthID-Text 非失真配置的水印会改变对有害请求的拒绝行为,配合提示词注入时更明显,部分模型因此更倾向回答本会拒绝的有害请求;不同密钥下效果也不同,研究将此现象称为采样漂移(sampling drift)。
整理与数据来源:AIHOT
来源:Ars Technica:AI(RSS) · arstechnica.com