跳到正文
原文
DAIR.AI· @dair_ai · X·· 2026-09-07AI 评分61
AI 导读

研究团队研究模型能否察觉自己正在被测试,发现能力较强的模型可以区分被测试与真实部署,这会削弱安全评估结论的效力。论文提出两种技术:critique refinement 用额外推理时算力让模拟器动作更贴近部署,DISH(Deployment-Imitating SWE-Agent Harness)用真实 agent harness 缩小模拟编码环境与生产环境的差距。

整理与数据来源:AIHOT

来源:DAIR.AI · x.com