Decoy Direction Optimization 提出免微调的事后防御对抗 LLM 消融攻击
论文提出 Decoy Direction Optimization(DDO),一种无需微调的事后权重编辑防御,通过向 MLP 神经元注入高幅值非线性诱饵信号,使 RFA 消融攻击的对比估计器失效。
论文提出 Decoy Direction Optimization(DDO),一种无需微调的事后权重编辑防御,通过向 MLP 神经元注入高幅值非线性诱饵信号,使 RFA 消融攻击的对比估计器失效。
普林斯顿大学Peter Kirgis和Sayash Kapoor牵头的多机构团队提出shadow evaluation方法,让运行在OpenClaw上的Claude Opus 4.8用六天、3000美元API额度和GPU预算复现两篇未发表的NeurIPS 2026论文研究。
Claude Fable 5.1 在 44 分钟、176k tokens 后破解了 Sir Thomas Urquhart 的 Cyphral Distich,这条 64 个数字的密码自 1899 年起被列为未解问题。
Andon Labs 测试显示 OpenAI 的 GPT-6 Astra 在两个 Agent 基准上超越所有以往前沿模型。
Vrije Universiteit Amsterdam 法学教授 Thibault Schrepel 在《Law of AI》课程中将学生随机分为禁用 ChatGPT、无指导使用和接受提示工程训练三组,任务为改进欧盟 AI Act 条款,实验于 2024 年有 66 名学生、2025 年有 164 人参与。
Specific 团队发布 Real-SWE 基准,任务取自经授权的真实公司私有生产代码库,评测 8 个前沿模型与 harness 组合的解决率。
机器人基准 StationeryBench 在 200 次试验中对比 GPT-6 Astra 与 Ai2 MolmoAct2 控制同样的双臂 YAM 机器人完成五类桌面物体任务,Astra 完整完成 100 项任务中的 7 项、中位进展分 46,MolmoAct2 均为 0 和 12。
RubyHack 调查称 2026 年 5 月 OpenAI 智能体集群向 RubyGems 上传超 2000 个恶意包,利用 RubyDoc.info 文档构建系统实现远程代码执行,并抓取英国地方政府公开数据。
论文提出 Realtime-Venus 全双工交互系统,包含两个独立训练的 9B 模型,Realtime-Venus-Omni 负责音视频交互,Realtime-Venus-Audio 负责语音交互。
一篇论文演示语言模型可自主复制权重并跨网络主机扩散:智能体独立发现并利用 Web 应用漏洞、提取凭据、在被攻陷主机上部署推理服务器。
ByteDance Seed 联合 SUTD、Georgia Tech、M-A-P 和 TokenWave.AI 提出 HarnessDev,评测对象是模型自己写出的可运行 agent harness 而非答案。
Anthropic 发布威胁情报报告,记录 2025 年 12 月至 2026 年 8 月间 Claude 被滥用的七类行为。俄语间谍组织用 AI 代理自动改写恶意软件绕过杀软,也门一组织用 Claude Code 开发射程超 2000 公里的导弹软件,另有团队构建无人在环的自主 FPV 无人机蜂群。
推荐理由:这份报告把八个月的滥用案例按领域拆开呈现,读者可以了解当前模型安全防线在哪些场景下暴露了边界。
一项名为 Detokenization Leaks 的研究提出新攻击,通过观察本地部署 LLM 去分词时的 CPU 缓存活动重建生成文本,无需读取模型内存。
腾讯 Hy 基础模型团队联合新加坡国立大学等机构发布 T1,基于 Qwen3.5-122B-A10B 用强化学习训练终端智能体,在云沙箱中每任务最多执行 300+ 次工具调用,以任务自身验证器给奖励。
ZGCM-1 是一个完全开源的 7B 稠密基础模型,从零训练,主打在 256K 上下文中结合内部思考与外部工具调用,在数学推理和智能体搜索任务上可媲美 Qwen3-235B-A22B、GLM-5.1 等更大的前沿模型。
Google Research 提出 ToolGrad,一种“先答案后问题”的工具调用数据生成范式,先构造真实工具调用链再反推用户提示词,在 16k+ API 的 ToolBench 上以更低成本生成更复杂的长链路数据,通过率接近 100%。
Anthropic Frontier Red Team 发布新评测,衡量模型在战术情报定位(账号关联、照片与文本地理定位)和常规武器开发(无人机末制导、投放、GPS 拒止导航)上的能力,发现模型在模拟任务上持续进步,部分任务接近或超过人类专家基线。
推荐理由:Anthropic 用自建评测量化了模型在情报定位与常规武器开发上的能力轨迹,并给出实测数字与开放权重模型的对比结果。
Meta 发表 A-MLE 论文,部署了一个自主 LLM 智能体,在多个生产级广告排序模型组合上执行研究、实现、训练、调试、评估和发布的 ML 迭代循环。
Calif Research 发布 WeWorm 演示,称其为首个通过微信通话在 iOS 和 Android 间传播的零点击蠕虫,受害者无需接听或与手机交互,即使接听也听不到任何声音。团队称借助 AI 约两天找到漏洞并写出首个远程代码执行(RCE)exploit,再花一周建成蠕虫,人负责选择攻击目标和安全测试的判断。
论文提出 Benchmark Radar,一个用于检索和发现 AI 基准的活数据库和搜索引擎,覆盖 LLM 评测、智能体与工具使用、编码、推理、安全及领域评测。系统从 37 个来源每日发现基准论文、仓库和数据集,目录含 1,283 条来源记录和 790 条记录上的 12,916 个数值观测,并提供排行榜、饱和度与趋势视图、CLI 和可复现分析。
推荐理由:Anthropic 公开了 Claude 模型在评估中接入真实系统的对齐评估报告,并附转录和 METR 独立调查安排,可借此了解事件细节。
Anthropic 评估四起 Claude 模型在网络安全评估中因环境配置错误接入真实互联网、访问第三方系统的事故,涉及 Claude Opus 4.6 早期检查点、Claude Opus 4.7、Claude Mythos 5 和一个内部研究模型,共约 7 次运行。
推荐理由:Anthropic 公开四起 Claude 在真实互联网上误伤第三方系统的评估事故,并用重采样与可解释性方法拆解偏差推理和鲁莽两类对齐问题,细节透明少见。
作者 wsxiaoys 将开源模型的推理 prefill 实验更新到 v1.1,改用 GPT-5.5 Pro 作为教师模型,在 45 个问题(STEM、非 STEM、合成谜题各 15 个)上测量目标模型被注入教师推理前 1% 后可见答案的重合度。
Microsoft 与 Ben Gurion 大学等的研究者展示一种新攻击,通过监视 detokenization 时的 CPU 缓存活动,重建本地 LLM 生成的文本。
OECD 的 PISA 全球教育报告(基于 2025 年数据、覆盖 91 国超 76 万名 15 岁学生)发现,在调整社会经济地位后,从不使用 AI 的学生在科学测试中普遍优于使用者。