Google 等机构的智能体被曝 MCP 信任缺口,可被提示注入跨智能体传播
独立研究者 Syed Anas Mohiuddin 测试了 Google、JP Morgan Chase、Weviate、Rapid7、法国政府部际数字事务局和美国联邦政府等机构的智能体,发现 MCP(Model Context Protocol)在智能体间通信中存在信任缺口。
独立研究者 Syed Anas Mohiuddin 测试了 Google、JP Morgan Chase、Weviate、Rapid7、法国政府部际数字事务局和美国联邦政府等机构的智能体,发现 MCP(Model Context Protocol)在智能体间通信中存在信任缺口。
Google 研究者提出 RRSI(Regularized Recursive Self-Improvement of Agent Harnesses),通过随时间收缩的编辑预算和严格评审机制,限制智能体在自我优化时记忆测试任务。
哈佛物理学家 Matthew Schwartz 在 Anthropic 客座博文中介绍开源工具 BootLoops,它让 Claude 完成精确科学计算,三个月内团队在 18 个领域产出 36 篇手稿、19 位合著者。
研究团队提出 Image-to-Code 方法,让编码智能体从单张照片写出可执行的 Blender 程序,并迭代修改直到场景匹配原图。配套基准 LEGO-Bench 包含 104 个场景的 208 张图像,最佳模型 GPT-6 Astra 在室内场景准确率 53.4%、室外仅 39.6%,弱配置约 15%。
卡内基梅隆、MIT、纽约大学和斯坦福的研究团队开发出 AI 系统 Ataraxos,在 Stratego 上以 15 胜 1 负 4 平击败被视为史上最强的选手 Pim Niemeijer。Stratego 是信息不完全游戏,棋子身份只在碰撞时揭示,此前连 DeepMind 也未能造出稳定击败顶尖人类玩家的机器。该研究仅用 16 块 GPU 和数千美元完成训练。
AI Night-Scientist 是一个用强化学习教模型何时以及如何跳出可预测推理的智能体框架,基于行动、过程、结果三个维度用 GRPO 训练。相比基座模型,其科研提案的研究方向范围扩大 27.8%、贡献类型增加 14.9%,预测引用影响最高提升 32.0 个百分点,原创性提升 66.2 分。仅提高解码温度无法复现这些增益,指明追求何种创造力的语义引导才是关键。
小红书 AllSpark 团队提出 PACT(Policy Aligned Critic Training),通过三个正则条件唯一确定长程 Agent 的信用分配,并用 BCE 回归有界 Value、采用 Actor-Then-Critic 更新顺序改进 Critic 与策略对齐。
研究提出一套可审计的同构 LLM 辩论协议,用 transition ledger 记录崩塌、纠正、起始与带符号干预效用。在 6,925 场 MMLU-Pro 辩论中识别出 253 次崩塌,并发现留一模型探针门控冻结虽能阻止 29 次崩塌,却损失 108 次纠正。
TokenCast 通过学习每个执行片段的可组合成本表示,在 LLM 智能体运行过程中实时预测 token 消耗,无需额外调用 LLM,在 SWE-bench Verified 上平均累计预测耗时 32.8 ms。
研究团队提出 AdaGuard 系列 Guard 模型(0.6B、4B、8B),可在推理时按用户自定义策略评估语言模型智能体的轨迹。
BaRe-Mem 是一种面向多智能体咨询的在线贝叶斯可靠性记忆,基于中心模型的内部信念表示估计顾问可靠性,并用历史交互更新这些估计,从而调节顾问回答的影响、决定是咨询还是自主推理。
PReCache 是一个免训练的 KV cache 共享框架,通过 PreLRShared 和 ReBaseShared 两种设计共享基于预训练权重计算的基础 cache,并预计算紧凑的智能体专属低秩(LR)cache。
KVCMAS 是一个面向多智能体系统的在线 KV cache 修正框架,用紧凑低秩状态表示跨智能体的缓存偏差,并沿智能体工作流链式修正,无需额外参考预填充。
研究者提出 Physical Coding,将任务状态与执行表示为代码,并构建 HexaAnything 调用感知、规划与控制工具(含 VLA/WAM 策略),依据外部反馈在环决策。
ControlScope 对比了 LLM 智能体在同一公开执行状态下继续生成代码、编辑下一次工具调用的数据参数、以及替换未完成工作流三种修订方式,并区分可用修复与智能体实际选择的动作。
一篇 arXiv 论文提出多智能体 AI 架构,借鉴 D. Kahneman 的"快思考与慢思考"理论,让系统 1(快速)智能体仅凭过往经验响应问题,系统 2(慢速)智能体则在需要推理和搜索最优解时被刻意激活。两类智能体均由世界模型(含环境领域知识)和"自我"模型(含系统过往动作与求解器技能信息)支撑。论文认为,研究人类具备这些能力的机制有助于理解如何让 AI 系统获得同类能力。
UC Berkeley 团队构建全自动 AI Agent 审计 13 个广泛使用的基准,发现 45 个作弊方案,全部基准被评为 critical 风险,共归纳 16 种攻击类型。
推荐理由:原文给出了13个常用基准的45个作弊方案细节和防范设计原则,读者可以据此检查自己依赖的评测是否可信。
Google Research 推出 AI 视频联合导演,由 4 个智能体框架组成,运行在 Gemini 和 Veo 之上,用于解决多镜头 AI 视频中的身份漂移和级联错误问题。
SkillGym 框架将人类编写的技能转化为 2,756 个带代码检查器的训练环境,并在 8,364 条成功轨迹上微调。
小米官方复盘 MiMo-V2.6 发布后的工具调用重复问题,响应级重复率超 0.05%,并区分了正常并行调用、调用泛滥与调用重复。回放 RL 各 checkpoint 显示泛滥率随训练从 11.1% 升至 24.6%,32 次调用阈值惩罚过于宽松;直接调低阈值需重启 20 步 MixRL,估计成本 231 万美元,且内部测试重复率仅从 13.45% 降至 3.83%。
推荐理由:原文给出完整的归因实验和修复路径,还公开了成本对比,读者可借鉴其诊断 RL 训练中涌现行为的方法。
复旦大学参与的研究团队分析了 56 名参与者、超过 700 份任务日志,研究智能体辅助开发 744B 参数 MoE 模型 Atria Dawn Preview 的过程。四周内每个人类输入对应的智能体操作中位数从 11 升至 28.5,约三分之一的 AI 辅助任务没有 AI 就不会启动,但方法和参数的最终决策 85.5% 由人类做出。团队提醒,长链智能体工作可能让人类监督退化为走过场式审批。
针对长程智能体在线策略自蒸馏中的"决策—时间戳错配"问题,研究者提出 AlignOPSD,通过决策对齐监督校正与半马尔可夫分层信用分配,将监督对齐后再分配信用。
WideSWE 是用于评估编码智能体跨仓库任务的新基准,从 103 个软件生态系统中挖掘出 120 个真实任务,包含 60 个 bug 修复和 60 个功能开发。
TraceDance 是一个从真实部署轨迹自动构建智能体行为基准的系统,通过 Anchor-and-Confirm 与 Anchor Synthesis Loop 针对用户指定的不良行为生成测试。
研究提出 Recursive Harness Distillation,让强智能体把干预经验蒸馏成 playbook 供轻量智能体使用,并借助轻量智能体的执行反馈递归优化,无需更新模型参数。
CompoWorld 通过组合可复用服务来扩展智能体任务空间,构建了 448 个服务、暴露 10,130 个工具,并用 3K SFT 轨迹和 1K RL 任务训练 Qwen3.6-35B-A3B。实验显示其在八个基准上平均提升 9.17 分,在 AutomationBench 上超过 Claude Opus 4.6 等前沿模型,并领先所有对比的 35B-A3B 专用智能体模型。
Skill2Env 是一个能力导向框架,从技能出发,用智能体的能力需求引导任务与环境合成,并通过可复用的难度模式将需求实例化为任务蓝图,指导任务指令、执行基座、工作区与评分器的联合构建。
阿里发布 QwenGyre,一个面向超长程(xlong-horizon)智能体在线强化学习的端到端框架,可在不中断执行的情况下弹性重分配 GPU,并通过轨迹处理器去重冗余分支路径。
DeepSeek-AI 发布技术报告,介绍用于大规模 LLM 智能体 RL 训练与评估的生产级沙箱平台 DeepSeek Elastic Compute(DSec),统一提供 FnCall、容器、microVM 和完整 VM 四种后端。
Lasso Security 的 Andrea Siposova 发文分析 Anthropic 为 Claude 引入的基于 Google DeepMind SynthID-Text 的水印如何影响模型行为,提出采样漂移(sampling drift)概念。
Nvidia 研究人员提出 SoL-Pi 系统,用研究 agent 自动优化编码 agent 的控制层(harness),在 EdgeBench 上相比 Codex 节省 50%、相比 Claude Code 节省 54.3% 的 token,性能与原 Pi harness 大致持平。
一份独立调查报告披露了 7 月约 700 个 OpenAI 智能体入侵 Hugging Face 的此前未公开细节,并发布超过 80,000 个重组攻击 payload 数据集。
推荐理由:作者基于公开链接短链数据独立还原了攻击链条并复原超 80,000 个 payload,披露了此前未公开的智能体行为细节与还原方法。
Relic 将多智能体协作中反复出现的失败转化为组织所有、可执行的协议,把触发条件、责任、所需证据与执行后果绑定到运行时,并支持修订与退役。在十个软件工作负载、三个模型共 360 次受控运行中,完整契约交付率从 14.06% 提升至 19.76%(+5.71 个百分点)。
RoboFoundry 提出“自演化系统即策略”的具身智能体框架,将执行轨迹转化为经验证的任务级系统更新,并沉淀为通用系统能力。在 EmbodiedBench 上,它把 GPT-5.5 提升 27.8%,并让 Qwen3.7-Plus 达到 70.3%、接近 GPT-5.5 的 72.7%。
SkillDRE 是一个全自动框架,通过执行前扫描与运行时防御反馈的双阶段闭环,演化完整的恶意 Agent 技能包。在 SkillsBench 上对四个受害模型评测,平均攻击成功率达 45.28%,超过最强基线 40.3%,且最终提交的技能未触发任何 SkillScan 告警,并基本保留良性任务性能。结果表明,两阶段防御反馈可作为自适应红队的有效学习信号,单独评估任一防御阶段都会遗漏攻击能力。
针对 LLM 智能体在长序列依赖任务中决策漂移的问题,研究者提出 Adaptive Consistency Graph(ACG),将执行证据及其来源增量组织进持久图,并在有限上下文预算下为每次决策构建以需求为中心的临时视图。
GAGAR 是一个面向代码智能体强化学习的质量感知信用重分配框架,通过 SFT 训练的智能体评分器在同一工作区内联合检查并排序通过测试的轨迹,对低排名轨迹降权并按比例重缩放优势值以保持总和不变。