跳到正文

#Agent

今日 21 条
9月20日周日
  1. Rohan Paul72

    Google 发布 ScientistTwo 论文,展示 AI 研究中的递归自我改进:模型先改进人类方法,再以自身发现为新基线继续改进。它以提出想法、实验验证、剔除无效方案并根据评审反馈开启新一轮的循环方式,自主改进了 107 个人类定义 ML 问题中的 86 个;在基于 ICLR、ICML 和 NeurIPS 论文的问题上,报告了 80.4% 的成功率和相对原始人类基线平均 25.2% 的改进。

9月19日周六
  1. HuggingFace Daily Papers(社区热门论文)55

    SAT 自组织智能体团队学会协同推理,超越最强成员

    论文提出自组织智能体团队 SAT,让固定团队的智能体从以往协作中学习角色分工、对话阶段和信息流策略,实现协同计算。仅用 15 道数学和 25 道研究生级知识题学到的策略可原样迁移到未见基准,五个数学与物理基准平均准确率 66.7%,高于最强成员的 48.8% 和完美路由器的 59.0%,在 AIME 2026 上超出该路由器 13.4 分。

  2. Simon Willison 博客65

    Claude Code 2.1.277 开始支持 AGENTS.md

    Thariq Shihipar 宣布 Claude Code 开始支持 AGENTS.md,从 2.1.277 版本起,当文件夹中没有 CLAUDE.md 时,Claude 会查找并使用 AGENTS.md。该支持基于即将推出的 Claude Code mods 自定义机制实现,属于内置 mod,用户也可以自行构建自定义版本的项目指令,mod 源码已公开。

  3. Hacker News 热门(buzzing.cc 中文翻译)57

    danluu:关掉大脑用 LLM 写代码的 meat proxy 模式走不通

    作者观察到越来越多人在使用 LLM 时关闭大脑、只当 for 循环肉代理,认为这种方式即使在 2026 年 9 月也产不出能用的软件,且员工这样做最终只会让自己被替代。文中用 Dominion 棋类 AI 对比和多个失效案例说明 agent 在分布外任务上表现远逊于合理的人类判断,并引用 Luke Burton、Thomas Dullien 和 Gary Bernhardt 的观点佐证。

  4. Ethan Mollick:One Useful Thing(RSS)63

    Ethan Mollick 谈能力悬差:GPT-6 Astra 与 Fable 5.1 的现有能力远未被用尽

    Ethan Mollick 撰文指出 GPT-6 Astra 和 Fable 5.1 已能可靠完成数周量级的人类工作,但大多数人远未用尽其能力,形成能力悬差。

    推荐理由:作者用自己复刻 Zork 3D 化和重建 Eco 图书馆等实测案例,提出深知识、广知识、品味与能动性四个与 AI 协作的个人优势。