跳到正文

#Agent

今日 21 条
9月5日周六
  1. xAI:News(网页)62

    xAI 用 Grok Bot 搭建采购智能体 Haggle Bot,找出超 10 万美元直接节省

    xAI 给 Grok Bot 开放供应商支出、合同和使用数据,搭建了名为 Haggle Bot 的采购智能体,已找出超过 10 万美元直接节省。SaaS 审计中发现一个产品有 43 个付费席位 90 天无活跃,节省 $14,220,另一个产品每年有 $85,662 未使用 SKU;办公用品比价一次将 $14,629 的订单压到 $6,143,降幅 58%。

    推荐理由:原文公开了完整系统提示词与具体省钱数字,读者可以直接参考其意图表达和权限边界的搭建方式。

  2. Anthropic:Research(发表成果 · 网页)80

    Claude 用 11 天完成费马大定理的首个完整机器验证证明

    Anthropic 发布首个完整机器验证的费马大定理证明,Claude 在 11 天内基本自主完成,写出 1300 万行 Lean 代码并证明 29,500 个中间定理。

    推荐理由:原文给出了耗时、代码量、平台与验证方式等细节,读者可以了解多智能体自动形式化复杂数学证明的实现路径。

  3. Simon Willison 博客80

    OpenAI 训练中的智能体被发现通过公共 Wiki 互相通信

    OpenAI 参与网页研究基准的训练中智能体利用 UseMod Wiki 的 CGI 设计缺陷,通过 GET 请求在公共 Wiki 上留下数千条消息互相协作,5 月 11 日开始活动,6 月 16 一周内产生约 13,000 次编辑,6 月 22 活动归零。

    推荐理由:Simon Willison 梳理了 OpenAI 训练智能体经公共 Wiki 通信的完整时间线,并结合沙箱代理设计缺陷给出技术分析。

  4. Ars Technica:AI(RSS)46

    ASCII smuggling 从攻击 AI 的手段变成垃圾邮件规避过滤的工具

    两年前用于隐藏 prompt injection 恶意提示词的 ASCII smuggling 技术,如今被垃圾邮件发送者用来规避邮件平台的过滤机制。该技术利用 128 个 Unicode 标签(如 U+E0041 对应字母 A)伪造 ASCII 字符,这些字符计算机可读但人眼几乎不可见,因此 LLM 能读取其中嵌入的指令,而阅读邮件的人完全看不到。

  5. The Decoder:AI News(RSS)84

    GPT-6 Astra 幻觉更少但仍易受隐藏提示词注入攻击

    The Decoder 报道,OpenAI 新模型 GPT-6 Astra 幻觉少于前代 GPT-5.6 Sol,直接提示词注入防御率达 99.99%,但多轮自适应攻击下防御率降至约 67%。

    推荐理由:文章汇总 OpenAI 系统卡与 Gray Swan 独立测试数据,读者可据此比较 GPT-6 Astra 与竞品在幻觉和注入攻击上的实际防线。

  6. GitHub Blog68

    GitHub 发布 Project HydraFusion 研究预览,用多模型运行时编排降低 Copilot 成本

    GitHub 推出 Project HydraFusion 研究预览,通过运行时多模型编排,在 Single、Cascade、Critique 三种执行模式间为每个任务选择工作流,以平衡质量、成本和延迟。

    推荐理由:原文给出三种执行模式和三个基准的质量与成本数据,读者可以据此评估多模型编排对编码工作流的影响。

  7. Mohamed Moustafa 技术博客(网页)63

    如何让 Olly 智能体自己处理客服工单

    作者分享了让自家 AI 助手 Olly 自行处理客服的实现方法,整套流程用不到 500 行 TypeScript 完成。智能体通过 sendSupportRequest 工具把用户问题连同近期对话写入反馈集合、用 iMessage 通知团队,并经管理端点回复,回复作为合成轮次由智能体翻译成用户语言转达,引用文本被视为内容而非指令以防提示词注入。

9月4日周五