跳到正文

#Agent

今日 20 条
9月23日周三
  1. OpenAI:官网动态(RSS · 排除企业/客户案例)82

    OpenAI 发布 GPT-6 Sol 和 GPT-6 Luna,API 价格较 GPT-5.6 降 50%

    OpenAI 发布 GPT-6 Sol 和 GPT-6 Luna,将 GPT-6 Astra 的训练方法用于更快更便宜的模型,API 价格较 GPT-5.6 促销价下调 50%(Sol 输入 $4→$2、输出 $20→$10;Luna 输入 $0.20→$0.10、输出 $1.20→$0.50,每百万 token)。

    推荐理由:官方发布给出各档模型的具体基准分数、API 价格降幅和缓存改进数据,可以用来对比 GPT-6 家族在成本与能力之间的取舍。

  2. Arena.ai72

    Arena 宣布 Anthropic 的 Claude Opus 5.5 已进入 Agent Arena,用户可通过投票驱动排行榜。Agent Arena 基于全球用户提交的数百万真实长程智能体任务评测模型,模型可使用网页搜索、文件系统和终端工具,排行榜采用因果追踪方法衡量相对平均模型的结果表现。

    推荐理由:Arena 官宣 Claude Opus 5.5 上架 Agent Arena 和 Battle Mode,读者可以参与投票影响排行榜结果。

  3. Artificial Analysis 完整文章(网页)82

    Claude Opus 5.5 登顶 Artificial Analysis Intelligence Index

    Artificial Analysis 实测 Claude Opus 5.5 在 Intelligence Index 得分 58,为其测得的最高分,并在 Terminal-Bench 4.0 上与 GPT-6 Astra 打平(59.6%)。

    推荐理由:原文给出 Claude Opus 5.5 在 Intelligence Index 及各分项评测的完整数据和定价变化,读者可据此比较智能与任务成本。

  4. 404 Media(RSS)73

    404 Media 披露 Meta Muse AI 智能体外呼电话部分由呼叫中心人工完成

    404 Media 报道,Meta 上周宣布 Muse AI 智能体可为用户致电商户完成订餐、预约等请求,但内部通讯显示部分通话由呼叫中心的人工坐席拨出并处理。员工担忧用户敏感信息被转交人类承包商带来的隐私风险,并有测试者表示在通话结束后才得知对方是人;Meta 发言人回应称这是内部测试,正式发布前会加入适当披露。

  5. ClaudeDevs77

    Anthropic 推出 Claude 5.5 家族首个模型 Claude Opus 5.5,官方称其在多数任务上达到 Claude Fable 5.1 的水平,运行成本比 Opus 5 低 40%。Claude Devs 补充称其每任务速度快约 30%;在 Claude Code 中,5 小时会话限额今日提升 20%,因 Opus 5.5 定价更低,额度内可用量多 25%,Pro、Max 和 Team 用户还将获得一次可随时使用的额度重置。引用图显示 Opus 5.5 在 Terminal-Bench 4.0 各 effort 档位下得分领先。

  6. Claude Code:GitHub Releases(RSS)68

    Claude Code v2.1.280 发布,新增 Claude Opus 5.5 为默认 Opus 模型

    Claude Code 发布 v2.1.280,新增 Claude Opus 5.5(claude-opus-5-5)为默认 Opus 模型,支持 1M 上下文,价格为 $4/$20 per Mtok、缓存读取 $0.20/Mtok;同时将 Pro 和 Team Standard 计划的默认模型从 Sonnet 改为 Opus。

    推荐理由:官方更新日志详列了新增 Opus 5.5 默认模型、价格与大量修复,开发者可据此判断是否升级及对现有工作流的影响。

  7. Anthropic:Newsroom(网页)91

    Anthropic 发布 Claude Opus 5.5,成本较 Opus 5 降低 40%

    Anthropic 发布 Claude 5.5 系列首个模型 Claude Opus 5.5,官方称多数工作表现与 Claude Fable 5.1 相当,运行成本较 Opus 5 降低 40%,输入和输出 token 定价为每百万 $4 和 $20,输出速度快 30% 以上。

    推荐理由:官方公告同时给出基准分数、完整定价表和防护措施细节,读者可以据此比较它相对 Opus 5 的成本与能力变化。

9月22日周二
  1. Hacker News:AI 热帖63

    Drop 发布:支持 gVisor 的无 root Linux 沙盒

    作者发布 Drop,一款无 root 的 Linux 沙盒工具,用于隔离编码智能体和第三方程序。它基于现有发行版运行,无需 Docker/Podman 容器配置,通过 TOML 配置暴露文件、目录和本地网络服务,用独立的 home 目录隐藏原环境;可选 gVisor 用户态内核作为额外隔离层,防止沙盒程序直接访问宿主内核。

  2. The Verge:AI(RSS)69

    Meta 修复 Muse macOS 应用零日漏洞,攻击者可借此操控 AI 智能体

    Meta 为 Muse macOS 应用发布补丁,修复一个可让攻击者接管 AI 智能体的零日漏洞。安全研究员 Patrick Wardle 发现漏洞利用一个未公开设置,可将转写处理从 Meta 服务器重定向到攻击者端点,从而获取 Muse 账户访问权;概念验证可实现拍照和写入恶意文件且多数情况不提醒用户。

  3. Kimi.ai69

    Kimi 发布新的 Kimi Browser Extension,前身为 Kimi WebBridge。用户可在浏览器侧边栏与 Kimi 对话,让它导航网页、填写表单并完成任务;对重复性任务,可录制一次操作步骤保存为 skill,下次由 Kimi 接手执行。产品现已在 kimi.com/products/kimi-browser-extension 和 Chrome Web Store 上线。

    推荐理由:官方原文给出了产品入口、侧边栏能力和把重复操作存为 skill 的做法,读者可据此评估是否纳入自己的浏览器工作流。

  4. IT之家(RSS)63

    美国银行等多家银行警告 AI 智能体代购或增加诈骗与数据隐私风险

    据路透社 9 月 22 日报道,美国银行、国民西敏银行、ING、新西兰 ASB 银行和美国第一资本金融等多家银行警告,让 AI 智能体代消费者网购可能增加诈骗、欺诈和数据隐私泄露风险。报告指出 AI 智能体可能要求消费者提供银行卡信息直接输入购物网站,或引导用户使用消费者保护较弱的支付方式;银行计划与政策制定者讨论要求披露 AI 参与交易、提高决策透明度及建立客户数据保护机制等提议。