Anthropic 发布 Claude Opus 5.5:性能对标 Fable 5.1,运行成本比 Opus 5 低 40%
Anthropic 发布 Claude 5.5 家族首个模型 Claude Opus 5.5,称其在多数工作上达到 Fable 5.1 水平,典型工作负载运行成本比 Opus 5 低 40%,输出速度快 30% 以上。
Anthropic 发布 Claude 5.5 家族首个模型 Claude Opus 5.5,称其在多数工作上达到 Fable 5.1 水平,典型工作负载运行成本比 Opus 5 低 40%,输出速度快 30% 以上。
OpenAI 发布 GPT-6 Sol 和 GPT-6 Luna,将 GPT-6 Astra 的训练方法用于更快更便宜的模型,API 价格较 GPT-5.6 促销价下调 50%(Sol 输入 $4→$2、输出 $20→$10;Luna 输入 $0.20→$0.10、输出 $1.20→$0.50,每百万 token)。
推荐理由:官方发布给出各档模型的具体基准分数、API 价格降幅和缓存改进数据,可以用来对比 GPT-6 家族在成本与能力之间的取舍。
OpenAI 发布 GPT-6 Sol 和 Luna 更新版,扩展本月早些时候推出的 GPT-6 Astra 系列。6 系列 API 价格为 5.6 系列 Sol 和 Luna 的一半,公司归因于缓存和推理改进;内部事实性评测显示 GPT-6 Sol 错误数约为前代一半,达到 Astra 级可靠性。
Artificial Analysis 实测 Claude Opus 5.5 在 Intelligence Index 得分 58,为其测得的最高分,并在 Terminal-Bench 4.0 上与 GPT-6 Astra 打平(59.6%)。
推荐理由:原文给出 Claude Opus 5.5 在 Intelligence Index 及各分项评测的完整数据和定价变化,读者可据此比较智能与任务成本。
Claude Code 发布 v2.1.280,新增 Claude Opus 5.5(claude-opus-5-5)为默认 Opus 模型,支持 1M 上下文,价格为 $4/$20 per Mtok、缓存读取 $0.20/Mtok;同时将 Pro 和 Team Standard 计划的默认模型从 Sonnet 改为 Opus。
推荐理由:官方更新日志详列了新增 Opus 5.5 默认模型、价格与大量修复,开发者可据此判断是否升级及对现有工作流的影响。
Anthropic 官方博客拆解 Claude Code 任务在 Opus 5.5 上的成本构成,轮次、缓存读取、输出 token 和模型选择决定账单,Opus 5.5 API 输入输出每百万 token 降价 20%、缓存读取降 60% 至 $0.20。
推荐理由:原文把一次任务的 token 成本拆成轮次、缓存、输出和模型选择四项,并给出 effort 设置与缓存维护的可迁移省钱方法。
Anthropic 发布 Claude 5.5 系列首个模型 Claude Opus 5.5,官方称多数工作表现与 Claude Fable 5.1 相当,运行成本较 Opus 5 降低 40%,输入和输出 token 定价为每百万 $4 和 $20,输出速度快 30% 以上。
推荐理由:官方公告同时给出基准分数、完整定价表和防护措施细节,读者可以据此比较它相对 Opus 5 的成本与能力变化。
Anthropic 发布 Claude Opus 5.5,称其在多数任务上达到 Claude Fable 5.1 水平,总运营成本比 Opus 5 低约 40%,输出速度快 30% 以上。
Anthropic 于周二发布新模型 Opus 5.5,公司称其在编码和知识工作上创下新 SOTA,并在多项基准上超过更大的 Fable 模型。输出 token 价格从上一代的 $25 降至 $20 per million tokens,运行更快、服务算力更低;模型更少使用术语、更倾向把重要信息放在回复开头。
作者发布 Drop,一款无 root 的 Linux 沙盒工具,用于隔离编码智能体和第三方程序。它基于现有发行版运行,无需 Docker/Podman 容器配置,通过 TOML 配置暴露文件、目录和本地网络服务,用独立的 home 目录隐藏原环境;可选 gVisor 用户态内核作为额外隔离层,防止沙盒程序直接访问宿主内核。
JetBrains 发布 JetBrains Air,一个面向开发者、团队和组织的开放智能体开发产品体系,包含 Air in JetBrains IDEs、Air Teams、Air Governance(原 JetBrains Central)三个产品,编码智能体 Junie 将支持所有 Air 表面。
NVIDIA、NTU 和 MIT 的研究团队发布 SoL-Pi,一套为开源 Pi 编码 Agent 提供的 4 项效率机制,由 AI 通过 harness 层的自动研究循环发现。
SpaceXAI 发布新旗舰模型 Grok 4.7,面向编码、智能体任务和知识工作,定价与 Grok 4.6 相同,为每百万 token 输入 $2、输出 $6。
工程师 Colin Breck 发文批评用 AI 批量生成设计文档、PR 摘要和会议纪要的现象,认为这类缺乏上下文的机器文本几乎不可读,并引用调查称 78% 的读者会在认为文章由 AI 撰写时停止阅读。他结合自己写学术论文的经历指出,AI 校验事实、补全引用、画 TikZ 图很有价值,但让它从上下文直接生成段落从未令人满意,主张写作应保留作者的亲身经验与声音。
SpaceXAI 于 9 月 22 日宣布推出新一代模型 Grok 4.7,定位编码和知识工作场景,官方称其为公司目前最强的编码和知识处理模型。该模型采用更大基座并经更长时间强化学习训练,强化自我验证与长上下文管理,在 CursorBench 4.0、GDPval、AA Briefcase 等基准较 Grok 4.6 有提升。
Simon Willison 发布 llm-keys-ui 0.1 插件,让用户无需把 API key 粘贴进智能体会话即可把 key 配置到远程机器。
Latent Space 发布对 TypeSafe AI CEO Diogo Almeida 的约两小时访谈,围绕其新模型 Jev 展开。
Artificial Analysis 发布 Grok 4.7 评测,Grok 4.7(xhigh)智能指数得 46 分,较 Grok 4.6 高 2 分,使 SpaceXAI 进入前四;搭配 Grok Build 的编码智能体指数从 47 升至 56,仅次于 Claude Fable 5.1、GPT-6 Astra 和 Claude Opus 5。
推荐理由:评测方给出 Grok 4.7 在多项基准的具体分数、token 消耗与对比对象,读者可据此判断其真实水平与成本。
Grok 4.7 发布,官方称在同等价格和速度下较 Grok 4.6 有显著提升。Harvey Legal Agent Benchmark 上 Grok 4.7 得分 19.6%。
Linear 工程师分享如何解决 AI Agent 加速写代码后 CI 成为瓶颈的问题,PR 等待时间从 6 分钟以上降至 5 分钟出头,单测 runner 时间约减半。
推荐理由:作者以第一手实践拆解 Linear 优化 CI 的具体做法与数据,读者可将其方法迁移到自己的 TypeScript 项目。
xAI 发布 Grok 4.7,定价为每百万输入 token 2 美元、输出 token 6 美元,公司称其基于更大基座模型并经过更长强化学习训练。
Elon Musk 引用 Artificial Analysis 评测称,Grok 4.7 使 xAI 在智能体编码上排名第三,仅次于 Anthropic 和 OpenAI。