Reflection 发布首款开源权重模型 Beam,主打低算力对标 DeepSeek 与 Qwen
AI 公司 Reflection 发布首款免费开放模型 Beam,采用 MoE 架构,每 token 激活 5010 亿总参数中的 230 亿,面向编码、逻辑推理和智能体任务。
推荐理由:Reflection 首款开源权重模型 Beam 以 MoE 架构和超大规模 RL 训练,在推理与编码基准上以更少算力对标 GLM 5.2 和 Qwen 3.8。
AI 公司 Reflection 发布首款免费开放模型 Beam,采用 MoE 架构,每 token 激活 5010 亿总参数中的 230 亿,面向编码、逻辑推理和智能体任务。
推荐理由:Reflection 首款开源权重模型 Beam 以 MoE 架构和超大规模 RL 训练,在推理与编码基准上以更少算力对标 GLM 5.2 和 Qwen 3.8。
Reflection 发布 Beam,一个面向编码、智能体与科研任务的纯文本 MoE 模型,总参数 501B、激活 23B,从零训练,Apache 2.0 全量权重将于本月放出。
Reflection AI 发布首款前沿开源权重模型 Beam,称其在高级推理基准上追平 Z.ai 的 GLM-5.2,并比当前领先的西方开源模型表现更好,推理算力用量少 3-4 倍。
Google 母公司 Alphabet 发布 Gemini 4 Argon,称其可处理编码、研究和写作等任务,并专门针对防御性网络安全训练,能自主发现、验证和修补关键软件漏洞。
Google DeepMind 发布前沿模型 Gemini 4 Argon,先通过 Fairwind Program 向受信任的网络安全防御方开放,随后逐步扩展至开发者、企业和消费者。
推荐理由:Gemini 4 Argon 的发布信息给出了输出上限、定价与多项基准成绩,可据此判断前沿模型在长程工程与安全防御上的进展。
GPT-6.1 Sol 现已在 Amazon Bedrock 正式可用,面向智能体编码、计算机使用和专业工作负载提供更强推理能力。据 OpenAI,它在 DeepSWE v1.1 上以约五分之一的单任务成本达到 GPT-6 Astra 的水平,并比 GPT-6 Sol 最佳成绩高 6.4 个百分点,且推理投入更低。
推荐理由:AWS 官方给出 GPT-6.1 Sol 在 Bedrock 上的能力定位与成本对比,可据此判断智能体工作流的落地方式。
作者实测 Anthropic 新发布的 Claude Sonnet 5.5,用代码动画、HTML PPT、3D 网页和写作四项任务对比 Opus 5.5 与 gpt6。
OpenAI DevDay 2026 公布 20 多项发布,涵盖 GPT-6 Astra、ChatGPT、Codex、API、安全以及面向开发者的新工具。
OpenAI 发布 GPT-6.1 Sol,官方称其在编码、电脑操作和专业工作方面接近 Astra 的智能水平。该模型标准 API 输入与输出 token 价格均为 Astra 的五分之一。
推荐理由:OpenAI 发布 GPT-6.1 Sol,主打编码与电脑操作能力,API 价格降至 Astra 的五分之一。
Anthropic 发布 Claude Sonnet 5.5,是 Claude 5.5 家族第二款模型,定位为 Opus 5.5 更快更省的补充,已在 Claude Platform、AWS、Google Cloud 和 Azure 上线。
Anthropic 发布中端模型 Claude Sonnet 5.5,官方称速度比上一代提升 30%,Token 消耗速度明显更低,定位为编写代码和制作办公文档等日常任务的助手。
Anthropic 发布 Claude Sonnet 5.5,官方称其运行快 30% 以上,多数工作成本最多低 30%,定价与 Sonnet 5 相同但在各项基准上表现更好。
Anthropic 的 Claude Sonnet 5.5 上线 OpenRouter。原文称其明显比 Sonnet 5 更聪明、写作更清晰,且对多数工作负载快约 30%、便宜约 30%。
AWS 宣布 Claude Sonnet 5.5 在 Amazon Bedrock 和 Claude Platform on AWS 上线,定位为面向编码与知识工作的更高效 Sonnet 模型,多数任务单任务成本更低、速度更快。
推荐理由:AWS 官方给出 Sonnet 5.5 的定位、与 Opus 5.5 的分工以及 Bedrock 上的调用方式,便于判断何时选用。
Anthropic 发布 Claude Sonnet 5.5,输出速度提升超过 30%,因每任务消耗 token 更少,有效成本最多降低 30%,多项基准接近 Opus 5.5。
Anthropic 发布中端模型 Sonnet 5.5,官方称其比前代 Sonnet 5 快 30%,token 消耗明显更低。公司基准显示该模型在 agentic 编码上优于 Opus 5.5,并称其具备与 Opus 5 相当的网络安全能力,因此成为首个适用与 Fable 和 Opus 相同网络安全防护的 Sonnet 模型;公司还计划在未来几周发布新版本 Haiku。
Anthropic 发布 Claude Sonnet 5.5,为 Claude 5.5 家族第二款模型,生成速度比 Sonnet 5 快 30% 以上,每任务成本最多低 30%,定价维持每百万输入 token $2、输出 $10、缓存读取 $0.20。
Anthropic 发布 Claude Sonnet 5.5,运行速度比 Sonnet 5 快 30% 以上,写作更清晰,适合快速来回交互。定位上与为复杂判断工作打造的 Claude Opus 5.5 区分,Sonnet 5.5 擅长范围明确的日常任务、修复 bug 以及制作文档、幻灯片和表格。模型即日起全量可用,Claude Haiku 5.5 将在未来几周加入该系列。
新智元转述多位开发者在 X 上的爆料称,Claude Sonnet 5.5 已出现在 Anthropic 官方配置中,标识符为「claude-sonnet-5-5」,并在 Claude Code 中开启灰度测试。
美团 LongCat API 开放平台于 9 月 25 日上线 LongCat-2.5-Preview 模型,同步开放 API 与网页端体验入口。
Anthropic 发布 Claude Opus 5.5,上下文1M Token,输入4美元/输出20美元每百万Token,比Opus 5成本降40%、速度快30%以上,Terminal-Bench 4.0拿66.4%创最高分,定位为Fable 5.1的性价比替代。
推荐理由:原文给出了 Code Arena: WebDev 具体分数和领先幅度,读者可以据此比较 Opus 5.5 与其他模型的表现和性价比。
Fireworks Research 发布基于 Kimi K3 训练的专用模型 Ember-1,通过学习精简不必要的推理,在保持质量的同时减少约 35-50% 的 reasoning token。
推荐理由:官方给出了多组基准、A/B 测试和成本数据,读者可以据此评估用 Ember-1 替代 Kimi K3 降低推理 token 开销的可行性。
Anthropic 发布 Claude Opus 5.5,称其多数任务达到 Claude Fable 5.1 水平,运行成本比 Opus 5 低 40%,并成为 Claude Code 与 Claude 应用的默认模型。
推荐理由:汇总 Claude Opus 5.5 与 GPT-6 Sol/Luna 同日发布的价格、基准与订阅变化,可对照两家降价策略。
OpenAI 发布 GPT-6 系列两款新模型 GPT-6 Sol 与 Luna,API 定价相比 GPT-5.6 促销价下调约 50%,Sol 为每 1M tokens 输入 $2、输出 $10,Luna 为 $0.10、$0.50,两者已上线 API。
OpenAI 发布 GPT-6 Sol 和 Luna 两款模型,token 价格较 GPT-5.6 Sol 和 Luna 下降一半,Sol 为每百万输入 token $2、输出 $10,Luna 为 $0.10/$0.50,同时提供缓存输入 token 九折优惠。
Anthropic 发布 Claude Opus 5.5,为 Claude 5.5 家族首个模型,宣称性能可媲美 Claude Fable 5.1,典型工作负载成本比 Opus 5 低 40%,输出速度快 30% 以上。
OpenAI 发布 GPT-6 系列新成员 GPT-6 Sol 和 GPT-6 Luna,API 价格较 GPT-5.6 促销价降低 50%,两款模型沿用 GPT-6 Astra 的训练方法,主打更快更经济。
Anthropic 发布 Claude 5.5 家族首个模型 Claude Opus 5.5,称其在多数工作上达到 Fable 5.1 水平,典型工作负载运行成本比 Opus 5 低 40%,输出速度快 30% 以上。
OpenAI 发布 GPT-6 Sol 和 GPT-6 Luna,将 GPT-6 Astra 的训练方法用于更快更便宜的模型,API 价格较 GPT-5.6 促销价下调 50%(Sol 输入 $4→$2、输出 $20→$10;Luna 输入 $0.20→$0.10、输出 $1.20→$0.50,每百万 token)。
推荐理由:官方发布给出各档模型的具体基准分数、API 价格降幅和缓存改进数据,可以用来对比 GPT-6 家族在成本与能力之间的取舍。