Anthropic 发布 Claude Haiku 5.5,价格对齐 GPT-6 Luna
Anthropic 发布快速低价模型 Claude Haiku 5.5,定价为每百万 token 输入 $0.10、输出 $0.50,与 OpenAI 上月发布的 GPT-6 Luna 一致,超过 100,000 token 后涨至 $0.50/$2.50。
推荐理由:作者实测对比 Haiku 5.5 与 GPT-6 Luna 的价格、tokenizer 与推理档位,给出可迁移的成本判断。
Anthropic 发布快速低价模型 Claude Haiku 5.5,定价为每百万 token 输入 $0.10、输出 $0.50,与 OpenAI 上月发布的 GPT-6 Luna 一致,超过 100,000 token 后涨至 $0.50/$2.50。
推荐理由:作者实测对比 Haiku 5.5 与 GPT-6 Luna 的价格、tokenizer 与推理档位,给出可迁移的成本判断。
Anthropic 发布 Claude Haiku 5.5,这是其目前最快、最便宜的小型模型,平均价格比 Haiku 4.5 低约 75%,10 万 token 以内提示词的价格降幅最高达 90%,超过 10 万 token 的提示词价格则是前者的五倍。
推荐理由:Haiku 5.5 的降价幅度与基准提升同时给出,读者可据此判断小型模型在成本敏感任务中的实际定位。
Mistral 发布 Mistral Large 4 预览版,这是一个 1 万亿参数、490 亿激活参数的模型,基于自有 3800 块 NVIDIA Grace Blackwell GPU 集群训练,目前通过其 API 提供。
AI 公司 Reflection 发布首款免费开放模型 Beam,采用 MoE 架构,每 token 激活 5010 亿总参数中的 230 亿,面向编码、逻辑推理和智能体任务。
推荐理由:Reflection 首款开源权重模型 Beam 以 MoE 架构和超大规模 RL 训练,在推理与编码基准上以更少算力对标 GLM 5.2 和 Qwen 3.8。
Reflection AI 发布首款前沿开源权重模型 Beam,称其在高级推理基准上追平 Z.ai 的 GLM-5.2,并比当前领先的西方开源模型表现更好,推理算力用量少 3-4 倍。
Google 发布新一代前沿模型 Gemini 4 Argon,在 Artificial Analysis 智能指数上以 53 分追平 GPT-6 Astra(max)和 Claude Fable 5.1,但仍落后 Claude Opus 5.5 的 58 分。
推荐理由:汇总第三方与 Google 自测的基准、价格和 token 消耗差异,可判断 Argon 在头部模型中的实际位置。
Google DeepMind 发布 Gemini 4 Argon,面向编码、企业知识工作和网络防御,首批开放给 Fairwind 计划中的政府用户与可信网络安全人员,之后才会向开发者、企业和消费者开放。
推荐理由:汇总 Gemini 4 Argon 的基准、定价与可用范围,并列出观察者对公布数据的质疑。
NVIDIA 发布开源表格基础模型 Kumo Tabular,对带标签表格做单次前向推理即可完成分类和回归,无需训练、调参或特征工程。
推荐理由:官方技术博客披露了架构、纯人工数据预训练配方和四项基准成绩,读者可据此评估其替换梯度提升树的可行性。
PostHog 发布 Jeeves,一个基于 Qwen3.5-9B(LoRA + pointer head)的推理型 Jev 式分类器,采用 SFT 与 CISPO 训练,并配备 block-4 扩散草稿器。
Anthropic 发布 Claude Sonnet 5.5,是 Claude 5.5 家族第二款模型,定位为 Opus 5.5 更快更省的补充,已在 Claude Platform、AWS、Google Cloud 和 Azure 上线。
Anthropic 的 Claude Opus 5.5 本周发布,社区反馈以正面为主,尤其擅长生成讲解视频。它在 SimpleBench 上以 88.4% 领先,在 Terminal-Bench-Science 上推理强度从 low 的 24% 升到 xhigh 的 62%,max 档反而降到 59%。
Artificial Analysis 发布对 Claude Sonnet 5.5 的评测:其智能指数得分 56,max effort 下比 Sonnet 5 高 18 分,升至第 2 名,仅落后 Opus 5.5 (max)。
推荐理由:Artificial Analysis 实测指出 Sonnet 5.5 逼近 Opus 5.5 依赖约 193k 输出 token,成本细节对选型有直接参考价值。
Anthropic 发布 Claude Sonnet 5.5,输出速度提升超过 30%,因每任务消耗 token 更少,有效成本最多降低 30%,多项基准接近 Opus 5.5。
Fireworks AI 推出 Ember-1,这是基于 Moonshot AI 开源权重 Kimi K3 进行后训练的专用模型。该模型通过优化内部推理过程,在保持任务准确率的同时将生成的推理 Token 减少了约 40%。与单纯降低推理努力程度不同,Ember-1 保留了有用的自我反思并削减了冗余循环。基准测试显示,其在 Terminal Bench 2.1 和 DeepSWE 1.1 上表现优于 K3 Max,且在生产环境 A/B 测试中实现了显著的成本节约。目前仅通过 Fireworks Serverless API 以研究预览形式提供,未开放权重。
推荐理由:原文给出具体排名、分数差和混合价格,读者可据此比较 Claude Opus 5.5 与前代的性价比位置。
BottleCap AI 发布 ThinkingCap-Qwen3.8-27B,这是基于 Qwen3.8-27B 的微调模型,在 12 个基准上平均减少 37.2% 思考 token,宏观精度从 86.65% 降至 85.79%。
Stanford 与 NVIDIA Research 团队发布 Contrastive Language Models(CLM)及 CLM-8B,用对比学习连接状态与动作,作为快速决策的 System One 模型。
Contrastive-LM 发布开放模型 CLM-8B,首个对比语言模型(CLM),不为生成文本而训练,而是对候选动作按当前状态打分并返回概率,主打与 TypeSafe AI 的 System One 模型 Jev 相同的接口。
Fireworks Research 发布基于 Kimi K3 训练的专用模型 Ember-1,通过学习精简不必要的推理,在保持质量的同时减少约 35-50% 的 reasoning token。
推荐理由:官方给出了多组基准、A/B 测试和成本数据,读者可以据此评估用 Ember-1 替代 Kimi K3 降低推理 token 开销的可行性。
Kyutai 发布 Voice of Reason,两个基于 GLM-4-Voice-9B 的开源权重语音到语音模型,无需转写和独立文本 LLM 即可口头解数学题。
OpenAI 发布 GPT-6 系列两款新模型 GPT-6 Sol 与 Luna,API 定价相比 GPT-5.6 促销价下调约 50%,Sol 为每 1M tokens 输入 $2、输出 $10,Luna 为 $0.10、$0.50,两者已上线 API。
OpenAI 发布 GPT-6 Sol 和 Luna 两款模型,token 价格较 GPT-5.6 Sol 和 Luna 下降一半,Sol 为每百万输入 token $2、输出 $10,Luna 为 $0.10/$0.50,同时提供缓存输入 token 九折优惠。
Arena 宣布 OpenAI 的 GPT-6 Sol 和 GPT-6 Luna 评分即将公布,邀请用户前往 Arena 实测并通过投票真实智能体任务支持其排行榜。
推荐理由:文中提及Peter用相同提示词和max reasoning对比GPT-6 Sol与GPT-5.6 Sol,覆盖输出、token用量和时延,可帮助读者了解两代模型差异。
OpenAI 发布 GPT-6 Sol 和 GPT-6 Luna,将 GPT-6 Astra 的训练方法用于更快更便宜的模型,API 价格较 GPT-5.6 促销价下调 50%(Sol 输入 $4→$2、输出 $20→$10;Luna 输入 $0.20→$0.10、输出 $1.20→$0.50,每百万 token)。
推荐理由:官方发布给出各档模型的具体基准分数、API 价格降幅和缓存改进数据,可以用来对比 GPT-6 家族在成本与能力之间的取舍。
OpenAI 发布 GPT-6 Sol 和 Luna 更新版,扩展本月早些时候推出的 GPT-6 Astra 系列。6 系列 API 价格为 5.6 系列 Sol 和 Luna 的一半,公司归因于缓存和推理改进;内部事实性评测显示 GPT-6 Sol 错误数约为前代一半,达到 Astra 级可靠性。
Anthropic 发布 Claude 5.5 系列首个模型 Claude Opus 5.5,官方称多数工作表现与 Claude Fable 5.1 相当,运行成本较 Opus 5 降低 40%,输入和输出 token 定价为每百万 $4 和 $20,输出速度快 30% 以上。
推荐理由:官方公告同时给出基准分数、完整定价表和防护措施细节,读者可以据此比较它相对 Opus 5 的成本与能力变化。
Anthropic 发布 Claude Opus 5.5,称其在多数任务上达到 Claude Fable 5.1 水平,总运营成本比 Opus 5 低约 40%,输出速度快 30% 以上。
小米发布 MiMo-V2.6 系列,旗舰 MiMo-V2.6-Pro 在 Artificial Analysis Intelligence Index 得 46 分,居开源模型之首,价格为每百万输入 token $0.435、输出 $0.87。
小米发布并开源 Xiaomi MiMo-V2.6 系列,含 Pro 与 Flash 两个原生全模态模型,称这是探索 RSI(递归自我改进)路径的关键一步。
SpaceXAI 发布新旗舰模型 Grok 4.7,面向编码、智能体任务和知识工作,定价与 Grok 4.6 相同,为每百万 token 输入 $2、输出 $6。