Anthropic 发布 Claude Haiku 5.5,价格对齐 GPT-6 Luna
Anthropic 发布快速低价模型 Claude Haiku 5.5,定价为每百万 token 输入 $0.10、输出 $0.50,与 OpenAI 上月发布的 GPT-6 Luna 一致,超过 100,000 token 后涨至 $0.50/$2.50。
推荐理由:作者实测对比 Haiku 5.5 与 GPT-6 Luna 的价格、tokenizer 与推理档位,给出可迁移的成本判断。
Anthropic 发布快速低价模型 Claude Haiku 5.5,定价为每百万 token 输入 $0.10、输出 $0.50,与 OpenAI 上月发布的 GPT-6 Luna 一致,超过 100,000 token 后涨至 $0.50/$2.50。
推荐理由:作者实测对比 Haiku 5.5 与 GPT-6 Luna 的价格、tokenizer 与推理档位,给出可迁移的成本判断。
Anthropic 发布 Claude Haiku 5.5,这是其目前最快、最便宜的小型模型,平均价格比 Haiku 4.5 低约 75%,10 万 token 以内提示词的价格降幅最高达 90%,超过 10 万 token 的提示词价格则是前者的五倍。
推荐理由:Haiku 5.5 的降价幅度与基准提升同时给出,读者可据此判断小型模型在成本敏感任务中的实际定位。
OpenAI 面向所有 ChatGPT 用户推出 GPT-6,并带来名为 Intelligent UI 的新功能,模型以图形、按钮、图表和表单等交互界面呈现答案,而非纯文本。
推荐理由:GPT-6 把 ChatGPT 输出从纯文本改为可交互界面,并给出分版本与开放节奏,可据此判断交互形态的变化。
OpenAI 宣布 GPT-6 正在 ChatGPT 中面向全球上线,并同步推出 Intelligent UI。官方称新版本响应更快,提供可视化内容与可直接探索和使用的交互体验。
推荐理由:OpenAI 官方公布 GPT-6 在 ChatGPT 全球上线,并同步引入 Intelligent UI,读者可据此了解模型与交互形态的同步变化。
AWS 宣布 Claude Haiku 5.5 在 Amazon Bedrock 和 Claude Platform on AWS 上可用。
推荐理由:文章给出 Haiku 5.5 在 Bedrock 上的可用区域、成本变化与代码调用方式,便于判断它在多智能体分层中的位置。
Mistral 表示其新模型 Le Chonk 能够与顶级闭源模型竞争,同时保持开放权重。
Mistral 发布 Mistral Large 4 预览版,这是一个 1 万亿参数、490 亿激活参数的模型,基于自有 3800 块 NVIDIA Grace Blackwell GPU 集群训练,目前通过其 API 提供。
Simon Willison 表示欣赏 EmbeddingGemma 2 采用 Apache 2.0 许可。他认为嵌入模型不适合用闭源、仅托管的形式:嵌入模型通常要计算并存储成千上万甚至数百万个向量,一旦厂商停供该模型,用户就得为重新计算这些已存向量付费。他本人不愿自托管,更愿意付费使用托管版本,同时知道厂商停托管后可以自行运行开放权重版本,或另找能运行的供应商。
Google DeepMind 发布 EmbeddingGemma 2,将文本、代码、图像、视频和音频映射到统一嵌入空间,采用 Apache 2.0 许可,参数量 7.4 亿。
推荐理由:EmbeddingGemma 2 把文本、图像、音频、视频统一到同一嵌入空间,并给出端侧内存与向量截断的具体数据,便于判断本地检索与 RAG 的可行性。
Google 发布图像生成与编辑模型 Nano Banana 2.1,取代 2026 年 2 月发布的 Nano Banana 2,1K 图像价格从 6.70 美分降至 3.36 美分,4K 从 15.10 降至 7.56 美分。
Google 发布开源多模态嵌入模型 EmbeddingGemma 2,可将文本、图像、视频、音频和代码转为数值向量。该模型 7.4 亿参数,在 Massive Text Embedding Benchmark(Code)上得分 78.68,比前代 68.76 提升近 10 分,Google 称其表现超过规模两倍的竞品。
Mistral 发布 Mistral Large 4,模型可通过 llm 命令行工具以 mistral/mistral-large-4 调用。Simon Willison 用同一提示词让 Mistral Large 4 与 Claude Opus 5.5、GPT-6.1-sol、Gemini 3.8 Flash 分别生成 SVG 进行对比。
法国 AI 实验室 Mistral 于周二发布 Mistral Large 4(ML4),这是一个 1 万亿参数的大规模多模态模型,绰号 Le Chonk,目前仅通过公开的 guardrail 端点访问,计划在三周内完成安全测试后开放权重。
Simon Willison 让 Claude Opus 5.5 为电脑游戏作曲,要求先设计简单的文本音乐格式,再构建可播放的 artifact 并附示例曲目,风格对标《猴岛小英雄》。结果模型比预期更贴近猴岛主题,成品质量出人意料地好。他猜测这种作曲能力可能类似文本模型的 3D 图形能力,是近几个月才涌现的新能力,但需用更多新旧模型做实验才能确认。
Mistral 发布迄今最大模型 Mistral Large 4,拥有 1 万亿参数、490 亿激活参数,已在 Mistral Studio 开放 API 预览,权重预计 10 月底发布。
AI 公司 Reflection 发布首款免费开放模型 Beam,采用 MoE 架构,每 token 激活 5010 亿总参数中的 230 亿,面向编码、逻辑推理和智能体任务。
推荐理由:Reflection 首款开源权重模型 Beam 以 MoE 架构和超大规模 RL 训练,在推理与编码基准上以更少算力对标 GLM 5.2 和 Qwen 3.8。
Reflection 发布 Beam,一个面向编码、智能体与科研任务的纯文本 MoE 模型,总参数 501B、激活 23B,从零训练,Apache 2.0 全量权重将于本月放出。
Reflection AI 发布首款前沿开源权重模型 Beam,称其在高级推理基准上追平 Z.ai 的 GLM-5.2,并比当前领先的西方开源模型表现更好,推理算力用量少 3-4 倍。
Reka AI 发布全模态模型 Rho-1 的研究预览版,这是一个 190 亿参数的模型,可在单一神经网络中处理并生成文本、图像、视频和机器人控制动作。与多数将任务分派给专用模型的系统不同,Rho-1 把所有模态作为 token 放在同一个共享上下文窗口中运行,无需工具调用或外部模型,可实时生成连续视频并即时响应新指令而无需重启。
Aleph Alpha 发布 Kolibri,一个德语和英语双语模型,总参数 78B,通过 MoE 架构每 token 激活约 3B。公司称 Kolibri 在两种语言的质量与运行成本上处于帕累托前沿,德语基准得分 71%,解码速度快于 GPT OSS A5B、Qwen 3.6 A3B 和 Gemma 4 A4B 等同类模型。
NASA 与 IBM Research 联合多家学术机构发布 NASA-IBM Lunar Foundation Model,称其为最早的开源月球科学基础模型之一。
OpenAI 发布 GPT-6.1 Sol,定价 $2/$10 per million input/output tokens,比 Astra 的 $10/$50 大幅降低;据称在 DeepSWE v1.1 上超 GPT-6 Sol 6.4 分、在 AutomationBench 上超 Opus 5.5 2.2 分。
Cloudflare 发布面向 AI 智能体的决策模型 Clef 和 Clef-flash,返回带概率的简短分类而非长文本,并称智能体决策不再必须有人参与。
微软 AI 发布实时转写模型 MAI-Transcribe-2-Streaming,称其在 Artificial Analysis 准确率排名第一,支持 60 种语言,首个部分结果延迟略超 100 毫秒,年底前音频价格为每小时 0.54 美元。
Black Forest Labs 发布 Flux 3 模型家族中的图像模型 Flux 3 Image,官方称其支持多步编辑且不改动图像其他部分,覆盖文生图、图生图、文字渲染和照片级真实感。
Google 发布新一代前沿模型 Gemini 4 Argon,在 Artificial Analysis 智能指数上以 53 分追平 GPT-6 Astra(max)和 Claude Fable 5.1,但仍落后 Claude Opus 5.5 的 58 分。
推荐理由:汇总第三方与 Google 自测的基准、价格和 token 消耗差异,可判断 Argon 在头部模型中的实际位置。
Ideogram 发布新模型 Ideogram 4.5,称其只修改用户指定的区域,换装等编辑不会改变人物身形和背景,早期测试者确认多次编辑后一致性较强。该模型提供四档质量档位,每张图 0.8 至 22 美分,均为原生 2K 分辨率,现已上线 Ideogram 平台和 API,合作方包括 Picsart、Runway、Pika 和 Leonardo AI。
Tavus 推出名为 Griffin 的 Human Interaction Model,可在实时视频通话中同时接收和生成语音、面部表情、语气、手势与停顿。
Google 发布下一代前沿模型 Gemini 4 Argon,称其在真实软件工程、法律金融等企业知识工作和网络安全防御等复杂工作流中具备前沿性能。该模型初期仅向一组可信网络安全方开放,Google 表示正参与美国政府的前沿模型发布前自愿访问流程,并将逐步扩大访问范围。
推荐理由:Google 发布 Gemini 4 Argon 却先只开放给可信网络安全方,读者可据此观察前沿模型发布与安全审查的绑定趋势。
Google 母公司 Alphabet 发布 Gemini 4 Argon,称其可处理编码、研究和写作等任务,并专门针对防御性网络安全训练,能自主发现、验证和修补关键软件漏洞。
AWS 发布开源决策模型 Strands Decider 2B,基于 Qwen3.5-2B 构建,可在本地运行,用于在预设选项中做选择并给出置信度评分。该模型由 AWS 杰出工程师 Marc Brooker 在看过 TypeSafe 的 Jev 后自行开发,曾在同规模模型的 Jevbench 排名上短暂登顶,随后由 Strands Labs 整理发布。
Google DeepMind 发布 Gemini 4 Argon,面向编码、企业知识工作和网络防御,首批开放给 Fairwind 计划中的政府用户与可信网络安全人员,之后才会向开发者、企业和消费者开放。
推荐理由:汇总 Gemini 4 Argon 的基准、定价与可用范围,并列出观察者对公布数据的质疑。
Google DeepMind 推出 SynthID Bio,将水印技术引入合成生物学,把不可感知的签名直接嵌入生物代码,使水印不仅能在数字模型上验证,也能在合成出的实体蛋白质上验证,同时保持其生物功能。
推荐理由:SynthID 水印技术首次延伸到合成生物学,读者可了解 AI 生成蛋白质如何在保留功能的同时被标记与验证。
Google DeepMind 发布前沿模型 Gemini 4 Argon,先通过 Fairwind Program 向受信任的网络安全防御方开放,随后逐步扩展至开发者、企业和消费者。
推荐理由:Gemini 4 Argon 的发布信息给出了输出上限、定价与多项基准成绩,可据此判断前沿模型在长程工程与安全防御上的进展。
Google 宣布推出 Gemini 4 Argon AI 模型,但该模型目前尚不可用。此前外界预期的 Gemini 3.5 Pro 并未出现。
GPT-6.1 Sol 现已在 Amazon Bedrock 正式可用,面向智能体编码、计算机使用和专业工作负载提供更强推理能力。据 OpenAI,它在 DeepSWE v1.1 上以约五分之一的单任务成本达到 GPT-6 Astra 的水平,并比 GPT-6 Sol 最佳成绩高 6.4 个百分点,且推理投入更低。
推荐理由:AWS 官方给出 GPT-6.1 Sol 在 Bedrock 上的能力定位与成本对比,可据此判断智能体工作流的落地方式。
Simon Willison 于 9 月 29 日发布博文,讨论 GPT 6.1 Sol 以五分之一的价格提供接近 Astra 的智能水平。
Anthropic 发布对智谱 GLM-5.3 网络攻击能力的分析,发现其可自主开发端到端漏洞利用,在 ExploitBench 410 次尝试中成功 50 次,接近 Claude Mythos Preview 的 56 次。
推荐理由:Anthropic 第一手评测给出 GLM-5.3 的漏洞利用成功率和防护绕过数据,读者可据此了解开放权重模型带来的攻击面变化。
NVIDIA 发布开源表格基础模型 Kumo Tabular,对带标签表格做单次前向推理即可完成分类和回归,无需训练、调参或特征工程。
推荐理由:官方技术博客披露了架构、纯人工数据预训练配方和四项基准成绩,读者可据此评估其替换梯度提升树的可行性。
上海人工智能实验室 InternLM 项目发布 ResOPD,一种仅用教师模型 Top-k 概率和学生采样 token 概率即可估计全词表 reverse-KL 梯度的稀疏在线策略蒸馏方法,教师传输量和前向次数与稀疏 OPD 持平。