Claude Haiku 5.5 上线 Amazon Bedrock 与 Claude Platform on AWS
AWS 宣布 Claude Haiku 5.5 在 Amazon Bedrock 和 Claude Platform on AWS 上可用。
推荐理由:文章给出 Haiku 5.5 在 Bedrock 上的可用区域、成本变化与代码调用方式,便于判断它在多智能体分层中的位置。
AWS 宣布 Claude Haiku 5.5 在 Amazon Bedrock 和 Claude Platform on AWS 上可用。
推荐理由:文章给出 Haiku 5.5 在 Bedrock 上的可用区域、成本变化与代码调用方式,便于判断它在多智能体分层中的位置。
Mistral 发布 Mistral Large 4 预览版,这是一个 1 万亿参数、490 亿激活参数的模型,基于自有 3800 块 NVIDIA Grace Blackwell GPU 集群训练,目前通过其 API 提供。
Simon Willison 表示欣赏 EmbeddingGemma 2 采用 Apache 2.0 许可。他认为嵌入模型不适合用闭源、仅托管的形式:嵌入模型通常要计算并存储成千上万甚至数百万个向量,一旦厂商停供该模型,用户就得为重新计算这些已存向量付费。他本人不愿自托管,更愿意付费使用托管版本,同时知道厂商停托管后可以自行运行开放权重版本,或另找能运行的供应商。
法国 AI 实验室 Mistral 于周二发布 Mistral Large 4(ML4),这是一个 1 万亿参数的大规模多模态模型,绰号 Le Chonk,目前仅通过公开的 guardrail 端点访问,计划在三周内完成安全测试后开放权重。
Mistral 发布迄今最大模型 Mistral Large 4,拥有 1 万亿参数、490 亿激活参数,已在 Mistral Studio 开放 API 预览,权重预计 10 月底发布。
Cloudflare 发布面向 AI 智能体的决策模型 Clef 和 Clef-flash,返回带概率的简短分类而非长文本,并称智能体决策不再必须有人参与。
AWS 发布开源决策模型 Strands Decider 2B,基于 Qwen3.5-2B 构建,可在本地运行,用于在预设选项中做选择并给出置信度评分。该模型由 AWS 杰出工程师 Marc Brooker 在看过 TypeSafe 的 Jev 后自行开发,曾在同规模模型的 Jevbench 排名上短暂登顶,随后由 Strands Labs 整理发布。
作者实测 Anthropic 新发布的 Claude Sonnet 5.5,用代码动画、HTML PPT、3D 网页和写作四项任务对比 Opus 5.5 与 gpt6。
Google Cloud AI Research 联合 UNC-Chapel Hill、Stanford 和圣路易斯华盛顿大学发布 RRSI(Regularized Recursive Self-Improvement),让 LLM 智能体在不改动模型权重的情况下改写自身 harness 的提示词、工具、记忆、控制流和子智能体。
Jeff 发布基于 Qwen3.5 与 Gemma 4 微调的零样本分类模型 Jeff-Qwen3.5-0.8B、Jeff-Qwen3.5-2B 和 Jeff-Gemma4-E2B,与 Jev 使用相同请求格式,单次前向输出各选项校准概率。
AWS 宣布 Claude Sonnet 5.5 在 Amazon Bedrock 和 Claude Platform on AWS 上线,定位为面向编码与知识工作的更高效 Sonnet 模型,多数任务单任务成本更低、速度更快。
推荐理由:AWS 官方给出 Sonnet 5.5 的定位、与 Opus 5.5 的分工以及 Bedrock 上的调用方式,便于判断何时选用。
Liquid AI 发布 LFM2.5-VL-3B-DSpark,一个为其视觉语言模型 LFM2.5-VL-3B 设计的实验性投机解码草稿模型,新增约 279.5M 参数(+8.9%),在 Apple silicon 上解码最高提速 3.13 倍,NVIDIA H100 上最高 2.66 倍。
Aikido Security 发布首个开源权重安全模型 Altar-1,将 Z.AI 的 GLM-5.3 经 AWQ 4-bit 量化和 Cerebras REAP 专家剪枝(每层保留 168/256 个专家)从 1,506.7 GB 压缩到 328 GB,缩小 78.2%。
Fastino Labs 发布 340M 参数开源权重决策模型 GLiNER2.5-Decide,接受文本和类型化问题 schema,返回带概率分布、置信度和约束可行性元数据的结构化答案,权重采用 Apache 2.0,可运行于 CPU、GPU 或气隙环境。
Liquid AI 为视觉语言模型 LFM2.5-VL-3B 发布实验性 DSpark drafter 模型,参数约 280M,仅增加 8.9% 参数量。GPU 上解码吞吐最高提升 2.66 倍、边缘设备 3.13 倍,端到端分别最高 2.27 倍和 2.62 倍;模型已上架 Hugging Face,支持 llama.cpp、SGLang 和 MLX-VLM。
蚂蚁百灵开源 Ming-Image-0.1-Design 系列模型,包含两个 6B 模型:Design 从文字需求生成 UI、信息图、海报等完整设计,Layer 将设计图拆成 2 至 9 个可独立编辑的 RGBA 图层,并同步开源 Design Skill 和 PPT Skill。
推荐理由:原文给出两个 6B 模型的能力划分、评测成绩和实际接入效果,读者可以据此评估设计生成加图层编辑链路的部署价值。
Fireworks Research 发布基于 Kimi K3 训练的专用模型 Ember-1,通过学习精简不必要的推理,在保持质量的同时减少约 35-50% 的 reasoning token。
推荐理由:官方给出了多组基准、A/B 测试和成本数据,读者可以据此评估用 Ember-1 替代 Kimi K3 降低推理 token 开销的可行性。
OpenAI 发布 GPT-6 系列新成员 GPT-6 Sol 和 GPT-6 Luna,API 价格较 GPT-5.6 促销价降低 50%,两款模型沿用 GPT-6 Astra 的训练方法,主打更快更经济。
Microsoft Research 在 Nature 发表逆合成预测模型 RetroChimera,结合基于 Transformer 的 R-SMILES 2 和图神经网络模型 NeuralLoc,用 learning-to-rank 集成两者互补预测。
Jina AI 发布端到端视觉文档解析模型 jina-ocr-v1,总参数 3.4B,每 token 激活约 570M,可将 PDF、扫描件、表格和发票一次转成 Markdown。
OpenAI前研究员、RLHF共同发明人Almeida创办的TypeSafe AI发布基于transformer的新模型Jev,它不输出文本而是产生概率形式的校准决策。
PrismML 发布 Ternary Bonsai 2 27B,将 Qwen3.8 27B 转为三值权重,模型仅 5.93 GB(FP16 为 53.80 GB),Apache 2.0 开源,官方称在 20 个基准上保留母模型 98.2% 的平均分,支持文本与图像输入和 262K token 上下文。
智谱正式推出 GLM-5.3-FlashX,在 GLM-5.3-Flash 基础上加大对 Infra 侧投入与推理优化,速度最高 200 tokens/s,算力基于 10 万张国产芯片。该模型此前曾以 Ox Alpha 之名面向开发者,官方称其长期保持同尺寸最强智能水平并具备高性价比,API 已上线,Model Key:GLM-5.3-FlashX。
AI 实验室 PrismML 发布 Bonsai 2 27B,将阿里开源模型 Qwen3.8 27B 压缩到 5.9 GB,内存较原版减少 9 到 10 倍,可放进 PC 甚至高端智能手机。
智谱 GLM 团队披露递归自我改进方向首个工程化实践,由 GLM-5.3 驱动的 Infra Agent 完成了 GLM-5.3-Flash 推理基础设施的设计、调试与优化。
由 ChatGPT 联合发明人 Diogo Almeida 创办的 TypeSafe 结束隐身模式,发布专用于程序化决策的 System One Model Jev。
Nums AI 发布预训练表格基础模型 Causilo,支持分类和回归,在 TabArena 单模型中取得最高 Elo,总体 1792.9,领先 Google Research 的 TabFM(1764.4)和 EXAONE Tabular(1758.8)。
推荐理由:原文给出了参数规模、上下文长度、开源协议和定价,读者可据此评估它能否接入现有编码与 Agent 工具链。
蚂蚁 inclusionAI 发布 SingProbe,一个基于 Qwen/Qwen3.5-4B 的轻量探针,复用基座模型隐藏状态在生成时逐 token 输出查询意图、回复不安全性和幻觉风险三类评分,仅 5.18M 参数,解码开销低于 0.5%。
DeepSeek 本周在 HuggingFace 开源 DeepSeek-V4.1-Flash 权重,模型总参数 552B,prefill 激活 8B、decode 激活 16B,支持 1M token 上下文和文本加图像输入,已上线 Baseten Model APIs。
推荐理由:文章解释了 CED 架构如何把 prefill 降到 8B 激活参数并压缩 KV cache,读者能理解它为何更适配编码智能体的高 prefill 负载。
Sakana AI 发布 Fugu 系列两款新模型 Fugu Max 和 Fugu Ultra v2,通过单一 OpenAI 兼容 API 在多个模型间路由任务。
DeepSeek V4.1 Flash 模型 9 月 10 日上线国家超算互联网中心,用户可在官网「模型服务」页面调用其 API。该模型为 552B 参数 MoE 模型,采用 Causal-Encoder-Decoder 结构,输入激活 8B、输出激活 16B;基准测试中超越了包括 DeepSeek V4 Pro 在内的旗舰模型。
DeepSeek AI 发布多模态 MoE 模型 DeepSeek-V4.1-Flash,552B 主干加 196B Engram 参数,上下文窗口 1M,prefill 激活 8B 参数、decode 激活 16B,全局 KV 缓存降至每 token 890 字节,约为 DeepSeek-V4-Flash 的 1/4、DeepSeek-V1 的 1/437。
推荐理由:文章拆解了 KV 缓存压缩和预精简架构的具体做法,读者可以对照其工程路径评估长上下文部署成本。
OpenAI 发布 GPT-6 Astra,已在 ChatGPT Work、Codex 和 API 提供,定价为每百万输入 token $10、输出 token $50。
DeepSeek 开放平台发布通知,计划于北京时间 2026 年 9 月 10 日前后正式发布 V4.1 Flash 模型,官方称经内外部多方测试,其在性能、费用、速度、总用时等指标上全面超越 V4 Pro。
Inception 发布 Mercury 2.5,称其为目前最强扩散大语言模型,智能较 Mercury 2 提升 40%,在 NVIDIA GPU 上达 1,107 tokens 每秒,上下文 260K tokens,定价 $0.20/百万输入、$0.75/百万输出,发布期 8 折优惠。