ElevenLabs 发布 v4 语音模型,表达力与长文本一致性提升并推出 Turbo 实时版本
ElevenLabs 发布 Eleven v4 语音模型,更准确地跟随情感、停顿等方向提示,支持超过 90 种语言(v3 约为 70 种),单次可处理 10,000 字符,发音基准得分从 v3 的 85.6% 升至 91.7%。
ElevenLabs 发布 Eleven v4 语音模型,更准确地跟随情感、停顿等方向提示,支持超过 90 种语言(v3 约为 70 种),单次可处理 10,000 字符,发音基准得分从 v3 的 85.6% 升至 91.7%。
PostHog 发布 Jeeves,一个基于 Qwen3.5-9B(LoRA + pointer head)的推理型 Jev 式分类器,采用 SFT 与 CISPO 训练,并配备 block-4 扩散草稿器。
蚂蚁百灵 Ling-3.0-flash-Fin 在 FrontierFinance System Performance 与 Vals AI Finance Agent v2 两项金融智能体评测中取得领先。
作者实测 Anthropic 新发布的 Claude Sonnet 5.5,用代码动画、HTML PPT、3D 网页和写作四项任务对比 Opus 5.5 与 gpt6。
OpenAI DevDay 2026 公布 20 多项发布,涵盖 GPT-6 Astra、ChatGPT、Codex、API、安全以及面向开发者的新工具。
OpenAI 发布 GPT-6.1 Sol,官方称其在编码、电脑操作和专业工作方面接近 Astra 的智能水平。该模型标准 API 输入与输出 token 价格均为 Astra 的五分之一。
推荐理由:OpenAI 发布 GPT-6.1 Sol,主打编码与电脑操作能力,API 价格降至 Astra 的五分之一。
Google Cloud AI Research 联合 UNC-Chapel Hill、Stanford 和圣路易斯华盛顿大学发布 RRSI(Regularized Recursive Self-Improvement),让 LLM 智能体在不改动模型权重的情况下改写自身 harness 的提示词、工具、记忆、控制流和子智能体。
H Company 发布 Holo4 系列通用计算机使用模型,包含 Holo4 27B(dense)和 Holo4 35B-A3B(MoE,3B 激活)两个规格,支持 256K 上下文,可在桌面、网页、Android、代码沙箱和业务 API 上以同一方式调用。
阿里 Qwen 团队发布 Qwen-Audio-3.1 系列 5 个音频模型,主力为面向语音智能体的全双工模型 qwen-audio-3.1-realtime-plus,通过 QwenCloud API 以 WebSocket 提供,未开源权重,并对 Realtime、TTS、ASR 分别降价约 85%、70% 和最高 95%。
Anthropic 发布 Claude Sonnet 5.5,是 Claude 5.5 家族第二款模型,定位为 Opus 5.5 更快更省的补充,已在 Claude Platform、AWS、Google Cloud 和 Azure 上线。
Arena 于 9 月 26 日分析 Text Arena 高推理回复,发现 Claude Opus 5.5 相比 Opus 5 破折号使用量下降约 95%(每 1,000 个单词从 15.2 个降至 0.8 个),分号下降 73%(从 6.10 个降至 1.64 个)。
Anthropic 的 Claude Opus 5.5 本周发布,社区反馈以正面为主,尤其擅长生成讲解视频。它在 SimpleBench 上以 88.4% 领先,在 Terminal-Bench-Science 上推理强度从 low 的 24% 升到 xhigh 的 62%,max 档反而降到 59%。
ElevenLabs 于当地时间周一发布 v4 与 v4 Turbo 两款语音模型,强化情绪表达控制、降低响应延迟,语言支持从 70 种提升至 90 余种,用户仅需 10 秒音频素材即可完成声音克隆。
Arena 宣布 GPT-6 Luna (Max) 进入 Agent Arena Pareto 前沿,净改进 +1.59%,中位成本每任务 $0.05。
Anthropic 发布中端模型 Claude Sonnet 5.5,官方称速度比上一代提升 30%,Token 消耗速度明显更低,定位为编写代码和制作办公文档等日常任务的助手。
Anthropic 发布 Claude Sonnet 5.5,官方称其运行快 30% 以上,多数工作成本最多低 30%,定价与 Sonnet 5 相同但在各项基准上表现更好。
Jeff 发布基于 Qwen3.5 与 Gemma 4 微调的零样本分类模型 Jeff-Qwen3.5-0.8B、Jeff-Qwen3.5-2B 和 Jeff-Gemma4-E2B,与 Jev 使用相同请求格式,单次前向输出各选项校准概率。
推荐理由:Arena 用 8K 真实智能体会话数据给出 GPT-6 Luna (Max) 的排名与成本对比,读者可据此权衡其性价比定位。
一组 Claude Sonnet 5.5 的早期实验。 @_re_pete 用 Sonnet 5 与 Sonnet 5.5 制作的秋叶模拟器对比。
Anthropic 于今日发布 Sonnet 5.5,定位为比 Sonnet 5 更强的协作模型,但需要用户保持掌控并在适当时机调用 Opus。该模型是 Claude 拥挤家族中的新成员,具体参数与基准数据尚未披露。
Artificial Analysis 发布对 Claude Sonnet 5.5 的评测:其智能指数得分 56,max effort 下比 Sonnet 5 高 18 分,升至第 2 名,仅落后 Opus 5.5 (max)。
推荐理由:Artificial Analysis 实测指出 Sonnet 5.5 逼近 Opus 5.5 依赖约 193k 输出 token,成本细节对选型有直接参考价值。
Anthropic 的 Claude Sonnet 5.5 上线 OpenRouter。原文称其明显比 Sonnet 5 更聪明、写作更清晰,且对多数工作负载快约 30%、便宜约 30%。
AWS 宣布 Claude Sonnet 5.5 在 Amazon Bedrock 和 Claude Platform on AWS 上线,定位为面向编码与知识工作的更高效 Sonnet 模型,多数任务单任务成本更低、速度更快。
推荐理由:AWS 官方给出 Sonnet 5.5 的定位、与 Opus 5.5 的分工以及 Bedrock 上的调用方式,便于判断何时选用。
Anthropic 发布 Claude Sonnet 5.5,输出速度提升超过 30%,因每任务消耗 token 更少,有效成本最多降低 30%,多项基准接近 Opus 5.5。
推荐理由:Arena 介绍了其 Agent Arena 的评测方式,读者可以据此理解 Claude Sonnet 5.5 在真实智能体任务上的衡量口径。
推荐理由:Artificial Analysis 用自家基准拆解了性能与 token 成本的权衡,为选型提供了可对比的量化参考。
Anthropic 发布 Claude Sonnet 5.5,称为 Claude 5.5 家族的第二款模型,相比 Sonnet 5 是明显升级,运行速度提升超过 30%,多数工作成本最多降低 30%。
Anthropic 发布中端模型 Sonnet 5.5,官方称其比前代 Sonnet 5 快 30%,token 消耗明显更低。公司基准显示该模型在 agentic 编码上优于 Opus 5.5,并称其具备与 Opus 5 相当的网络安全能力,因此成为首个适用与 Fable 和 Opus 相同网络安全防护的 Sonnet 模型;公司还计划在未来几周发布新版本 Haiku。