Mistral Large 4 发布
Mistral 发布 Mistral Large 4,模型可通过 llm 命令行工具以 mistral/mistral-large-4 调用。Simon Willison 用同一提示词让 Mistral Large 4 与 Claude Opus 5.5、GPT-6.1-sol、Gemini 3.8 Flash 分别生成 SVG 进行对比。
Mistral 发布 Mistral Large 4,模型可通过 llm 命令行工具以 mistral/mistral-large-4 调用。Simon Willison 用同一提示词让 Mistral Large 4 与 Claude Opus 5.5、GPT-6.1-sol、Gemini 3.8 Flash 分别生成 SVG 进行对比。
Simon Willison 让 Claude Opus 5.5 为电脑游戏作曲,要求先设计简单的文本音乐格式,再构建可播放的 artifact 并附示例曲目,风格对标《猴岛小英雄》。结果模型比预期更贴近猴岛主题,成品质量出人意料地好。他猜测这种作曲能力可能类似文本模型的 3D 图形能力,是近几个月才涌现的新能力,但需用更多新旧模型做实验才能确认。
NASA 与 IBM Research 联合多家学术机构发布 NASA-IBM Lunar Foundation Model,称其为最早的开源月球科学基础模型之一。
OpenAI 发布 GPT-6.1 Sol,定价 $2/$10 per million input/output tokens,比 Astra 的 $10/$50 大幅降低;据称在 DeepSWE v1.1 上超 GPT-6 Sol 6.4 分、在 AutomationBench 上超 Opus 5.5 2.2 分。
蚂蚁百灵 Ling-3.0-flash-Fin 在 FrontierFinance System Performance 与 Vals AI Finance Agent v2 两项金融智能体评测中取得领先。
作者实测 Anthropic 新发布的 Claude Sonnet 5.5,用代码动画、HTML PPT、3D 网页和写作四项任务对比 Opus 5.5 与 gpt6。
Arena 于 9 月 26 日分析 Text Arena 高推理回复,发现 Claude Opus 5.5 相比 Opus 5 破折号使用量下降约 95%(每 1,000 个单词从 15.2 个降至 0.8 个),分号下降 73%(从 6.10 个降至 1.64 个)。
Arena 宣布 GPT-6 Luna (Max) 进入 Agent Arena Pareto 前沿,净改进 +1.59%,中位成本每任务 $0.05。
推荐理由:Arena 用 8K 真实智能体会话数据给出 GPT-6 Luna (Max) 的排名与成本对比,读者可据此权衡其性价比定位。
Artificial Analysis 发布对 Claude Sonnet 5.5 的评测:其智能指数得分 56,max effort 下比 Sonnet 5 高 18 分,升至第 2 名,仅落后 Opus 5.5 (max)。
推荐理由:Artificial Analysis 实测指出 Sonnet 5.5 逼近 Opus 5.5 依赖约 193k 输出 token,成本细节对选型有直接参考价值。
推荐理由:Arena 介绍了其 Agent Arena 的评测方式,读者可以据此理解 Claude Sonnet 5.5 在真实智能体任务上的衡量口径。
推荐理由:Artificial Analysis 用自家基准拆解了性能与 token 成本的权衡,为选型提供了可对比的量化参考。
Arena 公布 Claude Opus 5.5 (High) 进入 Agent Arena 排名第 2,净改进分 +12.15%,仅次于 Fable 5.1 (Max)。
推荐理由:榜单给出了 Claude Opus 5.5 (High) 在 Agent Arena 的排名、价格与分项信号,读者可据此权衡它与 Opus 5 各档的成本与能力变化。
Microsoft Research 发布研究模型 CARE-X,一个面向胸部 X 光多种临床解读任务的统一视觉语言模型,结合生成式与结构化预测,并用强化学习(DAPO)在多任务设置下奖励临床正确性。