全部AI 动态
全部动态
今日 5 条
🚨 AI News | TestingCatalog@testingcatalogAI 评分7575Hacker News:AI 热帖AI 评分8686 Anthropic 发布 Claude Sonnet 5.5:速度提升 30%+,每任务成本最多降 30%
Anthropic 发布 Claude Sonnet 5.5,为 Claude 5.5 家族第二款模型,生成速度比 Sonnet 5 快 30% 以上,每任务成本最多低 30%,定价维持每百万输入 token $2、输出 $10、缓存读取 $0.20。
Claude:YouTube(RSS)AI 评分6767 Anthropic 发布 Claude Sonnet 5.5,速度比 Sonnet 5 快超 30%
Anthropic 发布 Claude Sonnet 5.5,运行速度比 Sonnet 5 快 30% 以上,写作更清晰,适合快速来回交互。定位上与为复杂判断工作打造的 Claude Opus 5.5 区分,Sonnet 5.5 擅长范围明确的日常任务、修复 bug 以及制作文档、幻灯片和表格。模型即日起全量可用,Claude Haiku 5.5 将在未来几周加入该系列。
Claude:YouTube(RSS)AI 评分6565 Anthropic 发布 Claude Sonnet 5.5,速度比 Sonnet 5 快逾 30%
Anthropic 发布 Claude Sonnet 5.5,运行速度比 Sonnet 5 快超过 30%,写作更清晰,适合快速往复的日常任务。官方称其擅长修复 bug、制作文档、幻灯片和表格并有较强设计感,而 Claude Opus 5.5 面向需要谨慎判断的复杂工作;Sonnet 5.5 即日起全面可用,Claude Haiku 5.5 将在未来几周加入该系列。
Arena.ai@arenaAI 评分6868
Arena.ai@arenaAI 评分7373
Arena.ai@arena精选AI 评分7575Arena 公布 Claude Opus 5.5 (High) 进入 Agent Arena 排名第 2,净改进分 +12.15%,仅次于 Fable 5.1 (Max)。
推荐理由:榜单给出了 Claude Opus 5.5 (High) 在 Agent Arena 的排名、价格与分项信号,读者可据此权衡它与 Opus 5 各档的成本与能力变化。
Rohan Paul@rohanpaul_aiAI 评分4646
Artificial Analysis@ArtificialAnlysAI 评分6161IT之家(RSS)AI 评分4343 Kimi K3.1 前端标识泄露:支持 1M tokens 上下文,预计近期发布
月之暗面 API 后台模型注册表出现“kimi-k3-1”标识且接口可调用,官方开放平台同步出现 K3.1 预告,支持 1M tokens 上下文窗口。该模型提供 Low、High、Max 三档推理强度,可能引入 Agent 智能体模式、Swarm 多智能体协作及搜索、批处理任务模式,API 价格显示与现有 K3 相同。
Artificial Analysis@ArtificialAnlysAI 评分5555
OpenBMB@OpenBMBAI 评分3232
X.PIN@thexpinAI 评分6464华为发布了 openPangu 2.0 的代码,涵盖预训练、监督微调及强化学习后训练环节。此次发布扩展了其基于昇腾硬件原生训练与推理的开放 AI 模型计划,相关模型组件正逐步添加至开源平台。
Hugging Face:Blog(RSS)精选AI 评分7171 H Company 发布 Holo4 智能体模型系列,含 27B 与 35B-A3B 两个版本
H Company 发布通用计算机使用智能体模型系列 Holo4,含 27B dense 和 35B-A3B MoE 两个尺寸,并基于 Nemotron 3 Nano Omni 推出 Holotron4 Nano。
推荐理由:原文给出跨 GUI、代码、MCP 和 API 的统一智能体模型设计、基准分数和成本对比,并开源权重与轨迹数据,读者可评估其实际可用性。
MarkTechPost(RSS)AI 评分7878 Fireworks AI 发布 Ember-1:基于 Kimi K3 的后训练模型,推理 Token 减少约 40%
Fireworks AI 推出 Ember-1,这是基于 Moonshot AI 开源权重 Kimi K3 进行后训练的专用模型。该模型通过优化内部推理过程,在保持任务准确率的同时将生成的推理 Token 减少了约 40%。与单纯降低推理努力程度不同,Ember-1 保留了有用的自我反思并削减了冗余循环。基准测试显示,其在 Terminal Bench 2.1 和 DeepSWE 1.1 上表现优于 K3 Max,且在生产环境 A/B 测试中实现了显著的成本节约。目前仅通过 Fireworks Serverless API 以研究预览形式提供,未开放权重。
IT之家(RSS)AI 评分5757 华为开源盘古 openPangu-2.0 预训练、SFT 代码和后训练 RL 代码正式开源上线
华为 9 月 28 日宣布,开源盘古 openPangu-2.0 的预训练、SFT 代码和后训练 RL 代码正式开源上线。openPangu 是华为开源 AI 模型品牌,通过昇腾原生训练与推理技术为业界提供最佳实践参考,相关代码已上线 gitcode.com 的 ascend-tribe/openPangu-2.0-Training 和 openPangu-2.0-RL 仓库。
IT之家(RSS)AI 评分6060 Claude Sonnet 5.5 疑似泄露,配置标识符现身并开启灰度测试
新智元转述多位开发者在 X 上的爆料称,Claude Sonnet 5.5 已出现在 Anthropic 官方配置中,标识符为「claude-sonnet-5-5」,并在 Claude Code 中开启灰度测试。
elvis@omarsar0AI 评分5555H Company 官方精选AI 评分7474 H Company 发布 Holo4 开放权重模型,统一操作界面与工具
H Company 发布 Holo4 的二百七十亿参数稠密模型和混合专家版本,提供 API、可下载权重与多种量化格式。模型把桌面、网页、安卓操作及代码和工具调用结合在同一智能体中;不同测试平台的分数不能直接横向比较。
推荐理由:开放权重和量化版本让团队能在自有环境尝试界面操作智能体,并对不同设备和工具组合开展实际任务评测。
MarkTechPost(RSS)AI 评分5151 巴西 Supersonic Labs 发布 144.3M 参数开源决策模型 Julia 1,可在 CPU 上运行
巴西 AI 实验室 Supersonic Labs 发布 144.3M 参数的开源决策模型 Julia 1,权重以 Apache 2.0 协议托管在 Hugging Face,可在普通 CPU 上运行,不生成文本,只对 2 到 20 个候选答案输出选择和概率。
Arena.ai@arena精选AI 评分7878推荐理由:原文给出具体排名、分数差和混合价格,读者可据此比较 Claude Opus 5.5 与前代的性价比位置。
IT之家(RSS)AI 评分6464 美团上线 LongCat-2.5-Preview 模型:1.6T 参数,主打长程任务与多模态
美团 LongCat API 开放平台于 9 月 25 日上线 LongCat-2.5-Preview 模型,同步开放 API 与网页端体验入口。
MarkTechPost(RSS)AI 评分5555 Liquid AI 发布 LFM2.5-VL-3B-DSpark 投机解码草稿模型,解码最高提速 3.13 倍
Liquid AI 发布 LFM2.5-VL-3B-DSpark,一个为其视觉语言模型 LFM2.5-VL-3B 设计的实验性投机解码草稿模型,新增约 279.5M 参数(+8.9%),在 Apple silicon 上解码最高提速 3.13 倍,NVIDIA H100 上最高 2.66 倍。
Arena.ai@arenaAI 评分8181
Rohan Paul@rohanpaul_aiAI 评分5151
MarkTechPost(RSS)AI 评分5353 Aikido Security 发布开源权重安全模型 Altar-1,由 GLM-5.3 压缩至 328 GB
Aikido Security 发布首个开源权重安全模型 Altar-1,将 Z.AI 的 GLM-5.3 经 AWQ 4-bit 量化和 Cerebras REAP 专家剪枝(每层保留 168/256 个专家)从 1,506.7 GB 压缩到 328 GB,缩小 78.2%。
karminski-牙医@karminski3AI 评分5858
Meituan LongCat@Meituan_LongCatAI 评分5555MarkTechPost(RSS)AI 评分5858 Fastino 发布 GLiNER2.5-Decide:可在 CPU 上运行的 340M 开源权重决策模型
Fastino Labs 发布 340M 参数开源权重决策模型 GLiNER2.5-Decide,接受文本和类型化问题 schema,返回带概率分布、置信度和约束可行性元数据的结构化答案,权重采用 Apache 2.0,可运行于 CPU、GPU 或气隙环境。
MarkTechPost(RSS)AI 评分6565 Black Forest Labs 发布 7B 开源权重世界动作模型 FLUX 3 Action,以 42.92% 登顶 RoboLab-120
Black Forest Labs 发布 7B 开源权重世界动作模型 FLUX 3 Action,用于机器人控制,在 RoboLab-120 上以 42.92% 任务成功率排名第一,领先 Cosmos 3 Nano 6.1 个百分点且参数少 56%。
MarkTechPost(RSS)AI 评分5858 BottleCap AI 发布 ThinkingCap-Qwen3.8-27B:思考 token 减少 37.2%,精度仅降 0.86pp
BottleCap AI 发布 ThinkingCap-Qwen3.8-27B,这是基于 Qwen3.8-27B 的微调模型,在 12 个基准上平均减少 37.2% 思考 token,宏观精度从 86.65% 降至 85.79%。
Black Forest Labs:Blog(网页)AI 评分5454 Black Forest Labs 发布 7B 开源权重世界动作模型 FLUX 3 Action
Black Forest Labs 发布 FLUX 3 Action,一个 7B 参数、开放权重的世界动作模型。官方称可将 FLUX 的视觉智能转化为动作能力,用于机器人、模拟器或游戏。
The Decoder:AI News(RSS)AI 评分5656 Black Forest Labs 发布开源机器人模型 FLUX 3 Action
Black Forest Labs 发布面向机器人的开源模型 FLUX 3 Action,基于以视频数据训练的多模态 FLUX 3,可从机器人工作区的多机位视频预测智能体下一步动作及环境变化。BFL 称其仅 70 亿参数即在 RoboLab-120 排行榜创下成功率纪录,体积不到此前最佳开源模型一半,运行最快快至 3.95 倍;模型权重已上架 Hugging Face。
Rohan Paul@rohanpaul_aiAI 评分5656Artificial Intelligence News(网页)AI 评分6060 Google 发布 Gemini 3.8 Flash TTS 与 Flash-Lite TTS 两款语音模型
Google 发布 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 两款语音生成模型,前者面向游戏、互动娱乐和长篇旁白,后者面向自动配音、对话智能体和高吞吐翻译流水线。
elvis@omarsar0AI 评分5252
Liquid AI 模型与工程博客(网页)AI 评分5757 Liquid AI 发布 LFM2.5-VL-DSpark 视觉语言 drafter 模型,边缘端解码最高提速 3.13 倍
Liquid AI 为视觉语言模型 LFM2.5-VL-3B 发布实验性 DSpark drafter 模型,参数约 280M,仅增加 8.9% 参数量。GPU 上解码吞吐最高提升 2.66 倍、边缘设备 3.13 倍,端到端分别最高 2.27 倍和 2.62 倍;模型已上架 Hugging Face,支持 llama.cpp、SGLang 和 MLX-VLM。
Hacker News:AI 热帖AI 评分5858 Stanford 与 NVIDIA Research 发布对比语言模型 CLM-8B
Stanford 与 NVIDIA Research 团队发布 Contrastive Language Models(CLM)及 CLM-8B,用对比学习连接状态与动作,作为快速决策的 System One 模型。
公众号:数字生命卡兹克AI 评分8484 Claude Opus 5.5 与 GPT-6 Sol、Luna 同日发布,主打性价比与降本
Anthropic 发布 Claude Opus 5.5,上下文1M Token,输入4美元/输出20美元每百万Token,比Opus 5成本降40%、速度快30%以上,Terminal-Bench 4.0拿66.4%创最高分,定位为Fable 5.1的性价比替代。
公众号:蚂蚁百灵(Ling)精选AI 评分6767 蚂蚁开源 Ming-Image-0.1-Design 系列:两个 6B 模型打通设计生成与图层编辑
蚂蚁百灵开源 Ming-Image-0.1-Design 系列模型,包含两个 6B 模型:Design 从文字需求生成 UI、信息图、海报等完整设计,Layer 将设计图拆成 2 至 9 个可独立编辑的 RGBA 图层,并同步开源 Design Skill 和 PPT Skill。
推荐理由:原文给出两个 6B 模型的能力划分、评测成绩和实际接入效果,读者可以据此评估设计生成加图层编辑链路的部署价值。