#模型发布
#模型发布
今日 6 条
Logan Kilpatrick@OfficialLoganKAI 评分6464
🚨 AI News | TestingCatalog@testingcatalogAI 评分6868Google DeepMind:Blog(RSS)精选AI 评分7070 Google DeepMind 发布 Gemini 3.8 Live 和 3.8 Live Extended Thinking
Google DeepMind 发布 Gemini 3.8 Live 与 Gemini 3.8 Live Extended Thinking 两个近实时语音对话模型,主打语音智能体和复杂任务执行。
推荐理由:原文给出两个语音对话模型的定位分工和多项基准数字,读者可以据此评估其推理、成本与工具调用能力。
Google AI@GoogleAIAI 评分6464Google AI 发布迄今最先进的 Gemini 音频模型 Gemini 3.8 Live 与 3.8 Live Extended Thinking。
公众号:生数科技(Vidu·视频)精选AI 评分6767 生数科技发布 Vidu S2:含 Avatar 与 Editing 双模型,探索空间视频
生数科技正式发布 Vidu S2,包含面向数字角色实时交互的 Vidu S2-Avatar 和面向视频流实时编辑的 Vidu S2-Editing,并探索面向 VR 头显的实时空间视频生成与编辑。
推荐理由:官方发布 Vidu S2 双模型,给出实时交互、编辑与空间视频的技术路线和评测数字,读者可对照判断其流式生成思路。
IT之家(RSS)AI 评分5252 Salesforce 联合英伟达推出推理大模型 Koa
Salesforce 在 Dreamforce 大会上发布首款推理大模型 Koa,基于英伟达开源权重的 Nemotron 模型由双方联合微调,主打销售、市场营销和客服类业务任务。Koa 将作为 Agentforce 平台可选模型,训练未使用真实客户数据,Token 消耗更低,可经 AI 网关自动调度;此前复杂推理任务依赖 Claude、ChatGPT 等外部前沿模型。
TechCrunch:AI(RSS)AI 评分5757 Salesforce 联合 Nvidia 发布首个推理模型 Koa,基于开源 Nemotron 面向销售与客服任务
Salesforce 在 Dreamforce 大会上发布首个推理模型 Koa,基于 Nvidia 开源权重的 Nemotron 模型,经后训练擅长销售、营销和客服任务,将作为 Agentforce 平台中 Claude 或 ChatGPT 等前沿模型的替代选项。
IT之家(RSS)AI 评分6262 阶跃星辰发布 StepAudio 3 系列语音大模型,含 Realtime、ASR、TTS、Gen、Music 五款
阶跃星辰发布 StepAudio 3 系列语音模型,包括 StepAudio3Realtime、StepAudio3ASR、StepAudio3TTS、StepAudio3Gen 和 StepAudio3Music,均已上线阶跃星辰开放平台。
公众号:阶跃星辰(Step)精选AI 评分6666 阶跃星辰发布 StepAudio 3 系列语音大模型,多款在 Artificial Analysis 榜单全球第一
阶跃星辰发布 StepAudio 3 系列,包含 Realtime、ASR、TTS、Gen 和 Music 五款模型,已在阶跃星辰开放平台上线。
推荐理由:官方完整介绍了五款模型的能力与榜单成绩,可帮助读者了解语音模型在实时交互、理解和创作上的进展。
HuggingFace Daily Papers(社区热门论文)AI 评分5959 Atria Dawn Preview 发布:面向科研工程流程的智能体基座模型
Atria Dawn Preview 发布,一个面向科研与工程流程的智能体基座语言模型,通过 Verifiable Experience Pipeline 将工具交互连接到可执行环境和外部可验证结果进行训练。
Fireworks AI(网页)精选AI 评分7272 Fireworks 上线 DeepSeek-V4.1-Flash,DeepSWE 达 GPT-6 Astra 水准、成本仅 1/15
Fireworks 发布 DeepSeek-V4.1-Flash,在 DeepSWE 上取得 74.34% pass@1、每任务 $0.43,与 GPT-6 Astra 同一精度区间但成本仅 1/15。
推荐理由:官方以多基准实测给出 DeepSeek-V4.1-Flash 与闭源模型的成本质量对比和架构细节,可帮助开发者做选型与成本权衡。
IT之家(RSS)AI 评分5757 Anthropic Claude Opus 5.2 疑似在 Claude Code 中灰度测试,开发者实测更快更不偷懒
开发者发现 Claude Code 中前端名为 Opus 5 的请求已被路由到 Opus 5.2,Anthropic 大概率跳过 5.1 直接灰度测试新版本。实测显示响应更快、输出更干净,长任务不再要求用户「按继续」,会自主进行「严酷循环(gauntlet loop)」迭代代码。
HuggingFace Daily Papers(社区热门论文)AI 评分5959 Zing-0.5 发布 5B 实时联合动作与文本控制世界模型
Zing-0.5 是一个 5B 自回归世界模型,支持键盘与文本联合控制,让用户在生成世界中导航并影响事件。技术要点包括统一动作与文本条件、事件级分布匹配蒸馏,以及四步生成加流式推理,在 832x480 分辨率下以 24 FPS 运行,估计服务器成本约每流分钟 0.009 美元;在 158 个 WBench Navigation 用例上取得总分 81.0 和一致性 88.5。
SiliconFlow@SiliconFlowAI精选AI 评分6666推荐理由:原文给出了参数规模、上下文长度、开源协议和定价,读者可据此评估它能否接入现有编码与 Agent 工具链。
公众号:小红书技术(dots.llm)精选AI 评分6868 小红书 AllSpark 开源 Search Agent 模型 Iris,35B 与 397B 版本同量级成绩领先
小红书 AllSpark 团队发布并开源 Search Agent 模型 Iris,权重和评测代码已公开,数据与训练配方将陆续公布。
推荐理由:原文给出了数据构造、SFT-RL 训练和统一评测的完整思路,读者可以据此理解 Search Agent 的训练难点与可迁移方法。
蚂蚁 inclusionAI:HuggingFace 新模型AI 评分5252 蚂蚁 inclusionAI 发布 SingProbe 流式护栏探针,基于 Qwen3.5-4B
蚂蚁 inclusionAI 发布 SingProbe,一个基于 Qwen/Qwen3.5-4B 的轻量探针,复用基座模型隐藏状态在生成时逐 token 输出查询意图、回复不安全性和幻觉风险三类评分,仅 5.18M 参数,解码开销低于 0.5%。
Dongxi 东锡 NLP@dongxi_nlpAI 评分5858
MiniMax (official)@MiniMax_AIAI 评分6262
MiniMax (official)@MiniMax_AIAI 评分6161MiniMax 盘点其开源视频生成模型 MiniMax H3 的社区生态进展,该模型支持原生立体声音频和多模态参考控制。
Sherwin Wu@sherwinwuAI 评分6262
IT之家(RSS)AI 评分6161 蚂蚁灵波开源三款 LingBot-World 2.0 世界模型:Small 参数 1.3B 面向消费级单卡 GPU 设计
蚂蚁灵波科技继 7 月开源 14B 模型后,本周开源 LingBot-World 2.0 Small(1.3B)、Bidirectional 和 Causal Pretrain 三款模型。
The Decoder:AI News(RSS)AI 评分6565 AllSpark 发布 Iris-mini 和 Iris-pro 开源搜索智能体
AllSpark 团队发布 Iris-mini(35B,基于 Qwen3.6-35B-A3B)和 Iris-pro(397B,基于 Qwen3.5-397B-A17B)两个开源搜索智能体,并公开训练配方。
MarkTechPost(RSS)AI 评分6666 Cognition 发布 SWE-2:基于 Kimi K3 后训练的编码模型,以低 64% 的成本接近 Fable 5.1
Cognition 发布编码模型 SWE-2,从 2.8T 参数的 Kimi K3 经强化学习后训练而来,在 FrontierCode 1.1 Main 得分 50.0%,与 Fable 5.1 相差不到 1 分且成本低 64%。
OpenAI Developers@OpenAIDevsAI 评分7070Suno:Blog(网页)精选AI 评分6868 Suno 发布 v6 音乐模型,推出 v6、v6-wild、v6-mini 三个版本
Suno 发布新一代音乐模型 v6,与 Warner Music Group、BMG、Believe 等行业伙伴合作开发,后续将全面替换旧模型。v6 分为三个版本:旗舰 v6 和探索向的 v6-wild 面向 Pro 与 Premier 订阅用户,更快的 v6-mini 向所有人开放。
推荐理由:官方发布新一代音乐模型,给出三个版本的定位差异和编辑、混音、采样等具体新能力,可帮助创作者判断如何选择和使用。
The Decoder:AI News(RSS)AI 评分5656 Google Research 发布 TimesFM-3 时序预测模型,首次支持多变量与已知未来事件
Google Research 发布 TimesFM-3 时序预测模型,可同时处理多个相关变量,并利用折扣计划、天气预报等已知未来事件改进预测,每步输出九个值以刻画不确定性。
公众号:生数科技(Vidu·视频)AI 评分5555 生数科技发布 Motus2:面向灵巧操作的自进化通用世界模型
生数科技发布面向机器人灵巧操作的世界模型 Motus2,将行动、预测、评估三种能力统一进同一个共享参数模型,形成生成动作、预测未来、评估结果、更新策略的闭环,并加入轻量触觉专家模块。
HuggingFace Daily Papers(社区热门论文)AI 评分5959 StepAudio 3 Realtime 技术报告发布,实时语音中并行推理
StepAudio 3 Realtime 是一个围绕听-说-想-做循环组织的音频语言基础模型,通过 Deep Perception 解读声学线索,Seamless Duplex 处理停顿、附和与打断。
jason@jxnlcoAI 评分5555Baseten 工程博客(网页)精选AI 评分7676 DeepSeek 发布开源模型 DeepSeek-V4.1-Flash,优化编码智能体 prefill 效率
DeepSeek 本周在 HuggingFace 开源 DeepSeek-V4.1-Flash 权重,模型总参数 552B,prefill 激活 8B、decode 激活 16B,支持 1M token 上下文和文本加图像输入,已上线 Baseten Model APIs。
推荐理由:文章解释了 CED 架构如何把 prefill 降到 8B 激活参数并压缩 KV cache,读者能理解它为何更适配编码智能体的高 prefill 负载。
Artificial Analysis@ArtificialAnlysAI 评分6464
Hacker News 热门(buzzing.cc 中文翻译)AI 评分5151 YuE2 发布:融合象征性规划的音乐生成模型,SongBench 得分 6.9632 超越 Suno v5
YuE2 项目页发布音乐生成模型 YuE2,以可编辑符号乐谱为中间表示生成全曲音频。YuE2 (best-of-8) 在 WildSongBench (192 prompts) 的 SongBench 上得 6.9632,为 15 个设置中的最高观测均值,Suno v5 同对比得 6.8721。
IT之家(RSS)AI 评分6060 月之暗面 Kimi K2.8 Preview 全量上线 Kimi Code,综合性能接近 K3
月之暗面 Kimi K2.8 Preview 全量上线 Kimi Code,Model ID 仍为 kimi-for-coding,客户端与第三方工具无需修改配置。
MarkTechPost(RSS)AI 评分6060 Sakana AI 发布 Fugu Max 和 Fugu Ultra v2,主打更低成本的多模型编排
Sakana AI 发布 Fugu 系列两款新模型 Fugu Max 和 Fugu Ultra v2,通过单一 OpenAI 兼容 API 在多个模型间路由任务。
MarkTechPost(RSS)AI 评分5858 Cohere 发布 North Small Translate:218B MoE 翻译模型,WMT26 全语言均分 83.6
Cohere 与 Cohere Labs 发布开源权重翻译模型 North Small Translate,采用稀疏 MoE 架构,总参数 218B、每 token 激活 25B,覆盖 50 种语言。
IT之家(RSS)AI 评分5555 小米开源工业级目标说话人语音识别大模型 Xiaomi-CocktailASR-1
小米发布并开源工业级目标说话人语音识别大模型 Xiaomi-CocktailASR-1,针对多人同时说话时识别率大幅下降的鸡尾酒会难题。模型采用端到端 LLM 架构,以目标说话人参考音频作为声纹提示,在多个主流多说话人测试集上达到 SOTA;单人识别性能比肩标准 ASR 模型,可拒识非目标说话人并支持思维链推理模式。代码开源于 GitHub 和 HuggingFace。
HuggingFace Daily Papers(社区热门论文)AI 评分5858 SenseNova-U1.5 发布:8B-MoT 原生统一多模态模型,支持 4K 生成与图像编辑
SenseNova 团队发布 SenseNova-U1.5,一个 8B-MoT 原生统一多模态模型,在无编码器、无 VAE 架构内实现视觉理解、推理、生成和编辑。
IT之家(RSS)AI 评分7373 OpenAI 将 GPT-Live-1 引入 API,支持全双工语音、打断处理与工具调用
OpenAI 宣布 GPT-Live-1 上线 API,支持全双工对话、处理打断与背景噪声,可用于电话语音智能体,并将语音理解与输出整合在同一模型中以降低延迟。
Rohan Paul@rohanpaul_aiAI 评分7272
Artificial Analysis@ArtificialAnlysAI 评分7878