跳到正文

#模型发布

今日 6 条
9月16日周三
9月15日周二
  1. 公众号:生数科技(Vidu·视频)67

    生数科技发布 Vidu S2:含 Avatar 与 Editing 双模型,探索空间视频

    生数科技正式发布 Vidu S2,包含面向数字角色实时交互的 Vidu S2-Avatar 和面向视频流实时编辑的 Vidu S2-Editing,并探索面向 VR 头显的实时空间视频生成与编辑。

    推荐理由:官方发布 Vidu S2 双模型,给出实时交互、编辑与空间视频的技术路线和评测数字,读者可对照判断其流式生成思路。

  2. IT之家(RSS)52

    Salesforce 联合英伟达推出推理大模型 Koa

    Salesforce 在 Dreamforce 大会上发布首款推理大模型 Koa,基于英伟达开源权重的 Nemotron 模型由双方联合微调,主打销售、市场营销和客服类业务任务。Koa 将作为 Agentforce 平台可选模型,训练未使用真实客户数据,Token 消耗更低,可经 AI 网关自动调度;此前复杂推理任务依赖 Claude、ChatGPT 等外部前沿模型。

  3. HuggingFace Daily Papers(社区热门论文)59

    Zing-0.5 发布 5B 实时联合动作与文本控制世界模型

    Zing-0.5 是一个 5B 自回归世界模型,支持键盘与文本联合控制,让用户在生成世界中导航并影响事件。技术要点包括统一动作与文本条件、事件级分布匹配蒸馏,以及四步生成加流式推理,在 832x480 分辨率下以 24 FPS 运行,估计服务器成本约每流分钟 0.009 美元;在 158 个 WBench Navigation 用例上取得总分 81.0 和一致性 88.5。

  4. SiliconFlow66

    硅基流动(SiliconFlow)宣布开源模型 Hy4 preview 上线其平台。该模型总参数 770B、每 token 激活 49B、支持 1M 上下文,采用 Apache 2.0 协议,面向编码、分析、研究和复杂实际工作。用户可将其接入 Claude Code、Codex、Cursor 等已有工具;图片显示定价为每 1M tokens 输入 $0.834、输出 $2.501、缓存 $0.042。

    推荐理由:原文给出了参数规模、上下文长度、开源协议和定价,读者可据此评估它能否接入现有编码与 Agent 工具链。

9月14日周一
  1. Dongxi 东锡 NLP58

    DeepSeek 发布 DeepSeek-V4.1-Flash,一款 552B 参数(每 token 激活 16B/预填充 8B)的多模态 MoE 模型,支持最长一百万 token 上下文。其 Causal Encoder-Decoder(CED)架构结合 CSA2 与 FP4 KV caching,将全局 KV cache 降至每 token 890 字节,约为 DeepSeek-V4-Flash 的 1/4、DeepSeek-V1 的 1/437,配合 SWA Bounded Replay 将持久 KV cache 降至约 1/8,性能仍优于基线。模型基于 45T token 多模态语料预训练,checkpoint 已在 https://huggingface.co/deepseek-ai/DeepSeek-V4.1-Flash 开放。

9月13日周日
  1. Suno:Blog(网页)68

    Suno 发布 v6 音乐模型,推出 v6、v6-wild、v6-mini 三个版本

    Suno 发布新一代音乐模型 v6,与 Warner Music Group、BMG、Believe 等行业伙伴合作开发,后续将全面替换旧模型。v6 分为三个版本:旗舰 v6 和探索向的 v6-wild 面向 Pro 与 Premier 订阅用户,更快的 v6-mini 向所有人开放。

    推荐理由:官方发布新一代音乐模型,给出三个版本的定位差异和编辑、混音、采样等具体新能力,可帮助创作者判断如何选择和使用。

9月12日周六
  1. Baseten 工程博客(网页)76

    DeepSeek 发布开源模型 DeepSeek-V4.1-Flash,优化编码智能体 prefill 效率

    DeepSeek 本周在 HuggingFace 开源 DeepSeek-V4.1-Flash 权重,模型总参数 552B,prefill 激活 8B、decode 激活 16B,支持 1M token 上下文和文本加图像输入,已上线 Baseten Model APIs。

    推荐理由:文章解释了 CED 架构如何把 prefill 降到 8B 激活参数并压缩 KV cache,读者能理解它为何更适配编码智能体的高 prefill 负载。

9月11日周五
  1. IT之家(RSS)55

    小米开源工业级目标说话人语音识别大模型 Xiaomi-CocktailASR-1

    小米发布并开源工业级目标说话人语音识别大模型 Xiaomi-CocktailASR-1,针对多人同时说话时识别率大幅下降的鸡尾酒会难题。模型采用端到端 LLM 架构,以目标说话人参考音频作为声纹提示,在多个主流多说话人测试集上达到 SOTA;单人识别性能比肩标准 ASR 模型,可拒识非目标说话人并支持思维链推理模式。代码开源于 GitHub 和 HuggingFace。