跳到正文

全部动态

今日 6 条
9月16日周三
  1. 🚨 AI News | TestingCatalog55

    Creatify Labs 发布面向视频广告的文生视频与图生视频模型 Boreal,定价每秒 $0.01,已向所有 Creatify 用户开放。模型基于开源权重的 LTX-2.5 后训练,训练语料包括真实广告素材、创作者风格 UGC 和客户制作需求;官方称在 40 多个制作案例的盲测人评中,后训练使 Boreal 对基座模型的胜率达 81%,并称其比 Seedance 2.5 最多便宜 47 倍。

  2. Rohan Paul54

    Odyssey 发布基础世界模型 Odyssey-3,称其可控制机器人、驱动人形、驾驶车辆、训练 AI、操控无人机甚至玩视频游戏。其路线是先用预训练世界模型,再接上用数十小时机器人演示训练的动作解码器;据作者转述,驾驶策略仅用 20 小时模拟数据训练后就能驶上印度真实街道,机械臂、人形遥操作和模拟无人机数据的用量也仅为数十小时。

9月15日周二
  1. 公众号:生数科技(Vidu·视频)67

    生数科技发布 Vidu S2:含 Avatar 与 Editing 双模型,探索空间视频

    生数科技正式发布 Vidu S2,包含面向数字角色实时交互的 Vidu S2-Avatar 和面向视频流实时编辑的 Vidu S2-Editing,并探索面向 VR 头显的实时空间视频生成与编辑。

    推荐理由:官方发布 Vidu S2 双模型,给出实时交互、编辑与空间视频的技术路线和评测数字,读者可对照判断其流式生成思路。

  2. IT之家(RSS)52

    Salesforce 联合英伟达推出推理大模型 Koa

    Salesforce 在 Dreamforce 大会上发布首款推理大模型 Koa,基于英伟达开源权重的 Nemotron 模型由双方联合微调,主打销售、市场营销和客服类业务任务。Koa 将作为 Agentforce 平台可选模型,训练未使用真实客户数据,Token 消耗更低,可经 AI 网关自动调度;此前复杂推理任务依赖 Claude、ChatGPT 等外部前沿模型。

  3. HuggingFace Daily Papers(社区热门论文)59

    Zing-0.5 发布 5B 实时联合动作与文本控制世界模型

    Zing-0.5 是一个 5B 自回归世界模型,支持键盘与文本联合控制,让用户在生成世界中导航并影响事件。技术要点包括统一动作与文本条件、事件级分布匹配蒸馏,以及四步生成加流式推理,在 832x480 分辨率下以 24 FPS 运行,估计服务器成本约每流分钟 0.009 美元;在 158 个 WBench Navigation 用例上取得总分 81.0 和一致性 88.5。

  4. SiliconFlow66

    硅基流动(SiliconFlow)宣布开源模型 Hy4 preview 上线其平台。该模型总参数 770B、每 token 激活 49B、支持 1M 上下文,采用 Apache 2.0 协议,面向编码、分析、研究和复杂实际工作。用户可将其接入 Claude Code、Codex、Cursor 等已有工具;图片显示定价为每 1M tokens 输入 $0.834、输出 $2.501、缓存 $0.042。

    推荐理由:原文给出了参数规模、上下文长度、开源协议和定价,读者可据此评估它能否接入现有编码与 Agent 工具链。

9月14日周一
  1. Dongxi 东锡 NLP58

    DeepSeek 发布 DeepSeek-V4.1-Flash,一款 552B 参数(每 token 激活 16B/预填充 8B)的多模态 MoE 模型,支持最长一百万 token 上下文。其 Causal Encoder-Decoder(CED)架构结合 CSA2 与 FP4 KV caching,将全局 KV cache 降至每 token 890 字节,约为 DeepSeek-V4-Flash 的 1/4、DeepSeek-V1 的 1/437,配合 SWA Bounded Replay 将持久 KV cache 降至约 1/8,性能仍优于基线。模型基于 45T token 多模态语料预训练,checkpoint 已在 https://huggingface.co/deepseek-ai/DeepSeek-V4.1-Flash 开放。

9月13日周日
  1. Suno:Blog(网页)68

    Suno 发布 v6 音乐模型,推出 v6、v6-wild、v6-mini 三个版本

    Suno 发布新一代音乐模型 v6,与 Warner Music Group、BMG、Believe 等行业伙伴合作开发,后续将全面替换旧模型。v6 分为三个版本:旗舰 v6 和探索向的 v6-wild 面向 Pro 与 Premier 订阅用户,更快的 v6-mini 向所有人开放。

    推荐理由:官方发布新一代音乐模型,给出三个版本的定位差异和编辑、混音、采样等具体新能力,可帮助创作者判断如何选择和使用。

9月12日周六