跳到正文

#视频

今日 0 条
10月6日周二
  1. The Decoder65

    Reka AI 发布全模态模型 Rho-1,单模型处理文本图像视频与机器人控制

    Reka AI 发布全模态模型 Rho-1 的研究预览版,这是一个 190 亿参数的模型,可在单一神经网络中处理并生成文本、图像、视频和机器人控制动作。与多数将任务分派给专用模型的系统不同,Rho-1 把所有模态作为 token 放在同一个共享上下文窗口中运行,无需工具调用或外部模型,可实时生成连续视频并即时响应新指令而无需重启。

10月2日周五
9月18日周五
  1. Qwen:Blog Retrieval(API)78

    Qwen 发布原生全模态模型 Qwen3.8-Omni-Flash,主打音视频智能体任务交付

    Qwen 发布下一代原生全模态模型 Qwen3.8-Omni-Flash,支持文本、图像、音频和视频输入及 1M token 上下文窗口,29 项评测平均分较 Qwen3.5-Omni-Plus 提升超过 25%,音频输入每小时价格下降超过 98%,音视频输入每小时价格下降超过 93%。

    推荐理由:官方发布同时开放 API 和开源插件与运行时,读者可以据此评估音视频智能体在剪辑、会议、实时交互等工作流中的落地方式。

9月16日周三
  1. 🚨 AI News | TestingCatalog55

    Creatify Labs 发布面向视频广告的文生视频与图生视频模型 Boreal,定价每秒 $0.01,已向所有 Creatify 用户开放。模型基于开源权重的 LTX-2.5 后训练,训练语料包括真实广告素材、创作者风格 UGC 和客户制作需求;官方称在 40 多个制作案例的盲测人评中,后训练使 Boreal 对基座模型的胜率达 81%,并称其比 Seedance 2.5 最多便宜 47 倍。

9月15日周二
  1. 公众号:生数科技(Vidu·视频)67

    生数科技发布 Vidu S2:含 Avatar 与 Editing 双模型,探索空间视频

    生数科技正式发布 Vidu S2,包含面向数字角色实时交互的 Vidu S2-Avatar 和面向视频流实时编辑的 Vidu S2-Editing,并探索面向 VR 头显的实时空间视频生成与编辑。

    推荐理由:官方发布 Vidu S2 双模型,给出实时交互、编辑与空间视频的技术路线和评测数字,读者可对照判断其流式生成思路。

  2. HuggingFace Daily Papers(社区热门论文)59

    Zing-0.5 发布 5B 实时联合动作与文本控制世界模型

    Zing-0.5 是一个 5B 自回归世界模型,支持键盘与文本联合控制,让用户在生成世界中导航并影响事件。技术要点包括统一动作与文本条件、事件级分布匹配蒸馏,以及四步生成加流式推理,在 832x480 分辨率下以 24 FPS 运行,估计服务器成本约每流分钟 0.009 美元;在 158 个 WBench Navigation 用例上取得总分 81.0 和一致性 88.5。

9月14日周一
9月10日周四
9月9日周三
9月8日周二
9月5日周六
9月4日周五
9月3日周四
9月2日周三
  1. IT之家(RSS)62

    李飞飞 World Labs 发布多模态世界模型 Atlas,支持像素级相机控制生成 1440p 视频

    李飞飞创办的 World Labs 发布多模态世界模型 Atlas,称其能以像素级精确相机控制生成图像和视频帧,并在 3D 中重建。Atlas 可输出最长 1 分钟的 1440p 视频,从一至数十张图像进行空间重建,支持时空模拟和文本生成图像与 360 度全景,部分合作伙伴已获抢先体验,未来几周内开放早期访问。

  2. Hacker News 热门(buzzing.cc 中文翻译)70

    World Labs 发布世界模型 Atlas:面向空间智能的多模态自回归扩散 Transformer

    World Labs 发布新一代世界模型 Atlas,从零预训练,原生处理文本、图像、视频和 3D,架构为多模态自回归扩散 Transformer,输入以 3D 姿态形成空间上下文。模型支持相机控制生成(最长 1 分钟 1440p 视频)、稀疏视图 3D 重建、时空仿真和图像生成,在相机控制生成与 3D 重建任务上优于更专用的模型;现已开放早期访问申请,未来将驱动 Marble 等产品。

  3. Fei-Fei Li57

    World Labs 发布从零训练的多模态世界模型 Atlas。模型可生成具有像素级相机控制能力的图像和视频帧,从单张输入图像重建大型场景,通过重帧视频模拟时空,并从一张或多张输入图像原生输出 3D 空间,还能将多张带位姿的图像合成一致的三维世界。作者称其为迄今最好的相机条件世界模型,可能应用于 VFX 到机器人等多个方向。

8月28日周五
  1. Google DeepMind71

    Google DeepMind 发布 Gemini Omni 1.1 Flash

    Google DeepMind 发布 Gemini Omni 1.1 Flash,为开发者带来场景延长、首尾帧插值、360p 快速草稿和最高 4K 放大等生成视频控制能力。

    推荐理由:官方给出场景延长、首尾帧插值与 4K 放大等具体能力与开放入口,可据此判断生成视频工作流的变化。

7月1日周三
5月18日周一