Reka AI 发布全模态模型 Rho-1,单模型处理文本图像视频与机器人控制
Reka AI 发布全模态模型 Rho-1 的研究预览版,这是一个 190 亿参数的模型,可在单一神经网络中处理并生成文本、图像、视频和机器人控制动作。与多数将任务分派给专用模型的系统不同,Rho-1 把所有模态作为 token 放在同一个共享上下文窗口中运行,无需工具调用或外部模型,可实时生成连续视频并即时响应新指令而无需重启。
Reka AI 发布全模态模型 Rho-1 的研究预览版,这是一个 190 亿参数的模型,可在单一神经网络中处理并生成文本、图像、视频和机器人控制动作。与多数将任务分派给专用模型的系统不同,Rho-1 把所有模态作为 token 放在同一个共享上下文窗口中运行,无需工具调用或外部模型,可实时生成连续视频并即时响应新指令而无需重启。
Tavus 推出名为 Griffin 的 Human Interaction Model,可在实时视频通话中同时接收和生成语音、面部表情、语气、手势与停顿。
Qwen 发布下一代原生全模态模型 Qwen3.8-Omni-Flash,支持文本、图像、音频和视频输入及 1M token 上下文窗口,29 项评测平均分较 Qwen3.5-Omni-Plus 提升超过 25%,音频输入每小时价格下降超过 98%,音视频输入每小时价格下降超过 93%。
推荐理由:官方发布同时开放 API 和开源插件与运行时,读者可以据此评估音视频智能体在剪辑、会议、实时交互等工作流中的落地方式。
生数科技正式发布 Vidu S2,包含面向数字角色实时交互的 Vidu S2-Avatar 和面向视频流实时编辑的 Vidu S2-Editing,并探索面向 VR 头显的实时空间视频生成与编辑。
推荐理由:官方发布 Vidu S2 双模型,给出实时交互、编辑与空间视频的技术路线和评测数字,读者可对照判断其流式生成思路。
Zing-0.5 是一个 5B 自回归世界模型,支持键盘与文本联合控制,让用户在生成世界中导航并影响事件。技术要点包括统一动作与文本条件、事件级分布匹配蒸馏,以及四步生成加流式推理,在 832x480 分辨率下以 24 FPS 运行,估计服务器成本约每流分钟 0.009 美元;在 158 个 WBench Navigation 用例上取得总分 81.0 和一致性 88.5。
MiniMax 盘点其开源视频生成模型 MiniMax H3 的社区生态进展,该模型支持原生立体声音频和多模态参考控制。
Vidu 团队发布 Vidu S2,包含实时交互数字人模型 Vidu S2-Avatar 和实时视频编辑模型 Vidu S2-Editing,并探索了二者的实时空间视频生成。
李飞飞创办的 World Labs 发布多模态世界模型 Atlas,称其能以像素级精确相机控制生成图像和视频帧,并在 3D 中重建。Atlas 可输出最长 1 分钟的 1440p 视频,从一至数十张图像进行空间重建,支持时空模拟和文本生成图像与 360 度全景,部分合作伙伴已获抢先体验,未来几周内开放早期访问。
World Labs 发布新一代世界模型 Atlas,从零预训练,原生处理文本、图像、视频和 3D,架构为多模态自回归扩散 Transformer,输入以 3D 姿态形成空间上下文。模型支持相机控制生成(最长 1 分钟 1440p 视频)、稀疏视图 3D 重建、时空仿真和图像生成,在相机控制生成与 3D 重建任务上优于更专用的模型;现已开放早期访问申请,未来将驱动 Marble 等产品。
推出 Atlas: 全球首个多模态世界模型,可生成图像和视频帧,具备像素级精准的相机控制,并在 3D 中重建它们。 建模世界,移动相机,模拟空间与时间。
Visko 发布首个 Live Model「Orbis 1.0」,一个实时、可引导的视频生成模型,可实时流式生成持续进行的世界,具备持久记忆、交互性和基于物理的无限长度生成。
Google DeepMind 发布 Gemini Omni 1.1 Flash,为开发者带来场景延长、首尾帧插值、360p 快速草稿和最高 4K 放大等生成视频控制能力。
推荐理由:官方给出场景延长、首尾帧插值与 4K 放大等具体能力与开放入口,可据此判断生成视频工作流的变化。
Google DeepMind 发布 Nano Banana 2 Lite 和 Gemini Omni Flash 两款模型。
推荐理由:两款新模型给出了延迟、单价与可用入口,读者可据此判断图像与视频生成链路的成本变化。
Google DeepMind 发布 Omni 家族首个模型 Gemini Omni Flash,可组合图像、音频、视频和文本输入生成高质量视频,并通过自然语言多轮编辑视频。
推荐理由:Gemini Omni Flash 把对话式视频编辑和多模态输入整合进 Gemini 应用与 YouTube Shorts,可据此判断生成视频工作流的变化。