从4秒到两小时,AI视频长叙事正在走向完整故事
作者梳理AI视频从Runway Gen-2单次4秒到Seedance 2.5单次30秒、再到《出马仙镇东北》113分钟和《山》94分钟AI真人电影的演进,指出观众对AI长篇叙事接受度明显提高。文中还提到RunningHub于9月8日联合华语科幻星云奖和金瞳奖发起AIGC长片创作大赛,总奖池550万,开放10部科幻作品免费改编授权,并提供RHTV无限画布和RHSTORY剧本拆解等创作工具。
作者梳理AI视频从Runway Gen-2单次4秒到Seedance 2.5单次30秒、再到《出马仙镇东北》113分钟和《山》94分钟AI真人电影的演进,指出观众对AI长篇叙事接受度明显提高。文中还提到RunningHub于9月8日联合华语科幻星云奖和金瞳奖发起AIGC长片创作大赛,总奖池550万,开放10部科幻作品免费改编授权,并提供RHTV无限画布和RHSTORY剧本拆解等创作工具。
网易《天下》与王祖贤合作的 AI 短片《倩影》上线3天播放量超1000万,为游戏行业首个明星授权 AI 短片,基于 Seedance 2.0 4K 生成。
Vidu 团队发布 Vidu S2,包含实时交互数字人模型 Vidu S2-Avatar 和实时视频编辑模型 Vidu S2-Editing,并探索了二者的实时空间视频生成。
OpenRouter 发布对 ByteDance Seedance 2.5 视频模型的评测,该模型自 2026 年 8 月 7 日上线其视频 API,生成 4 到 30 秒、480p 或 720p 的片段,支持图像、视频、音频引用和首尾帧控制,音频同趟生成不加价。
推荐理由:原文基于自家端点数据给出 Seedance 2.5 的计费公式、能力边界和与 Seedance 2.0、Wan 3.0、Veo 3.1 的逐项对比,便于按需求选型。
Runway 发布 Runway Plugins,面板可直接嵌入 Premiere Pro 和 After Effects,无需导出导入即可在时间线内生成图像和视频、重渲染片段并一键放置结果。
推荐理由:原文给出了插件的功能范围、付费条件与下载方式,剪辑工作流用户可据此评估是否把生成环节搬进时间线。
Adobe 为 Premiere 推出 Generative Media 工具,编辑可在项目时间线内高亮空缺直接生成视频、音效、音乐和声景,无需离开项目。
Adobe 宣布重新设计 Premiere 的 AI 交互,新的生成式媒体工具支持在时间线空白区域直接生成视频、音效、音乐和声景,无需切换应用。时间线可调用 Adobe Firefly、谷歌 Veo、Runway、Luma 和可灵等多种底层模型。
据彭博社报道,字节跳动正开发实时空间视频生成 AI 模型,创始人张一鸣亲自督导研发,计划最早下月发布,发布时间尚未最终确定。该模型基于电影级视频生成模型 Seedance 构建,面向直播、短剧和游戏创建交互式虚拟世界,可在每秒 20 帧帧率下以约 50 毫秒延迟按需生成视频流,响应 Pico 头显用户的语音或动作。
据央视财经报道,AI 短剧和数字广告扩张带动数字人脸素材采购需求,人脸授权平台将授权人分为普通人和专业演员两类。普通人的数字肖像按每部短视频约 100 元付费,专业演员按使用范围和剧集长度定价,从 500 元到数千元,成交后平台与授权人按比例分成。
据央视财经报道,AI 短剧技术门槛下降、从业者涌入,制作报价从每分钟 5000 元跌至几百元,逼近成本线,但定制短剧仍可达每分钟 1 万至 2 万元。行业竞争正从拼产量、拼价格转向拼内容、拼市场,预计 2026 年国内 AI 剧漫剧市场规模有望超 400 亿元,同比增速 138%,海外规模预计突破 40 亿美元,占海外微短剧整体规模近 70%。
9 月 2 日,广电总局召开 AI 微短剧融像融声知识产权与人格权益保护座谈会,明确融像融声须取得权利人明确授权。会议提出科学认定侵权,并要求平台和制作机构建立事前授权、事中筛查、事后存证的全流程风控机制,爱奇艺、快手、腾讯、红果等 17 家平台和制作机构代表参会。
arXiv 论文《Select, Compress, Reinvest》在固定评分器、分辨率策略与回答模型的前提下,逐一检验长视频 MLLM 的视觉token分配决策,覆盖六种免训练选择规则、三个长视频基准和两个回答模型。
Puffin-World 是一个统一多模态架构,不依赖外部离线模块即可实现物理理解、空间模拟和 3D 世界生成与重建。该框架联合建模物理(重力场与纬度)、几何(深度)和外观(图像)三种原生世界状态,并引入统一 Omni-Camera 表示与跨未来帧传播物理动态的策略,在单一生成过程中同时合成未来视图并重建底层几何。
WorldReward 是一个基于 VLM 的成对偏好奖励模型,为相机条件世界模型统一评估动作一致性与视觉质量。方法将视频分解为动作对齐的块并投票聚合,配套发布人工标注的 WorldReward-Bench,在三个维度上分别超过 GPT-5.5 约 3.42、1.45 和 3.56 个百分点,用于 HY-WorldPlay 1.5 的 RL 后训练可同时提升动作执行与视觉质量。
论文提出 FlashRender,一个少步生成渲染框架,可在数秒内沿目标相机轨迹重新渲染源视频。方法引入 RETA 将源视频隐表示与冻结视觉几何模型的目标视频特征对齐,实现采样步数一致的相机控制,再用 MeanFlow 目标微调并结合 on-policy flow map 蒸馏。实验显示其在视频质量和几何一致性上匹配多步基线,采样成本降低 25 倍,并在分布外目标相机轨迹下具备更强的相机可控性。
论文提出 Principia 基准,用 529 个真实场景中的配对物体关系不变量评测视频生成模型和 VLM 的牛顿物理一致性,覆盖重力、摩擦、转动惯量等 8 种现象。