实测LibTV 1.5五大新功能,演示AI短剧工作流
作者详细测试了LibTV 1.5版本的新功能,包括将Agent升级为TV Director、剧本原创及改编、角色造型室、导演执导、3D-BOX预演和创意片头。文章展示了从生成50集古装言情喜剧大纲、手动编辑剧本、使用角色造型室调整人物形象,到利用Seedance 2.5生成分镜、通过导演模式优化镜头以及用3D-BOX进行复杂运镜预演的完整流程,最终输出成片。
作者详细测试了LibTV 1.5版本的新功能,包括将Agent升级为TV Director、剧本原创及改编、角色造型室、导演执导、3D-BOX预演和创意片头。文章展示了从生成50集古装言情喜剧大纲、手动编辑剧本、使用角色造型室调整人物形象,到利用Seedance 2.5生成分镜、通过导演模式优化镜头以及用3D-BOX进行复杂运镜预演的完整流程,最终输出成片。
FlashForward 直接复用当前 chunk 去噪前向中已算出的 in-flight KV cache,省去为更新缓存而做的额外前向,并生成稀疏的干净锚点 latent 以稳定生成轨迹。
Krea AI 宣布 Krea Agent 上线 motion references 功能,可以提取任意视频片段中的动作,并将其赋予新的角色、新的场景或新的元素。官方称现已可用。
论文提出 TRACE 基准,旨在解决现有流式视频理解评估中忽略证据时效性、历史维护及响应触发机制的问题。该框架通过统一因果协议控制信息可用性,并多维报告答案质量、及时性、负载等指标。在 1240 条记录上的实验显示,相似的 QA 准确率可能掩盖系统在完成度、生成负载及主动响应行为(如误报、漏报)上的巨大差异,强调应将性能视为执行条件下的系统行为而非单一分数。
Google Research 提出基于 Gemini 和 Veo 的多智能体编排框架,将长视频生成建模为全局优化与世界状态跟踪问题,包含 Co-Director(COLM 2026)、CANVAS(EMNLP 2026)、A²RD 和 VQQA 四个框架,支持 SynthID 水印。
火山引擎为 Seedance 2.5 API 推出 Draft(样片)模式,先用 480P 快速生成样片验证创意,选中后再通过样片 ID 生成 1080P 成片,复用提示词、参考素材、seed、ratio、duration 等参数保证一致性。
推荐理由:官方给出了具体的成本节约数字和两阶段工作流说明,创作者可以据此判断是否把 Draft 模式接入自己的视频生成管线。
国内首部AI长剧《后西游记》8月31日登陆湖南卫视黄金档,60集规划、每集约40分钟,全剧无摄影机拍摄,视频生成100%由 Seedance 实现,上线一周芒果TV正片播放量突破1.5亿次。剧集由芒果TV出品、伯璟文化承制,依托芒果灵创平台,5月立项到播出仅半年、制作周期3个月;总导演李东珅以一场动作戏为例,小组制作耗时10天、成本约十几万元,真人实拍则可能需300至400万元。
推荐理由:官方复盘给出了AI长剧从立项到播出的创作流程和成本对比,读者可以了解AIGC长篇叙事的实际生产方式。
Runway 发布 DaVinci Resolve 插件,可在 Resolve Studio 内直接生成图像和视频、重绘播放头下的片段,并将结果导入媒体池和时间线。
推荐理由:官方发布说明讲清了插件的核心工作流变化和版本要求,剪辑师可以据此评估是否把生成环节搬进 Resolve。
谷歌将实时视频形象加入 Gemini 3.8 Live,企业可构建带口型、表情和语音同步的对话角色,并在后台调用工具。服务支持多语言和预设形象;从参考图片定制形象需要企业白名单,音视频输出带有 SynthID 水印。
推荐理由:实时形象与工具调用结合,让企业对话界面可以表达表情和口型,公开的准入条件便于评估实际接入范围。
火山引擎为 Seedance 2.5 API 推出 Draft(样片)模式,用户先用 480P 低成本生成样片验证创意,再通过样片 ID 复用提示词、seed、ratio、duration 等参数生成 1080P 成片。以 5 秒镜头抽卡 4 次为例可节约 57% 成本、速度提升近一倍,抽卡 20 抽 1 时可节约 77%;C 端可在即梦中选择“Seedance 2.5(样片模式)”体验。
爱奇艺官宣超长真人出演 AI 季播剧《不羡鸳鸯只羡仙》,由沈羽洁、陈鹤一领衔主演,两位演员以 AI 生成形象在预热视频中露面,视频发布后相关话题登上微博热搜,不少网友表示观感诡异。
作者开源awesome-seedance项目,将463条实测复现并打分分类的AI视频提示语整理成14个提示语模版和25个Skills,涵盖分镜脚本、角色一致性、手持UGC vlog、打斗等类型,仓库地址为 github.com/LearnPrompt/awesome-seedance。
字节跳动推出 AI 短剧与视频制作平台 Dramagic,覆盖剧本分析、角色创建、分镜到视频预览的全流程,支持多人协作并内置一致性检查,通过企业平台 BytePlus 销售。据中国网络视听协会数据,2026 年一季度中国上线约 12.8 万部短剧,为上一年全年总量的三倍,其中 95% 由 AI 生成;清华大学教授沈阳估算 AI 视频每分钟成本为 90 至 120 美元,约为传统制作成本的十分之一。
Krea AI 在 Krea Agent 中推出新视频编辑器,用户可在编辑器中处理生成的视频片段。功能包括拼接场景、延长片段、添加音频等,现已可在 krea.ai/agent 体验。
Qwen 发布下一代原生全模态模型 Qwen3.8-Omni-Flash,支持文本、图像、音频和视频输入及 1M token 上下文窗口,29 项评测平均分较 Qwen3.5-Omni-Plus 提升超过 25%,音频输入每小时价格下降超过 98%,音视频输入每小时价格下降超过 93%。
推荐理由:官方发布同时开放 API 和开源插件与运行时,读者可以据此评估音视频智能体在剪辑、会议、实时交互等工作流中的落地方式。
作者 Zho 实测 GPT-6 Astra,仅凭一句提示词、不提供照片,让其完成精细建模、渲染、分镜、旁白、原创配乐到剪辑的 2 分钟建筑短片《POMPIDOU:A PUBLIC MACHINE》。
生数科技正式发布 Vidu S2,包含面向数字角色实时交互的 Vidu S2-Avatar 和面向视频流实时编辑的 Vidu S2-Editing,并探索面向 VR 头显的实时空间视频生成与编辑。
推荐理由:官方发布 Vidu S2 双模型,给出实时交互、编辑与空间视频的技术路线和评测数字,读者可对照判断其流式生成思路。
生数科技发布 Vidu S2,距 Vidu S1 发布 69 天,包含 S2-Editing 实时编辑模型、S2-Avatar 实时互动模型,并展示 Spatial 空间化视频探索。
Zing-0.5 是一个 5B 自回归世界模型,支持键盘与文本联合控制,让用户在生成世界中导航并影响事件。技术要点包括统一动作与文本条件、事件级分布匹配蒸馏,以及四步生成加流式推理,在 832x480 分辨率下以 24 FPS 运行,估计服务器成本约每流分钟 0.009 美元;在 158 个 WBench Navigation 用例上取得总分 81.0 和一致性 88.5。
火山引擎采访AI导演DiDi_OK,介绍其完全用Seedance 2.5 720P制作的9分钟科幻短片《Candy》背后的制作过程。他称模型在精细定制化、运动规律理解和超长镜头一次生成上有突破,部分效果连续性超过传统CG;其工作流随之改变,提示词取代关键帧成为决定视觉上限的首要条件,世界观类叙事中分镜不再是必需。
MiniMax 盘点其开源视频生成模型 MiniMax H3 的社区生态进展,该模型支持原生立体声音频和多模态参考控制。
京东探索研究院在9月9日JDD大会上发布JoyAI-Echo系列两项进展:超长音视频生成模型升级至JoyAI-Echo 1.5,同时发布并开源可交互视听世界模型EchoWM。
自媒体作者专访AI影像创作者DiDi_OK,聊其用Seedance 2.5制作的新片《糖果》及此前B站播放2000万的《牌子》。DiDi_OK认为Seedance 2.5在运动规律和高度定制化上跨时代升级,让他做出几乎百分百纯AI的片子,省掉约60%叙事成本,参考图重要性下降、提示词作用上升;他还谈到AI时代创作本质在于取舍判断,模型变强后自己反而更痛苦,表达成本越低,平庸越没有借口。