昆仑万维 SkyProduction 天工工作台新版本上线,打通剧本到成片流程
昆仑万维 SkyProduction 天工工作台全新版本于8月31日上线,把剧本、资产、分镜、视频和后期整合为一条生产线。剧本环节提供剧本翻译、剧本评分和小说转剧本功能;Agent 流程可选 Seedance 2.0 智能创作或智能分镜模式,支持片段重拍和10分钟超长视频生成;Seedance 2.5 720P 无参考视频低至0.4元/秒,30秒视频生成成本最低12元。
昆仑万维 SkyProduction 天工工作台全新版本于8月31日上线,把剧本、资产、分镜、视频和后期整合为一条生产线。剧本环节提供剧本翻译、剧本评分和小说转剧本功能;Agent 流程可选 Seedance 2.0 智能创作或智能分镜模式,支持片段重拍和10分钟超长视频生成;Seedance 2.5 720P 无参考视频低至0.4元/秒,30秒视频生成成本最低12元。
可灵 Kling AI 发布教程,讲解如何在 Kling MCP 中使用 Elements 功能,在不同镜头间保持角色身份一致,从而创作更连贯的 AI 生成故事。
Miro 品牌团队分享如何完全用 Runway 制作 Canvas26 年度活动的开场视频,并本地化为四个城市的版本。此前年份依赖素材库加 3D 动效,今年每个镜头包括城市景观、人群和入场镜头都以 Runway 生成,再叠加基于 Miro Flows 节点连线设计的 3D 动效。
Google DeepMind 为 Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite 推出 agentic video understanding,模型动态扫描视频片段,相比固定帧率处理 token 消耗最多降低 88%,成本最多降低 66%,准确率最多提升 7%。
推荐理由:官方说明列出 token、成本与准确率三项数字和开启方式,开发者可据此评估长视频分析是否换用该模式。
推出 Atlas: 全球首个多模态世界模型,可生成图像和视频帧,具备像素级精准的相机控制,并在 3D 中重建它们。 建模世界,移动相机,模拟空间与时间。
可灵(Kling AI)发布官方教程,讲解如何使用 Kling MCP 中的 Elements 功能在不同镜头之间保持角色身份一致,从而创作更具连贯性的 AI 生成故事。
Luma AI 官方宣布推出 FLUX Video Upscale,将视频分辨率提升至 2K 和 4K。推文配有一段演示视频,并称有些面孔值得 4K 分辨率,即使是六只眼睛的面孔。
昆仑万维在中国证券报主办的2026科技创新与产业高质量发展大会上获颁2025年度新质企业金牛奖(人工智能)。公司2026年上半年营收53.59亿元,同比增长43.55%,归母净利润10.88亿元,同比增长227.17%;AI短剧平台单月流水超6500万美元,FreeReels位列出海短剧APP下载量第一。
vLLM-Omni 团队发布 MiniMax H3 生产级服务实践,先做系统级优化,再集成 FastVideo 的四步 FastH3 蒸馏学生模型,将去噪循环从 49 次 DiT 前向降到 4 次。
Gemini API 上线智能体视频理解,可按问题动态检查画面、音频和字幕,支持上传视频与 YouTube 链接。功能适用于多款 Flash 模型,沿用标准 API 计价;谷歌测试中的节省幅度取决于任务,不能直接当作所有视频的成本承诺。
推荐理由:按问题选择视频片段改变了长视频分析的资源分配方式,开发者可据此设计更有针对性的检索和理解流程。
MiniMax 将 H3 Max 768P、480P 接入开放平台和 MiniMax Design,海外开发者已借此搭建出 Twitch 直播和 24 小时“AI 电视台”。
推荐理由:原文给出 H3 Max 的生成速度、吞吐量提升和接入入口,并梳理了社区围绕它做实时直播的具体玩法。
Google DeepMind 发布 Gemini Omni 1.1 Flash,为开发者带来场景延长、首尾帧插值、360p 快速草稿和最高 4K 放大等生成视频控制能力。
推荐理由:官方给出场景延长、首尾帧插值与 4K 放大等具体能力与开放入口,可据此判断生成视频工作流的变化。
Google DeepMind 与 A24 宣布达成首个此类研究合作,将顶尖研究实验室与电影制作公司配对,帮助艺术家开发新工作流与技术。合作将跨越多个项目,让 A24 及其电影人直接参与塑造新技术,同时为 Google DeepMind 提供艺术家反馈。Google 还对 A24 进行了投资。
Google DeepMind 发布 Nano Banana 2 Lite 和 Gemini Omni Flash 两款模型。
推荐理由:两款新模型给出了延迟、单价与可用入口,读者可据此判断图像与视频生成链路的成本变化。
Google DeepMind 发布 Omni 家族首个模型 Gemini Omni Flash,可组合图像、音频、视频和文本输入生成高质量视频,并通过自然语言多轮编辑视频。
推荐理由:Gemini Omni Flash 把对话式视频编辑和多模态输入整合进 Gemini 应用与 YouTube Shorts,可据此判断生成视频工作流的变化。