跳到正文

#视频

今日 1 条
9月3日周四
  1. Artificial Analysis70

    Artificial Analysis 评测显示,阿里巴巴 Wan 3.0 在视频编辑带音频榜单首次登顶第一,文生视频带音频位列第二,图生视频带音频排名第五。该模型为一体化视频生成与编辑模型,支持最长 30 秒 1080p 原生音频输出,可接受文本、图片、视频、音频、文档和网页作为创作参考,并支持指令式编辑画面、剧情、对话和声音。

  2. HuggingFace Daily Papers(社区热门论文)50

    SolarWM 发布开放数据与可扩展训练框架,仅用5秒序列训练实现小时级交互式视频世界模型

    SolarWM 是一个全开源的交互式视频世界模型基础,包含可重构多源数据引擎和骨干原生适配框架,将10个数据集约143万片段(约25.85TB)转为统一的帧对齐训练契约,并基于 Wan2.2、LTX-2.5 和 MiniMax-H3 训练四个 5B–33B 模型。

  3. HuggingFace Daily Papers(社区热门论文)40

    DramaChain Bench 发布:覆盖短剧生成全流程的端到端基准

    DramaChain Bench 是首个评估短剧生产完整链路(剧本、分镜、关键帧、镜头视频到成片)各阶段的基准,包含五条评估轴、63 个叶子维度。基准由 5785 个条目经三名专业标注者独立打分,产生 17,488 个有效评分和 255,925 条可追溯归因记录;人工标注证实上游缺陷会跨阶段级联,最终成片质量并非只由视频生成决定。

9月2日周三
  1. IT之家(RSS)56

    国内首部 AIGC 长剧《后西游记》上线芒果 TV,制作周期较传统三维动画减少 70%

    国内首部无真人演员的 AIGC 长剧《后西游记》于 8 月 31 日上线芒果 TV 并登陆湖南卫视黄金档。芒果超媒董事长蔡怀军称,该剧 30 集、单集 40 分钟,总成本约为同类 S 级真人剧几分之一,从策划到上线时间较传统三维动画压缩 70%;制作流程为导演定情绪基调、美术完成设计、AI 团队从文生图推进到图生视频。该剧也是“广电 21 条”发布后首部“边审边播”剧集。

  2. 公众号:昆仑万维(天工)54

    昆仑万维 SkyProduction 天工工作台新版本上线,打通剧本到成片流程

    昆仑万维 SkyProduction 天工工作台全新版本于8月31日上线,把剧本、资产、分镜、视频和后期整合为一条生产线。剧本环节提供剧本翻译、剧本评分和小说转剧本功能;Agent 流程可选 Seedance 2.0 智能创作或智能分镜模式,支持片段重拍和10分钟超长视频生成;Seedance 2.5 720P 无参考视频低至0.4元/秒,30秒视频生成成本最低12元。

  3. IT之家(RSS)62

    李飞飞 World Labs 发布多模态世界模型 Atlas,支持像素级相机控制生成 1440p 视频

    李飞飞创办的 World Labs 发布多模态世界模型 Atlas,称其能以像素级精确相机控制生成图像和视频帧,并在 3D 中重建。Atlas 可输出最长 1 分钟的 1440p 视频,从一至数十张图像进行空间重建,支持时空模拟和文本生成图像与 360 度全景,部分合作伙伴已获抢先体验,未来几周内开放早期访问。

  4. HuggingFace Daily Papers(社区热门论文)43

    VeriPhy 提出面向世界模型评估与改进的智能体物理推理系统

    论文提出 VeriPhy,一个可审计的物理验证系统:纯文本规划器在观察任何帧之前将提示词编译为带类型的物理义务和经静态验证的执行计划,执行时仅调用冻结的低层专家(分割与跟踪、计数、11 类物理测量、深度、OCR、音频事件检测),每个动作返回带溯源的证据记录,并映射为 supported、contradicted 或 unknown 三值判定。

  5. Hacker News 热门(buzzing.cc 中文翻译)70

    World Labs 发布世界模型 Atlas:面向空间智能的多模态自回归扩散 Transformer

    World Labs 发布新一代世界模型 Atlas,从零预训练,原生处理文本、图像、视频和 3D,架构为多模态自回归扩散 Transformer,输入以 3D 姿态形成空间上下文。模型支持相机控制生成(最长 1 分钟 1440p 视频)、稀疏视图 3D 重建、时空仿真和图像生成,在相机控制生成与 3D 重建任务上优于更专用的模型;现已开放早期访问申请,未来将驱动 Marble 等产品。

  6. Fei-Fei Li57

    World Labs 发布从零训练的多模态世界模型 Atlas。模型可生成具有像素级相机控制能力的图像和视频帧,从单张输入图像重建大型场景,通过重帧视频模拟时空,并从一张或多张输入图像原生输出 3D 空间,还能将多张带位姿的图像合成一致的三维世界。作者称其为迄今最好的相机条件世界模型,可能应用于 VFX 到机器人等多个方向。

  7. Google DeepMind:Blog(RSS)72

    Google DeepMind 为 Gemini 推出 agentic 视频理解功能

    Google DeepMind 为 Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite 推出 agentic video understanding,模型动态扫描视频片段,相比固定帧率处理 token 消耗最多降低 88%,成本最多降低 66%,准确率最多提升 7%。

    推荐理由:官方说明列出 token、成本与准确率三项数字和开启方式,开发者可据此评估长视频分析是否换用该模式。

9月1日周二