跳到正文

#视频

今日 0 条
9月29日周二
  1. HuggingFace Daily Papers(社区热门论文)33

    GeoVerse:在几何隐空间中实现世界一致的新视角合成

    GeoVerse 通过在预训练 3D 基础模型的几何隐空间中生成、并注入视频生成模型的外观先验,实现世界一致的新视角合成。它从 Wan2.2 VACE 提取多层级特征,经 ControlNet 式适配器注入几何隐扩散模型,并用全局空间记忆聚合已观测与合成内容以保持跨视角连贯。

  2. HuggingFace Daily Papers(社区热门论文)41

    WorldPlay2:扩展实时交互世界模型的控制能力与预测时长

    WorldPlay2 是一个交互式世界模型,通过分解式混合控制接口与压缩记忆、稳定蒸馏的协同设计,兼顾长时一致性与实时响应。该接口将帧对齐动作控制与结构化语义控制结合,显式解耦场景外观、角色身份和动态语义事件;同时将历史上下文压缩为记忆 token,供自回归学生模型与双向教师模型共享,实现按片段进行记忆条件打分,大幅降低蒸馏开销。

  3. HuggingFace Daily Papers(社区热门论文)42

    EditWorld:面向可交互世界的精准编辑与灵活引用视频世界模型

    EditWorld 是一个支持精准编辑与灵活引用的视频世界模型,可在自回归生成过程中流式接收编辑指令和参考图像,将世界建模从探索扩展到精准修改。它引入 Gated Causal Attention 处理时变编辑条件与参考图像,并用 Sparse Context 机制维持有界历史上下文以支持长时程推理。

9月28日周一
9月27日周日
  1. HuggingFace Daily Papers(社区热门论文)38

    VGGT-Diff:融合视觉几何与扩散模型的稀疏视角新视角合成

    VGGT-Diff 将 VGGT-Ω 的视觉几何 latent 路由进预训练视频扩散模型,用于稀疏视角新视角合成。每个视觉 token 关联 3D 点和置信度,经置信度感知的 Visual Geometry Router(VGR)转为查询对齐的 latent 条件,Point-Track Residual Consistency(PTRC)沿可靠 3D 轨迹正则化预测残差。

9月26日周六
9月25日周五
  1. HuggingFace Daily Papers(社区热门论文)55

    TRACE:流式视频理解的时序审计与条件感知评估框架

    论文提出 TRACE 基准,旨在解决现有流式视频理解评估中忽略证据时效性、历史维护及响应触发机制的问题。该框架通过统一因果协议控制信息可用性,并多维报告答案质量、及时性、负载等指标。在 1240 条记录上的实验显示,相似的 QA 准确率可能掩盖系统在完成度、生成负载及主动响应行为(如误报、漏报)上的巨大差异,强调应将性能视为执行条件下的系统行为而非单一分数。

9月15日周二
  1. AK52

    Vidu S2 论文发布,提出实时交互、可编辑和空间视频生成,包含实时交互数字人模型 Vidu S2-Avatar 和实时视频编辑模型 Vidu S2-Editing。Vidu S2-Avatar 相比 Vidu S1 支持实时 720p 生成、可随时更新的动态参考和更强的指令遵循;Vidu S2-Editing 支持对视频流实时编辑,包括风格渲染、服装、角色和背景替换。论文链接 https://huggingface.co/papers/2609.11638,在线演示 https://vidu.com/vidu-stream。

9月5日周六
9月4日周五
  1. HuggingFace Daily Papers(社区热门论文)42

    Puffin-World 提出原生 3D 世界状态的统一多模态世界模型并开源

    Puffin-World 是一个统一多模态架构,不依赖外部离线模块即可实现物理理解、空间模拟和 3D 世界生成与重建。该框架联合建模物理(重力场与纬度)、几何(深度)和外观(图像)三种原生世界状态,并引入统一 Omni-Camera 表示与跨未来帧传播物理动态的策略,在单一生成过程中同时合成未来视图并重建底层几何。

  2. HuggingFace Daily Papers(社区热门论文)40

    WorldReward 提出面向相机条件世界模型的 VLM 奖励建模方法

    WorldReward 是一个基于 VLM 的成对偏好奖励模型,为相机条件世界模型统一评估动作一致性与视觉质量。方法将视频分解为动作对齐的块并投票聚合,配套发布人工标注的 WorldReward-Bench,在三个维度上分别超过 GPT-5.5 约 3.42、1.45 和 3.56 个百分点,用于 HY-WorldPlay 1.5 的 RL 后训练可同时提升动作执行与视觉质量。

  3. HuggingFace Daily Papers(社区热门论文)40

    FlashRender:基于相机控制视频 MeanFlow 的少步生成渲染框架

    论文提出 FlashRender,一个少步生成渲染框架,可在数秒内沿目标相机轨迹重新渲染源视频。方法引入 RETA 将源视频隐表示与冻结视觉几何模型的目标视频特征对齐,实现采样步数一致的相机控制,再用 MeanFlow 目标微调并结合 on-policy flow map 蒸馏。实验显示其在视频质量和几何一致性上匹配多步基线,采样成本降低 25 倍,并在分布外目标相机轨迹下具备更强的相机可控性。

9月3日周四
  1. HuggingFace Daily Papers(社区热门论文)50

    SolarWM 发布开放数据与可扩展训练框架,仅用5秒序列训练实现小时级交互式视频世界模型

    SolarWM 是一个全开源的交互式视频世界模型基础,包含可重构多源数据引擎和骨干原生适配框架,将10个数据集约143万片段(约25.85TB)转为统一的帧对齐训练契约,并基于 Wan2.2、LTX-2.5 和 MiniMax-H3 训练四个 5B–33B 模型。

  2. HuggingFace Daily Papers(社区热门论文)40

    DramaChain Bench 发布:覆盖短剧生成全流程的端到端基准

    DramaChain Bench 是首个评估短剧生产完整链路(剧本、分镜、关键帧、镜头视频到成片)各阶段的基准,包含五条评估轴、63 个叶子维度。基准由 5785 个条目经三名专业标注者独立打分,产生 17,488 个有效评分和 255,925 条可追溯归因记录;人工标注证实上游缺陷会跨阶段级联,最终成片质量并非只由视频生成决定。

9月2日周三
  1. HuggingFace Daily Papers(社区热门论文)43

    VeriPhy 提出面向世界模型评估与改进的智能体物理推理系统

    论文提出 VeriPhy,一个可审计的物理验证系统:纯文本规划器在观察任何帧之前将提示词编译为带类型的物理义务和经静态验证的执行计划,执行时仅调用冻结的低层专家(分割与跟踪、计数、11 类物理测量、深度、OCR、音频事件检测),每个动作返回带溯源的证据记录,并映射为 supported、contradicted 或 unknown 三值判定。

9月1日周二