跳到正文
原文
HuggingFace Daily Papers(社区热门论文)·· 2026-09-03AI 评分40

WorldReward 提出面向相机条件世界模型的 VLM 奖励建模方法

WorldReward: Reward Modeling for Camera-Conditioned World Models

AI 导读

WorldReward 是一个基于 VLM 的成对偏好奖励模型,为相机条件世界模型统一评估动作一致性与视觉质量。方法将视频分解为动作对齐的块并投票聚合,配套发布人工标注的 WorldReward-Bench,在三个维度上分别超过 GPT-5.5 约 3.42、1.45 和 3.56 个百分点,用于 HY-WorldPlay 1.5 的 RL 后训练可同时提升动作执行与视觉质量。

整理与数据来源:AIHOT

来源:HuggingFace Daily Papers(社区热门论文) · arxiv.org