HuggingFace Daily Papers(社区热门论文)·· 15 天前AI 评分37
联合视频生成中的跨注意力鸿沟:RecCAR 让视频与动作、音频互相对齐
All modalities are equal, but video is more equal: Closing the Cross-Attention Gap in Joint Video Generation
AI 导读
研究者发现联合多模态扩散 Transformer 存在"互惠对应鸿沟":动作、音频等伴随模态能强对应视频,反向约束视频的对应却明显偏弱。为此提出 KL 正则化方法 RecCAR,以视频到模态的对应为固定参照,拉齐较弱的模态到视频对应。在视频-动作与视频-音频生成中,RecCAR 将 Human Anatomy 分数从 0.69 提升至 0.75,音视频不同步从 0.804 降至 0.752。
整理与数据来源:AIHOT
来源:HuggingFace Daily Papers(社区热门论文) · arxiv.org