跳到正文
原文
HuggingFace Daily Papers(社区热门论文)·· 2026-09-02AI 评分52

Microsoft Research 发布 VibeVoice-ASR-Streaming 流式说话人归属语音识别技术报告

VibeVoice-ASR-Streaming Technical Report

AI 导读

Microsoft Research 发布 VibeVoice-ASR-Streaming 技术报告,提出基于 LLM 的端到端流式说话人归属 ASR,将音频块、0.5 秒 lookahead 和已有文本交错在单一自回归上下文中,无需独立 diarization 阶段即可随语音到达输出谁说了什么。

整理与数据来源:AIHOT

来源:HuggingFace Daily Papers(社区热门论文) · arxiv.org