HuggingFace Daily Papers(社区热门论文)·· 2026-09-02AI 评分52
Microsoft Research 发布 VibeVoice-ASR-Streaming 流式说话人归属语音识别技术报告
VibeVoice-ASR-Streaming Technical Report
AI 导读
Microsoft Research 发布 VibeVoice-ASR-Streaming 技术报告,提出基于 LLM 的端到端流式说话人归属 ASR,将音频块、0.5 秒 lookahead 和已有文本交错在单一自回归上下文中,无需独立 diarization 阶段即可随语音到达输出谁说了什么。
整理与数据来源:AIHOT
来源:HuggingFace Daily Papers(社区热门论文) · arxiv.org