跳到正文
原文
IT之家(RSS)·· 27 天前AI 评分55

小米开源工业级目标说话人语音识别大模型 Xiaomi-CocktailASR-1

AI 导读

小米发布并开源工业级目标说话人语音识别大模型 Xiaomi-CocktailASR-1,针对多人同时说话时识别率大幅下降的鸡尾酒会难题。模型采用端到端 LLM 架构,以目标说话人参考音频作为声纹提示,在多个主流多说话人测试集上达到 SOTA;单人识别性能比肩标准 ASR 模型,可拒识非目标说话人并支持思维链推理模式。代码开源于 GitHub 和 HuggingFace。

整理与数据来源:AIHOT

来源:IT之家(RSS) · ithome.com