🐌 蜗牛AI
← 返回 AI 资讯
科技👁 0

小米开源工业级目标说话人语音识别大模型 Xiaomi-CocktailASR-1

小米开源工业级目标说话人语音识别大模型 Xiaomi-CocktailASR-1
IT之家 9 月 11 日消息,小米技术今日发文宣布,小米正式发布并开源工业级目标说话人语音识别大模型 Xiaomi-CocktailASR-1。 官方表示,Xiaomi-CocktailASR-1 旨在解决“鸡尾酒会”难题 (IT之家注:当前语音识别技术已经可以以较高精度识别一个人所讲的话,但是当说话的人数为两人或者多人时,语音识别率就会极大地降低,这一难题被称为鸡尾酒会问题)。 该模型采用端到端 LLM 架构,以目标说话人的一段参考音频作为声纹提示,可在多人同时说话的复杂环境中,精准提取并仅转录目标用户的语音。 在多个主流多说话人测试集上均达到 SOTA ,大幅领先现有方案。 同时, 其单…

以上为资讯摘要,完整内容请访问原文网站。

阅读原文 →