据 PANews 报道,9 月 11 日,小米发布并开源了 Xiaomi-CocktailASR-1,这是一款工业级目标说话人语音识别模型。该模型通过利用端到端 LLM 架构,将目标说话人的参考音频作为声纹提示,解决了鸡尾酒会问题,从而能够在多说话人环境中准确提取并转录目标用户的语音。