尧图网络科技YAOTU DIGITAL 获取报价
获取报价
首页 / 资讯中心 / 文章详情

只听指定的人:小米这款开源 ASR,把参考声音变成识别开关

发布时间:2026/9/26 4:04:29

资讯中心
01
ARTICLE

只听指定的人:小米这款开源 ASR,把参考声音变成识别开关

只听指定的人:小米这款开源 ASR,把参考声音变成识别开关
会议里三个人同时说话普通 ASR 通常面临两个难题要么把所有人的话糊在一起要么先做语音分离再一路路识别。但如果你只关心其中一个人其实有另一条路给模型一段这个人的参考声音让它直接只转录目标说话人。小米研究团队开源的 Xiaomi-CocktailASR-1做的就是这件事。它是一个目标说话人语音识别模型参考语音相当于一把“声音钥匙”模型根据这把钥匙从混合语音里找出对应的人并转成文字。它解决的不是“更安静”而是“该听谁”这点很容易和降噪、语音分离混在一起。降噪要去掉的是空调、风声、键盘声这类环境噪声语音分离希望把多个人分成多路音频而目标说话人 ASR 的目标更直接我不需要所有人只要某一个人的文字。官方 demo 里参考声音和待识别混合语音都给到模型后输出是人们设计 AI 配方的过程本质上主要还是一个不断试错的过程。当参考声音对应的人不在待识别音频里模型则应该输出空文本。这个“不该说时就不说”的能力对声控设备、指定发言人转录和特定受访者抽取都很有价值。真实会议数据有效但要看具体测试项目报告了两个真实多人会议测试集。在 AMI SDM 上Xiaomi-CocktailASR-1 的 WER 是 21.81%在 AliMeeting Far 上是 20.63%。对比表中Qwen3-ASR 分别是 38.18% 和 39.64%。这组数据支持一个有用的判断当任务明确要“只识别某个人”时目标说话人建模比把普通 ASR 直接丢进多人混合语音更对题。但也要看清边界。在模拟集 LibriMix 3mix 上它的 WER 为 12.29%而表中 previous SOTA 是 12.23%因此不宜把结论简化成“所有项目都第一”。真正应该关注的是它把多人、单人和负样本拒识统一到了同一个调用接口里。拒识能力很实用也会带来新权衡项目还测试了三组负样本。Xiaomi-CocktailASR-1 的拒识率分别是 79.59%、75.35% 和 68.54%。这意味着参考人不在场时它有较大概率保持沉默但还不是百分之百。另一面是误拒。在五个单人测试集上官方报告的 FRR 介于 0% 到 0.73%。所以生产选型不能只看 WER还要根据业务设定“误转一句”和“漏掉一句”哪个更贵。怎么开始先跑通一条正样本和一条负样本官方 README 的依赖很短pipinstalltorch torchaudio transformers soundfile这一步是准备 PyTorch、音频读取和 Hugging Face 模型加载环境。安装完成后下面的导入不报错就说明基础依赖已就绪。然后准备两个文件ref_speaker.wav是目标人的参考声音target.wav是待识别音频。模型接受文件路径、NumPy 数组或 Tensor期望 16 kHz 单声道其他采样率会自动重采样。fromtransformersimportAutoModel modelAutoModel.from_pretrained(Ease3/Xiaomi-CocktailASR-1,trust_remote_codeTrue,torch_dtypebfloat16,).cuda().eval()textmodel(target.wav,ref_speaker.wav)print(text)这一步内部会拼接“参考语音 1 秒静音 目标语音”。成功标志是返回目标人的文本。接着把参考音频换成一个不在target.wav里的人再跑一次预期输出是空字符串。这里有一个必须认真处理的工程问题trust_remote_codeTrue会执行模型仓库里的自定义代码。正式部署时应该先审查代码固定 revision而不是始终跟随远程最新版。批量转录已经有现成入口仓库的tools/test_batch_scp.py接受五列 TSVutt_id, wav, text, ref_wav, ref_id。它按原文件顺序处理模型只加载一次。CUDA_VISIBLE_DEVICES0python tools/test_batch_scp.py\--hf_model_dirEase3/Xiaomi-CocktailASR-1\--input_scpscp.tsv\--output_fileout/result.txt成功后会得到out/result.txt和同目录下的text分别保存预测文本和参考文本便于后续评分。最后的选型建议如果你的目标是生成完整会议纪要所有发言人都要保留那么说话人日志、分离或 diarization 仍然更合适。如果你的任务是指定受访者转录、语音唤醒后只识别已登记用户或者从多人场景中追踪一个固定人这个模型才真正对题。它当前的门槛也很明确这是一个约 8B 规模、官方示例使用 CUDA 和 bfloat16 的模型不是移动端即装即用的小工具。先用一条正样本和一条负样本验证价值再决定是否值得把它接入你的语音流水线。参考GitHub 项目 · Hugging Face 模型 · 技术报告
02
RELATED NEWS

相关资讯

更多网站建设与数字化升级内容

03
WHY YAOTU

想打造同款高转化官网?

懂行业、懂生意,从建站到增长一站式陪跑

◈

场景化定制

不做模板站,围绕你的业务场景量身设计,小众不撞款。

◐

营销型架构

以转化目标组织内容与路径,让官网真正带来询盘。

▲

全周期服务

设计、开发、运营、运维一体,上线只是开始。

免费获取你的建站方案

留下需求,专属顾问 24 小时内为你输出方案建议。