尧图网络科技YAOTU DIGITAL 获取报价
获取报价
首页 / 资讯中心 / 文章详情

深度剖析Nemotron-3-Diarization说话人分离模型:1亿参数Transformer与说话人缓存如何稳定追踪8个声源

发布时间:2026/9/26 1:49:28

资讯中心
01
ARTICLE

深度剖析Nemotron-3-Diarization说话人分离模型:1亿参数Transformer与说话人缓存如何稳定追踪8个声源

深度剖析Nemotron-3-Diarization说话人分离模型:1亿参数Transformer与说话人缓存如何稳定追踪8个声源
深度剖析Nemotron-3-Diarization说话人分离模型1亿参数Transformer与说话人缓存如何稳定追踪8个声源【免费下载链接】Nemotron-3-Diarization项目地址: https://ai.gitcode.com/hf_mirrors/nvidia/Nemotron-3-DiarizationNemotron-3-Diarization是 NVIDIA 发布的开源权重说话人分离Speaker Diarization模型用于在真实音频中回答“谁在什么时间说话”。它基于 1 亿参数1.0×10⁸的 Transformer 编码器结合到序说话人缓存AOSC与 FIFO 队列可在流式推理中稳定追踪最多 8 位说话人输入缓冲延迟最低可至 0.32 秒且已开放商用或非商用使用。 先看效果流式说话人分离演示下图是官方演示界面截图左侧是正在播放的多人对话右侧实时画出每位说话人的活动时间线。可以看到说话人身份在整段音频中保持连贯不会出现“同一个人被拆成多个标签”的漂移问题——这正是后文要讲的说话人缓存机制的作用。 说话人分离解决什么问题简单说语音识别ASR回答“说了什么”而说话人分离回答“谁在说”。它把一段音频切分成若干片段并为每个片段打上说话人标签典型输出形如[speaker1, 0.51, 12.62]说话人、起始秒、结束秒。Nemotron-3-Diarization 的几个关键定位见 README.md最多 8 位说话人输出是[T, 8]的张量每列对应一位说话人在该帧的激活概率0~1流式 离线双模式同一个检查点既能做 0.32 s 超低延迟流式也能做 30.4 s 离线高精度模式长度不限分块chunked推理模式下录音时长没有上限输入要求简单16 kHz 单声道音频支持.wav、.flac、.opus、.mp3输出帧率可配默认 10 ms 一帧可按 10 ms 的任意整数倍调整如 30 ms、80 ms、240 ms。一个容易混淆的点8 个通道不是固定指 8 个真人而是容量上限。模型会随音频中实际出现的声音自动“发现”说话人身份。 核心架构1亿参数 Transformer 的四个设计31 层 Transformer 编码器 RoPE模型主干是一个 31 层的 Transformer 编码器使用旋转位置编码RoPE刻画帧间位置关系。整个模型仅约 1 亿参数对端侧与单卡 GPU 部署都很友好。10 ms 特征 → 80 ms 编码帧8 倍特征堆叠输入音频先转换为 10 ms 分辨率的梅尔频谱再通过特征堆叠把相邻 8 帧压成 1 帧编码器内部以 80 ms 帧率运行。这样做的目的是降低序列长度、减少注意力计算量——对实时流式推理至关重要。Conv1D 上采样把预测拉回 10 ms 分辨率编码器输出是 80 ms 粒度模型顶部再叠一层 Conv1D将预测上采样回 10 ms 输入特征分辨率使最终时间戳精度更细。按“到达顺序”排序的 8 通道输出Sortformer 思路说话人分离最难的是“标签对齐”模型第 3 个通道和标注里的“说话人 2”可能根本对不上训练时会产生排列歧义。Nemotron-3-Diarization 沿用 Sortformer 的解法——输出通道按说话人在音频中首次出现的时间先后排序从根本上消除排列问题让“通道编号 到达顺序”训练与推理都稳定。 说话人缓存AOSC与 FIFO 队列流式稳定追踪的秘密流式推理时音频被切成小块逐步喂给模型模型“看不到未来”也记不住太久远的内容。Nemotron-3-Diarization 用两个机制解决AOSCArrival-Order Speaker Cache到序说话人缓存保存较早音频块中各说话人的特征信息让“speaker1 还是那个 speaker1”跨越长时间保持身份避免标签漂移FIFO 队列提供最近若干帧的上下文保证当前块的预测有足够“前情提要”。所有流式参数都以80 ms 帧为单位计量官方推荐了 4 档延迟配置摘自 README.md场景延迟SPKCACHE_LENFIFO_LENCHUNK_LENRIGHT_CONTEXTUPDATE_PERIOD离线高延迟30.4 s2644034040300低延迟1.04 s26426494222很低延迟0.64 s26426462222超低延迟0.32 s26426431222延迟 (CHUNK_LEN RIGHT_CONTEXT) × 80 ms不含计算耗时。模型理论上支持低至 80 ms 的缓冲但官方推荐最低档为 0.32 s。 性能表现声源越多优势越大评估采用说话人分离领域通用的DERDiarization Error Rate说话人分离错误率 误报 漏报 说话人混淆三项之和辅以说话人数统计准确率SCA与 MAE、实时加速比RTFx。指标口径详见 diarization_evaluation.md。与 4 说话人基线模型相比Nemotron-3-Diarization 在各大基准上全面领先DER 越低越好%数据集说话人数基线 DER30.4 sNemotron-330.4 sNemotron-30.32 sDIHARD III1–919.0912.7313.55CALLHOME-Part22–610.329.1011.32AliMeeting远场2–413.6910.4711.60AMI单通道3–421.4211.1412.95NOTSOFAR1 MHM3–721.776.778.65两个值得注意的亮点8 声源场景大幅受益DIHARD III 中 5–9 人录音的 DER 从基线的 40.21 降到 27.58说明多说话人容量确实带来了实打实的精度提升低延迟代价很小从 30.4 s 压到 0.32 sDER 仅上升不到 1 个百分点实时性与精度可以兼得。推理速度方面在 NVIDIA RTX PRO 5000Blackwell、BF16 精度下离线档 RTFx 最高达4385×torch.compile后即每秒可处理约 73 分钟音频。 如何快速跑起来模型运行在 NVIDIA NeMo Frameworkv3.0之上仓库中已直接提供权重文件 Nemotron-3-Diarization.nemo。整体流程只有四步安装 NeMo → 加载模型 → 设置流式参数 → 调用diarize()。安装依赖需 Python 3.12、较新版本 PyTorchapt-get update apt-get install -y libsndfile1 ffmpeg uv pip install nemo-toolkit[asr]本地克隆仓库获取权重文件git clone https://gitcode.com/hf_mirrors/nvidia/Nemotron-3-Diarization核心调用设置 0.32 s 超低延迟档并推理一个 WAV 文件from nemo.collections.asr.models import SortformerEncLabelModel diar_model SortformerEncLabelModel.restore_from( restore_pathNemotron-3-Diarization.nemo, map_locationcuda, strictFalse) diar_model.eval() # 超低延迟流式配置80 ms 帧为单位 m diar_model.sortformer_modules m.chunk_len 340; m.chunk_right_context 40 m.fifo_len 40; m.spkcache_update_period 300 diar_model._check_streaming_parameters() segments diar_model.diarize(audio[meeting.wav], batch_size1) for seg in segments[0]: print(seg) # 形如: [speaker1, 0.51, 12.62] 进阶与流式 ASR 组合得到“谁说了什么”单独使用它只能拿到“谁在何时说话”若要生成带说话人归属的完整字幕官方给出了与两个流式 ASR 模型的搭配方案详细步骤见 ASR_INTEGRATION_GUIDE.md多说话人 Parakeet 流式 ASR专为重叠语音微调将说话人激活作为条件输入Nemotron 3.5 流式 ASR单说话人模型 说话人掩码开箱支持 32 种语言区域。两条管线都通过 NeMo Speech 的多说话人流式推理脚本运行按说话人并行维护各自的转写流最终输出形如Speaker 0: Welcome, everyone. Let us begin. Speaker 1: I have the latest numbers. Speaker 2: I agree, but there is one remaining issue.注意Speaker 0/1/2只是本次会话内发现的身份编号不是真实姓名如需显示姓名需另行做声纹注册或应用层映射。️ 支持硬件、许可与延伸阅读硬件面向 NVIDIA GPU 优化覆盖 AmpereA100/RTX 30 系、AdaRTX 40 系/L 系、HopperH100/H200与 BlackwellRTX 50 系/B 系列平台推荐 Linux 环境许可OpenMDW 1.1商用与非商用均可适合会议、电话、播客、语音助手等“通用说话人标签 时间戳”场景训练背景由 NEST 自监督检查点初始化经“仿真数据离线预训练 真实对话流式微调”两阶段训练数据规模约 1 万小时真实对话 8.2 万小时仿真多说话人混合音频。延伸阅读仓库内文档模型总览与使用说明README.md与流式 ASR 的集成指南ASR_INTEGRATION_GUIDE.md评估指标与 DER 口径diarization_evaluation.md偏见 / 可解释性 / 安全 / 隐私子卡片bias.md、explainability.md、safety.md、privacy.md一句话总结Nemotron-3-Diarization 用“到达序排序 AOSC 说话人缓存 FIFO 上下文”三件套让一个仅 1 亿参数的 Transformer 在 0.32 秒延迟下也能把 8 位说话人的身份稳稳钉住——这是它从“离线可用”走向“实时可用”的核心工程答案。【免费下载链接】Nemotron-3-Diarization项目地址: https://ai.gitcode.com/hf_mirrors/nvidia/Nemotron-3-Diarization创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
02
RELATED NEWS

相关资讯

更多网站建设与数字化升级内容

03
WHY YAOTU

想打造同款高转化官网?

懂行业、懂生意,从建站到增长一站式陪跑

◈

场景化定制

不做模板站,围绕你的业务场景量身设计,小众不撞款。

◐

营销型架构

以转化目标组织内容与路径,让官网真正带来询盘。

▲

全周期服务

设计、开发、运营、运维一体,上线只是开始。

免费获取你的建站方案

留下需求,专属顾问 24 小时内为你输出方案建议。