影音音频

NVIDIA发布Nemotron 3 Diarization:1亿参数开源权重模型,实时追踪8位说话人

原标题: NVIDIA发布Nemotron 3 Diarization:1亿参数开源权重模型,实时追踪8位说话人

marktechpost.com·2026/9/23 18:17:14🔗 原文

📋总体概括

NVIDIA在Hugging Face上发布了开源权重的说话人分离模型Nemotron 3 Diarization,仅1亿参数即可解决「谁在何时说话」的问题。该模型最多可同时追踪8位说话人,甚至能应对声音重叠的场景,且单一checkpoint同时支持离线录音处理与实时流式推理。权重以开放许可发布,可直接部署。这类轻量级语音基础组件的开放,将显著降低会议转写、语音助手等应用的开发门槛。

⚡关键信息

  • ▸NVIDIA发布开源权重说话人分离模型Nemotron 3 Diarization,上架Hugging Face
  • ▸模型仅100M参数,可同时追踪最多8位说话人,并支持声音重叠场景
  • ▸单一checkpoint同时覆盖离线录音与实时流式两种推理模式
  • ▸权重以开放许可发布,可直接落地部署
  • ▸发布渠道为Hugging Face,面向语音转写与会议分析等应用场景

🔥犀利点评

100M参数做到8人实时分离,这手感很像当年Whisper用小模型掀翻语音识别桌子的剧本。说话人分离一直是转写管线里最脏最难的环节,NVIDIA直接把权重放出来,等于把一批靠卖Diarization API的创业公司的护城河填平了。真正的问题在于重叠语音的准确率到底几分,文章没给benchmark,先别急着封神。

本文由本站自动聚合,以下为原始来源:前往 marktechpost.com 阅读全文 →