英伟达发布Nemotron-3-Diarization免费语音分割模型,拥有约1亿参数,支持最多8人同时发声的实时及录音音频处理。该模型在VoiceArena语音分割基准测试中以14.72%的错误率登顶榜首,显著优于排名第二的系统。相比前代Streaming Sortformer,新模型在1.04秒音频缓冲区下的平均错误率大幅降低41%,并支持0.32秒至30.4秒的动态音频缓冲区设置。该模型可与Parakeet等语音识别系统协同,自动生成带有匿名说话者标签的文本。英伟达此次推出轻量级高精度语音分割模型,将为实时会议记录、智能客服等应用提供底层支撑,加速多说话人识别技术在端侧与实时商业场景的落地。

文章作者、来源:AIBase

Nemotron-3-Diarization模型发布

9月27日,英伟达正式发布了拥有约1亿参数的免费人工智能模型Nemotron-3-Diarization。该模型专注于语音分割聚类(Diarization)任务,开放了权重数据,能够精准识别对话中任意时刻的说话者,支持最多8人同时发声的实时及录音音频处理。

技术突破与性能表现

Nemotron-3-Diarization在严苛的VoiceArena语音分割基准测试(v1版本)中以14.72%的错误率(DER)登顶榜首,显著优于排名第二的系统(19.3%)。相比其前代产品Streaming Sortformer,新模型在使用1.04秒音频缓冲区的八个测试场景下,平均错误率大幅降低了41%。为平衡系统延迟与准确率,该模型支持从0.32秒至30.4秒的四级动态音频缓冲区设置。

功能应用层面

新模型可与Parakeet等语音识别系统无缝协同,自动生成带有匿名说话者标签(如"speaker_2")的文本。尽管在参与者增多、背景噪音过大或混响严重时错误率会相应上升,但其强大的底层架构已能有效应对重叠语音等传统技术难点。

此次英伟达推出轻量级且免费的高精度语音分割模型,大幅降低了复杂语音分析的技术门槛。这一动作不仅为实时会议记录、智能客服与多角色语音交互等应用提供了极具性价比的底层支撑,也预示着多说话人识别技术在端侧与实时商业场景下的落地将进一步提速。