A NVIDIA lançou o Nemotron 3 Diarization, um modelo de áudio com pesos abertos para rastrear locutores em conversas ao vivo e gravadas. O checkpoint de cerca de 100 milhões de parâmetros identifica até oito locutores, incluindo fala sobreposta, segundo o post de lançamento.
O modelo retorna marcas de tempo e rótulos anônimos de locutores, em vez de identidades ou transcrições independentes. Um único checkpoint atende ao processamento por streaming e offline, enquanto os pesos estão disponíveis no Hugging Face sob a OpenMDW 1.1.
As equipes podem combinar seus canais de locutores com reconhecimento automático de fala para atas de reunião, análise de chamadas e processamento de podcasts. Ainda será necessário associar os rótulos a participantes conhecidos e testar a precisão em áudios ruidosos e específicos do domínio.
O lançamento anterior do Nemotron 3 da NVIDIA aborda sua família de modelos de linguagem; o lançamento de diarização é um modelo de áudio separado.
