Latenode

NVIDIA lança modelo de áudio aberto para diarização de 8 vozes

Criadores de automações podem adicionar processamento com reconhecimento de locutores sem depender totalmente de uma API fechada de diarização. Fluxos de produção ainda precisam de transcrição, mapeamento de identidade e verificações de erro para fala sobreposta ou ruidosa.

Modelo Nemotron 3 separando vozes em uma conversa com vários participantes

A NVIDIA lançou o Nemotron 3 Diarization, um modelo de áudio com pesos abertos para rastrear locutores em conversas ao vivo e gravadas. O checkpoint de cerca de 100 milhões de parâmetros identifica até oito locutores, incluindo fala sobreposta, segundo o post de lançamento.

O modelo retorna marcas de tempo e rótulos anônimos de locutores, em vez de identidades ou transcrições independentes. Um único checkpoint atende ao processamento por streaming e offline, enquanto os pesos estão disponíveis no Hugging Face sob a OpenMDW 1.1.

As equipes podem combinar seus canais de locutores com reconhecimento automático de fala para atas de reunião, análise de chamadas e processamento de podcasts. Ainda será necessário associar os rótulos a participantes conhecidos e testar a precisão em áudios ruidosos e específicos do domínio.

O lançamento anterior do Nemotron 3 da NVIDIA aborda sua família de modelos de linguagem; o lançamento de diarização é um modelo de áudio separado.

Quando modelos e APIs mudam o fluxo continua rodando

Conecte em um único cenário os modelos e apps de notícias como esta. Se um provedor mudar roteamento, preço ou disponibilidade, você atualiza o fluxo — sem recomeçar do zero.

Começar grátis

Plano gratuito para sempre. Não é necessário cartão de crédito.