NVIDIA lanzó Nemotron 3 Diarization, un modelo de audio con pesos abiertos para identificar hablantes en conversaciones en vivo y grabadas. El punto de control de aproximadamente 100 millones de parámetros etiqueta hasta ocho hablantes, incluido el habla superpuesta, según la entrada de lanzamiento.
El modelo devuelve marcas de tiempo y etiquetas anónimas de hablantes, en lugar de identidades o transcripciones independientes. Un único punto de control gestiona tanto el procesamiento en tiempo real como sin conexión, mientras que los pesos están disponibles en Hugging Face bajo OpenMDW 1.1.
Los equipos pueden combinar sus canales de hablantes con reconocimiento automático del habla para notas de reuniones, análisis de llamadas y procesamiento de pódcast. Aun así, deberán asociar las etiquetas con participantes conocidos y probar la precisión con audio ruidoso y específico de cada dominio.
La anterior versión de Nemotron 3 de NVIDIA cubre su familia de modelos de lenguaje; el lanzamiento de diarización corresponde a un modelo de audio independiente.
