Latenode

NVIDIA lanza modelo de diarización para 8 hablantes con pesos abiertos

Los creadores de automatizaciones pueden añadir procesamiento consciente de los hablantes sin depender por completo de una API de diarización cerrada. Los flujos de producción aún requieren transcripción, asociación de identidades y comprobaciones de errores ante habla superpuesta o ruidosa.

Canales de voz detectados en una conversación

NVIDIA lanzó Nemotron 3 Diarization, un modelo de audio con pesos abiertos para identificar hablantes en conversaciones en vivo y grabadas. El punto de control de aproximadamente 100 millones de parámetros etiqueta hasta ocho hablantes, incluido el habla superpuesta, según la entrada de lanzamiento.

El modelo devuelve marcas de tiempo y etiquetas anónimas de hablantes, en lugar de identidades o transcripciones independientes. Un único punto de control gestiona tanto el procesamiento en tiempo real como sin conexión, mientras que los pesos están disponibles en Hugging Face bajo OpenMDW 1.1.

Los equipos pueden combinar sus canales de hablantes con reconocimiento automático del habla para notas de reuniones, análisis de llamadas y procesamiento de pódcast. Aun así, deberán asociar las etiquetas con participantes conocidos y probar la precisión con audio ruidoso y específico de cada dominio.

La anterior versión de Nemotron 3 de NVIDIA cubre su familia de modelos de lenguaje; el lanzamiento de diarización corresponde a un modelo de audio independiente.

Cuando cambian los modelos y las APIs el flujo sigue en marcha

Conecta en un solo escenario los modelos y apps de noticias como esta. Si un proveedor cambia el enrutado, el precio o la disponibilidad, actualizas el flujo — no empiezas de cero.

Empezar gratis

Plan gratuito para siempre. No se requiere tarjeta de crédito.