Saltar al contenido principal
EN VIVO
BTC: $77,398.42ETH: $2,415.62SOL: $99.93USD/BCV: 801.18 BsEUR/BCV: 929.09 BsBTC: $77,398.42ETH: $2,415.62SOL: $99.93USD/BCV: 801.18 BsEUR/BCV: 929.09 BsBTC: $77,398.42ETH: $2,415.62SOL: $99.93USD/BCV: 801.18 BsEUR/BCV: 929.09 BsBTC: $77,398.42ETH: $2,415.62SOL: $99.93USD/BCV: 801.18 BsEUR/BCV: 929.09 Bs
Inteligencia Artificial

Muse Voice Transcribe: la nueva IA de Meta que distingue 20 voces a la vez

Añadir como fuente preferida en Google
Muse Voice Transcribe: la nueva IA de Meta que distingue 20 voces a la vez

Meta presentó Muse Voice Transcribe, un modelo de percepción en tiempo real capaz de identificar a más de 20 hablantes distintos dentro de una misma conversación. Desarrollado por su equipo de Superinteligencia, este sistema supera los desarrollos de competidores como OpenAI al procesar audio en directo, detectar pausas automáticamente y estar disponible en su API y en la aplicación de Meta AI para macOS.

Reconocimiento multilingüe de más de 20 hablantes en simultáneo

El sistema fue entrenado con más de 70 idiomas, de los cuales 25 cuentan con una validación exhaustiva. Esta capacidad técnica le permite gestionar conversaciones donde los participantes alternan de idioma a mitad de una frase sin perder precisión. El modelo procesa archivos de más de una hora de duración sin requerir pasos intermedios, un avance relevante dentro de la categoría de Inteligencia Artificial enfocado en voz.

En el apartado de rendimiento técnico, la herramienta registra una tasa de error de palabras del 3,1% en inglés. Con este número supera la precisión ofrecida por sistemas como GPT Live Transcribe o Gemini Transcribe Live. Asimismo, su margen de error al clasificar a diferentes hablantes es del 17,5%, la cifra más baja registrada entre los modelos actuales de la industria.

Arquitectura técnica de Muse Voice Transcribe

Para lograr la transcripción instantánea, la arquitectura procesa el audio en fragmentos de 80 milisegundos, lo que equivale a 12,5 segmentos por segundo. Cada bloque se convierte en un token analizado de forma autorregresiva. La tecnología evalúa si debe emitir una palabra de inmediato o si requiere esperar el siguiente bloque para obtener más contexto, aplicando un aprendizaje por refuerzo que equilibra precisión y latencia.

Un token específico indica al modelo cuándo finaliza la entrada de audio, cerrando la emisión de texto pendiente. Meta confirmó que la herramienta ya está disponible a través de su API por un costo de 3 dólares por cada 1.000 minutos de audio procesado. Aunque la empresa no liberará los pesos abiertos del proyecto, los usuarios pueden utilizarlo en macOS mediante la app de Meta AI y en Muse Code.

Comunidad Arepa

Únete a nuestros canales principales

Comentarios

Relacionados

Ver más