El sector de la transcripción de audio inteligente acaba de sufrir un terremoto mayúsculo. Meta ha dado un golpe sobre la mesa al presentar Muse Voice Transcribe, un avanzado modelo de percepción en tiempo real desarrollado por su equipo de Superinteligencia que se adelanta a las propuestas de OpenAI en el terreno de la transcripción simultánea y la identificación de múltiples interlocutores.
Precisión quirúrgica: Más de 20 voces y soporte multilingüe fluido
Concebido para solucionar el caos habitual que suponen las grabaciones con multitud de participantes, el nuevo modelo destaca por su capacidad para distinguir a más de 20 hablantes distintos en una misma grabación, detectando pausas y separando las intervenciones con una precisión inaudita.
Entre sus fortalezas técnicas y funcionales destacan:
- Soporte multilingüe masivo: El sistema ha sido entrenado en más de 70 idiomas, con 25 de ellos sometidos a un riguroso proceso de validación previa.
- Fluidez bilingüe: Es capaz de procesar conversaciones donde los usuarios alternan entre diferentes idiomas de forma natural, haciéndolo incluso a mitad de una misma frase sin perder el hilo.
- Banda ancha temporal: Admite grabaciones continuas de más de una hora de duración sin requerir procesamiento adicional.
Innovación arquitectónica: Procesamiento inteligente en fragmentos de 80 milisegundos
A nivel técnico, la gran revolución de Muse Voice Transcribe reside en su arquitectura de procesamiento. El modelo analiza el flujo de audio dividiéndolo en fragmentos de 80 milisegundos (lo que equivale a 12,5 segmentos por segundo), convirtiendo cada uno en un token analizado de manera autorregresiva.
Gracias a un entrenamiento basado en refuerzo que equilibra la precisión de la transcripción y el tiempo de espera, la IA adopta un comportamiento de escucha flexible:
- Las palabras sencillas y directas se transcriben casi al instante.
- Las expresiones ambiguas o complejas retienen la emisión hasta recibir bloques de audio posteriores que aporten el contexto necesario.
Una vez que el audio se detiene, un token específico avisa al modelo de la finalización de la entrada, liberando de forma inmediata cualquier texto pendiente y cerrando la identificación de los hablantes.

Rendimiento superior y disponibilidad
En las pruebas comparativas de rendimiento, Muse Voice Transcribe ha demostrado batir con holgura a competidores directos como GPT Live Transcribe y Gemini Transcribe Live, registrando una tasa de error de palabras del 3,1% en inglés. En lo que respecta a la tarea crítica de identificar correctamente a los distintos interlocutores, el modelo se sitúa como líder indiscutible del mercado al registrar una tasa de error del 17,5%, la más baja entre las alternativas populares.
El servicio ya se encuentra disponible a través de la API oficial con un coste de 3 dólares por cada 1.000 minutos de audio procesado. Aunque Meta ha confirmado que no publicará los pesos abiertos de este modelo, los usuarios pueden acceder a sus bondades directamente a través del dictado de la aplicación de Meta AI para Mac y en Muse Code, con solo pulsar la tecla Fn para empezar a hablar en cualquier aplicación.
Únete a nuestras redes sociales en Instagram, Facebook y en YouTube.
