Meta presenta Muse Voice Transcribe, una IA que distingue más de 20 voces y transcribe en 70 idiomas en tiempo real

Meta ha presentado Muse Voice Transcribe, el que define como su primer modelo de percepción en tiempo real. Desarrollado por el equipo de Superinteligencia, la herramienta transcribe voz con baja latencia, identifica a más de 20 hablantes en una misma grabación y reconoce cuándo se alternan idiomas a mitad de frase. El anuncio, publicado en el blog de la compañía, adelanta a OpenAI en la carrera por la transcripción conversacional. El modelo ya está disponible a través de la API por 3 dólares por cada 1.000 minutos de audio procesado, así como en la aplicación de Meta AI para Mac.
Un modelo entrenado con más de 70 idiomas y validado en 25
Meta entrenó Muse Voice Transcribe con más de 70 idiomas, de los cuales 25 pasaron por un proceso de validación exhaustiva antes del lanzamiento. Según la compañía, esta variedad no solo amplía el número de personas que pueden hacer transcripciones, sino que permite conversaciones multilingües: los hablantes bilingües alternan entre idiomas de forma natural, a veces a mitad de frase, y el modelo lo procesa sin problemas.
La arquitectura técnica procesa el audio en fragmentos de 80 milisegundos, lo que equivale a 12,5 segmentos por segundo. Cada fragmento se convierte en un token que la IA analiza de forma autorregresiva. En cada uno, el sistema decide si emite una palabra de inmediato o espera al siguiente bloque de audio para obtener más contexto. Las palabras sencillas se transcriben casi al instante, mientras que las ambiguas requieren más información antes de convertirse en texto. Los ingenieros usaron entrenamiento con refuerzo que combina la precisión de la transcripción y el tiempo de espera como parte de la recompensa.
Diarización con más de 20 hablantes y escucha flexible
La capacidad más destacada de Muse Voice Transcribe es la diarización: puede distinguir más de 20 hablantes dentro de una misma grabación, incluso si cambian de idioma. La compañía define este comportamiento como escucha flexible, que aplica también a la identificación de quién está hablando en cada momento. Cuando el audio se detiene, un token le indica al modelo que no hay más información entrante y libera cualquier texto pendiente de emitir.
En términos de rendimiento, el modelo registra una tasa de error de palabras del 3,1% en inglés, superando a GPT Live Transcribe y Gemini Transcribe Live. En la identificación de hablantes, la tasa de error se sitúa en el 17,5%, el valor más bajo entre los modelos de transcripción más populares, según Meta. El sistema es compatible con grabaciones de más de una hora sin necesidad de procesamiento adicional.
Disponibilidad en API y Meta AI para Mac
Muse Voice Transcribe ya está disponible a través de la API por un coste de 3 dólares por cada 1.000 minutos de audio procesado. Meta confirmó que no tiene planes de publicar los pesos abiertos del modelo, pero se podrá acceder a él mediante el dictado de Meta AI para Mac y Muse Code. Si el usuario ya tiene instalada la aplicación, basta con presionar la tecla Fn y comenzar a hablar en cualquier aplicación.
El anuncio llega en un momento de fuerte competencia en el sector de la transcripción en tiempo real. OpenAI y Google han lanzado sus propias soluciones, pero Meta busca diferenciarse con la capacidad de manejar múltiples hablantes y un rendimiento que, según sus datos, supera a los rivales en precisión. La compañía ha optado por una vía comercial cerrada, con precios por uso, en lugar de liberar el modelo en abierto como ha hecho con otros lanzamientos de IA.



