Meta lanza reconocimiento de voz de codigo abierto para mas de 1.600 idiomas
Meta lanzo Omnilingual ASR, un conjunto de reconocimiento de voz de codigo abierto que cubre mas de 1.600 idiomas, incluidos mas de 500 nunca antes atendidos, bajo una licencia permisiva.
Inteligencia ArtificialEquipo Editorial GNGV5 min lectura
Meta lanzo Omnilingual ASR, un conjunto de modelos de reconocimiento automatico de voz de codigo abierto que transcriben el habla en mas de 1.600 idiomas, incluidos mas de 500 que, segun la empresa, nunca habian sido atendidos por ningun sistema. Los modelos y herramientas se publicaron en noviembre de 2025 y se ofrecieron gratis en un repositorio publico de codigo, reduciendo la barrera para que investigadores y comunidades creen tecnologia de voz para idiomas ignorados por el mercado.
Para comparar, los sistemas mas usados suelen admitir entre 100 y 125 idiomas. El alcance de Omnilingual ASR es mucho mayor, y el equipo lo diseno para ser extensible: mediante una tecnica llamada aprendizaje en contexto sin ejemplos previos, el sistema puede apuntarse a un idioma nuevo usando solo unos pocos pares de audio y texto, sin reentrenar el modelo completo. El conjunto va de modelos compactos para dispositivos de baja potencia a un modelo de 7.000 millones de parametros.
De forma crucial, los idiomas poco atendidos no se extrajeron de la web. Meta reunio grabaciones de comunidades mediante alianzas locales remuneradas, trabajando con organizaciones y hablantes en regiones como partes de Africa y el sur de Asia, y publico un corpus de voz para cientos de idiomas de bajos recursos junto con los modelos.
Persisten advertencias. La precision varia mucho segun el idioma y depende de cuantos datos de calidad existan, asi que el rendimiento en los idiomas mas raros sera menor. El reconocimiento de voz tambien plantea cuestiones de privacidad y consentimiento. Aun asi, abrir herramientas que funcionan en 1.600 idiomas es un paso importante hacia la inclusion digital.