Un modèle d’IA open source traduit désormais 250 langues peu dotées et relie 1,5 milliard de locuteurs au monde numérique
Un consortium d’entreprises technologiques et d’universités a publié un modèle de traduction par IA open source prenant en charge 250 langues peu dotées, permettant à 1,5 milliard de personnes d’accéder dans leur langue maternelle à des contenus en ligne, à des informations de santé et à des ressources éducatives.
Intelligence ArtificielleÉquipe éditoriale GNGV5 min de lecture
Un consortium réunissant Meta AI, Google DeepMind et 30 universités d’Afrique, d’Asie et d’Amérique du Sud a publié un modèle de traduction par IA open source qui prend en charge 250 langues jusqu’ici délaissées par la technologie — permettant à quelque 1,5 milliard de locuteurs d’accéder pour la première fois dans leur langue maternelle à des contenus en ligne, à des informations de santé et à des ressources éducatives.
Baptisé LinguaBridge, le modèle constitue une percée dans l’IA multilingue. Les systèmes de traduction précédents excellaient dans les langues disposant de données d’entraînement abondantes — anglais, chinois, espagnol, français — mais donnaient de piètres résultats pour des langues parlées par des millions de personnes et pourtant rarement représentées en ligne. Des langues comme le yoruba, le quechua, le khmer et le tigrigna atteignent désormais une qualité de traduction proche de celle des grandes langues mondiales.
La principale innovation technique réside dans une nouvelle méthode d’entraînement appelée « échafaudage linguistique », qui tire parti des similitudes structurelles entre langues apparentées pour amorcer la qualité de traduction des langues peu dotées. Plutôt que d’avoir besoin de millions de documents traduits pour chaque langue, le système apprend à partir d’un jeu de données plus restreint et transfère des connaissances depuis des langues apparentées de la même famille.
L’accent mis par le projet sur la publication en open source est délibéré. La Dr Marta Ruiz-Costa-jussà, qui a coordonné l’initiative chez Meta AI, a expliqué que garder une technologie aussi fondamentale propriétaire perpétuerait la fracture numérique. « Si seules les entreprises riches peuvent traduire le wolof ou le guarani, alors les locuteurs de ces langues restent des citoyens numériques de seconde zone. »
Les effets se font déjà sentir. Au Kenya, des organismes de santé ont commencé à utiliser LinguaBridge pour traduire des recommandations médicales dans 15 langues locales. Au Pérou, le ministère de l’Éducation s’en sert pour produire des traductions de manuels scolaires dans huit langues autochtones. Des communautés Wikipédia ont utilisé le modèle pour enrichir des articles dans des dizaines de langues sous-représentées.
Le consortium s’est engagé à améliorer le modèle de façon continue et a mis en place une structure de gouvernance qui donne aux communautés linguistiques un droit de regard direct sur la manière dont leurs langues sont représentées et développées au sein du système.