Le Brésil et le Portugal représentent environ 69 % des enregistrements de jeux de données en portugais
Traduction automatique de l’original anglais, publiée sans relecture humaine. En cas de doute, l’anglais fait foi. Si un passage sonne faux, sélectionnez-le et signalez-le en bas de page.
Les jeux de données de traitement automatique des langues1 indiquent d’ordinaire la langue qu’ils utilisent, mais omettent souvent quels pays ou quelles populations y sont représentés. Pour cartographier cet écart, des chercheurs ont construit AtlasNLP, une base de plus de 13 000 enregistrements de jeux de données extraits d’articles scientifiques. Au moyen d’une extraction automatique de texte et d’audits humains, ils ont séparé la langue d’un jeu de données de son origine géographique. Ils ont ensuite comparé le pays représenté, celui dont les données sont incluses, au pays producteur, celui où se trouvent les institutions, et analysé la couverture sur 30 catégories de tâches telles que la traduction automatique et l’analyse de sentiment.
La langue est un indicateur incomplet de la géographie. Le Brésil et le Portugal représentent environ 69 % des enregistrements de jeux de données en portugais, tandis que la France, la Suisse et le Canada représentent environ 63 % des enregistrements en français. La couverture des jeux de données est très concentrée : 121 pays sur 197 n’ont pas plus de dix enregistrements qui leur soient attribués. Même lorsque les auteurs ont inclus l’origine géographique inférée, 74 % des enregistrements demeurent géographiquement non attribués. En conséquence, les auteurs interprètent une couverture nationale faible ou nulle comme une documentation manquante dans les articles scientifiques qu’ils ont analysés, et non comme la preuve qu’aucune donnée locale n’existe. Des métadonnées explicites par pays sont nécessaires pour observer des écarts au niveau des populations que les seules métadonnées de langue peuvent masquer.
Un modèle d’IA qui prend en charge une langue n’est pas nécessairement construit sur des données provenant de chaque pays qui la parle. Les acheteurs qui consultent une fiche de modèle2 voient la langue mais ne trouvent pas le pays précis. Sans métadonnées géographiques, les développeurs ne peuvent pas mesurer comment un système se comporte pour des populations régionales. Vu de l’extérieur, des jeux de données manquants et des métadonnées manquantes sont indiscernables.
Les liens du jour : Liens divers pour le 2 septembre 2026.
Footnotes
-
Le traitement automatique des langues est une branche de l’informatique qui donne aux machines la capacité de lire et de comprendre les mots humains. Il sert à construire des logiciels qui traduisent des textes, répondent à des questions ou résument des documents. ↩
-
Une fiche de modèle est un court document de référence qui donne les informations essentielles sur un système d’intelligence artificielle. Elle sert à expliquer comment le logiciel a été construit, à quoi il est destiné et quelles sont ses limites. ↩
Tiago C. Peixoto · English original · About