Brasil y Portugal representan cerca del 69% de los registros de conjuntos de datos en portugués
Traducción automática del original en inglés, publicada sin revisión humana. En caso de duda, prevalece el inglés. Si un fragmento suena mal, selecciónelo y márquelo al final de la página.
Los conjuntos de datos de procesamiento del lenguaje natural1 suelen indicar el idioma que utilizan, pero a menudo omiten qué países o poblaciones están representados. Para cartografiar esa brecha, unos investigadores construyeron AtlasNLP, una base con más de 13.000 registros de conjuntos de datos extraídos de artículos académicos. Mediante extracción automática de texto y auditorías humanas, separaron el idioma de un conjunto de datos de su origen geográfico. Después compararon el país representado, aquel cuyos datos están incluidos, con el país productor, donde se encuentran las instituciones, y analizaron la cobertura en 30 categorías de tareas como la traducción automática y el análisis de sentimiento.
El idioma es un indicador incompleto de la geografía. Brasil y Portugal representan cerca del 69% de los registros de conjuntos de datos en portugués, mientras que Francia, Suiza y Canadá representan cerca del 63% de los registros en francés. La cobertura de los conjuntos de datos está muy concentrada: 121 de 197 países tienen diez registros o menos atribuidos. Incluso cuando los autores incluyeron el origen geográfico inferido, el 74% de los registros sigue sin atribución geográfica. En consecuencia, los autores interpretan la cobertura nacional baja o nula como documentación ausente en los artículos académicos que analizaron, y no como prueba de que no existan datos locales. Los metadatos explícitos por país son necesarios para observar brechas a nivel de población que los metadatos de idioma por sí solos pueden ocultar.
Un modelo de IA que admite un idioma no está necesariamente construido con datos de todos los países que lo hablan. Los compradores que consultan una ficha de modelo2 ven el idioma pero no encuentran el país concreto. Sin metadatos geográficos, quienes desarrollan no pueden medir cómo se comporta un sistema para poblaciones regionales. Desde fuera, los conjuntos de datos ausentes y los metadatos ausentes son indistinguibles.
Los enlaces de hoy: Enlaces varios para el 2 de septiembre de 2026.
Footnotes
-
El procesamiento del lenguaje natural es una rama de la informática que da a las máquinas la capacidad de leer y entender palabras humanas. Se usa para construir software que traduce textos, responde preguntas o resume documentos. ↩
-
Una ficha de modelo es un documento de referencia breve que recoge los datos esenciales de un sistema de inteligencia artificial. Sirve para explicar cómo se construyó el software, para qué está pensado y cuáles son sus límites. ↩
Tiago C. Peixoto · English original · About