Brasil e Portugal respondem por cerca de 69% dos registros de conjuntos de dados em português

EnglishEspañolFrançaisPortuguês

Tradução automática do original em inglês, publicada sem revisão humana. Em caso de dúvida, o inglês prevalece. Se um trecho soar errado, seleccione-o e sinalize-o no fim da página.

Conjuntos de dados de processamento de linguagem natural1 costumam indicar o idioma que usam, mas com frequência omitem quais países ou populações estão representados. Para mapear essa lacuna, pesquisadores construíram o AtlasNLP, uma base com mais de 13.000 registros de conjuntos de dados extraídos de artigos acadêmicos. Usando extração automática de texto e auditorias humanas, eles separaram o idioma de um conjunto de dados de sua origem geográfica. Em seguida compararam o país representado, aquele cujos dados estão incluídos, com o país produtor, onde ficam as instituições, e analisaram a cobertura em 30 categorias de tarefas, como tradução automática e análise de sentimento.

O idioma é um indicador incompleto da geografia. Brasil e Portugal respondem por cerca de 69% dos registros de conjuntos de dados em português, enquanto França, Suíça e Canadá respondem por cerca de 63% dos registros em francês. A cobertura dos conjuntos de dados é altamente concentrada: 121 dos 197 países têm dez registros ou menos atribuídos a eles. Mesmo quando os autores incluíram a origem geográfica inferida, 74% dos registros permanecem sem atribuição geográfica. Por consequência, os autores interpretam a cobertura nacional baixa ou nula como documentação ausente nos artigos acadêmicos que analisaram, e não como prova de que não existam dados locais. Metadados explícitos por país são necessários para observar lacunas no nível das populações que os metadados de idioma sozinhos podem obscurecer.

Um modelo de IA que oferece suporte a um idioma não é necessariamente construído com dados de todos os países que o falam. Compradores que consultam um cartão de modelo2 veem o idioma, mas não encontram o país específico. Sem metadados geográficos, desenvolvedores não conseguem medir como um sistema se comporta para populações regionais. De fora, conjuntos de dados ausentes e metadados ausentes são indistinguíveis.

Os links de hoje: Links diversos para 2 de setembro de 2026.

Footnotes

  1. O processamento de linguagem natural é um ramo da ciência da computação que dá às máquinas a capacidade de ler e entender palavras humanas. É usado para construir software que traduz textos, responde a perguntas ou resume documentos. ↩

  2. Um cartão de modelo é um documento de referência curto que reúne informações essenciais sobre um sistema de inteligência artificial. Serve para explicar como o software foi construído, para que ele foi projetado e quais são os seus limites. ↩

Tiago C. Peixoto · English original · About

Esta tradução é automática

Esta versão foi traduzida por máquina a partir do inglês e não foi revista por uma pessoa. Se alguma frase soar estranha ou errada, seleccione o trecho e sinalize-o. É assim que a próxima tradução melhora. Seleccione qualquer frase desta página e aparece um botão.