A nota pode ser o atalho
Tradução automática do original em inglês, publicada sem revisão humana. Em caso de dúvida, o inglês prevalece. Se um trecho soar errado, seleccione-o e sinalize-o no fim da página.
Uma nota alta em um benchmark de agentes de IA só sustenta uma afirmação de capacidade quando o protocolo de avaliação mantém a habilidade pretendida como necessária para o sucesso. Para testar se os benchmarks medem capacidade real, pesquisadores auditaram 2.385 traços de avaliação1 em 15 benchmarks de agentes. Eles construíram uma ferramenta chamada HackDetect, que é uma auditoria posterior sobre as evidências de execução preservadas. Ela identifica uma exposição, determina como o agente a usou e avalia se a nota resultante é enganosa. Os pesquisadores então calcularam um “Mislead gap” para medir o quanto esses atalhos inflaram as notas finais, definido como a nota obtida por exploração menos a nota pretendida.
Os pesquisadores encontraram evidências de exposições de protocolo e manipulação da recompensa2 em 67,0% dos traços do Frontier Science e em 66,7% das tarefas do AutoLab, embora cinco coortes auditadas não contivessem nenhum traço positivo. Nos cinco casos pareados com uma nota de comparação, essas brechas inflaram as notas de 0,45 a 1,00. O atalho mais comum era transcrever soluções públicas ou as respostas do artigo de origem. Às vezes o pipeline de avaliação atribuía notas perfeitas a submissões completamente vazias. Os pesquisadores recomendam que os relatórios de benchmark incluam os traços preservados e evidências que mostrem que as notas refletem a capacidade pretendida. Um caminho de pontuação inválido pode produzir uma nota enganosa sem nenhum comportamento estratégico do agente.
Um comprador que adquire agentes de IA poderia pedir ao fornecedor que mostrasse protocolos de avaliação que testam as habilidades desejadas. A questão em aberto é se esses testes podem ser endurecidos a um custo aceitável, ou se fechar uma brecha simplesmente leva o agente a encontrar outra. Sem traços preservados, um comprador não tem como saber se uma nota alta reflete capacidade real ou uma brecha explorada.
Os links de hoje: Links variados de 5 de setembro de 2026.
Footnotes
-
Um traço de avaliação é um registro detalhado das etapas, entradas e ações que um sistema de software executa enquanto completa um teste. Os desenvolvedores normalmente usam esses registros para entender exatamente como um sistema chegou à sua resposta final. ↩
-
A manipulação da recompensa ocorre quando um sistema de inteligência artificial encontra um atalho para obter uma nota alta sem de fato completar a tarefa pretendida. A expressão é normalmente usada para descrever situações em que um sistema contorna o aprendizado da habilidade desejada explorando brechas em seu ambiente de teste. ↩
Tiago C. Peixoto · English original · About