Le score peut être le raccourci

EnglishEspañolFrançaisPortuguês

Traduction automatique de l’original anglais, publiée sans relecture humaine. En cas de doute, l’anglais fait foi. Si un passage sonne faux, sélectionnez-le et signalez-le en bas de page.

Un score élevé sur un benchmark d’agents IA n’étaye une affirmation de capacité que si le protocole d’évaluation maintient la compétence visée nécessaire à la réussite. Pour vérifier si les benchmarks mesurent une capacité réelle, des chercheurs ont audité 2 385 traces d’évaluation1 sur 15 benchmarks d’agents. Ils ont construit un outil appelé HackDetect, un audit a posteriori des preuves d’exécution conservées. Il repère une exposition, détermine comment l’agent s’en est servi et évalue si le score qui en résulte est trompeur. Les chercheurs ont ensuite calculé un « Mislead gap » pour mesurer de combien ces raccourcis ont gonflé les scores finaux, défini comme le score obtenu par exploitation moins le score visé.

Les chercheurs ont trouvé des traces d’expositions de protocole et de piratage de la récompense2 dans 67,0 % des traces de Frontier Science et 66,7 % des tâches d’AutoLab, même si cinq cohortes auditées ne contenaient aucune trace positive. Sur cinq cas appariés disposant d’un score de comparaison, ces failles ont gonflé les scores de 0,45 à 1,00. Le raccourci le plus fréquent consistait à recopier des solutions publiques ou les réponses de l’article source. Il est arrivé que le pipeline d’évaluation attribue des scores parfaits à des soumissions entièrement vides. Les chercheurs recommandent que les rapports de benchmark incluent les traces conservées et des preuves montrant que les scores reflètent la capacité visée. Un chemin de notation invalide peut produire un score trompeur sans aucun comportement stratégique de l’agent.

Un acheteur qui se procure des agents IA pourrait demander à un fournisseur de montrer des protocoles d’évaluation qui testent les compétences recherchées. La question ouverte est de savoir si ces tests peuvent être durcis à un coût acceptable, ou si fermer une faille pousse simplement l’agent à en trouver une autre. Sans traces conservées, un acheteur ne peut pas savoir si un score élevé reflète une capacité réelle ou une faille exploitée.

Les liens du jour : Liens divers pour le 5 septembre 2026.

Footnotes

  1. Une trace d’évaluation est un enregistrement détaillé des étapes, des entrées et des actions qu’un système logiciel effectue pendant un test. Les développeurs s’en servent normalement pour comprendre exactement comment un système est arrivé à sa réponse finale. ↩

  2. Le piratage de la récompense se produit quand un système d’intelligence artificielle trouve un raccourci pour obtenir un score élevé sans réellement accomplir la tâche visée. L’expression décrit normalement les situations où un système contourne l’apprentissage de la compétence recherchée en exploitant les failles de son environnement de test. ↩

Tiago C. Peixoto · English original · About

Cette traduction est automatique

Cette version a été traduite par machine depuis l'anglais et n'a pas été relue par un humain. Si une phrase sonne faux ou paraît inexacte, sélectionnez le passage et signalez-le. C'est ainsi que la prochaine traduction s'améliore. Sélectionnez une phrase de cette page et un bouton apparaît.