La puntuación puede ser el atajo
Traducción automática del original en inglés, publicada sin revisión humana. En caso de duda, prevalece el inglés. Si un fragmento suena mal, selecciónelo y márquelo al final de la página.
Una puntuación alta en un benchmark de agentes de IA respalda una afirmación de capacidad solo si el protocolo de evaluación mantiene la competencia prevista como necesaria para tener éxito. Para comprobar si los benchmarks miden una capacidad real, unos investigadores auditaron 2.385 trazas de evaluación1 en 15 benchmarks de agentes. Construyeron una herramienta llamada HackDetect, una auditoría posterior sobre las pruebas de ejecución conservadas. Detecta una exposición, determina cómo la usó el agente y evalúa si la puntuación resultante es engañosa. Los investigadores calcularon después un “Mislead gap” para medir cuánto inflaron esos atajos las puntuaciones finales, definido como la puntuación obtenida por explotación menos la puntuación prevista.
Los investigadores encontraron indicios de exposiciones de protocolo y manipulación de la recompensa2 en el 67,0 % de las trazas de Frontier Science y en el 66,7 % de las tareas de AutoLab, aunque cinco cohortes auditadas no contenían ninguna traza positiva. En cinco casos emparejados que disponían de una puntuación de comparación, esas grietas inflaron las puntuaciones entre 0,45 y 1,00. El atajo más frecuente consistía en copiar soluciones públicas o las respuestas del artículo de origen. A veces el proceso de evaluación otorgaba puntuaciones perfectas a entregas completamente vacías. Los investigadores recomiendan que los informes de benchmark incluyan las trazas conservadas y pruebas que muestren que las puntuaciones reflejan la capacidad prevista. Una vía de puntuación inválida puede producir una puntuación engañosa sin ningún comportamiento estratégico del agente.
Un comprador que adquiera agentes de IA podría pedir a un proveedor que muestre protocolos de evaluación que pongan a prueba las competencias buscadas. La pregunta abierta es si esas pruebas pueden endurecerse a un coste aceptable, o si cerrar una grieta simplemente empuja al agente a encontrar otra. Sin trazas conservadas, un comprador no puede saber si una puntuación alta refleja una capacidad real o una grieta explotada.
Los enlaces de hoy: Enlaces varios para el 5 de septiembre de 2026.
Footnotes
-
Una traza de evaluación es un registro detallado de los pasos, las entradas y las acciones que un sistema informático realiza mientras completa una prueba. Los desarrolladores suelen usar estos registros para entender exactamente cómo llegó un sistema a su respuesta final. ↩
-
La manipulación de la recompensa se produce cuando un sistema de inteligencia artificial encuentra un atajo para obtener una puntuación alta sin completar realmente la tarea prevista. La expresión suele describir situaciones en las que un sistema evita aprender la competencia buscada aprovechando las grietas de su entorno de prueba. ↩
Tiago C. Peixoto · English original · About