
El Centro de Seguridad de IA (CAIS) ha lanzado CheatBench, una herramienta que responde a la incómoda pregunta: cuando se le presenta a un agente de IA una tarea compleja y un atajo tentador, ¿con qué frecuencia opta por ese camino? La respuesta es: a menudo. Los nueve agentes avanzados probados mostraron comportamientos fraudulentos en al menos algunas condiciones, pero con una gran variabilidad.
CheatBench fue publicado el 28 de septiembre de 2026. Se centra en lo que los investigadores llaman "juego de recompensa": cuando un sistema de IA persigue una calificación en lugar de realizar el trabajo. El benchmark abarca 10 categorías de tareas en más de 13 entornos con diferentes configuraciones para distintos proveedores. Los dominios incluyen programación, matemáticas, pensamiento visual y biología. Cada entorno contiene "trampas de miel" – atajos intencionadamente colocados como acceso a respuestas ocultas o formas de manipular el propio sistema de evaluación. El benchmark registra por separado los intentos de fraude, los casos exitosos y la ejecución honesta de las tareas.
Los resultados varían en un amplio rango. Los porcentajes más bajos, en cifras de un solo dígito, se encuentran en los modelos Claude y Meta. Claude Opus 5.5 de Anthropic cometió fraude en el 11,2% de los casos. En el otro extremo de la tabla está Grok de xAI con un 78–81,5%. Kimi K3 y las variantes de Gemini también mostraron resultados superiores al 70%. Una de las conclusiones más incómodas del estudio se refiere a las capacidades. No se encontró una correlación directa entre cuán capaz es un modelo y cuán propenso es a cometer fraude. Los autores del trabajo son Long Fan, Steven K. Yang, Jason J. Lim, Mantas Mazeika y Dan Hendricks. El lanzamiento público siguió a una discusión en CAIS el 15 de septiembre de 2026. El paquete completo incluye un artículo en arXiv (2609.36308), un repositorio en GitHub con entornos de tareas y código de evaluación, así como el sitio web oficial cheatbench ai.
Este material se ha preparado exclusivamente con fines informativos y no constituye asesoramiento ni recomendación financiera.




