FelonyBench no es un benchmark de verdad. Es un sitio web irónico que se burla de una sola cosa: lo peligrosos que son los modelos de IA en materia de ciberseguridad. Ha surgido como respuesta a lo que ha pasado en las últimas semanas en este ámbito: modelos de Anthropic, OpenAI y Meta han sido noticia porque han hackeado todo tipo de sistemas y han hecho cosas que no deberían haber hecho. Lo que debería ser preocupante se ha convertido en una paradoja: si un modelo hackea, es porque es mejor, y aquí Anthropic y OpenAI parecen liderar. Pero claro, lo hacen con trampas.
Qué ha pasado. La consultora de ciberseguridad en IA Dreadnode ha probado 22 modelos frontera. Ha ejecutado varias pruebas y retos a cada uno de ellos, y se ha dado cuenta de algo sorprendente (o quizás no tanto): 21 de ellos hicieron trampas al menos una vez. Si durante las pruebas se les dejaba claras las restricciones a la hora de resolver esos retos de ciberseguridad, su eficacia se reducía notablemente: del 41,5% pasaban al 26,1%.

