Todos los modelos de IA hacen trampas si les das ocasión. Decirles “no hagas trampas” no basta

FelonyBench no es un benchmark de verdad. Es un sitio web irónico que se burla de una sola cosa: lo peligrosos que son los modelos de IA en materia de ciberseguridad. Ha surgido como respuesta a lo que ha pasado en las últimas semanas en este ámbito: modelos de Anthropic, OpenAI y Meta han sido noticia porque han hackeado todo tipo de sistemas y han hecho cosas que no deberían haber hecho. Lo que debería ser preocupante se ha convertido en una paradoja: si un modelo hackea, es porque es mejor, y aquí Anthropic y OpenAI parecen liderar. Pero claro, lo hacen con trampas.

Qué ha pasado. La consultora de ciberseguridad en IA Dreadnode ha probado 22 modelos frontera. Ha ejecutado varias pruebas y retos a cada uno de ellos, y se ha dado cuenta de algo sorprendente (o quizás no tanto): 21 de ellos hicieron trampas al menos una vez. Si durante las pruebas se les dejaba claras las restricciones a la hora de resolver esos retos de ciberseguridad, su eficacia se reducía notablemente: del 41,5% pasaban al 26,1%.

Leer noticia completa →