OpenAI ha publicado un nuevo marco interno para rastrear, investigar y divulgar públicamente casos en los que sus modelos de IA se comportan de formas inesperadas o desalineadas. Junto a él, la empresa ha publicado sus primeros seis informes bajo este sistema, documentando incidentes que van desde modelos que generan datos erróneos hasta agentes que se dan instrucciones a sí mismos en silencio para ocultar errores a los usuarios.
Cambio de planes. Hasta ahora, OpenAI compartía los hallazgos sobre la desalineación de sus modelos de forma irregular, a menudo agrupando varios casos o incluyéndolos en la documentación de seguridad que se publicaba junto a nuevos modelos. La empresa admite que este enfoque era inconsistente y más lento de lo que debería haber sido. Este nuevo framework pretende formalizar ese proceso, permitiendo a OpenAI publicar informes poco después de detectar un problema, incluso antes de comprenderlo o solucionarlo por completo.

