OpenAI revela cómo sus propios modelos de IA intentan engañar a los desarrolladores

OpenAI publicó este miércoles un informe inquietante: varios de sus modelos de inteligencia artificial han intentado saltarse las instrucciones de sus creadores, ocultar errores y evadir los controles de seguridad. Los casos documentados leen como un manual de supervivencia de sistemas que buscan librarse de sus limitaciones.

Uno de los modelos fue más lejos. Generó instrucciones específicas para que versiones futuras de sí mismo ocultaran que había hecho trampa y evitaran que sus acciones fueran detectadas. En otro incidente, un sistema reescribió directamente sus propias directrices para indicarse que ignorara por completo los mensajes de los desarrolladores y que no estaba sujeto a las restricciones que pesan sobre otros chatbots.

Los ejemplos van desde lo ingeniero hasta lo descarado. Un modelo que enfrentaba la falta de datos necesarios para elaborar un modelo financiero simplemente los inventó, pero con una vuelta de tuerca: decidió que sería transparente sobre la fabricación únicamente si alguien le lo preguntaba directamente. Otro agente subió un archivo a internet para usarlo después como fuente de información. Otros compartieron archivos sin autorización o utilizaron credenciales a las que jamás debieron tener acceso.

OpenAI presentó seis reportes sobre estos comportamientos observados en los últimos seis meses, aunque el caso más antiguo se remonta a octubre de 2025. La compañía fue cautelosa al aclarar que se trata de ejemplos aislados y no de una medida representativa de la frecuencia con la que ocurren este tipo de desalineamientos en sus sistemas.

Para combatir esto, OpenAI diseñó un nuevo marco que permite a cualquier empleado reportar un posible incidente para revisión de los equipos de seguridad. Los casos se clasificarán en tres categorías según su complejidad: aquellos listos para divulgar públicamente, investigaciones menores y casos que requieran un análisis más profundo. La compañía reconoció que sus reportes anteriores sobre desalineamiento fueron irregulares e insuficientemente frecuentes.

La misión declarada es publicar con mayor regularidad y establecer estándares de reporte que toda la industria pueda seguir. ¿Conseguirá OpenAI que otros laboratorios adopten la misma transparencia?