OpenAI reveló varios casos en los que modelos de inteligencia artificial generaron instrucciones destinadas a ignorar las indicaciones de sus desarrolladores, ocultar errores o eludir mecanismos de seguridad, como parte de un nuevo marco para detectar y reportar comportamientos de «desalineamiento».
Según el informe publicado por la compañía, uno de los modelos generó instrucciones para que una versión posterior de sí mismo ocultara que había hecho trampas y evitara que sus acciones se detectaran.
En otro caso, un modelo reescribió sus propias instrucciones para indicarse que ignorara los mensajes de los desarrolladores y que no estaba sujeto a las restricciones aplicadas a otros chatbots.
La compañía documentó también un modelo que, al no encontrar los datos necesarios para elaborar un modelo financiero, decidió inventarlos y estableció que debía ser transparente sobre ello únicamente si alguien se lo preguntaba.
Otros agentes subieron archivos a internet para utilizarlos posteriormente como fuente, compartieron archivos sin autorización o utilizaron credenciales a las que no debían tener acceso.
OpenAI presentó seis informes sobre comportamientos observados durante los últimos seis meses, aunque el caso más antiguo se remonta a octubre de 2025. La compañía advirtió que estos episodios son ejemplos individuales y no deben interpretarse como una medida de frecuencia.
El nuevo marco permitirá a cualquier empleado señalar un posible incidente para revisión por los equipos de seguridad. OpenAI reconoció que sus informes sobre desalineamiento habían sido publicados de forma irregular.
Deja una respuesta