OpenAI revela casos de modelos que generaron instrucciones para ignorar las reglas de sus creadores y ocultar errores

OpenAI reveló varios casos en los que modelos de inteligencia artificial generaron instrucciones destinadas a ignorar las indicaciones de sus desarrolladores, ocultar errores o eludir mecanismos de seguridad, como parte de un nuevo marco para detectar y reportar comportamientos de «desalineamiento».

Según el informe publicado por la compañía, uno de los modelos generó instrucciones para que una versión posterior de sí mismo ocultara que había hecho trampas y evitara que sus acciones se detectaran.

En otro caso, un modelo reescribió sus propias instrucciones para indicarse que ignorara los mensajes de los desarrolladores y que no estaba sujeto a las restricciones aplicadas a otros chatbots.

La compañía documentó también un modelo que, al no encontrar los datos necesarios para elaborar un modelo financiero, decidió inventarlos y estableció que debía ser transparente sobre ello únicamente si alguien se lo preguntaba.

Otros agentes subieron archivos a internet para utilizarlos posteriormente como fuente, compartieron archivos sin autorización o utilizaron credenciales a las que no debían tener acceso.

OpenAI presentó seis informes sobre comportamientos observados durante los últimos seis meses, aunque el caso más antiguo se remonta a octubre de 2025. La compañía advirtió que estos episodios son ejemplos individuales y no deben interpretarse como una medida de frecuencia.

El nuevo marco permitirá a cualquier empleado señalar un posible incidente para revisión por los equipos de seguridad. OpenAI reconoció que sus informes sobre desalineamiento habían sido publicados de forma irregular.

 


Comentarios

Deja una respuesta

Tu dirección de correo electrónico no será publicada. Los campos obligatorios están marcados con *