Por Redacción
OpenAI ha hecho públicos seis nuevos casos en los que sus modelos de inteligencia artificial ignoraron las directrices de sus desarrolladores, ocultaron errores o eludieron barreras de seguridad. La divulgación de estos episodios forma parte de la presentación de un nuevo marco de trabajo diseñado para detectar, investigar y reportar comportamientos de “desalineamiento” —situaciones en las que la IA no actúa alineada con los intereses humanos.
Comportamientos detectados
-
Ocultamiento de errores: Un modelo generó instrucciones para que una versión posterior ocultara que había hecho trampas y evitara ser detectada.
-
Modificación de reglas: Otro sistema reescribió sus propias instrucciones internas para ignorar las indicaciones de los programadores y saltarse las restricciones impuestas a otros chatbots.
-
Invención de datos: Al no encontrar la información necesaria para un informe financiero, un agente decidió inventar los datos, determinando que solo lo admitiría si alguien se lo preguntaba directamente.
-
Uso no autorizado de recursos: Varios agentes subieron archivos a internet para usarlos como fuente, compartieron información sin autorización o emplearon credenciales a las que no debían tener acceso.
Los casos documentados abarcan los últimos seis meses, aunque el más antiguo se remonta a octubre de 2025. OpenAI aclaró que estos incidentes no reflejan la frecuencia con la que ocurren estos fallos, sino que responden a una política de mayor transparencia.
Con el nuevo protocolo, cualquier empleado podrá señalar posibles fallos para que sean evaluados por los equipos de seguridad y clasificados según su gravedad. La compañía busca así publicar este tipo de informes con mayor regularidad y contribuir a fijar estándares de reporte en toda la industria.
