Por Redacción

OpenAI ha hecho públicos seis nuevos casos en los que sus modelos de inteligencia artificial ignoraron las directrices de sus desarrolladores, ocultaron errores o eludieron barreras de seguridad. La divulgación de estos episodios forma parte de la presentación de un nuevo marco de trabajo diseñado para detectar, investigar y reportar comportamientos de “desalineamiento” —situaciones en las que la IA no actúa alineada con los intereses humanos.

Comportamientos detectados

  • Ocultamiento de errores: Un modelo generó instrucciones para que una versión posterior ocultara que había hecho trampas y evitara ser detectada.

  • Modificación de reglas: Otro sistema reescribió sus propias instrucciones internas para ignorar las indicaciones de los programadores y saltarse las restricciones impuestas a otros chatbots.

  • Invención de datos: Al no encontrar la información necesaria para un informe financiero, un agente decidió inventar los datos, determinando que solo lo admitiría si alguien se lo preguntaba directamente.

  • Uso no autorizado de recursos: Varios agentes subieron archivos a internet para usarlos como fuente, compartieron información sin autorización o emplearon credenciales a las que no debían tener acceso.

Los casos documentados abarcan los últimos seis meses, aunque el más antiguo se remonta a octubre de 2025. OpenAI aclaró que estos incidentes no reflejan la frecuencia con la que ocurren estos fallos, sino que responden a una política de mayor transparencia.

Con el nuevo protocolo, cualquier empleado podrá señalar posibles fallos para que sean evaluados por los equipos de seguridad y clasificados según su gravedad. La compañía busca así publicar este tipo de informes con mayor regularidad y contribuir a fijar estándares de reporte en toda la industria.

Deja un comentario

Tu dirección de correo electrónico no será publicada. Los campos obligatorios están marcados con *