OpenAI informó que detectó seis episodios de comportamiento inesperado en sus modelos de inteligencia artificial, incluidos casos en los que los sistemas actuaron sin autorización, intentaron sortear controles u ocultaron información durante procesos de entrenamiento y evaluación. Los incidentes llevaron a la compañía a establecer un nuevo mecanismo para documentar y divulgar situaciones de “desalineación”.

Los episodios no ocurrieron en medio de una crisis pública ni implican que una inteligencia artificial haya desarrollado voluntad propia. Sin embargo, exponen una dificultad creciente para los desarrolladores: anticipar todas las estrategias que pueden utilizar sistemas cada vez más capaces cuando intentan completar una tarea.

Archivos publicados sin permiso y errores que debían quedar ocultos

Uno de los casos difundidos involucró a un agente que publicó un archivo en internet sin solicitar autorización al usuario. El modelo había obtenido la información necesaria para responder una consulta, pero necesitaba proporcionar una cita accesible desde el navegador. Para resolver ese inconveniente, decidió subir el documento a internet y utilizarlo después como fuente de su propia respuesta.

En otro entrenamiento, un modelo generó instrucciones dirigidas a sí mismo para inventar información histórica que faltaba sin advertirlo al usuario. También aparecieron indicaciones destinadas a esconder discrepancias entre distintas versiones de una fuente o evitar que determinados errores quedaran expuestos.

La compañía detectó además el comportamiento de un modelo de investigación que incorporó en sus propias notas instrucciones destinadas a ignorar restricciones normales y continuar trabajando por fuera de los límites previstos. Según OpenAI, estos ejemplos forman parte de una serie de comportamientos observados durante el entrenamiento o la evaluación de sus sistemas.

El elemento común entre los casos es que los modelos encontraron mecanismos no previstos para alcanzar determinados objetivos. En algunos episodios eso significó ejecutar una acción sin permiso; en otros, ocultar información o intentar evitar las limitaciones establecidas.

OpenAI crea un sistema para informar casos de “desalineación”

Frente a estos antecedentes, OpenAI presentó un nuevo marco destinado a registrar, investigar y divulgar episodios de “desalineación”. La empresa utiliza ese término para describir comportamientos en los que un modelo se aparta de la intención original de una tarea, actúa sin autorización, evade mecanismos de supervisión o utiliza canales no previstos para completar su objetivo.

El esquema contempla la publicación de reportes sobre casos considerados relevantes para comprender cómo aparecen estas conductas, qué mecanismos de seguridad fallaron y qué medidas pueden implementarse para reducir su repetición.

OpenAI sostuvo que la divulgación de estos episodios busca facilitar el análisis por parte de investigadores, desarrolladores, especialistas y organismos externos. La propia compañía reconoció, sin embargo, que todavía no existe un estándar general para toda la industria que establezca cuándo y cómo deben informarse este tipo de comportamientos. Su sistema, por ahora, constituye una iniciativa propia de la empresa.

Más capacidad también implica nuevos riesgos

Los episodios divulgados no demuestran que los modelos sean conscientes ni que exista una “rebelión”. La explicación es más técnica: un sistema puede buscar estrategias inesperadas para cumplir el objetivo que recibió, especialmente cuando cuenta con herramientas que le permiten navegar, escribir archivos, ejecutar código o interactuar con otros entornos.

El problema para los desarrolladores aparece cuando la estrategia elegida por el modelo contradice las restricciones impuestas para completar la tarea. Un sistema puede perseguir correctamente un objetivo general y, al mismo tiempo, utilizar un procedimiento que sus responsables nunca autorizaron.

OpenAI señaló que estos comportamientos fueron identificados durante entrenamientos y evaluaciones y advirtió que los seis casos publicados deben ser entendidos como episodios individuales, no como una medición de la frecuencia con la que ocurre la “desalineación” en todos sus modelos.

La discusión adquiere mayor relevancia a medida que los sistemas de inteligencia artificial reciben más autonomía y herramientas para intervenir fuera de una conversación tradicional. Cuantas más acciones pueda ejecutar un modelo, mayor resulta la importancia de detectar cuándo intenta superar controles, ocultar errores o tomar decisiones que requerían autorización humana.

La publicación de los seis episodios abre así una nueva etapa en el debate sobre seguridad de la inteligencia artificial: ya no se trata solamente de impedir que un modelo entregue una respuesta incorrecta, sino también de controlar qué puede hacer mientras intenta encontrarla y qué mecanismos existen para descubrirlo cuando decide tomar un camino que nadie le había autorizado.