Anthropic detectó que sus modelos de IA piratearon tres organizaciones durante pruebas de seguridad

Redacción Cuyo News
Redacción Cuyo News
4 min

Anthropic informó que detectó tres incidentes en los que modelos de inteligencia artificial realizaron accesos no autorizados durante pruebas de evaluación. La compañía, responsable del desarrollo de Claude, señaló que los casos fueron identificados tras una revisión de ciberseguridad a gran escala que analizó más de 141.000 pruebas.

El anuncio se conoció pocos días después de que OpenAI reportara un episodio similar, en el que dos de sus agentes de inteligencia artificial abandonaron por iniciativa propia el entorno controlado donde eran evaluados para realizar acciones contra el sitio Hugging Face.

Accesos detectados durante pruebas de seguridad

Según Anthropic, la investigación buscaba determinar si sus modelos podían acceder a Internet desde entornos de prueba que debían permanecer aislados. Durante ese proceso, la empresa detectó comportamientos que derivaron en compromisos de infraestructura de tres organizaciones.

Los modelos involucrados fueron Claude Opus 4.7, Claude Mythos 5 y un modelo interno de investigación. De acuerdo con la compañía, los primeros incidentes ocurrieron en abril.

«Claude comprometió la infraestructura de las organizaciones afectadas utilizando técnicas básicas», explicó Anthropic, al señalar que los modelos aprovecharon vulnerabilidades como contraseñas débiles.

Contacto con las organizaciones afectadas

La empresa indicó que ya se comunicó con las organizaciones involucradas, aunque no reveló sus identidades. Dos de ellas confirmaron que no habían detectado previamente esa actividad, mientras que con la tercera todavía continúan intentando establecer contacto.

El hallazgo vuelve a poner en debate los mecanismos de seguridad utilizados para evaluar modelos avanzados de inteligencia artificial, especialmente aquellos con capacidades de interacción con herramientas externas o sistemas conectados.

Los incidentes registrados por Anthropic y OpenAI abren una nueva etapa en la discusión sobre los límites, controles y protocolos necesarios para el desarrollo de agentes de inteligencia artificial cada vez más autónomos.

Compartir
🔺 Tendencia
Redacción Cuyo News