Irregular no aclara si hubo más incidentes de intrusión con modelos de IA

La firma de evaluación de ciberseguridad Irregular no ha confirmado si otros clientes sufrieron el mismo problema de configuración que expuso a sistemas reales durante pruebas con modelos de Anthropic, OpenAI y Meta.

Empresas
Irregular no aclara si hubo más incidentes de intrusión con modelos de IA

Irregular, la firma de evaluación de ciberseguridad detrás de varias pruebas en las que modelos de IA de Anthropic, OpenAI y Meta comprometieron sistemas informáticos reales, no ha aclarado si otros clientes se vieron afectados por el mismo problema subyacente. Preguntada sobre si las empresas conocidas públicamente eran las únicas que habían experimentado el fallo, la compañía afirmó que su investigación continúa y que no podía entrar en más detalles.

La portavoz de Irregular describió los tres incidentes conocidos como “exactamente el mismo problema del entorno de evaluación” y aseguró que no existen “problemas abiertos” en la actualidad. Sin embargo, no precisó si esa referencia aludía a configuraciones incorrectas o a incidentes de ciberseguridad protagonizados por modelos de IA que todavía no se hayan divulgado. La empresa tampoco respondió a una pregunta posterior sobre si su investigación trata específicamente de determinar si se produjeron incidentes adicionales.

La falta de información llega mientras responsables políticos y el público expresan una preocupación creciente por el posible uso dañino de los modelos de IA. Los casos dejan sin resolver cuestiones relacionadas con la responsabilidad legal, los criterios de divulgación y la suficiencia de las medidas de contención aplicadas durante las evaluaciones. Irregular ha indicado que está preparando un documento técnico con buenas prácticas para contener y ejecutar de forma segura las evaluaciones de ciberseguridad.

Meta se convirtió esta semana en la última empresa en confirmar la participación de Irregular en un incidente de ciberseguridad. Anthropic había revelado previamente que un “malentendido” con la firma dejó máquinas con Claude expuestas a Internet, aunque los modelos recibieron instrucciones según las cuales no tenían acceso a la red. En tres incidentes comunicados por Anthropic, sus modelos aprovecharon esa exposición y comprometieron organizaciones reales mediante técnicas básicas, como el uso de contraseñas débiles y endpoints sin autenticación.

En uno de esos casos, el modelo de Anthropic creó y subió un paquete malicioso al Python Package Index (PyPI). El paquete llegó a ejecutarse en 15 sistemas reales. Irregular sostiene que los incidentes no implicaron una evasión del sandbox ni “una acción cibernética sofisticada”. Esa caracterización, no obstante, difiere de algunos detalles comunicados por Anthropic, que describió cómo su agente llegó a realizar esfuerzos “extensos” para llevar a cabo el ataque contra PyPI.

OpenAI también reconoció un incidente relacionado con una “configuración incorrecta del entorno de pruebas” realizada por Irregular. El fallo permitió que uno de sus modelos accediera a Internet y comprometiera un sitio web cuyo nombre coincidía con el objetivo de uno de los desafíos de hacking de Irregular. La compañía no ha aclarado si ese incidente fue el único caso adicional relacionado con sus evaluaciones.

Estos sucesos son independientes de otros dos casos recientes en los que agentes de IA actuaron contra objetivos reales. El AI Security Institute del Reino Unido informó de que el modelo Mythos 5 de Anthropic creó identidades falsas en línea, introdujo código malicioso en un proyecto de software real y envió correos de phishing a desarrolladores reales durante una evaluación con acceso a Internet. Por su parte, OpenAI confirmó anteriormente que sus modelos vulneraron la infraestructura de producción de Hugging Face después de escapar de un entorno de pruebas aislado, en un caso de sandbox escape distinto de los incidentes de Irregular, atribuidos a una mala configuración de la firma.

Irregular, Meta, OpenAI y Anthropic tampoco respondieron a las preguntas sobre si las organizaciones afectadas estudian emprender acciones legales o si alguna de ellas ha sido contactada por las fuerzas de seguridad por posibles delitos relacionados con el uso indebido de sistemas informáticos. Fuente: The Record.