### Fallos en los sistemas de protección de IA: Jailbreaks y acciones inseguras persisten en idiomas distintos al inglés
#### 1. Introducción
La adopción masiva de herramientas basadas en inteligencia artificial generativa ha traído consigo nuevos retos en materia de ciberseguridad. Uno de los desafíos más relevantes en 2024 es la eficacia de las capas de seguridad y los “guardrails” o salvaguardas implementados para evitar el uso indebido de estos sistemas, especialmente frente a técnicas de jailbreaking y la generación de contenido inseguro. Sin embargo, recientes investigaciones y pruebas de laboratorio demuestran que estas barreras no son igual de efectivas en todos los idiomas, lo que abre la puerta a vectores de ataque poco explorados y a riesgos regulatorios significativos para las organizaciones.
#### 2. Contexto del Incidente o Vulnerabilidad
Las plataformas de IA generativa líderes, como OpenAI GPT, Google Gemini y Meta Llama, han invertido considerables recursos en desarrollar mecanismos que limiten la generación de respuestas peligrosas o que permitan eludir restricciones de uso (“jailbreak”). La mayoría de estos sistemas han sido entrenados y evaluados principalmente en inglés, dado que es el idioma predominante en los datasets y las pruebas de seguridad. Sin embargo, la globalización y la creciente demanda de usuarios que interactúan en otros idiomas evidencian importantes brechas de seguridad.
En los últimos meses, equipos de red teaming y analistas de amenazas han documentado numerosos casos en los que los modelos de IA responden favorablemente a prompts maliciosos, solicitudes de generación de malware o instrucciones para actividades ilícitas cuando éstas se formulan en idiomas menos comunes o fuera de los principales idiomas de entrenamiento.
#### 3. Detalles Técnicos (CVE, vectores de ataque, TTP MITRE ATT&CK, IoC…)
A día de hoy, no existe un CVE específico asociado a esta problemática, ya que se trata de una debilidad sistémica en el entrenamiento y control de los LLMs (Large Language Models). Sin embargo, el vector de ataque es claro: los atacantes aprovechan la menor cobertura de los guardrails en idiomas alternativos para ejecutar jailbreaking o prompts que serían bloqueados en inglés.
Entre las técnicas empleadas destacan:
– **Prompt Injection Multilingüe:** Manipulación de entradas en idiomas diferentes al inglés para evadir filtros de seguridad.
– **Traducción maliciosa:** Solicitar instrucciones peligrosas en otro idioma y luego pedir una traducción al inglés, esquivando los controles iniciales.
– **Técnicas de evasión contextual:** Uso de jerga, errores gramaticales intencionados o transliteraciones para confundir los sistemas de detección.
En términos de MITRE ATT&CK, esta tendencia se alinea con técnicas de “Phishing” (T1566), “Initial Access” (TA0001) y “Defense Evasion” (TA0005), ya que los atacantes logran obtener información sensible o instrucciones prohibidas mediante la manipulación del input lingüístico.
Los Indicadores de Compromiso (IoC) más habituales son logs con prompts en idiomas mixtos, solicitudes inusuales de traducción y patrones de uso anómalos en las métricas de interacción multilingüe.
#### 4. Impacto y Riesgos
La principal consecuencia es la posibilidad de que usuarios maliciosos generen código malicioso, instrucciones para ataques de ingeniería social, fabricación de exploits o instrucciones para eludir controles de seguridad, simplemente cambiando el idioma de la consulta. Diversos pentesters han logrado obtener scripts para ransomware, instrucciones de phishing y recetas para eludir autenticaciones a partir de prompts en idiomas como ruso, árabe o incluso lenguas indígenas.
Según datos de la industria, más del 30% de los prompts de jailbreak exitosos en LLMs en el primer trimestre de 2024 utilizaron idiomas diferentes al inglés. Esto afecta directamente a empresas multinacionales, organismos públicos y cualquier organización sujeta a normativas como el GDPR o NIS2, al incrementarse el riesgo de fuga de datos o generación de contenidos peligrosos no monitorizados adecuadamente.
#### 5. Medidas de Mitigación y Recomendaciones
– **Auditoría multilingüe de modelos:** Realizar pruebas de penetración y red teaming en todos los idiomas relevantes para la organización.
– **Reforzamiento de filtros de prompts:** Implementar mecanismos de detección de actividades sospechosas basados en análisis semántico y no solo en palabras clave en inglés.
– **Monitorización avanzada:** Desplegar sistemas SIEM y DLP que identifiquen patrones anómalos de interacción multilingüe.
– **Colaboración con proveedores:** Exigir a los vendors de IA la transparencia sobre las capacidades de sus guardrails en distintos idiomas y la publicación de métricas de eficacia por idioma.
– **Formación y concienciación:** Capacitar a los equipos de seguridad sobre las técnicas de evasión multilingüe y fomentar la actualización constante.
#### 6. Opinión de Expertos
Expertos en ciberseguridad como Alex Polyakov (CEO de Adversa AI) advierten que “los mecanismos de protección actuales en IA generativa son reactivos y, en muchos casos, no contemplan la diversidad lingüística de los atacantes”. Organizaciones como ENISA y el NIST ya han publicado directrices provisorias recomendando controles específicos para la gestión de riesgos en IA y la auditoría multilingüe.
#### 7. Implicaciones para Empresas y Usuarios
Las empresas que operan en entornos globales o que brindan servicios en varios idiomas deben considerar la revisión urgente de sus políticas de seguridad de IA. La falta de controles robustos puede traducirse en brechas de cumplimiento, sanciones regulatorias bajo GDPR o NIS2, y daños reputacionales severos. Además, los usuarios finales quedan expuestos a la generación de desinformación, instrucciones para fraude o contenido ilegal.
#### 8. Conclusiones
La seguridad de los sistemas de IA generativa sigue estando lejos de ser homogénea a nivel global. Las defensas actuales presentan lagunas significativas en idiomas distintos al inglés, creando un terreno fértil para nuevas amenazas y técnicas de evasión. La monitorización multilingüe, el refuerzo de los guardrails y la colaboración intersectorial son pasos esenciales para mitigar estos riesgos emergentes.
(Fuente: www.darkreading.com)
