### Los nuevos modelos de lenguaje generan alarmas falsas y aumentan la carga de trabajo en AppSec
#### Introducción
La irrupción de los grandes modelos de lenguaje (LLM) en el ámbito de la ciberseguridad ha supuesto una revolución en las capacidades de análisis automatizado, especialmente en tareas de escaneo de vulnerabilidades y revisión de código. Sin embargo, recientes investigaciones y experiencias en entornos corporativos revelan una problemática creciente: estos modelos presentan tasas elevadas de falsos positivos y una deficiente interpretación del contexto, lo que está incrementando la carga de trabajo para los equipos de seguridad de aplicaciones (AppSec). Este artículo analiza en profundidad las causas técnicas, el impacto en los flujos de trabajo y las estrategias recomendadas para mitigar estos desafíos en entornos profesionales.
#### Contexto del Incidente o Vulnerabilidad
Desde 2023, los LLM como GPT-4, Claude 3 o Gemini han sido integrados en soluciones de análisis de seguridad para detectar vulnerabilidades en aplicaciones, tanto en desarrollo como en producción. Herramientas de SAST (Static Application Security Testing) y DAST (Dynamic Application Security Testing) han incorporado capacidades de IA generativa para mejorar la detección y priorización de riesgos. Sin embargo, los AppSec profesionales han reportado que los modelos, al carecer de conocimiento del contexto funcional y de negocio, generan listas extensas de hallazgos irrelevantes o inexactos. Este fenómeno no solo afecta a soluciones comerciales, sino también a integraciones personalizadas construidas sobre frameworks como OpenAI API o Hugging Face Transformers.
#### Detalles Técnicos
Los fallos de los LLM en escaneos de seguridad se centran principalmente en dos aspectos técnicos: la falta de contexto y la propensión a generar falsos positivos.
– **Falsos positivos:** Según estudios recientes, la tasa de falsos positivos puede superar el 40% en escaneos automatizados realizados por LLM, frente al 15% de soluciones tradicionales basadas en reglas. Esto se debe a que los modelos tienden a marcar como vulnerables patrones de código o configuraciones que, en el contexto de la aplicación, no representan realmente un riesgo.
– **Contexto limitado:** Los LLM suelen analizar fragmentos de código o configuraciones de manera aislada, sin considerar dependencias, controles compensatorios, o lógica de negocio. Así, pueden señalar como inseguro un endpoint protegido por mecanismos de autenticación implementados en capas superiores, o malinterpretar pseudocódigo y comentarios.
– **Vectores de ataque:** El análisis de TTP basado en MITRE ATT&CK revela que los LLM generan alertas sobre técnicas como “Input Validation” (T1190) o “Exploit Public-Facing Application” (T1190), aunque los controles de mitigación estén correctamente implementados.
– **Indicadores de compromiso (IoC):** Los modelos pueden identificar patrones genéricos de malware o exfiltración, pero fallan al correlacionarlos con la arquitectura real del sistema.
– **Exploits y frameworks:** Herramientas como Metasploit o Burp Suite han comenzado a integrar asistentes LLM, pero estos aún no superan en precisión a los motores de reglas clásicos ni a los análisis manuales de pentesters experimentados.
#### Impacto y Riesgos
El aumento de falsos positivos genera una sobrecarga significativa para los equipos de AppSec:
– **Tiempo de revisión:** El personal debe invertir hasta un 60% más de tiempo filtrando y validando hallazgos irrelevantes, según datos de ISACA.
– **Fatiga de alerta:** El exceso de alarmas reduce la atención sobre las vulnerabilidades críticas reales, incrementando el riesgo de omisión de amenazas.
– **Costes económicos:** El coste medio asociado a la gestión de falsos positivos puede llegar a los 250.000 euros anuales en grandes organizaciones, según estudios de Gartner.
– **Compliance:** La generación de reportes inflados de hallazgos puede afectar negativamente a la gestión de riesgos y a la priorización de inversiones en cumplimiento de normativas como GDPR o NIS2.
#### Medidas de Mitigación y Recomendaciones
Para minimizar el impacto negativo de los LLM en AppSec, los expertos recomiendan:
– **Enriquecimiento de contexto:** Integrar datos de negocio, dependencias y controles existentes en los análisis, mediante APIs o conectores personalizados.
– **Post-procesamiento:** Aplicar filtros automatizados y reglas de correlación para reducir falsos positivos antes de la revisión humana.
– **Feedback continuo:** Alimentar los modelos con feedback específico de los analistas para mejorar la precisión mediante aprendizaje continuo.
– **Entrenamiento especializado:** Desarrollar modelos finos ajustados a cada entorno y lenguaje de programación utilizado en la organización.
– **Validación manual:** Mantener revisiones humanas en los hallazgos críticos antes de su remediación o reporte externo.
#### Opinión de Expertos
Raúl Siles, fundador de DinoSec y referente en pentesting, advierte: “Los LLM son útiles como apoyo, pero no como única fuente de verdad. Sin contexto, generan más ruido que señal”. Por su parte, Marta Barrio, CISO de una entidad financiera, indica: “La integración de IA en seguridad requiere invertir en contextualización y gobernanza, o la fatiga de alertas puede volverse un problema de seguridad en sí mismo”.
#### Implicaciones para Empresas y Usuarios
La tendencia a automatizar la seguridad con IA debe ir acompañada de estrategias sólidas de validación y contextualización. Empresas bajo regulación estricta (financieras, salud, infraestructuras críticas) deben extremar la revisión manual y el registro detallado de decisiones para cumplir con GDPR y NIS2. Los usuarios finales, por su parte, pueden experimentar retrasos en la corrección de vulnerabilidades reales si los equipos de AppSec están saturados con trabajo innecesario.
#### Conclusiones
Los grandes modelos de lenguaje ofrecen un potencial considerable para mejorar la eficiencia en AppSec, pero su uso sin una adecuada contextualización puede traducirse en un incremento de falsos positivos y una sobrecarga operativa significativa. Para las organizaciones, la clave está en combinar la automatización basada en IA con inteligencia humana y procesos adaptados a su realidad tecnológica y de negocio.
(Fuente: www.darkreading.com)
