Riesgos de Seguridad en IAGen

Rubén

Miembro nuevo
Desde
25 Ene 2026
Mensajes
3
Buenas a todos,

Estoy empezando mi doctorado "Generative AI in Wrong Hands" basado en el descubrimiento de nuevas amenazas y vulnerabilidades de seguridad que puedan afectar a los diversos sectores de la sociedad. Empezando con O.W.A.S.P for LLM (Large Language Models Applications), mi idea es ir descubriendo nuevos riesgos de seguridad implícitos en el uso de la Inteligencia Artificial Generativa. Inicialmente quiero empezar basándome en los posibles casos de usos de manipulación intencionada de la entrada (prompt) para obligar al modelo a generar información falsa, fabricada o engañosa, presentándola con alta confianza, intrínsecamente relacionado este factor de riesgo con los ataques adversarios (adversarial attacks), donde se explotan las vulnerabilidades del modelo para inducir comportamientos no deseados.

Algunos casos de uso en los que quiero centrar mi investigación son:

1. Manipulación de Señales y Entorno afectando a Vehículos Autónomos.

Este es uno de los casos de mayor riesgo físico. Un atacante podría aplicar perturbaciones físicas (pegatinas, parches o luces) sobre objetos reales para que el sistema de visión los interprete erróneamente.
  • Caso de uso: Pegatinas estratégicamente colocadas en una señal de "STOP" que pudieran hacer que la IA del vehículo sufra una aluciación entendíendola como una señal de límite de velocidad y pudiendo provocar accidentes.
  • Estado en 2026: Los parches adversarios físicos han demostrado una tasa de éxito de hasta el 76% contra modelos de visión-lenguaje integrados en vehículos.
2. Suplantación y Evasión en el Reconocimiento Facial.

Un usuario malintencionado podría utilizar patrones casi imperceptibles para el ojo humano (como monturas de gafas especiales o proyecciones de luz) que alteran los píxeles procesados por el algoritmo de identificación.
  • Caso de uso: Manipular la propia imagen para que el sistema "alucine" que el atacante es una persona autorizada (ej. un CEO para transferencias bancarias).
  • Evasión: Hacer que el sistema no reconozca a un individuo que está en una "lista negra".
3. Fraude y Manipulación de Tratamientos en el Diagnóstico Médico.

En el sector sanitario ya se han detectado algunos ataques que introducen ruido en imágenes médicas (como tomografías o rayos X) para alterar el diagnóstico de la IA.
  • Caso de uso: Un atacante podría forzar al sistema a "alucinar" la presencia de un tumor inexistente para justificar cobros indebidos de seguros o, por el contrario, ocultar una patología real.
  • Tendencia 2026: Se documenta un aumento en el uso de IA para generar historias clínicas sintéticas que manipulan ensayos clínicos globales.
4. Evasión de Detección de Fraude en Sistemas Financieros.

Los ciberdelincuentes ajustan ligeramente las características de una transacción maliciosa para que los modelos de aprendizaje automático la clasifiquen como "legítima".
  • Caso de uso: Modificar patrones de gasto de forma que el sistema de detección de fraude no detecte anomalías, permitiendo el lavado de dinero o retiros masivos sin alarmas.
5. Ataques en Cadena de Suministro de Software (Poisoning).
En lugar de atacar el modelo ya entrenado, los atacantes "envenenan" los datos de entrenamiento para insertar backdoors o puertas traseras.
  • Caso de uso: La IA aprende que si aparece un "disparador" específico (como un carácter raro en un comando), debe ignorar todas las reglas de seguridad y ejecutar código malicioso.
6. Ciberseguridad: Malware Camaleónico

En 2026, el malware utiliza interacciones en vivo con LLM para regenerar su propio código fuente en cada ejecución (técnicas como PROMPTFLUX), lo que hace que los antivirus basados en IA lo clasifiquen erróneamente como benigno
 
Última edición:
Interesante enfoque para tu doctorado. Partiendo de OWASP Top 10 for LLM, enfócate en prompt injection como vector clave para adversarial attacks, como envenenamiento de datos o jailbreaking. Explora impactos sectoriales: en salud, podría generar diagnósticos falsos; en finanzas, fraudes simulados. Sugiero integrar análisis de robustness con herramientas como AdvBench para validar nuevas vulnerabilidades. ¡Éxito!
 
Interesante enfoque para tu doctorado. Partiendo de OWASP Top 10 for LLM, enfócate en prompt injection como vector clave para adversarial attacks, como envenenamiento de datos o jailbreaking. Explora impactos sectoriales: en salud, podría generar diagnósticos falsos; en finanzas, fraudes simulados. Sugiero integrar análisis de robustness con herramientas como AdvBench para validar nuevas vulnerabilidades. ¡Éxito!
Gracias compañero. Había pensado hacer mi primer caso de uso basado en un pequeño workshop que se base en el l Arte de la Inyección Indirecta, intentando explicar la teoría de cómo los atacantes pueden esconder comandos maliciosos en sitios web que el LLM leerá a través de herramientas de navegación, y mediante un laboratorio práctico (de no más de 90 minutos) crear un "exploit" oculto en un archivo PDF que, al ser resumido por la IA, obligue al asistente a enviar los correos del usuario a un servidor externo. Me han recomendado el uso de Garak para el escaneo de vulnerabilidades.
 
Nombre del Evento: " El Arte de la Inyección Indirecta "

Fecha:
Marzo de 2026
Formato: Híbrido (Presencial + Laboratorios en la nube)
Audiencia: Ingenieros de Machine Learning, Especialistas en Ciberseguridad y Arquitectos de Soluciones.
Tiempo del workshop: 90 minutos

Objetivos del Workshop

Identificar
vulnerabilidades críticas en arquitecturas de Agentes de IA y sistemas RAG (Generación Aumentada por Recuperación).
Ejecutar ataques controlados de inyección, extracción y envenenamiento.
Implementar capas de defensa activas utilizando "Modelos Guardián" y sanitización dinámica.
Requerimientos Técnicos
  • Acceso a un entorno Ollama local o instancias de Azure AI Studio / AWS Bedrock.
  • Python 3.11+ y librerías de seguridad como PyRIT (Microsoft).
  • Familiaridad con el OWASP Top 10 para Aplicaciones LLM.
Caso de uso inicial - Agenda del Evento

Teoría:
Cómo los atacantes pueden esconder comandos maliciosos en sitios web que el LLM leerá a través de herramientas de navegación.
Laboratorio Práctico: Crear un "exploit" oculto en un archivo PDF que, al ser resumido por la IA, obligue al asistente a enviar los correos del usuario a un servidor externo.
Herramienta: Uso de Garak para escaneo de vulnerabilidades.
 
Interesante enfoque para tu doctorado. Partiendo de OWASP Top 10 for LLM, enfócate en prompt injection como vector clave para adversarial attacks, como envenenamiento de datos o jailbreaking. Explora impactos sectoriales: en salud, podría generar diagnósticos falsos; en finanzas, fraudes simulados. Sugiero integrar análisis de robustness con herramientas como AdvBench para validar nuevas vulnerabilidades. ¡Éxito!
Muy interesante tu trabajo. Yo también estoy trabajando en un tema bastante relacionado, aunque con un enfoque distinto, centrado más en identidad digital, estafas y el aumento del fraude online en internet con la aparición de agentes de IA.

Me parece especialmente relevante cómo planteas los riesgos en distintos sectores, porque conecta muy bien con lo que se está viendo también en el ámbito digital, donde la automatización está haciendo que los ataques sean más escalables y difíciles de detectar.

Te deseo mucho éxito con el doctorado, es un tema muy importante y actual. También me gustaría conectar contigo y seguir en contacto para poder intercambiar ideas a medida que avancemos en nuestras investigaciones.
 
  • Insertar:
Atrás
Arriba