Buenas a todos,
Estoy empezando mi doctorado "Generative AI in Wrong Hands" basado en el descubrimiento de nuevas amenazas y vulnerabilidades de seguridad que puedan afectar a los diversos sectores de la sociedad. Empezando con O.W.A.S.P for LLM (Large Language Models Applications), mi idea es ir descubriendo nuevos riesgos de seguridad implícitos en el uso de la Inteligencia Artificial Generativa. Inicialmente quiero empezar basándome en los posibles casos de usos de manipulación intencionada de la entrada (prompt) para obligar al modelo a generar información falsa, fabricada o engañosa, presentándola con alta confianza, intrínsecamente relacionado este factor de riesgo con los ataques adversarios (adversarial attacks), donde se explotan las vulnerabilidades del modelo para inducir comportamientos no deseados.
Algunos casos de uso en los que quiero centrar mi investigación son:
1. Manipulación de Señales y Entorno afectando a Vehículos Autónomos.
Este es uno de los casos de mayor riesgo físico. Un atacante podría aplicar perturbaciones físicas (pegatinas, parches o luces) sobre objetos reales para que el sistema de visión los interprete erróneamente.
Un usuario malintencionado podría utilizar patrones casi imperceptibles para el ojo humano (como monturas de gafas especiales o proyecciones de luz) que alteran los píxeles procesados por el algoritmo de identificación.
En el sector sanitario ya se han detectado algunos ataques que introducen ruido en imágenes médicas (como tomografías o rayos X) para alterar el diagnóstico de la IA.
Los ciberdelincuentes ajustan ligeramente las características de una transacción maliciosa para que los modelos de aprendizaje automático la clasifiquen como "legítima".
En lugar de atacar el modelo ya entrenado, los atacantes "envenenan" los datos de entrenamiento para insertar backdoors o puertas traseras.
En 2026, el malware utiliza interacciones en vivo con LLM para regenerar su propio código fuente en cada ejecución (técnicas como PROMPTFLUX), lo que hace que los antivirus basados en IA lo clasifiquen erróneamente como benigno
Estoy empezando mi doctorado "Generative AI in Wrong Hands" basado en el descubrimiento de nuevas amenazas y vulnerabilidades de seguridad que puedan afectar a los diversos sectores de la sociedad. Empezando con O.W.A.S.P for LLM (Large Language Models Applications), mi idea es ir descubriendo nuevos riesgos de seguridad implícitos en el uso de la Inteligencia Artificial Generativa. Inicialmente quiero empezar basándome en los posibles casos de usos de manipulación intencionada de la entrada (prompt) para obligar al modelo a generar información falsa, fabricada o engañosa, presentándola con alta confianza, intrínsecamente relacionado este factor de riesgo con los ataques adversarios (adversarial attacks), donde se explotan las vulnerabilidades del modelo para inducir comportamientos no deseados.
Algunos casos de uso en los que quiero centrar mi investigación son:
1. Manipulación de Señales y Entorno afectando a Vehículos Autónomos.
Este es uno de los casos de mayor riesgo físico. Un atacante podría aplicar perturbaciones físicas (pegatinas, parches o luces) sobre objetos reales para que el sistema de visión los interprete erróneamente.
- Caso de uso: Pegatinas estratégicamente colocadas en una señal de "STOP" que pudieran hacer que la IA del vehículo sufra una aluciación entendíendola como una señal de límite de velocidad y pudiendo provocar accidentes.
- Estado en 2026: Los parches adversarios físicos han demostrado una tasa de éxito de hasta el 76% contra modelos de visión-lenguaje integrados en vehículos.
Un usuario malintencionado podría utilizar patrones casi imperceptibles para el ojo humano (como monturas de gafas especiales o proyecciones de luz) que alteran los píxeles procesados por el algoritmo de identificación.
- Caso de uso: Manipular la propia imagen para que el sistema "alucine" que el atacante es una persona autorizada (ej. un CEO para transferencias bancarias).
- Evasión: Hacer que el sistema no reconozca a un individuo que está en una "lista negra".
En el sector sanitario ya se han detectado algunos ataques que introducen ruido en imágenes médicas (como tomografías o rayos X) para alterar el diagnóstico de la IA.
- Caso de uso: Un atacante podría forzar al sistema a "alucinar" la presencia de un tumor inexistente para justificar cobros indebidos de seguros o, por el contrario, ocultar una patología real.
- Tendencia 2026: Se documenta un aumento en el uso de IA para generar historias clínicas sintéticas que manipulan ensayos clínicos globales.
Los ciberdelincuentes ajustan ligeramente las características de una transacción maliciosa para que los modelos de aprendizaje automático la clasifiquen como "legítima".
- Caso de uso: Modificar patrones de gasto de forma que el sistema de detección de fraude no detecte anomalías, permitiendo el lavado de dinero o retiros masivos sin alarmas.
En lugar de atacar el modelo ya entrenado, los atacantes "envenenan" los datos de entrenamiento para insertar backdoors o puertas traseras.
- Caso de uso: La IA aprende que si aparece un "disparador" específico (como un carácter raro en un comando), debe ignorar todas las reglas de seguridad y ejecutar código malicioso.
En 2026, el malware utiliza interacciones en vivo con LLM para regenerar su propio código fuente en cada ejecución (técnicas como PROMPTFLUX), lo que hace que los antivirus basados en IA lo clasifiquen erróneamente como benigno
Última edición: