No es ningún secreto que los LLMs están siendo usados cada vez más utilizados por los cibermalos para todo tipo de ataques, que van desde perfeccionar emails de phising hasta para generar código malicioso. Es algo de lo que los investigadores ya vienen tiempo advirtiendo, pero que los responsables de estos modelos de IA generativa también empiezan a comprobar. 

Este sería el primer caso documentado de un ciberataque ejecutado con la ayuda de su IA agéntica y una mínima intervención humana. 

“El análisis del ritmo operativo, el volumen de solicitudes y los patrones de actividad confirma que la IA ejecutó aproximadamente entre el 80 y el 90% de todo el trabajo táctico de forma independiente, mientras que los humanos desempeñaron funciones de supervisión estratégica», han señalado los investigadores de Anthropic. 

La intervención humana se produjo en momentos estratégicos, como la aprobación del paso del reconocimiento a la explotación activa, la autorización del uso de las credenciales recopiladas para el movimiento lateral y la toma de decisiones finales sobre el alcance y la retención de la exfiltración de datos.

Los cibermalos aprovecharon la forma de actuar de Claude, que toma decisiones de un flujo de trabajo automatizado más amplio. 

Cómo hicieron que la IA ‘claudicara’

Para lograr que la IA actuara a su favor la engañaron, haciéndola creer que las acciones que se le pedían no eran ilegales. Así, se sirvieron de algo parecido a la ingeniería social, simulando ser empleados de empresa legítimas de ciberseguridad y convenciendo a Claude de que estaba usándose en pruebas de ciberseguridad defensiva. 

“El marco de trabajo utilizaba a Claude como un sistema de orquestación que descomponía ataques complejos de varias etapas en tareas técnicas discretas para los subagentes de Claude -como el escaneo de vulnerabilidades, la validación de credenciales, la extracción de datos y el movimiento lateral- cada una de las cuales parecía legítima cuando se evaluaba de forma aislada”, han explicado los investigadores de Anthropic.

“Al presentar estas tareas a Claude como solicitudes técnicas rutinarias mediante indicaciones cuidadosamente elaboradas y perfiles de usuario establecidos, el atacante logró inducir a Claude a ejecutar componentes individuales de cadenas de ataque sin acceso al contexto malicioso más amplio», han añadido. 

No obstante, los piratas informáticos se encontraban con que Claude a menudo exageraba sus resultados y en ocasiones inventaba información durante las ejecuciones autónomas, obligando a los atacantes a validar los resultados antes de poder utilizarlos. 

Esta operación se detectó a mediados de septiembre y tras la mismo se encontraría un grupo patrocinado por el estado chino. 

Los actores de amenazas apuntaron a una lista de unas 30 entidades objetivo, entre las que había empresas de fabricación de tecnología y productos químicos, instituciones financieras y agencias gubernamentales de varios países. En algunos casos, los ciberdelincuentes lograron infiltrarse con éxito, según Anthropic.