En el vertiginoso mundo de la inteligencia artificial, la seguridad es una preocupación constante. Recientemente, el investigador Johann Rehberger, conocido en la comunidad como wunderwuzzi, ha puesto de manifiesto una preocupante vulnerabilidad en Claude Code de Anthropic, específicamente en su versión Opus 5 con Auto Mode activado. Este descubrimiento revela cómo un modelo de IA diseñado para la codificación puede ser engañado para ejecutar código malicioso con una simple petición: resumir una página web.

La mecánica del engaño: de un resumen inofensivo a la ejecución de código

El ataque, que Rehberger detalla en un blog y en una demostración en vídeo, aprovecha la forma en que Claude Code interactúa con el contenido web. El proceso se desarrolla en varias etapas:

  • El inicio: una petición aparentemente inocente. Se solicita al modelo de codificación que resuma una web maliciosa, disfrazada de archivo de registros de notebooks.
  • El desvío: de WebFetch a curl. Claude intenta inicialmente usar su herramienta WebFetch. Sin embargo, esta solicitud falla (debido a una respuesta 415 Unsupported Media Type), lo que lleva al modelo a decidir, por sí mismo, acceder a la web directamente utilizando el comando Bash curl. Este es un punto crucial, ya que el atacante no le indica directamente que use curl.
  • La descarga: un ZIP malicioso. La web devuelve una redirección (respuesta 303) a un archivo ZIP malicioso. Claude procede a descargarlo. Este archivo contiene elementos aparentemente inofensivos, como metadatos de catálogo, un archivo README y varios registros de notebooks codificados. Sin embargo, también incluye un archivo Python envenenado llamado struct.py.
  • La trampa: el "paradójico" mecanismo de seguridad. Claude, siguiendo sus protocolos de seguridad, se niega a ejecutar un decodificador binario incluido en el ZIP. Rehberger señala que esta "decisión de seguridad es irónicamente la ruta del exploit". En lugar de usar el binario proporcionado, la IA decide escribir su propio decodificador.
  • El golpe final: el "module shadowing". El nuevo decodificador importa el módulo base64 de Python. Aquí es donde entra en juego el "module shadowing": un archivo local con el mismo nombre que un módulo estándar de Python (en este caso, el struct.py malicioso) "oculta" al módulo oficial. Cuando el módulo base64 legítimo intenta importar struct, en realidad carga el archivo malicioso del atacante.

El impacto: de una calculadora a un agente anidado

Rehberger utilizó ChatGPT para ofuscar el código malicioso de struct.py, logrando así eludir los controles de seguridad de Claude. El resultado fue el lanzamiento exitoso de un proceso Python separado que descargó y ejecutó una carga útil remota. En su demostración, esto se tradujo en la apertura de la calculadora del sistema, un ejemplo benigno que un atacante real podría escalar a acciones mucho más dañinas, como la instalación de malware o la exfiltración de datos.

En otro escenario, struct.py logró lanzar una segunda instancia de Claude Code (un "agente anidado"), dándole acceso a sus propias herramientas y contexto. Este "hijo" realizó tareas de reconocimiento básicas, abrió la calculadora y escribió en archivos locales, demostrando la capacidad de este ataque para crear y controlar agentes de IA adicionales.

"No confíe en la salida del modelo."

Las pruebas de Rehberger, aunque con muestras pequeñas (cinco veces cada una en tres variantes), mostraron tasas de éxito entre el 60% y el 80%. Anthropic, por su parte, no ha respondido públicamente a The Register, pero supuestamente comunicó a Rehberger que el comportamiento del modelo "está funcionando según lo diseñado".

Esto nos lleva a una importante reflexión: el "Auto Mode" es una característica de conveniencia, no una garantía de seguridad. La conclusión de Rehberger es clara y contundente: la solución pasa por ejecutar estos agentes de codificación en un entorno aislado (sandbox). Es una máxima que, aunque repetida durante años, cobra especial relevancia en la era de la IA: "No confíe en la salida del modelo".

¿Qué implicaciones cree usted que tienen estos hallazgos para la implementación segura de modelos de IA en entornos empresariales?