En una reciente evaluación que puso a prueba las capacidades de agentes de codificación de inteligencia artificial, solo el modelo Codex de OpenAI logró superar los doce desafíos de Solidity diseñados originalmente para desarrolladores humanos. Esta carrera de seguridad, organizada por Austin Griffith de la Ethereum Foundation, reveló no solo la destreza de Codex, sino también el notable rendimiento de DeepSeek V4 Pro, un modelo chino de código abierto que se acercó al éxito con una fracción del costo.
La carrera de seguridad: un desafío para la IA
Austin Griffith, conocido por su trabajo en la incorporación de desarrolladores y herramientas en la Ethereum Foundation, así como por fundar el colectivo de desarrolladores BuidlGuidl, dirigió esta evaluación. Diez agentes de IA se enfrentaron a los mismos doce desafíos de Solidity que se presentaron en las conferencias Devcon de Ethereum. Cada agente operó en una instancia aislada con su propia billetera, y la captura de una 'bandera' solo se validaba cuando la transacción se registraba en la cadena de bloques.
Los desafíos no estaban diseñados para máquinas, lo que, según Griffith, asegura que las respuestas no estuvieran ya en los datos de entrenamiento de los modelos. Este enfoque buscaba una evaluación más auténtica de las capacidades de razonamiento y resolución de problemas de la IA en un entorno de codificación complejo.
Resultados destacados: Codex y DeepSeek V4 Pro
El modelo Codex de OpenAI, que utiliza GPT-5.5, fue el único en completar todos los desafíos, ocupando los tres primeros puestos. Curiosamente, la configuración de razonamiento medio de Codex fue la más rápida, finalizando en 40 minutos y 7 segundos. La configuración de razonamiento extra-alto, aunque también completó la carrera, tardó más (50:26) y consumió casi un tercio más de tokens, sugiriendo que más 'pensamiento' no siempre se traduce en mayor eficiencia.
Sin embargo, el resultado más impactante provino de DeepSeek V4 Pro. Este modelo chino de código abierto capturó once de las doce banderas con un costo computacional de solo 1.45 dólares. En contraste, Claude Opus 4.8 de Anthropic logró diez banderas, pero a un costo de 7.61 dólares, más de cinco veces el precio de DeepSeek V4 Pro por un resultado ligeramente inferior. Otros modelos de código abierto, como GLM 5.3, Kimi K3 y Qwen, se quedaron significativamente atrás, obteniendo seis y dos banderas respectivamente.
Implicaciones y la necesidad de evaluaciones continuas
Griffith enfatiza la importancia de realizar evaluaciones constantes y robustas para comprender verdaderamente las capacidades de los nuevos modelos de IA. Argumenta que cada desarrollador debería tener su propio conjunto de pruebas para evaluar el rendimiento de la IA en tareas específicas.
"Necesitamos buenas evaluaciones. La gente debería estar ejecutando evaluaciones todo el tiempo. Deberías tener tu propio conjunto de pruebas y deberías poder ejecutarlo."
Los organizadores de BuidlGuidl han publicado de forma transparente los prompts del sistema y cualquier intervención humana junto con las clasificaciones, aclarando que esta fue una evaluación de una sola ejecución y no una clasificación universal de modelos. Este enfoque subraya la naturaleza experimental y en evolución de la evaluación de la IA, especialmente en campos tan especializados como la seguridad de contratos inteligentes.
Los resultados de esta carrera de seguridad resaltan la creciente sofisticación de los agentes de codificación de IA y la importancia de la eficiencia de costos, particularmente con modelos de código abierto. A medida que la IA continúa integrándose en el desarrollo de software, la capacidad de evaluar con precisión y de manera rentable el rendimiento de estos modelos será crucial para su adopción y mejora.
La capacidad de modelos como Codex y DeepSeek V4 Pro para abordar desafíos de Solidity que en su día fueron exclusivos de desarrolladores humanos, abre nuevas vías para la automatización y la mejora de la seguridad en el ecosistema blockchain. La eficiencia de DeepSeek V4 Pro, en particular, sugiere un futuro prometedor para las soluciones de IA de código abierto en tareas complejas.