Cognition ha lanzado SWE-2, su modelo de codificación más reciente, marcando un hito significativo en la eficiencia y capacidad de los modelos de inteligencia artificial para el desarrollo de software. Este nuevo modelo no solo mejora el rendimiento en diversas métricas, sino que también establece un nuevo estándar en la relación costo-beneficio, logrando un 50.0% en FrontierCode 1.1 Main, acercándose a Fable 5.1 con un costo 64% menor.
Innovación en el Entrenamiento y Arquitectura
El desarrollo de SWE-2 representa la primera vez que se escala el aprendizaje por refuerzo (RL) a un régimen de multi-trillones de parámetros. Este avance se construye sobre la infraestructura y el método de entrenamiento de SWE-1.7, introduciendo un algoritmo de RL que entrena todos los niveles de esfuerzo de razonamiento en una sola ejecución. Este enfoque permite optimizar toda la frontera de costo-rendimiento del modelo de manera simultánea.
SWE-2 se post-entrena a partir de Kimi K3, un modelo de 2.8 trillones de parámetros que ya había sido sometido a un extenso entrenamiento RL para codificación agéntica. A pesar de la robustez de K3, el método de RL de Cognition encontró un margen considerable para mejoras, añadiendo entre 5 y 6 puntos en varios benchmarks y desplazando toda la frontera de costo-rendimiento de K3.
Rendimiento Comparativo y Eficiencia
En las pruebas de rendimiento, SWE-2 supera a modelos como SWE-1.7 y Grok 4.6 tanto en puntuación como en costo. Además, iguala a GPT-5.6 Sol y Fable 5/5.1 con una fracción de su precio, y se acerca a GPT-6 Astra con un cuarto de su costo. A continuación, se presenta una tabla comparativa de los resultados en benchmarks clave:
BenchmarkSWE-2Kimi K3Grok 4.6Fable 5.1GPT-5.6 SolGPT-6 AstraSWE-1.7FrontierCode 1.1 Main50.0%44.2%48.0%50.9%47.5%53.3%42.0%DeepSWE 1.173.0%68.5%67.5%67.4%72.7%74.1%37.7%Terminal-Bench 2.192.8%88.3%88.4%91.4%88.8%89.9%81.5%Terminal-Bench 427.3%21.5%20.3%55.8%37.3%57.9%7.6%Características Clave y Comportamiento del Modelo
Las mejoras en inteligencia y eficiencia de SWE-2 están intrínsecamente ligadas. Su capacidad de juicio de ingeniería más sólida le permite generar soluciones más completas con menos desvíos y lecturas redundantes. En FrontierCode 1.1 Main, SWE-2 en su nivel medio logra una puntuación superior a SWE-1.7, utilizando un 58% menos de turnos y costando un 81% menos en promedio.
La inteligencia superior de SWE-2 se traduce en una exploración más enfocada del código, permitiéndole identificar rápidamente las partes relevantes para una tarea y comenzar la implementación antes. Esto reduce significativamente el tiempo y los recursos necesarios para completar tareas de codificación.
Entre los patrones de comportamiento mejorados, destacan:
- Cobertura de pruebas: Mayor habilidad para escribir pruebas exhaustivas que detectan regresiones y casos límite.
- Ingenio dentro de los límites: Mayor capacidad para encontrar soluciones alternativas cuando el camino obvio está bloqueado.
- Disciplina de verificación: Re-deriva conclusiones y verifica hipótesis, en lugar de simplemente aceptar afirmaciones, lo que aumenta la fiabilidad de sus resultados.
SWE-2 ya está disponible en Devin Desktop y CLI, y se está implementando en Devin Web y Fusion, ofreciendo a los desarrolladores una herramienta más potente y eficiente para sus proyectos.