En el vertiginoso mundo de la inteligencia artificial, donde la carrera por la inteligencia bruta parece no tener fin, DeepSeek ha decidido tomar un camino diferente con el lanzamiento de su último modelo, el DeepSeek-V4-Flash-0731. Este modelo, que forma parte de la serie DeepSeek-V4, se enfoca en la eficiencia para contextos largos, buscando reducir drásticamente los costes de cálculo y memoria sin sacrificar las capacidades esenciales del modelo.
Eficiencia y Coste-Efectividad: La Nueva Frontera
El DeepSeek-V4-Flash-0731 mantiene la arquitectura y el tamaño de su predecesor, el DeepSeek-V4-Flash-Preview (284.000 millones de parámetros, de los cuales 13.000 millones están activos, y un contexto de un millón de tokens). Sin embargo, incorpora nuevas técnicas de posentrenamiento diseñadas para potenciar sus capacidades agénticas. La estrategia de DeepSeek no es competir en el pico de inteligencia, sino maximizar la densidad de inteligencia por parámetro activo y por dólar invertido.
¿Qué significa esto en términos prácticos? Según Artificial Analysis, el coste medio de una prueba con este modelo es de tan solo 0,03 dólares. Esto representa una reducción de aproximadamente cien veces en comparación con modelos de referencia como Claude Fable 5, cuyo coste asciende a 3,15 dólares por prueba. Esta mejora en la eficiencia económica se logra sin modificar la arquitectura base ni las capacidades fundamentales, sino optimizando el proceso posterior al entrenamiento.
Además, el V4-Flash-0731 es sorprendentemente frugal en el consumo de recursos. Con un millón de tokens de contexto, utiliza solo el 10% de los cálculos (FLOP) por token generado y el 7% de la memoria (caché KV) en comparación con su predecesor, DeepSeek-V3.2. Y lo que es aún más impresionante, ofrece un rendimiento superior al de DeepSeek-V4-Pro por un tercio de su precio.
Rendimiento Agéntico Superior
Aunque el V4-Flash y el V4-Pro pertenecen a la misma familia arquitectónica y emplean los mismos factores de compresión de atención para mejorar la eficacia en contextos largos, difieren en su escala. Flash cuenta con 43 capas, una dimensión de 4.096, 256 expertos y 13.000 millones de parámetros activados, mientras que Pro tiene 61 capas, una dimensión de 7.168, 384 expertos y 49.000 millones de parámetros activados.
A pesar de su menor escala, las pruebas de rendimiento agéntico publicadas por DeepSeek muestran que V4-Flash-0731 supera a V4-Pro-Preview en las nueve evaluaciones presentadas. Por ejemplo, obtiene 82,7 frente a 72,1 en Terminal Bench 2.1, 54,4 frente a 12,8 en DeepSWE, 76,7 frente a 52,7 en CyberGym, y 70,3 frente a 55,9 en Toolathlon-Verified. Esto demuestra que la optimización post-entrenamiento ha logrado reducir la brecha en la ejecución agéntica.
La capacidad de DeepSeek-V4-Flash-0731 para ofrecer un rendimiento superior a un coste significativamente menor lo posiciona como una opción atractiva para desarrolladores y empresas que buscan soluciones de IA eficientes y accesibles.
Licencia Abierta y Desafíos en la Producción
DeepSeek-V4-Flash-0731, al igual que la mayoría de los modelos recientes de DeepSeek, se publica bajo licencia MIT, lo que permite su uso comercial, modificación y redistribución. Esta apertura contrasta con otros modelos como Kimi K3, que exige acuerdos comerciales específicos para empresas con una facturación anual superior a los 20 millones de dólares.
DeepSeek también ha liberado el módulo «draft» junto con las versiones iniciales de V4-Flash y V4-Pro. Este módulo se utiliza para la decodificación especulativa, una técnica que acelera la inferencia al permitir que un modelo pequeño prediga varios tokens a la vez, que luego son verificados por el modelo principal. También ha puesto a disposición el código para entrenar este módulo.
Sin embargo, el cofundador de DeepSeek, Liang Wenfeng, ha señalado un desafío clave: la publicación de los pesos no garantiza que los proveedores externos puedan igualar el coste de inferencia de DeepSeek. Alcanzar el mismo coste por token requiere optimizaciones complejas que pocas empresas tienen la capacidad de implementar.
Wenfeng también destacó la principal diferencia entre China y Estados Unidos en este ámbito: la capacidad de cálculo y las GPU. La escasez de potencia de cálculo limita el tamaño de los modelos y el número de experimentos que se pueden realizar en paralelo, afectando directamente la calidad de los modelos. Su objetivo es adquirir tantas GPU como sea posible, siempre que el precio sea razonable.
A pesar de estos desafíos, el modelo económico de DeepSeek parece sólido. Wenfeng confía en que, incluso sin una disrupción tecnológica adicional, la venta de API podría ser suficiente para que la empresa sea rentable y sostenible como entidad cotizada en bolsa.