DeepSeek ha lanzado DeepSeek-V4.1-Flash, un innovador modelo multimodal de código abierto que representa un avance significativo en la eficiencia de los agentes de inteligencia artificial. Este modelo está diseñado para abordar el desafío del alto consumo de memoria asociado con tareas prolongadas y extensos historiales, un problema crítico en el desarrollo de agentes de IA.
Una arquitectura optimizada para la eficiencia de memoria
El corazón de DeepSeek-V4.1-Flash radica en su capacidad para manejar una ventana de contexto de 1 millón de tokens, combinada con una caché de claves y valores (KV) cuantizada en formato FP4 y la reutilización de atención entre capas. Estas características son fundamentales para reducir drásticamente la presión sobre la memoria HBM (High Bandwidth Memory) y las unidades SSD, elementos cruciales en la infraestructura de IA.
El modelo cuenta con 552.000 millones de parámetros en su backbone y otros 196.000 millones asociados con Engram, un módulo de memoria condicional. Durante el prellenado, DeepSeek-V4.1-Flash activa 8.000 millones de parámetros por token, y 16.000 millones durante la generación. Su huella global de caché KV es de solo 890 bytes por token, lo que representa una reducción aproximada de cuatro veces en comparación con DeepSeek-V4-Flash y unas 437 veces menos que DeepSeek-V1. Esta optimización prioriza una reducción profunda del estado que el sistema debe mantener disponible, lo que se traduce en menores costos operativos.
Innovaciones clave en la arquitectura
- Codificador-decodificador causal: La arquitectura se compone de 40 capas, divididas equitativamente entre un codificador causal y un decodificador. El decodificador deriva sus proyecciones globales del estado oculto final, una técnica inspirada en el enfoque YOCO que reduce casi a la mitad el trabajo inicial de procesamiento.
- Atención dispersa CSA2: DeepSeek-V4.1-Flash emplea Compressed Sparse Attention 2 (CSA2) para gestionar el tamaño de la caché a lo largo del eje de capas. Este mecanismo asigna cada capa a uno de tres modos (Full, Reindex y Reuse), permitiendo un equilibrio entre precisión y eficiencia.
- Hierarchical Sparse Indexer: Este componente del decodificador permite a una capa Full construir un conjunto de candidatos de hasta 16.384 posiciones. Las capas Reindex posteriores puntúan este conjunto acotado, en lugar de revisar el contexto completo, lo que minimiza el trabajo cuando las secuencias son extremadamente largas.
- Atención de ventana deslizante: El modelo mantiene una ventana de 128 tokens en cada capa. En caso de fallos de caché, el mecanismo Decoder SWA Bounded Replay solo reproduce los últimos 128 tokens del prompt, evitando la necesidad de reprocesar el historial completo.
Cuantización FP4 y optimizaciones adicionales
La caché KV principal se cuantiza con el formato E2M1, acompañado de una escala E4M3 cada 16 canales. Esta técnica, introducida mediante entrenamiento consciente de la cuantización, reduce casi a la mitad el almacenamiento frente a la caché FP8 de V4. Además, el modelo incorpora:
- Almacenamiento temporal optimizado: Los estados de atención de ventana deslizante se mantienen en un grupo distribuido que utiliza el 10% de la DRAM del host, con un tiempo de vida de minutos, mientras que la caché global tiene una vida útil de 72 horas.
- Single-Pass mHC: Optimiza el tráfico de memoria de activaciones fusionando operaciones.
- Engram: Integrado en las capas 1 y 14.
- Decodificado especulativo DSpark: Entrenado después del preentrenamiento con el backbone congelado.
- Optimizador Muon: Utilizado por cabezas.
Rendimiento y resultados
El preentrenamiento de DeepSeek-V4.1-Flash se realizó con 45 billones de tokens multimodales. El equipo de DeepSeek afirma que el modelo base iguala a DeepSeek-V4-Pro-Base en conocimiento general y programación, utilizando un tercio de los parámetros totales y una cuarta parte de los activados.
En diversas pruebas, DeepSeek-V4.1-Flash ha mostrado un rendimiento notable:
En Terminal-Bench 2.1, obtuvo 90,6 puntos, superando a DeepSeek-V4-Flash (82,7), Opus-5 (89,1) y GPT-5.6 Sol (88,8).
En DeepSWE v1.1, alcanzó 74,2 puntos, por encima de su predecesor (54,4) y casi empatado con Opus-5 (74,0).
En Terminal-Bench 4.0, logró 31,2 puntos, un avance significativo sobre DeepSeek-V4-Flash (7,0), aunque por debajo de Opus-5 (51,8) y GPT-5.6 Sol (39,9).
En Automation-Bench, marcó 54,8 puntos, superando a sus rivales (37,7, 50,3 y 45,8).
En conocimiento científico (GPQA Diamond), obtuvo 90,9 puntos, por debajo de Opus-5 (93,4) y GPT-5.6 Sol (94,1), pero por encima de DeepSeek-V4-Flash (89,9).
En Codeforces, alcanzó una calificación de 3.471, frente a 3.289 de la versión anterior.
Estos resultados demuestran un avance importante en la eficiencia y capacidad de los modelos de lenguaje para manejar contextos extensos, abriendo nuevas posibilidades para el desarrollo de agentes de IA más potentes y eficientes.