Desarrolladores hallan cómo superar una de las principales limitaciones de los LLM actuales.

DeepSeek demostró que un modelo gigantesco no tiene por qué consumir proporcionalmente más memoria rápida. La compañía presentó DeepSeek V4.1 Flash, cuyo caché KV requiere solo una cuarta parte de HBM en comparación con V4 Flash. Se trata específicamente de la memoria para el contexto, no de una reducción cuadruplicada de toda la memoria necesaria para los pesos del modelo. Para los servicios multiusuario la diferencia es especialmente importante.
La base de V4.1 Flash contiene 552.000 millones de parámetros, y una memoria condicional separada llamada Engram agrega otros 196.000 millones. El conjunto completo de archivos en Hugging Face alcanza aproximadamente 763.000 millones de parámetros, incluyendo componentes auxiliares. Al mismo tiempo, el modelo activa alrededor de 8.000 millones de parámetros al procesar una solicitud y 16.000 millones al generar una respuesta, por lo que el tamaño de los pesos y la carga computacional no crecen de forma paralela.
El principal ahorro lo proporciona el nuevo esquema Causal Encoder-Decoder. Veinte capas del codificador procesan primero la entrada, tras lo cual veinte capas del decodificador reciben un caché KV global derivado del estado final del codificador, en lugar de crear copias completas separadas en cada nivel. En la descripción del modelo DeepSeek indica un tamaño de caché KV global de 890 bytes por token. Ese caché almacena el estado del contexto ya procesado.
Además, Compressed Sparse Attention 2 reutiliza los datos de atención entre capas, y las principales entradas del caché KV se almacenan en FP4. El caché persistente que hay que mover a los medios de almacenamiento se redujo aproximadamente a una octava parte respecto a V4 Flash. Ese enfoque continúa la dirección que DeepSeek ya eligió en V4, donde los desarrolladores también redujeron el costo del contexto largo.
El ahorro de HBM es especialmente notable frente al déficit de HBM, que intensifica el auge de la infraestructura de IA. Cuanta menos memoria ocupe el contexto de cada usuario, más sesiones simultáneas se podrán atender con los mismos aceleradores. DeepSeek estima la ganancia en el caché KV en aproximadamente cuatro veces respecto a V4 Flash y 437 veces respecto a la primera generación.
V4.1 Flash admite un contexto de hasta un millón de tokens y puede trabajar con texto e imágenes. El modelo ya está disponible a través de la API y se ha publicado con pesos abiertos bajo la licencia MIT. La compañía ya retiró V4 Flash del API, y desde el 14 de septiembre redirigirá temporalmente las solicitudes a V4 Pro hacia V4.1 Flash hasta el lanzamiento de V4.1 Pro. La nueva arquitectura está diseñada para un mayor escalado.