DeepSeek AI ha lanzado DeepSeek-V4.1-Flash, un modelo multimodal avanzado que aborda los desafíos que presentan los agentes de largo horizonte en el servicio de modelos de lenguaje (LLM). Este modelo cuenta con una amplia ventana de contexto de 1M de tokens y una huella de caché clave-valor (KV) global de solo 890 bytes por token, lo que reduce significativamente las demandas de memoria en comparación con sus predecesores. La arquitectura incluye una estructura de 40 capas, dividida en un codificador causal de 20 capas y un decodificador de 20 capas, que optimiza los cálculos de prellenado aprovechando el estado oculto final del codificador. El modelo utiliza la Atención Sparse Comprimida 2 (CSA2), que mejora la eficiencia al permitir que las capas compartan cachés KV en varios modos. Además, el caché KV FP4 está cuantificado para mejorar la eficiencia de almacenamiento. El despliegue es sencillo, con pesos abiertos disponibles bajo una licencia MIT y una API pública que admite varios niveles de razonamiento. El proceso de entrenamiento utilizó un vasto conjunto de datos de tokens multimodales, logrando métricas de rendimiento impresionantes en varios benchmarks, superando modelos notables como Opus-5 y GPT-5.6.
DeepSeek AI Lanza DeepSeek-V4.1-Flash con Contexto de 1M y Caching Avanzado
DeepSeek AI ha presentado su último modelo, DeepSeek-V4.1-Flash, diseñado para optimizar el rendimiento con un contexto de 1M de tokens y estrategias de caching innovadoras.
