DeepSeek AI Lance DeepSeek-V4.1-Flash Avec 1M de Contexte et Caching Avancé

DeepSeek AI a lancé son dernier modèle, DeepSeek-V4.1-Flash, conçu pour optimiser les performances avec un contexte de 1M de tokens et des stratégies de mise en cache innovantes.

3 min readTechnologie

DeepSeek AI a dévoilé DeepSeek-V4.1-Flash, un modèle multimodal de pointe qui répond aux défis posés par les agents à long terme dans le service des modèles de langage (LLM). Ce modèle dispose d'une vaste fenêtre de contexte de 1M de tokens et d'une empreinte de cache clé-valeur (KV) globale de seulement 890 octets par token, réduisant considérablement les besoins en mémoire par rapport à ses prédécesseurs. L'architecture comprend une structure de 40 couches, divisée en un encodeur causal de 20 couches et un décodeur de 20 couches, qui optimise les calculs de pré-remplissage en s'appuyant sur l'état caché final de l'encodeur. Le modèle utilise l'Attention Sparse Comprimée 2 (CSA2), qui améliore l'efficacité en permettant aux couches de partager les caches KV dans divers modes. De plus, le cache KV FP4 est quantifié pour une meilleure efficacité de stockage. Le déploiement est simple, avec des poids ouverts disponibles sous une licence MIT et une API publique qui prend en charge divers niveaux de raisonnement. Le processus d'entraînement a utilisé un vaste ensemble de données de tokens multimodaux, atteignant des performances impressionnantes sur plusieurs benchmarks, surpassant des modèles notables comme Opus-5 et GPT-5.6.

Technologie