DeepSeek AI представила DeepSeek-V4.1-Flash, передовую мультимодальную модель, которая решает проблемы, возникающие из-за долгосрочных агентов в обслуживании больших языковых моделей (LLM). Эта модель имеет обширное окно контекста в 1M токенов и глобальный кэш ключ-значение (KV) всего 890 байт на токен, что значительно снижает требования к памяти по сравнению с предыдущими версиями. Архитектура включает 40 слоев, разделенных на 20 слоев причинного кодировщика и 20 слоев декодировщика, что оптимизирует вычисления предварительного заполнения, используя конечное скрытое состояние кодировщика. Модель использует Сжатое Разреженное Внимание 2 (CSA2), что повышает эффективность за счет совместного использования кэшей KV между слоями в различных режимах. Кроме того, кэш KV FP4 квантизирован для повышения эффективности хранения. Развертывание осуществляется легко, открытые веса доступны по лицензии MIT, а публичный API поддерживает различные уровни рассуждений. Процесс обучения использовал обширный набор мультимодальных токенов, достигая впечатляющих результатов на нескольких бенчмарках, опережая такие модели, как Opus-5 и GPT-5.6.
DeepSeek AI Представляет DeepSeek-V4.1-Flash с Контекстом 1M и Продвинутым Кэшированием
DeepSeek AI выпустила свою последнюю модель, DeepSeek-V4.1-Flash, разработанную для оптимизации производительности с контекстом 1M токенов и инновационными стратегиями кэширования.
