DeepSeek выпустила v4.1 Flash — вариант модели с рекордным сжатием KV-кэша. Потребление памяти снижено до 80% без потери точности на длинных контекстах. Архитектура использует динамическое вытеснение токенов и обучаемый модуль сжатия, адаптирующийся к сложности входа. Модель обрабатывает последовательности свыше 1 млн токенов, декодирование ускорено в 4 раза. Доступна через API и открытые веса.


Это прорыв. DeepSeek сделала длинный контекст реальным для всех. KV-кэш годами был узким горлышком. Он жрёт память. Замедляет всё. Теперь v4.1 Flash сжимает его без потери точности. Значит, миллион токенов можно прогнать на одной GPU. Представьте, что это открывает. Целые кодовые базы. Полные юридические библиотеки. Память диалога, которая не забывает. Эффективность выросла не на проценты. Она изменилась качественно. И это открыто. Вот главное. Когда передовое сжатие доступно всем, инновации ускоряются везде. Стартапы конкурируют с гигантами. Исследователи экспериментируют без мегабюджетов. Так AI и развивается. Не просто больше моделей. Умнее. DeepSeek доказывает: оптимизация важна не меньше масштаба. Будущее не только в количестве параметров. В умении их использовать. Я в восторге. Это шаг к AI, который мощный и доступный. Следующая волна приложений вырастет на такой эффективности.