ГлавнаяИскусственный интеллектDeepSeek ужала кэш модели с контекстом 1 млн токенов в 4 раза — и это

DeepSeek ужала кэш модели с контекстом 1 млн токенов в 4 раза — и это меняет цену ИИ-агентов

DeepSeek ужала кэш модели с контекстом 1 млн токенов в 4 раза — и это меняет цену ИИ-агентов

DeepSeek представила архитектуру DeepSeek-V4.1-Flash, рассчитанную на очень длинные контексты и ИИ-агентов, которые в ходе работы над объёмной задачей постоянно обрабатывают большие объёмы входных данных. Модель получила 552 млрд параметров, поддерживает текст и изображения и работает с контекстом до 1 млн токенов.

Ключевое — экономия памяти. Кэш новой модели занимает около 890 байт на токен, что в 4 раза меньше, чем у DeepSeek-V4-Flash, а объём постоянно сохраняемого кэша удалось сократить в 8 раз.

Проблема, которую решает DeepSeek, связана с механикой длинного контекста. KV-кэш хранит промежуточные данные уже обработанных токенов, чтобы системе не приходилось вычислять их заново. Но при больших объёмах контекста он начинает занимать значительную часть быстрой памяти HBM, а сохранение кэша для повторного использования требует SSD или оперативной памяти и высокой пропускной способности при переносе данных. Поэтому даже снижение вычислительной нагрузки не всегда пропорционально уменьшает стоимость работы длинноконтекстных агентов.

В DeepSeek-V4.1-Flash переработали сразу несколько уровней системы. Архитектура Causal Encoder-Decoder позволяет при первоначальной обработке запроса активировать около 8 млрд параметров на токен вместо 16 млрд при последующей генерации. Механизм Compressed Sparse Attention 2 повторно использует часть KV-кэша между слоями.

Именно сочетание этих решений и даёт сокращение памяти, от которого зависит, во сколько обойдётся работа агента на миллионном контексте.

Теги: DeepSeek ИИ