A. Smyntyna / Code
ENRU

контекстное окно

context window

Максимум токенов, который модель держит одновременно: системный промпт, разговор, прочитанные файлы и всё, что она уже сказала. Фронтирные модели в 2026 году заявляют от 200 тысяч до 1 миллиона токенов. Когда окно заполняется, что-то приходится выбросить или пересказать, и о выброшенном модель не помнит ничего.

Окно — это не свободная память. Каждый токен в нём лежит в KV-кеше, который сидит в оперативке рядом с весами и растёт вместе с разговором. Большое окно — это расход памяти, который вы платите на своей машине, и расход токенов, который вы платите за каждый запрос в облаке.

Заполнить его — тоже не цель. Качество ответов проседает заметно раньше заявленного предела, а агентские харнессы, заново отправляющие весь разговор на каждом шаге, платят за всё окно снова на каждом вызове инструмента.

Читать дальше