Нагрузка на контекстное окно
Контекстное окно — вся оперативная память бота. Шесть цифр показывают, сколько реплик клиента она удержит и в какой момент старые сообщения начнут уходить.
Ваши данные
Вопрос клиента и ответ бота вместе. Короткая переписка в чате — около 80 слов, разбор заявки — 250 и больше.
Прайс, регламент, карточка клиента — всё, что подкладывается к разговору постоянно.
Это пары «вопрос — ответ» поверх постоянной подкладки. Дальше самые старые сообщения уходят из окна первыми.
Рабочая настройка: несколько диалогов средней длины помещаются вместе с документами. История клиента доживает до конца сделки, если переписка не тянется месяцами. Заранее описывают, что делать со старыми сообщениями — сжимать в сводку или откладывать в карточку.
- Подкладка в каждом запросе
- 25 300
- Окно занято до первой реплики
- 12,7%
- Запас на ответ
- 30 000
- Свободно под историю
- 144 700
- Один разговор целиком
- 7 700
- Разговоров помещается целиком
- 18,8
Это прикидка порядка величины. Точное число токенов зависит от языка, разметки и устройства подкладки; счётчик провайдера на вашей переписке даст цифру ближе к реальности.
Как устроен расчёт
Окно делится на три части. Постоянная подкладка — инструкция и документы, которые едут с каждым запросом. Запас на ответ — место, куда модель пишет. Остаток и есть память разговора.
Слова переводятся в токены по коэффициенту 2,2 для кириллицы. Ориентир взят из тарификации провайдеров: русское слово дробится мельче английского. Страница считается по 1800 знаков — около 250 слов, примерно 550 токенов.
Свободный остаток делится на вес одной пары реплик. Получается число обменов, которое ложится поверх подкладки. Дальше идёт вытеснение: ранние сообщения уходят из окна, и бот отвечает по тому, что осталось.
Что занимает окно сильнее всего
Документы. Сорок страниц регламента — это порядка 22 000 токенов в каждом запросе, и лежат они там постоянно, независимо от темы разговора. Двести страниц займут половину стандартного окна ещё до первого «здравствуйте».
Инструкция весит меньше, чем кажется. Полторы тысячи слов правил — около 3300 токенов, доли процента от окна. Расписывать правила подробно недорого, а вот держать рядом весь прайс — дорого и по месту, и по счёту за токены.
Длина реплик решает не меньше объёма. Диалог из коротких сообщений по 80 слов живёт вчетверо дольше разбора заявки по 300 слов. Поэтому длину пары «вопрос — ответ» меряют на своей переписке, а не берут по ощущению.
При каких условиях памяти хватает
Разговор укладывается в окно целиком, когда постоянная подкладка занимает меньше четверти. Такой запас держит удар: клиент вернулся через неделю, переписка продолжилась, история осталась на месте.
Второе условие — справочники подаются по запросу. Поиск достаёт две-три нужные страницы вместо всего регламента, и окно освобождается под диалог. Порядок величины: подкладка сжимается в десять раз и сильнее.
Третье — у долгой истории есть сводка. Раз в двадцать-тридцать реплик прошлое сворачивают в компактный конспект: что клиент просил, о чём договорились, какие ограничения. Конспект весит сотни токенов вместо десятков тысяч.
Как понять, что забывание началось
Симптомы узнаваемые. Бот переспрашивает то, что уже прозвучало. Ссылается на договорённости неточно. Меняет тон и формат посреди разговора — это ушла из окна часть инструкции.
Проверяют так: в конец длинной переписки задают вопрос про факт из первых сообщений. Промах означает, что окно переполнено. Замер повторяют на трёх-пяти реальных диалогах разной длины — одного случая мало.
Логи дают цифру точнее любых ощущений. Провайдер возвращает число входных токенов на каждый запрос; график этого числа по ходу разговора показывает, где кривая упирается в потолок окна.
Когда считать не нужно
Разовые задачи без истории. Классификация письма, извлечение полей из счёта, ответ на типовой вопрос — там разговор заканчивается за один обмен, и вытеснять нечего.
Расчёт не нужен и там, где память вынесена наружу: диалог живёт в базе, а в модель едет текущий вопрос с найденными фрагментами. Окно перестаёт быть ограничением, и вопрос переезжает в качество поиска.
Что делать с результатом
Цифра из калькулятора — граница, за которой начинается работа с памятью. Когда целиком не помещается даже один разговор, выбирают между сжатием подкладки и моделью с окном пошире; первое обычно дешевле.
Хороший следующий шаг — посчитать счёт за токены при выбранном объёме окна. Полное окно оплачивается на каждом запросе, поэтому память и деньги регулируются одной ручкой.
Частые вопросы
Что такое контекстное окно простыми словами?
Это объём текста, который модель видит одновременно: инструкция, подложенные документы, вся переписка и её собственный ответ. Измеряется в токенах — кусочках слов. Окно на 200 000 токенов вмещает порядка 90 000 русских слов, это роман среднего размера.
Бот правда забывает начало разговора?
Когда переписка перестаёт помещаться, самые старые сообщения выпадают из окна первыми. Модель отвечает по остатку и делает это уверенно, поэтому потеря заметна не сразу. Калькулятор показывает, на какой примерно реплике наступает этот момент.
Почему русский текст занимает больше места
Кириллица дробится на токены мельче латиницы: ориентир — около 2,2 токена на русское слово против 1,3 на английское. В расчёте взято 2,2. Проверяется за минуту: типовую переписку прогоняют через счётчик токенов провайдера и делят на число слов.
Как страницы документов пересчитаны в токены
Страница считается по классическому объёму в 1800 знаков — это около 250 слов, то есть примерно 550 токенов. Таблицы и распознанные сканы тяжелее: разметка и артефакты распознавания добавляют до трети сверху.
Зачем в расчёте запас на ответ
Ответ модели пишется в то же окно, что и вопрос. Если занять место под завязку, длинный ответ упрётся в потолок и оборвётся на середине. Отсюда доля от окна: 10% на короткие реплики, 15% на обычные, 25% на развёрнутые разборы с цитатами.
Что делать, когда история перестала помещаться
Три рабочих приёма. Справочники убирают из постоянной подкладки в поиск и подкладывают только найденные фрагменты. Старую переписку сжимают в короткую сводку фактов. Устойчивые данные клиента — договор, тариф, ограничения — хранят в карточке и подставляют одной строкой.
Окно в миллион токенов снимает вопрос?
Место снимает, цену и скорость — нет. Каждый запрос оплачивается по всему объёму, который в него положили, и обрабатывается тем дольше, чем окно полнее. Точность на длинной дистанции тоже проседает: нужный факт в середине огромного текста находится хуже, чем в компактной подкладке.
Проверить на вашей задаче?
Посмотрим ваш процесс и назовём цифры по нему, а не по средним значениям.
Смежные инструменты
Обновлено: 18 августа 2026