Задержка ответа ассистента
Четыре параметра — и видно, сколько секунд клиент смотрит на индикатор набора. Отдельной строкой считается пауза до первых слов: именно её человек воспринимает как скорость.
Ваши данные
Значение варианта — скорость выдачи в токенах в секунду.
Инструкция, история диалога и найденные фрагменты базы вместе.
Абзац — примерно 120 токенов, короткая справка с пунктами — 300–400.
Уточнение запроса, поиск, формулировка, проверка — каждый шаг считается отдельным вызовом.
Считается спокойная нагрузка на стороне провайдера. Время на разбор голоса и синтез речи в телефонии добавляется сверху.
Для переписки по почте и разбора заявок это норма. В живом чате такое ожидание удерживают явным статусом «ищу в базе», а голосовой сценарий на этих цифрах собирают с ответом-обещанием перезвонить.
- До первых слов на экране
- 4,5
- Чтение промпта
- 3,3
- Генерация ответа
- 6,7
- Один вызов модели
- 11,2
- Занято от окна телефонии
- 74,7%
Расчёт даёт порядок величины на спокойной нагрузке. Реальные секунды зависят от провайдера, региона и часа суток, поэтому итог проверяют замером на рабочем контуре.
Как устроен расчёт
Ответ собирается в четыре такта, и каждый добавляет секунды.
Первый такт — чтение. Модель принимает инструкцию, историю диалога и найденные фрагменты базы. Читает она заметно быстрее, чем пишет. В расчёте скорость чтения получена умножением скорости выдачи на сорок, поэтому даже большой промпт стоит единиц секунд.
Второй такт — генерация. Токены выходят по одному, и время растёт линейно длине ответа. Триста токенов на средней модели занимают около семи секунд. Это самая крупная статья почти в любой конфигурации.
Третий такт — обращения наружу. Поиск по векторной базе, запрос в CRM, проверка остатков на складе. В поле выбора зашиты три типовых значения: от десятых долей секунды до двух с небольшим.
Четвёртый такт — сеть и очередь. Фиксированные 0,4 секунды на каждый вызов. Столько уходит на дорогу до провайдера и ожидание свободного слота под нагрузкой.
Сумма четырёх тактов умножается на число вызовов. Цепочка «уточнить вопрос → найти → сформулировать» — это три вызова, а не один.
Что весит больше остального
Длина ответа. Каждая сотня лишних токенов на средней модели стоит примерно две секунды, и никакая оптимизация промпта этого не компенсирует. Короткий формат ответа — самый дешёвый способ ускорения.
Число вызовов. Множитель работает на весь такт целиком, вместе с сетью и поиском. Два шага вместо трёх снимают треть ожидания, даже если модель осталась прежней.
Класс модели. Разница между компактной и крупной рассуждающей — примерно в пять раз по скорости выдачи. Крупную модель ставят туда, где ошибка дороже секунд: расчёт условий, юридические формулировки, спорные случаи. На типовых вопросах её держат в резерве.
Длина промпта влияет слабее всего. Пять тысяч лишних токенов контекста добавляют около трёх секунд. Контекст режут ради стоимости и точности выдачи, а секунды находят в других местах.
Две границы терпения
В чате граница мягкая. При потоковой выдаче ожидание заканчивается на первых словах, поэтому важна не полная длительность, а пауза до начала. Полторы-две секунды до первого слова читаются как быстрый ответ, даже если текст пишется ещё десять секунд.
В телефонии граница жёсткая. Тишина дольше полутора секунд воспринимается как обрыв, а шлюз рвёт сессию примерно через тридцать. Между этими порогами помещается короткая реплика-заполнитель: она начинает звучать сразу, пока модель считает основной ответ. В разбивке видно, какую долю тридцатисекундного окна занимает выбранная конфигурация.
Для почты и заявок обе границы не действуют. Там ответ ждут минутами, и модель выбирают по качеству разбора.
Как проверить цифру на своём контуре
Расчёт даёт ориентир, замер даёт факт. Методика простая. Один и тот же запрос прогоняют двадцать раз в рабочие часы, а не ночью, и берут медиану — лучший результат из двадцати обманчив. Отдельно записывают время до первого токена и время до конца ответа. Разница между ними и есть генерация.
Замер повторяют на двух длинах промпта: короткой и полной. Разница времени, делённая на разницу токенов, даёт скорость чтения для конкретного провайдера. Полученные числа подставляют вместо коэффициентов расчёта.
Пиковый час считают отдельно. Очередь у провайдера в час нагрузки добавляет к каждому вызову от долей секунды до нескольких секунд, и на цепочке из трёх шагов это заметно.
Когда хватает одного замера
Если ассистент уже работает и жалоб на скорость нет, расчёт нужен только перед изменениями. Смена модели, добавление шага проверки, расширение базы знаний — каждое такое решение сдвигает секунды, и полезно увидеть сдвиг заранее.
Для нового сценария порядок обратный. Сначала выбирают допустимую задержку по каналу, потом подбирают под неё длину ответа и число вызовов. Так проектировать дешевле, чем ускорять готовое.
Укладываются в терпение клиента при трёх условиях: ответ короткий, шагов немного, поток включён. Совпадения этих трёх хватает, чтобы держаться в живом чате даже на крупной модели.
Частые вопросы
Почему пауза до первых слов важнее общего времени
Человек оценивает скорость по началу ответа, а не по его концу. При потоковой выдаче текст появляется по мере генерации, и ожидание заканчивается на первых словах. Поэтому в разбивке отдельной строкой стоит сумма чтения промпта, поиска и сети — она и есть воспринимаемая задержка.
Откуда взялась скорость чтения в сорок раз выше скорости выдачи
Промпт обрабатывается пачкой, а ответ собирается по одному токену — отсюда разрыв на порядок с лишним. Коэффициент 40 взят как средний ориентир для облачных провайдеров. Свой замер делают так: один запрос прогоняют двадцать раз в рабочие часы, берут медиану времени до первого токена при двух разных длинах промпта и делят разницу на разницу токенов.
Почему длинная база знаний почти не замедляет ответ
Лишние пять тысяч токенов контекста на средней модели добавляют около трёх секунд чтения. Те же пять тысяч токенов в выдаче стоили бы больше ста секунд. Контекст ограничивают ради денег и точности, а секунды экономят на длине ответа.
Какая пауза считается предельной в телефонии
Тишина дольше полутора секунд читается собеседником как обрыв связи, а типовое окно шлюза до разрыва сессии — около тридцати секунд. В расчёте показана доля этого окна. Дистанцию между двумя порогами закрывают короткой репликой-заполнителем в начале обработки.
Что ускоряет ответ быстрее всего
Сокращение выдачи и склейка вызовов. Ответ на 300 токенов вместо 800 экономит около одиннадцати секунд на средней модели, а объединение двух шагов цепочки в один снимает целый такт целиком. Смена модели на более быструю даёт выигрыш пропорционально, но забирает часть качества рассуждения.
Проверить на вашей задаче?
Посмотрим ваш процесс и назовём цифры по нему, а не по средним значениям.
Смежные инструменты
Обновлено: 4 сентября 2026