[МСК]

Что такое задержка и как её укладывают в секунды

Задержка в ответе так и называется — задержка. В английской документации это latency, в русских переводах встречается «латентность» и «время отклика». Величина одна: время между отправкой запроса и готовым ответом. Замеряют её двумя числами — временем до первого слова и полным временем ответа.

Зачем это знать

  • Понять, за что пользователь бросает работу с системой, хотя ответы у неё верные
  • Знать, какие рычаги ускоряют ответ без замены модели и без переписывания системы
  • Спрашивать подрядчика время ответа на живом потоке, а не на демонстрационном запросе

Что такое задержка простыми словами

Заказ в кофейне принимают за секунду. Кофе готовится три минуты. Но раздражает не ожидание чашки, а бариста, который молчит и не показывает, что услышал.

С моделью так же. Задержка — это время между отправкой запроса и готовым ответом. Она делится на две части: ожидание первого слова и дописывание остального текста.

Первая часть весит больше. Экран, на котором ничего не происходит, читается как поломка. Тот же ответ, выводимый по мере написания, воспринимается быстрым при одинаковом полном времени.

Шаг 1
Сбор запроса
Поиск по базе знаний, справка из CRM, подстановка инструкции. Модель ещё не задействована
Шаг 2
Очередь у поставщика
Запрос ждёт свободной мощности. В часы пик ожидание растёт, ночью падает
Шаг 3
Чтение входного объёма
Модель прочитывает всё присланное и выдаёт первое слово. Чем длиннее запрос, тем дольше пауза
Шаг 4
Написание ответа
Текст пишется по кусочку. Время прямо пропорционально длине ответа
Шаг 5
Проверки после ответа
Разбор формата, сверка с правилами, запись в систему. Часто добавляет секунды незаметно
Из чего складывается ожидание ответа

Как это работает

  1. Замеряют два числа, а не одно. Время до первого слова отвечает за ощущение живого диалога. Полное время ответа отвечает за то, успевает ли сотрудник обработать очередь.
  2. Считают по хвосту, а не по среднему. Берут значение, которое не превышено в 95 случаях из 100. Среднее прячет редкие долгие ответы, а жалобы приходят именно с них.
  3. Раскладывают ожидание по шагам. Секундомер ставят на каждый шаг цепочки отдельно. Обычно выясняется, что модель занимает меньшую часть ожидания.
  4. Сокращают входной объём. Короткий запрос читается быстрее длинного. Здесь задержка и счёт за токены двигаются в одну сторону: меньше объём — быстрее и дешевле.
  5. Ограничивают длину ответа. Текст на 600 слов пишется примерно вдвое дольше текста на 300. Ограничение задаётся в запросе, а не пожеланием.
  6. Включают вывод по мере написания. Ответ появляется на экране с первых слов. Полное время не меняется, ощущение меняется сильно.

Отдельно смотрят на цепочки из нескольких обращений. Каждый шаг агента складывается со следующим: четыре обращения по три секунды дают двенадцать секунд ожидания. Часть шагов выполняется параллельно, часть заменяется обычной интеграцией без модели.

Пример из практики

Цифры ниже — расчётные ориентиры для компании такого профиля, а не отчёт по конкретному внедрению. У каждой указана методика замера, чтобы её можно было повторить на своих данных.

Оптовая компания подключила помощника к обработке входящих заявок. Ответ по существу был верным, но операторы вернулись к почте. Замер на 300 обращениях за две недели показал: первое слово появлялось через 6 секунд по хвостовому значению, полный ответ — через 11.

Разложили ожидание по шагам. Поиск по базе знаний забирал 2 секунды, обращение к складской системе — ещё 1,5, модель — оставшееся. Сделали три вещи: включили вывод по мере написания, урезали подставляемый контекст с восьми документов до трёх, вынесли обращение к складу в параллельный шаг.

Первое слово стало появляться быстрее секунды, полный ответ уложился в 5 секунд по тому же хвостовому значению. Долю верных разборов сверяли на той же выборке до и после — она не изменилась. Операторы вернулись в систему без отдельного распоряжения.

Что это даёт бизнесу

  • Систему начинают использовать. Верный ответ, который приходит слишком поздно, не участвует в работе. Ускорение первого слова возвращает пользователей без единой правки в логике.
  • Появляется предсказуемая пропускная способность. Оператор с ответом за 5 секунд обрабатывает заметно больше обращений за смену, чем с ответом за 11. Величину считают на своём потоке, до закупки лицензий.
  • Рычаги видны и дёшевы. Вывод по мере написания, короткий контекст, ограничение длины ответа, параллельные шаги — четыре приёма, не требующие смены модели. Нагрузку на запрос можно прикинуть калькулятором контекстного окна.
  • Разговор с подрядчиком становится конкретным. Вопрос звучит как «какое время ответа держится на потоке в 500 обращений в день» — и на него есть проверяемый ответ.
Фоновая обработка
Диалог с человеком
Что замечает пользователь
Ничего: результат готов к сроку
Каждая пауза на экране
Целевой показатель
Объём документов за смену
Отклик в пределах 100–150 миллисекунд
Главный рычаг
Пакетная обработка ночью
Вывод по мере написания, короткий контекст
Оправданная доплата
Обычно не нужна
Быстрая модель на последнем шаге
Один и тот же показатель значит разное в двух сценариях · Источник: techxeber.az; обсуждение практиков в r/automation

Когда без этого можно обойтись

Ночная обработка документов живёт по другому правилу. Пакет накладных, разобранный к восьми утра, одинаково хорош при секунде на документ и при десяти. Здесь считают объём за смену и берут модель подешевле — инференс в спокойные часы стоит меньше.

То же с задачами, где человек ждёт не ответа, а результата: подготовка отчёта, разбор архива, ежемесячная сверка. Секундомер тут заменяется сроком. Ускорять такие процессы можно, но экономии это обычно не приносит.

Что важно проверить

Первое: демонстрационный запрос почти всегда быстрее рабочего. На показе отправляют один вопрос, в работе к нему добавляют инструкцию, найденные документы и историю переписки. Просите замер на потоке, похожем на ваш по объёму запроса.

Второе: рассуждающие модели думают перед ответом, и это время попадает в ожидание. На сложных задачах невидимая часть бывает длиннее самого ответа. Проверяется на реальных запросах до запуска.

Третье: задержка растёт вместе с нагрузкой. Система, отвечающая за 3 секунды на десяти пользователях, на сотне может отвечать за пятнадцать. Замер под нагрузкой делается один раз и снимает главный сюрприз после запуска.

Частые вопросы

Задержка простыми словами — это что?

Это время от нажатия кнопки до готового ответа. Внутри оно делится на две части: сколько ждали первого слова и сколько дописывался остальной текст. Пользователь острее чувствует первую часть. Поэтому системы, которые выводят ответ по мере написания, кажутся быстрее при одинаковом полном времени.

Как называется задержка в ответе

Задержкой и называется. В английской документации это latency, в русских переводах встречается «латентность» и «время отклика». Величина одна: время между отправкой запроса и готовым ответом. У поставщиков моделей её приводят двумя числами — время до первого слова и полное время ответа.

Латентность и задержка — это одно и то же

Да, это два названия одной величины. «Латентность» — калька с latency, «задержка» — русский вариант, смысл совпадает. В договоре и в замере достаточно одного слова. Рядом указывают, что именно мерили: время до первого слова или полное время ответа.

Какая задержка считается нормальной

Ориентир задаёт сценарий. Для диалогового помощника отклик держат в пределах 100–150 миллисекунд, иначе разговор рвётся. Для разбора документа нормой бывают и двадцать секунд: человек в это время занят другим. Для ночной обработки пакета значение не имеет вовсе — там считают объём за смену.

Почему ответ приходит медленнее, чем на демонстрации

На демонстрации показывают короткий запрос без окружения. В работе к нему добавляются инструкция, найденные документы, история переписки и обращения к смежным системам. Каждое слагаемое добавляет своё время. Разложите одно обращение по шагам с секундомером — обычно две трети ожидания приходится на шаги вокруг модели, а не на саму модель.

Как сократить ожидание без смены модели

Четыре рычага дают эффект быстрее прочих. Включить вывод по мере написания, сократить входной объём, ограничить длину ответа, убрать лишние шаги цепочки. Пятый — кэширование постоянной части запроса у поставщика. Результат каждого рычага проверяют замером до и после на одной и той же выборке обращений.

Как замерить задержку у себя

Возьмите поток за рабочую неделю, не меньше 200–300 обращений. Для каждого запишите время до первого слова и полное время ответа. Считайте не среднее, а значение, которое не превышено в 95 случаях из 100. Среднее прячет медленный хвост — а жалобы приходят именно с него.

Связаны ли задержка и счёт за модель

Связаны через объём. Длинный входной запрос и развёрнутый ответ и стоят дороже, и ждать их дольше. Сокращение контекста обычно улучшает обе величины сразу. Обратный случай — дорогая быстрая модель: ожидание падает, счёт растёт, и выбор делается по цене минуты ожидания сотрудника.