[UTC+3]

Инференс

Inference

In short

Инференс — это момент, когда обученная модель отвечает на запрос; именно за него выставляют счёт каждый месяц.

Зачем это знать

  • Понять, из чего складывается ежемесячный счёт за ИИ
  • Считать окупаемость не «сколько стоит внедрить», а «сколько стоит один разбор документа»
  • Знать, какие рычаги удешевления существуют, и спрашивать о них подрядчика

Что такое инференс простыми словами

Расходы на ИИ делятся надвое. Обучение — это когда модель с нуля читает интернет и осваивает язык. Оно длится неделями, стоит миллионы долларов, и делает его вендор, а не вы. Инференс — каждое обращение к готовой модели в работе: ответ клиенту, разбор одного счёта, проверка одного договора.

Аналогия простая. Обучение — это годы, за которые бухгалтер получил профессию. Инференс — обычный рабочий день, когда он проводит документы. Вы платите за рабочие дни, а не за его институт.

Отсюда главное следствие для бюджета: считать нужно себестоимость одной операции и умножать на объём. «Сколько стоит внедрить ИИ» — вопрос про разовый проект. «Сколько стоит разобрать один входящий счёт» — вопрос, от которого зависит, окупится ли всё это через год.

Как это работает

Модель получает запрос, разбивает его на токены — кусочки примерно по три четверти слова — и предсказывает продолжение шаг за шагом. Каждый шаг требует вычислений на видеокарте. Чем длиннее запрос и чем длиннее ответ, тем больше шагов и тем дороже обращение.

Поэтому в счёте всегда две колонки: входные токены — то, что модель прочитала, и выходные — то, что она написала. Выходные дороже, обычно в несколько раз: их приходится генерировать по одному, а входные модель обрабатывает разом.

Здесь же прячется неочевидная статья расходов. Если при каждом обращении вы отправляете модели одну и ту же инструкцию на две страницы и весь предыдущий разговор, вы платите за них каждый раз заново. На потоке в тысячи обращений в день это становится основной частью счёта.

Пример из практики

Компания разбирала входящие счета от поставщиков: около 4 000 документов в месяц. Первая версия отправляла в модель полный текст инструкции, примеры оформления и сам документ целиком — выходило примерно 11 ₽ за счёт, около 44 000 ₽ в месяц.

Изменили три вещи: включили кэширование постоянной части промпта, перестали слать модели скан целиком после того, как из него уже извлекли текст, и отправили простые типовые счета в модель попроще, оставив сильную для нестандартных. Стоимость упала до 3 ₽ за документ — порядка 12 000 ₽ в месяц. Качество разбора проверяли на одной и той же выборке из 200 счетов до и после: доля ошибок не изменилась.

Что это даёт бизнесу

  • Предсказуемый бюджет. Зная себестоимость операции, вы считаете расходы от объёма, а не гадаете.
  • Понятные рычаги экономии. Кэширование, выбор модели под задачу, чистка контекста, пакетная обработка — всё это меняет счёт без переписывания системы.
  • Основа для сравнения предложений. Подрядчик, который называет цену за операцию и объясняет, из чего она складывается, разбирается в предмете. Тот, кто говорит только про стоимость проекта, — не обязательно.

Когда об этом можно не думать

Если объём небольшой — скажем, несколько десятков обращений в день — оптимизация инференса не окупит потраченного времени. Счёт будет в пределах пары тысяч рублей в месяц, и любая экономия окажется меньше стоимости работ по её достижению.

Оптимизацию оставляют на потом, когда пилот подтвердил пользу. Пока непонятно, работает ли решение вообще и каким будет реальный объём, экономия на токенах — преждевременная работа. Сначала проверяют пользу, потом считают себестоимость.

Что важно проверить

Задержка — оборотная сторона стоимости. Дешёвая модель отвечает быстрее, сильная думает дольше, а рассуждающие модели могут потратить на обдумывание больше токенов, чем на сам ответ. Если ассистент отвечает клиенту в чате, счёт важен не больше, чем секунды ожидания: человек уходит, не дождавшись. Обе величины меряют вместе, до запуска, на реальных запросах.

FAQ

Инференс простыми словами — это что?

Это работа готовой модели: она получила ваш запрос и выдала ответ. Обучение — редкое и дорогое событие, которое обычно делают не вы. Инференс происходит каждый раз, когда ассистент отвечает клиенту или система разбирает документ, и именно он формирует ежемесячный счёт.

Чем инференс отличается от обучения

Обучение — это когда модель осваивает навык на огромном объёме данных; занимает недели и стоит миллионы. Инференс — когда она этот навык применяет; занимает секунды и стоит доли копейки за раз. Разница как между обучением сотрудника и его обычным рабочим днём.

От чего зависит стоимость инференса

От трёх вещей: сколько текста модель прочитала, сколько написала в ответ и какая модель выбрана. Выходные токены обычно в несколько раз дороже входных, а разница между простой и сильной моделью бывает десятикратной.

Как удешевить инференс без потери качества

Направлять простые запросы в модель попроще, кэшировать повторяющуюся часть промпта, убирать из контекста лишнее и отправлять несрочные задачи пакетом. На больших объёмах эти четыре приёма меняют счёт в разы.

Можно ли считать инференс внутри компании

Да, если данные нельзя отдавать наружу. Модель разворачивают на своём оборудовании, и тогда платят не за токены, а за видеокарты и их обслуживание. Расчёт окупаемости строится иначе: фиксированные затраты вместо оплаты за каждое обращение.