Инференс
Inference
Инференс — это момент, когда обученная модель отвечает на запрос; именно за него выставляют счёт каждый месяц.
Зачем это знать
- Понять, из чего складывается ежемесячный счёт за ИИ
- Считать окупаемость не «сколько стоит внедрить», а «сколько стоит один разбор документа»
- Знать, какие рычаги удешевления существуют, и спрашивать о них подрядчика
Что такое инференс простыми словами
Расходы на ИИ делятся надвое. Обучение — это когда модель с нуля читает интернет и осваивает язык. Оно длится неделями, стоит миллионы долларов, и делает его вендор, а не вы. Инференс — каждое обращение к готовой модели в работе: ответ клиенту, разбор одного счёта, проверка одного договора.
Аналогия простая. Обучение — это годы, за которые бухгалтер получил профессию. Инференс — обычный рабочий день, когда он проводит документы. Вы платите за рабочие дни, а не за его институт.
Отсюда главное следствие для бюджета: считать нужно себестоимость одной операции и умножать на объём. «Сколько стоит внедрить ИИ» — вопрос про разовый проект. «Сколько стоит разобрать один входящий счёт» — вопрос, от которого зависит, окупится ли всё это через год.
Как это работает
Модель получает запрос, разбивает его на токены — кусочки примерно по три четверти слова — и предсказывает продолжение шаг за шагом. Каждый шаг требует вычислений на видеокарте. Чем длиннее запрос и чем длиннее ответ, тем больше шагов и тем дороже обращение.
Поэтому в счёте всегда две колонки: входные токены — то, что модель прочитала, и выходные — то, что она написала. Выходные дороже, обычно в несколько раз: их приходится генерировать по одному, а входные модель обрабатывает разом.
Здесь же прячется неочевидная статья расходов. Если при каждом обращении вы отправляете модели одну и ту же инструкцию на две страницы и весь предыдущий разговор, вы платите за них каждый раз заново. На потоке в тысячи обращений в день это становится основной частью счёта.
Пример из практики
Компания разбирала входящие счета от поставщиков: около 4 000 документов в месяц. Первая версия отправляла в модель полный текст инструкции, примеры оформления и сам документ целиком — выходило примерно 11 ₽ за счёт, около 44 000 ₽ в месяц.
Изменили три вещи: включили кэширование постоянной части промпта, перестали слать модели скан целиком после того, как из него уже извлекли текст, и отправили простые типовые счета в модель попроще, оставив сильную для нестандартных. Стоимость упала до 3 ₽ за документ — порядка 12 000 ₽ в месяц. Качество разбора проверяли на одной и той же выборке из 200 счетов до и после: доля ошибок не изменилась.
Что это даёт бизнесу
- Предсказуемый бюджет. Зная себестоимость операции, вы считаете расходы от объёма, а не гадаете.
- Понятные рычаги экономии. Кэширование, выбор модели под задачу, чистка контекста, пакетная обработка — всё это меняет счёт без переписывания системы.
- Основа для сравнения предложений. Подрядчик, который называет цену за операцию и объясняет, из чего она складывается, разбирается в предмете. Тот, кто говорит только про стоимость проекта, — не обязательно.
Когда об этом можно не думать
Если объём небольшой — скажем, несколько десятков обращений в день — оптимизация инференса не окупит потраченного времени. Счёт будет в пределах пары тысяч рублей в месяц, и любая экономия окажется меньше стоимости работ по её достижению.
Оптимизацию оставляют на потом, когда пилот подтвердил пользу. Пока непонятно, работает ли решение вообще и каким будет реальный объём, экономия на токенах — преждевременная работа. Сначала проверяют пользу, потом считают себестоимость.
Что важно проверить
Задержка — оборотная сторона стоимости. Дешёвая модель отвечает быстрее, сильная думает дольше, а рассуждающие модели могут потратить на обдумывание больше токенов, чем на сам ответ. Если ассистент отвечает клиенту в чате, счёт важен не больше, чем секунды ожидания: человек уходит, не дождавшись. Обе величины меряют вместе, до запуска, на реальных запросах.
Частые вопросы
Инференс простыми словами — это что?
Это работа готовой модели: она получила ваш запрос и выдала ответ. Обучение — редкое и дорогое событие, которое обычно делают не вы. Инференс происходит каждый раз, когда ассистент отвечает клиенту или система разбирает документ, и именно он формирует ежемесячный счёт.
Чем инференс отличается от обучения
Обучение — это когда модель осваивает навык на огромном объёме данных; занимает недели и стоит миллионы. Инференс — когда она этот навык применяет; занимает секунды и стоит доли копейки за раз. Разница как между обучением сотрудника и его обычным рабочим днём.
От чего зависит стоимость инференса
От трёх вещей: сколько текста модель прочитала, сколько написала в ответ и какая модель выбрана. Выходные токены обычно в несколько раз дороже входных, а разница между простой и сильной моделью бывает десятикратной.
Как удешевить инференс без потери качества
Направлять простые запросы в модель попроще, кэшировать повторяющуюся часть промпта, убирать из контекста лишнее и отправлять несрочные задачи пакетом. На больших объёмах эти четыре приёма меняют счёт в разы.
Можно ли считать инференс внутри компании
Да, если данные нельзя отдавать наружу. Модель разворачивают на своём оборудовании, и тогда платят не за токены, а за видеокарты и их обслуживание. Расчёт окупаемости строится иначе: фиксированные затраты вместо оплаты за каждое обращение.
Нужно применить?
Разберём вашу задачу и скажем, где эта технология даст результат, а где не стоит тратиться.
Смежные термины
Обновлено: 26 июля 2026