[МСК]

Счёт за инференс в месяц

Цена «за тысячу токенов» превращается в рублёвый счёт за месяц. Четыре ползунка описывают нагрузку, пятое поле — класс модели.

Ваши данные

400 шт.

Обращений целиком: заявка, письмо, разговор в чате. Отдельные реплики внутри считаются ниже.

5 шт.
600 симв.

Со знаками и пробелами. Страница А4 — около 1800 символов.

Ежемесячный счёт за обращения к модели
77 000 ₽

Посчитана только плата провайдеру за токены. Разработка, интеграции, хранилище и сопровождение считаются отдельно.

Статья, за которой стоит следить

Счёт уже виден в бюджете и реагирует на настройки. Обрезка истории, кэш общей части промпта и маршрутизация простых обращений на компактную модель обычно снимают от четверти до половины суммы.

Из чего сложилось
Токенов на один диалог
11 280
Токенов в месяц, млн
137,2
Обращения к модели
69 000 ₽
Повторы и служебные вызовы
8 000 ₽
Доля контекста в токенах
83,0%
Цена одного диалога
6 ₽

Расчёт даёт порядок величины по тарифам середины 2026 года. Итоговый счёт зависит от провайдера, кэширования и того, сколько текста реально уходит в каждый запрос.

Как устроен расчёт

Провайдер выставляет счёт за токены. Токен — кусок текста примерно в 2,5 символа русского письма; по этому курсу расчёт и переводит символы. Оплачивается всё, что модель прочитала, и всё, что она написала.

Отправная точка — диалог целиком. Число обращений в сутки руководитель обычно знает: заявки, письма, вопросы в чат. Внутри обращения человек пишет несколько реплик подряд.

Дальше начинается место, где интуиция подводит. Каждая реплика уходит в модель вместе со всей предысторией: у модели нет памяти между вызовами, переписка пересылается заново. При пяти репликах суммарный вход равен пятнадцати репликам — 5 × 6 / 2. Именно эта формула и стоит в расчёте.

К каждому запросу прибавляется постоянная нагрузка: инструкция, правила обработки, выдержки из базы знаний. Она задана коэффициентом к входным токенам. Короткая инструкция — 1,4; инструкция с фрагментами документов — 2,6; документы целиком — 4,5. Разброс между крайними вариантами трёхкратный.

Ответы считаются отдельно, их длина принята в 1,6 длины реплики человека. Сумма входа и выхода умножается на число диалогов и на 30,4 дня. Сверху добавлено 12% на повторы, переспросы и служебные вызовы — классификацию обращения, проверку ответа, попытки после сбоя. Итог округляется до тысячи рублей.

Что двигает счёт сильнее всего

Длина диалога. Рост здесь квадратичный, и ползунок реплик сдвигает результат заметнее остальных. Переход с пяти реплик на десять поднимает входные токены в 3,7 раза при том же числе обращений.

Объём приложенного контекста. Зависимость линейная, зато диапазон широкий. Между короткой инструкцией и полными документами разница больше чем втрое.

Класс модели. Между компактной и флагманской ставкой в расчёте двадцатикратный разрыв. Модель выбирают под задачу: сортировку писем и извлечение полей тянет компактная, разбор договора — старшая.

Число диалогов действует линейно и предсказуемо. Оно задаёт масштаб, но не влияет на цену одного обращения.

На что смотреть в разбивке

Строка «Цена одного диалога» переводит счёт в понятную единицу. Её сравнивают со стоимостью того же диалога у человека — минуты работы оператора считаются по той же логике, что и в калькуляторе бюджета.

Строка «Доля контекста» показывает, за что уходят деньги. На значениях по умолчанию около 80% токенов — это перечитанная история и приложенные документы. Ответы модели занимают оставшуюся пятую часть.

Когда доля контекста переваливает за 85%, экономию ищут в подготовке запроса. Ужать ответы при таком раскладе почти нечего.

При каких условиях счёт остаётся предсказуемым

Историю обрезают до нескольких последних реплик, а старую часть заменяют коротким конспектом. Диалог перестаёт дорожать к концу.

Неизменную часть промпта отдают в кэш провайдера. Повторное чтение тарифицируется дешевле, и общая инструкция перестаёт оплачиваться по полной ставке в каждом вызове.

В запрос кладут найденные поиском фрагменты. Один точный абзац из регламента работает лучше всего документа и стоит в десятки раз меньше.

Обращения маршрутизируют по сложности. Типовые вопросы уходят компактной модели, спорные — старшей. На потоке однородных задач такая развилка снимает половину счёта.

На каждый диалог ставят лимит токенов. Он превращает открытый расход в потолок, который видно заранее.

Когда хватает грубой оценки

Пилот на несколько десятков обращений в сутки укладывается в сумму, сопоставимую с парой часов разработки. Подробный расчёт там ничего не решает: считать стоит после выхода на поток.

Разговор о деньгах становится предметным от нескольких сотен диалогов в день. С этого объёма счёт за инференс начинает попадать в отчёт и реагировать на настройки системы.

Полученное число — ориентир порядка величины. Точная цифра появляется после замера на реальных обращениях: неделя логов показывает настоящую длину диалогов и объём контекста лучше любой прикидки.

Частые вопросы

Почему счёт растёт быстрее, чем число сообщений

Каждая новая реплика уходит в модель вместе со всей перепиской до неё. При пяти репликах первая оплачивается пять раз, вторая четыре — суммарно пятнадцать реплик вместо пяти. Рост идёт по формуле суммы ряда, поэтому удвоение длины диалога увеличивает входные токены примерно в 3,7 раза.

Что такое токен и сколько их в странице текста

Токен — кусок текста, для русского письма это примерно 2,5 символа. Страница А4 — около 1800 символов, то есть порядка 700 токенов. По этому курсу расчёт и переводит символы в токены.

Почему цена модели задана одним числом, если вход и выход стоят по-разному

Вход у диалоговых сценариев обычно занимает больше 80% токенов — это видно в строке «Доля контекста». Ставка усреднена со сдвигом в сторону входной цены, поэтому для переписки прикидка держится. Для сценариев с длинной генерацией по короткому запросу счёт выйдет выше расчётного.

Можно ли снизить счёт без смены модели

Три рычага работают почти всегда. Историю обрезают до нескольких последних реплик, в запрос кладут найденные фрагменты вместо целых документов, а неизменную часть промпта отдают в кэш провайдера — она тарифицируется дешевле при повторном чтении.

Что не попало в расчёт

Разовая разработка и интеграции, хранилище для поиска по документам, ручная проверка ответов и работа команды сопровождения. Для собственного контура добавляются аренда видеокарт и администрирование — там оплата идёт за время, а не за обращения.