Счёт за инференс в месяц
Цена «за тысячу токенов» превращается в рублёвый счёт за месяц. Четыре ползунка описывают нагрузку, пятое поле — класс модели.
Your numbers
Обращений целиком: заявка, письмо, разговор в чате. Отдельные реплики внутри считаются ниже.
Со знаками и пробелами. Страница А4 — около 1800 символов.
Посчитана только плата провайдеру за токены. Разработка, интеграции, хранилище и сопровождение считаются отдельно.
Счёт уже виден в бюджете и реагирует на настройки. Обрезка истории, кэш общей части промпта и маршрутизация простых обращений на компактную модель обычно снимают от четверти до половины суммы.
- Токенов на один диалог
- 11 280
- Токенов в месяц, млн
- 137,2
- Обращения к модели
- 69 000 ₽
- Повторы и служебные вызовы
- 8 000 ₽
- Доля контекста в токенах
- 83,0%
- Цена одного диалога
- 6 ₽
Расчёт даёт порядок величины по тарифам середины 2026 года. Итоговый счёт зависит от провайдера, кэширования и того, сколько текста реально уходит в каждый запрос.
Как устроен расчёт
Провайдер выставляет счёт за токены. Токен — кусок текста примерно в 2,5 символа русского письма; по этому курсу расчёт и переводит символы. Оплачивается всё, что модель прочитала, и всё, что она написала.
Отправная точка — диалог целиком. Число обращений в сутки руководитель обычно знает: заявки, письма, вопросы в чат. Внутри обращения человек пишет несколько реплик подряд.
Дальше начинается место, где интуиция подводит. Каждая реплика уходит в модель вместе со всей предысторией: у модели нет памяти между вызовами, переписка пересылается заново. При пяти репликах суммарный вход равен пятнадцати репликам — 5 × 6 / 2. Именно эта формула и стоит в расчёте.
К каждому запросу прибавляется постоянная нагрузка: инструкция, правила обработки, выдержки из базы знаний. Она задана коэффициентом к входным токенам. Короткая инструкция — 1,4; инструкция с фрагментами документов — 2,6; документы целиком — 4,5. Разброс между крайними вариантами трёхкратный.
Ответы считаются отдельно, их длина принята в 1,6 длины реплики человека. Сумма входа и выхода умножается на число диалогов и на 30,4 дня. Сверху добавлено 12% на повторы, переспросы и служебные вызовы — классификацию обращения, проверку ответа, попытки после сбоя. Итог округляется до тысячи рублей.
Что двигает счёт сильнее всего
Длина диалога. Рост здесь квадратичный, и ползунок реплик сдвигает результат заметнее остальных. Переход с пяти реплик на десять поднимает входные токены в 3,7 раза при том же числе обращений.
Объём приложенного контекста. Зависимость линейная, зато диапазон широкий. Между короткой инструкцией и полными документами разница больше чем втрое.
Класс модели. Между компактной и флагманской ставкой в расчёте двадцатикратный разрыв. Модель выбирают под задачу: сортировку писем и извлечение полей тянет компактная, разбор договора — старшая.
Число диалогов действует линейно и предсказуемо. Оно задаёт масштаб, но не влияет на цену одного обращения.
На что смотреть в разбивке
Строка «Цена одного диалога» переводит счёт в понятную единицу. Её сравнивают со стоимостью того же диалога у человека — минуты работы оператора считаются по той же логике, что и в калькуляторе бюджета.
Строка «Доля контекста» показывает, за что уходят деньги. На значениях по умолчанию около 80% токенов — это перечитанная история и приложенные документы. Ответы модели занимают оставшуюся пятую часть.
Когда доля контекста переваливает за 85%, экономию ищут в подготовке запроса. Ужать ответы при таком раскладе почти нечего.
При каких условиях счёт остаётся предсказуемым
Историю обрезают до нескольких последних реплик, а старую часть заменяют коротким конспектом. Диалог перестаёт дорожать к концу.
Неизменную часть промпта отдают в кэш провайдера. Повторное чтение тарифицируется дешевле, и общая инструкция перестаёт оплачиваться по полной ставке в каждом вызове.
В запрос кладут найденные поиском фрагменты. Один точный абзац из регламента работает лучше всего документа и стоит в десятки раз меньше.
Обращения маршрутизируют по сложности. Типовые вопросы уходят компактной модели, спорные — старшей. На потоке однородных задач такая развилка снимает половину счёта.
На каждый диалог ставят лимит токенов. Он превращает открытый расход в потолок, который видно заранее.
Когда хватает грубой оценки
Пилот на несколько десятков обращений в сутки укладывается в сумму, сопоставимую с парой часов разработки. Подробный расчёт там ничего не решает: считать стоит после выхода на поток.
Разговор о деньгах становится предметным от нескольких сотен диалогов в день. С этого объёма счёт за инференс начинает попадать в отчёт и реагировать на настройки системы.
Полученное число — ориентир порядка величины. Точная цифра появляется после замера на реальных обращениях: неделя логов показывает настоящую длину диалогов и объём контекста лучше любой прикидки.
FAQ
Почему счёт растёт быстрее, чем число сообщений
Каждая новая реплика уходит в модель вместе со всей перепиской до неё. При пяти репликах первая оплачивается пять раз, вторая четыре — суммарно пятнадцать реплик вместо пяти. Рост идёт по формуле суммы ряда, поэтому удвоение длины диалога увеличивает входные токены примерно в 3,7 раза.
Что такое токен и сколько их в странице текста
Токен — кусок текста, для русского письма это примерно 2,5 символа. Страница А4 — около 1800 символов, то есть порядка 700 токенов. По этому курсу расчёт и переводит символы в токены.
Почему цена модели задана одним числом, если вход и выход стоят по-разному
Вход у диалоговых сценариев обычно занимает больше 80% токенов — это видно в строке «Доля контекста». Ставка усреднена со сдвигом в сторону входной цены, поэтому для переписки прикидка держится. Для сценариев с длинной генерацией по короткому запросу счёт выйдет выше расчётного.
Можно ли снизить счёт без смены модели
Три рычага работают почти всегда. Историю обрезают до нескольких последних реплик, в запрос кладут найденные фрагменты вместо целых документов, а неизменную часть промпта отдают в кэш провайдера — она тарифицируется дешевле при повторном чтении.
Что не попало в расчёт
Разовая разработка и интеграции, хранилище для поиска по документам, ручная проверка ответов и работа команды сопровождения. Для собственного контура добавляются аренда видеокарт и администрирование — там оплата идёт за время, а не за обращения.
Check it on your case?
We will look at your process and give numbers for it, not for averages.
Related tools
Updated: 31 июля 2026