[МСК]

Сколько токенов съест ваша задача

Пять цифр — и видно, во что обходится каждая из трёх архитектур на вашем объёме и какая из них выигрывает по деньгам.

Ваши данные

200 стр.

Страницы, к которым модель обращается по существу: регламенты, инструкции, каталог. Архив за десять лет сюда не входит.

3 000 шт.

Обращений пользователей, а не сообщений: один диалог из пяти реплик — пять запросов.

Самый дешёвый вариант в месяц
29 000 ₽

Счёт по выигравшей архитектуре. Какая именно выиграла — видно в разбивке: её строка равна этой цифре.

Рабочий масштаб

Здесь три варианта уже расходятся по деньгам заметно, и разбивка показывает, за что именно платят в каждом. Строка «переплата» — цена архитектурного решения, принятого на глаз.

Из чего сложилось
База знаний в токенах
140 000
Занято окна контекста
77,8%
Весь текст в промпт
80 000 ₽
Поиск по базе (RAG)
29 000 ₽
Дообученная модель
38 000 ₽
Переплата при худшем выборе
51 000 ₽
Лучший вариант за год
348 000 ₽

Расчёт даёт порядок величины по усреднённым прайсам облачных провайдеров. Итоговая цифра зависит от модели, региона и того, в каком виде лежат документы.

Как устроен расчёт

Отправная точка — объём текста, который модель обязана видеть, чтобы ответить по делу. Он переводится в токены по курсу 700 токенов на страницу. Курс выведён из 1 800 знаков на странице А4 и кириллической токенизации, где один токен покрывает 2–3 знака.

Дальше объём умножается на поток запросов. Три архитектуры отличаются тем, сколько текста уходит в модель на каждом обращении.

Весь текст в промпт. База целиком подставляется в каждый запрос. Расход равен объёму базы, помноженному на число запросов. Повторяющаяся часть кэшируется, и чтение кэша стоит дешевле полного ввода — в расчёт заложен коэффициент 0,4 как усреднение по трафику, где кэш срабатывает не всегда.

Поиск по базе. Документы режутся на фрагменты, вопрос находит подходящие, в промпт уходят только они. В расчёте это 12 фрагментов и инструкция — около 5 200 токенов на запрос, независимо от размера базы. Взамен появляется постоянная статья: хранилище векторов и его обслуживание, 18 000 ₽ в месяц.

Дообучение. Знания переносятся в веса модели, промпт остаётся коротким — около 900 токенов. Расход на запрос минимальный, зато инференс дообученной модели стоит примерно в полтора раза дороже базовой. Плюс два регулярных счёта: прогон обучения от 15 000 ₽ за цикл и подготовка датасета из расчёта 900 ₽ за страницу, разнесённая на год.

Выходные токены считаются одинаково для всех трёх вариантов и оцениваются вчетверо дороже входных — так устроены прайсы облачных провайдеров.

Что двигает счёт сильнее всего

Первое — произведение объёма базы на поток. У первого варианта эти два числа перемножаются напрямую, поэтому он взлетает быстрее остальных. Двести страниц и три тысячи запросов дают 420 миллионов входных токенов; те же страницы при тридцати тысячах запросов — уже 4,2 миллиарда.

Второе — класс модели. Разрыв между лёгкой и старшей моделью в расчёте одиннадцатикратный. Он растягивает все три столбца одновременно, поэтому победителя обычно не меняет, но переводит разговор из десятков тысяч в сотни.

Третье — частота обновления базы. Для поиска по базе переиндексация почти бесплатна: эмбеддинги стоят единицы рублей за миллион токенов. Для дообучения каждое обновление означает новый цикл обучения, и еженедельные правки умножают эту статью вчетверо.

При каких условиях каждый вариант выигрывает

Полный текст в промпт окупается, пока база помещается в окно контекста и поток измеряется сотнями запросов. Разработки почти нет, менять документы можно в тот же день — правка файла сразу видна модели.

Поиск по базе окупается на среднем и крупном потоке при живой базе знаний. Постоянные 18 000 ₽ размываются уже на нескольких тысячах запросов, а расход на запрос перестаёт зависеть от того, выросла база до пятисот страниц или до трёх тысяч.

Дообучение окупается на большом однотипном потоке при стабильной базе. Короткий промпт даёт самую низкую цену обращения, и разовые вложения возвращаются тем быстрее, чем реже приходится переобучать. Редкое обновление здесь ключевое условие: квартальный цикл вдвое дешевле ежемесячного.

Что остаётся за скобками

Разработка. Расчёт показывает эксплуатацию — счёт, который приходит каждый месяц после запуска. Интеграция с почтой, CRM и правами доступа считается отдельно и от архитектуры зависит слабо.

Состояние документов. Регламенты в сканах и противоречащие друг другу инструкции удорожают любой из трёх путей, а для дообучения удваивают подготовку датасета. Оценить эту статью можно, только посмотрев на сами файлы.

Качество ответов. Дешёвый вариант выигрывает по деньгам, а не по попаданию в суть вопроса. Порядок обычно такой: сначала пилот на сотне реальных вопросов, потом сравнение точности, и только затем выбор по счёту среди тех, что прошли по качеству.

Как пользоваться результатом

Смотреть стоит на три столбца сразу. Соотношение между ними устойчиво даже при ошибке в прайсе вдвое — а именно оно определяет, куда идут деньги следующего года.

Строка «переплата при худшем выборе» показывает цену решения, принятого по привычке. Когда она измеряется сотнями тысяч в год, вечер на этот расчёт возвращается с запасом.

Частые вопросы

Что такое токен и почему счёт идёт в них

Токен — кусок текста примерно в 2–3 знака кириллицы. Провайдеры берут плату за каждый токен на входе и на выходе, поэтому счёт зависит от длины документов и ответов, а не от числа пользователей. Страница А4 в 1 800 знаков — это около 700 токенов.

Почему «весь текст в промпт» дешевеет только на маленькой базе

Каждый запрос оплачивается заново вместе со всей базой. Двести страниц при трёх тысячах запросов дают 420 миллионов входных токенов в месяц. Рост объёма и рост потока перемножаются, поэтому счёт растёт квадратично.

Откуда взялись 18 000 ₽ у варианта с поиском по базе

Векторное хранилище, сервис нарезки документов и мониторинг качества поиска. Сумма почти не зависит от потока запросов, поэтому на малых объёмах она и делает вариант дорогим, а на больших перестаёт быть заметной.

Почему дообучение считается вместе с подготовкой данных

Прогон обучения — меньшая часть расходов. Основное время уходит на превращение регламентов в пары «вопрос — ответ»: в расчёте заложено около 20 минут на страницу, это 900 ₽ по ставке 2 700 ₽ за час. Сумма размазана на 12 месяцев.

Что показывает строка «занято окна контекста»

Долю базы от окна в 180 000 токенов. Выше 100% вариант с полным текстом в промпте физически не собирается: документы не помещаются в один запрос, и остаются два других пути.

Насколько цифрам можно верить

Это порядок величины по усреднённым прайсам, а не смета. Расхождение в два раза даёт уже сам выбор модели, поэтому смотреть стоит на соотношение трёх столбцов, а не на конкретные рубли.