[МСК]

Свой контур или API: где порог выгоды

Четыре цифры про поток запросов — и видно месячную разницу между двумя способами платить за модель, а также порог, после которого своё железо выигрывает.

Ваши данные

3 000 шт.

Все обращения: и от людей, и от фоновых процессов.

6 тыс.

Промпт, подложенный контекст и ответ вместе.

1

Средняя по входу и выходу, из прайса выбранной модели.

Разница в месяц в пользу своего контура
502 000 ₽

Сравниваются только текущие платежи. Разовое развёртывание и замеры качества в сумму не входят.

Свой контур дешевле

Объём уже оплачивает железо с запасом, и каждый следующий месяц роста работает в плюс. Дальше решают два вопроса: хватает ли качества открытой модели на этих задачах и кто дежурит по контуру. Загрузка в разбивке подсказывает, когда пора добавлять карту.

Из чего сложилось
Порог: запросов в сутки
710
Счёт за API в месяц
657 000 ₽
Свой контур в месяц
155 000 ₽
Аренда карт
95 000 ₽
Сопровождение
60 000 ₽
Загрузка железа
60,8%
Своя цена 1000 токенов, ₽
0,3

Расчёт даёт порядок величины по эксплуатации. Развёртывание, замеры качества и приведение документов в порядок считаются отдельно.

Как устроен расчёт

Сравниваются две колонки на одном и том же объёме. Слева — оплата за токены по прайсу провайдера. Справа — аренда видеокарт под модель с открытыми весами плюс люди, которые её обслуживают.

Объём собирается из двух цифр. Сколько запросов проходит за сутки и сколько токенов весит средний запрос. В вес входит промпт, подложенный поиском контекст и ответ модели. Месяц берётся как 30,4 дня.

Счёт за API — умножение объёма на цену тысячи токенов. Он линеен. Поток вырос вдвое — счёт вырос вдвое, и это ровно то поведение, из-за которого расчёт обычно и запускают.

Своя сторона ведёт себя иначе. Сервер стоит одинаково при любой загрузке. В расчёт заложено 95 000 ₽ в месяц за карту — медиана публичных прайсов на аренду GPU-инстанса, снятая летом 2026 года. Сопровождение добавляет от 36 000 до 120 000 ₽ в зависимости от того, кто дежурит.

Где проходит порог

Порог — объём, на котором колонки равны. Месячная стоимость контура делится на цену тысячи токенов, результат переводится в запросы в сутки. Ниже этой отметки дешевле платить провайдеру. Выше — держать своё.

Сильнее всего порог двигает цена токена. Дешёвая модель у провайдера поднимает планку в разы, и своё железо начинает окупаться только на больших потоках. Дорогая модель опускает планку до сотен запросов в день.

Второй по силе фактор — вес запроса. Сборка с длинным контекстом легко доходит до 20–40 тысяч токенов на обращение. Тогда порог по числу запросов падает кратно, хотя число людей у экранов не меняется.

Загрузка железа

Разница в деньгах — половина ответа. Вторая половина в том, тянет ли купленная конфигурация поток.

Расчётная ёмкость одной карты принята за 900 млн токенов в месяц. Цифра получена из двух допущений: 2500 токенов в секунду устойчивой скорости при батчинге и 100 часов реальной нагрузки за месяц. Оба проверяются на своей модели за один день замеров.

Показатель загрузки в разбивке отвечает на практический вопрос. До 60% — запас есть, пики проходят незаметно. От 80% — в час пик собирается очередь, и следующим шагом добавляют карту. Стоимость контура при этом растёт ступенькой, а порог сдвигается вверх.

При каких условиях свой контур окупается

Условий четыре, и они складываются.

Поток стабилен и предсказуем. Железо оплачивается целиком даже в тихую неделю, поэтому ровная нагрузка выгоднее редких всплесков.

Задачи однотипные. Разбор входящих писем, извлечение полей из накладных, классификация обращений, черновики ответов по шаблону — на таком классе открытые модели 8–32B держатся близко к внешним.

Данные обязаны остаться внутри. Требование регулятора или службы безопасности снимает вопрос сравнения целиком: тогда считают не выгоду, а минимальную конфигурацию, которая закрывает объём.

Есть кому дежурить. Модель в контуре — это сервис с обновлениями, мониторингом и ночными падениями. Когда дежурного нет, экономия из расчёта уходит в простои.

Гибридная схема

Выбор редко бывает бинарным. Массовый однотипный поток уводят на свою модель, редкие сложные запросы оставляют на внешней. Порог тогда считают по той части потока, которую собираются переносить.

Такая схема даёт ещё один плюс. Внешняя модель остаётся горячим резервом: контур упал — трафик переключают обратно, и процесс продолжает работать.

Что осталось за скобками

Разовые вложения. Развёртывание, квантование, прогон на своих данных, настройка логирования и мониторинга — это недели работы, и они не усредняются по прайсу.

Качество. Открытая модель на 14B уступает топовой внешней на длинных рассуждениях. Мерить это надо до переезда: сотня реальных запросов, размеченных заранее, показывает разрыв честнее любых бенчмарков.

Собственная стойка. Если карты покупаются, а не арендуются, в расчёт добавляют амортизацию, электричество, охлаждение и запасной узел на случай отказа. Порядок величины сдвигается, логика сравнения остаётся прежней.

Частые вопросы

С какого объёма своё железо дешевле API?

Порог считается делением месячной стоимости контура на цену тысячи токенов. При аренде одной карты, инженере на part-time и прайсе 1,2 ₽ за 1000 токенов он выходит около 700 запросов в сутки по 6 тысяч токенов каждый. Дешевле прайс у провайдера — порог выше, длиннее запросы — ниже.

Откуда взялись 95 000 ₽ за карту в месяц

Это медиана публичных прайсов на аренду инстанса с одной картой класса A100 или H100 у российских площадок, снятая летом 2026 года. Покупка железа считается иначе: цена карты делится на срок службы, и к ней добавляются стойка, питание и запасной узел.

Почему в расчёте нет разовых затрат

Они плохо усредняются. Развёртывание, квантование модели, прогон на своих данных и настройка мониторинга занимают от нескольких недель, и стоимость зависит от того, есть ли в компании DevOps и в каком виде лежат документы. Инструмент отвечает на один вопрос — как соотносятся ежемесячные платежи.

Что показывает загрузка железа

Долю расчётной пропускной способности, которую съедает поток. Ёмкость одной карты принята за 900 млн токенов в месяц: 2500 токенов в секунду при батчинге и 100 часов реальной нагрузки. Значения выше 80% означают очереди в пиковые часы.

Открытая модель справится с теми же задачами, что и внешняя

Не со всеми. На извлечении данных из документов, классификации обращений и черновиках по шаблону модели 8–32B держатся близко к внешним. На длинных рассуждениях и редких языках разрыв заметен. Проверяют это одним способом: сотней реальных запросов, размеченных заранее.