[UTC+3]

Токен

Token

In short

Токен — это кусочек текста примерно в три четверти слова: модель читает запрос токенами, и поставщик выставляет счёт за их количество.

Зачем это знать

  • Понять, за что именно приходит счёт за ИИ и как он вырастет при росте объёма
  • Знать, почему обработка русских документов стоит дороже английских при одном тарифе
  • Спрашивать подрядчика цену за операцию, а не только за проект

Что такое токен простыми словами

Телеграмму когда-то оплачивали по словам. Короткое слово — одна единица, длинное могли посчитать за две. Отправитель платил за штуки, поэтому текст сжимали до предела: «выезжаю вторник встречайте».

Языковые модели считают так же. Единица счёта — токен, кусочек текста примерно в три четверти английского слова. Частые слова становятся одним токеном, редкие разваливаются на части: «недоукомплектованность» превратится в пять-шесть кусочков.

Отсюда главное для бюджета. Поставщик считает деньги по количеству кусочков, которые модель прочитала и написала. Ни страницы, ни документы, ни обращения в счёте не участвуют. Тариф называют за миллион токенов, отдельно за входные и отдельно за выходные.

Как это работает

  1. Текст режут на токены. Тем же способом режут всё: вопрос пользователя, служебную инструкцию, приложенные документы, предыдущие реплики разговора.
  2. Считают входные токены. Это весь объём, ушедший в модель за одно обращение. Здесь прячется основная статья расходов: инструкция на шесть страниц отправляется заново при каждом запросе.
  3. Ответ модель пишет по одному токену. Это выходные токены. У распространённых моделей они стоят в три-пять раз дороже входных, поэтому развёрнутый ответ обходится заметно дороже короткого.
  4. Складывают и умножают на тариф. Себестоимость одного обращения = входные × цена входа + выходные × цена выхода. Дальше умножается на месячный объём.
  5. Проверяют язык. Русский текст даёт больше токенов на тот же смысл. Страница на 1 800 знаков — порядка 450 токенов на английском и 700–900 на русском. Точную цифру для своих документов даёт счётчик токенов той модели, с которой работаете.

Отдельно стоит следить за длиной разговора. В чате модель не помнит прошлое сама: всю историю переписки ей отправляют заново при каждой реплике. К двадцатому сообщению входной объём вырастает в разы, а вместе с ним и цена реплики.

Пример из практики

Интернет-магазин обрабатывал моделью около 12 000 обращений в поддержку в месяц. В каждое обращение уходила инструкция на шесть страниц, карточка товара и вся история переписки — в среднем 9 000 входных токенов и 350 выходных. На тарифах модели среднего уровня выходило примерно 2,6 ₽ за диалог, около 31 000 ₽ в месяц.

Сделали три вещи: перевели служебную инструкцию на английский (4 500 токенов стали 2 300), включили кэширование её постоянной части и стали передавать четыре последние реплики вместо всей переписки. Ответы клиентам остались на русском.

Входной объём упал до 3 200 токенов на диалог. Кэширование добавило скидку: за повторную отправку одной и той же инструкции поставщик берёт по сниженной цене. Счёт снизился до 14 000 ₽ в месяц — входных токенов стало почти втрое меньше, но выходные остались прежними, поэтому счёт упал не так сильно, как объём. Качество сверяли на одной выборке из 300 диалогов до и после: доля переводов на живого оператора не изменилась.

Что это даёт бизнесу

  • Счёт становится расчётной величиной. Себестоимость одной операции умножается на объём, и бюджет на год считается до старта, а не выясняется по факту. Порядок суммы для своего процесса можно прикинуть калькулятором бюджета.
  • Появляются понятные рычаги. Сокращение инструкции, кэширование постоянной части, обрезка истории, перевод служебного текста на английский — четыре приёма, которые в примере выше снизили счёт больше чем вдвое и не потребовали переписывать систему.
  • Предложения подрядчиков сравниваются честно. Цена за миллион токенов ничего не говорит без объёма. Цена за разбор одного счёта или один диалог поддержки сравнима напрямую.
  • Снимается риск роста расходов. Система, где входной объём растёт вместе с длиной разговора, при удвоении нагрузки дорожает больше чем вдвое. Это видно заранее, если считать в токенах.

Когда без этого можно обойтись

При небольших объёмах считать токены незачем. Несколько сотен обращений в месяц при тарифах из примера выше дают счёт около тысячи рублей — время на оптимизацию стоит дороже всей экономии.

Токены ни при чём и там, где куплена подписка с фиксированной платой за пользователя: там оплачивают рабочие места и упираются в лимиты запросов, объём текста на цену не влияет. То же с моделью, развёрнутой на своём оборудовании: платят за видеокарты и их обслуживание, и токены остаются технической величиной без ценника.

Что важно проверить

Первое: каждая модель режет текст на токены по-своему, один и тот же русский текст может дать на 10–20 процентов больше или меньше. Поэтому сравнение поставщиков по цене за миллион вводит в заблуждение — считать нужно стоимость своей типичной операции на своих текстах.

Второе: рассуждающие модели тратят токены на внутреннее обдумывание, которого вы не видите в ответе, но которое попадает в счёт. На сложных задачах невидимая часть бывает больше самого ответа. Проверять это надо на реальных запросах до запуска.

Третье: попросите подрядчика показать разбивку входного объёма одной операции — сколько занимает инструкция, сколько приложенные документы, сколько история переписки. Без такой разбивки любое обещание удешевить работу проверить нечем, а именно по ней видно, что сокращать в первую очередь.

FAQ

Токен простыми словами — это что?

Это кусочек текста, которым модель меряет всё: и объём запроса, и объём ответа, и деньги. В английском один токен — примерно три четверти слова. В русском слова чаще разваливаются на два-три куска. Счёт от поставщика выставляется за количество токенов, а не за число обращений или страниц.

Сколько токенов в странице текста

Страница делового документа — около 1 800 знаков с пробелами. На русском это обычно 700–900 токенов, тот же текст в переводе на английский — около 450. Разброс большой: каждая модель режет текст по-своему, у распространённых моделей расхождение доходит до 10–20 процентов. Для расчёта берите результат счётчика той модели, с которой работаете, а цифры выше — только для прикидки.

Почему русский текст дороже английского

Модели учат в основном на английском, поэтому английские слова целиком попали в словарь токенов, а русские приходится собирать из кусков. Один и тот же смысл на русском занимает примерно в полтора-два раза больше токенов. При равном тарифе за миллион токенов обработка русского документа обходится во столько же раз дороже.

Что можно перевести на английский ради экономии

На английский переводят постоянную служебную часть: инструкцию для модели, описание формата ответа, примеры разбора. Её видит только модель, и на качестве русских ответов это обычно не сказывается. Документы клиентов и сами ответы остаются на русском. Экономия заметна там, где служебная часть занимает больше половины входного объёма. Эффект проверяют замером на своей выборке до и после.

Как считать бюджет в токенах

Возьмите одну типичную операцию, посчитайте входные и выходные токены счётчиком поставщика, умножьте на тариф и на месячный объём. Получится себестоимость обращения и месячный счёт. Отдельно посчитайте самую тяжёлую операцию — длинный диалог или большой документ: она задаёт верхнюю границу счёта. Дальше любое изменение системы оценивают этой же формулой, до того как его начнут делать.