[UTC+3]

Три цента за задачу: на чём экономит DeepSeek V4-Flash

6 августа 2026 · 4 minРазборыМодели

Выполнение одной типовой задачи на DeepSeek V4-Flash замерили в 3 цента. У Claude Fable 5 на том же замере вышло 3,15 доллара. Разрыв — примерно в 105 раз. Такие числа расширяют список задач, которые имеет смысл отдавать модели.

Цифры ниже — расчётные ориентиры для компании соответствующего профиля, а не отчёт по конкретному внедрению. У каждой указана методика, чтобы расчёт можно было повторить на своих данных.

$0,14
за миллион входных токенов
$0,28
за миллион выходных токенов
$0,03
средняя стоимость одной задачи на замере
50/100
балл в Intelligence Index
Источник: Artificial Analysis, замер V4-Flash-0731; тарифы разработчика, по данным tks.ru от 4 августа 2026

Прайс показывает половину картины

Заявленный тариф простой: 0,14 доллара за миллион входных токенов и 0,28 доллара за миллион выходных. По этой строке модель встаёт в первую тройку самых дешёвых на рынке.

Но аналитики Artificial Analysis считают иначе. Они мерили стоимость целой задачи в режиме сложных рассуждений с максимальной вычислительной нагрузкой. Тестировали сборку V4-Flash-0731.

Разница между двумя способами счёта существенная. Модель с низким прайсом может тратить больше токенов, пока ищет решение. Поэтому разрыв по прайс-листу и разрыв по стоимости задачи не совпадают.

DeepSeek V4-Flash
0.03 долларов за задачу
Kimi K3
0.86 долларов за задачу
GPT-5.6 Sol
1.86 долларов за задачу
Claude Fable 5
3.15 долларов за задачу
Стоимость выполнения одной задачи · Источник: Artificial Analysis, режим сложных рассуждений с максимальной нагрузкой; по данным tks.ru от 4 августа 2026

Десять тысяч писем в месяц укладываются в две тысячи рублей

Прайс в долларах за миллион токенов на вопрос «сколько это стоит» не отвечает. Поэтому — расчёт.

Что заложено. Профиль запроса: 10 000 входных токенов и 2 000 выходных. Это письмо с историей переписки плюс короткий структурированный ответ. Тариф — заявленные 0,14 и 0,28 доллара. Стоимость одного такого запроса выходит около 0,2 цента.

Объём. 10 000 запросов в месяц — примерно 500 обращений в рабочий день.

Итог. Около 20 долларов в месяц. По курсу 80 ₽ за доллар — примерно 1 600 ₽. Кэширование повторяющихся кусков промпта в расчёт не заложено, с ним счёт ниже.

Второй расчёт — для задач посложнее. Тысяча задач в режиме сложных рассуждений по замеру Artificial Analysis обходится в 30 долларов, около 2 400 ₽. Та же тысяча на Claude Fable 5 по тому же замеру — 3 150 долларов, около 252 000 ₽.

Что в расчёт не входит: разработка промптов, тесты, приёмка, ручная вычитка ответов. Обычно эти статьи и определяют смету, а счёт за запросы оказывается меньшей её частью. Прикинуть полную картину помогает калькулятор бюджета на ИИ.

50 баллов хватает там, где ответ проверяется за секунду

В Intelligence Index от Artificial Analysis модель набрала 50 баллов из 100. Столько же у Google Gemini 3.6 Flash. Выше стоят Kimi K3 с 57 баллами, а также модели OpenAI и Anthropic.

Сам по себе балл ничего не говорит. Говорит вот что: на классификации обращений, извлечении полей из накладной, коротком ответе по инструкции разница между 50 и 57 баллами обычно теряется в шуме. Такие ответы проверяются глазом за секунду.

На длинных цепочках рассуждений картина другая. Юридический вывод, сверка условий договора, многошаговый разбор с ветвлениями — здесь каждый лишний балл превращается в число правок. Разработчик сам ставит на соотношение цены и качества, а более сильную V4-Pro готовит отдельно.

Расклад меняется у трёх профилей

Поток однотипных разборов. Первичка, входящие обращения, извлечение артикулов из писем. Пятизначный месячный объём при таком тарифе перестаёт упираться в счёт за API. Что сделать на этой неделе: посчитать реальное число запросов и средний объём текста в каждом.

Отложенные пилоты. Часть проектов останавливалась на строчке «расходы на запросы» в смете. При стоимости задачи в три цента эта строка перестаёт быть аргументом против. Что сделать: достать старый расчёт и пересчитать по новому тарифу.

Агентные циклы. Там, где один результат стоит десятков вызовов модели, цена запроса умножается на глубину цепочки. Дешёвый шаг делает длинные сценарии считаемыми. Что сделать: замерить, сколько вызовов уходит на один готовый результат.

Похожий сдвиг уже проходили при снижении цен на API у OpenAI. Ценовая конкуренция стала отдельным сюжетом рынка: считают уже не качество генерации, а расходы на миллион запросов.

Экономия появляется от объёма

Есть обратная сторона. При тысяче запросов в месяц счёт и по прежней модели измеряется сотнями рублей. Переезд — переписанные промпты, новые тесты, повторная приёмка — съедает выигрыш за первый же месяц. Порог, ниже которого смена модели окупается плохо, каждый считает на своих числах: сравниваются месячная экономия и разовая стоимость переезда.

Второе условие — задача с проверяемым результатом. Там, где ответ нельзя сверить за секунду, дешевизна вызова роли не играет: время уходит на вычитку.

Третье — порядок в данных. Если документы лежат в трёх системах и в почте, цена запроса на итог не влияет вовсе.

Про Россию первоисточник молчит

Условия оплаты из России в сообщении о релизе не приводятся. Способы доступа, размещение данных, соответствие требованиям к персональным данным — тоже. Строить предположения тут нечего: проверяется на странице поставщика доступа перед первым платежом.

Отдельный вопрос — размещение модели в собственном контуре. Условия лицензии и требования к железу в первоисточнике не названы.

Чего пока не известно: сроки полноценного релиза V4-Pro; условия лицензии на веса; предел контекста и скорость ответа V4-Flash; тарифы на кэшированный вход из официального прайса; поведение модели на русскоязычных документах — публичных замеров на русском в источнике нет.

Модель не стала умнее лидеров рейтинга. Она сделала дешёвыми те задачи, где сильный разум и не требовался. Для потоковой работы этого обычно достаточно.

Source: tks.ru