
Три цента за задачу: на чём экономит DeepSeek V4-Flash
Выполнение одной типовой задачи на DeepSeek V4-Flash замерили в 3 цента. У Claude Fable 5 на том же замере вышло 3,15 доллара. Разрыв — примерно в 105 раз. Такие числа расширяют список задач, которые имеет смысл отдавать модели.
Цифры ниже — расчётные ориентиры для компании соответствующего профиля, а не отчёт по конкретному внедрению. У каждой указана методика, чтобы расчёт можно было повторить на своих данных.
Прайс показывает половину картины
Заявленный тариф простой: 0,14 доллара за миллион входных токенов и 0,28 доллара за миллион выходных. По этой строке модель встаёт в первую тройку самых дешёвых на рынке.
Но аналитики Artificial Analysis считают иначе. Они мерили стоимость целой задачи в режиме сложных рассуждений с максимальной вычислительной нагрузкой. Тестировали сборку V4-Flash-0731.
Разница между двумя способами счёта существенная. Модель с низким прайсом может тратить больше токенов, пока ищет решение. Поэтому разрыв по прайс-листу и разрыв по стоимости задачи не совпадают.
Десять тысяч писем в месяц укладываются в две тысячи рублей
Прайс в долларах за миллион токенов на вопрос «сколько это стоит» не отвечает. Поэтому — расчёт.
Что заложено. Профиль запроса: 10 000 входных токенов и 2 000 выходных. Это письмо с историей переписки плюс короткий структурированный ответ. Тариф — заявленные 0,14 и 0,28 доллара. Стоимость одного такого запроса выходит около 0,2 цента.
Объём. 10 000 запросов в месяц — примерно 500 обращений в рабочий день.
Итог. Около 20 долларов в месяц. По курсу 80 ₽ за доллар — примерно 1 600 ₽. Кэширование повторяющихся кусков промпта в расчёт не заложено, с ним счёт ниже.
Второй расчёт — для задач посложнее. Тысяча задач в режиме сложных рассуждений по замеру Artificial Analysis обходится в 30 долларов, около 2 400 ₽. Та же тысяча на Claude Fable 5 по тому же замеру — 3 150 долларов, около 252 000 ₽.
Что в расчёт не входит: разработка промптов, тесты, приёмка, ручная вычитка ответов. Обычно эти статьи и определяют смету, а счёт за запросы оказывается меньшей её частью. Прикинуть полную картину помогает калькулятор бюджета на ИИ.
50 баллов хватает там, где ответ проверяется за секунду
В Intelligence Index от Artificial Analysis модель набрала 50 баллов из 100. Столько же у Google Gemini 3.6 Flash. Выше стоят Kimi K3 с 57 баллами, а также модели OpenAI и Anthropic.
Сам по себе балл ничего не говорит. Говорит вот что: на классификации обращений, извлечении полей из накладной, коротком ответе по инструкции разница между 50 и 57 баллами обычно теряется в шуме. Такие ответы проверяются глазом за секунду.
На длинных цепочках рассуждений картина другая. Юридический вывод, сверка условий договора, многошаговый разбор с ветвлениями — здесь каждый лишний балл превращается в число правок. Разработчик сам ставит на соотношение цены и качества, а более сильную V4-Pro готовит отдельно.
Расклад меняется у трёх профилей
Поток однотипных разборов. Первичка, входящие обращения, извлечение артикулов из писем. Пятизначный месячный объём при таком тарифе перестаёт упираться в счёт за API. Что сделать на этой неделе: посчитать реальное число запросов и средний объём текста в каждом.
Отложенные пилоты. Часть проектов останавливалась на строчке «расходы на запросы» в смете. При стоимости задачи в три цента эта строка перестаёт быть аргументом против. Что сделать: достать старый расчёт и пересчитать по новому тарифу.
Агентные циклы. Там, где один результат стоит десятков вызовов модели, цена запроса умножается на глубину цепочки. Дешёвый шаг делает длинные сценарии считаемыми. Что сделать: замерить, сколько вызовов уходит на один готовый результат.
Похожий сдвиг уже проходили при снижении цен на API у OpenAI. Ценовая конкуренция стала отдельным сюжетом рынка: считают уже не качество генерации, а расходы на миллион запросов.
Экономия появляется от объёма
Есть обратная сторона. При тысяче запросов в месяц счёт и по прежней модели измеряется сотнями рублей. Переезд — переписанные промпты, новые тесты, повторная приёмка — съедает выигрыш за первый же месяц. Порог, ниже которого смена модели окупается плохо, каждый считает на своих числах: сравниваются месячная экономия и разовая стоимость переезда.
Второе условие — задача с проверяемым результатом. Там, где ответ нельзя сверить за секунду, дешевизна вызова роли не играет: время уходит на вычитку.
Третье — порядок в данных. Если документы лежат в трёх системах и в почте, цена запроса на итог не влияет вовсе.
Про Россию первоисточник молчит
Условия оплаты из России в сообщении о релизе не приводятся. Способы доступа, размещение данных, соответствие требованиям к персональным данным — тоже. Строить предположения тут нечего: проверяется на странице поставщика доступа перед первым платежом.
Отдельный вопрос — размещение модели в собственном контуре. Условия лицензии и требования к железу в первоисточнике не названы.
Чего пока не известно: сроки полноценного релиза V4-Pro; условия лицензии на веса; предел контекста и скорость ответа V4-Flash; тарифы на кэшированный вход из официального прайса; поведение модели на русскоязычных документах — публичных замеров на русском в источнике нет.
Модель не стала умнее лидеров рейтинга. Она сделала дешёвыми те задачи, где сильный разум и не требовался. Для потоковой работы этого обычно достаточно.
Обсудим задачу?
Расскажите о процессе — предложим, где ИИ окупится быстрее всего.
Ещё по теме

Qwen3.8-Max: миллион токенов контекста по $2 за вход
Alibaba выложила флагманскую модель с 2,4 трлн параметров и контекстом до 1 млн токенов. Что это меняет в расчёте бюджета на длинные документы.

Цена внедрения ИИ: девять строк сметы и три забытых
Вилка от 500 тысяч до нескольких миллионов складывается из девяти строк расходов. Смета разобрана по частям, включая три, которых обычно нет в предложениях.