
DeepSeek V4.1 Flash: агентные сценарии считают заново
DeepSeek выложил V4.1 Flash. Модель построена по схеме MoE: 552 млрд параметров всего, на один ответ включается 8–16 млрд. Отсюда цена ответа на уровне лёгкого тарифа.
Считают не параметры, а активацию
В MoE на запрос работает малая часть сети. Здесь это 8–16 млрд из 552 — примерно тридцатая часть. Стоимость вывода считают по активной части, поэтому тяжёлая модель попадает в дешёвый тариф.
По агентным замерам заявлены три числа. Работа в терминале — 90,6 балла против 89,1 у Claude Opus 5 и 88,8 у GPT-5.6. Починка багов в реальных проектах — 74,2.
Что это значит для сметы
Агентные и кодовые сценарии — самая дорогая статья счёта: агент делает десятки вызовов на одну задачу. Перенос такой нагрузки на более дешёвый вывод меняет месячный счёт сильнее, чем любая правка промптов.
Порядок проверки простой: берут неделю реальных запросов, прогоняют через обе модели, сравнивают счёт и долю верных ответов. Оценить порядок цифр заранее помогает калькулятор счёта за инференс.
Чего пока не известно
Цены за токены для российских плательщиков, лицензия и доступность весов для развёртывания в своём контуре, предел контекста и дата открытия API.
Обсудим задачу?
Расскажите о процессе — предложим, где ИИ окупится быстрее всего.
Ещё по теме

OpenAI выпустила GPT-6 Astra: стоимость задачи ниже на 63%
OpenAI показала GPT-6 Astra: на предметном бенчмарке отрыв в 12 пунктов, заявленная цена за задачу на 63% ниже. Смету на агентские сценарии пересчитывают.

Gemini 3.7 Flash вдвое дешевле: смету потока пересчитывают
Google выпустила Gemini 3.7 Flash — дешёвый класс моделей подрос в коде и агентах, вход стоит $0,75 за 1 млн токенов до конца 2026 года.