[МСК]

Qwen3.8-Max: миллион токенов контекста по $2 за вход

7 августа 2026 · 4 минРазборыМодели

3 августа Alibaba открыла доступ к Qwen3.8-Max. Модель на 2,4 трлн параметров держит до 1 млн токенов за раз и понимает текст, изображения и видео. Тариф — $2 за миллион входных токенов и $6 за выходные. На следующей неделе обещаны открытые веса.

Цифра, ради которой стоит читать дальше, — не параметры. Миллион токенов контекста.

1 млн
токенов контекста за один запрос
$2
за миллион входных токенов
$6
за миллион выходных токенов
2,4 трлн
параметров, архитектура «смесь экспертов»
Источник: Ньюсрум Alibaba, 3 августа 2026; prospect.com.ru, delo.ua

Длинный документ перестал разрезаться на куски

Раньше договор на четыреста страниц в модель целиком не влезал. Его резали, каждый кусок обрабатывали отдельно, потом склеивали ответы. На склейке терялись перекрёстные ссылки: пункт 4.2 отсылает к приложению, приложение уехало в другой запрос.

Миллион токенов — это примерно тысячи страниц текста разом. Вместо нарезки — один запрос. Подробнее про то, как считается контекстное окно и почему токен не равен слову.

Второе отличие — обещанные открытые веса. Их выкладывают на неделе после релиза, то есть в районе 10 августа. Что такое открытые веса и зачем они бизнесу: модель можно скачать и запустить на своём железе, без обращения к чужому API.

Закрытые модели OpenAI, Anthropic, Google
Qwen3.8-Max
Число параметров
не раскрывается
2,4 трлн, заявлено вендором
Веса
не выкладываются
публикация обещана через неделю после релиза
Запуск на своём железе
недоступен
станет возможен после публикации весов
Тариф
у каждого свой
$2 вход / $6 выход за млн токенов
Закрытая западная модель и Qwen3.8-Max — что различается по факту · Источник: Ньюсрум Alibaba, prospect.com.ru, themoscowtimes.com, delo.ua, август 2026

Считать надо не тариф, а объём операций

Тариф в долларах за миллион токенов на вопрос «сколько это стоит» не отвечает. Отвечает расчёт на конкретном потоке.

Возьмём разбор входящих документов. Методика: средний договор — 20 страниц, страница — около 500 слов, слово в русском тексте — примерно 1,5 токена. Выходит 15 000 входных токенов на документ. Ответ модели — структурированная выжимка на 1 500 выходных токенов. Курс — 80 ₽ за доллар.

Один документ: 15 000 × $2/1 000 000 = $0,03 на вход, 1 500 × $6/1 000 000 = $0,009 на выход. Итого $0,039, или около 3,1 ₽.

Тысяча документов в месяц — примерно 3 100 ₽ по тарифу. Это плата за вызовы модели, и только за них. В смету внедрения она входит третьей строкой после разработки и поддержки — что именно складывается в общую сумму, разобрано в материале про стоимость внедрения ИИ.

Ориентир держится на трёх допущениях: объём документа, длина ответа, курс. Поменяйте любое — пересчитайте. Проверить порядок цифр на своём потоке помогает калькулятор бюджета на ИИ.

100 документов
310 рублей в месяц
1 000 документов
3100 рублей в месяц
10 000 документов
31000 рублей в месяц
Расчётный расход на разбор документов, тариф Qwen3.8-Max · Источник: Тариф Alibaba $2/$6 за млн токенов (ньюсрум Alibaba, 3 августа 2026; delo.ua); расчёт на 15 000 входных и 1 500 выходных токенов на документ, курс 80 ₽/$

Цифра выглядит маленькой, и это правда только про строку тарифа. Часы на подготовку данных, на проверку выдачи и на переделку промптов в неё не входят.

Расклад меняется для трёх профилей

У кого документы длиннее прежнего предела. Проектная документация, многотомные договоры, техрегламенты, архивы переписки. Раньше их резали на части и мирились с потерей связей между разделами. Что сделать на этой неделе: взять три самых длинных документа из реального потока, посчитать в них токены, сравнить с миллионом. Если укладываются — нарезка больше не нужна.

Кто упирался в цену на большом потоке. При десятках тысяч операций в месяц разница в тарифе перестаёт быть погрешностью. Сравнивать имеет смысл не только с западными моделями: DeepSeek V4 Flash вышел раньше и держит другой тариф. Что сделать: выгрузить месячную статистику по объёму текста и пересчитать её по двум тарифам.

Кому нужен свой контур. Медицина, финансы, работа с персональными данными. Открытые веса означают, что после публикации модель можно поставить on-premise и не отдавать документы наружу. Что сделать: дождаться публикации весов и запросить у ИТ оценку железа — модель на 2,4 трлн параметров требований к оборудованию не отменяет.

Прежней версии хватает чаще, чем кажется

Флагман нужен там, где задача правда сложная. Классификация обращений по десяти категориям, извлечение полей из типового счёта, короткие ответы по базе знаний — на этом разница между моделями съедается разницей в качестве данных.

Миллион токенов контекста не заменяет RAG. Загонять весь корпус документов в каждый запрос — значит платить за вход по полной на каждом вызове. Поиск по векторной базе подаёт модели три нужных абзаца вместо тысячи страниц, и на потоке это дешевле.

Отдельно про безопасность: доступность мощной модели с открытыми весами упрощает не только полезные сценарии. Тот же инструмент годится для убедительного фишинга и разбора украденных данных — на это указывают в CISOClub. Значит, требования к проверке входящих писем растут независимо от того, внедряется модель в компании или нет.

Про Россию известно немногое

Модель заявлена как доступная для тестирования пользователям по всему миру. Порядок оплаты API из России в источниках не описан — ни про карты, ни про партнёров-реселлеров, ни про юрлица. Пока это открытый вопрос, а не решённый.

Размещение данных при работе через облако Alibaba в публикациях тоже не раскрыто. Для персональных данных это ключевой пункт: требования к обработке разбирались в материале про приказ ФСТЭК.

Открытые веса этот вопрос закрывают иначе — через локальный запуск. Но веса пока не опубликованы, обещаны на неделе.

Что пока не известно: реальные замеры скорости ответа, лицензия на веса, условия оплаты из России, политика хранения данных в облаке Alibaba. Заявления о сравнении с западными флагманами исходят от вендора и независимо не подтверждены.

Источник: prospect.com.ru