
Qwen3.8-Max: миллион токенов контекста по $2 за вход
3 августа Alibaba открыла доступ к Qwen3.8-Max. Модель на 2,4 трлн параметров держит до 1 млн токенов за раз и понимает текст, изображения и видео. Тариф — $2 за миллион входных токенов и $6 за выходные. На следующей неделе обещаны открытые веса.
Цифра, ради которой стоит читать дальше, — не параметры. Миллион токенов контекста.
Длинный документ перестал разрезаться на куски
Раньше договор на четыреста страниц в модель целиком не влезал. Его резали, каждый кусок обрабатывали отдельно, потом склеивали ответы. На склейке терялись перекрёстные ссылки: пункт 4.2 отсылает к приложению, приложение уехало в другой запрос.
Миллион токенов — это примерно тысячи страниц текста разом. Вместо нарезки — один запрос. Подробнее про то, как считается контекстное окно и почему токен не равен слову.
Второе отличие — обещанные открытые веса. Их выкладывают на неделе после релиза, то есть в районе 10 августа. Что такое открытые веса и зачем они бизнесу: модель можно скачать и запустить на своём железе, без обращения к чужому API.
Считать надо не тариф, а объём операций
Тариф в долларах за миллион токенов на вопрос «сколько это стоит» не отвечает. Отвечает расчёт на конкретном потоке.
Возьмём разбор входящих документов. Методика: средний договор — 20 страниц, страница — около 500 слов, слово в русском тексте — примерно 1,5 токена. Выходит 15 000 входных токенов на документ. Ответ модели — структурированная выжимка на 1 500 выходных токенов. Курс — 80 ₽ за доллар.
Один документ: 15 000 × $2/1 000 000 = $0,03 на вход, 1 500 × $6/1 000 000 = $0,009 на выход. Итого $0,039, или около 3,1 ₽.
Тысяча документов в месяц — примерно 3 100 ₽ по тарифу. Это плата за вызовы модели, и только за них. В смету внедрения она входит третьей строкой после разработки и поддержки — что именно складывается в общую сумму, разобрано в материале про стоимость внедрения ИИ.
Ориентир держится на трёх допущениях: объём документа, длина ответа, курс. Поменяйте любое — пересчитайте. Проверить порядок цифр на своём потоке помогает калькулятор бюджета на ИИ.
Цифра выглядит маленькой, и это правда только про строку тарифа. Часы на подготовку данных, на проверку выдачи и на переделку промптов в неё не входят.
Расклад меняется для трёх профилей
У кого документы длиннее прежнего предела. Проектная документация, многотомные договоры, техрегламенты, архивы переписки. Раньше их резали на части и мирились с потерей связей между разделами. Что сделать на этой неделе: взять три самых длинных документа из реального потока, посчитать в них токены, сравнить с миллионом. Если укладываются — нарезка больше не нужна.
Кто упирался в цену на большом потоке. При десятках тысяч операций в месяц разница в тарифе перестаёт быть погрешностью. Сравнивать имеет смысл не только с западными моделями: DeepSeek V4 Flash вышел раньше и держит другой тариф. Что сделать: выгрузить месячную статистику по объёму текста и пересчитать её по двум тарифам.
Кому нужен свой контур. Медицина, финансы, работа с персональными данными. Открытые веса означают, что после публикации модель можно поставить on-premise и не отдавать документы наружу. Что сделать: дождаться публикации весов и запросить у ИТ оценку железа — модель на 2,4 трлн параметров требований к оборудованию не отменяет.
Прежней версии хватает чаще, чем кажется
Флагман нужен там, где задача правда сложная. Классификация обращений по десяти категориям, извлечение полей из типового счёта, короткие ответы по базе знаний — на этом разница между моделями съедается разницей в качестве данных.
Миллион токенов контекста не заменяет RAG. Загонять весь корпус документов в каждый запрос — значит платить за вход по полной на каждом вызове. Поиск по векторной базе подаёт модели три нужных абзаца вместо тысячи страниц, и на потоке это дешевле.
Отдельно про безопасность: доступность мощной модели с открытыми весами упрощает не только полезные сценарии. Тот же инструмент годится для убедительного фишинга и разбора украденных данных — на это указывают в CISOClub. Значит, требования к проверке входящих писем растут независимо от того, внедряется модель в компании или нет.
Про Россию известно немногое
Модель заявлена как доступная для тестирования пользователям по всему миру. Порядок оплаты API из России в источниках не описан — ни про карты, ни про партнёров-реселлеров, ни про юрлица. Пока это открытый вопрос, а не решённый.
Размещение данных при работе через облако Alibaba в публикациях тоже не раскрыто. Для персональных данных это ключевой пункт: требования к обработке разбирались в материале про приказ ФСТЭК.
Открытые веса этот вопрос закрывают иначе — через локальный запуск. Но веса пока не опубликованы, обещаны на неделе.
Что пока не известно: реальные замеры скорости ответа, лицензия на веса, условия оплаты из России, политика хранения данных в облаке Alibaba. Заявления о сравнении с западными флагманами исходят от вендора и независимо не подтверждены.
Let’s discuss your project?
Tell us about your process — we’ll suggest where AI pays off fastest.
Related articles

Три цента за задачу: на чём экономит DeepSeek V4-Flash
DeepSeek V4-Flash: около 3 центов за типовую задачу против 3,15 доллара у Claude Fable 5. Пересчёт тарифа в рубли на месячном объёме и профили, где это меняет расклад.

Что такое токен и почему за него платят
Токен — это кусочек текста примерно в три четверти слова: модель читает запрос токенами, и поставщик выставляет счёт за их количество.