Релизы и изменения моделей
Qwen в каталоге KeyDealer: четыре модели по 3 ₽
12 сентября 2026 года в живой выдаче GET /v1/models появились четыре модели Qwen: 3.8 Max, 3.7 Max, 3.7 Plus и 3.6 Flash. Все четыре — по 3 ₽ за миллион токенов, одинаково на вход и на выход. Каталог вырос с 49 позиций до 53. В документации Alibaba у всех четырёх заявлен контекст в миллион токенов, а сам разработчик ставит Qwen 3.8 Max в один ряд с GPT-5.5, Claude Opus 4.7 и Gemini 3.1 Pro — которые в нашем же каталоге стоят 30, 40 и 17 ₽ за миллион. Проверено у нас: инструменты, параллельные вызовы, стриминг и JSON-режим. Не проверено и честно помечено: зрение, протоколы Responses и Anthropic Messages, а принудительный выбор инструмента у двух моделей из четырёх просто не работает.
Какие модели Qwen появились в каталоге KeyDealer
Четыре, и все со статусом available:
| ID в API | Название | Для чего заявлена |
|---|---|---|
qwen-3-8-max | Qwen 3.8 Max | Сложные рассуждения, код, длинные контексты |
qwen-3-7-max | Qwen 3.7 Max | Код, анализ, многошаговые агентные задачи |
qwen-3-7-plus | Qwen 3.7 Plus | Многоязычные документы, код, универсальные задачи |
qwen-3-6-flash | Qwen 3.6 Flash | Быстрые ответы, классификация, массовая обработка |
История тут длиннее одного дня. В разборе от 13 августа на вопрос «есть ли Kimi и Qwen в каталоге» честным ответом было «нет»: лендинг их перечислял, а API не отдавал. Месяц спустя ответ поменялся.
Наличие модели проверяют по живой выдаче. Страница со списком — витрина, выдача — контракт.
Сколько стоит миллион токенов Qwen в рублях
3 ₽ за миллион входных и 3 ₽ за миллион выходных токенов — по данным GET /v1/models на 12 сентября 2026 года. Ставка симметричная: выход не дороже входа, хотя у большинства разработчиков моделей он дороже в два-восемь раз — мы разбирали эту асимметрию отдельно.
Где это в каталоге по деньгам:
| Модель | ₽ за миллион (вход и выход) |
|---|---|
| DeepSeek V4 Flash | 1 |
| Qwen (все четыре) | 3 |
| GLM 5.3 Flash | 5 |
| Claude Haiku 4.5 | 8 |
| Claude Sonnet 4.6 | 12 |
| Gemini 3.1 Pro | 17 |
| GPT-5.5 | 30 |
| Claude Opus 4.7 | 40 |
Третий по дешевизне платный уровень каталога. Ниже только DeepSeek V4 Flash и восемь позиций с нулевой ставкой — пять текстовых моделей, модель переранжирования и два генератора изображений. Все рублёвые ставки каталога сведены в отдельной статье про цену миллиона токенов — там же объясняется, почему цена за миллион не равна цене за текст.
Какой контекст у Qwen и сколько это в страницах
Миллион токенов у всех четырёх. В документации Alibaba Cloud Model Studio на 12 сентября 2026 года в графе «контекст» у каждой стоит 1M. Для сравнения, у Qwen 3.6 Max Preview, которого в нашем каталоге нет, там же указано 256 тысяч.
Миллион токенов — это порядка тысячи страниц русского текста, если считать по прикидке из нашего разбора контекстного окна: страница обычного текста занимает около тысячи токенов. Прикидка грубая и зависит от темы и токенизатора, но порядок величины она даёт верный.
Оговорка, которая важнее самой цифры: заявленное окно и рабочее окно — разные вещи. Длинный контекст не бесплатен ни по деньгам, ни по качеству ответа. Отправить в модель весь репозиторий технически можно; получить от этого пользу — отдельная задача.
Какие Qwen разработчик рекомендует, а какие убрал из первой линии
Рекомендованы два из четырёх: Qwen 3.8 Max и Qwen 3.7 Plus. Qwen 3.7 Max и Qwen 3.6 Flash разработчик держит в разделе старых моделей.
Это видно только в исходной документации. Страница текстовых моделей Alibaba на 12 сентября 2026 года разделена на два блока: «рекомендуемые модели» и «старые модели» — с пометкой, что перечисленные ниже больше не являются первым выбором.
Из наших четырёх:
- Qwen 3.8 Max и Qwen 3.7 Plus — в блоке рекомендованных. Для чат-ботов, генерации контента, суммаризации и работы с документами разработчик прямо советует 3.7 Plus как баланс возможностей и стоимости, а 3.8 Max — когда нужны максимальные рассуждения.
- Qwen 3.7 Max и Qwen 3.6 Flash — в блоке старых. Работать они не перестали, но первой линией их разработчик уже не считает.
Это не повод их не брать. Это повод знать, что у них другой горизонт жизни: модель, которую вендор убрал из рекомендаций, рано или поздно уезжает в расписание отключений. Даты по нашему каталогу мы держим в календаре отключений; у Qwen публичного расписания отключений в открытой документации мы не нашли.
С какими моделями Alibaba сравнивает Qwen 3.8 Max
С GPT-5.5, Claude Opus 4.7 и Gemini 3.1 Pro. Так Alibaba сама расставляет свои модели против закрытых в таблице соответствия на той же странице документации:
| Уровень | С чем сравнивает разработчик | Что советует у себя |
|---|---|---|
| Высокие способности | GPT-5.5, Claude Opus 4.7, Gemini 3.1 Pro | qwen3.8-max |
| Баланс | GPT-5.4, Claude Sonnet 4.6, Gemini 3 Pro | qwen3.7-plus |
| Лёгкий и дешёвый | GPT-5.4-mini, Claude Haiku 4.5, Gemini 3.1 Flash | qwen3.8-flash |
Это заявление вендора о себе. Независимого замера за ним не стоит, и читать его надо с поправкой. Но оно хотя бы конкретное и проверяется на своей задаче: три модели из левой колонки верхней строки есть в нашем каталоге по 30, 40 и 17 ₽ за миллион, а предложенная замена — по 3 ₽.
Разрыв слишком большой, чтобы верить на слово, и слишком большой, чтобы не проверить. Прогоните свои реальные промпты через обе модели и сравните ответы — это стоит десятки рублей, а не десятки тысяч.
Что из возможностей Qwen проверено в каталоге, а что нет
Проверены и работают: chat completions, стриминг, вызов инструментов, параллельные вызовы, стриминг с инструментами и JSON-режим. Не проверены: зрение и протоколы Responses и Anthropic Messages. Принудительный выбор инструмента у двух моделей из четырёх не поддержан.
Каждая модель в каталоге несёт поле capabilities, где у возможности три состояния: verified, unsupported и unknown. Мы не пишем «модель умеет», пока не проверили сами. Отметка о проверке лежит в поле capabilities_verified_at — 11 сентября 2026 года, 21:27 UTC:
| Возможность | Qwen 3.8 Max | Qwen 3.7 Max | Qwen 3.7 Plus | Qwen 3.6 Flash |
|---|---|---|---|---|
| Chat completions | проверено | проверено | проверено | проверено |
| Стриминг | проверено | проверено | проверено | проверено |
| Вызов инструментов | проверено | проверено | проверено | проверено |
| Параллельные вызовы | проверено | проверено | проверено | проверено |
| Стриминг с инструментами | проверено | проверено | проверено | проверено |
| JSON-режим | проверено | проверено | проверено | проверено |
| Принудительный выбор инструмента | не поддержан | проверено | не поддержан | проверено |
| Зрение | не проверено | не проверено | не проверено | не проверено |
| Responses, Anthropic Messages | не проверено | не проверено | не проверено | не проверено |
Две строки надо объяснить.
Принудительный выбор инструмента — это когда вы передаёте tool_choice с именем конкретной функции и требуете вызвать именно её. У Qwen 3.8 Max и Qwen 3.7 Plus маршрут такой запрос отклоняет — мы пробовали несколько форматов подряд, отбиваются все. Обычный вызов инструментов при этом работает: модель сама решает, что дёрнуть. Если ваш агент строится на жёстком принуждении — берите 3.7 Max или 3.6 Flash, у них это проверено.
Зрение. В документации разработчика Qwen 3.8 Max и 3.7 Plus перечислены среди моделей, понимающих изображения. У нас это не проверено, поэтому в каталоге стоит unknown, и обещать мы ничего не будем. Генерация изображений и видео у Alibaba — вообще отдельная линейка, и её в каталоге KeyDealer нет. Если задача не «встроить модель в свой код», а «получить готовый ролик, фото или карусель» — это соседний слой, им занимается TrendMix, где цена видна до генерации.
Протоколы Responses и Anthropic Messages у всех четырёх стоят в статусе review — они ещё не открыты. Работает chat completions, и его достаточно для большинства интеграций.
Почему за кэш промптов у Qwen скидки нет
У всех четырёх моделей prompt_cache.status равен unsupported. Формулировка в самой выдаче прямая: попадания в кэш наблюдаться могут, но и кэшированный вход, и запись в кэш считаются по обычной входной ставке, пока не опубликована проверенная скидка.
Не закладывайте в расчёт экономию на повторяющемся системном промпте. У моделей с подтверждённым кэшем повторно отправленный контекст обходится дешевле; здесь — нет. Считайте по полной ставке. Появится скидка — хорошо, но бюджет она не спасёт.
Симметричная ставка 3 ₽ отчасти это компенсирует: у большинства моделей платить приходится по двум разным ценникам, и выходной обычно кусается сильнее.
Как подключить Qwen и на чём это реально экономит
Через OpenAI-совместимый эндпойнт: меняете в коде адрес и идентификатор модели, остальное остаётся как было.
from openai import OpenAI
client = OpenAI(
api_key="ваш ключ KeyDealer",
base_url="https://api.keydealer.ru/v1",
)
response = client.chat.completions.create(
model="qwen-3-7-plus",
messages=[{"role": "user", "content": "Сократи договор до пяти пунктов"}],
)
print(response.choices[0].message.content)
Теперь деньги. Возьмём рабочую нагрузку среднего размера: 50 миллионов входных токенов и 5 миллионов выходных в месяц — это примерно суммаризатор документов или внутренний ассистент на небольшую команду.
| Модель | Расход за месяц |
|---|---|
| Qwen (любая из четырёх) | 165 ₽ |
| Gemini 3.1 Pro | 935 ₽ |
| GPT-5.5 | 1 650 ₽ |
| Claude Opus 4.7 | 2 200 ₽ |
Между Qwen и Opus 4.7 — 2 035 ₽ разницы в месяц, то есть в 13,3 раза. Это не значит, что Qwen заменит Opus на вашей задаче: заменит или нет, покажет только прогон ваших промптов. Но разница такого порядка меняет саму постановку вопроса. Когда дешёвая модель стоит в тринадцать раз меньше, у неё появляется право на две попытки и на проверку результата третьей моделью — и это всё равно выйдет дешевле одного вызова флагмана.
Схема, которая обычно и выигрывает: черновая обработка объёма на Qwen, финальная выжимка на Sonnet или Opus. Классификация, извлечение полей, первичная суммаризация, разметка — на таких задачах разрыв в качестве между уровнями меньше, чем разрыв в цене.
И честная граница: там, где цена ошибки высока — юридические заключения, финансовые расчёты, код в продакшене без ревью — экономия в 2 000 ₽ не стоит риска. Дешёвая модель хороша на объёме, а не на ответственности.
Что держать в голове
Главное тут не четыре новые строки в списке, а то, что у каталога появился этаж между бесплатными позициями и средним уровнем — раньше его просто не было. Заявка разработчика на сопоставимость с флагманами громкая. Наша таблица её не доказывает и не опровергает; доказывают ваши промпты.
Что стоит сделать в ближайшие дни, если вы уже платите за токены:
- Найдите в своей интеграции самый объёмный и наименее ответственный вызов — обычно это предобработка или классификация.
- Прогоните на нём
qwen-3-7-plusрядом с текущей моделью и сравните ответы вручную на двух десятках примеров. - Если результат приемлем — переключите только этот вызов, остальное оставьте как есть.
- Через неделю сверьте расход в кабинете.
Чего мы не утверждаем: что Qwen лучше или хуже перечисленных моделей на вашей задаче, что зрение у него работает через наш маршрут, что скидка за кэш появится, и что модели из блока «старых» проживут долго. Всё это либо не проверено, либо не опубликовано — так и написано в выдаче каталога, без обтекаемых формулировок.
Актуальный статус любой модели всегда смотрите в живой выдаче GET /v1/models и в кабинете: каталог меняется быстрее, чем выходят статьи. Как мы проверяем факты — на странице о проекте. Ключ заводится за минуту: keydealer.ru/login.
Частые вопросы
Какие модели Qwen доступны в KeyDealer?
На 12 сентября 2026 года четыре: Qwen 3.8 Max, Qwen 3.7 Max, Qwen 3.7 Plus и Qwen 3.6 Flash. Все четыре отдаются живым GET /v1/models со статусом available по протоколу chat completions.
Сколько стоит Qwen в рублях?
3 ₽ за миллион токенов, одинаково на входе и на выходе, у всех четырёх моделей. Это третий по дешевизне платный уровень каталога после DeepSeek V4 Flash за 1 ₽ и восьми позиций с нулевой ставкой.
Какой у Qwen контекст?
В документации Alibaba Cloud Model Studio у всех четырёх моделей указан миллион токенов. У Qwen 3.6 Max Preview, которого в нашем каталоге нет, — 256 тысяч.
Работают ли у Qwen вызовы инструментов?
Обычные вызовы, параллельные вызовы, ответы инструментов, стриминг с инструментами и JSON-режим проверены на всех четырёх. Принудительный выбор конкретного инструмента у Qwen 3.8 Max и Qwen 3.7 Plus помечен как неподдерживаемый — маршрут отклоняет такой запрос.
Есть ли у Qwen скидка за кэш промптов?
Нет. В каталоге у всех четырёх prompt_cache стоит в статусе unsupported: попадания в кэш могут случаться, но и кэшированный вход, и запись в кэш считаются по обычной входной ставке.
Можно ли обращаться к Qwen через протокол Responses или Anthropic Messages?
Пока нет. В выдаче каталога оба протокола у Qwen стоят в статусе review — они ещё не открыты. Работает chat completions.
Как подключить Qwen из России?
Через OpenAI-совместимый эндпойнт https://api.keydealer.ru/v1 с ключом KeyDealer: в коде меняются адрес и идентификатор модели, оплата рублями, VPN и зарубежная карта не нужны.
Чем Qwen 3.8 Max отличается от Qwen 3.7 Plus?
Ценой в каталоге они не отличаются — обе по 3 ₽ за миллион. Разработчик советует 3.7 Plus как баланс возможностей и стоимости для чат-ботов и работы с документами, а 3.8 Max — когда нужны максимальные рассуждения. Принудительный выбор инструмента не поддержан у обеих.