Релизы и изменения моделей

Qwen в каталоге KeyDealer: четыре модели по 3 ₽

Qwen в каталоге KeyDealer: четыре модели по 3 ₽

12 сентября 2026 года в живой выдаче GET /v1/models появились четыре модели Qwen: 3.8 Max, 3.7 Max, 3.7 Plus и 3.6 Flash. Все четыре — по 3 ₽ за миллион токенов, одинаково на вход и на выход. Каталог вырос с 49 позиций до 53. В документации Alibaba у всех четырёх заявлен контекст в миллион токенов, а сам разработчик ставит Qwen 3.8 Max в один ряд с GPT-5.5, Claude Opus 4.7 и Gemini 3.1 Pro — которые в нашем же каталоге стоят 30, 40 и 17 ₽ за миллион. Проверено у нас: инструменты, параллельные вызовы, стриминг и JSON-режим. Не проверено и честно помечено: зрение, протоколы Responses и Anthropic Messages, а принудительный выбор инструмента у двух моделей из четырёх просто не работает.

Какие модели Qwen появились в каталоге KeyDealer

Четыре, и все со статусом available:

ID в APIНазваниеДля чего заявлена
qwen-3-8-maxQwen 3.8 MaxСложные рассуждения, код, длинные контексты
qwen-3-7-maxQwen 3.7 MaxКод, анализ, многошаговые агентные задачи
qwen-3-7-plusQwen 3.7 PlusМногоязычные документы, код, универсальные задачи
qwen-3-6-flashQwen 3.6 FlashБыстрые ответы, классификация, массовая обработка

История тут длиннее одного дня. В разборе от 13 августа на вопрос «есть ли Kimi и Qwen в каталоге» честным ответом было «нет»: лендинг их перечислял, а API не отдавал. Месяц спустя ответ поменялся.

Наличие модели проверяют по живой выдаче. Страница со списком — витрина, выдача — контракт.

Сколько стоит миллион токенов Qwen в рублях

3 ₽ за миллион входных и 3 ₽ за миллион выходных токенов — по данным GET /v1/models на 12 сентября 2026 года. Ставка симметричная: выход не дороже входа, хотя у большинства разработчиков моделей он дороже в два-восемь раз — мы разбирали эту асимметрию отдельно.

Где это в каталоге по деньгам:

Модель₽ за миллион (вход и выход)
DeepSeek V4 Flash1
Qwen (все четыре)3
GLM 5.3 Flash5
Claude Haiku 4.58
Claude Sonnet 4.612
Gemini 3.1 Pro17
GPT-5.530
Claude Opus 4.740

Третий по дешевизне платный уровень каталога. Ниже только DeepSeek V4 Flash и восемь позиций с нулевой ставкой — пять текстовых моделей, модель переранжирования и два генератора изображений. Все рублёвые ставки каталога сведены в отдельной статье про цену миллиона токенов — там же объясняется, почему цена за миллион не равна цене за текст.

Какой контекст у Qwen и сколько это в страницах

Миллион токенов у всех четырёх. В документации Alibaba Cloud Model Studio на 12 сентября 2026 года в графе «контекст» у каждой стоит 1M. Для сравнения, у Qwen 3.6 Max Preview, которого в нашем каталоге нет, там же указано 256 тысяч.

Миллион токенов — это порядка тысячи страниц русского текста, если считать по прикидке из нашего разбора контекстного окна: страница обычного текста занимает около тысячи токенов. Прикидка грубая и зависит от темы и токенизатора, но порядок величины она даёт верный.

Оговорка, которая важнее самой цифры: заявленное окно и рабочее окно — разные вещи. Длинный контекст не бесплатен ни по деньгам, ни по качеству ответа. Отправить в модель весь репозиторий технически можно; получить от этого пользу — отдельная задача.

Какие Qwen разработчик рекомендует, а какие убрал из первой линии

Рекомендованы два из четырёх: Qwen 3.8 Max и Qwen 3.7 Plus. Qwen 3.7 Max и Qwen 3.6 Flash разработчик держит в разделе старых моделей.

Это видно только в исходной документации. Страница текстовых моделей Alibaba на 12 сентября 2026 года разделена на два блока: «рекомендуемые модели» и «старые модели» — с пометкой, что перечисленные ниже больше не являются первым выбором.

Из наших четырёх:

  • Qwen 3.8 Max и Qwen 3.7 Plus — в блоке рекомендованных. Для чат-ботов, генерации контента, суммаризации и работы с документами разработчик прямо советует 3.7 Plus как баланс возможностей и стоимости, а 3.8 Max — когда нужны максимальные рассуждения.
  • Qwen 3.7 Max и Qwen 3.6 Flash — в блоке старых. Работать они не перестали, но первой линией их разработчик уже не считает.

Это не повод их не брать. Это повод знать, что у них другой горизонт жизни: модель, которую вендор убрал из рекомендаций, рано или поздно уезжает в расписание отключений. Даты по нашему каталогу мы держим в календаре отключений; у Qwen публичного расписания отключений в открытой документации мы не нашли.

С какими моделями Alibaba сравнивает Qwen 3.8 Max

С GPT-5.5, Claude Opus 4.7 и Gemini 3.1 Pro. Так Alibaba сама расставляет свои модели против закрытых в таблице соответствия на той же странице документации:

УровеньС чем сравнивает разработчикЧто советует у себя
Высокие способностиGPT-5.5, Claude Opus 4.7, Gemini 3.1 Proqwen3.8-max
БалансGPT-5.4, Claude Sonnet 4.6, Gemini 3 Proqwen3.7-plus
Лёгкий и дешёвыйGPT-5.4-mini, Claude Haiku 4.5, Gemini 3.1 Flashqwen3.8-flash

Это заявление вендора о себе. Независимого замера за ним не стоит, и читать его надо с поправкой. Но оно хотя бы конкретное и проверяется на своей задаче: три модели из левой колонки верхней строки есть в нашем каталоге по 30, 40 и 17 ₽ за миллион, а предложенная замена — по 3 ₽.

Разрыв слишком большой, чтобы верить на слово, и слишком большой, чтобы не проверить. Прогоните свои реальные промпты через обе модели и сравните ответы — это стоит десятки рублей, а не десятки тысяч.

Что из возможностей Qwen проверено в каталоге, а что нет

Проверены и работают: chat completions, стриминг, вызов инструментов, параллельные вызовы, стриминг с инструментами и JSON-режим. Не проверены: зрение и протоколы Responses и Anthropic Messages. Принудительный выбор инструмента у двух моделей из четырёх не поддержан.

Каждая модель в каталоге несёт поле capabilities, где у возможности три состояния: verified, unsupported и unknown. Мы не пишем «модель умеет», пока не проверили сами. Отметка о проверке лежит в поле capabilities_verified_at — 11 сентября 2026 года, 21:27 UTC:

ВозможностьQwen 3.8 MaxQwen 3.7 MaxQwen 3.7 PlusQwen 3.6 Flash
Chat completionsпроверенопроверенопроверенопроверено
Стримингпроверенопроверенопроверенопроверено
Вызов инструментовпроверенопроверенопроверенопроверено
Параллельные вызовыпроверенопроверенопроверенопроверено
Стриминг с инструментамипроверенопроверенопроверенопроверено
JSON-режимпроверенопроверенопроверенопроверено
Принудительный выбор инструментане поддержанпровереноне поддержанпроверено
Зрениене провереноне провереноне провереноне проверено
Responses, Anthropic Messagesне провереноне провереноне провереноне проверено

Две строки надо объяснить.

Принудительный выбор инструмента — это когда вы передаёте tool_choice с именем конкретной функции и требуете вызвать именно её. У Qwen 3.8 Max и Qwen 3.7 Plus маршрут такой запрос отклоняет — мы пробовали несколько форматов подряд, отбиваются все. Обычный вызов инструментов при этом работает: модель сама решает, что дёрнуть. Если ваш агент строится на жёстком принуждении — берите 3.7 Max или 3.6 Flash, у них это проверено.

Зрение. В документации разработчика Qwen 3.8 Max и 3.7 Plus перечислены среди моделей, понимающих изображения. У нас это не проверено, поэтому в каталоге стоит unknown, и обещать мы ничего не будем. Генерация изображений и видео у Alibaba — вообще отдельная линейка, и её в каталоге KeyDealer нет. Если задача не «встроить модель в свой код», а «получить готовый ролик, фото или карусель» — это соседний слой, им занимается TrendMix, где цена видна до генерации.

Протоколы Responses и Anthropic Messages у всех четырёх стоят в статусе review — они ещё не открыты. Работает chat completions, и его достаточно для большинства интеграций.

Почему за кэш промптов у Qwen скидки нет

У всех четырёх моделей prompt_cache.status равен unsupported. Формулировка в самой выдаче прямая: попадания в кэш наблюдаться могут, но и кэшированный вход, и запись в кэш считаются по обычной входной ставке, пока не опубликована проверенная скидка.

Не закладывайте в расчёт экономию на повторяющемся системном промпте. У моделей с подтверждённым кэшем повторно отправленный контекст обходится дешевле; здесь — нет. Считайте по полной ставке. Появится скидка — хорошо, но бюджет она не спасёт.

Симметричная ставка 3 ₽ отчасти это компенсирует: у большинства моделей платить приходится по двум разным ценникам, и выходной обычно кусается сильнее.

Как подключить Qwen и на чём это реально экономит

Через OpenAI-совместимый эндпойнт: меняете в коде адрес и идентификатор модели, остальное остаётся как было.

from openai import OpenAI

client = OpenAI(
    api_key="ваш ключ KeyDealer",
    base_url="https://api.keydealer.ru/v1",
)

response = client.chat.completions.create(
    model="qwen-3-7-plus",
    messages=[{"role": "user", "content": "Сократи договор до пяти пунктов"}],
)
print(response.choices[0].message.content)

Теперь деньги. Возьмём рабочую нагрузку среднего размера: 50 миллионов входных токенов и 5 миллионов выходных в месяц — это примерно суммаризатор документов или внутренний ассистент на небольшую команду.

МодельРасход за месяц
Qwen (любая из четырёх)165 ₽
Gemini 3.1 Pro935 ₽
GPT-5.51 650 ₽
Claude Opus 4.72 200 ₽

Между Qwen и Opus 4.7 — 2 035 ₽ разницы в месяц, то есть в 13,3 раза. Это не значит, что Qwen заменит Opus на вашей задаче: заменит или нет, покажет только прогон ваших промптов. Но разница такого порядка меняет саму постановку вопроса. Когда дешёвая модель стоит в тринадцать раз меньше, у неё появляется право на две попытки и на проверку результата третьей моделью — и это всё равно выйдет дешевле одного вызова флагмана.

Схема, которая обычно и выигрывает: черновая обработка объёма на Qwen, финальная выжимка на Sonnet или Opus. Классификация, извлечение полей, первичная суммаризация, разметка — на таких задачах разрыв в качестве между уровнями меньше, чем разрыв в цене.

И честная граница: там, где цена ошибки высока — юридические заключения, финансовые расчёты, код в продакшене без ревью — экономия в 2 000 ₽ не стоит риска. Дешёвая модель хороша на объёме, а не на ответственности.

Что держать в голове

Главное тут не четыре новые строки в списке, а то, что у каталога появился этаж между бесплатными позициями и средним уровнем — раньше его просто не было. Заявка разработчика на сопоставимость с флагманами громкая. Наша таблица её не доказывает и не опровергает; доказывают ваши промпты.

Что стоит сделать в ближайшие дни, если вы уже платите за токены:

  1. Найдите в своей интеграции самый объёмный и наименее ответственный вызов — обычно это предобработка или классификация.
  2. Прогоните на нём qwen-3-7-plus рядом с текущей моделью и сравните ответы вручную на двух десятках примеров.
  3. Если результат приемлем — переключите только этот вызов, остальное оставьте как есть.
  4. Через неделю сверьте расход в кабинете.

Чего мы не утверждаем: что Qwen лучше или хуже перечисленных моделей на вашей задаче, что зрение у него работает через наш маршрут, что скидка за кэш появится, и что модели из блока «старых» проживут долго. Всё это либо не проверено, либо не опубликовано — так и написано в выдаче каталога, без обтекаемых формулировок.

Актуальный статус любой модели всегда смотрите в живой выдаче GET /v1/models и в кабинете: каталог меняется быстрее, чем выходят статьи. Как мы проверяем факты — на странице о проекте. Ключ заводится за минуту: keydealer.ru/login.

Частые вопросы

Какие модели Qwen доступны в KeyDealer?

На 12 сентября 2026 года четыре: Qwen 3.8 Max, Qwen 3.7 Max, Qwen 3.7 Plus и Qwen 3.6 Flash. Все четыре отдаются живым GET /v1/models со статусом available по протоколу chat completions.

Сколько стоит Qwen в рублях?

3 ₽ за миллион токенов, одинаково на входе и на выходе, у всех четырёх моделей. Это третий по дешевизне платный уровень каталога после DeepSeek V4 Flash за 1 ₽ и восьми позиций с нулевой ставкой.

Какой у Qwen контекст?

В документации Alibaba Cloud Model Studio у всех четырёх моделей указан миллион токенов. У Qwen 3.6 Max Preview, которого в нашем каталоге нет, — 256 тысяч.

Работают ли у Qwen вызовы инструментов?

Обычные вызовы, параллельные вызовы, ответы инструментов, стриминг с инструментами и JSON-режим проверены на всех четырёх. Принудительный выбор конкретного инструмента у Qwen 3.8 Max и Qwen 3.7 Plus помечен как неподдерживаемый — маршрут отклоняет такой запрос.

Есть ли у Qwen скидка за кэш промптов?

Нет. В каталоге у всех четырёх prompt_cache стоит в статусе unsupported: попадания в кэш могут случаться, но и кэшированный вход, и запись в кэш считаются по обычной входной ставке.

Можно ли обращаться к Qwen через протокол Responses или Anthropic Messages?

Пока нет. В выдаче каталога оба протокола у Qwen стоят в статусе review — они ещё не открыты. Работает chat completions.

Как подключить Qwen из России?

Через OpenAI-совместимый эндпойнт https://api.keydealer.ru/v1 с ключом KeyDealer: в коде меняются адрес и идентификатор модели, оплата рублями, VPN и зарубежная карта не нужны.

Чем Qwen 3.8 Max отличается от Qwen 3.7 Plus?

Ценой в каталоге они не отличаются — обе по 3 ₽ за миллион. Разработчик советует 3.7 Plus как баланс возможностей и стоимости для чат-ботов и работы с документами, а 3.8 Max — когда нужны максимальные рассуждения. Принудительный выбор инструмента не поддержан у обеих.

Источники