Мир ИИ

Qwen 3.8 27B: контекст 262K и зрение под Apache 2.0

Qwen 3.8 27B: контекст 262K и зрение под Apache 2.0

Alibaba опубликовала Qwen 3.8 27B под лицензией Apache 2.0: 27 млрд параметров, встроенная обработка изображений, нативный контекст 262 тысячи токенов с расширением до миллиона, архитектура на блоках Gated DeltaNet и Gated Attention. На фоне релизов с триллионами параметров цифра выглядит скромно — и именно поэтому заслуживает внимания. Модель такого размера реально запустить на одной серверной видеокарте, а свободная лицензия снимает юридические ограничения полностью. В каталоге KeyDealer этой модели нет; из семейства Qwen там одна позиция, и та в статусе review. Разбираем, почему компактные открытые модели меняют рынок сильнее гигантских.

Что опубликовано

Параметры компактно.

СвойствоЗначение
Параметров27 млрд
ЛицензияApache 2.0
Нативный контекст262 144 токена
Расширяемый контекстдо 1 млн
Мультимодальностьобработка изображений встроена
Архитектураблоки Gated DeltaNet и Gated Attention

Два пункта здесь стоят отдельного разбора: размер и лицензия. Остальное — детали реализации.

Почему 27 миллиардов интереснее 2,8 триллиона

За последний месяц мы разбирали два релиза с заголовочными цифрами на порядки больше: Kimi K3 на 2,8 трлн параметров и DeepSeek V4 Pro на 1,6 трлн. Обе с открытыми весами, обе впечатляют.

И обе почти никому не доступны для самостоятельного запуска. Разреженная архитектура удешевляет вычисления, но не память: загружать в видеопамять надо все параметры, потому что маршрутизатор заранее не знает, какие эксперты понадобятся. Это серверная стойка, а не рабочая станция.

27 млрд — другая история. Модель такого размера помещается на одну видеокарту серверного класса, а в квантизованном виде — и на менее серьёзное железо. Порог входа падает с «нужен парк GPU» до «нужна одна карта».

Практическое следствие: открытые веса гигантских моделей влияют на рынок через цены, а компактных — через то, что их действительно разворачивают. Это разные механизмы, и второй работает быстрее.

Что даёт Apache 2.0

Лицензия — не формальность, и различия здесь стоят денег.

Apache 2.0 не ограничивает коммерческое использование, не требует раскрывать производные работы, не навязывает условия дальнейшего распространения и не ставит порогов по размеру бизнеса.

Собственные лицензии вендоров, под которыми выходит значительная часть «открытых» моделей, обычно содержат хотя бы одно из: ограничение по числу пользователей или выручке, запрет обучать на выходе модели конкурирующие системы, обязательную атрибуцию, запрет отдельных сфер применения.

Разница проявляется в тот момент, когда юрист вашей компании читает условия перед выкаткой в продакшн. Модель под Apache 2.0 проходит эту проверку без обсуждений; модель под лицензией вендора — как повезёт.

Из недавнего в том же ряду: веса DeepSeek V4 вышли под MIT — лицензией такой же свободы. А вот Z.ai на этой неделе придержала веса GLM-5.3 до окончания проверки безопасности, показав, что «открытая модель» перестаёт означать «доступна сразу».

Зрение в компактной модели

Отдельно про мультимодальность, потому что обычно она достаётся флагманам.

Встроенная обработка изображений в модели на 27 млрд параметров закрывает целый класс задач, которые до этого требовали либо большой закрытой модели, либо связки из двух моделей: разбор сканов документов, извлечение данных из скриншотов, проверка соответствия картинки описанию, модерация изображений.

Связка из двух моделей — отдельная головная боль: они не разделяют контекст, и всё, что понял «зрячий» компонент, приходится пересказывать текстом. Встроенная обработка этого шага не требует.

Что до контекста в 262 тысячи токенов нативно — это уже уровень, на котором в модель помещается небольшая кодовая база или пара сотен страниц документа целиком.

Оговорка, которая тут важна: изображения тратят контекст заметно щедрее текста. Страница скана съедает столько же, сколько несколько страниц обычного текста, и на длинных мультимодальных задачах окно кончается быстрее, чем подсказывает интуиция. Считать бюджет контекста в таких сценариях стоит по картинкам, а не по буквам.

Что есть в каталоге

Проговорим прямо, чтобы не создавать ожиданий.

Из семейства Qwen в каталоге на 15 августа одна позиция: qwen-3-6-35b-a3b по 40 ₽ за миллион входных токенов и 280 ₽ за миллион выходных. Причём она:

  • в статусе review — числится в выдаче, но запросы не принимает;
  • единственная асимметричная ставка каталога из 36 текстовых позиций, разрыв ровно семикратный.

Разбор того, как считать бюджет на таком тарифе, — в материале про асимметричную цену выхода. Qwen 3.8 27B в каталоге нет, и сроков мы не называем.

Что реально нужно для запуска

Раз главный аргумент компактной модели — практическая доступность, стоит быть точным в том, что за ней стоит.

Требования к видеопамяти определяются не только числом параметров, но и тем, в каком представлении вы держите веса. Полная точность требует примерно вдвое больше памяти, чем половинная, а квантизация ужимает ещё в разы — ценой некоторой потери качества, обычно небольшой.

Второй потребитель памяти — сам контекст. И вот здесь заявленные 262 тысячи токенов превращаются из достоинства в статью расходов: чем длиннее контекст, который вы реально используете, тем больше памяти уходит на его хранение во время генерации. Модель, которая помещается на карту с коротким контекстом, может не поместиться с длинным.

Отсюда практический порядок действий перед закупкой железа: определить не максимальный контекст модели, а тот, который вам реально нужен. Разница между «может до миллиона» и «мы используем 20 тысяч» — это разница в классе оборудования.

Третье, о чём забывают: одна карта обслуживает один поток генерации приемлемо, а десять одновременных запросов — уже нет. Если у вас не эксперимент, а сервис с пользователями, считать надо не по модели, а по пиковой нагрузке.

Чего мы не утверждаем

Мы не тестировали модель. Характеристики — из публикаций, перечисленных в источниках.

Не приводим бенчмарков. Сравнительные цифры по свежим релизам расходятся между публикациями, а проверить их у себя мы не можем.

Не утверждаем, что расширение до миллиона токенов работает без потерь. Нативный контекст и расширенный — разные вещи, и качество работы на верхней границе обычно ниже.

Не обещаем, что модель появится у нас. Каталог на 15 августа — 38 позиций: Claude, GPT, Gemini, GLM, Grok, Kimi, Qwen и GPT Image.

Не даём юридических консультаций по лицензии. Мы описываем общий смысл Apache 2.0; условия применения к вашему случаю должен смотреть ваш юрист.

Не сравниваем со зрением закрытых моделей. Наличие мультимодальности и её качество — разные утверждения, и второе мы не проверяли.

Что с этим делать

Если новость показалась практически важной — три шага.

  1. Определите, упирается ли ваша задача в приватность. Если да, компактная открытая модель на своём железе — самый прямой ответ, и лицензия Apache 2.0 делает его юридически чистым.
  2. Проверьте объём. Своё железо окупается ровной нагрузкой; при неровной простой карты съедает всю экономию.
  3. Сначала попробуйте через API. Прогнать реальные запросы через доступные модели стоит рубли и отвечает на вопрос, какого класса модель вам вообще нужна, до всяких расчётов окупаемости.
  4. Проверьте лицензию до, а не после. Выяснять условия использования, когда интеграция уже написана и работает в продакшене, — худший момент из возможных.

Для контента — текстов, картинок и видео под соцсети — своё железо тем более не нужно: этим занимается наш второй сервис TrendMix, где генерация уже развёрнута и оплачивается по факту.

Что держать в голове

Qwen 3.8 27B — компактная модель со зрением, контекстом 262 тысячи токенов и свободной лицензией Apache 2.0. Она не претендует на верх рейтингов, но её реально запустить, и юридических ограничений у неё нет.

Именно такие релизы, а не триллионные флагманы, определяют нижнюю границу цен на рынке — потому что их разворачивают, а не только обсуждают.

Проверить это на своей задаче стоит дешевле, чем читать про неё: сотня реальных запросов через готовую модель обойдётся в рубли и покажет, нужна ли вам вообще собственная инфраструктура.

Как мы отделяем проверенное от предполагаемого — на странице о проекте. Сравнить доступные модели на своих запросах: keydealer.ru/login.

Частые вопросы

Что за модель Qwen 3.8 27B?

Языковая модель Alibaba на 27 млрд параметров со встроенной обработкой изображений. Нативный контекст 262 тысячи токенов с возможностью расширения до миллиона. Веса опубликованы под лицензией Apache 2.0.

Чем Apache 2.0 отличается от лицензий вендоров?

Она не ограничивает коммерческое использование, не требует раскрывать производные работы и не навязывает условий дальнейшего распространения. Многие «открытые» модели выходят под собственными лицензиями с оговорками.

Модель есть в каталоге KeyDealer?

Нет. Из семейства Qwen в каталоге на 15 августа 2026 года одна позиция — qwen-3-6-35b-a3b по 40 рублей за миллион входных и 280 за миллион выходных токенов, и она в статусе review.

Почему 27 млрд параметров — это интересно?

Потому что такую модель реально запустить на одной серверной видеокарте, в отличие от систем на триллионы параметров. Практическая доступность у неё принципиально другая.

Что нужно для запуска?

Видеокарта серверного класса. Точные требования зависят от выбранной квантизации и длины контекста, который вы собираетесь использовать.

Источники