Релизы и изменения моделей
MiniMax M3 в каталоге: новое семейство по нулевой ставке
1 сентября в каталоге KeyDealer появилось семейство MiniMax — модель minimax-m3 с нулевой ставкой за вход и выход. Условие доступа то же, что у остальных бесплатных позиций: подтверждённое платное пополнение от 100 ₽, деньги остаются на балансе. У самой MiniMax эта модель стоит $0,30 за миллион входных токенов и $1,20 за выход — по курсу ЦБ на 1 сентября (86,3793 ₽) это 25,91 ₽ и 103,66 ₽. Контекст по документации вендора — миллион токенов, архитектура MoE на 428 млрд параметров с 23 млрд активных. protocols.chat_completions открыт, anthropic_messages и responses пока в review, кэш промптов не поддерживается. Каталог за сутки вырос с 41 позиции до 44.
Обновление от 9 сентября 2026 года. Производитель снял MiniMax M3 9 сентября 2026 года, модель больше не обслуживается и убрана из каталога KeyDealer. Бесплатные позиции для текста сейчас —
nemotron-3-ultra,nemotron-3-super,nemotron-3-5-lightning,gpt-oss-20b; актуальный список всегда отдаётGET /v1/models. Ниже сохранён текст на дату публикации.
Что за модель MiniMax M3
MiniMax описывает M3 коротко: frontier multimodal coding model с контекстным окном в миллион токенов. Это флагман линейки — в обзоре моделей вендора M2.7 и M2.7-highspeed стоят рядом с ней как текущие, а всё поколение M2.5 и ниже убрано в раздел legacy.
Внутри — Mixture of Experts: около 428 млрд параметров всего и около 23 млрд активных на токен. Соотношение примерно 18,6 к одному, и оно объясняет, почему модель такого размера вообще может стоить тридцать центов за миллион входа.
Семейство MiniMax у нас в блоге уже мелькало, но с другой стороны: в августе компания открыла веса музыкальной модели Music 3.0 — и лицензия там оказалась куда жёстче, чем у моделей под MIT. M3 — первая модель этого разработчика, доступная через наш API.
Сколько стоит MiniMax M3 в каталоге KeyDealer
Нисколько. Ставка нулевая в обе стороны, billing.source — qualified_free, формула в выдаче записана прямо: zero charge after confirmed paid top-up.
| Поле каталога | Значение на 1 сентября 2026 |
|---|---|
input_rub_per_million | 0 |
output_rub_per_million | 0 |
billing.source | qualified_free |
availability | available |
protocols.chat_completions | available |
protocols.anthropic_messages | review |
protocols.responses | review |
prompt_cache.status | unsupported |
Это десятая позиция каталога, у которой нулевая ставка зашита в сам механизм биллинга: в выдаче такие модели помечены billing.source: qualified_free. Остальные девять — текстовые, зрительная, два генератора изображений и модель переранжирования — мы разбирали в обзоре бесплатного доступа к API. M3 добавляет к набору длинный контекст, которого там не хватало.
Отличать это стоит от временных промо-ставок: у них billing.source остаётся usage, а ноль в цене живёт ровно столько, сколько идёт акция. Смотрите на billing.source, а не только на цифру.
Почему нулевая ставка требует пополнения на 100 рублей
Потому что это не оплата модели, а фильтр. В поле access у M3 стоит policy: paid_topup_required, минимум — 100 ₽, и отдельным флагом прописано welcome_bonus_qualifies: false.
Разница принципиальная: сто рублей никуда не уходят. Они лежат на балансе и тратятся, когда вы обращаетесь к платным моделям. Порог стоит против автоматического создания учётных записей ради бесплатного ресурса. Приветственный бонус его намеренно не закрывает — иначе фильтр обходился бы регистрацией.
Сто рублей по курсу на 1 сентября — это $1,16. Столько же у вендора стоят примерно 3,9 млн входных токенов M3 по стандартному тарифу.
Сколько MiniMax M3 стоит у самой MiniMax
Прайс вендора двухуровневый, порог проходит по 512 тысячам входных токенов. Ниже — страница Pay as You Go на platform.minimax.io, снятая 1 сентября 2026 года. Обе строки идут с пометкой Permanent 50% off — то есть перечёркнутая цена вдвое выше, а действующей объявлена нижняя.
| Стандартный тариф | Вход | Выход | Чтение из кэша |
|---|---|---|---|
| до 512k входных токенов | $0,30 | $1,20 | $0,06 |
| свыше 512k | $0,60 | $2,40 | $0,12 |
Есть ещё тир Priority: он включается параметром service_tier: priority, даёт приоритетную постановку в очередь и стоит ровно в полтора раза дороже — $0,45 и $1,80 на коротком контексте.
По курсу ЦБ на 1 сентября 2026 года — 86,3793 ₽ за доллар:
| Стандартный тариф | Вход, ₽/млн | Выход, ₽/млн |
|---|---|---|
| до 512k | 25,91 | 103,66 |
| свыше 512k | 51,83 | 207,31 |
Миллион входных плюс миллион выходных токенов обойдётся у вендора в 129,57 ₽. У нас — в ноль, при закрытом пороге пополнения. Курс, кстати, за сутки сдвинулся: 85,6007 ₽ держались с 29 августа, 1 сентября стало 86,3793 ₽, рост на 0,91%. Все рублёвые ставки каталога живут в хабе по стоимости миллиона токенов — дублировать их здесь мы не будем.
Что у MiniMax M3 проверено, а что нет
Модель приехала вчера, и список проверенного у неё короткий. В поле capabilities verified только два значения: chat_completions и streaming. Всё остальное — tools, json_output, parallel_tool_calls, forced_tool_choice, вся группа anthropic_ и вся группа responses_ — стоит в unknown. Дата проверки: 31 августа 2026, 11:00 UTC.
unknown не значит «не работает». Это значит, что мы не проверяли и не обещаем. У вендора, для сравнения, отдельная страница документации посвящена tool use и interleaved thinking у M3, а SDK-интеграция описана через Anthropic SDK. Но между «работает у разработчика» и «проверено на нашем маршруте» лежит ровно та дистанция, из-за которой мы это поле и ведём — механику статусов разбирали в материале о том, как читать биллинг в выдаче моделей.
Отдельно про кэш: prompt_cache.status — unsupported. У MiniMax кэш есть и стоит $0,06 за миллион прочитанных токенов, но на нашем маршруте скидка не обещается и не применяется.
И ещё одна пустая клетка: estimated_route_context_tokens у M3 равен null. Служебный контекст маршрута для этой модели пока не измерен ни оценкой, ни выборкой — что это за накладные расходы и почему они различаются на порядок между моделями, мы считали отдельно.
Сколько железа нужно, чтобы поднять MiniMax M3 самому
Восемь NVIDIA B200 в одном узле — это эталонная конфигурация из документации MiniMax, tensor parallel 8.
Веса открыты, и вендор публикует рецепт развёртывания целиком. Читать его стоит до того, как принимать решение. Веса MiniMaxAI/MiniMax-M3-MXFP8 занимают около 444 ГБ; вариант BF16 на восьми H200 — около 854 ГБ. На B300 и GB300 хватает четырёх карт. AMD MI355X и MI300X валидированы только для текстовых задач.
Три оговорки из самой документации, которые обычно теряются в пересказах:
- Статус развёртывания — экспериментальный. Поддержка идёт через dev-образ SGLang, а не через релизный тег. Вендор прямо пишет: не считайте этот рецепт production SLA.
- 23 млрд активных параметров не означают, что памяти нужно на 23 млрд. Веса грузятся или шардируются целиком — предупреждение вынесено в отдельную рамку.
- Часть цифр не опубликована вовсе: минимальный объём хостовой памяти, пиковое потребление GPU-памяти и минимальная версия драйвера NVIDIA в документации отсутствуют.
Арифметику «развернуть у себя против API» мы уже считали на видеомоделях и открытых весах и на семьсоткратной модели, которую пробовали уместить в одну карту. Вывод от типа модели не зависит и здесь тот же: восемь B200 под неровной нагрузкой простаивают большую часть суток, а платите вы за них круглосуточно.
Какие ещё модели приехали в каталог 1 сентября
За сутки каталог вырос с 41 позиции до 44.
| Модель | Ставка, ₽ вход/выход | Статус чата |
|---|---|---|
minimax-m3 | 0 / 0 | открыт |
glm-5-3-flash | 5 / 5 | открыт |
kimi-k2-7-code | 20 / 20 | ещё не открыт |
glm-5-3-flash — та самая мультимодальная GLM с весами под MIT, про которую мы писали 28 августа, когда её в каталоге ещё не было. Четыре дня — быстро.
Заодно открылся чат у четырёх позиций, которые до этого числились в review: glm-4-7, glm-4-6v, gpt-oss-120b и nemotron-3-ultra. Расхождение между полем availability и реальным статусом протокола, о котором мы предупреждали в разборе роста каталога, продолжает схлопываться.
Что делать, если вам нужен длинный контекст
Если задача — разовый прогон большого документа или репозитория. Нулевая ставка снимает главный тормоз: можно не считать, сколько стоит скормить модели 300 тысяч токенов, и просто скормить. Порог в 100 ₽ закрывается один раз, деньги остаются вашими.
Если задача — постоянный агент на длинном контексте. Смотрите на два поля перед переключением. Первое — tools в unknown. Агент без работающих инструментов бесполезен, а проверять их придётся вам самим. Второе — prompt_cache.status: unsupported: при бесплатной ставке это неважно, но если модель когда-нибудь станет платной, отсутствие кэша на длинном контексте бьёт больнее самой ставки.
Если вы сравниваете с платными моделями. Миллион токенов контекста почти никогда не нужен целиком — мы разбирали, сколько контекста расходуется на практике. Бесплатная модель с окном на миллион не отменяет вопроса, что вы в это окно кладёте.
Если вы держите продакшен. Не переключайтесь на позицию, которая приехала вчера, без своего прогона. Читайте GET /v1/models перед сборкой, а не с лендинга: статусы меняются чаще, чем выходят статьи. Что и когда отключают у вендоров — в календаре отключений.
Ключ на все модели каталога — один, забирается на странице входа. Отдельная регистрация под MiniMax не нужна: тот же OpenAI-совместимый endpoint, другой model.
Что проверить перед переключением
Пять пунктов, каждый проверяется за минуту.
- Живая выдача.
GET /v1/models, полеprotocols.chat_completionsуminimax-m3. Неavailability— именно протокол: они расходятся, и это уже стоило кому-то отладочного вечера. - Порог пополнения. Без подтверждённого платного пополнения от 100 ₽ нулевая ставка не включится, а приветственный бонус его не закрывает.
- Инструменты. Если ваш код вызывает функции — прогоните свой набор tools сами. В каталоге поле стоит в
unknown. - Длина запроса. У вендора порог по 512 тысячам токенов удваивает ставку; у нас порога нет, но и служебный контекст маршрута для M3 пока не измерен.
- Лимиты вендора. 200 запросов в минуту и 10 млн токенов в минуту по документации MiniMax. Это лимиты разработчика модели, не наши, но упереться в них можно.
И последнее, про сроки. glm-5-3-flash приехал через четыре дня после анонса весов, Kimi K3 в августе прошла путь от review до открытого чата за две с половиной недели, а kimi-k2-7-code за это же время успела пропасть из выдачи и вернуться. Каталог движется быстрее, чем выходят статьи о нём. Дата у этого текста стоит не для красоты: через месяц половину статусов придётся перечитывать заново — из GET /v1/models, а не отсюда.
Частые вопросы
Есть ли MiniMax M3 в каталоге KeyDealer?
Да, с 1 сентября 2026 года. Ставка нулевая, protocols.chat_completions открыт, семейство MiniMax появилось в каталоге впервые.
Сколько стоит MiniMax M3 у самой MiniMax?
Тридцать центов за миллион входных токенов и доллар двадцать за миллион выходных при запросе до 512 тысяч токенов. Свыше этой длины — шестьдесят центов и два сорок.
Что нужно, чтобы ставка была нулевой?
Подтверждённое платное пополнение на сумму от 100 рублей. Деньги остаются на балансе и расходуются на платные модели. Приветственный бонус этот порог не закрывает.
Какой у MiniMax M3 контекст?
Миллион токенов по документации вендора. Модель мультимодальная у разработчика, но в нашем каталоге проверены только чат и стриминг.
Сколько железа нужно, чтобы поднять MiniMax M3 самому?
Восемь NVIDIA B200 в одном узле по эталонной конфигурации вендора. Веса в MXFP8 занимают около 444 ГБ, в BF16 — около 854 ГБ.
Работает ли у MiniMax M3 скидка за кэш промптов?
В каталоге prompt_cache.status равен unsupported, скидка не обещается и не применяется. У вендора кэш есть и стоит шесть центов за миллион прочитанных токенов.
Можно ли обращаться к MiniMax M3 через Anthropic SDK или Responses API?
Через наш маршрут пока нет: protocols.anthropic_messages и protocols.responses у модели стоят в review. Открыт только OpenAI-совместимый Chat Completions.
Сколько моделей в каталоге KeyDealer на 1 сентября 2026 года?
Сорок четыре позиции. За сутки до этого был сорок один: добавились minimax-m3, glm-5-3-flash и kimi-k2-7-code.