Релизы и изменения моделей

MiniMax M3 в каталоге: новое семейство по нулевой ставке

MiniMax M3 в каталоге: новое семейство по нулевой ставке

1 сентября в каталоге KeyDealer появилось семейство MiniMax — модель minimax-m3 с нулевой ставкой за вход и выход. Условие доступа то же, что у остальных бесплатных позиций: подтверждённое платное пополнение от 100 ₽, деньги остаются на балансе. У самой MiniMax эта модель стоит $0,30 за миллион входных токенов и $1,20 за выход — по курсу ЦБ на 1 сентября (86,3793 ₽) это 25,91 ₽ и 103,66 ₽. Контекст по документации вендора — миллион токенов, архитектура MoE на 428 млрд параметров с 23 млрд активных. protocols.chat_completions открыт, anthropic_messages и responses пока в review, кэш промптов не поддерживается. Каталог за сутки вырос с 41 позиции до 44.

Обновление от 9 сентября 2026 года. Производитель снял MiniMax M3 9 сентября 2026 года, модель больше не обслуживается и убрана из каталога KeyDealer. Бесплатные позиции для текста сейчас — nemotron-3-ultra, nemotron-3-super, nemotron-3-5-lightning, gpt-oss-20b; актуальный список всегда отдаёт GET /v1/models. Ниже сохранён текст на дату публикации.

Что за модель MiniMax M3

MiniMax описывает M3 коротко: frontier multimodal coding model с контекстным окном в миллион токенов. Это флагман линейки — в обзоре моделей вендора M2.7 и M2.7-highspeed стоят рядом с ней как текущие, а всё поколение M2.5 и ниже убрано в раздел legacy.

Внутри — Mixture of Experts: около 428 млрд параметров всего и около 23 млрд активных на токен. Соотношение примерно 18,6 к одному, и оно объясняет, почему модель такого размера вообще может стоить тридцать центов за миллион входа.

Семейство MiniMax у нас в блоге уже мелькало, но с другой стороны: в августе компания открыла веса музыкальной модели Music 3.0 — и лицензия там оказалась куда жёстче, чем у моделей под MIT. M3 — первая модель этого разработчика, доступная через наш API.

Сколько стоит MiniMax M3 в каталоге KeyDealer

Нисколько. Ставка нулевая в обе стороны, billing.sourcequalified_free, формула в выдаче записана прямо: zero charge after confirmed paid top-up.

Поле каталогаЗначение на 1 сентября 2026
input_rub_per_million0
output_rub_per_million0
billing.sourcequalified_free
availabilityavailable
protocols.chat_completionsavailable
protocols.anthropic_messagesreview
protocols.responsesreview
prompt_cache.statusunsupported

Это десятая позиция каталога, у которой нулевая ставка зашита в сам механизм биллинга: в выдаче такие модели помечены billing.source: qualified_free. Остальные девять — текстовые, зрительная, два генератора изображений и модель переранжирования — мы разбирали в обзоре бесплатного доступа к API. M3 добавляет к набору длинный контекст, которого там не хватало.

Отличать это стоит от временных промо-ставок: у них billing.source остаётся usage, а ноль в цене живёт ровно столько, сколько идёт акция. Смотрите на billing.source, а не только на цифру.

Почему нулевая ставка требует пополнения на 100 рублей

Потому что это не оплата модели, а фильтр. В поле access у M3 стоит policy: paid_topup_required, минимум — 100 ₽, и отдельным флагом прописано welcome_bonus_qualifies: false.

Разница принципиальная: сто рублей никуда не уходят. Они лежат на балансе и тратятся, когда вы обращаетесь к платным моделям. Порог стоит против автоматического создания учётных записей ради бесплатного ресурса. Приветственный бонус его намеренно не закрывает — иначе фильтр обходился бы регистрацией.

Сто рублей по курсу на 1 сентября — это $1,16. Столько же у вендора стоят примерно 3,9 млн входных токенов M3 по стандартному тарифу.

Сколько MiniMax M3 стоит у самой MiniMax

Прайс вендора двухуровневый, порог проходит по 512 тысячам входных токенов. Ниже — страница Pay as You Go на platform.minimax.io, снятая 1 сентября 2026 года. Обе строки идут с пометкой Permanent 50% off — то есть перечёркнутая цена вдвое выше, а действующей объявлена нижняя.

Стандартный тарифВходВыходЧтение из кэша
до 512k входных токенов$0,30$1,20$0,06
свыше 512k$0,60$2,40$0,12

Есть ещё тир Priority: он включается параметром service_tier: priority, даёт приоритетную постановку в очередь и стоит ровно в полтора раза дороже — $0,45 и $1,80 на коротком контексте.

По курсу ЦБ на 1 сентября 2026 года — 86,3793 ₽ за доллар:

Стандартный тарифВход, ₽/млнВыход, ₽/млн
до 512k25,91103,66
свыше 512k51,83207,31

Миллион входных плюс миллион выходных токенов обойдётся у вендора в 129,57 ₽. У нас — в ноль, при закрытом пороге пополнения. Курс, кстати, за сутки сдвинулся: 85,6007 ₽ держались с 29 августа, 1 сентября стало 86,3793 ₽, рост на 0,91%. Все рублёвые ставки каталога живут в хабе по стоимости миллиона токенов — дублировать их здесь мы не будем.

Что у MiniMax M3 проверено, а что нет

Модель приехала вчера, и список проверенного у неё короткий. В поле capabilities verified только два значения: chat_completions и streaming. Всё остальное — tools, json_output, parallel_tool_calls, forced_tool_choice, вся группа anthropic_ и вся группа responses_ — стоит в unknown. Дата проверки: 31 августа 2026, 11:00 UTC.

unknown не значит «не работает». Это значит, что мы не проверяли и не обещаем. У вендора, для сравнения, отдельная страница документации посвящена tool use и interleaved thinking у M3, а SDK-интеграция описана через Anthropic SDK. Но между «работает у разработчика» и «проверено на нашем маршруте» лежит ровно та дистанция, из-за которой мы это поле и ведём — механику статусов разбирали в материале о том, как читать биллинг в выдаче моделей.

Отдельно про кэш: prompt_cache.statusunsupported. У MiniMax кэш есть и стоит $0,06 за миллион прочитанных токенов, но на нашем маршруте скидка не обещается и не применяется.

И ещё одна пустая клетка: estimated_route_context_tokens у M3 равен null. Служебный контекст маршрута для этой модели пока не измерен ни оценкой, ни выборкой — что это за накладные расходы и почему они различаются на порядок между моделями, мы считали отдельно.

Сколько железа нужно, чтобы поднять MiniMax M3 самому

Восемь NVIDIA B200 в одном узле — это эталонная конфигурация из документации MiniMax, tensor parallel 8.

Веса открыты, и вендор публикует рецепт развёртывания целиком. Читать его стоит до того, как принимать решение. Веса MiniMaxAI/MiniMax-M3-MXFP8 занимают около 444 ГБ; вариант BF16 на восьми H200 — около 854 ГБ. На B300 и GB300 хватает четырёх карт. AMD MI355X и MI300X валидированы только для текстовых задач.

Три оговорки из самой документации, которые обычно теряются в пересказах:

  1. Статус развёртывания — экспериментальный. Поддержка идёт через dev-образ SGLang, а не через релизный тег. Вендор прямо пишет: не считайте этот рецепт production SLA.
  2. 23 млрд активных параметров не означают, что памяти нужно на 23 млрд. Веса грузятся или шардируются целиком — предупреждение вынесено в отдельную рамку.
  3. Часть цифр не опубликована вовсе: минимальный объём хостовой памяти, пиковое потребление GPU-памяти и минимальная версия драйвера NVIDIA в документации отсутствуют.

Арифметику «развернуть у себя против API» мы уже считали на видеомоделях и открытых весах и на семьсоткратной модели, которую пробовали уместить в одну карту. Вывод от типа модели не зависит и здесь тот же: восемь B200 под неровной нагрузкой простаивают большую часть суток, а платите вы за них круглосуточно.

Какие ещё модели приехали в каталог 1 сентября

За сутки каталог вырос с 41 позиции до 44.

МодельСтавка, ₽ вход/выходСтатус чата
minimax-m30 / 0открыт
glm-5-3-flash5 / 5открыт
kimi-k2-7-code20 / 20ещё не открыт

glm-5-3-flash — та самая мультимодальная GLM с весами под MIT, про которую мы писали 28 августа, когда её в каталоге ещё не было. Четыре дня — быстро.

Заодно открылся чат у четырёх позиций, которые до этого числились в review: glm-4-7, glm-4-6v, gpt-oss-120b и nemotron-3-ultra. Расхождение между полем availability и реальным статусом протокола, о котором мы предупреждали в разборе роста каталога, продолжает схлопываться.

Что делать, если вам нужен длинный контекст

Если задача — разовый прогон большого документа или репозитория. Нулевая ставка снимает главный тормоз: можно не считать, сколько стоит скормить модели 300 тысяч токенов, и просто скормить. Порог в 100 ₽ закрывается один раз, деньги остаются вашими.

Если задача — постоянный агент на длинном контексте. Смотрите на два поля перед переключением. Первое — tools в unknown. Агент без работающих инструментов бесполезен, а проверять их придётся вам самим. Второе — prompt_cache.status: unsupported: при бесплатной ставке это неважно, но если модель когда-нибудь станет платной, отсутствие кэша на длинном контексте бьёт больнее самой ставки.

Если вы сравниваете с платными моделями. Миллион токенов контекста почти никогда не нужен целиком — мы разбирали, сколько контекста расходуется на практике. Бесплатная модель с окном на миллион не отменяет вопроса, что вы в это окно кладёте.

Если вы держите продакшен. Не переключайтесь на позицию, которая приехала вчера, без своего прогона. Читайте GET /v1/models перед сборкой, а не с лендинга: статусы меняются чаще, чем выходят статьи. Что и когда отключают у вендоров — в календаре отключений.

Ключ на все модели каталога — один, забирается на странице входа. Отдельная регистрация под MiniMax не нужна: тот же OpenAI-совместимый endpoint, другой model.

Что проверить перед переключением

Пять пунктов, каждый проверяется за минуту.

  1. Живая выдача. GET /v1/models, поле protocols.chat_completions у minimax-m3. Не availability — именно протокол: они расходятся, и это уже стоило кому-то отладочного вечера.
  2. Порог пополнения. Без подтверждённого платного пополнения от 100 ₽ нулевая ставка не включится, а приветственный бонус его не закрывает.
  3. Инструменты. Если ваш код вызывает функции — прогоните свой набор tools сами. В каталоге поле стоит в unknown.
  4. Длина запроса. У вендора порог по 512 тысячам токенов удваивает ставку; у нас порога нет, но и служебный контекст маршрута для M3 пока не измерен.
  5. Лимиты вендора. 200 запросов в минуту и 10 млн токенов в минуту по документации MiniMax. Это лимиты разработчика модели, не наши, но упереться в них можно.

И последнее, про сроки. glm-5-3-flash приехал через четыре дня после анонса весов, Kimi K3 в августе прошла путь от review до открытого чата за две с половиной недели, а kimi-k2-7-code за это же время успела пропасть из выдачи и вернуться. Каталог движется быстрее, чем выходят статьи о нём. Дата у этого текста стоит не для красоты: через месяц половину статусов придётся перечитывать заново — из GET /v1/models, а не отсюда.

Частые вопросы

Есть ли MiniMax M3 в каталоге KeyDealer?

Да, с 1 сентября 2026 года. Ставка нулевая, protocols.chat_completions открыт, семейство MiniMax появилось в каталоге впервые.

Сколько стоит MiniMax M3 у самой MiniMax?

Тридцать центов за миллион входных токенов и доллар двадцать за миллион выходных при запросе до 512 тысяч токенов. Свыше этой длины — шестьдесят центов и два сорок.

Что нужно, чтобы ставка была нулевой?

Подтверждённое платное пополнение на сумму от 100 рублей. Деньги остаются на балансе и расходуются на платные модели. Приветственный бонус этот порог не закрывает.

Какой у MiniMax M3 контекст?

Миллион токенов по документации вендора. Модель мультимодальная у разработчика, но в нашем каталоге проверены только чат и стриминг.

Сколько железа нужно, чтобы поднять MiniMax M3 самому?

Восемь NVIDIA B200 в одном узле по эталонной конфигурации вендора. Веса в MXFP8 занимают около 444 ГБ, в BF16 — около 854 ГБ.

Работает ли у MiniMax M3 скидка за кэш промптов?

В каталоге prompt_cache.status равен unsupported, скидка не обещается и не применяется. У вендора кэш есть и стоит шесть центов за миллион прочитанных токенов.

Можно ли обращаться к MiniMax M3 через Anthropic SDK или Responses API?

Через наш маршрут пока нет: protocols.anthropic_messages и protocols.responses у модели стоят в review. Открыт только OpenAI-совместимый Chat Completions.

Сколько моделей в каталоге KeyDealer на 1 сентября 2026 года?

Сорок четыре позиции. За сутки до этого был сорок один: добавились minimax-m3, glm-5-3-flash и kimi-k2-7-code.

Источники