Мир ИИ

Kimi K3: 2,8 трлн параметров с открытыми весами

Kimi K3: 2,8 трлн параметров с открытыми весами

27 июля 2026 года Moonshot AI опубликовала веса Kimi K3 — 2,8 трлн параметров, разреженная архитектура Mixture-of-Experts с 896 экспертами, контекст в 1 млн токенов. Это крупнейшая модель с открытыми весами на сегодня; компания описывает её как первую открытую систему класса 3T. Сообщалось, что во Frontend Code Arena она обходит Claude Fable 5 — ту самую модель, которая 12 августа появилась в нашем каталоге по 180 ₽ за миллион токенов. Kimi K3 указана в веб-каталоге по 10 ₽, но живой API пока её не публикует. Эта статья не про то, как её купить: она про то, что открытые веса делают с ценами закрытых моделей — и почему слово «бесплатно» здесь означает совсем не то, что кажется.

Что именно открыли

Разберём цифры, потому что заголовок «2,8 триллиона» вводит в заблуждение сильнее, чем помогает.

ПараметрЗначение
Всего параметров~2,8 трлн
Архитектураразреженная Mixture-of-Experts
Экспертов896
Активируется на токеноколо 16
Контекст1 млн токенов
Дата публикации весов27 июля 2026

Ключевая строка — предпоследняя. В разреженной MoE-архитектуре на каждый токен работает не вся модель, а небольшая доля экспертов. Активных параметров на токен принципиально меньше заголовочной цифры — именно это делает модель пригодной для реального инференса, а не только для пресс-релиза.

Вместе с весами, по данным разборов, приехала поддержка в vLLM и квантизация MXFP4. Без этого «открытые веса» остались бы архивом, который негде запустить.

Почему «бесплатно» — неточное слово

Веса бесплатны. Инференс — нет.

Чтобы поднять модель такого размера, нужна серверная сборка с десятками, а чаще сотнями гигабайт видеопамяти. Даже в квантизации MXFP4 это не задача для одной карты и не задача для одного человека. На практике self-hosting такой модели выбирают компании, у которых уже есть парк GPU и требование не выпускать данные за периметр.

Сравнение честное выглядит так:

Открытые веса выигрывают, когда данные нельзя отдавать наружу ни при каких условиях, когда нагрузка постоянна и предсказуема, и когда железо уже куплено под другие задачи.

API выигрывает, когда нагрузка неровная, когда моделей нужно несколько и переключаться между ними надо на лету, и когда стоимость простоя железа выше стоимости токенов.

Для большинства команд, которые к нам приходят, второй сценарий — это просто описание их реальности. Про то, как вендоры сами относятся к публикации весов и почему открывают одни модели и держат закрытыми другие, мы писали в разборе позиций вендоров.

Что это значит для цен

Здесь начинается интересное — и это единственная часть новости, которая касается вашего счёта.

Открытые веса — единственный механизм, который систематически давит на прайс закрытых моделей. Не конкуренция между OpenAI и Anthropic: они держат сопоставимые ставки и синхронно их поднимают. Именно открытые веса задают нижнюю границу, ниже которой платить за закрытую модель перестаёт быть разумным.

Эффект виден и в нашем каталоге. Самые дешёвые платные позиции — GLM-4.7 и GLM-4.6V по 3 ₽ за миллион токенов, и это прямое следствие того, что рядом существуют открытые альтернативы сопоставимого класса. Самая дорогая позиция — fable-5 по 180 ₽, разрыв шестидесятикратный. Opus 5 стоит 30 ₽, то есть в шесть раз дешевле Fable 5.

Kimi K3 в этот механизм добавляет главное: раньше открытые веса догоняли закрытые модели с отставанием в поколение. Теперь заголовок звучит как «открытая модель обходит закрытую флагманскую в бенчмарке». Даже если конкретный бенчмарк узкий, направление читается однозначно.

Открытые веса, которые уже можно попробовать

Здесь стоит сказать то, что обычно теряется в разговорах про открытые модели: чтобы их пощупать, необязательно ничего скачивать.

В нашем каталоге есть gpt-oss-120b — модель OpenAI с открытыми весами. Она доступна ровно так же, как закрытые: по тому же ключу, тем же запросом, с оплатой за токены. Никакого железа, никакого разворачивания.

Это удобный способ понять, что вообще даёт открытая модель на ваших задачах, до того как считать стоимость кластера. Если gpt-oss-120b справляется, разговор про self-hosting становится предметным — вы уже знаете, какого класса модель вам нужна. Если не справляется, вы сэкономили себе месяц расчётов.

Любопытная деталь про эту позицию: у неё billing.estimated_route_context_tokens равен null, тогда как у остальных семейств там конкретные числа — от 2000 у Gemini до 9500 у линейки Opus. Что это за поле и почему prompt_tokens в ответе оказывается больше, чем вы отправили, разбирали в отдельном материале о служебном контексте маршрута.

Про бенчмарк и его границы

Отдельно про «обходит Claude Fable 5». Это сообщение Tom's Hardware со ссылкой на Frontend Code Arena.

Что тут важно держать в голове:

Frontend Code Arena — узкая задача. Генерация фронтенд-кода. Это не общий интеллект, не работа с длинным контекстом, не вызов инструментов и не мультимодальность.

Опережение в одном бенчмарке не переносится на другие. Бенчмарк говорит о бенчмарке, а не о вашей задаче. Считать имеет смысл не позиции в рейтинге, а стоимость миллиона токенов в рублях на ваших реальных запросах.

Проверить на своих данных дешевле, чем спорить. Прогнать сотню реальных запросов через две модели стоит несколько сотен рублей и даёт ответ, которого нет ни в одном рейтинге.

Что значит «896 экспертов» на практике

Ещё немного про архитектуру, потому что от неё зависит, кто вообще может эту модель запустить.

В плотной модели на каждый токен работают все параметры. Модель на 2,8 трлн параметров в плотном исполнении не запустил бы никто — ни по памяти, ни по скорости.

В разреженной MoE-архитектуре сеть разбита на группы параметров, и маршрутизатор для каждого токена выбирает несколько подходящих. У Kimi K3 таких групп 896, а активируется около 16. Считать вычисления надо по активным, а не по общим.

Но есть подвох, который часто упускают: в память загружать надо всё равно все. Маршрутизатор не знает заранее, какие эксперты понадобятся на следующем токене, поэтому веса должны быть доступны целиком. Отсюда и значение квантизации MXFP4 — она сжимает представление весов, и без неё требования к видеопамяти были бы вовсе за гранью.

Практический вывод: MoE удешевляет вычисления, но не память. Именно поэтому такие модели дёшевы в пересчёте на токен у того, кто уже развернул кластер, и абсолютно недоступны тому, кто хочет запустить их на паре карт.

Чего мы не утверждаем

Границы честности, как обычно.

Мы не тестировали Kimi K3. Её нет в нашем каталоге, все характеристики — из публикаций, перечисленных в источниках.

Мы не тестировали её и в собственном каталоге. Kimi K3 появилась в нём 13 августа со статусом review — это значит, что позиция заведена, а маршрут ещё не открыт. Пока статус не сменится на available, запрос к модели завершится отказом до списания средств. Сколько это займёт, мы не обещаем.

Мы не проверяли бенчмарк самостоятельно. Цифра про Frontend Code Arena приведена по публикации, а не по нашему замеру.

Что стоит сделать

Три вещи, если новость показалась вам практически важной.

  1. Не переезжайте на модель по заголовку. Прогоните свои реальные запросы через то, что уже доступно, и сравните на своих данных.
  2. Посчитайте стоимость простоя, если думаете про self-hosting. Железо под 2,8 трлн параметров окупается только при ровной нагрузке.
  3. Следите за ценами закрытых моделей, а не за релизами открытых. Открытые веса влияют на вас именно через прайс.

Если задача — генерация контента, а не инженерия, то держать под неё собственный кластер тем более не нужно: для картинок, видео и текстов под соцсети мы сделали отдельный сервис TrendMix, где вся эта машинерия уже собрана и оплачивается по факту использования.

Что держать в голове

Moonshot открыла веса модели на 2,8 трлн параметров с MoE-архитектурой на 896 экспертов и контекстом в миллион токенов. Это крупнейшая открытая модель на сегодня, и в отдельных бенчмарках она конкурирует с флагманами.

Для вас это новость не про доступ, а про цены: открытые веса — единственная сила, которая заставляет закрытые модели дешеветь. В нашем каталоге эта сила уже видна в позициях по 3 ₽.

Как мы отделяем проверенное от предполагаемого — на странице о проекте. Сравнить модели на своих запросах можно, заведя ключ за минуту: keydealer.ru/login.

Частые вопросы

Что такое Kimi K3?

Мультимодальная модель Moonshot AI на 2,8 трлн параметров в разреженной архитектуре Mixture-of-Experts с 896 экспертами, из которых на токен активируется около 16. Контекст — 1 млн токенов. Веса опубликованы 27 июля 2026 года.

Kimi K3 есть в каталоге KeyDealer?

Да, появилась 13 августа 2026 года и сейчас указана по 10 ₽ за миллион входных и выходных токенов, вместе с Kimi K2.7 Code по 20 ₽. Но обе пока со статусом review: числятся в веб-каталоге, а живой API их не публикует. Проверять готовность нужно по GET /v1/models.

Правда, что модель бесплатная?

Бесплатны веса, а не работа модели. Заплатить придётся за железо: 2,8 трлн параметров даже в квантизации MXFP4 требуют серверной сборки, которую в одиночку почти никто не разворачивает.

Она действительно сильнее закрытых моделей?

В отдельных бенчмарках — да, сообщалось об опережении Claude Fable 5 во Frontend Code Arena. Бенчмарк — это узкий срез, переносить его на все задачи некорректно.

Что с этого разработчику в России?

Практически — понимание, куда идёт рынок. Открытые веса давят на цены закрытых моделей, и это единственный механизм, который на них реально влияет.

Источники