Мир ИИ
Kimi K3: 2,8 трлн параметров с открытыми весами
27 июля 2026 года Moonshot AI опубликовала веса Kimi K3 — 2,8 трлн параметров, разреженная архитектура Mixture-of-Experts с 896 экспертами, контекст в 1 млн токенов. Это крупнейшая модель с открытыми весами на сегодня; компания описывает её как первую открытую систему класса 3T. Сообщалось, что во Frontend Code Arena она обходит Claude Fable 5 — ту самую модель, которая 12 августа появилась в нашем каталоге по 180 ₽ за миллион токенов. Kimi K3 указана в веб-каталоге по 10 ₽, но живой API пока её не публикует. Эта статья не про то, как её купить: она про то, что открытые веса делают с ценами закрытых моделей — и почему слово «бесплатно» здесь означает совсем не то, что кажется.
Что именно открыли
Разберём цифры, потому что заголовок «2,8 триллиона» вводит в заблуждение сильнее, чем помогает.
| Параметр | Значение |
|---|---|
| Всего параметров | ~2,8 трлн |
| Архитектура | разреженная Mixture-of-Experts |
| Экспертов | 896 |
| Активируется на токен | около 16 |
| Контекст | 1 млн токенов |
| Дата публикации весов | 27 июля 2026 |
Ключевая строка — предпоследняя. В разреженной MoE-архитектуре на каждый токен работает не вся модель, а небольшая доля экспертов. Активных параметров на токен принципиально меньше заголовочной цифры — именно это делает модель пригодной для реального инференса, а не только для пресс-релиза.
Вместе с весами, по данным разборов, приехала поддержка в vLLM и квантизация MXFP4. Без этого «открытые веса» остались бы архивом, который негде запустить.
Почему «бесплатно» — неточное слово
Веса бесплатны. Инференс — нет.
Чтобы поднять модель такого размера, нужна серверная сборка с десятками, а чаще сотнями гигабайт видеопамяти. Даже в квантизации MXFP4 это не задача для одной карты и не задача для одного человека. На практике self-hosting такой модели выбирают компании, у которых уже есть парк GPU и требование не выпускать данные за периметр.
Сравнение честное выглядит так:
Открытые веса выигрывают, когда данные нельзя отдавать наружу ни при каких условиях, когда нагрузка постоянна и предсказуема, и когда железо уже куплено под другие задачи.
API выигрывает, когда нагрузка неровная, когда моделей нужно несколько и переключаться между ними надо на лету, и когда стоимость простоя железа выше стоимости токенов.
Для большинства команд, которые к нам приходят, второй сценарий — это просто описание их реальности. Про то, как вендоры сами относятся к публикации весов и почему открывают одни модели и держат закрытыми другие, мы писали в разборе позиций вендоров.
Что это значит для цен
Здесь начинается интересное — и это единственная часть новости, которая касается вашего счёта.
Открытые веса — единственный механизм, который систематически давит на прайс закрытых моделей. Не конкуренция между OpenAI и Anthropic: они держат сопоставимые ставки и синхронно их поднимают. Именно открытые веса задают нижнюю границу, ниже которой платить за закрытую модель перестаёт быть разумным.
Эффект виден и в нашем каталоге. Самые дешёвые платные позиции — GLM-4.7 и GLM-4.6V по 3 ₽ за миллион токенов, и это прямое следствие того, что рядом существуют открытые альтернативы сопоставимого класса. Самая дорогая позиция — fable-5 по 180 ₽, разрыв шестидесятикратный. Opus 5 стоит 30 ₽, то есть в шесть раз дешевле Fable 5.
Kimi K3 в этот механизм добавляет главное: раньше открытые веса догоняли закрытые модели с отставанием в поколение. Теперь заголовок звучит как «открытая модель обходит закрытую флагманскую в бенчмарке». Даже если конкретный бенчмарк узкий, направление читается однозначно.
Открытые веса, которые уже можно попробовать
Здесь стоит сказать то, что обычно теряется в разговорах про открытые модели: чтобы их пощупать, необязательно ничего скачивать.
В нашем каталоге есть gpt-oss-120b — модель OpenAI с открытыми весами. Она доступна ровно так же, как закрытые: по тому же ключу, тем же запросом, с оплатой за токены. Никакого железа, никакого разворачивания.
Это удобный способ понять, что вообще даёт открытая модель на ваших задачах, до того как считать стоимость кластера. Если gpt-oss-120b справляется, разговор про self-hosting становится предметным — вы уже знаете, какого класса модель вам нужна. Если не справляется, вы сэкономили себе месяц расчётов.
Любопытная деталь про эту позицию: у неё billing.estimated_route_context_tokens равен null, тогда как у остальных семейств там конкретные числа — от 2000 у Gemini до 9500 у линейки Opus. Что это за поле и почему prompt_tokens в ответе оказывается больше, чем вы отправили, разбирали в отдельном материале о служебном контексте маршрута.
Про бенчмарк и его границы
Отдельно про «обходит Claude Fable 5». Это сообщение Tom's Hardware со ссылкой на Frontend Code Arena.
Что тут важно держать в голове:
Frontend Code Arena — узкая задача. Генерация фронтенд-кода. Это не общий интеллект, не работа с длинным контекстом, не вызов инструментов и не мультимодальность.
Опережение в одном бенчмарке не переносится на другие. Бенчмарк говорит о бенчмарке, а не о вашей задаче. Считать имеет смысл не позиции в рейтинге, а стоимость миллиона токенов в рублях на ваших реальных запросах.
Проверить на своих данных дешевле, чем спорить. Прогнать сотню реальных запросов через две модели стоит несколько сотен рублей и даёт ответ, которого нет ни в одном рейтинге.
Что значит «896 экспертов» на практике
Ещё немного про архитектуру, потому что от неё зависит, кто вообще может эту модель запустить.
В плотной модели на каждый токен работают все параметры. Модель на 2,8 трлн параметров в плотном исполнении не запустил бы никто — ни по памяти, ни по скорости.
В разреженной MoE-архитектуре сеть разбита на группы параметров, и маршрутизатор для каждого токена выбирает несколько подходящих. У Kimi K3 таких групп 896, а активируется около 16. Считать вычисления надо по активным, а не по общим.
Но есть подвох, который часто упускают: в память загружать надо всё равно все. Маршрутизатор не знает заранее, какие эксперты понадобятся на следующем токене, поэтому веса должны быть доступны целиком. Отсюда и значение квантизации MXFP4 — она сжимает представление весов, и без неё требования к видеопамяти были бы вовсе за гранью.
Практический вывод: MoE удешевляет вычисления, но не память. Именно поэтому такие модели дёшевы в пересчёте на токен у того, кто уже развернул кластер, и абсолютно недоступны тому, кто хочет запустить их на паре карт.
Чего мы не утверждаем
Границы честности, как обычно.
Мы не тестировали Kimi K3. Её нет в нашем каталоге, все характеристики — из публикаций, перечисленных в источниках.
Мы не тестировали её и в собственном каталоге. Kimi K3 появилась в нём 13 августа со статусом review — это значит, что позиция заведена, а маршрут ещё не открыт. Пока статус не сменится на available, запрос к модели завершится отказом до списания средств. Сколько это займёт, мы не обещаем.
Мы не проверяли бенчмарк самостоятельно. Цифра про Frontend Code Arena приведена по публикации, а не по нашему замеру.
Что стоит сделать
Три вещи, если новость показалась вам практически важной.
- Не переезжайте на модель по заголовку. Прогоните свои реальные запросы через то, что уже доступно, и сравните на своих данных.
- Посчитайте стоимость простоя, если думаете про self-hosting. Железо под 2,8 трлн параметров окупается только при ровной нагрузке.
- Следите за ценами закрытых моделей, а не за релизами открытых. Открытые веса влияют на вас именно через прайс.
Если задача — генерация контента, а не инженерия, то держать под неё собственный кластер тем более не нужно: для картинок, видео и текстов под соцсети мы сделали отдельный сервис TrendMix, где вся эта машинерия уже собрана и оплачивается по факту использования.
Что держать в голове
Moonshot открыла веса модели на 2,8 трлн параметров с MoE-архитектурой на 896 экспертов и контекстом в миллион токенов. Это крупнейшая открытая модель на сегодня, и в отдельных бенчмарках она конкурирует с флагманами.
Для вас это новость не про доступ, а про цены: открытые веса — единственная сила, которая заставляет закрытые модели дешеветь. В нашем каталоге эта сила уже видна в позициях по 3 ₽.
Как мы отделяем проверенное от предполагаемого — на странице о проекте. Сравнить модели на своих запросах можно, заведя ключ за минуту: keydealer.ru/login.
Частые вопросы
Что такое Kimi K3?
Мультимодальная модель Moonshot AI на 2,8 трлн параметров в разреженной архитектуре Mixture-of-Experts с 896 экспертами, из которых на токен активируется около 16. Контекст — 1 млн токенов. Веса опубликованы 27 июля 2026 года.
Kimi K3 есть в каталоге KeyDealer?
Да, появилась 13 августа 2026 года и сейчас указана по 10 ₽ за миллион входных и выходных токенов, вместе с Kimi K2.7 Code по 20 ₽. Но обе пока со статусом review: числятся в веб-каталоге, а живой API их не публикует. Проверять готовность нужно по GET /v1/models.
Правда, что модель бесплатная?
Бесплатны веса, а не работа модели. Заплатить придётся за железо: 2,8 трлн параметров даже в квантизации MXFP4 требуют серверной сборки, которую в одиночку почти никто не разворачивает.
Она действительно сильнее закрытых моделей?
В отдельных бенчмарках — да, сообщалось об опережении Claude Fable 5 во Frontend Code Arena. Бенчмарк — это узкий срез, переносить его на все задачи некорректно.
Что с этого разработчику в России?
Практически — понимание, куда идёт рынок. Открытые веса давят на цены закрытых моделей, и это единственный механизм, который на них реально влияет.
Источники
- https://www.tomshardware.com/tech-industry/artificial-intelligence/moonshot-releases-2-8-trillion-parameter-kimi-k3
- https://www.scmp.com/tech/tech-trends/article/3360885/moonshot-ai-unveils-worlds-largest-open-source-ai-model-china-narrows-gap-us-rivals
- https://huggingface.co/blog/ResterChed/kimi-k3-model-overview-mxfp4-quantization-open-wei
- https://api.keydealer.ru/v1/models