Релизы и изменения моделей

SWE-2 от Cognition: дообученная Kimi K3

SWE-2 от Cognition: дообученная Kimi K3

Cognition представила SWE-2 и в том же тексте назвала её основу: это дообученная Kimi K3 на 2,8 триллиона параметров. По замерам разработчика модель набирает 50,0% на FrontierCode 1.1 Main против 44,2% у самой K3 — прирост около шести пунктов даёт обучение с подкреплением поверх готовой базы. Для тех, кто не пользуется продуктами Cognition, практический вывод один: сама SWE-2 отдельным API не раздаётся, а базовая kimi-k3 доступна в каталоге за 10 ₽ за миллион токенов.

Разберём, что именно измерили, где в таблице прячется самое интересное и что из этого применимо на практике.

Что заявлено

Главная цифра анонса — 50,0% на FrontierCode 1.1 Main. Разработчик формулирует результат через соотношение цены и качества: в пределах одного пункта от Fable 5.1 при цене на 64% ниже.

Вторая цифра касается эффективности. Средний уровень усилий у SWE-2 обходит предыдущую модель линейки при 58% меньшем числе шагов и на 81% меньшей стоимости. В абсолютных числах это 53 шага против 127 у предшественницы, а первая реальная правка кода происходит в среднем на 18-м шаге вместо 48-го.

Смысл здесь не в самих числах, а в том, что разработчик оптимизировал не качество, а кривую «цена против качества» целиком — и описывает это как основной вклад работы.

Полная таблица замеров

Все числа — из публикации разработчика, то есть замеры заинтересованной стороны. Публикуем как есть, вместе с неудобными для неё строками.

БенчмаркSWE-2Kimi K3Grok 4.6Fable 5.1GPT-5.6 SolGPT-6 Astra
FrontierCode 1.1 Main50,044,248,050,947,553,3
DeepSWE 1.173,068,567,567,472,774,1
Terminal-Bench 2.192,888,388,491,488,889,9
Terminal-Bench 427,321,520,355,837,357,9

Самое интересное — в последней строке

Сравните две строки Terminal-Bench. На версии 2.1 у SWE-2 лучший результат таблицы, 92,8%. На версии 4 — 27,3% против 55,8% у Fable 5.1 и 57,9% у GPT-6 Astra, то есть отставание вдвое.

Это не противоречие, а иллюстрация насыщения. Когда все модели набирают на бенчмарке под девяносто процентов, он перестаёт их различать: разница в три пункта на вершине шкалы говорит о методике замера не меньше, чем о моделях. Новая, более сложная версия того же бенчмарка расставляет участников совершенно иначе.

Практический вывод для читателя простой и скучный: по одной строке из чужой таблицы решение не принимают. Как сравнивать модели на своих задачах, разобрано в статье как сравнивать модели.

Как они мерили

Методику разработчик описывает отдельно, и она заслуживает внимания.

Каждую модель гоняли в её родной обвязке: Claude Code для моделей Anthropic, Codex для моделей OpenAI, Grok Build для xAI, собственный клиент для моделей с открытыми весами. Для каждой брали лучший результат по всем уровням усилий.

Такой подход честнее общего харнесса для всех, потому что модель в чужой обвязке работает хуже своей. Но он же означает, что сравниваются не модели, а пары «модель плюс обвязка» — и это стоит держать в голове, читая любую подобную таблицу. Почему обвязка двигает результат сильнее, чем кажется, разбирали в материале служебный контекст маршрута.

Что это значит для тех, у кого нет Devin

Сама SWE-2 раздаётся внутри продуктов разработчика. Отдельного API-доступа к ней в публикации не объявлено, поэтому встроить её в свой сервис нельзя.

Зато базовая модель доступна как обычная позиция. kimi-k3 есть в каталоге по 10 ₽ за миллион токенов в обе стороны, с подтверждённым чат-протоколом и подтверждённым пониманием изображений. По той же таблице разработчика K3 набирает 44,2% против 50,0% у дообученной версии — разрыв около шести пунктов, и это цена вопроса, если вам нужна именно SWE-2.

Ставки на 12 сентября 2026 года для сопоставимых по назначению позиций:

Модель₽ за миллионНазначение по каталогу
kimi-k310длинный контекст и сложные документы
grok-build-0-15быстрая разработка и правки
glm-5-315сложный код и агентные задачи
sonnet-4-612точные правки в существующем коде
opus-530архитектура и глубокий разбор

Что значит «оптимизировали кривую цены»

Формулировка из анонса звучит абстрактно, но за ней стоит понятная практическая вещь.

Обычно у модели есть несколько уровней усилий: чем выше, тем больше она думает, тем дороже и тем лучше результат. Разработчики настраивают эти уровни по отдельности, и часто верхний уровень оказывается невыгодным: платите вдвое, получаете полпункта.

Cognition описывает подход, при котором все уровни усилий обучаются за один проход, а штраф за стоимость подбирается под наклон кривой на каждом уровне. Результат виден в шагах: средний уровень делает 53 шага, высокий 80, максимальный 98, и каждый следующий действительно добавляет качество, а не только счёт.

Для читателя отсюда следует практическое правило, не зависящее от вендора: уровень усилий надо проверять на своих задачах. Верхний уровень часто не окупается, а нижний справляется чаще, чем принято думать. Разбор параметра — в статье уровни рассуждения.

Отдельный замер, который стоит прочитать

В той же публикации есть раздел про доверие к моделям, и в нём приведены результаты, неудобные для базовой модели SWE-2.

На наборе из 145 вопросов о политически чувствительных для Китая темах измеряли долю ответов без пропаганды и цензуры. Kimi K3 прошла 75,6% на английском, 54,5% на упрощённом китайском и 73,3% на традиционном. Для сравнения, у GPT-5.6 Sol в том же замере 100%, 95,9% и 99,3%, у Fable 5.1 — 99,3%, 95,4% и 98,8%, у GLM 5.3 — 99,3%, 83,8% и 95,5%.

Оговорка обязательная: замер выполнен компанией, которая продаёт конкурирующую модель, судьёй выступала другая языковая модель, а критерий прохождения бинарный. Но сам факт разрыва по языку запроса — повод проверить поведение на своих данных, если ваша задача касается чувствительных тем.

Что здесь общего с другими релизами

Третий заметный случай за месяц, когда сильная модель получается дообучением чужой открытой базы, а не обучением с нуля. Это меняет практическую картину сразу в двух местах.

Во-первых, разрыв между открытыми весами и закрытыми флагманами измеряется теперь не поколениями, а несколькими пунктами, которые добирают обучением с подкреплением поверх базы.

Во-вторых, качество вашего результата всё сильнее зависит не от того, чью модель вы взяли, а от обвязки вокруг неё. Про позицию вендоров по открытым весам писали в статье открытые веса: позиция вендоров.

Чего мы не утверждаем

Мы не проверяли SWE-2: отдельного API-доступа к ней нет, а писать о качестве по чужим таблицам мы не станем.

Мы не подтверждаем ни одной цифры из анонса. Все замеры выполнены разработчиком модели на его же инфраструктуре, включая результаты конкурентов в сравнительной таблице.

Мы не утверждаем, что kimi-k3 в нашем каталоге ведёт себя так же, как в замерах разработчика: там своя обвязка, свои уровни усилий и свой набор задач.

Что нужно, чтобы проверить самому

Ключ заводится за минуту на keydealer.ru/login — почта и пароль, без документов и без зарубежной карты. Оплата российской картой в рублях, один ключ на все 53 позиции каталога.

Платные текстовые модели доступны сразу на приветственном бонусе: прогнать kimi-k3 на своих трёх задачах и сравнить с привычной моделью можно без пополнения.

Что держать в голове

Сильная кодовая модель снова оказалась дообучением чужой открытой базы, и база эта доступна как обычная позиция каталога.

Разброс результатов одной модели между двумя версиями одного бенчмарка — от первого места до отставания вдвое — говорит о бенчмарках больше, чем о моделях.

Любая сравнительная таблица от разработчика модели остаётся его замером, даже когда выглядит нейтрально. Как мы проверяем факты и почему у каждой цифры стоит дата — на странице о проекте. Завести ключ: keydealer.ru/login.

Частые вопросы

Что такое SWE-2?

Кодовая модель Cognition, представленная 10 сентября 2026 года. По замерам разработчика она набирает 50,0% на FrontierCode 1.1 Main — в пределах одного пункта от Fable 5.1 и на 64% дешевле.

На чём основана SWE-2?

На Kimi K3. Разработчик пишет об этом прямо: SWE-2 дообучена поверх модели на 2,8 триллиона параметров, которая уже прошла обучение с подкреплением под агентный код.

Доступна ли SWE-2 по API?

Отдельного API-доступа разработчик не объявлял: модель раздаётся внутри его собственных продуктов. Базовая Kimi K3 при этом доступна как обычная позиция каталога.

Насколько SWE-2 экономнее предшественницы?

По замерам разработчика средний уровень усилий делает на 58% меньше шагов и стоит на 81% дешевле SWE-1.7 при более высоком результате.

Почему SWE-2 лидирует в одном бенчмарке и проигрывает в другом?

На Terminal-Bench 2.1 у неё 92,8% — лучший результат в таблице, а на Terminal-Bench 4 всего 27,3% против 57,9% у GPT-6 Astra. Насыщенный бенчмарк перестаёт различать модели.

Сколько стоит Kimi K3 в рублях?

В каталоге KeyDealer позиция kimi-k3 стоит 10 ₽ за миллион токенов одинаково на вход и на выход.

Источники