Релизы и изменения моделей
SWE-2 от Cognition: дообученная Kimi K3
Cognition представила SWE-2 и в том же тексте назвала её основу: это дообученная Kimi K3 на 2,8 триллиона параметров. По замерам разработчика модель набирает 50,0% на FrontierCode 1.1 Main против 44,2% у самой K3 — прирост около шести пунктов даёт обучение с подкреплением поверх готовой базы. Для тех, кто не пользуется продуктами Cognition, практический вывод один: сама SWE-2 отдельным API не раздаётся, а базовая kimi-k3 доступна в каталоге за 10 ₽ за миллион токенов.
Разберём, что именно измерили, где в таблице прячется самое интересное и что из этого применимо на практике.
Что заявлено
Главная цифра анонса — 50,0% на FrontierCode 1.1 Main. Разработчик формулирует результат через соотношение цены и качества: в пределах одного пункта от Fable 5.1 при цене на 64% ниже.
Вторая цифра касается эффективности. Средний уровень усилий у SWE-2 обходит предыдущую модель линейки при 58% меньшем числе шагов и на 81% меньшей стоимости. В абсолютных числах это 53 шага против 127 у предшественницы, а первая реальная правка кода происходит в среднем на 18-м шаге вместо 48-го.
Смысл здесь не в самих числах, а в том, что разработчик оптимизировал не качество, а кривую «цена против качества» целиком — и описывает это как основной вклад работы.
Полная таблица замеров
Все числа — из публикации разработчика, то есть замеры заинтересованной стороны. Публикуем как есть, вместе с неудобными для неё строками.
| Бенчмарк | SWE-2 | Kimi K3 | Grok 4.6 | Fable 5.1 | GPT-5.6 Sol | GPT-6 Astra |
|---|---|---|---|---|---|---|
| FrontierCode 1.1 Main | 50,0 | 44,2 | 48,0 | 50,9 | 47,5 | 53,3 |
| DeepSWE 1.1 | 73,0 | 68,5 | 67,5 | 67,4 | 72,7 | 74,1 |
| Terminal-Bench 2.1 | 92,8 | 88,3 | 88,4 | 91,4 | 88,8 | 89,9 |
| Terminal-Bench 4 | 27,3 | 21,5 | 20,3 | 55,8 | 37,3 | 57,9 |
Самое интересное — в последней строке
Сравните две строки Terminal-Bench. На версии 2.1 у SWE-2 лучший результат таблицы, 92,8%. На версии 4 — 27,3% против 55,8% у Fable 5.1 и 57,9% у GPT-6 Astra, то есть отставание вдвое.
Это не противоречие, а иллюстрация насыщения. Когда все модели набирают на бенчмарке под девяносто процентов, он перестаёт их различать: разница в три пункта на вершине шкалы говорит о методике замера не меньше, чем о моделях. Новая, более сложная версия того же бенчмарка расставляет участников совершенно иначе.
Практический вывод для читателя простой и скучный: по одной строке из чужой таблицы решение не принимают. Как сравнивать модели на своих задачах, разобрано в статье как сравнивать модели.
Как они мерили
Методику разработчик описывает отдельно, и она заслуживает внимания.
Каждую модель гоняли в её родной обвязке: Claude Code для моделей Anthropic, Codex для моделей OpenAI, Grok Build для xAI, собственный клиент для моделей с открытыми весами. Для каждой брали лучший результат по всем уровням усилий.
Такой подход честнее общего харнесса для всех, потому что модель в чужой обвязке работает хуже своей. Но он же означает, что сравниваются не модели, а пары «модель плюс обвязка» — и это стоит держать в голове, читая любую подобную таблицу. Почему обвязка двигает результат сильнее, чем кажется, разбирали в материале служебный контекст маршрута.
Что это значит для тех, у кого нет Devin
Сама SWE-2 раздаётся внутри продуктов разработчика. Отдельного API-доступа к ней в публикации не объявлено, поэтому встроить её в свой сервис нельзя.
Зато базовая модель доступна как обычная позиция. kimi-k3 есть в каталоге по 10 ₽ за миллион токенов в обе стороны, с подтверждённым чат-протоколом и подтверждённым пониманием изображений. По той же таблице разработчика K3 набирает 44,2% против 50,0% у дообученной версии — разрыв около шести пунктов, и это цена вопроса, если вам нужна именно SWE-2.
Ставки на 12 сентября 2026 года для сопоставимых по назначению позиций:
| Модель | ₽ за миллион | Назначение по каталогу |
|---|---|---|
kimi-k3 | 10 | длинный контекст и сложные документы |
grok-build-0-1 | 5 | быстрая разработка и правки |
glm-5-3 | 15 | сложный код и агентные задачи |
sonnet-4-6 | 12 | точные правки в существующем коде |
opus-5 | 30 | архитектура и глубокий разбор |
Что значит «оптимизировали кривую цены»
Формулировка из анонса звучит абстрактно, но за ней стоит понятная практическая вещь.
Обычно у модели есть несколько уровней усилий: чем выше, тем больше она думает, тем дороже и тем лучше результат. Разработчики настраивают эти уровни по отдельности, и часто верхний уровень оказывается невыгодным: платите вдвое, получаете полпункта.
Cognition описывает подход, при котором все уровни усилий обучаются за один проход, а штраф за стоимость подбирается под наклон кривой на каждом уровне. Результат виден в шагах: средний уровень делает 53 шага, высокий 80, максимальный 98, и каждый следующий действительно добавляет качество, а не только счёт.
Для читателя отсюда следует практическое правило, не зависящее от вендора: уровень усилий надо проверять на своих задачах. Верхний уровень часто не окупается, а нижний справляется чаще, чем принято думать. Разбор параметра — в статье уровни рассуждения.
Отдельный замер, который стоит прочитать
В той же публикации есть раздел про доверие к моделям, и в нём приведены результаты, неудобные для базовой модели SWE-2.
На наборе из 145 вопросов о политически чувствительных для Китая темах измеряли долю ответов без пропаганды и цензуры. Kimi K3 прошла 75,6% на английском, 54,5% на упрощённом китайском и 73,3% на традиционном. Для сравнения, у GPT-5.6 Sol в том же замере 100%, 95,9% и 99,3%, у Fable 5.1 — 99,3%, 95,4% и 98,8%, у GLM 5.3 — 99,3%, 83,8% и 95,5%.
Оговорка обязательная: замер выполнен компанией, которая продаёт конкурирующую модель, судьёй выступала другая языковая модель, а критерий прохождения бинарный. Но сам факт разрыва по языку запроса — повод проверить поведение на своих данных, если ваша задача касается чувствительных тем.
Что здесь общего с другими релизами
Третий заметный случай за месяц, когда сильная модель получается дообучением чужой открытой базы, а не обучением с нуля. Это меняет практическую картину сразу в двух местах.
Во-первых, разрыв между открытыми весами и закрытыми флагманами измеряется теперь не поколениями, а несколькими пунктами, которые добирают обучением с подкреплением поверх базы.
Во-вторых, качество вашего результата всё сильнее зависит не от того, чью модель вы взяли, а от обвязки вокруг неё. Про позицию вендоров по открытым весам писали в статье открытые веса: позиция вендоров.
Чего мы не утверждаем
Мы не проверяли SWE-2: отдельного API-доступа к ней нет, а писать о качестве по чужим таблицам мы не станем.
Мы не подтверждаем ни одной цифры из анонса. Все замеры выполнены разработчиком модели на его же инфраструктуре, включая результаты конкурентов в сравнительной таблице.
Мы не утверждаем, что kimi-k3 в нашем каталоге ведёт себя так же, как в замерах разработчика: там своя обвязка, свои уровни усилий и свой набор задач.
Что нужно, чтобы проверить самому
Ключ заводится за минуту на keydealer.ru/login — почта и пароль, без документов и без зарубежной карты. Оплата российской картой в рублях, один ключ на все 53 позиции каталога.
Платные текстовые модели доступны сразу на приветственном бонусе: прогнать kimi-k3 на своих трёх задачах и сравнить с привычной моделью можно без пополнения.
Что держать в голове
Сильная кодовая модель снова оказалась дообучением чужой открытой базы, и база эта доступна как обычная позиция каталога.
Разброс результатов одной модели между двумя версиями одного бенчмарка — от первого места до отставания вдвое — говорит о бенчмарках больше, чем о моделях.
Любая сравнительная таблица от разработчика модели остаётся его замером, даже когда выглядит нейтрально. Как мы проверяем факты и почему у каждой цифры стоит дата — на странице о проекте. Завести ключ: keydealer.ru/login.
Частые вопросы
Что такое SWE-2?
Кодовая модель Cognition, представленная 10 сентября 2026 года. По замерам разработчика она набирает 50,0% на FrontierCode 1.1 Main — в пределах одного пункта от Fable 5.1 и на 64% дешевле.
На чём основана SWE-2?
На Kimi K3. Разработчик пишет об этом прямо: SWE-2 дообучена поверх модели на 2,8 триллиона параметров, которая уже прошла обучение с подкреплением под агентный код.
Доступна ли SWE-2 по API?
Отдельного API-доступа разработчик не объявлял: модель раздаётся внутри его собственных продуктов. Базовая Kimi K3 при этом доступна как обычная позиция каталога.
Насколько SWE-2 экономнее предшественницы?
По замерам разработчика средний уровень усилий делает на 58% меньше шагов и стоит на 81% дешевле SWE-1.7 при более высоком результате.
Почему SWE-2 лидирует в одном бенчмарке и проигрывает в другом?
На Terminal-Bench 2.1 у неё 92,8% — лучший результат в таблице, а на Terminal-Bench 4 всего 27,3% против 57,9% у GPT-6 Astra. Насыщенный бенчмарк перестаёт различать модели.
Сколько стоит Kimi K3 в рублях?
В каталоге KeyDealer позиция kimi-k3 стоит 10 ₽ за миллион токенов одинаково на вход и на выход.