Обзоры и сравнения моделей

Сравнение нейросетей: GPT, Claude, Gemini и Grok

Сравнение нейросетей: GPT, Claude, Gemini и Grok

Вопрос «GPT или Claude» задают чаще всего и отвечают на него хуже всего, потому что сравнивают бренды, а выбирать нужно позиции. В каталоге на 5 сентября 2026 года 54 модели в шестнадцати семействах, и разброс цен внутри одного семейства доходит до двадцатикратного — больше, чем между семействами. При этом четыре вещи, которые действительно различают линейки, к качеству текста отношения не имеют: цена, размер контекста, набор поддержанных протоколов и то, какие возможности проверены, а какие помечены как непроверенные. Разбираем их по порядку и показываем, как выбрать за вечер без единого рейтинга.

Что в каталоге

Обзор семейств с текстовыми моделями на 5 сентября 2026 года. Ставки за миллион токенов, одинаковые на вход и на выход.

СемействоПозицийДиапазон, ₽
DeepSeek11
GLM73–15
NVIDIA50
GPT-OSS20–5
Gemini46–17
Kimi210
MiniMax10
Llama10
Grok65–20
GPT68–40
Claude88–180

Главный вывод виден прямо из таблицы: внутри Claude разброс двадцатидвухкратный, внутри Grok — четырёхкратный. Выбор «Claude или GPT» решает меньше, чем выбор позиции внутри выбранного семейства.

Четыре реальных различия

Не про качество текста, а про то, что влияет на работу.

Цена. Очевидное и при этом недооценённое: разница между позициями кратная, а не процентная. На объёме это главный фактор.

Размер контекста. Различается между семействами существенно. Но большое окно не значит, что его надо заполнять: качество ответа на очень длинном контексте растёт нелинейно, а платите вы за весь объём — сколько контекста реально нужно.

Протоколы. Часть позиций отвечает только по OpenAI-совместимому интерфейсу, часть — дополнительно по родному протоколу Anthropic. Если у вас инструмент, написанный под конкретный протокол, это решающий пункт.

Проверенность возможностей. Вызов функций, строгий вывод JSON, параллельные вызовы — у большинства позиций в каталоге эти поля помечены unknown, то есть проверка не проводилась. Это не «не работает», но и закладывать в обязательства перед клиентом без своего теста нельзя — как читать поля выдачи.

Четвёртый пункт — самый частый источник неприятных сюрпризов. Модель отвечает отлично, а нужная вам функция на ней не проверена.

Что говорят про сами линейки

Коротко, по заявленному назначению позиций в каталоге. Это описания вендоров, а не наши замеры.

Claude. Восемь позиций, самый широкий разброс. Заявленные сильные стороны — код, документы, длинный анализ. Сейчас есть примечательная деталь: opus-5 и sonnet-5 стоят одинаково, по 30 ₽, — то есть верх линейки сжался и выбирать между ними по цене больше нельзя.

GPT. Шесть позиций от 8 до 40 ₽, разделены по назначению: диалоги, контент, сложный код, массовая обработка. Самая понятная сегментация из всех — какую GPT-5.6 брать.

Gemini. Четыре позиции, заявленный упор на большой контекст и скорость. Самая дешёвая точка входа среди крупных вендоров.

Grok. Шесть позиций, включая отдельные под быструю разработку и под многошаговые исследования.

GLM, Kimi, DeepSeek, MiniMax, NVIDIA, Llama. Открытые веса или производные от них. Здесь самые низкие ставки: DeepSeek V4 Flash — 1 ₽ за миллион, восемь позиций тарифицируются по нулевой ставке. Их отдельное преимущество в том, что при желании модель можно поднять у себя — когда это оправдано.

Почему рейтинги не помогают

Три причины, по которым чужие сравнения не отвечают на ваш вопрос.

Они меряют средний результат на чужих задачах. Ваш стек, ваша предметная область и ваш язык в эту среднюю не входят.

Разрыв между позициями сузился. На многих прикладных задачах разница между дорогой и дешёвой моделью не видна без вдумчивого сравнения — мы разбирали это на данных о том, что бизнес не берёт флагманы.

Рейтинги устаревают быстрее, чем публикуются. За неделю до этой статьи в каталоге было 46 позиций, сейчас 54.

Практический вывод: рейтинг годится, чтобы сузить список до трёх кандидатов. Дальше только свои задачи.

Как выбрать за вечер

Методика, которая заменяет любые подборки.

  1. Возьмите двадцать своих реальных задач. Не придуманных — тех, что вы действительно решаете, с известным правильным результатом.
  2. Выберите четыре позиции из разных семейств. Одну нулевую, одну дешёвую, одну среднюю, одну дорогую. Так видна форма кривой, а не одна точка.
  3. Прогоните одинаково. Один промпт, один набор данных. Иначе сравниваете формулировки, а не модели.
  4. Считайте не «нравится», а число правок до готового. Эта метрика переводится в рабочее время, в отличие от общего впечатления.
  5. Добавьте колонку со стоимостью прогона. Модель, дающая на два процента лучше при вдвое большей цене, — не улучшение.
  6. Сохраните выборку. Она понадобится при следующем обновлении каталога, а обновляется он часто.

Занимает вечер, стоит рубли. Подробная методика — как выбрать модель под задачу, а как поставить это на регулярную основу — как тестировать нейросеть.

Почему стоит держать две модели

Практическое соображение, независимое от того, кто победил в вашем сравнении.

Модели отключают. У вендоров есть расписания вывода версий, и слаг может перестать отвечать или тихо начать обслуживаться другой моделью — календарь отключений.

Статусы меняются. Позиция уходит в review и возвращается; на неделе до этой статьи такое случалось несколько раз.

Цены двигаются. У вендоров и у посредников.

Через совместимый интерфейс запасной вариант — это строка в конфигурации, а не проект. Как устроен переход и что при этом ломается — как перейти на другую модель.

Частые заблуждения при выборе

Четыре, которые обходятся дороже всего.

«Флагман справится точно». Не гарантирует. Сильная модель ошибается реже, но архитектура, полагающаяся на безошибочность, ломается на любой — просто на дорогой позже и незаметнее.

«Большой контекст — значит лучше». Окно на миллион токенов не означает, что его надо заполнять. Качество ответа на очень длинном контексте растёт нелинейно, а платите вы за весь объём.

«Одна модель на всё». Обычно проигрывает разделению: дешёвая на массовое и простое, сильная на редкое и сложное. Через один ключ такое разделение — вопрос маршрутизации в вашем коде, а не двух договоров.

«Выбрали один раз и забыли». За неделю до этой статьи каталог вырос с 46 позиций до 54, ставки восьми моделей изменились, часть позиций сменила статус. Решение стоит пересматривать раз в квартал, а не считать окончательным.

И отдельно про язык: модели заметно лучше работают с тем, чего было много в обучении. Для русского это означает, что разница между семействами может быть больше, чем показывают англоязычные сравнения, — и проверять на своих текстах нужно тем более.

Чего мы не утверждаем

Мы не сравниваем качество моделей. Своих замеров мы не делали и на чужие рейтинги как на доказательство пригодности для вашей задачи не ссылаемся. Описания линеек — заявленные вендором назначения.

Не обещаем, что ставки сохранятся. Цифры — состояние на 5 сентября 2026 года; актуальные только в живой выдаче.

Не обещаем доступности конкретной позиции. Статус протокола читается перед запросом.

Что нужно, чтобы сравнить самому

Ключ заводится за минуту на keydealer.ru/login — почта и пароль, без документов и без зарубежной карты. Оплата российской картой в рублях, один ключ на весь каталог: переключение между Claude, GPT, Gemini, Grok и остальными — смена строки в запросе, а не новый договор.

Платные текстовые модели доступны сразу на приветственном бонусе: прогнать двадцать своих задач по четырём позициям можно без пополнения. Ставки и статусы видны до регистрации в GET /v1/models.

Что держать в голове

Сравнивать надо позиции, а не бренды: внутри Claude разброс двадцатидвухкратный, и выбор внутри семейства решает больше, чем выбор семейства.

Четыре различия, которые действительно влияют на работу, — цена, контекст, протоколы и проверенность возможностей. Качество текста в этом списке не первое, и именно поэтому вечер на своих двадцати задачах полезнее месяца чтения рейтингов.

Как мы проверяем факты и что храним из запросов — на странице о проекте и в llms.txt. Сравнить четыре семейства по одному ключу: keydealer.ru/login.

Частые вопросы

Какая нейросеть лучше — GPT, Claude, Gemini или Grok?

Универсального ответа нет. Разброс цен и возможностей внутри одного семейства обычно больше, чем между семействами, поэтому выбирать надо конкретную позицию под задачу, а не бренд.

Чем линейки реально различаются?

Ценой, размером контекстного окна, поддержкой протоколов и проверенностью возможностей вроде вызова функций. Качество текста различается меньше, чем эти четыре пункта.

Сколько стоят модели разных семейств в рублях?

В каталоге KeyDealer на 5 сентября 2026 года платные текстовые позиции идут от 1 рубля за миллион токенов у DeepSeek V4 Flash до 180 рублей у Claude Fable 5.

Можно ли переключаться между семействами без переписывания кода?

Да, если работать через совместимый интерфейс. Смена модели тогда — правка одной строки, а не релиз.

Как выбрать, не читая рейтинги?

Прогнать двадцать своих реальных задач через три-четыре позиции разных семейств и сравнить результаты. Это стоит рубли и занимает вечер.

Источники