Обзоры и сравнения моделей
GPT или Claude: что выбрать для своей задачи
«GPT или Claude» — вопрос, на который нет честного универсального ответа, и любой, кто даёт его одним словом, что-то упускает. На разных задачах выигрывают разные линейки, а разница между ними обычно меньше, чем разница между старшей и младшей моделью внутри одной и той же линейки. Зато есть методика, которая даёт ответ для вашей задачи за вечер и за несколько сотен рублей. Разбираем, чем линейки действительно отличаются на практике — и различия эти чаще в интеграции, чем в качестве текста, — и как проверить выбор так, чтобы результат означал что-то конкретное.
Почему нельзя ответить в общем
Три причины, по которым сравнение «в целом» бесполезно именно вам.
Разброс внутри линейки больше, чем между линейками. В каталоге между младшей и старшей позицией одного семейства разница в цене кратная, и в качестве на сложных задачах тоже. Сравнивать «GPT против Claude» — всё равно что сравнивать «легковые против грузовиков», не уточняя, что везём.
Рейтинги измеряют не вашу задачу. Сводная оценка строится на широком наборе, обычно на английском и на общих темах. Ваш сценарий там либо отсутствует, либо представлен парой примеров — почему рейтинги вводят в заблуждение.
Модели меняются быстрее, чем пишутся статьи. За август состав каталога менялся почти еженедельно, ставки двигались в обе стороны. Ответ, верный месяц назад, сегодня может быть неверным.
Ступени в обеих линейках и ставки каталога за миллион токенов:
| Семейство | Позиция | ₽ за миллион |
|---|---|---|
| GPT | gpt-5-6-luna — младшая | 8 |
| GPT | gpt-5-5 — средняя | 30 |
| GPT | gpt-6-astra — старшая | 60 |
| Claude | haiku-4-5 — младшая | 8 |
| Claude | sonnet-4-6 — средняя | 12 |
| Claude | opus-4-8 — старшая | 40 |
Отсюда позиция, которой мы держимся: полезно не сказать, кто лучше, а показать, чем они отличаются и как проверить.
Чем они отличаются на практике
Различия, которые заметны в работе, а не в бенчмарках.
Формат ответа по умолчанию. Линейки по-разному склонны к спискам, заголовкам и развёрнутым пояснениям. Если ваш парсер настроен под одну, вторая может ломать его на ровном месте — не потому что хуже, а потому что иначе структурирует.
Поведение при отказе. У Claude классификатор безопасности может отклонить запрос, и это придёт успешным ответом с полем stop_reason, а не кодом ошибки. Код, ловящий только ошибки, примет такой ответ за нормальный и отдаст пользователю пустоту. Разбирали это подробно, когда появлялась Fable 5.
Работа с инструментами. Структура описания инструментов и передачи результатов различается. Через OpenAI-совместимый маршрут это скрыто прослойкой, но на сложных сценариях с параллельными вызовами перевод не всегда бесплатен.
Параметры генерации. У Claude начиная с Opus 4.7 передача temperature с недефолтным значением возвращает ошибку. Код, который всегда её подставляет, сломается на части моделей — что ещё ломается при переносе.
Служебный контекст маршрута. К вашему запросу добавляется то, чего вы не отправляли, и величина различается между семействами на порядок — подробный разбор.
Обратите внимание: ни один из пяти пунктов не про «кто умнее». Все пять про то, что придётся учесть в коде.
Методика выбора за вечер
Порядок, который даёт ответ вместо ощущения.
- Возьмите полсотни своих реальных запросов из логов. Не придуманные: они систематически проще настоящих.
- Включите пограничные случаи. Обычные запросы отработают почти одинаково; разница проявится там, где текущая модель ошибается.
- Прогоните через обе линейки с одинаковым промптом. Промпт, отлаженный под одну модель, даёт ей фору — это самая частая ошибка сравнения.
- Сравните вслепую. Ответы рядом, вы не знаете, где чей. Зная происхождение, вы найдёте достоинства у той, которую считаете лучшей.
- Повторите каждый запрос трижды. Модели недетерминированы, единичный результат ничего не доказывает — почему.
- Посчитайте стоимость на своём объёме. Не ставку за миллион, а цену вашего типичного запроса, умноженную на месячное количество.
Шестой шаг обычно и решает. Если разница в качестве неразличима, а в счёте кратная, выбор очевиден.
Начинайте снизу, а не сверху
Совет, который экономит больше всего, и его почти никто не выполняет.
Естественный порядок — взять флагман, убедиться что работает, и оставить. Правильный порядок обратный: взять самую дешёвую позицию и подниматься, только если не хватает.
В каталоге есть позиции с нулевой ставкой после квалификации и позиции по несколько рублей за миллион токенов. Разрыв с флагманскими — кратный. При этом на классификации, извлечении полей и переписывании текстов разницы в результате обычно не видно вовсе.
Именно так, судя по данным о корпоративных расходах, ведёт себя и рынок: флагманские модели собирают заметно меньшую долю объёма, чем можно было бы ожидать по их репутации. Компании берут дорогое там, где оно оправдано, и дешёвое везде остальном.
Что считать признаком «не хватает»
Раз мы советуем подниматься снизу, нужен критерий остановки. Иначе легко застрять на дешёвой модели там, где она не тянет, или наоборот переплачивать из осторожности.
Четыре признака, что дешёвой позиции действительно не хватает.
Ошибки в фактах на сложных случаях. Не в формулировке, а по существу: модель уверенно утверждает неверное там, где вопрос требует рассуждения.
Развал структуры на длинных ответах. Начало корректное, к концу теряется формат или логика. Обычно означает, что задача упирается в способность держать длинную цепочку.
Много повторных попыток. Если на одну удачную задачу приходится три обращения, экономия на ставке съедается объёмом. Отношение попыток к результату стоит мерить отдельно.
Промпт разрастается до неприличия. Когда для получения приемлемого результата приходится писать страницу инструкций, это признак, что модель компенсируется вручную. Более сильная позиция часто справляется с короткой формулировкой, и в сумме выходит дешевле.
Признак, который не годится: субъективное ощущение, что ответ дорогой модели «лучше написан». На слепом сравнении эта разница обычно исчезает — и именно поэтому мы настаиваем на слепом.
Про модели с постоянным рассуждением
Отдельная деталь, которая заметно влияет на счёт и которую редко учитывают при сравнении.
Часть современных моделей рассуждает перед ответом, и эти рассуждения тарифицируются как выходные токены — даже когда вы их не видите. У некоторых позиций отключить это нельзя вовсе.
Практическое следствие: сравнивая стоимость, смотрите на фактические выходные токены, а не на длину видимого ответа. Модель, выдавшая три предложения, могла потратить на внутренние рассуждения больше, чем на сам ответ.
Проверяется это просто — по числам из ответа API, а не на глаз. Что логировать, чтобы такие вещи были видны, разбирали отдельно.
Отсюда и неочевидный вывод для выбора: на простых задачах модель без принудительного рассуждения может оказаться и быстрее, и дешевле при том же результате. Не потому что она сильнее, а потому что не тратит токены на обдумывание того, что обдумывать не нужно.
Использовать обе — нормально
Ложная развилка, которую стоит снять.
Выбор не обязан быть окончательным и единым для всего продукта. Разные шаги одного сценария вполне могут идти на разных моделях: разбор ответа инструмента — на дешёвой, финальное рассуждение — на сильной.
Через один ключ и один совместимый интерфейс это не требует двух интеграций: меняется идентификатор модели в конфигурации. Именно поэтому мы советуем держать его в конфигурации, а не в коде вызова.
Оговорка обязательная: перед вызовом стоит читать статус маршрута из живой выдачи. Модель может быть в каталоге с закрытым протоколом, и запрос будет отклонён — бесплатно, но всё же.
Чего мы не утверждаем
Мы не называем победителя. Не из осторожности, а потому что ответ зависит от задачи и меняется со временем.
Не приводим бенчмарков. Чужие замеры измеряют чужие задачи, а своих систематических у нас нет.
Не гарантируем состав каталога. Модели появляются и уходят; актуальное состояние — только в GET /v1/models.
Различия в поведении описаны по нашему опыту работы с контрактом, а не по документации вендоров построчно.
Что держать в голове
Разница между линейками меньше, чем разница между старшей и младшей моделью внутри линейки. Значит первый вопрос — не «GPT или Claude», а «насколько дешёвой моделью можно обойтись».
Ответ на него даёт вечер работы: полсотни реальных запросов, одинаковый промпт, слепое сравнение, тройной повтор и арифметика на своём объёме. Всё остальное — включая эту статью — даёт основания для гипотезы, но не для решения.
Как мы отделяем проверенное от предполагаемого — на странице о проекте. Один ключ ко всем моделям каталога, чтобы сравнить на своих запросах: keydealer.ru/login.
Частые вопросы
Какая модель лучше — GPT или Claude?
Универсального ответа нет. На разных задачах выигрывают разные линейки, и разница обычно меньше, чем разница между старшей и младшей моделью внутри одной линейки.
Чем они отличаются на практике?
Форматом ответа по умолчанию, поведением при отказе, устройством работы с инструментами и тем, как считается контекст. Различия заметнее в интеграции, чем в качестве текста.
Как выбрать правильно?
Прогнать полсотни своих реальных запросов через обе линейки, сравнить вслепую и посчитать стоимость на своём объёме.
Что дешевле?
Зависит от задачи и от того, какие именно модели сравнивать. Разброс внутри каждой линейки кратный, поэтому сравнивать надо конкретные позиции, а не семейства.
Можно ли использовать обе?
Да, и это часто разумно: разные шаги одного сценария могут идти на разных моделях. Через один ключ это не требует двух интеграций.