LLM API и интеграция

Уровни рассуждения в API: сколько стоит думать дольше

Уровни рассуждения в API: сколько стоит думать дольше

Уровень усилий рассуждения — единственный параметр, который меняет счёт, ничего не меняя в вашем запросе. Модель тратит на размышление токены, они тарифицируются как выходные, а выход у флагманов стоит в пять раз дороже входа. Значит переключение с medium на max может удорожить обращение в разы, при том что видимый ответ останется той же длины. У GPT-5.6 Sol уровней шесть, включая none; у вышедшей 3 сентября GPT-6 Astra их пять — none из списка исчез, и это тихо ломает код, который его передавал. Разбираем, что уровни делают, во что обходятся и почему поднимать их по умолчанию — плохая идея.

Что это за параметр

Начнём с механики, потому что из неё следует вся экономика.

Рассуждающая модель перед ответом генерирует промежуточный текст — ход мысли. Вы его обычно не видите, но он существует и состоит из тех же токенов, что и ответ. Параметр reasoning.effort управляет тем, сколько модель на это тратит.

Отсюда главное: токены рассуждения тарифицируются как выходные. Не как вход, не бесплатно, а по самой дорогой ставке в прайсе. У GPT-5.6 Sol выход стоит $20 за миллион при входе $4, у Astra — $50 при входе $10. Пятикратный разрыв в обоих случаях, и невидимая часть ответа попадает именно в дорогую сторону.

Почему выход вообще дороже входа и что из этого следует — разбирали отдельно в материале про асимметричную цену выхода.

Какие уровни есть

По документации разработчика на 5 сентября 2026 года.

МодельУровни reasoning.effort
GPT-5.6 Solnone, low, medium (по умолчанию), high, xhigh, max
GPT-6 Astralow, medium, high, xhigh, max
Шкала уровней рассуждения от low до max и рост расхода выходных токенов
Каждая ступень выше — больше невидимых выходных токенов. Кривая качества при этом выполаживается раньше, чем заканчивается шкала.

Две вещи, которые стоит заметить.

Уровней шесть, а не три. Выше привычного high есть ещё два — xhigh и max. Это отчасти объясняет, почему у Astra нет отдельной Pro-версии: запас «думать дольше» встроен в саму модель — почему Pro и Ultra не существует.

У Astra исчез none. Значение, которым отключали рассуждение полностью, в её списке отсутствует. Код, который его передавал, при переходе придётся править — и это ровно тот тип поломки, который не даёт ошибки на этапе разработки и всплывает в проде.

Во что это обходится

Посчитаем, чтобы масштаб стал понятен. Курс ЦБ на 5 сентября 2026 года — 86,5857 ₽ за доллар.

Выходная ставка Astra $50 за миллион — это 4 329 ₽. У Sol $20 — 1 732 ₽.

Теперь представим типичную задачу: короткий вопрос, ответ на 500 токенов. На низком уровне усилий модель потратит на рассуждение, условно, ещё несколько сотен токенов. На максимальном — может потратить тысячи. Видимый ответ при этом одинаковый.

Точных коэффициентов вендор не публикует, и мы их не выдумываем. Но направление однозначно: чем выше уровень, тем больше выходных токенов и тем больше счёт, а поскольку выход дороже входа впятеро, растёт он быстрее, чем интуиция подсказывает.

Отсюда практический вывод, который стоит проверить у себя: если у вас в счёте выходных токенов заметно больше, чем длина видимых ответов, — вы платите за рассуждение и, возможно, не знали об этом. Как разложить расход по строкам — как считать токены.

Когда поднимать уровень

Три ситуации, где это оправдано.

Многошаговые задачи без очевидного решения. Архитектурный разбор, планирование, задача с несколькими взаимными ограничениями.

Редкие и дорогие по последствиям обращения. Когда ошибка стоит больше, чем разница в цене запроса, экономить на рассуждении бессмысленно.

Отладка сложного случая. Разово поднять до high или выше, чтобы понять, справляется ли модель в принципе, — нормальная диагностика.

Общее у трёх: вызовов немного, цена ошибки высока. Именно этим сценарий отличается от массового.

Когда поднимать не надо

Четыре ситуации, где повышенный уровень — это чистый расход.

Классификация и извлечение полей. Ответ короткий, вариантов конечное число, правильный ответ один. Рассуждение здесь почти ничего не добавляет — как устроена классификация.

Ответы по предоставленным данным. Если ответ лежит в тексте, который вы положили в контекст, думать особо не над чем: нужен поиск нужного фрагмента, а не размышление — поиск по своим документам.

Генерация по шаблону. Описания товаров, письма по образцу, переводы. Здесь решает фактура на входе, а не глубина размышления.

Интерактивные сценарии. Рассуждение — это время. Чем выше уровень, тем дольше пользователь смотрит на индикатор ожидания — из чего складывается задержка.

Последний пункт недооценивают: повышение уровня бьёт и по счёту, и по скорости одновременно.

Как выбрать уровень по-честному

Методика на вечер, вместо догадок.

  1. Возьмите двадцать своих реальных задач с известными правильными ответами.
  2. Прогоните на трёх уровнях: низком, среднем и высоком. Один и тот же промпт.
  3. Посчитайте три величины: долю правильных ответов, число выходных токенов, время ответа.
  4. Посмотрите, где кривая выполаживается. Обычно между низким и средним разница заметная, а между высоким и максимальным — нет. Платить за плоский участок незачем.
  5. Зафиксируйте выбор в конфигурации, а не в коде: уровень придётся пересматривать при смене модели.

Четвёртый пункт — суть всего упражнения. Уровень усилий стоит выбирать по точке, где качество перестаёт расти, а не по принципу «возьмём максимум на всякий случай».

Подробнее о том, как ставить такие замеры, — как тестировать нейросеть.

Чем это отличается от температуры

Разграничение, потому что оба параметра путают.

Температура управляет случайностью выбора следующего токена. Она не добавляет модели вычислений и не меняет счёт — что она делает на самом деле.

Уровень усилий управляет объёмом промежуточных вычислений. Он напрямую меняет число выходных токенов и, следовательно, цену.

Отсюда правило: если задача даёт нестабильные ответы — это к температуре и к проверкам в коде. Если задача не решается в принципе — это к уровню усилий и к выбору модели. Крутить одно вместо другого — самая частая потеря времени в этой области.

Что делать при переходе на Astra

Практический чек-лист, раз уж none оттуда исчез.

Найдите в коде все места, где передаётся reasoning.effort. Особенно захардкоженные значения.

Уберите none. На Astra его нет; чем заменить — вопрос к вашей задаче, ближайшее по смыслу low.

Пересчитайте бюджет. Если раньше рассуждение было отключено, а теперь минимальный уровень low, выходных токенов станет больше — при выходной ставке в 4 329 ₽ за миллион это заметно.

Прогоните выборку заново. Уровень, подобранный под Sol, на Astra может вести себя иначе.

Общая механика перехода и то, что ещё ломается тихо, — в материале как перейти на другую модель.

Как с этим у нас

Честно и коротко.

Astra приехала в каталог KeyDealer 5 сентября 2026 года — 60 ₽ за миллион входных и столько же за миллион выходных токенов. Разбор самой модели — в отдельном материале.

Поддержка параметра зависит от позиции. В выдаче GET /v1/models возможности публикуются полями capabilities, и у большинства позиций каталога они стоят в unknown — это означает «мы не проверяли», а не «работает». Проверять нужно на своей задаче — как читать поля.

Ставка у нас одна на вход и на выход у большинства позиций. Это меняет арифметику: там, где у вендора рассуждение попадает в ставку впятеро дороже входа, у нас оно стоит столько же, сколько обычный текст. Для задач с длинным размышлением это выгоднее, для задач с огромным контекстом и коротким ответом — наоборот.

Чего мы не утверждаем

Не публикуем коэффициентов расхода по уровням. Вендор их не раскрывает, а своих замеров у нас нет.

Не сравниваем качество между уровнями. Оно зависит от задачи; измерять надо на своей выборке.

Не утверждаем, что уровни ведут себя одинаково у разных вендоров. Названия могут совпадать, поведение — нет.

Цифры — на дату. Список уровней и ставки взяты из документации разработчика на 5 сентября 2026 года.

Что нужно, чтобы проверить у себя

Ключ заводится за минуту на keydealer.ru/login — почта и пароль, без документов и без зарубежной карты. Оплата российской картой в рублях, один ключ на весь каталог: 54 позиции в шестнадцати семействах.

Платные текстовые модели доступны сразу на приветственном бонусе — прогнать двадцать своих задач и посмотреть, сколько выходных токенов уходит на рассуждение, можно без пополнения. Это, кстати, самый быстрый способ понять, платите ли вы за размышление, которое вам не нужно.

Что держать в голове

Уровень усилий — параметр, который меняет счёт, не меняя запроса. Токены рассуждения идут по выходной ставке, а она у флагманов впятеро выше входной.

Выбирать уровень стоит по точке, где качество перестаёт расти на вашей выборке, а не по принципу «побольше». И при переходе на Astra проверьте код на none — этого значения там больше нет.

Как мы проверяем факты и почему у каждой цифры стоит дата — на странице о проекте и в llms.txt. Замерить свои задачи: keydealer.ru/login.

Частые вопросы

Что такое reasoning.effort?

Параметр, который задаёт, насколько долго модель рассуждает перед ответом. У GPT-5.6 Sol он принимает значения none, low, medium, high, xhigh и max, у GPT-6 Astra значения none нет.

Какой уровень стоит по умолчанию?

У GPT-5.6 Sol по документации вендора значение по умолчанию — medium.

Влияет ли уровень рассуждения на цену?

Да, напрямую. Токены рассуждения тарифицируются как выходные, а выход стоит в разы дороже входа. Поднять уровень — значит увеличить счёт, даже если видимый ответ не станет длиннее.

Что случилось со значением none у Astra?

В документации GPT-6 Astra оно отсутствует: поддерживаются low, medium, high, xhigh и max. Код, который передавал none, при переходе придётся править.

Есть ли этот параметр у моделей в каталоге KeyDealer?

Поддержка зависит от позиции и протокола. В выдаче GET /v1/models возможности публикуются полями capabilities, и у большинства позиций они помечены как непроверенные.

Источники