LLM API и интеграция
Уровни рассуждения в API: сколько стоит думать дольше
Уровень усилий рассуждения — единственный параметр, который меняет счёт, ничего не меняя в вашем запросе. Модель тратит на размышление токены, они тарифицируются как выходные, а выход у флагманов стоит в пять раз дороже входа. Значит переключение с medium на max может удорожить обращение в разы, при том что видимый ответ останется той же длины. У GPT-5.6 Sol уровней шесть, включая none; у вышедшей 3 сентября GPT-6 Astra их пять — none из списка исчез, и это тихо ломает код, который его передавал. Разбираем, что уровни делают, во что обходятся и почему поднимать их по умолчанию — плохая идея.
Что это за параметр
Начнём с механики, потому что из неё следует вся экономика.
Рассуждающая модель перед ответом генерирует промежуточный текст — ход мысли. Вы его обычно не видите, но он существует и состоит из тех же токенов, что и ответ. Параметр reasoning.effort управляет тем, сколько модель на это тратит.
Отсюда главное: токены рассуждения тарифицируются как выходные. Не как вход, не бесплатно, а по самой дорогой ставке в прайсе. У GPT-5.6 Sol выход стоит $20 за миллион при входе $4, у Astra — $50 при входе $10. Пятикратный разрыв в обоих случаях, и невидимая часть ответа попадает именно в дорогую сторону.
Почему выход вообще дороже входа и что из этого следует — разбирали отдельно в материале про асимметричную цену выхода.
Какие уровни есть
По документации разработчика на 5 сентября 2026 года.
| Модель | Уровни reasoning.effort |
|---|---|
| GPT-5.6 Sol | none, low, medium (по умолчанию), high, xhigh, max |
| GPT-6 Astra | low, medium, high, xhigh, max |

Две вещи, которые стоит заметить.
Уровней шесть, а не три. Выше привычного high есть ещё два — xhigh и max. Это отчасти объясняет, почему у Astra нет отдельной Pro-версии: запас «думать дольше» встроен в саму модель — почему Pro и Ultra не существует.
У Astra исчез none. Значение, которым отключали рассуждение полностью, в её списке отсутствует. Код, который его передавал, при переходе придётся править — и это ровно тот тип поломки, который не даёт ошибки на этапе разработки и всплывает в проде.
Во что это обходится
Посчитаем, чтобы масштаб стал понятен. Курс ЦБ на 5 сентября 2026 года — 86,5857 ₽ за доллар.
Выходная ставка Astra $50 за миллион — это 4 329 ₽. У Sol $20 — 1 732 ₽.
Теперь представим типичную задачу: короткий вопрос, ответ на 500 токенов. На низком уровне усилий модель потратит на рассуждение, условно, ещё несколько сотен токенов. На максимальном — может потратить тысячи. Видимый ответ при этом одинаковый.
Точных коэффициентов вендор не публикует, и мы их не выдумываем. Но направление однозначно: чем выше уровень, тем больше выходных токенов и тем больше счёт, а поскольку выход дороже входа впятеро, растёт он быстрее, чем интуиция подсказывает.
Отсюда практический вывод, который стоит проверить у себя: если у вас в счёте выходных токенов заметно больше, чем длина видимых ответов, — вы платите за рассуждение и, возможно, не знали об этом. Как разложить расход по строкам — как считать токены.
Когда поднимать уровень
Три ситуации, где это оправдано.
Многошаговые задачи без очевидного решения. Архитектурный разбор, планирование, задача с несколькими взаимными ограничениями.
Редкие и дорогие по последствиям обращения. Когда ошибка стоит больше, чем разница в цене запроса, экономить на рассуждении бессмысленно.
Отладка сложного случая. Разово поднять до high или выше, чтобы понять, справляется ли модель в принципе, — нормальная диагностика.
Общее у трёх: вызовов немного, цена ошибки высока. Именно этим сценарий отличается от массового.
Когда поднимать не надо
Четыре ситуации, где повышенный уровень — это чистый расход.
Классификация и извлечение полей. Ответ короткий, вариантов конечное число, правильный ответ один. Рассуждение здесь почти ничего не добавляет — как устроена классификация.
Ответы по предоставленным данным. Если ответ лежит в тексте, который вы положили в контекст, думать особо не над чем: нужен поиск нужного фрагмента, а не размышление — поиск по своим документам.
Генерация по шаблону. Описания товаров, письма по образцу, переводы. Здесь решает фактура на входе, а не глубина размышления.
Интерактивные сценарии. Рассуждение — это время. Чем выше уровень, тем дольше пользователь смотрит на индикатор ожидания — из чего складывается задержка.
Последний пункт недооценивают: повышение уровня бьёт и по счёту, и по скорости одновременно.
Как выбрать уровень по-честному
Методика на вечер, вместо догадок.
- Возьмите двадцать своих реальных задач с известными правильными ответами.
- Прогоните на трёх уровнях: низком, среднем и высоком. Один и тот же промпт.
- Посчитайте три величины: долю правильных ответов, число выходных токенов, время ответа.
- Посмотрите, где кривая выполаживается. Обычно между низким и средним разница заметная, а между высоким и максимальным — нет. Платить за плоский участок незачем.
- Зафиксируйте выбор в конфигурации, а не в коде: уровень придётся пересматривать при смене модели.
Четвёртый пункт — суть всего упражнения. Уровень усилий стоит выбирать по точке, где качество перестаёт расти, а не по принципу «возьмём максимум на всякий случай».
Подробнее о том, как ставить такие замеры, — как тестировать нейросеть.
Чем это отличается от температуры
Разграничение, потому что оба параметра путают.
Температура управляет случайностью выбора следующего токена. Она не добавляет модели вычислений и не меняет счёт — что она делает на самом деле.
Уровень усилий управляет объёмом промежуточных вычислений. Он напрямую меняет число выходных токенов и, следовательно, цену.
Отсюда правило: если задача даёт нестабильные ответы — это к температуре и к проверкам в коде. Если задача не решается в принципе — это к уровню усилий и к выбору модели. Крутить одно вместо другого — самая частая потеря времени в этой области.
Что делать при переходе на Astra
Практический чек-лист, раз уж none оттуда исчез.
Найдите в коде все места, где передаётся reasoning.effort. Особенно захардкоженные значения.
Уберите none. На Astra его нет; чем заменить — вопрос к вашей задаче, ближайшее по смыслу low.
Пересчитайте бюджет. Если раньше рассуждение было отключено, а теперь минимальный уровень low, выходных токенов станет больше — при выходной ставке в 4 329 ₽ за миллион это заметно.
Прогоните выборку заново. Уровень, подобранный под Sol, на Astra может вести себя иначе.
Общая механика перехода и то, что ещё ломается тихо, — в материале как перейти на другую модель.
Как с этим у нас
Честно и коротко.
Astra приехала в каталог KeyDealer 5 сентября 2026 года — 60 ₽ за миллион входных и столько же за миллион выходных токенов. Разбор самой модели — в отдельном материале.
Поддержка параметра зависит от позиции. В выдаче GET /v1/models возможности публикуются полями capabilities, и у большинства позиций каталога они стоят в unknown — это означает «мы не проверяли», а не «работает». Проверять нужно на своей задаче — как читать поля.
Ставка у нас одна на вход и на выход у большинства позиций. Это меняет арифметику: там, где у вендора рассуждение попадает в ставку впятеро дороже входа, у нас оно стоит столько же, сколько обычный текст. Для задач с длинным размышлением это выгоднее, для задач с огромным контекстом и коротким ответом — наоборот.
Чего мы не утверждаем
Не публикуем коэффициентов расхода по уровням. Вендор их не раскрывает, а своих замеров у нас нет.
Не сравниваем качество между уровнями. Оно зависит от задачи; измерять надо на своей выборке.
Не утверждаем, что уровни ведут себя одинаково у разных вендоров. Названия могут совпадать, поведение — нет.
Цифры — на дату. Список уровней и ставки взяты из документации разработчика на 5 сентября 2026 года.
Что нужно, чтобы проверить у себя
Ключ заводится за минуту на keydealer.ru/login — почта и пароль, без документов и без зарубежной карты. Оплата российской картой в рублях, один ключ на весь каталог: 54 позиции в шестнадцати семействах.
Платные текстовые модели доступны сразу на приветственном бонусе — прогнать двадцать своих задач и посмотреть, сколько выходных токенов уходит на рассуждение, можно без пополнения. Это, кстати, самый быстрый способ понять, платите ли вы за размышление, которое вам не нужно.
Что держать в голове
Уровень усилий — параметр, который меняет счёт, не меняя запроса. Токены рассуждения идут по выходной ставке, а она у флагманов впятеро выше входной.
Выбирать уровень стоит по точке, где качество перестаёт расти на вашей выборке, а не по принципу «побольше». И при переходе на Astra проверьте код на none — этого значения там больше нет.
Как мы проверяем факты и почему у каждой цифры стоит дата — на странице о проекте и в llms.txt. Замерить свои задачи: keydealer.ru/login.
Частые вопросы
Что такое reasoning.effort?
Параметр, который задаёт, насколько долго модель рассуждает перед ответом. У GPT-5.6 Sol он принимает значения none, low, medium, high, xhigh и max, у GPT-6 Astra значения none нет.
Какой уровень стоит по умолчанию?
У GPT-5.6 Sol по документации вендора значение по умолчанию — medium.
Влияет ли уровень рассуждения на цену?
Да, напрямую. Токены рассуждения тарифицируются как выходные, а выход стоит в разы дороже входа. Поднять уровень — значит увеличить счёт, даже если видимый ответ не станет длиннее.
Что случилось со значением none у Astra?
В документации GPT-6 Astra оно отсутствует: поддерживаются low, medium, high, xhigh и max. Код, который передавал none, при переходе придётся править.
Есть ли этот параметр у моделей в каталоге KeyDealer?
Поддержка зависит от позиции и протокола. В выдаче GET /v1/models возможности публикуются полями capabilities, и у большинства позиций они помечены как непроверенные.