Обзоры и сравнения моделей

Цена входных и выходных токенов: почему разная

Цена входных и выходных токенов: почему разная

13 августа в веб-каталоге появилась модель qwen-3-6-35b-a3b со ставкой 40 ₽ за миллион входных токенов и 280 ₽ за миллион выходных. Это первая и пока единственная асимметричная позиция: остальные текстовые модели берут одинаково в обе стороны. Разрыв ровно семикратный, и он полностью меняет способ считать бюджет — при симметричном тарифе неважно, где у вас токены, а при асимметричном счёт определяет длина ответа. Модель остаётся в статусе review и не публикуется живым API. Разбираем механику асимметрии, потому что она встретится вам далеко за пределами этой одной позиции.

Что показывает каталог

Цифры из живой выдачи на 13 августа 2026 года.

ВходВыходОтношение
qwen-3-6-35b-a3b40 ₽280 ₽7,0
Остальные 34 текстовые моделиодинаковоодинаково1,0

Для сравнения — крайние точки каталога по входу: самые дешёвые платные glm-4-6v и glm-4-7 по 3 ₽, самая дорогая fable-5 по 180 ₽. По входу Qwen сидит в середине, а по выходу её 280 ₽ — самая высокая ставка каталога.

Откуда вообще берётся асимметрия

Причина техническая, и она объясняет, почему у официальных API это норма, а не исключение.

Входной контекст модель обрабатывает за один проход: весь ваш промпт уходит в неё разом, и токены считаются параллельно. Это дёшево в пересчёте на токен.

Выход устроен иначе. Модель генерирует по одному токену за раз, и каждый следующий требует нового прохода по всей сети с учётом всего, что уже написано. Тысяча выходных токенов — это тысяча проходов, а не один.

Отсюда и разрыв в прайсах вендоров, где выход обычно дороже входа в 5–6 раз. Семикратный разрыв у Qwen — в том же порядке, ничего экзотического.

Что меняется в расчёте бюджета

Здесь начинается практика, ради которой всё это стоит читать.

При симметричном тарифе формула простая: сумма всех токенов, умноженная на ставку. Где именно эти токены — в запросе или в ответе — не имеет значения.

При асимметричном тарифе так считать нельзя. Возьмём типичный сценарий: запрос на 2000 токенов, ответ на 500.

Симметричный тариф 40 ₽: (2000 + 500) × 40 ₽ / 1 000 000 = 0,10 ₽

Асимметричный 40/280: 2000 × 40 / 1 000 000 + 500 × 280 / 1 000 000 = 0,08 + 0,14 = 0,22 ₽

Ответ вчетверо короче запроса, но стоит дороже него. Это и есть главный вывод: при асимметричном тарифе платите вы за ответ.

Следствие для оптимизации получается контринтуитивным. Привычный совет «сократите промпт» здесь почти не работает: урезав запрос вдвое, вы сэкономите 0,04 ₽ из 0,22. А ограничив ответ вдвое — 0,07 ₽, почти вдвое больше при вдвое меньшем усилии.

Точка, где асимметрия перестаёт иметь значение

Полезно понимать не только как считать, но и когда об этом можно не думать.

Асимметрия важна ровно настолько, насколько выход сопоставим с входом. Есть порог, за которым она перестаёт быть заметной: если ответ составляет меньше нескольких процентов от запроса, дорогая ставка применяется к такой малой доле объёма, что общий счёт определяет вход.

Прикинем на тех же ставках 40/280. Запрос на 50 000 токенов, ответ на 200 токенов — типичная классификация большого документа:

  • вход: 50 000 × 40 / 1 000 000 = 2,00 ₽
  • выход: 200 × 280 / 1 000 000 = 0,06 ₽

Выход — 3% счёта. Здесь оптимизировать надо промпт, и совет «сократите контекст» снова работает.

А теперь наоборот, генерация текста: запрос 300 токенов, ответ 3000.

  • вход: 300 × 40 / 1 000 000 = 0,012 ₽
  • выход: 3000 × 280 / 1 000 000 = 0,84 ₽

Выход — 98% счёта. Работа над промптом здесь не даст ничего измеримого.

Отсюда простое правило: посчитайте отношение длины ответа к длине запроса на своей типичной задаче. Если оно меньше единицы — оптимизируйте вход. Если больше — только выход.

Где это бьёт больнее всего

Три сценария, в которых асимметрия из бухгалтерской детали превращается в проблему.

Генерация длинных текстов. Короткое задание, объёмный результат — худшее соотношение из возможных. Промпт на 200 токенов, статья на 3000: почти весь счёт приходится на выход.

Модели с рассуждением. Внутренний ход мысли тарифицируется как выходные токены, даже если вы его не видите. При семикратной ставке невидимая часть ответа может стоить дороже видимой.

Агентские циклы. Каждый шаг агента — это новый ответ модели, и все они считаются по выходной ставке. Плюс история диалога растёт и переотправляется, но она-то как раз идёт по дешёвой входной. Про то, откуда берётся расхождение между отправленным и посчитанным, мы писали в разборе служебного контекста маршрута.

Что с этим делать

Четыре приёма, отсортированных по отношению эффекта к усилию.

  1. Ставьте max_tokens осознанно. Это единственный прямой рычаг на выходную часть счёта. Значение по умолчанию обычно щедрее, чем вам нужно.
  2. Просите краткость в задании. Формулировка «ответь одним абзацем» дешевле любой оптимизации промпта, потому что бьёт по дорогой стороне.
  3. Считайте вход и выход раздельно. Если ваш счётчик расходов складывает их в одну сумму токенов, на асимметричной модели он будет врать. Как разложить расход по строкам — в разборе стоимости миллиона токенов в рублях.
  4. Не переносите оценку с одной модели на другую. Бюджет, посчитанный на симметричной ставке, при переезде на асимметричную улетает без предупреждения.

Почему в каталоге асимметрия — редкость

Логичный вопрос: если у вендоров разрыв в 5–6 раз норма, почему в нашем каталоге 34 позиции из 35 симметричны.

Ответ в том, что ставка каталога — не пересчёт вендорского прайса, а самостоятельная цена. Одинаковая ставка в обе стороны считается проще и предсказуемее: вы прикидываете расход по общему объёму, не разбирая, где токены.

Побочный эффект приятный: на сценариях с длинными ответами симметричный тариф выгоднее вендорского при сопоставимой цене входа. Обратное тоже верно — на сценариях, где ответы короткие, а контекст огромный, вендорская схема была бы выгоднее.

Qwen 3.6 из этого ряда выбивается, и стоит понимать почему это может повториться: у моделей с ярко выраженным перекосом в стоимости генерации симметричная ставка либо завышает вход, либо занижает выход. Асимметрия здесь честнее.

Чего мы не утверждаем

Не обещаем, что ставка сохранится. Каталог за сутки вырос с 25 моделей до 37, цены внутри него тоже двигаются. Актуальные значения — только из GET /v1/models.

Не утверждаем, что Qwen 3.6 работает. На 13 августа у неё availability: review и protocols.chat_completions: review — позиция заведена, маршрут закрыт. Что означает этот статус и как его читать, разобрано в материале о росте каталога до 37 моделей.

Не сравниваем качество. Эта статья про механику тарифа, а не про то, насколько модель хороша.

Кэш промптов не поможет. У всех 35 текстовых моделей каталога он unsupported, скидки за повторный контекст нет ни на входе, ни на выходе. У провайдеров, где кэш есть, разрыв бывает огромным — например, у DeepSeek попадание дешевле промаха в 120 раз, — но и там скидка касается только входа, а дорогую выходную часть не трогает.

Не утверждаем, что асимметрия хуже симметрии. Она просто требует другого способа считать. На задачах с короткими ответами и длинным контекстом асимметричный тариф выгоднее симметричного при той же ставке входа.

Что держать в голове

Асимметричная ставка означает, что счёт определяет длина ответа, а не длина запроса. Семикратный разрыв у qwen-3-6-35b-a3b — первый такой случай в каталоге, но в мире официальных API это норма.

Рычаг ровно один и он простой: max_tokens и просьба о краткости. Оптимизация промпта на асимметричной модели даёт меньше, чем кажется.

Как мы проверяем цифры и почему у каждой стоит дата — на странице о проекте. Посмотреть ставки по всем позициям можно без регистрации в GET /v1/models, а завести ключ — за минуту: keydealer.ru/login.

Частые вопросы

Какая модель в каталоге стоит по-разному на входе и выходе?

Такая одна — qwen-3-6-35b-a3b, 40 ₽ за миллион входных токенов и 280 ₽ за миллион выходных. Остальные текстовые позиции берут одинаково в обе стороны.

Почему у официальных API выход всегда дороже входа?

Вход обрабатывается параллельно за один проход, а выход генерируется по одному токену за раз, и каждый требует отдельного прохода по модели. Это разная вычислительная нагрузка.

Как это меняет расчёт бюджета?

При асимметричном тарифе итоговый счёт определяет длина ответа, а не длина запроса. Сокращать промпт в такой ситуации почти бесполезно — экономия приходит от ограничения max_tokens.

Qwen 3.6 уже можно использовать?

На 13 августа 2026 года модель в статусе review — числится в каталоге, но маршрут закрыт. Проверять готовность нужно по полю protocols.chat_completions.

Где посмотреть актуальные ставки?

В ответе GET /v1/models, поля pricing.input_rub_per_million и pricing.output_rub_per_million.

Источники