Обзоры и сравнения моделей
Цена входных и выходных токенов: почему разная
13 августа в веб-каталоге появилась модель qwen-3-6-35b-a3b со ставкой 40 ₽ за миллион входных токенов и 280 ₽ за миллион выходных. Это первая и пока единственная асимметричная позиция: остальные текстовые модели берут одинаково в обе стороны. Разрыв ровно семикратный, и он полностью меняет способ считать бюджет — при симметричном тарифе неважно, где у вас токены, а при асимметричном счёт определяет длина ответа. Модель остаётся в статусе review и не публикуется живым API. Разбираем механику асимметрии, потому что она встретится вам далеко за пределами этой одной позиции.
Что показывает каталог
Цифры из живой выдачи на 13 августа 2026 года.
| Вход | Выход | Отношение | |
|---|---|---|---|
qwen-3-6-35b-a3b | 40 ₽ | 280 ₽ | 7,0 |
| Остальные 34 текстовые модели | одинаково | одинаково | 1,0 |
Для сравнения — крайние точки каталога по входу: самые дешёвые платные glm-4-6v и glm-4-7 по 3 ₽, самая дорогая fable-5 по 180 ₽. По входу Qwen сидит в середине, а по выходу её 280 ₽ — самая высокая ставка каталога.
Откуда вообще берётся асимметрия
Причина техническая, и она объясняет, почему у официальных API это норма, а не исключение.
Входной контекст модель обрабатывает за один проход: весь ваш промпт уходит в неё разом, и токены считаются параллельно. Это дёшево в пересчёте на токен.
Выход устроен иначе. Модель генерирует по одному токену за раз, и каждый следующий требует нового прохода по всей сети с учётом всего, что уже написано. Тысяча выходных токенов — это тысяча проходов, а не один.
Отсюда и разрыв в прайсах вендоров, где выход обычно дороже входа в 5–6 раз. Семикратный разрыв у Qwen — в том же порядке, ничего экзотического.
Что меняется в расчёте бюджета
Здесь начинается практика, ради которой всё это стоит читать.
При симметричном тарифе формула простая: сумма всех токенов, умноженная на ставку. Где именно эти токены — в запросе или в ответе — не имеет значения.
При асимметричном тарифе так считать нельзя. Возьмём типичный сценарий: запрос на 2000 токенов, ответ на 500.
Симметричный тариф 40 ₽: (2000 + 500) × 40 ₽ / 1 000 000 = 0,10 ₽
Асимметричный 40/280: 2000 × 40 / 1 000 000 + 500 × 280 / 1 000 000 = 0,08 + 0,14 = 0,22 ₽
Ответ вчетверо короче запроса, но стоит дороже него. Это и есть главный вывод: при асимметричном тарифе платите вы за ответ.
Следствие для оптимизации получается контринтуитивным. Привычный совет «сократите промпт» здесь почти не работает: урезав запрос вдвое, вы сэкономите 0,04 ₽ из 0,22. А ограничив ответ вдвое — 0,07 ₽, почти вдвое больше при вдвое меньшем усилии.
Точка, где асимметрия перестаёт иметь значение
Полезно понимать не только как считать, но и когда об этом можно не думать.
Асимметрия важна ровно настолько, насколько выход сопоставим с входом. Есть порог, за которым она перестаёт быть заметной: если ответ составляет меньше нескольких процентов от запроса, дорогая ставка применяется к такой малой доле объёма, что общий счёт определяет вход.
Прикинем на тех же ставках 40/280. Запрос на 50 000 токенов, ответ на 200 токенов — типичная классификация большого документа:
- вход: 50 000 × 40 / 1 000 000 = 2,00 ₽
- выход: 200 × 280 / 1 000 000 = 0,06 ₽
Выход — 3% счёта. Здесь оптимизировать надо промпт, и совет «сократите контекст» снова работает.
А теперь наоборот, генерация текста: запрос 300 токенов, ответ 3000.
- вход: 300 × 40 / 1 000 000 = 0,012 ₽
- выход: 3000 × 280 / 1 000 000 = 0,84 ₽
Выход — 98% счёта. Работа над промптом здесь не даст ничего измеримого.
Отсюда простое правило: посчитайте отношение длины ответа к длине запроса на своей типичной задаче. Если оно меньше единицы — оптимизируйте вход. Если больше — только выход.
Где это бьёт больнее всего
Три сценария, в которых асимметрия из бухгалтерской детали превращается в проблему.
Генерация длинных текстов. Короткое задание, объёмный результат — худшее соотношение из возможных. Промпт на 200 токенов, статья на 3000: почти весь счёт приходится на выход.
Модели с рассуждением. Внутренний ход мысли тарифицируется как выходные токены, даже если вы его не видите. При семикратной ставке невидимая часть ответа может стоить дороже видимой.
Агентские циклы. Каждый шаг агента — это новый ответ модели, и все они считаются по выходной ставке. Плюс история диалога растёт и переотправляется, но она-то как раз идёт по дешёвой входной. Про то, откуда берётся расхождение между отправленным и посчитанным, мы писали в разборе служебного контекста маршрута.
Что с этим делать
Четыре приёма, отсортированных по отношению эффекта к усилию.
- Ставьте
max_tokensосознанно. Это единственный прямой рычаг на выходную часть счёта. Значение по умолчанию обычно щедрее, чем вам нужно. - Просите краткость в задании. Формулировка «ответь одним абзацем» дешевле любой оптимизации промпта, потому что бьёт по дорогой стороне.
- Считайте вход и выход раздельно. Если ваш счётчик расходов складывает их в одну сумму токенов, на асимметричной модели он будет врать. Как разложить расход по строкам — в разборе стоимости миллиона токенов в рублях.
- Не переносите оценку с одной модели на другую. Бюджет, посчитанный на симметричной ставке, при переезде на асимметричную улетает без предупреждения.
Почему в каталоге асимметрия — редкость
Логичный вопрос: если у вендоров разрыв в 5–6 раз норма, почему в нашем каталоге 34 позиции из 35 симметричны.
Ответ в том, что ставка каталога — не пересчёт вендорского прайса, а самостоятельная цена. Одинаковая ставка в обе стороны считается проще и предсказуемее: вы прикидываете расход по общему объёму, не разбирая, где токены.
Побочный эффект приятный: на сценариях с длинными ответами симметричный тариф выгоднее вендорского при сопоставимой цене входа. Обратное тоже верно — на сценариях, где ответы короткие, а контекст огромный, вендорская схема была бы выгоднее.
Qwen 3.6 из этого ряда выбивается, и стоит понимать почему это может повториться: у моделей с ярко выраженным перекосом в стоимости генерации симметричная ставка либо завышает вход, либо занижает выход. Асимметрия здесь честнее.
Чего мы не утверждаем
Не обещаем, что ставка сохранится. Каталог за сутки вырос с 25 моделей до 37, цены внутри него тоже двигаются. Актуальные значения — только из GET /v1/models.
Не утверждаем, что Qwen 3.6 работает. На 13 августа у неё availability: review и protocols.chat_completions: review — позиция заведена, маршрут закрыт. Что означает этот статус и как его читать, разобрано в материале о росте каталога до 37 моделей.
Не сравниваем качество. Эта статья про механику тарифа, а не про то, насколько модель хороша.
Кэш промптов не поможет. У всех 35 текстовых моделей каталога он unsupported, скидки за повторный контекст нет ни на входе, ни на выходе. У провайдеров, где кэш есть, разрыв бывает огромным — например, у DeepSeek попадание дешевле промаха в 120 раз, — но и там скидка касается только входа, а дорогую выходную часть не трогает.
Не утверждаем, что асимметрия хуже симметрии. Она просто требует другого способа считать. На задачах с короткими ответами и длинным контекстом асимметричный тариф выгоднее симметричного при той же ставке входа.
Что держать в голове
Асимметричная ставка означает, что счёт определяет длина ответа, а не длина запроса. Семикратный разрыв у qwen-3-6-35b-a3b — первый такой случай в каталоге, но в мире официальных API это норма.
Рычаг ровно один и он простой: max_tokens и просьба о краткости. Оптимизация промпта на асимметричной модели даёт меньше, чем кажется.
Как мы проверяем цифры и почему у каждой стоит дата — на странице о проекте. Посмотреть ставки по всем позициям можно без регистрации в GET /v1/models, а завести ключ — за минуту: keydealer.ru/login.
Частые вопросы
Какая модель в каталоге стоит по-разному на входе и выходе?
Такая одна — qwen-3-6-35b-a3b, 40 ₽ за миллион входных токенов и 280 ₽ за миллион выходных. Остальные текстовые позиции берут одинаково в обе стороны.
Почему у официальных API выход всегда дороже входа?
Вход обрабатывается параллельно за один проход, а выход генерируется по одному токену за раз, и каждый требует отдельного прохода по модели. Это разная вычислительная нагрузка.
Как это меняет расчёт бюджета?
При асимметричном тарифе итоговый счёт определяет длина ответа, а не длина запроса. Сокращать промпт в такой ситуации почти бесполезно — экономия приходит от ограничения max_tokens.
Qwen 3.6 уже можно использовать?
На 13 августа 2026 года модель в статусе review — числится в каталоге, но маршрут закрыт. Проверять готовность нужно по полю protocols.chat_completions.
Где посмотреть актуальные ставки?
В ответе GET /v1/models, поля pricing.input_rub_per_million и pricing.output_rub_per_million.