Обзоры и сравнения моделей

Токены на задачу: почему дорогая модель бывает дешевле

Токены на задачу: почему дорогая модель бывает дешевле

Независимый замер Artificial Analysis показал вещь, которую ставка за миллион токенов скрывает: GPT-6 Astra на максимальном уровне рассуждения тратит около 27 тысяч выходных токенов на задачу — примерно треть от Claude Fable 5.1 при том же итоговом балле. В агентных задачах она делала задачу за 24 хода против 45 у GPT-5.6 Sol и 60 у Claude Fable 5.1 и Opus 5. Отсюда главный вывод для бюджета: модель с высокой ставкой бывает дешевле по счёту, если решает короче.

Разберём, что именно намерили, где у этой модели регресс и как перенести метод на свои задачи.

Что намерили

Artificial Analysis — независимая команда, которая гоняет модели по собственному набору тестов и публикует не только баллы, но и расход. Оценка GPT-6 Astra опубликована 9 сентября 2026 года.

Ключевые цифры, которые относятся к расходу:

Что мерилиGPT-6 AstraС чем сравнивали
Выходных токенов на задачу, максимальный уровеньоколо 27 тысячоколо 78 тысяч у Claude Fable 5.1 при том же балле
Токенов на задачу в индексе кодинг-агентовтреть от GPT-5.6 SolGPT-5.6 Sol, максимальный уровень
Ходов на задачу в одном из агентных тестов2445 у GPT-5.6 Sol, 60 у Fable 5.1 и Opus 5
Стоимость задачи в интеллектуальном индексеоколо 40 % от Fable 5.1при одинаковом балле

Долларовые суммы из замера мы не приводим: часть сравниваемых моделей есть в нашем каталоге, и ставить вендорские цены рядом с рублёвыми мы не будем. Соотношения выше от этого не зависят.

Почему ставка обманывает

Счёт считается просто: ставка умножить на токены. Две переменные, и о второй прайс не говорит ничего.

Модель с высокой ставкой, которая решает задачу коротко, может выйти дешевле модели с низкой ставкой и длинными рассуждениями. В замере это видно прямо: у Astra цена за токен выше, чем у предыдущего поколения, но меньший расход токенов частично это компенсирует. На максимальном уровне в кодинг-задачах она выходит лишь немного дороже GPT-5.6 Sol за задачу — при заметно более высоком балле.

Про ту же механику с другой стороны мы писали, когда разбирали модель, которая пишет на 71 % меньше при почти том же качестве, — в материале JetBrains смешала две Qwen.

Почему ходы важнее длины ответа

Это место, которое чаще всего упускают при оценке агентов.

Ход — один цикл агента: подумать, вызвать инструмент, получить результат. Каждый ход — отдельный вызов модели, и в каждый уходит весь накопленный контекст: системные инструкции, описания инструментов, история предыдущих шагов. Контекст растёт с каждым ходом.

Отсюда нелинейность. Агент, которому нужно 60 ходов, платит не вдвое больше агента на 30 ходов, а заметно больше: поздние ходы тащат за собой длинную историю. Сокращение числа ходов — самый сильный рычаг экономии в агентных сценариях, сильнее выбора модели по ставке.

Про то, как служебная часть каждого вызова складывается в счёт, мы разбирали в материале HarnessTax: обвязка агента.

Где у модели регресс

Честный замер показывает и слабые места, и это самое полезное в нём.

В одном из тестов на экономически значимые задачи результат упал примерно на 45 пунктов рейтинга относительно GPT-5.6 Sol. Это тот самый тест, где Astra делала меньше всего ходов. Авторы не утверждают причинную связь, но совпадение показательное: меньше ходов — не всегда лучше, иногда модель просто останавливается раньше, чем следовало.

По качеству оформления результата в тесте на долгую работу со знаниями GPT-5.6 Sol по-прежнему впереди, хотя по аналитической части Astra заметно выросла.

Галлюцинаций стало вдвое меньше — доля выдуманных ответов в тесте на знания упала с 92 % до 51 % на максимальном уровне, при этом точность выросла. Это плюс, но 51 % — всё ещё много, и проверка фактов на вашей стороне остаётся обязательной. Про природу выдумок — в материале галлюцинации нейросети.

Почему уровень рассуждения меняет всё

Отдельный вывод из замера, который легко пропустить: у одной модели несколько уровней рассуждения, и каждый из них — по сути отдельная позиция по цене и качеству.

По данным Artificial Analysis, у Astra каждый уровень рассуждения — от низкого до максимального — лежит на границе эффективности: за свои деньги ни одна другая конфигурация в их наборе не даёт больше. Стоимость задачи в их интеллектуальном индексе при этом различается между низким и максимальным уровнем примерно в четыре раза.

Практически это значит, что вопрос «какую модель взять» неполный. Правильный вопрос — «какую модель и на каком уровне». Максимальный уровень на рутинной задаче — переплата в разы за то же качество. Низкий на сложной — экономия, которая оборачивается переделками.

Выбирать уровень стоит так же, как модель: замером на своей выборке. Начинать с низкого и подниматься, пока качество не перестанет расти. Механику уровней рассуждения мы разбирали отдельно в материале уровни рассуждения: reasoning effort.

Какие ошибки делают при сравнении

Три, и все они приводят к неправильному выбору позиции.

Сравнивают по ставке. Самая частая. Берут дешёвую за миллион и через месяц обнаруживают, что счёт выше, потому что она пишет втрое длиннее.

Сравнивают на трёх примерах. Разброс между прогонами одной и той же модели бывает больше, чем разница между моделями. Меньше двадцати задач — это впечатление, а не замер.

Не отделяют решённые задачи. Если одна модель бросает сложные задачи на полпути, её расход выглядит маленьким. Считать нужно только на задачах, которые решили обе.

Как перенести метод на свои задачи

Замер Artificial Analysis — это их задачи и их обвязка. Ваши задачи другие, но метод переносится целиком.

Шаг первый: зафиксируйте набор. Двадцать-тридцать реальных задач из вашего потока, желательно с известным правильным результатом.

Шаг второй: прогоните на двух позициях. Одинаковый промпт, одинаковая обвязка, одинаковый уровень рассуждения, если он настраивается.

Шаг третий: отберите решённые обеими. Только на них сравнение честное — иначе в выборку попадёт экономия на недоделанной работе.

Шаг четвёртый: сложите три числа. Токены входа, токены выхода и число вызовов на задачу. Умножьте токены на ставку каждой позиции.

Шаг пятый: посмотрите на выбросы. Одна задача на 60 ходов может съесть бюджет двадцати обычных. Если такие есть, это вопрос к обвязке, а не к модели.

Что есть в каталоге KeyDealer

Позиция gpt-6-astra в каталоге доступна по 60 ₽ за миллион токенов одинаково на входе и на выходе. Рядом — предыдущее поколение линейки: gpt-5-6-sol по 40 ₽, gpt-5-6-terra по 30 ₽ и gpt-5-6-luna по 8 ₽, а также opus-5 по 30 ₽.

Симметричная ставка упрощает замер из предыдущего раздела: не нужно отдельно считать вход и выход по разным ценам, достаточно сложить токены. Один ключ открывает весь каталог из 57 позиций, 44 из которых доступны сейчас, с оплатой российской картой в рублях, а расход виден по каждому запросу — то есть стоимость решённой задачи на двух позициях считается из журнала за вечер. Подробнее о самой модели — в материале GPT-6 Astra: цена и чем заменить.

Чего мы не утверждаем

Три оговорки.

Мы не переносим цифры замера на ваши задачи. Треть токенов и 24 хода — это результат на наборе Artificial Analysis с их обвязкой. На вашем потоке соотношение может быть другим.

Мы не утверждаем, что меньше ходов — лучше. Регресс в одном из тестов показывает обратное: модель может остановиться раньше, чем нужно. Меньше ходов хорошо, только если задача решена.

Мы не делаем выводов о причинах. Почему модель расходует меньше токенов — архитектура, обучение, настройки по умолчанию — в замере не раскрыто, и гадать мы не будем.

Что держать в голове

Первое. Ставка за миллион — половина цены. Вторая половина — сколько токенов модель потратит на вашу задачу, и она может перевесить первую в разы.

Второе. В агентных сценариях число ходов бьёт по счёту сильнее длины ответа, потому что каждый ход тащит за собой весь накопленный контекст.

Третье. Независимый замер ценен тем, что показывает и регрессы. Модель, у которой нет слабых мест, — это модель, которую плохо померили. Что мы за проект — на странице о проекте, ключ заводится на keydealer.ru/login.

Частые вопросы

Что показал замер?

По данным Artificial Analysis от 9 сентября 2026 года, GPT-6 Astra на максимальном уровне рассуждения тратит около 27 тысяч выходных токенов на задачу — примерно треть от Claude Fable 5.1 при том же итоговом балле. В задачах кодинг-агента она расходует треть токенов GPT-5.6 Sol на задачу.

Почему это важно для счёта?

Потому что счёт — это ставка, умноженная на токены. Модель с высокой ставкой, которая решает задачу втрое короче, может выйти дешевле модели с низкой ставкой и длинными ответами. Ставка за миллион сама по себе ничего не говорит о стоимости задачи.

Что такое ходы и почему их считают?

Ход — это один цикл агента: подумать, вызвать инструмент, получить результат. В одном из тестов Astra тратила 24 хода на задачу против 45 у GPT-5.6 Sol и 60 у Claude Fable 5.1 и Claude Opus 5. Каждый ход — это отдельный вызов со всем накопленным контекстом, поэтому число ходов бьёт по счёту сильнее длины ответа.

Значит, Astra лучше во всём?

Нет. Тот же замер фиксирует регресс: в одном из тестов на экономически значимые задачи результат упал примерно на 45 пунктов рейтинга относительно GPT-5.6 Sol, а по качеству оформления результата GPT-5.6 Sol по-прежнему впереди. Меньше ходов — не всегда лучше.

Есть ли GPT-6 Astra в каталоге KeyDealer?

Да, позиция gpt-6-astra доступна. В каталоге также есть предыдущее поколение этой линейки — gpt-5-6-sol, gpt-5-6-luna и gpt-5-6-terra — и Claude Opus 5. Ставки опубликованы в каталоге в рублях.

Как посчитать это на своих задачах?

Прогнать одинаковые задачи на двух позициях, отобрать решённые обеими и сложить токены выхода и число вызовов. Умножить на ставку каждой позиции. Сравнивать нужно стоимость решённой задачи, а не цену за миллион и не впечатление от нескольких ответов.

Источники