ИИ-агенты и автоматизация

Обвязка решает: NVIDIA срезала токены агента вдвое

Обвязка решает: NVIDIA срезала токены агента вдвое

Исследовательское подразделение NVIDIA выложило SoL-Pi — открытое расширение для обвязки кодинг-агента, которое по их замерам сохраняет около 94% качества, тратя на 45–49% меньше токенов. В сравнении с обвязками самих вендоров моделей разрыв ещё больше: 35–64% по токенам и 50–54% по стоимости. Вывод для тех, кто платит за токены: счёт определяет не модель, а то, что вокруг неё.

Разберём, что именно измерили, где прячется экономия и что из этого применимо без их кода.

Что такое обвязка и почему она в счёте

Обвязка — это всё, что окружает модель в агенте: что она читает перед правкой, сколько истории тащит на следующий шаг, как оформлены инструменты, когда останавливается.

Модель в этой схеме — калькулятор. Она отвечает на то, что ей прислали. Прислала обвязка: системную инструкцию, содержимое файлов, вывод команд, всю предыдущую переписку. Вы платите за это целиком и на каждом шаге.

Отсюда неприятный вывод, который мы видим на своих замерах постоянно: два агента на одной и той же модели дают счета, различающиеся в разы. Разбор механики — в статье как считать токены.

Что измерили

Цифры из публикации лаборатории, все — их собственные замеры.

СравнениеЭкономия токеновЭкономия денег
Против исходной обвязки45–49%около трети
Против обвязок вендоров моделей35–64%50–54%
Рой агентов, один прогон17,5% меньше циклов26,8%

При этом качество просело незначительно: около 94% от среднего результата исходной обвязки на обоих проверенных семействах моделей. То есть отдали примерно шесть процентов качества и забрали половину счёта.

Где именно нашлась экономия

Самое полезное в публикации — не итоговые проценты, а разбор, откуда они взялись.

Склейка соседних действий. Анализ показал, что правка файла и команда, которая её сразу проверяет, идут двумя отдельными шагами в 12,3% переходов между ходами. Каждый лишний шаг — это новая отправка всей накопленной истории. Их объединили в один вызов, и это дало основную часть выигрыша.

Доля команд в действиях. На запуск команд пришлось 85,1% наблюдаемых следующих действий агента. То есть агент почти всегда после чего-то что-то запускает, и именно эта пара оказалась главным местом для склейки.

Стабильность важнее пиковых значений. Механизм довели до срабатывания в 87,7% подходящих вызовов при нуле некорректных. В десяти итерациях подбора промпта частота срабатывания гуляла от 28,3% до 100%.

Что из этого применимо без их кода

Принцип переносится на любой агент, включая самописный. Четыре приёма по убыванию эффекта.

  1. Склеивайте действие и его проверку. Если после правки всегда идёт запуск теста, это один шаг, а не два.
  2. Инструмент возвращает выжимку, а не весь вывод. Тысяча строк лога останется в истории и будет оплачена на каждом следующем шаге.
  3. Не перечитывайте то, что уже в контексте. Повторное чтение файла — чистая переплата, и старые инструкции вроде «прочитай проект перед каждой правкой» именно это и делают. Разбор — в статье инструкции агенту устарели.
  4. Одна задача — одна сессия. История не бесплатна, и к тридцатому шагу она стоит дороже самой задачи.

Сколько это в рублях на нашем каталоге

Переведём проценты в деньги. Возьмём агентную сессию, где через модель проходит 300 000 входных токенов, и посмотрим, что даёт экономия в 45%.

Модель₽ за миллионСессия как естьС экономией 45%
qwen-3-6-flash30,900,50
haiku-4-582,401,32
sonnet-4-6123,601,98
opus-5309,004,95
gpt-6-astra6018,009,90

Сто сессий в месяц на флагмане — это 1 800 ₽ против 990 ₽. На команде из пяти человек разница в год выходит под пятьдесят тысяч рублей, и получена она без смены модели и без потери качества.

Ставки в каталоге KeyDealer одинаковы на вход и на выход, поэтому такие расчёты делаются умножением, а не таблицей условий. Ключ открывает все 53 позиции сразу, и переключить агента с флагмана на недорогую позицию — это правка одной строки конфигурации, что и есть самый быстрый способ проверить, сколько вы переплачиваете за обвязку.

Чем это отличается от простой смены модели на дешёвую

Разница принципиальная, и её стоит проговорить.

Смена модели на более дешёвую — это всегда обмен: вы платите меньше и получаете ответы другого качества. Иногда разницы не видно, иногда видно сразу.

Оптимизация обвязки — не обмен. Вы убираете то, за что платили и что не приносило пользы: повторное чтение уже прочитанного, лишний шаг там, где хватало одного, тысяча строк лога в контексте вместо трёх нужных. Качество при этом не меняется, потому что модель получает ту же информацию, просто без балласта.

Отсюда правильный порядок: сначала вычистить обвязку, потом сравнивать модели. Если сделать наоборот, вы обменяете качество на деньги там, где можно было получить деньги бесплатно.

Как померить свою обвязку за час

Ревизия, которая не требует ни их расширения, ни смены агента.

Залогируйте входные токены по каждому шагу одной сессии. Не суммарно, а по шагам. График скажет главное: если он растёт быстрее, чем число шагов, вы платите за накопление истории.

Посчитайте, сколько раз один и тот же файл попал в контекст. Больше одного — почти всегда ошибка обвязки или инструкции.

Посмотрите на длину ответов инструментов. Всё, что длиннее экрана, стоит на каждом следующем шаге. Выжимка вместо полного вывода — самая дешёвая правка из возможных.

Проверьте, есть ли пары «правка и сразу проверка». Это ровно тот случай, который в исследовании дал основную экономию, и он виден в журнале невооружённым глазом.

Как поставить журнал так, чтобы такие вещи были видны, разобрано в статье логирование запросов к моделям.

Чего цифры не говорят

Три оговорки, без которых проценты выглядят убедительнее, чем есть.

Это замеры лаборатории. Их собственный стенд, их набор задач, их выбор базовой обвязки для сравнения. Статья на момент публикации ещё не вышла, есть только страница проекта и код.

Сравнение роёв — один прогон. Цифры 17,5% и 26,8% получены в единственном сравнении на одиннадцати задачах. Это наблюдение, а не установленный факт.

Шесть процентов качества — не всегда приемлемо. На рутинных правках потеря незаметна, на сложном разборе может стоить дороже сэкономленных токенов.

Что это меняет в выборе

Общий вывод шире конкретного расширения.

Год назад разговор о стоимости агента сводился к выбору модели: взять флагман или позицию подешевле. Теперь видно, что обвязка двигает счёт в том же диапазоне, что и смена модели, но без потери качества.

Практический порядок действий из этого простой. Сначала померьте свои входные токены по шагам, потом уберите лишние шаги и повторные чтения, и только потом обсуждайте смену модели. Первое даёт половину счёта и не требует ничего менять в качестве, второе всегда компромисс.

Как устроен агентный цикл и что в нём стоит денег — в статье как сделать ИИ-агента, а разбор представления страницы для браузерного агента — в статье чем кормить браузерного агента.

Чего мы не утверждаем

Мы не проверяли SoL-Pi на своих задачах и не подтверждаем ни одного из процентов. Это публикация разработчика, а не наш замер.

Мы не советуем ставить это расширение в прод. Оно исследовательское, и статья по нему ещё не опубликована.

Мы не переносим экономию на любой агент механически. Если у вас уже склеены действия и инструменты возвращают выжимку, запас меньше.

Что нужно, чтобы посчитать своё

Ключ заводится за минуту на keydealer.ru/login — почта и пароль, без документов и без зарубежной карты. Оплата российской картой в рублях.

Самый быстрый замер: прогнать одну свою задачу и посмотреть usage по шагам. Если входные токены растут быстрее числа шагов, вы платите за историю, а не за работу.

Что держать в голове

Счёт агента определяет обвязка, а не модель: одна и та же позиция в разных агентах стоит по-разному в разы.

Основная экономия найдена не в хитром алгоритме, а в склейке соседних действий и отказе от повторных чтений.

Любые проценты из публикации лаборатории — её собственные замеры на её стенде. Как мы проверяем факты и почему у каждой цифры стоит дата — на странице о проекте. Завести ключ: keydealer.ru/login.

Частые вопросы

Что такое SoL-Pi?

Открытое расширение для обвязки кодинг-агента от исследовательского подразделения NVIDIA. По замерам лаборатории оно сохраняет около 94% качества исходной обвязки, тратя на 45–49% меньше токенов.

Почему одна и та же модель стоит по-разному?

Потому что платите вы не за модель, а за токены, которые в неё отправляет обвязка. Сколько файлов она покажет, сколько истории протащит и сколько лишних шагов сделает — всё это ваш счёт, а модель тут ни при чём.

Насколько обвязка влияет на счёт в цифрах?

По данным лаборатории, разрыв с обвязками самих вендоров моделей составил 35–64% по токенам и 50–54% по стоимости при тех же задачах.

Что конкретно они оптимизировали?

Главная находка — склейка соседних действий. Правка файла и команда, которая её проверяет, шли отдельными шагами в 12,3% переходов между ходами. Их объединили в один вызов.

Можно ли применить это без их расширения?

Да, принцип переносится: меньше шагов, меньше повторных чтений, инструменты возвращают выжимку. Для этого не нужна их конкретная реализация.

Насколько этим цифрам можно верить?

Это замеры самой лаборатории, статья на момент публикации ещё не вышла, а сравнение роёв сделано в одном прогоне. Порядок величины полезен, точные проценты на своей задаче будут другими.

Источники