LLM API и интеграция

Intelligence per Watt: 88,7 % запросов простые

Intelligence per Watt: 88,7 % запросов простые

Стэнфордская работа Intelligence per Watt измерила, какую долю реальных запросов закрывают маленькие модели: на миллионе одноходовых чатовых и рассуждающих запросов локальные модели до 20 миллиардов активных параметров ответили точно в 88,7 % случаев. Эффективность на ватт выросла в 5,3 раза с 2023 по 2025 год. Для практика вывод один: большая часть потока не требует топовой позиции — и это можно проверить на своих данных за вечер.

Работа вышла из лаборатории Scaling Intelligence при Стэнфорде, среди авторов Джон Хеннесси и Кристофер Ре. Замерялись 20 с лишним локальных моделей, восемь ускорителей — и локальных, и облачных, — и миллион реальных запросов. Разберём, что из этого переносится на обычный проект, а что нет.

Что такое intelligence per watt и зачем понадобилась новая метрика

Точность и энергопотребление обычно меряют по отдельности: бенчмарк отдельно, ватты отдельно. Авторы соединили их в одно число — точность на задаче, делённая на потребляемую мощность.

Смысл в том, что для локального инференса важен не рекорд по качеству и не рекорд по экономичности, а их отношение. Ноутбук ограничен по питанию, и вопрос стоит так: сколько полезного ответа удаётся получить в пределах этого бюджета. Метрика позволяет сравнивать пары «модель плюс ускоритель» между собой, а не спорить о моделях в вакууме.

Что именно намерили

Три результата, которые стоит запомнить.

РезультатЦифраОговорка
Доля запросов, закрытых локальными моделями88,7 %только одноходовые чатовые и рассуждающие
Рост эффективности на ватт за 2023–20255,3 разавклад и архитектур, и ускорителей
Отставание локальных ускорителей от облачныхминимум в 1,4 разана одних и тех же моделях

Первая строка — та, ради которой работу и пересказывают. Вторая объясняет, почему дешёвые позиции за два года стали пригодны для боевых задач. Третья — техническая: даже при том же коде и той же модели облачное железо остаётся эффективнее, и запас по оптимизации локального ещё не выбран.

Почему 88,7 % — это не «всё работает на дешёвой модели»

Самая важная часть разбора. Замер сделан на одноходовых запросах: один вопрос, один ответ, чат и рассуждение.

Вот что в эту выборку не входило:

  • агентские цепочки, где модель делает десятки шагов подряд и ошибка накапливается;
  • работа с инструментами и вызов функций;
  • длинный контекст — разбор документа на сотню страниц;
  • строгий формат на выходе, который нужно держать от запроса к запросу;
  • диалог, где ответ зависит от десяти предыдущих реплик.

То есть 88,7 % — это про долю запросов, а не про долю работы и тем более не про долю ценности. Один многоходовой сценарий может стоить дороже и значить больше, чем тысяча простых вопросов. Именно поэтому вывод «берём везде самое дешёвое» из работы не следует.

Как перенести это на свой поток

Порядок из четырёх шагов, и он не требует ни ноутбука с ускорителем, ни своей инфраструктуры.

Шаг первый — разметить поток. Выгрузите запросы за неделю и разделите на две кучи: одноходовые и всё остальное. Обычно первая куча оказывается больше, чем ожидалось, и состоит из однотипных вещей — короткая классификация, извлечение полей, переформулировка, ответ на типовой вопрос.

Шаг второй — прогнать первую кучу на дешёвой позиции. Не всю, а сотню запросов. Сравнить с тем, что сейчас отвечает дорогая позиция.

Шаг третий — посчитать разницу. Не в процентах точности, а в деньгах и в замеченных ошибках. Если из ста ответов хуже стали два и оба некритичны — решение очевидно.

Шаг четвёртый — закрепить маршрут. Простые запросы уходят вниз, сложные остаются наверху. Как это устроить технически, разобрано в материале маршрутизация между моделями.

Какие запросы почти всегда уезжают вниз

По опыту разбора чужих потоков набор повторяется от проекта к проекту. Вот что обычно оказывается в дешёвой корзине без потери качества:

  • Классификация по закрытому списку. Определить тип обращения, тему письма, тональность отзыва. Задача с коротким входом и коротким выходом.
  • Извлечение полей из текста. Вытащить дату, сумму, наименование, телефон. Разница между дешёвой и дорогой позицией здесь заметна реже всего.
  • Переформулировка. Сократить, развернуть, переписать под другую аудиторию.
  • Короткий перевод. Фраза, абзац, подпись к фото.
  • Первичная проверка. Отсечь явно постороннее до того, как запрос дойдёт до дорогой позиции.

А вот что уезжать вниз не должно почти никогда: работа агента с инструментами, разбор длинного документа целиком, генерация текста, который пойдёт клиенту без вычитки, и любые задачи, где ответ надо держать в жёстком формате от запроса к запросу.

Почему разделение потока экономит больше, чем торг за ставку

Арифметика простая. Допустим, восемьдесят процентов ваших запросов — простые. Если они уходят на позицию в тридцать раз дешевле, счёт падает примерно втрое даже при том, что оставшиеся двадцать процентов продолжают идти по верхней ставке.

Никакая скидка на тариф такого эффекта не даёт. И в отличие от скидки, этот выигрыш не надо ни с кем согласовывать — он целиком в вашем коде.

Обратная сторона честная: у вас появляется маршрутизация, а значит ещё одно место, где что-то может пойти не так. Поэтому первое правило маршрута — он должен быть простым и проверяемым. Не модель решает, куда отправить запрос, а понятное правило на вашей стороне, которое можно прочитать глазами и протестировать.

Причём здесь цена за токен

Связь прямая, хотя её редко проговаривают. Стоимость запроса в конечном счёте упирается в энергию и железо: сколько ватт потратил ускоритель, пока считал ваш ответ. Метрика на ватт смотрит на ту же экономику со стороны инфраструктуры, а ставка за миллион токенов — со стороны счёта.

Отсюда и разрыв в ставках, который иначе выглядит произволом. В каталоге разница между лёгкими и тяжёлыми позициями — десятки раз: 1 ₽ за миллион токенов против 60 ₽ у верхней позиции. Это не наценка за бренд, а отражение того, сколько вычислений уходит на ответ.

Практический вывод для тех, кто считает бюджет: KeyDealer даёт один ключ на 53 позиции каталога, 40 из них доступны сейчас, с оплатой российской картой в рублях. Разметить поток и развести простые запросы на дешёвые позиции можно без смены поставщика и без второго договора — меняется одна строка с именем модели, а расход виден по каждому запросу. Как считается сам счёт, разобрано в материале сколько стоит миллион токенов в рублях.

Что в каталоге относится к тому же классу моделей

Работа изучала модели до 20 миллиардов активных параметров — тот класс, который помещается на ноутбук. Прямой представитель этого класса есть и у нас: gpt-oss-20b со ставкой 0 ₽, то есть после первого платного пополнения он не тарифицируется вовсе. Рядом ещё четыре бесплатных текстовых позиции — llama-3-2-11b-vision и три Nemotron.

Это удобный способ проверить вывод работы на своих данных, не покупая железо: тот же класс моделей, но без ускорителя на столе. Про бесплатные позиции и их условия мы писали в материале бесплатные нейросети по API.

Чего мы не утверждаем

Три оговорки, без которых пересказ был бы нечестным.

Мы не утверждаем, что локальный инференс дешевле облачного. В работе прямо сказано обратное по эффективности: локальные ускорители дают как минимум в 1,4 раза худший показатель на ватт, чем облачные на тех же моделях. Речь о перераспределении нагрузки, а не о выигрыше в эффективности.

Мы не переносим 88,7 % на ваш поток. Авторы отдельно отмечают, что точность заметно различается по доменам. Ваша доля простых запросов может оказаться и выше, и заметно ниже — это измеряется, а не предполагается.

Мы не утверждаем, что цифры работы применимы к сегодняшним моделям один в один. Публикация датирована ноябрём 2025 года, с тех пор вышло не одно поколение. Направление вывода устойчиво, конкретные числа — нет.

Что нужно, чтобы проверить у себя

Сотня реальных запросов из своего продакшена, ключ на keydealer.ru/login и час времени. Прогоните их на своей текущей позиции и на дешёвой, положите ответы рядом и прочитайте глазами. Критерий приёмки формулируете вы, а не бенчмарк: где ошибка терпима, там она терпима. Как сравнивать корректно, разобрано в материале как сравнивать модели.

Что держать в голове

Первое. Главная ценность работы не в цифре 88,7 %, а в том, что она заставляет разделить поток. Пока все запросы идут в одну позицию, вы платите по верхней ставке за задачи, которые закрывает нижняя.

Второе. Оговорка про одноходовость важнее самой цифры. Агент, длинный документ, строгий формат — это не тот случай, и экономить там опасно: одна пропущенная ошибка в цепочке стоит дороже всей экономии за месяц.

Третье. Проверять нужно на своих данных. Любая опубликованная метрика — это чужая выборка на чужих задачах, и переносить её на свой продукт без замера — ровно та же ошибка, что верить маркетинговой странице вендора. Что мы за проект — на странице о проекте, ключ заводится на keydealer.ru/login.

Частые вопросы

Что такое intelligence per watt?

Метрика из работы Стэнфорда: точность на задаче, делённая на потребляемую мощность. Она соединяет две вещи, которые обычно меряют порознь, — насколько модель справляется и сколько энергии на это уходит. Нужна была авторам, чтобы сравнивать пары «модель плюс ускоритель» между собой.

Откуда взялась цифра 88,7 процента?

Из замера на миллионе реальных одноходовых запросов чатового и рассуждающего типа. Локальные модели до 20 миллиардов активных параметров ответили на 88,7 % из них точно, при этом точность заметно различается по доменам. Это доля запросов, а не доля рабочего времени и не доля ценности.

Значит, дорогие модели не нужны?

Нет. Замер сделан на одноходовых запросах: один вопрос, один ответ. Всё, где нужна длинная цепочка шагов, работа с инструментами, большой контекст или строгий формат на выходе, в эту выборку не входило. Дорогая позиция нужна там, где задача сложнее одного хода.

Как это применить к своему проекту?

Разметить свой поток. Возьмите запросы за неделю и разделите их на одноходовые и многоходовые. Первые прогоните на дешёвой или бесплатной позиции и сравните с текущим результатом. Если разница незаметна, эта доля потока переезжает вниз по цене и остаётся там.

Насколько выросла эффективность за два года?

В работе приводится рост intelligence per watt в 5,3 раза с 2023 по 2025 год — за счёт и архитектур моделей, и ускорителей. Отдельно отмечено, что локальные ускорители дают как минимум в 1,4 раза худший показатель, чем облачные на тех же моделях, то есть запас по оптимизации ещё есть.

Причём тут стоимость запроса в рублях?

Напрямую. Цена за токен в конечном счёте упирается в энергию и железо, на котором крутится инференс. Метрика на ватт — это взгляд на ту же экономику со стороны инфраструктуры, и она объясняет, почему разрыв в ставках между лёгкими и тяжёлыми позициями измеряется десятками раз.

Источники