LLM API и интеграция
Intelligence per Watt: 88,7 % запросов простые
Стэнфордская работа Intelligence per Watt измерила, какую долю реальных запросов закрывают маленькие модели: на миллионе одноходовых чатовых и рассуждающих запросов локальные модели до 20 миллиардов активных параметров ответили точно в 88,7 % случаев. Эффективность на ватт выросла в 5,3 раза с 2023 по 2025 год. Для практика вывод один: большая часть потока не требует топовой позиции — и это можно проверить на своих данных за вечер.
Работа вышла из лаборатории Scaling Intelligence при Стэнфорде, среди авторов Джон Хеннесси и Кристофер Ре. Замерялись 20 с лишним локальных моделей, восемь ускорителей — и локальных, и облачных, — и миллион реальных запросов. Разберём, что из этого переносится на обычный проект, а что нет.
Что такое intelligence per watt и зачем понадобилась новая метрика
Точность и энергопотребление обычно меряют по отдельности: бенчмарк отдельно, ватты отдельно. Авторы соединили их в одно число — точность на задаче, делённая на потребляемую мощность.
Смысл в том, что для локального инференса важен не рекорд по качеству и не рекорд по экономичности, а их отношение. Ноутбук ограничен по питанию, и вопрос стоит так: сколько полезного ответа удаётся получить в пределах этого бюджета. Метрика позволяет сравнивать пары «модель плюс ускоритель» между собой, а не спорить о моделях в вакууме.
Что именно намерили
Три результата, которые стоит запомнить.
| Результат | Цифра | Оговорка |
|---|---|---|
| Доля запросов, закрытых локальными моделями | 88,7 % | только одноходовые чатовые и рассуждающие |
| Рост эффективности на ватт за 2023–2025 | 5,3 раза | вклад и архитектур, и ускорителей |
| Отставание локальных ускорителей от облачных | минимум в 1,4 раза | на одних и тех же моделях |
Первая строка — та, ради которой работу и пересказывают. Вторая объясняет, почему дешёвые позиции за два года стали пригодны для боевых задач. Третья — техническая: даже при том же коде и той же модели облачное железо остаётся эффективнее, и запас по оптимизации локального ещё не выбран.
Почему 88,7 % — это не «всё работает на дешёвой модели»
Самая важная часть разбора. Замер сделан на одноходовых запросах: один вопрос, один ответ, чат и рассуждение.
Вот что в эту выборку не входило:
- агентские цепочки, где модель делает десятки шагов подряд и ошибка накапливается;
- работа с инструментами и вызов функций;
- длинный контекст — разбор документа на сотню страниц;
- строгий формат на выходе, который нужно держать от запроса к запросу;
- диалог, где ответ зависит от десяти предыдущих реплик.
То есть 88,7 % — это про долю запросов, а не про долю работы и тем более не про долю ценности. Один многоходовой сценарий может стоить дороже и значить больше, чем тысяча простых вопросов. Именно поэтому вывод «берём везде самое дешёвое» из работы не следует.
Как перенести это на свой поток
Порядок из четырёх шагов, и он не требует ни ноутбука с ускорителем, ни своей инфраструктуры.
Шаг первый — разметить поток. Выгрузите запросы за неделю и разделите на две кучи: одноходовые и всё остальное. Обычно первая куча оказывается больше, чем ожидалось, и состоит из однотипных вещей — короткая классификация, извлечение полей, переформулировка, ответ на типовой вопрос.
Шаг второй — прогнать первую кучу на дешёвой позиции. Не всю, а сотню запросов. Сравнить с тем, что сейчас отвечает дорогая позиция.
Шаг третий — посчитать разницу. Не в процентах точности, а в деньгах и в замеченных ошибках. Если из ста ответов хуже стали два и оба некритичны — решение очевидно.
Шаг четвёртый — закрепить маршрут. Простые запросы уходят вниз, сложные остаются наверху. Как это устроить технически, разобрано в материале маршрутизация между моделями.
Какие запросы почти всегда уезжают вниз
По опыту разбора чужих потоков набор повторяется от проекта к проекту. Вот что обычно оказывается в дешёвой корзине без потери качества:
- Классификация по закрытому списку. Определить тип обращения, тему письма, тональность отзыва. Задача с коротким входом и коротким выходом.
- Извлечение полей из текста. Вытащить дату, сумму, наименование, телефон. Разница между дешёвой и дорогой позицией здесь заметна реже всего.
- Переформулировка. Сократить, развернуть, переписать под другую аудиторию.
- Короткий перевод. Фраза, абзац, подпись к фото.
- Первичная проверка. Отсечь явно постороннее до того, как запрос дойдёт до дорогой позиции.
А вот что уезжать вниз не должно почти никогда: работа агента с инструментами, разбор длинного документа целиком, генерация текста, который пойдёт клиенту без вычитки, и любые задачи, где ответ надо держать в жёстком формате от запроса к запросу.
Почему разделение потока экономит больше, чем торг за ставку
Арифметика простая. Допустим, восемьдесят процентов ваших запросов — простые. Если они уходят на позицию в тридцать раз дешевле, счёт падает примерно втрое даже при том, что оставшиеся двадцать процентов продолжают идти по верхней ставке.
Никакая скидка на тариф такого эффекта не даёт. И в отличие от скидки, этот выигрыш не надо ни с кем согласовывать — он целиком в вашем коде.
Обратная сторона честная: у вас появляется маршрутизация, а значит ещё одно место, где что-то может пойти не так. Поэтому первое правило маршрута — он должен быть простым и проверяемым. Не модель решает, куда отправить запрос, а понятное правило на вашей стороне, которое можно прочитать глазами и протестировать.
Причём здесь цена за токен
Связь прямая, хотя её редко проговаривают. Стоимость запроса в конечном счёте упирается в энергию и железо: сколько ватт потратил ускоритель, пока считал ваш ответ. Метрика на ватт смотрит на ту же экономику со стороны инфраструктуры, а ставка за миллион токенов — со стороны счёта.
Отсюда и разрыв в ставках, который иначе выглядит произволом. В каталоге разница между лёгкими и тяжёлыми позициями — десятки раз: 1 ₽ за миллион токенов против 60 ₽ у верхней позиции. Это не наценка за бренд, а отражение того, сколько вычислений уходит на ответ.
Практический вывод для тех, кто считает бюджет: KeyDealer даёт один ключ на 53 позиции каталога, 40 из них доступны сейчас, с оплатой российской картой в рублях. Разметить поток и развести простые запросы на дешёвые позиции можно без смены поставщика и без второго договора — меняется одна строка с именем модели, а расход виден по каждому запросу. Как считается сам счёт, разобрано в материале сколько стоит миллион токенов в рублях.
Что в каталоге относится к тому же классу моделей
Работа изучала модели до 20 миллиардов активных параметров — тот класс, который помещается на ноутбук. Прямой представитель этого класса есть и у нас: gpt-oss-20b со ставкой 0 ₽, то есть после первого платного пополнения он не тарифицируется вовсе. Рядом ещё четыре бесплатных текстовых позиции — llama-3-2-11b-vision и три Nemotron.
Это удобный способ проверить вывод работы на своих данных, не покупая железо: тот же класс моделей, но без ускорителя на столе. Про бесплатные позиции и их условия мы писали в материале бесплатные нейросети по API.
Чего мы не утверждаем
Три оговорки, без которых пересказ был бы нечестным.
Мы не утверждаем, что локальный инференс дешевле облачного. В работе прямо сказано обратное по эффективности: локальные ускорители дают как минимум в 1,4 раза худший показатель на ватт, чем облачные на тех же моделях. Речь о перераспределении нагрузки, а не о выигрыше в эффективности.
Мы не переносим 88,7 % на ваш поток. Авторы отдельно отмечают, что точность заметно различается по доменам. Ваша доля простых запросов может оказаться и выше, и заметно ниже — это измеряется, а не предполагается.
Мы не утверждаем, что цифры работы применимы к сегодняшним моделям один в один. Публикация датирована ноябрём 2025 года, с тех пор вышло не одно поколение. Направление вывода устойчиво, конкретные числа — нет.
Что нужно, чтобы проверить у себя
Сотня реальных запросов из своего продакшена, ключ на keydealer.ru/login и час времени. Прогоните их на своей текущей позиции и на дешёвой, положите ответы рядом и прочитайте глазами. Критерий приёмки формулируете вы, а не бенчмарк: где ошибка терпима, там она терпима. Как сравнивать корректно, разобрано в материале как сравнивать модели.
Что держать в голове
Первое. Главная ценность работы не в цифре 88,7 %, а в том, что она заставляет разделить поток. Пока все запросы идут в одну позицию, вы платите по верхней ставке за задачи, которые закрывает нижняя.
Второе. Оговорка про одноходовость важнее самой цифры. Агент, длинный документ, строгий формат — это не тот случай, и экономить там опасно: одна пропущенная ошибка в цепочке стоит дороже всей экономии за месяц.
Третье. Проверять нужно на своих данных. Любая опубликованная метрика — это чужая выборка на чужих задачах, и переносить её на свой продукт без замера — ровно та же ошибка, что верить маркетинговой странице вендора. Что мы за проект — на странице о проекте, ключ заводится на keydealer.ru/login.
Частые вопросы
Что такое intelligence per watt?
Метрика из работы Стэнфорда: точность на задаче, делённая на потребляемую мощность. Она соединяет две вещи, которые обычно меряют порознь, — насколько модель справляется и сколько энергии на это уходит. Нужна была авторам, чтобы сравнивать пары «модель плюс ускоритель» между собой.
Откуда взялась цифра 88,7 процента?
Из замера на миллионе реальных одноходовых запросов чатового и рассуждающего типа. Локальные модели до 20 миллиардов активных параметров ответили на 88,7 % из них точно, при этом точность заметно различается по доменам. Это доля запросов, а не доля рабочего времени и не доля ценности.
Значит, дорогие модели не нужны?
Нет. Замер сделан на одноходовых запросах: один вопрос, один ответ. Всё, где нужна длинная цепочка шагов, работа с инструментами, большой контекст или строгий формат на выходе, в эту выборку не входило. Дорогая позиция нужна там, где задача сложнее одного хода.
Как это применить к своему проекту?
Разметить свой поток. Возьмите запросы за неделю и разделите их на одноходовые и многоходовые. Первые прогоните на дешёвой или бесплатной позиции и сравните с текущим результатом. Если разница незаметна, эта доля потока переезжает вниз по цене и остаётся там.
Насколько выросла эффективность за два года?
В работе приводится рост intelligence per watt в 5,3 раза с 2023 по 2025 год — за счёт и архитектур моделей, и ускорителей. Отдельно отмечено, что локальные ускорители дают как минимум в 1,4 раза худший показатель, чем облачные на тех же моделях, то есть запас по оптимизации ещё есть.
Причём тут стоимость запроса в рублях?
Напрямую. Цена за токен в конечном счёте упирается в энергию и железо, на котором крутится инференс. Метрика на ватт — это взгляд на ту же экономику со стороны инфраструктуры, и она объясняет, почему разрыв в ставках между лёгкими и тяжёлыми позициями измеряется десятками раз.