Мир ИИ

Компании режут расходы на токены: что реально работает

Компании режут расходы на токены: что реально работает

Расход на ИИ в крупных компаниях гонят не разработчики, а обычные сотрудники — так следует из материала 404 Media о внутренней встрече в Accenture, который 7 августа разобрал Саймон Уиллисон. Один из главных пожирателей бюджета там назван прямо: конвейер, где страницы PDF сначала превращают в изображения, а потом просят модель извлечь из них текст. Разработчик обычно представляет цену запроса, сотрудник без технического бэкграунда — нет, и именно на этом разрыве вырастают счета, которые потом приходится срочно резать.

История любопытна не самим фактом, а тем, что она переворачивает привычную картину: экономить принято на промптах разработчика, а деньги уходят там, где их никто не считает.

Откуда на самом деле берётся счёт

Три источника расхода, по убыванию влияния.

Выбор модели. Самая крупная статья, и одновременно самая простая для правки. В каталоге KeyDealer ставки идут от 4 ₽ за миллион токенов у GLM-4.7 до 65 ₽ у Opus 5 — разница в шестнадцать раз. Никакая оптимизация текста промпта такого эффекта не даст.

Форма данных на входе. Тот самый случай с PDF. Изображение занимает заметно больше токенов, чем тот же текст, извлечённый обычным способом. Конвейер «PDF → картинка → модель → markdown» удобен тем, что работает на любых документах без настройки, и дорог ровно по той же причине.

Объём того, что уходит помимо промпта. История диалога, описания инструментов и служебный контекст маршрута. Здесь разброс между семействами моделей достигает 4,75 раза — разбор с цифрами в материале про то, почему prompt_tokens больше, чем вы отправили.

Почему нетехнический сотрудник тратит больше

Причина не в халатности, а в отсутствии обратной связи. Разработчик видит usage в ответе, счёт в кабинете и связь между тем и другим. Сотрудник, который загружает в корпоративного ассистента квартальный отчёт на двести страниц, не видит ничего — интерфейс одинаково быстро отвечает и на короткий вопрос, и на документ.

Отсюда типичный сценарий: инструмент раскатывают на всю компанию, через месяц приходит счёт, и начинается спешное сокращение.

Вывод для тех, кто строит такой инструмент внутри своего продукта: лимит и видимая цена нужны до раскатки, а не после первого счёта. Не обязательно показывать рубли каждому пользователю — достаточно потолка на пользователя в месяц и понятного поведения при его достижении.

Что реально снижает счёт

Приёмы по убыванию эффекта, с цифрами на ставках каталога.

1. Подобрать модель под задачу, а не брать самую сильную по умолчанию.

ЗадачаРазумный выборСтавка, ₽ за 1 млн
Классификация обращений, извлечение полейGLM-4.7, Gemini 2.5 Flash4–7
Короткие ответы, массовая обработкаGPT-5.4 Mini, Gemini 3.5 Flash6–8
Основная рабочая нагрузкаSonnet 5, Gemini 3.1 Pro, GPT-5.6 Terra20
Сложные рассуждения, ревью кодаOpus 5, GPT-5.6 Sol25–65

Разница между первой и последней строкой — до шестнадцати раз. Практика показывает, что заметная доля запросов в корпоративном ассистенте это первая строка, а обрабатываются они моделью из последней.

2. Не гнать документы через картинки, если текст извлекается иначе. Изображения дороже по токенам. Конвертация нужна там, где документ действительно нескан или где важна вёрстка, а не как режим по умолчанию для всех PDF.

3. Ограничить историю диалога. Если в каждый запрос уходит вся переписка, стоимость растёт с каждым ходом: следующий запрос содержит всё предыдущее. Потолок по числу сообщений или по токенам ставится один раз и работает всегда.

4. Убрать лишнее из описаний инструментов. Поле tools уходит в модель при каждом запросе. Пять подробно описанных функций легко весят больше самого вопроса.

5. Считать по факту, а не по ощущениям. Возьмите десять реальных запросов, посмотрите usage в ответах, выведите среднее соотношение входа к выходу. Дальше умножайте на объём. Прикидки в уме на коротких запросах ошибаются в разы.

Считаем на примере: корпоративный ассистент на сто человек

Возьмём типовой сценарий и посчитаем, как выбор модели меняет счёт.

Сто сотрудников, каждый делает двадцать обращений в рабочий день. Средний запрос — вопрос плюс небольшой контекст, около 1500 токенов. Ответ около 500 токенов. Двадцать два рабочих дня в месяце.

Итого 44 тысячи запросов в месяц, 66 млн входных токенов и 22 млн выходных, без учёта служебного контекста маршрута.

МодельСтавка, ₽ за 1 млнРасход в месяц
GLM-4.74352 ₽
Gemini 2.5 Flash7616 ₽
Sonnet 5201 760 ₽
GPT-5.6 Sol252 200 ₽
Opus 5655 720 ₽

Разрыв между первой и последней строкой — больше пяти тысяч рублей в месяц на ровном месте, при одинаковой нагрузке. Для большинства вопросов корпоративного ассистента разница в качестве ответа между этими строками читателем просто не замечается.

Здесь же видно, почему служебный контекст важен: добавьте к каждому из 44 тысяч запросов 9500 служебных токенов на Opus 5, и сверху набежит ещё 27 170 ₽ — в 4,75 раза больше, чем стоит весь полезный трафик. На Gemini 2.5 Flash с её 2000 служебных токенов та же добавка составит 616 ₽.

Сложим всё вместе. Полный месячный счёт на Opus 5 — 32 890 ₽, из которых полезного трафика лишь 5 720 ₽. На Gemini 2.5 Flash — 1 232 ₽, ровно пополам между полезным и служебным.

Это и есть главный вывод расчёта: на коротких частых запросах служебная часть решает больше, чем ставка. По ставке разница между этими моделями девятикратная, по итоговому счёту — двадцатисемикратная.

Отсюда правило для корпоративного ассистента: если большинство обращений короткие, семейство с маленьким служебным контекстом выигрывает дважды, и второй выигрыш крупнее первого. Проверить это на своих данных можно за один вечер, посмотрев usage у десятка реальных запросов.

Чего в этих расчётах быть не должно

Два места, где экономия оказывается воображаемой.

Скидка за кэш промптов. У вендоров попадание в кэш действительно дешевле обычного входа в разы. Соблазн заложить это в модель расходов большой. Но кэш — свойство маршрута, а не запроса: в каталоге KeyDealer у всех моделей prompt_cache.status сейчас unsupported, поэтому скидка не обещается и не применяется. Наличие поля cache_control в вашем коде ничего не доказывает.

Batch-скидки в сравнении обычных запросов. У Anthropic и Google пакетная обработка даёт минус 50%, но это отдельный асинхронный режим с другими гарантиями по времени. Сравнивать его со синхронными запросами некорректно.

Подробный пересчёт официальных долларовых ставок в рубли, с датой и курсом ЦБ — в опорном разборе, сколько стоит 1 млн токенов в рублях.

Отдельно: цена меняется и без вашего участия

Планируя бюджет, полезно помнить, что ставки двигаются сами. Свежие примеры: вводная цена Claude Sonnet 5 действует только до 31 августа 2026 года, дальше она вырастает в полтора раза. У Gemini 3.1 Pro ставка входа удваивается, как только запрос переваливает за 200 тысяч токенов. У OpenAI в конце июля выходило снижение цен на Luna и Terra.

Плюс модели отключают. Что и когда выключают все три вендора до конца 2026 года — в отдельном календаре: что сломается до конца 2026.

Что держать в голове

Счёт за ИИ обычно вырастает не там, где его оптимизируют. Оптимизируют промпт разработчика, а растёт он на нетехнических пользователях, на картинках вместо текста и на истории диалога, которая тащится целиком в каждый запрос.

Порядок действий от самого эффективного к наименее: подобрать модель под задачу, убрать лишний объём на входе, поставить лимиты до раскатки, и только потом заниматься тонкой настройкой промптов.

В KeyDealer ставка каждой модели видна до первого запроса, а списание считается по фактическому usage без скрытых коэффициентов — контракт описан в документации API. Как мы проверяем цифры — на странице о проекте.

Один ключ ко всему каталогу, чтобы переключаться между дешёвой и сильной моделью в одну строку: keydealer.ru/login.

Частые вопросы

Кто в компаниях тратит больше всего токенов?

По материалу 404 Media о внутренней встрече в Accenture основной расход давали не разработчики, а остальные сотрудники. Разработчик обычно понимает, сколько стоит запрос, а сотрудник без технического бэкграунда — нет.

Что такое дорогая конвертация PDF в картинки?

Распространённый приём обработки документов: страницы PDF превращают в изображения, затем просят модель извлечь из них текст в markdown. Изображения занимают заметно больше токенов, чем тот же текст, поэтому такой конвейер становится одним из главных пожирателей бюджета.

Какой приём экономии даёт наибольший эффект?

Выбор модели под задачу. Разница между самой дешёвой и самой дорогой моделью каталога достигает шестнадцати раз по ставке. Никакая оптимизация промпта такого эффекта не даст.

Помогает ли скидка за кэш промптов?

Только если провайдер прямо подтверждает попадание в кэш. В каталоге KeyDealer у всех моделей prompt_cache.status равен unsupported, поэтому закладывать эту скидку в расчёт нельзя.

Источники