LLM API и интеграция
Сколько стоит внедрить нейросеть в компанию
Вопрос «сколько стоит внедрить нейросеть» обычно задают про токены, а токены — самая маленькая строка сметы. Основные деньги уходят на людей: сформулировать задачу, подготовить данные, написать обвязку, договориться о том, что считать правильным ответом, и потом это поддерживать. Отсюда и главная причина, по которой проекты останавливаются: не дороговизна моделей, а отсутствие критерия успеха — когда заранее не договорились, какая доля верных ответов приемлема, спор о готовности не заканчивается. Разбираем реальную структуру затрат, порядок действий и признаки, по которым видно, что задача выбрана неправильно.
Из чего складывается смета
Шесть статей, отсортированных по типичному размеру.
Постановка задачи. Что именно автоматизируем, что на входе, что считается правильным ответом. Кажется формальностью, занимает больше всего обсуждений и определяет судьбу проекта.
Подготовка данных. Разметка примеров, сбор документов, приведение к пригодному виду. Самая трудоёмкая часть, измеряется человеко-днями, и её почти всегда недооценивают.
Разработка обвязки. Промпт, обработка ответов, проверки, лимиты, логи. Это обычный код, и оценивается как обычный код.
Проверка качества. Выборка, прогоны, сравнение вариантов — как это делается. Экономить здесь дешевле всего и дороже всего по последствиям.
Токены. Расход на сами запросы. Обычно самая маленькая строка, и её легко посчитать заранее.
Поддержка. Модели обновляются, данные меняются, задачи расширяются. Это постоянная статья, а не разовая.
Те же шесть статей одним взглядом.
| Этап | Что стоит денег | Чем считается |
|---|---|---|
| Постановка задачи | Что автоматизируем, что на входе, что считать правильным ответом | Работа людей |
| Подготовка данных | Разметка примеров, сбор и приведение документов | Работа людей, человеко-дни |
| Разработка обвязки | Промпт, обработка ответов, проверки, лимиты, логи | Работа людей, как обычный код |
| Проверка качества | Выборка, прогоны, сравнение вариантов | Работа людей |
| Токены | Сами запросы к модели | Объём в токенах × ставка |
| Поддержка | Обновление моделей, данных и задач | Работа людей, постоянно |
Пропорция, которую стоит держать в голове: если расход на токены сопоставим с расходом на людей, у вас либо очень большой объём, либо очень маленький проект.
Почему токены — маленькая строка
Покажем на порядке величин, без привязки к конкретным ставкам.
Типовые корпоративные задачи — классификация обращений, извлечение полей, короткие ответы по документам — это короткий вход и короткий выход. Даже тысячи запросов в день складываются в сумму, сопоставимую с несколькими часами работы разработчика в месяц.
Расход становится заметным в трёх случаях: длинные документы в каждом запросе, агентские цепочки с растущей историей и генерация больших объёмов текста. Если ваш сценарий не из этих трёх, считать экономию на токенах до запуска — преждевременная оптимизация.
Посчитать свою цифру заранее можно за полчаса: объём в токенах умножить на ставку — методика. А проверить гипотезу вообще без расхода — на нулевых позициях каталога: их восемь из сорока шести на 3 сентября 2026 года.
С какой задачи начинать
Признаки правильной первой задачи. Нужны все, а не один.
Узкая. Одна операция, а не «помощник для всего». Универсальный помощник невозможно принять: непонятно, когда он готов.
Измеримая. Есть правильный ответ, и его можно сравнить с полученным.
Повторяющаяся. Сотни или тысячи раз, иначе экономия не окупит разработку.
С обратимой ошибкой. Неверная категория обращения исправляется человеком в очереди; неверно отправленное письмо — нет.
С существующим эталоном. Задачу уже делают люди, значит есть архив правильных решений — готовая выборка.
Под эти признаки лучше всего подходят классификация обращений, извлечение полей из документов и подготовка черновиков, которые правит человек.
Плохие первые задачи: помощник, отвечающий клиентам без проверки; автоматизация процесса, который и без модели не описан; всё, где ошибка необратима.
Порядок действий
Шесть шагов, от которых не стоит отклоняться.
- Договоритесь о критерии успеха. Конкретная цифра: «85% обращений размечены верно» или «черновик требует не больше двух правок». Без цифры проект не закончится никогда.
- Соберите выборку. Двести реальных примеров с правильными ответами. День работы, окупается сразу.
- Сделайте пилот на дешёвой модели. Не на самой сильной: сначала выясните, решается ли задача в принципе.
- Померьте. Сравните с критерием из первого пункта.
- Улучшайте в правильном порядке. Промпт, потом данные в контексте, потом параметры, и только потом модель. Обратный порядок дороже и обычно бесполезен.
- Запускайте с человеком в контуре. Сначала модель предлагает, человек подтверждает. Автоматический режим включается по накопленной статистике, а не по ощущению готовности.
Шестой пункт заодно решает вопрос доверия внутри компании: люди видят, как система работает, прежде чем ей что-то доверить.
Что почти всегда недооценивают
Четыре статьи, из-за которых смета оказывается больше плана.
Разметка данных. «Мы быстро разметим» превращается в две недели, потому что выясняется, что сотрудники размечают по-разному, и сначала надо договориться о правилах.
Согласование правильного ответа. Два эксперта из разных отделов по-разному отвечают на один вопрос клиента. Это обнаруживается на разметке и требует решения на уровне бизнеса, а не разработки.
Интеграция. Модель — маленькая часть; основное время уходит на то, чтобы подключить её к вашим системам и провести результат по существующим процессам.
Поддержка после запуска. Категории меняются, документы обновляются, промпт устаревает. Проект без выделенного времени на сопровождение деградирует за квартал.
Где деньги уходят зря
Пять типовых способов потратить лишнее.
Начали с дорогой модели. Не проверив, справляется ли дешёвая. Разница в цене кратная, разница в результате на типовых задачах часто небольшая.
Отправляют документы целиком. Вместо нужных фрагментов.
Взялись за дообучение раньше времени. Почти всегда задача решается промптом и данными в контексте — когда что нужно.
Нет учёта по сценариям. Один ключ на всё, и непонятно, какая функция сколько стоит. Лечится отдельными ключами.
Оптимизируют то, что не измеряли. Правки промпта без выборки — это перекладывание, а не улучшение.
Что решить до начала
Три вопроса, ответы на которые дешевле получить заранее.
Что можно отправлять наружу. Какие данные допустимо передавать провайдеру, а какие надо обезличивать до отправки — что уходит на самом деле.
Кто отвечает за неверный ответ. Если система отвечает клиенту от имени компании, это обязательство компании, кто бы ни сформулировал текст.
Что делаем, когда модель не знает. Отказ, передача человеку, форма обратной связи. Ответ «такого не будет» — неправильный.
Как понять, что пилот удался
Критерии приёмки, о которых стоит договориться до начала, а не после.
Метрика достигла порога. Тот самый процент, названный в первом шаге. Если не достигла — это не провал, а информация: либо задача сложнее, чем думали, либо данных не хватает.
Расход укладывается в прикидку. Не «мало», а «столько, сколько посчитали». Расхождение в разы означает, что профиль нагрузки поняли неверно, и на объёме это станет проблемой.
Понятно, что делать с ошибками. Есть маршрут для случаев, где модель не справилась, и кто-то реально по нему проходит.
Люди пользуются. Самый недооценённый критерий. Система, которая работает, но которой не доверяют, ничем не отличается от неработающей — и лечится это не улучшением модели, а участием тех, кто будет с ней работать, ещё на этапе разметки.
Есть кому поддерживать. Названный человек и выделенное время, а не «посмотрим по ситуации».
Если четыре из пяти сходятся, а пятый нет — запускать рано. Проект без сопровождения деградирует быстрее, чем окупается.
Чего мы не утверждаем
Не называем сумм. Стоимость работы людей зависит от рынка и команды; мы описываем структуру, а не цифры.
Не сравниваем модели по качеству. Своих замеров мы не делали.
Не даём готовой методологии внедрения. Порядок выше — практический минимум, а не стандарт.
Цифры каталога — на дату. 46 позиций и восемь нулевых — состояние на 3 сентября 2026 года.
И про масштабирование: вторая задача обходится заметно дешевле первой. Обвязка, лимиты, логи и привычка работать с выборкой уже написаны — остаётся промпт и разметка. Поэтому первый пилот стоит выбирать не по максимальной выгоде, а по минимальному риску: он оплачивает инфраструктуру для всех следующих.
Что держать в голове
Токены — самая маленькая строка сметы. Деньги уходят на постановку задачи, разметку данных и поддержку, и именно эти статьи недооценивают.
И главное: проект без заранее названного критерия успеха не заканчивается. Цифра «сколько процентов верных ответов нас устроит» стоит одного разговора и экономит месяцы спора о готовности.
Как мы проверяем факты и что храним из запросов — на странице о проекте и в llms.txt. Проверить свою гипотезу на нулевой ставке: keydealer.ru/login.
Частые вопросы
Сколько стоит внедрить нейросеть в компанию?
Основная статья — не токены, а работа людей: постановка задачи, подготовка данных, разработка, проверка качества и поддержка. Расход на API обычно оказывается самой маленькой частью сметы.
С чего начать, чтобы не потратить лишнего?
С одной узкой задачи, где результат измерим и проверяется автоматически. Классификация обращений или извлечение полей окупаются быстрее, чем универсальный помощник.
Сколько занимает пилот?
Обычно недели, а не месяцы, если задача узкая. Дольше всего идёт не разработка, а разметка данных и согласование того, что считать правильным ответом.
Нужен ли отдельный специалист?
Для пилота обычно хватает разработчика и человека, знающего предметную область. Отдельная роль появляется, когда сценариев становится много.
Что чаще всего убивает проект?
Отсутствие критерия успеха. Если заранее не договорились, какая доля правильных ответов считается приемлемой, спор о готовности не заканчивается никогда.