LLM API и интеграция

API нейросети для стартапа: с чего начать и сколько тратить

API нейросети для стартапа: с чего начать и сколько тратить

Стартапу для запуска на моделях нужны три вещи: ключ, самая дешёвая позиция, которая справляется с задачей, и потолок расхода, выставленный до первого запроса. Расчёт проще, чем кажется: тысяча активных пользователей по десять обращений в месяц на позиции за 8 ₽ за миллион обходится в 184 ₽. Дорогим продукт делает не ставка, а привычка гонять всё через флагман и отправлять в модель лишний контекст.

Ниже — порядок запуска, расчёт экономики на пользователя и список решений, которые дешевле принять в начале, чем переделывать потом.

С чего начать: три шага до первой версии

  1. Опишите одно действие пользователя, которое модель делает лучше вашего текущего решения. Не продукт целиком, а одно действие.
  2. Соберите его на дешёвой позиции и посмотрите на результат на полусотне реальных примеров, а не на трёх придуманных.
  3. Померьте две цифры: сколько стоит одно обращение и какую долю ответов приходится править руками.

Только после этого имеет смысл говорить о выборе модели. Разбор первого вызова по шагам — в статье первый запрос к API нейросети.

Сколько это стоит на самом деле

Считаем на типовом обмене: 2 000 токенов на вход вместе с инструкцией и контекстом, 300 токенов на выход. Это 2 300 токенов на обращение.

Модель₽ за миллион₽ за 10 000 обращений
gpt-oss-20b00
deepseek-v4-flash123
qwen-3-6-flash369
gemini-3-flash6138
gpt-5-6-luna8184
sonnet-530690

Десять тысяч обращений — это тысяча активных пользователей по десять действий в месяц. На этом масштабе счёт за модель меньше, чем за один рабочий день разработчика, и обсуждать экономию на ставке бессмысленно.

Смысл появляется на порядок выше. Сто тысяч обращений на флагмане — это уже семь тысяч рублей в месяц против двухсот тридцати на недорогой позиции, и вот здесь выбор модели становится продуктовым решением.

Бесплатные позиции для прототипа

В каталоге пять текстовых позиций со ставкой 0 ₽ за миллион в обе стороны: gpt-oss-20b, llama-3-2-11b-vision и три позиции Nemotron. Они открываются после первого платного пополнения и дальше не тарифицируются.

Для стартапа это удобный полигон: на них проверяют форму промпта, структуру ответа и общий сценарий, не глядя на счёт. Что они умеют и где ломаются — в статье бесплатные нейросети по API.

Ограничение честное: на сложных рассуждениях они уступают платным, поэтому выводы о качестве продукта на них делать нельзя. Полигон — да, финальная проверка — нет.

Главная метрика: стоимость полезного действия

Сумма за месяц ничего не говорит о жизнеспособности. Считать нужно стоимость одного действия, которое приносит пользователю ценность.

Пример. Если на одно успешное действие приходится три обращения к модели, из которых два — это повторы после неудачного ответа, ваша реальная стоимость втрое выше расчётной. И лечится это не сменой модели, а промптом и подачей контекста.

Эта метрика отвечает на главный вопрос инвестора и основателя одновременно: сойдётся ли экономика, когда пользователей станет в сто раз больше. Как разложить сценарий по токенам — в статье как считать токены.

Решения, которые дешевле принять сразу

Идентификатор модели живёт в конфигурации. Не в коде, не в трёх местах. Смена модели должна быть правкой одной строки — иначе каждый переезд превращается в спринт.

Формат ответа задаётся строго. Если результат уходит в код, он должен приходить структурой, а не текстом с пояснением. Механика — в статье JSON от нейросети.

Ключи разведены по нагрузкам. Прод, тесты, эксперименты. Так виден расход по каждой и одну можно отозвать, не роняя остальные.

Есть запасная модель другого семейства. Проверенная заранее, а не в момент аварии. Как сделать переезд дешёвым, разобрано в статье как перейти на другую модель.

Журнал запросов ведётся с первого дня. Когда счёт вырастет вдвое, ответ на вопрос «почему» должен находиться запросом к журналу.

Чего на старте делать не нужно

Дообучать модель. Почти всегда преждевременно: дороже, медленнее и необратимее, чем правка промпта. Сравнение подходов — в статье дообучение или промпт.

Строить свою инфраструктуру инференса. Локальный запуск имеет смысл при конкретных требованиях к данным и объёму, а не по умолчанию — разбор в статье локальная нейросеть или API.

Брать флагман «на вырост». Это самый быстрый способ получить экономику, которая не сходится, и не заметить этого до масштабирования.

Обещать пользователю точность, которую вы не проверяли. Модель ошибается уверенно, и ответственность за ответ остаётся на продукте.

Как защититься от неожиданного счёта

Три меры, каждая занимает пять минут.

Потолок расхода до первого запроса. Не после первого счёта.

Лимит на длину ответа параметром. Защищает от случая, когда модель уходит в длинное рассуждение вместо короткого ответа.

Ограничение на частоту со стороны пользователя. Без него один активный клиент или чужой скрипт способен выбрать месячный бюджет за ночь. Механика — в статье лимиты запросов и что делать.

Как это выглядит в деньгах при росте

Полезно прикинуть три сценария заранее, чтобы не удивляться.

ПользователейОбращений в месяц₽ на gpt-5-6-luna₽ на sonnet-5
1 00010 000184690
10 000100 0001 8406 900
100 0001 000 00018 40069 000

Из таблицы видно главное: расход растёт линейно, а разница между позициями остаётся кратной на любом масштабе. Поэтому решение о модели, принятое на старте, стоит пересматривать не когда счёт станет большим, а когда изменится задача.

Что показывать инвестору и что себе

Две разные картины, и путать их дорого.

Инвестору интересна единица экономики: сколько стоит обслужить одного платящего пользователя и как эта цифра ведёт себя при росте. Здесь важна не ставка модели, а доля расхода на модель в выручке с пользователя. Если она измеряется единицами процентов, вопрос закрыт. Если десятками, продукт держится на субсидии.

Себе полезнее смотреть на другое: на долю обращений, которые пришлось повторить, и на долю ответов, которые пользователь не принял. Обе цифры показывают качество сценария, а не бюджета, и обе чинятся раньше, чем начинается разговор о смене модели.

Третья цифра, о которой забывают, — время ответа. Пользователь уходит не из-за цены, которой не видит, а из-за десятисекундной паузы. Когда ответ длинный, помогает потоковая выдача: первые слова появляются сразу, разбор в статье потоковая передача: когда нужна.

Чего мы не утверждаем

Мы не обещаем, что расчёт совпадёт с вашим: длина промпта и размер контекста у всех разные, и вход в 2 000 токенов может оказаться вдвое больше.

Мы не утверждаем, что дешёвая модель подойдёт любому продукту. Она подойдёт большинству рутинных сценариев, и это проверяется на своих примерах, а не по таблице.

Мы не даём советов по юридической стороне обработки данных пользователей — это вопрос к вашему юристу.

Что нужно, чтобы начать

Ключ заводится за минуту на keydealer.ru/login — почта и пароль, без документов и без зарубежной карты. Оплата российской картой в рублях, один ключ на все 53 позиции каталога.

Платные текстовые модели доступны сразу на приветственном бонусе: собрать первый сценарий и посмотреть на стоимость действия можно без пополнения.

Что держать в голове

Начинают с одного действия и самой дешёвой позиции, которая с ним справляется, а не с выбора флагмана.

Главная метрика — стоимость полезного действия, а не сумма за месяц: только она показывает, сойдётся ли экономика при росте.

Идентификатор модели живёт в конфигурации, ключи разведены по нагрузкам, потолок расхода выставлен заранее. Как мы проверяем факты и почему у каждой цифры стоит дата — на странице о проекте. Завести ключ: keydealer.ru/login.

Частые вопросы

Сколько стоит запустить продукт на нейросети?

Сама интеграция бесплатна, платят за токены. Продукт с тысячей активных пользователей и десятью обращениями на каждого обходится в 184 ₽ в месяц на позиции за 8 ₽ за миллион.

С какой модели начинать?

С самой дешёвой, которая справляется. В каталоге пять текстовых позиций со ставкой 0 ₽ и рабочие позиции от 1 ₽ за миллион — этого хватает, чтобы проверить идею до первых платежей.

Как не привязаться к одному вендору?

Держать идентификатор модели в конфигурации, а не в коде, и заранее проверить запасную позицию другого семейства. Переключение тогда занимает минуту, а не спринт.

Что считать главной метрикой расхода?

Стоимость одного полезного действия пользователя, а не сумму за месяц. Только она показывает, сойдётся ли экономика при росте.

Нужно ли дообучать модель под свой продукт?

На старте почти никогда. Сначала выжимают промпт и подачу контекста: это дешевле, быстрее и обратимо.

Как защититься от неожиданного счёта?

Отдельный ключ на каждую нагрузку, потолок расхода до первого запроса и лимит на длину ответа. Цикл без ограничений тратит баланс быстрее, чем это видно в графике.

Источники