LLM API и интеграция

Локальная нейросеть или API: что дешевле и когда

Локальная нейросеть или API: что дешевле и когда

Вопрос «поднять модель у себя или платить за API» решается арифметикой, но считают обычно неправильно: сравнивают ставку за токен с нулём, потому что веса скачиваются бесплатно. Бесплатны только веса. Дальше идут видеокарта, электричество, обслуживание и время инженера — и в пересчёте на реальный объём запросов эта сумма чаще всего проигрывает. Локальный запуск выигрывает в трёх ситуациях: когда нагрузка постоянная и круглосуточная, когда данные нельзя выпускать наружу, и когда железо у вас уже есть под другую задачу. Разбираем, как посчитать свой случай, и почему у сравнения есть третий вариант, о котором забывают.

Что вообще можно запустить локально

Первое ограничение отсекает половину сценариев ещё до расчётов.

Локально запускаются только модели с открытыми весами — те, чьи файлы вендор выложил для скачивания. GPT, Claude, Gemini и прочие закрытые модели не запускаются у себя ни при каких условиях: их весов не существует в публичном доступе, и никакая настройка это не обходит.

Открытых весов сейчас много и они сильные — мы разбирали позицию вендоров по этому вопросу. Но если ваш выбор упирается в конкретную закрытую модель, вопрос локального запуска просто не стоит.

Второе ограничение — размер. Грубый ориентир: примерно гигабайт видеопамяти на каждый миллиард параметров при обычном сжатии весов, плюс запас под контекст. Модель на 30 миллиардов параметров с этим ориентиром требует около 30 ГБ и не помещается в потребительскую карту. Модель на 700 миллиардов требует стойки, а не компьютера.

Отсюда практический вывод: на домашнем железе реально работают небольшие модели. Сравнивать их с флагманами некорректно — это разные весовые категории, и разочарование от локального запуска чаще всего именно отсюда.

Из чего складывается стоимость локального запуска

Пять статей, из которых регулярно считают одну.

Железо. Видеокарта с достаточным объёмом памяти — единственная позиция, которую все помнят. Считать её надо не целиком, а амортизацией: карта живёт несколько лет, и на месяц приходится соответствующая доля.

Электричество. Карта под нагрузкой потребляет постоянно. Круглосуточная работа — это счёт каждый месяц, и в некоторых регионах он сопоставим с амортизацией железа.

Обслуживание. Обновления драйверов, движка инференса, самой модели. Плюс то, что ломается: сбой охлаждения, упавший процесс, забитый диск.

Время инженера. Самая дорогая и самая недооценённая статья. Поднять модель — день. Довести до состояния, когда она не падает по ночам, — недели. Час специалиста стоит больше, чем месяц API на умеренной нагрузке.

Простой. Железо, купленное под пик, в остальное время стоит без дела, но амортизируется. Если запросы идут восемь часов в сутки, две трети стоимости карты уходят в никуда.

Последняя статья и есть главный аргумент против локального запуска при неровной нагрузке. API вы оплачиваете по факту использования, железо — независимо от него.

Когда локальный запуск выигрывает

Три ситуации, где арифметика поворачивается в другую сторону.

Постоянная круглосуточная нагрузка. Если модель работает без пауз, простоя нет, и амортизация раскладывается на большой объём. Это единственный случай, где локальный запуск может оказаться дешевле чисто по деньгам.

Данные нельзя выпускать наружу. Медицинские записи, персональные данные под жёстким регламентом, коммерческая тайна с формальными обязательствами. Здесь вопрос цены вторичен: если передавать данные нельзя, сравнивать не с чем.

Железо уже есть. Карта, купленная под обучение моделей или рендеринг, часть суток свободна. Её амортизация уже оплачена другой задачей, и остаётся только электричество.

Есть и четвёртая причина, которую стоит назвать честно, хотя она не экономическая: независимость. Локальная модель не отключится по решению вендора, не подорожает и не сменит поведение с новой версией. Мы вели календарь отключений моделей — там видно, что это не гипотетический риск.

Когда локальный запуск проигрывает

Обратная сторона, тоже коротким списком.

Редкие запросы. Несколько сотен в день — железо простаивает почти всё время.

Неровная нагрузка. Пики днём, тишина ночью. Карта покупается под пик, оплачивается всегда.

Нужна сильная модель. Флагманы либо закрыты, либо требуют инфраструктуры, которая дороже любого API.

Некому обслуживать. Если в команде нет человека, готового чинить это в три часа ночи, локальный запуск — источник простоев, а не экономии.

Нужна не одна модель, а выбор. Держать локально пять моделей под разные задачи — это пять раз оплаченное железо. Через API переключение между ними — смена строки в запросе.

Оба списка в одной сетке.

КритерийЛокальный запускЧерез API
За что платитеЖелезо, электричество, обслуживание, время инженераСтавка за токен по факту
ПростойОплачивается: амортизация идёт всегдаНе оплачивается
Какие модели доступныТолько открытые веса, и небольшиеВесь каталог, включая закрытые
Смена моделиКаждая — ещё раз оплаченное железоСтрока в запросе
Кто чинит в три часа ночиВаш инженерПровайдер
ДанныеНаружу не уходятУходят провайдеру
Отключение модели вендоромВеса уже у васРешение вендора

Третий вариант, о котором забывают

Сравнение «локально против API» неполное, потому что у него есть промежуточный случай: открытые веса через API.

Модели с открытыми весами доступны и по ставке за токен — у нас в каталоге таких много. Вы получаете ту же модель, которую могли бы скачать, но без железа, электричества и ночных дежурств. И при этом сохраняете главное преимущество открытых весов: возможность уйти. Если провайдер отключит модель или поднимет цену, вы поднимаете те же веса у себя или у другого провайдера — модель никуда не делась, она лежит в открытом доступе.

Это принципиально отличается от привязки к закрытой модели, где решение вендора не обходится ничем.

Отдельно про нулевые ставки. В каталоге на 30 августа 2026 года девять позиций тарифицируются по нулю после платного пополнения баланса — что это значит на практике, разбирали в материале про бесплатный API нейросети. Для сценария «попробовать открытую модель, прежде чем покупать под неё карту» это самый дешёвый способ проверки из существующих.

Как посчитать свой случай

Порядок, который занимает полчаса и снимает вопрос.

  1. Посчитайте реальный объём. Сколько запросов в сутки, какой средней длины. Не планируемый, а текущий — как считать токены.
  2. Умножьте на ставку API. Получите месячную сумму. Это ваш ориентир.
  3. Сложите локальную стоимость честно. Амортизация карты за месяц плюс электричество плюс хотя бы несколько часов инженера. Время считайте по своей ставке, а не по нулю.
  4. Разделите локальную сумму на объём. Получите стоимость своего токена. Теперь цифры сравнимы.
  5. Проверьте качество на своей задаче. Локально запускается модель меньшего размера, и она может не справиться с тем, что решает флагман через API.

Пятый пункт часто оказывается решающим раньше денег. Если небольшая открытая модель не даёт нужного результата, экономика уже не важна.

Гибридный вариант

Стоит упомянуть схему, к которой приходят те, кто посчитал оба варианта и не выбрал ни один.

Задачи внутри одного проекта редко однородны. Обычно есть большой объём простой работы — классификация, извлечение полей, короткие ответы по шаблону — и небольшой объём сложной, где нужна сильная модель. Первое отлично закрывается небольшой открытой моделью, второе требует флагмана.

Отсюда схема: массовое и простое — локально или на дешёвой ставке, редкое и сложное — через API на сильной модели. Экономика при этом складывается лучше любого из чистых вариантов: железо загружено постоянной работой, а за флагман вы платите ровно столько раз, сколько он реально понадобился.

Цена такого решения — усложнение кода: появляется маршрутизация запросов и необходимость решать, куда какой отправить. Если объём простой работы невелик, эта сложность не окупится, и честнее оставить всё на одном маршруте.

Чего мы не утверждаем

Не даём конкретных цифр по железу. Цены на видеокарты и электричество различаются по регионам и меняются; ориентир по видеопамяти — грубый и зависит от модели и настроек.

Не сравниваем качество моделей. Своих замеров мы не делали и на чужие рейтинги как на доказательство пригодности для вашей задачи не ссылаемся.

Не утверждаем, что API всегда дешевле. При постоянной круглосуточной нагрузке и уже имеющемся железе локальный запуск вполне может выиграть.

Не советуем по вопросам обработки персональных данных. Требования зависят от вашего регламента и юрисдикции.

Что держать в голове

Бесплатны только веса. Всё остальное — железо, электричество, обслуживание и время инженера — платится независимо от того, идут запросы или нет. Именно поэтому локальный запуск выигрывает при постоянной нагрузке и проигрывает при редкой.

И перед выбором из двух вариантов стоит посмотреть на третий: открытые веса через API дают ту же модель без железа и сохраняют возможность в любой момент перенести её к себе.

Как мы проверяем факты и что храним из запросов — на странице о проекте и в llms.txt. Попробовать открытую модель без покупки железа: keydealer.ru/login.

Частые вопросы

Что дешевле — локальная нейросеть или API?

Зависит от объёма. При редких запросах API дешевле почти всегда, потому что железо простаивает. При постоянной круглосуточной нагрузке локальный запуск может окупиться, но считать надо вместе с электричеством и временем инженера.

Какая модель нужна для запуска на своём компьютере?

Только с открытыми весами — те, что можно скачать. Закрытые модели вроде GPT или Claude локально запустить нельзя ни при каких условиях.

Сколько нужно видеопамяти?

Ориентир — примерно по гигабайту на каждый миллиард параметров при обычном сжатии весов, плюс запас под контекст. Точная цифра зависит от модели и настроек.

Локальный запуск бесплатный?

Нет. Бесплатны только веса. Платить приходится за железо, электричество, обслуживание и время специалиста, который всё это поднимает и чинит.

Есть ли бесплатные модели через API?

В каталоге KeyDealer на 30 августа 2026 года девять позиций тарифицируются по нулевой ставке после платного пополнения. Это не отменяет требования пополнить баланс.

Источники