LLM API и интеграция
Что такое LLM простыми словами и как она работает
Большая языковая модель делает ровно одну вещь: предсказывает следующий кусочек текста по всему предыдущему. Из повторения этого шага складывается всё, что выглядит как рассуждение, ответ на вопрос или написанный код. Понимание этого единственного механизма объясняет и сильные стороны, и все типовые разочарования: почему модель уверенно выдумывает, почему два одинаковых запроса дают разные ответы, почему она не знает вчерашних новостей и почему длина ответа напрямую превращается в деньги. Разбираем устройство без математики и вытаскиваем из него практические выводы.
Один шаг, повторённый много раз
Начнём с того, что происходит на самом деле.
Вы отправляете текст. Модель разбивает его на токены — кусочки, каждый из которых обычно короче слова. Дальше она считает вероятности для всех возможных следующих токенов и выбирает один. Затем повторяет: новый токен добавляется к тексту, и всё считается заново.
Так, по одному кусочку, набирается ответ. Ни на каком этапе не происходит поиска в базе, обращения к справочнику или проверки истинности. Есть только вопрос «что вероятнее идёт дальше».
Из этого механизма следует почти всё остальное, поэтому дальше мы будем к нему возвращаться.
Что такое токены и почему это важно
Токен — единица, в которой измеряется всё: объём запроса, длина ответа и счёт.
Токен не равен слову. Короткое частое слово может быть одним токеном, длинное или редкое — разбивается на несколько. Знаки препинания и пробелы тоже считаются.
Практически важная деталь для русского языка: кириллица расходует больше токенов, чем латиница. Один и тот же по смыслу текст на русском обходится дороже, чем на английском, — иногда заметно. Как это считать, разбирали отдельно: как считать токены и не ошибиться в бюджете.
Второе следствие — прямое: длина ответа переводится в деньги напрямую. Просьба «отвечай кратко» — это не стилистическое пожелание, а строка в счёте.
Что такое контекстное окно
Второе понятие, без которого не обойтись.
Контекстное окно — максимальный объём текста, который модель может учесть за один раз. В него входит всё: системные инструкции, история диалога, приложенные документы и сам ответ.
Три вещи, которые из этого следуют.
Модель ничего не помнит между запросами. Ощущение памяти в чате создаётся тем, что вся предыдущая переписка отправляется заново при каждом сообщении. Отсюда и рост стоимости длинного диалога.
Большое окно не значит, что его надо заполнять. Качество ответа на очень длинном контексте растёт не линейно, а платите вы за весь объём — сколько контекста реально нужно.
За окно нельзя выйти. Документ, который не помещается, надо разбивать на части или искать в нём нужные фрагменты.
Почему модель выдумывает
Самый частый вопрос, и ответ на него уже содержится в механизме.
Правдоподобное продолжение существует всегда — в том числе когда правильного ответа модель не знает. Внутри нет разницы между «помню точно» и «достраиваю», поэтому выдумка формулируется так же уверенно, как верный ответ.
Это не дефект конкретной модели и не признак плохого обучения. Это свойство подхода, и лечится оно не выбором модели, а архитектурой вокруг неё — подробно разбирали в материале про галлюцинации нейросети.
Почему ответы каждый раз разные
Второй по частоте вопрос.
Выбор следующего токена содержит элемент случайности — иначе модель на любой запрос выдавала бы один и тот же текст, включая случаи, когда хороших вариантов много. Степенью этой случайности управляет температура и родственные параметры.
Но даже при минимальной случайности полного совпадения от запуска к запуску ждать не стоит: на итог влияют и другие обстоятельства, не зависящие от вашего запроса. Подробности — в разборе почему модель отвечает по-разному.
Практический вывод: если вашему коду нужна стабильность, её обеспечивает проверка результата, а не настройка генерации.
Что модель знает и чего не знает
Разграничение, которое снимает половину завышенных ожиданий.
Знает: то, что было в обучающих данных, — язык, общие знания, распространённые библиотеки и практики, типовые формы документов.
Не знает: событий после окончания обучения, ваших внутренних данных, содержимого ваших систем, того, что происходит прямо сейчас.
По умолчанию модель не ходит в интернет. Некоторые продукты умеют это отдельной функцией, но базовое обращение к API — это разговор с тем, что модель усвоила.
Отсюда правильный способ дать ей знания: не «доучить», а положить данные в запрос. Разницу между этими путями и цену каждого мы разбирали в материале дообучение или промпт.
Из чего складывается работа с LLM на практике
Короткая карта, чтобы было видно, где что.
Промпт. Текст задачи и правила. Самый дешёвый рычаг и самый недоиспользуемый — как написать системный промпт.
Контекст. Данные, которые вы кладёте в запрос: документы, найденные фрагменты, история.
Параметры. Настройки генерации: длина ответа, степень случайности, ограничители.
Инструменты. Функции, которые модель может попросить вызвать; выполняет их ваш код — как это устроено.
Проверка. То, что делает ваш код с полученным ответом, прежде чем показать его человеку или совершить действие.
Порядок здесь не случайный: улучшать стоит слева направо, а не начинать со смены модели.
Сколько это стоит
Коротко про экономику, потому что она устроена проще, чем кажется.
Оплачивается объём: входные токены плюс выходные. Ставки указываются за миллион токенов, и у большинства позиций нашего каталога они одинаковы для входа и выхода — как читать цену через GET /v1/models.
В каталоге на 1 сентября 2026 года 44 позиции и 12 семейств, из них восемь тарифицируются по нулевой ставке после платного пополнения баланса — на них удобно проверять свои задачи, прежде чем платить: что именно там доступно.
Три заблуждения, которые стоят дороже всего
Полезно назвать явно, потому что каждое из них ведёт к неверным решениям.
«Модель думает». Слово «рассуждение» в описаниях моделей означает, что она генерирует промежуточный текст перед ответом, а не что внутри происходит проверка логики. Промежуточные шаги — такое же предсказание токенов, и они тоже могут содержать выдумку. Практическое следствие: длинное подробное обоснование не является доказательством правильности вывода.
«Модель ищет ответ в своей базе». Базы нет. Есть распределение вероятностей, сформированное обучением. Отсюда невозможность спросить «откуда ты это взяла» и получить настоящую ссылку: источника у ответа нет, если вы сами его не положили в запрос.
«Более дорогая модель не ошибается». Ошибаются все, разница в частоте. Архитектура, которая полагается на безошибочность модели, сломается на любой из них — просто на дорогой позже и незаметнее, что хуже.
Общий вывод из всех трёх: надёжность появляется не внутри модели, а вокруг неё — в данных, которые вы подаёте, и в проверках, которые делает ваш код. Это не недостаток технологии, а способ её правильно применять; вся практическая работа с API состоит именно из этого.
Чего мы не утверждаем
Мы упрощаем. Внутреннее устройство современных моделей сложнее описанного; здесь дана рабочая модель понимания, а не точное описание архитектуры.
Не сравниваем модели по качеству. Своих замеров мы не делали.
Цифры каталога — на дату. 44 позиции и 8 нулевых — состояние на 1 сентября 2026 года; актуальное всегда в живой выдаче.
Отдельно стоит сказать про слово «понимает». Модель воспроизводит связи, встречавшиеся в текстах, и по внешнему результату это часто неотличимо от понимания. Спор о том, понимание это или нет, для практики бесполезен: важно другое — там, где связь в данных была слабой или противоречивой, результат будет соответствующим, и никакая формулировка запроса этого не исправит.
Что держать в голове
LLM предсказывает следующий токен — и все её особенности следуют из этого одного факта. Она не ищет, не проверяет и не помнит между запросами.
Практический вывод для того, кто начинает: улучшать результат надо в порядке «промпт → данные в контексте → параметры → проверка в коде», а смена модели — последний шаг, а не первый.
Как мы проверяем факты и что храним из запросов — на странице о проекте и в llms.txt. Попробовать на нулевых позициях без расхода: keydealer.ru/login.
Частые вопросы
Что такое LLM простыми словами?
Большая языковая модель — программа, которая предсказывает следующий кусочек текста по всему предыдущему. Из повторения этого шага складывается связный ответ.
Чем LLM отличается от нейросети вообще?
Нейросеть — общее название класса моделей. LLM — конкретный тип, обученный на больших объёмах текста и работающий с языком.
Модель ищет ответ в интернете?
По умолчанию нет. Она отвечает из того, что усвоила при обучении. Доступ к свежим данным появляется, только если вы сами положили их в запрос или подключили поиск.
Что такое токен?
Кусочек текста, которым модель оперирует: часть слова, слово или знак. По токенам считается и объём запроса, и стоимость.
Что такое контекстное окно?
Максимальный объём текста, который модель способна учесть за один запрос, вместе с вашим вопросом и своим ответом.