LLM API и интеграция
Обработка заявок нейросетью: разбор и маршрутизация
Нейросеть разбирает заявку в свободной форме на поля, ставит тип и срочность, предлагает маршрут, готовит черновик первого ответа и помечает дубли. Поток в 10 000 заявок в месяц при 1 200 входных и 300 выходных токенах на заявку стоит 15 ₽ на ставке 1 ₽ за миллион, 120 ₽ на 8 ₽ и 450 ₽ на 30 ₽. Решение по заявке принимает человек: модель готовит карточку и черновик.
Ниже — пять сценариев по отдельности, два расчёта на месячном потоке, схема с двумя проходами, которая снижает счёт вдвое, и разбор того, что происходит при ошибке классификации.
Что именно модель делает с заявкой
Она превращает неструктурированный текст в структуру, с которой умеет работать ваша система.
Заявка приходит как попало: письмо на три абзаца без темы, сообщение в мессенджере из пяти реплик подряд, форма с одним полем «опишите проблему», пересланная переписка с подписями и цитатами. Система такое принять не может — ей нужны поля.
Разрыв между «текст от человека» и «поля в базе» и есть работа модели. Всё остальное — маршрутизация, приоритеты, ответы — надстраивается над результатом разбора и без него не существует.
Отсюда порядок внедрения: сначала разбор, потом классификация, потом всё остальное. Попытка начать с автоответов даёт красивую демонстрацию и неработающий процесс.
Как разобрать заявку в свободной форме
На выход нужен строгий формат с фиксированным набором полей, а не рассказ. Минимальный набор: кто обратился, по какому каналу, о каком объекте речь, что просят, есть ли срок, есть ли признак повторного обращения.
Три правила, без которых разбор не переживает первую тысячу заявок.
Каждое поле имеет значение «не указано». Отсутствие телефона в заявке — это факт, а не повод придумать телефон. Модель по умолчанию склонна достраивать, и запрет ставится в инструкции прямым текстом.
Значения переносятся как есть. Номер заказа, сумма и дата копируются символ в символ, без нормализации и без пересчёта.
Формат ответа фиксирован. Разбор идёт в машину, а не человеку, поэтому структура жёсткая — как её задавать, разобрано в статье JSON от нейросети: строгий формат.
Полезное дополнение: поле с уверенностью разбора. Заявки, где модель сама отметила сомнение, уходят оператору в первую очередь, а не растворяются в общем потоке.
Как классифицировать по типу и срочности
Тип и срочность — две независимые оси, и путать их нельзя.
Тип отвечает на вопрос «куда». Список закрытый, с описанием каждого класса в одну строку и обязательным классом «прочее». Открытый список, где модель придумывает название класса, превращается в семьдесят вариантов за месяц.
Срочность отвечает на вопрос «когда». Здесь работает не смысл текста, а признаки: названный клиентом срок, упоминание остановки работы, повторное обращение по той же теме, эмоциональная окраска. Эти признаки задаются правилами, а модель только отмечает их наличие.
Важная тонкость: решать, что считать срочным, должна не модель. Она находит в тексте «у нас встал склад», а вес этой фразы в вашей шкале приоритетов определяете вы. Общая механика разметки разобрана в статье классификация текстов нейросетью.
Качество классификации проверяется на размеченной вручную сотне заявок до запуска. Без этой сотни непонятно, что вы внедрили.
Как устроена маршрутизация и что делать с сомнением
Маршрут выбирает не модель, а ваша таблица соответствия: тип плюс срочность плюс канал дают отдел и очередь. Модель только заполняет входные значения для этой таблицы.
Разделение важно по трём причинам. Правила маршрутизации меняются чаще инструкции. Их изменение должно быть видно в системе, а не спрятано в тексте промпта. И на вопрос «почему заявка ушла туда» должен быть ответ, который читается без запуска модели.
Отдельная ветка — сомнение. Если уверенность разбора низкая или класс определён как «прочее», заявка идёт в ручную очередь, а не в случайный отдел. Доля таких заявок — рабочая метрика: если она растёт, список классов перестал покрывать поток.
Технические отказы — это третья ветка: недоступность, лимиты, слишком длинный текст. Про них есть разборы в статьях лимиты запросов и что делать и отказы маршрута и fallback. Заявка при отказе не теряется, а попадает в очередь без разметки.
Черновик первого ответа: где он уместен
Черновик уместен там, где ответ типовой, а цена ошибки низкая.
Хорошо работает: подтверждение получения с пересказом сути обращения своими словами, запрос недостающих данных, ответ на повторяющийся вопрос из базы знаний, уведомление о смене статуса.
Плохо работает: всё, что касается денег, сроков, компенсаций и обязательств. Здесь черновик экономит набор текста, но отправляет его оператор после правки.
Отдельно про автоотправку без человека. Она допустима для узкого класса — подтверждение получения, режим работы, статус заказа — и только когда неправильный ответ не создаёт обязательства. Смежный сценарий разобран в статье нейросеть для техподдержки, а почтовая часть — в статье нейросеть для почты.
Как находить дубли
Текстовым сравнением дубли в заявках не ловятся: один и тот же человек напишет об одной проблеме в почту и в мессенджер совершенно разными словами.
Рабочая схема двухслойная.
Слой первый — поля. Совпадение телефона, почты или номера заказа за окно в несколько дней даёт кандидатов почти без вычислений. Это ловит большинство дублей и стоит ноль.
Слой второй — смысл. Для оставшихся берётся отбор похожих обращений и переранжирование кандидатов: в каталоге для этого есть отдельная позиция, и она не текстовая модель. Как устроен такой поиск, разобрано в статье эмбеддинги и rerank для поиска.
Решение о склейке принимает человек или правило с высоким порогом. Автоматическая склейка по догадке модели приводит к потерянным обращениям, и клиент об этом узнаёт раньше вас.
Сколько стоит 10 000 заявок в месяц
Считаем полный цикл на одной заявке: 1 200 токенов на вход — текст обращения, список классов, инструкция — и 300 токенов на выход.
| Модель | ₽ за заявку | ₽ за 10 000 заявок |
|---|---|---|
gpt-oss-20b | 0 | 0 |
deepseek-v4-flash | 0,0015 | 15 |
qwen-3-6-flash | 0,0045 | 45 |
gemini-3-flash | 0,009 | 90 |
gpt-5-6-luna | 0,012 | 120 |
glm-5-3 | 0,0225 | 225 |
sonnet-5 | 0,045 | 450 |
gpt-6-astra | 0,09 | 900 |
Ставки каталога на 13 сентября 2026 года, одинаковые на вход и на выход. Пять текстовых позиций бесплатны и открываются после первого платного пополнения; на них удобно держать массовую разметку.
Как разделить поток на два прохода
Платить по верхней ставке за все десять тысяч заявок незачем: разметка и написание ответа — разные по сложности задачи.
| Проход | Объём | Токенов на заявку | Ставка | Стоимость |
|---|---|---|---|---|
| Разбор, класс, дубли | 10 000 | 800 | 3 ₽ | 24,00 ₽ |
| Черновик ответа | 2 000 | 1 600 | 8 ₽ | 25,60 ₽ |
| Итого | — | — | — | 49,60 ₽ |
Против 120 ₽ за тот же поток на одной средней позиции — в два с половиной раза дешевле при том же результате, потому что дорогая модель работает только там, где текст читает клиент. Как собирается такое разделение, разобрано в статье маршрутизация между моделями.
Оговорка про масштаб: разница в семьдесят рублей не стоит недели работы. Схема окупается на сотнях тысяч заявок или когда в цикле появляется дорогая модель с длинным контекстом.
Что делать, если модель ошиблась в классе
Ошибка в классификации — не авария, а ожидаемая часть процесса. Важно, что происходит после.
Оператор правит класс в карточке, и правка сохраняется. Без сохранения исправлений вы не узнаете ни частоту ошибок, ни их распределение по типам.
Раз в неделю смотрится разбор правок. Один класс, который путают чаще других, — это почти всегда плохая формулировка в его описании, а не слабая модель.
Список классов пересматривается раз в квартал. Рост доли «прочего» — сигнал, что поток изменился.
Чего делать не нужно — брать модель подороже при первых ошибках. На классификации с коротким списком классов разница между позициями видна слабо, а формулировка описаний влияет сильно.
Решение по заявке принимает человек
Модель готовит: разбирает, размечает, предлагает, пишет черновик. Решение — отказать, вернуть деньги, продлить срок, эскалировать — остаётся человеком, и это не про осторожность, а про природу инструмента.
Языковая модель не знает вашей истории отношений с клиентом, не видит его платежей и не отвечает за последствия. Она воспроизводит статистически вероятный ответ на текст, который ей показали. Внешне это выглядит как суждение, внутри — продолжение текста.
Отсюда практическое правило: модель не должна иметь права на действие, которое нельзя отменить. Отправка письма клиенту, закрытие обращения, возврат — всё это подтверждает человек. Про связку с рабочей системой есть разбор в статье нейросеть в CRM: что автоматизировать.
Частые ошибки при запуске
Начинают с автоответов. Эффектная демонстрация без разбора и классификации превращается в поток неточных писем клиентам.
Открытый список классов. Модель придумывает названия, и через месяц в отчёте семьдесят классов по одной заявке.
Нет ветки для сомнения. Заявки с низкой уверенностью уходят в случайный отдел и находятся через неделю.
Правила маршрутизации внутри промпта. Изменение приоритета превращается в правку текста инструкции без истории и без ответственного.
Не размечена контрольная сотня. Качество обсуждается ощущениями, потому что сравнивать не с чем.
Как понять, что стало лучше
Доля заявок, прошедших без правки оператора. Прямая метрика качества разбора и классификации.
Время до первого ответа клиенту. Метрика, которую видит клиент, и обычно она улучшается первой.
Доля заявок в классе «прочее». Показывает, покрывает ли список классов реальный поток.
Число потерянных и задвоенных обращений. Считается по жалобам и по склейкам; рост означает, что порог автоматической склейки завышен.
Чего мы не утверждаем
Мы не утверждаем, что расчёт совпадёт с вашим: пересланная переписка на десять писем даёт вход не в 1 200 токенов, а в десять тысяч, и счёт растёт пропорционально.
Мы не утверждаем, что классификация заработает без настройки: список классов и их описания — это ваша работа, и первая неделя всегда уходит на доводку.
Мы не обрабатываем звонки: распознавания речи в каталоге нет, и голосовой канал попадает в сценарий только текстовой расшифровкой со стороны вашей телефонии.
Что нужно, чтобы попробовать
Ключ заводится за минуту на keydealer.ru/login — почта и пароль, без документов и без зарубежной карты. Оплата российской картой в рублях, один ключ на весь каталог из 53 позиций.
Платные текстовые модели доступны сразу на приветственном бонусе: выгрузить двести своих реальных заявок, прогнать разбор и сравнить результат с ручной разметкой можно без пополнения. Это и есть та самая контрольная сотня, с которой начинается внедрение.
Что держать в голове
Обработка заявок нейросетью — это конвейер из пяти шагов: разбор в структуру, тип, срочность, маршрут, черновик ответа. Ценность даёт первый шаг, всё остальное надстраивается над ним.
Правила остаются в системе, а не в инструкции модели: маршрут считается таблицей соответствия, срочность задаётся вашей шкалой, склейка дублей требует порога и подтверждения.
Счёт за токены на потоке в десять тысяч заявок измеряется сотнями рублей в месяц, а на двух проходах — десятками. Решение по заявке при любой ставке остаётся за человеком. Как мы проверяем факты и почему у каждой цифры стоит дата — на странице о проекте. Завести ключ: keydealer.ru/login.
Частые вопросы
Что нейросеть делает с заявкой?
Разбирает текст в свободной форме на поля, ставит тип и срочность, предлагает маршрут, готовит черновик первого ответа и помечает вероятные дубли. Решение по заявке и отправку ответа подтверждает человек.
Сколько стоит обработать 10 000 заявок в месяц?
При 1 200 входных и 300 выходных токенах на заявку месячный поток стоит 15 ₽ на самой дешёвой платной позиции, 120 ₽ на средней и 450 ₽ на флагмане. Разделение на два прохода снижает счёт более чем вдвое.
Можно ли отдать модели автоответ клиенту без человека?
Только для узкого класса заявок с однозначным ответом и низкой ценой ошибки — подтверждение получения, статус, режим работы. Всё, что касается денег, сроков и обязательств, уходит оператору на подтверждение.
Как ловить дубли, если текст заявок разный?
Текстовым сравнением такие дубли не находятся. Работает связка: нормализованные поля из разбора — телефон, почта, номер заказа — плюс отбор похожих по смыслу обращений за окно в несколько дней и финальное решение человека.
Что делать, когда модель ошиблась в классе заявки?
Ошибка исправляется оператором в карточке, и эта правка сохраняется. Накопленные исправления — материал для уточнения инструкции и для замера качества: доля правок и есть главная метрика сценария.
Нужна ли модель посильнее для классификации?
Обычно нет. Классификация с коротким списком классов — задача для дешёвой позиции, и разница с флагманом на ней почти не видна. Верхние позиции берут под черновики ответов, а не под разметку.