LLM API и интеграция
Как понять, что задача не для нейросети
Задачу не стоит отдавать нейросети, если верно хотя бы одно из пяти: ответ обязан совпадать при каждом прогоне, правильный ответ ровно один и он лежит в базе, ошибка дороже человека, который сделает то же самое, результат не с чем сравнить, данные нельзя отправлять наружу. Проверка по этим 5 признакам занимает 30 минут и не требует ни кода, ни бюджета. Признаки не складываются в баллы: достаточно одного совпадения.
Дальше — разбор каждого признака, таблица из 5 задач, которые выглядят очевидными кандидатами и не являются ими, объяснение, почему модель проваливает точный подсчёт и поиск по совпадению, и что делать с задачей, не прошедшей отбор. Про обратный отбор — какую задачу брать первой — есть отдельный разбор: какие задачи отдать нейросети первыми.
Когда ответ обязан быть одинаковым каждый раз
Когда за расхождение отвечает не вкус, а регламент. Расчёт зарплаты, начисление процентов, дозировка, срок по договору, сумма возврата — здесь два прогона обязаны дать один результат, и модель такой гарантии не даёт.
Дело не в настройках. Одна и та же позиция на один и тот же запрос выдаёт разные формулировки, а иногда и разные числа; нулевая температура снижает разброс, но не убирает его. Механика разобрана в статье почему модель отвечает по-разному.
Проверка формулируется одной фразой: придётся ли объяснять разницу между двумя ответами клиенту, проверяющему или суду. Если да — число должно приходить из расчёта. Модель может собрать вокруг него пояснение, но не может быть его источником.
Когда правильный ответ ровно один и он уже в базе
Тогда нужен запрос, а не модель. Остаток на складе, статус заказа, дата окончания гарантии, тариф по номеру договора — у этих вопросов единственный верный ответ, и он лежит в таблице.
Модель в этом месте делает ту же работу хуже и дороже. Если нужных данных нет в запросе, она не скажет «не знаю» автоматически — она соберёт ответ, похожий на правильный. Природа таких ответов разобрана в статье галлюцинации нейросети.
Рядом с базой модель полезна в другой роли. Рабочая схема: модель переводит вопрос человека в запрос, база отдаёт значение, модель оформляет ответ словами. За число отвечает база. Как это собирается — в статье поиск по своей базе.
Когда ошибка дороже человека, который сделает то же самое
Сравнивать нужно не «модель против ничего», а «модель против сотрудника, который делает это сейчас». Если сотрудник закрывает задачу за двадцать минут, а одна пропущенная ошибка стоит десятков тысяч рублей и разбирательства, экономия на токенах риск не окупает.
Арифметика простая: стоимость времени человека на объёме за месяц против цены одной ошибки, умноженной на ожидаемую долю ошибок. Долю на старте вы не знаете, поэтому считаете по пессимистичной. Как переводить ошибку в деньги — в статье сколько стоит ошибка нейросети.
Отдельно стоят области, где цена ошибки в деньгах не выражается: медицина, право, безопасность людей. Там модель уместна как черновик для специалиста и неуместна как источник ответа для того, кто на этот ответ опирается. Про распределение ответственности — кто отвечает за ответ нейросети.
Когда результат не с чем сравнить
Тогда задачу нельзя ни принять, ни улучшить. Эталон — это набор примеров, где правильный ответ известен заранее и определяется без спора.
Без эталона любое обсуждение результата превращается в обмен впечатлениями. «Стало лучше» и «стало хуже» — одинаково недоказуемые утверждения, а значит, вы не отличите удачную правку промпта от случайности. Как собирается выборка — в статье как тестировать нейросеть.
Это единственный признак из пяти, который иногда лечится. Соберите тридцать–пятьдесят примеров с известным ответом: если получилось, задача возвращается в работу; если сотрудники спорят о том, какой ответ верный, у вас не задача для модели, а неописанный процесс.
Когда данные нельзя отправлять наружу
Когда на входе персональные данные, врачебная или банковская тайна, сведения под NDA, коммерческая тайна или что-то, что по договору с клиентом не покидает контур. Здесь ограничение не техническое, и обойти его выбором модели нельзя.
Проверка формулируется бытовым языком: можете ли вы показать этот текст подрядчику, с которым не подписано соглашение. Если нет — запрос к внешнему API считается таким же показом. Разбор по составу данных — в статьях нейросети и персональные данные и коммерческая тайна и нейросети.
Часто ограничение снимается обезличиванием: из текста вынимают имена, номера и адреса, а модель работает с обезличенным фрагментом. Это отдельная работа, и её стоимость закладывают в смету до, а не после запуска.
Какие задачи выглядят подходящими, но не являются
Пять задач, которые регулярно попадают в план автоматизации и регулярно возвращаются оттуда.
| Задача | Почему кажется подходящей | Что выходит на деле | Чем делать |
|---|---|---|---|
| Точный подсчёт вхождений в тексте | текст на входе, текст на выходе | правдоподобное число, ошибка растёт с длиной | скрипт или формула |
| Сортировка строк по числовому полю | «это же просто список» | порядок рядом с верным, часть строк теряется | таблица или запрос к базе |
| Проверка арифметики в документе | числа уже лежат в тексте | ошибки в сумме пропускаются, верные строки помечаются неверными | пересчёт формулой |
| Поиск по точному совпадению артикула | «модель понимает запрос» | близкие идентификаторы путаются, недостающие символы дописываются | индекс или поиск по строке |
| Сверка двух списков позиция к позиции | сравнение похоже на чтение | расхождения находятся выборочно, порядок сбивается | сопоставление по ключу |
Общее у всех пяти: правильный ответ проверяется машиной за секунду, а модель делает ту же работу медленнее и без гарантии. Если результат можно получить формулой, формула и есть решение.
Почему модель не считает и не ищет точное совпадение
Потому что она работает с текстом, а не с таблицей, и считает не арифметикой. Ответ собирается как продолжение последовательности символов: число в запросе для модели не величина, а кусок текста, и «1 347» может разбиться на несколько фрагментов, которые дальше живут отдельной жизнью.
Отсюда характерный сбой на подсчёте. Модель не перебирает элементы по одному и не ведёт счётчик — она сразу выдаёт правдоподобный итог. На десяти строках он обычно верен, на сотне расходится, и хуже всего то, что уверенность в ответе при этом не меняется.
С точным совпадением похожая история. Сопоставление идёт по смыслу, а не посимвольно, поэтому A-1180-X и A-1I80-X для модели почти одно и то же. Для поиска по смыслу существует переранжирование — оно есть в нашем каталоге и разобрано в статье эмбеддинги и rerank для поиска, — но точное совпадение остаётся работой индекса.
Практический вывод для таблиц: модель хорошо пишет формулу и плохо заменяет её собой. Подробно — в статье нейросеть в Excel: формулы и таблицы.
Что делать с задачей, которая не прошла отбор
Разрезать, а не выбрасывать. В большинстве случаев признак срабатывает не на всю задачу, а на её часть, и после разреза обе половины становятся рабочими.
- Точную часть отдают инструменту. Расчёт, сортировка, сверка, поиск по идентификатору выполняются кодом или запросом.
- Текстовую часть оставляют модели. Понять вопрос, разобрать письмо, оформить ответ, объяснить результат человеческими словами.
- Решение оставляют человеку. Там, где цена ошибки высока, модель готовит черновик, а подпись ставит сотрудник.
Целиком задачу оставляют человеку редко — когда разрезать её не получается и эталона нет. Это честный итог получасовой проверки, и он дешевле, чем выяснить то же самое через три месяца по жалобам. Порядок действий, когда ошибка уже случилась, — в статье что делать, если нейросеть ошиблась.
Сколько стоит проверить это заранее
Задача не для нейросети, если ответ обязан совпадать при каждом прогоне, верный ответ один и лежит в базе, ошибка дороже человека, эталона нет или данные нельзя отправлять наружу. Остальные задачи проверяют прогоном на дешёвых позициях: в каталоге KeyDealer 57 позиций, 44 доступны, ставки текстовых начинаются с 1 ₽ за миллион токенов, оплата российской картой в рублях.
Порядок расчёта: сто спорных примеров по две тысячи токенов — это около 200 тысяч токенов, то есть пятая часть миллиона. На qwen-3-7-plus за 3 ₽ или haiku-4-5 за 8 ₽ за миллион такая проверка стоит меньше поездки на такси.
Скидку за повторяющийся префикс в расчёт не закладывайте: у всех текстовых позиций каталога кэш промптов помечен как неподдерживаемый. Пять текстовых позиций бесплатны после первого платного пополнения — на них удобно гонять черновые прогоны, пока вы решаете, та ли это задача вообще.
Чего мы не утверждаем
Мы не утверждаем, что перечисленные задачи модели не по силам никогда. Речь о задаче в том виде, в каком она поставлена: подсчёт внутри текста ненадёжен, а вызов инструмента, который считает, — рабочая схема.
Мы не утверждаем, что пять признаков закрывают все случаи. В производстве, медицине и финансах есть отраслевые ограничения, которых нет в этом списке, и они сильнее любых общих критериев.
Мы не даём юридических оценок. Допустимость конкретного сценария в вашей отрасли определяют ваши регламенты и ваш юрист, а не статья в блоге.
Что нужно, чтобы попробовать
Ключ заводится за минуту на keydealer.ru/login — почта и пароль, без документов и без зарубежной карты. Один ключ открывает весь каталог, оплата российской картой в рублях.
Со своей стороны подготовьте два списка: задачи, которые прошли проверку по пяти признакам, и задачи, которые не прошли. Второй список полезнее первого — он экономит месяцы.
Приветственный бонус позволяет прогнать спорные примеры до первого пополнения и увидеть, где модель уверенно ошибается. Это и есть главный аргумент в разговоре с командой.
Что держать в голове
Отбор задач — не про возможности моделей, а про вашу способность проверить результат. Задача, у которой нет проверяемого правильного ответа, остаётся непроверяемой независимо от того, какую позицию вы выберете.
Из пяти признаков лечится один — отсутствие эталона. Остальные четыре означают либо другой инструмент, либо другое разрезание задачи, либо человека с подписью.
Отказ от задачи — такой же результат внедрения, как запуск. Он стоит полчаса на входе и экономит бюджет, который иначе уйдёт на месяцы правок промпта в надежде, что модель начнёт считать. Как мы проверяем факты и почему у каждой цифры стоит дата — на странице о проекте. Завести ключ и проверить оставшиеся задачи: keydealer.ru/login.
Частые вопросы
Какие задачи нельзя отдавать нейросети?
Те, где верен хотя бы один из пяти признаков: ответ обязан совпадать при каждом прогоне, правильный ответ ровно один и он лежит в базе, цена ошибки выше стоимости человека, который сделает то же самое, результат не с чем сравнить, данные нельзя отправлять наружу. Признаки не складываются в баллы — достаточно одного.
Почему нейросеть плохо считает?
Потому что она не выполняет арифметику, а продолжает текст. Число внутри запроса для неё такая же последовательность символов, как слово, поэтому результат получается правдоподобным, а не верным. Складывать, сортировать и сверять суммы должен скрипт, формула или запрос к базе — модель может написать эту формулу, но не заменить её.
Можно ли доверить модели поиск по точному совпадению?
Нет. Модель сопоставляет по смыслу, а не посимвольно, поэтому близкие артикулы, номера договоров и идентификаторы она путает и иногда дополняет недостающие символы сама. Точное совпадение ищет индекс или обычный поиск по строке, а переранжирование помогает уже поверх найденного набора.
Что делать, если задача не прошла отбор?
Разрезать её на части. Обычно точную часть — расчёт, поиск, сверку — забирает детерминированный инструмент, а модель остаётся на текстовой части: понять вопрос, оформить ответ, объяснить результат. Целиком задачу отдают человеку только тогда, когда даже разрезать её не получается.
Как проверить, есть ли у задачи эталон?
Попробуйте собрать 30–50 примеров с заранее известным правильным ответом. Если правильный ответ в каждом случае определяется без спора, эталон есть и задачу можно измерить. Если сотрудники спорят о том, какой ответ верный, то измерять нечего, и модель здесь не даёт результата, а даёт мнение.
Сколько стоит проверить задачу перед внедрением?
Порядок — десятки рублей. Сто спорных примеров по две тысячи токенов складываются примерно в 200 тысяч токенов, а на дешёвой текстовой позиции миллион токенов стоит 1 ₽. Дороже токенов обходится подготовка самих примеров, и это единственная часть, которую нельзя ускорить деньгами.