LLM API и интеграция

Как понять, что задача не для нейросети

Как понять, что задача не для нейросети

Задачу не стоит отдавать нейросети, если верно хотя бы одно из пяти: ответ обязан совпадать при каждом прогоне, правильный ответ ровно один и он лежит в базе, ошибка дороже человека, который сделает то же самое, результат не с чем сравнить, данные нельзя отправлять наружу. Проверка по этим 5 признакам занимает 30 минут и не требует ни кода, ни бюджета. Признаки не складываются в баллы: достаточно одного совпадения.

Дальше — разбор каждого признака, таблица из 5 задач, которые выглядят очевидными кандидатами и не являются ими, объяснение, почему модель проваливает точный подсчёт и поиск по совпадению, и что делать с задачей, не прошедшей отбор. Про обратный отбор — какую задачу брать первой — есть отдельный разбор: какие задачи отдать нейросети первыми.

Когда ответ обязан быть одинаковым каждый раз

Когда за расхождение отвечает не вкус, а регламент. Расчёт зарплаты, начисление процентов, дозировка, срок по договору, сумма возврата — здесь два прогона обязаны дать один результат, и модель такой гарантии не даёт.

Дело не в настройках. Одна и та же позиция на один и тот же запрос выдаёт разные формулировки, а иногда и разные числа; нулевая температура снижает разброс, но не убирает его. Механика разобрана в статье почему модель отвечает по-разному.

Проверка формулируется одной фразой: придётся ли объяснять разницу между двумя ответами клиенту, проверяющему или суду. Если да — число должно приходить из расчёта. Модель может собрать вокруг него пояснение, но не может быть его источником.

Когда правильный ответ ровно один и он уже в базе

Тогда нужен запрос, а не модель. Остаток на складе, статус заказа, дата окончания гарантии, тариф по номеру договора — у этих вопросов единственный верный ответ, и он лежит в таблице.

Модель в этом месте делает ту же работу хуже и дороже. Если нужных данных нет в запросе, она не скажет «не знаю» автоматически — она соберёт ответ, похожий на правильный. Природа таких ответов разобрана в статье галлюцинации нейросети.

Рядом с базой модель полезна в другой роли. Рабочая схема: модель переводит вопрос человека в запрос, база отдаёт значение, модель оформляет ответ словами. За число отвечает база. Как это собирается — в статье поиск по своей базе.

Когда ошибка дороже человека, который сделает то же самое

Сравнивать нужно не «модель против ничего», а «модель против сотрудника, который делает это сейчас». Если сотрудник закрывает задачу за двадцать минут, а одна пропущенная ошибка стоит десятков тысяч рублей и разбирательства, экономия на токенах риск не окупает.

Арифметика простая: стоимость времени человека на объёме за месяц против цены одной ошибки, умноженной на ожидаемую долю ошибок. Долю на старте вы не знаете, поэтому считаете по пессимистичной. Как переводить ошибку в деньги — в статье сколько стоит ошибка нейросети.

Отдельно стоят области, где цена ошибки в деньгах не выражается: медицина, право, безопасность людей. Там модель уместна как черновик для специалиста и неуместна как источник ответа для того, кто на этот ответ опирается. Про распределение ответственности — кто отвечает за ответ нейросети.

Когда результат не с чем сравнить

Тогда задачу нельзя ни принять, ни улучшить. Эталон — это набор примеров, где правильный ответ известен заранее и определяется без спора.

Без эталона любое обсуждение результата превращается в обмен впечатлениями. «Стало лучше» и «стало хуже» — одинаково недоказуемые утверждения, а значит, вы не отличите удачную правку промпта от случайности. Как собирается выборка — в статье как тестировать нейросеть.

Это единственный признак из пяти, который иногда лечится. Соберите тридцать–пятьдесят примеров с известным ответом: если получилось, задача возвращается в работу; если сотрудники спорят о том, какой ответ верный, у вас не задача для модели, а неописанный процесс.

Когда данные нельзя отправлять наружу

Когда на входе персональные данные, врачебная или банковская тайна, сведения под NDA, коммерческая тайна или что-то, что по договору с клиентом не покидает контур. Здесь ограничение не техническое, и обойти его выбором модели нельзя.

Проверка формулируется бытовым языком: можете ли вы показать этот текст подрядчику, с которым не подписано соглашение. Если нет — запрос к внешнему API считается таким же показом. Разбор по составу данных — в статьях нейросети и персональные данные и коммерческая тайна и нейросети.

Часто ограничение снимается обезличиванием: из текста вынимают имена, номера и адреса, а модель работает с обезличенным фрагментом. Это отдельная работа, и её стоимость закладывают в смету до, а не после запуска.

Какие задачи выглядят подходящими, но не являются

Пять задач, которые регулярно попадают в план автоматизации и регулярно возвращаются оттуда.

ЗадачаПочему кажется подходящейЧто выходит на делеЧем делать
Точный подсчёт вхождений в текстетекст на входе, текст на выходеправдоподобное число, ошибка растёт с длинойскрипт или формула
Сортировка строк по числовому полю«это же просто список»порядок рядом с верным, часть строк теряетсятаблица или запрос к базе
Проверка арифметики в документечисла уже лежат в текстеошибки в сумме пропускаются, верные строки помечаются невернымипересчёт формулой
Поиск по точному совпадению артикула«модель понимает запрос»близкие идентификаторы путаются, недостающие символы дописываютсяиндекс или поиск по строке
Сверка двух списков позиция к позициисравнение похоже на чтениерасхождения находятся выборочно, порядок сбиваетсясопоставление по ключу

Общее у всех пяти: правильный ответ проверяется машиной за секунду, а модель делает ту же работу медленнее и без гарантии. Если результат можно получить формулой, формула и есть решение.

Почему модель не считает и не ищет точное совпадение

Потому что она работает с текстом, а не с таблицей, и считает не арифметикой. Ответ собирается как продолжение последовательности символов: число в запросе для модели не величина, а кусок текста, и «1 347» может разбиться на несколько фрагментов, которые дальше живут отдельной жизнью.

Отсюда характерный сбой на подсчёте. Модель не перебирает элементы по одному и не ведёт счётчик — она сразу выдаёт правдоподобный итог. На десяти строках он обычно верен, на сотне расходится, и хуже всего то, что уверенность в ответе при этом не меняется.

С точным совпадением похожая история. Сопоставление идёт по смыслу, а не посимвольно, поэтому A-1180-X и A-1I80-X для модели почти одно и то же. Для поиска по смыслу существует переранжирование — оно есть в нашем каталоге и разобрано в статье эмбеддинги и rerank для поиска, — но точное совпадение остаётся работой индекса.

Практический вывод для таблиц: модель хорошо пишет формулу и плохо заменяет её собой. Подробно — в статье нейросеть в Excel: формулы и таблицы.

Что делать с задачей, которая не прошла отбор

Разрезать, а не выбрасывать. В большинстве случаев признак срабатывает не на всю задачу, а на её часть, и после разреза обе половины становятся рабочими.

  • Точную часть отдают инструменту. Расчёт, сортировка, сверка, поиск по идентификатору выполняются кодом или запросом.
  • Текстовую часть оставляют модели. Понять вопрос, разобрать письмо, оформить ответ, объяснить результат человеческими словами.
  • Решение оставляют человеку. Там, где цена ошибки высока, модель готовит черновик, а подпись ставит сотрудник.

Целиком задачу оставляют человеку редко — когда разрезать её не получается и эталона нет. Это честный итог получасовой проверки, и он дешевле, чем выяснить то же самое через три месяца по жалобам. Порядок действий, когда ошибка уже случилась, — в статье что делать, если нейросеть ошиблась.

Сколько стоит проверить это заранее

Задача не для нейросети, если ответ обязан совпадать при каждом прогоне, верный ответ один и лежит в базе, ошибка дороже человека, эталона нет или данные нельзя отправлять наружу. Остальные задачи проверяют прогоном на дешёвых позициях: в каталоге KeyDealer 57 позиций, 44 доступны, ставки текстовых начинаются с 1 ₽ за миллион токенов, оплата российской картой в рублях.

Порядок расчёта: сто спорных примеров по две тысячи токенов — это около 200 тысяч токенов, то есть пятая часть миллиона. На qwen-3-7-plus за 3 ₽ или haiku-4-5 за 8 ₽ за миллион такая проверка стоит меньше поездки на такси.

Скидку за повторяющийся префикс в расчёт не закладывайте: у всех текстовых позиций каталога кэш промптов помечен как неподдерживаемый. Пять текстовых позиций бесплатны после первого платного пополнения — на них удобно гонять черновые прогоны, пока вы решаете, та ли это задача вообще.

Чего мы не утверждаем

Мы не утверждаем, что перечисленные задачи модели не по силам никогда. Речь о задаче в том виде, в каком она поставлена: подсчёт внутри текста ненадёжен, а вызов инструмента, который считает, — рабочая схема.

Мы не утверждаем, что пять признаков закрывают все случаи. В производстве, медицине и финансах есть отраслевые ограничения, которых нет в этом списке, и они сильнее любых общих критериев.

Мы не даём юридических оценок. Допустимость конкретного сценария в вашей отрасли определяют ваши регламенты и ваш юрист, а не статья в блоге.

Что нужно, чтобы попробовать

Ключ заводится за минуту на keydealer.ru/login — почта и пароль, без документов и без зарубежной карты. Один ключ открывает весь каталог, оплата российской картой в рублях.

Со своей стороны подготовьте два списка: задачи, которые прошли проверку по пяти признакам, и задачи, которые не прошли. Второй список полезнее первого — он экономит месяцы.

Приветственный бонус позволяет прогнать спорные примеры до первого пополнения и увидеть, где модель уверенно ошибается. Это и есть главный аргумент в разговоре с командой.

Что держать в голове

Отбор задач — не про возможности моделей, а про вашу способность проверить результат. Задача, у которой нет проверяемого правильного ответа, остаётся непроверяемой независимо от того, какую позицию вы выберете.

Из пяти признаков лечится один — отсутствие эталона. Остальные четыре означают либо другой инструмент, либо другое разрезание задачи, либо человека с подписью.

Отказ от задачи — такой же результат внедрения, как запуск. Он стоит полчаса на входе и экономит бюджет, который иначе уйдёт на месяцы правок промпта в надежде, что модель начнёт считать. Как мы проверяем факты и почему у каждой цифры стоит дата — на странице о проекте. Завести ключ и проверить оставшиеся задачи: keydealer.ru/login.

Частые вопросы

Какие задачи нельзя отдавать нейросети?

Те, где верен хотя бы один из пяти признаков: ответ обязан совпадать при каждом прогоне, правильный ответ ровно один и он лежит в базе, цена ошибки выше стоимости человека, который сделает то же самое, результат не с чем сравнить, данные нельзя отправлять наружу. Признаки не складываются в баллы — достаточно одного.

Почему нейросеть плохо считает?

Потому что она не выполняет арифметику, а продолжает текст. Число внутри запроса для неё такая же последовательность символов, как слово, поэтому результат получается правдоподобным, а не верным. Складывать, сортировать и сверять суммы должен скрипт, формула или запрос к базе — модель может написать эту формулу, но не заменить её.

Можно ли доверить модели поиск по точному совпадению?

Нет. Модель сопоставляет по смыслу, а не посимвольно, поэтому близкие артикулы, номера договоров и идентификаторы она путает и иногда дополняет недостающие символы сама. Точное совпадение ищет индекс или обычный поиск по строке, а переранжирование помогает уже поверх найденного набора.

Что делать, если задача не прошла отбор?

Разрезать её на части. Обычно точную часть — расчёт, поиск, сверку — забирает детерминированный инструмент, а модель остаётся на текстовой части: понять вопрос, оформить ответ, объяснить результат. Целиком задачу отдают человеку только тогда, когда даже разрезать её не получается.

Как проверить, есть ли у задачи эталон?

Попробуйте собрать 30–50 примеров с заранее известным правильным ответом. Если правильный ответ в каждом случае определяется без спора, эталон есть и задачу можно измерить. Если сотрудники спорят о том, какой ответ верный, то измерять нечего, и модель здесь не даёт результата, а даёт мнение.

Сколько стоит проверить задачу перед внедрением?

Порядок — десятки рублей. Сто спорных примеров по две тысячи токенов складываются примерно в 200 тысяч токенов, а на дешёвой текстовой позиции миллион токенов стоит 1 ₽. Дороже токенов обходится подготовка самих примеров, и это единственная часть, которую нельзя ускорить деньгами.

Источники