LLM API и интеграция
Rerank API: как улучшить поиск по документам
27 августа в каталоге появился новый класс моделей и новый эндпоинт под них: POST /v1/rerank. Он принимает запрос и список документов, а возвращает те же документы, упорядоченные по релевантности. Доступны две модели — Nemotron Rerank VL 1B V2, принимающая до 1000 документов за обращение, и Rerank QA Mistral 4B с пределом в 512. Обе отдаются по нулевой ставке за запрос после подтверждённых пополнений от 100 рублей. Заодно приехала бесплатная Nemotron 3 Ultra для рассуждений, и в каталоге появились два новых семейства — NVIDIA и Mistral. Всего позиций 38, бесплатных из них пять. Разбираем, что такое реранк, зачем он нужен рядом с обычными моделями и в каких задачах даёт наибольший выигрыш.
Что делает реранк
Объясним на задаче, потому что абстрактное определение мало что даёт.
Представьте поиск по базе знаний. Пользователь спрашивает, вы находите пятьдесят фрагментов, похожих на запрос, и хотите отдать модели три самых подходящих — потому что все пятьдесят в контекст не влезут, а если и влезут, то разбавят релевантное и ухудшат ответ.
Вопрос: какие три из пятидесяти?
Обычный поиск отвечает на этот вопрос приблизительно. Он сравнивает запрос с документами по числовому представлению, посчитанному заранее и независимо друг от друга, — быстро, дёшево и грубо.
Реранкер отвечает точнее. Он смотрит на пару «запрос и документ» вместе и оценивает, насколько этот документ отвечает именно на этот вопрос. Это дороже по вычислениям, но именно поэтому и точнее: модель видит контекст обоих текстов одновременно.
Отсюда типичная связка: быстрый поиск отбирает полсотни кандидатов из миллионов, реранкер точно упорядочивает эти полсотни, в модель уходят первые три.
Что в контракте
Практические детали для тех, кто будет подключать.
| Эндпоинт | POST /v1/rerank |
| Список моделей | GET /v1/models/rerank |
| Поля запроса | query, documents, top_n, return_documents, truncate |
| Единица тарификации | запрос |
| Ставка | 0 после квалификации |
| Условие | подтверждённые пополнения от 100 ₽ |
Модели различаются пределом на число документов: у Nemotron Rerank VL 1B V2 это 1000 за обращение, у Rerank QA Mistral 4B — 512. Обе подтверждены по возможностям rerank, text_rerank, top_n и return_documents; мультимодальный реранк у обеих в статусе unknown — то есть не проверялся.
Поле truncate принимает значения END и NONE: усечь слишком длинный документ с конца или отказаться его обрабатывать.
Отдельно про приватность: по контракту тела запроса и документов не пишутся в хранилище расхода. В ответе возвращается чек с нулевым списанием — сам факт обращения фиксируется, содержимое нет.
Условие бесплатности то же, что у остальных бесплатных позиций каталога: сто рублей подтверждённых пополнений, промо-начисления не считаются. Проверить своё состояние можно через GET /v1/balance, который возвращает признак доступа к реранку по каждому маршруту.
Где это даёт выигрыш
Четыре сценария, по убыванию отдачи.
Поиск по базе знаний. Классический случай. Качество ответа модели напрямую зависит от того, что вы ей подложили; реранкер улучшает именно этот шаг, ничего не меняя в остальном.
Поддержка и вопросы по документации. Пользователь спрашивает своими словами, а нужный фрагмент написан канцелярским языком. Обычный поиск по сходству тут промахивается чаще, чем хочется.
Отбор фрагментов кода. Похожесть по тексту и релевантность задаче в коде расходятся особенно сильно: одинаковые по виду функции решают разные задачи.
Сокращение контекста. Если вы кладёте в запрос десять документов «на всякий случай», реранкер позволит класть три — и это одновременно дешевле и точнее.
Последний пункт стоит подчеркнуть. При нулевой ставке за реранк вы фактически меняете дорогие входные токены основной модели на бесплатный вызов. На объёме это заметная экономия, а не только улучшение качества.
Как встроить реранк в существующий поиск
Практическая часть, потому что менять придётся немного.
Если у вас уже работает поиск по базе знаний, схема сейчас выглядит примерно так: запрос пользователя — поиск — берём первые N — кладём в контекст модели.
Добавление реранка меняет одну строку в середине:
- Расширьте выборку из поиска. Раньше брали первые 3–5, теперь берите 30–50. Поиск от этого не подорожает: он и так считал больше, просто вы отсекали.
- Прогоните кандидатов через реранк. Один вызов, на вход — запрос и список, на выход — упорядоченный список с оценками.
- Возьмите первые 3–5 из упорядоченного. Теперь это уже осмысленный отбор, а не первые попавшиеся по грубому сходству.
Что даёт эта перестановка: раньше вы доверяли отбор быстрому и грубому механизму, теперь — точному. Число документов, уходящих в дорогую модель, при этом не растёт, а падает, потому что вы увереннее в том, что оставили.
Параметр top_n избавляет от необходимости резать список у себя: модель вернёт только нужное количество. А return_documents определяет, придут ли в ответе сами тексты или только их порядковые номера с оценками — второе экономит трафик, если документы у вас и так под рукой.
На что смотреть при замере
Реранк — тот редкий случай, когда пользу можно измерить объективно, и этим стоит воспользоваться.
Соберите два десятка реальных запросов, для которых вы знаете правильный ответ — то есть знаете, какой документ должен был найтись.
Замерьте, на каком месте он оказывается в выдаче обычного поиска. Обычно выясняется, что нужный фрагмент часто не в первой тройке, а на седьмом-пятнадцатом месте, — и именно поэтому модель отвечает мимо.
Прогоните те же запросы через реранк и посмотрите, поднялся ли он.
Метрика простая: доля запросов, где нужный документ попал в первые три. Если она выросла — реранк окупился, а поскольку он бесплатный, вопрос закрыт. Если не выросла, проблема в поиске: нужного документа просто нет среди кандидатов, и лечится это настройкой поиска, а не добавлением слоя.
Полезно, что этот замер объективен: правильный ответ известен заранее, и субъективные оценки не нужны. Мы разбирали, почему это редкость — у большинства задач с моделями такой роскоши нет.
Чего реранк не делает
Границы, чтобы не переоценить.
Он не ищет. На вход нужен уже отобранный список кандидатов. Найти их — задача вашего поиска, будь то векторный индекс, полнотекстовый движок или просто выборка из базы.
Он не отвечает на вопрос. Реранкер упорядочивает, а формулирует ответ по-прежнему обычная модель.
Он не спасёт плохих кандидатов. Если нужного документа нет среди поданных, никакое упорядочивание его не создаст. Реранк улучшает верх списка, а не его состав.
Мультимодальный реранк не проверен. У обеих моделей это поле в статусе unknown — не «не работает», а «не проверяли». Как читать такие статусы, разбирали в материале про поля биллинга.
Что ещё изменилось за сутки
Коротко, для полноты картины на 27 августа.
Каталог вырос до 38 позиций. Появились два новых семейства: NVIDIA и Mistral. Кроме реранкеров приехала Nemotron 3 Ultra — модель для рассуждений, кода и анализа, тоже с нулевой ставкой и тем же условием.
Бесплатных позиций теперь пять: Nemotron 3 Ultra, две модели FLUX для изображений и два реранкера. То есть бесплатно закрывается уже целый рабочий цикл — рассуждение, поиск нужного фрагмента, генерация картинки.
Курс ЦБ на 27 августа — 84,2820 ₽ за доллар.
Отдельно отметим: у opus-4-7 протокол chat_completions ушёл в review. Проверять статус перед запросом стоит всегда — разбор кодов отказа.
Чего мы не утверждаем
Мы не сравнивали качество двух реранкеров. Различаются они пределом на число документов; что точнее на ваших данных, проверяется только замером.
Не обещаем, что ставка останется нулевой. Условия описаны в контракте на сегодня; актуальное состояние — в GET /v1/models/rerank.
Не приводим цифр прироста качества. Выигрыш от реранка сильно зависит от того, насколько хорош ваш исходный поиск: при плохом отборе кандидатов эффект будет скромным.
Реранк не заменяет настройку поиска. Если кандидаты подбираются плохо, чинить надо поиск, а не добавлять слой поверх.
Что держать в голове
В каталоге появился отдельный эндпоинт для упорядочивания документов по релевантности и две модели под него, обе с нулевой ставкой после квалификации.
Практический смысл — в связке: быстрый поиск даёт кандидатов, реранк точно их сортирует, в основную модель уходит меньше документов. Меньше контекста означает и дешевле, и точнее, а сам реранк при этом ничего не стоит.
Как мы проверяем факты и почему ставки берутся из живой выдачи — на странице о проекте. Один ключ на весь каталог, включая реранк: keydealer.ru/login.
Частые вопросы
Что такое реранк?
Переупорядочивание набора документов по релевантности запросу. На вход подаются запрос и список кандидатов, на выходе — те же документы, отсортированные по тому, насколько они отвечают запросу.
Какой эндпоинт отвечает за реранк?
POST /v1/rerank. Он принимает поля query, documents, top_n, return_documents и truncate. Список доступных моделей отдаёт GET /v1/models/rerank.
Сколько это стоит?
Ноль за запрос после подтверждённых платных пополнений на сумму от 100 рублей. Приветственные и промо-начисления это условие не закрывают.
Какие модели доступны?
Две: Nemotron Rerank VL 1B V2 с пределом в 1000 документов за запрос и Rerank QA Mistral 4B с пределом в 512.
Сохраняется ли содержимое запросов?
Нет. По контракту тела запроса и документов не пишутся в хранилище расхода KeyDealer; в ответе возвращается чек с нулевым списанием.