Обзоры и сравнения моделей
Как выбрать модель ИИ под задачу: методика
Выбор модели почти всегда делается неправильно: смотрят рейтинг, берут ту, что выше, и удивляются счёту. Проблема в том, что рейтинг отвечает на вопрос «какая модель лучше в среднем по широкому набору задач», а ваш вопрос звучит иначе — «какая справляется с моей узкой задачей при разумной цене». Между этими вопросами корреляция есть, но слабая: модель, выигрывающая по сумме, регулярно проигрывает на конкретном сценарии более дешёвой. Проверить это можно за вечер и за несколько сотен рублей. Разбираем методику: что брать в выборку, как оценивать, когда результат достоверен и где в этой процедуре обычно ошибаются.
Почему рейтинги отвечают не на ваш вопрос
Три причины, по которым сводная оценка вводит в заблуждение именно вас.
Усреднение скрывает разброс. Модель с высоким средним может проваливаться на классе задач, к которому относится ваша, — и в сводной цифре это не видно.
Набор задач чужой. Составлен он под цели авторов рейтинга: сравнить модели между собой широко. Ваш сценарий там либо отсутствует, либо представлен парой примеров.
Язык и предметная область не учтены. Оценки почти всегда строятся на английском и на общих темах. Русскоязычные задачи с отраслевой спецификой ведут себя иначе.
Отсюда практическое: рейтинг полезен как фильтр первого приближения — чтобы отсеять заведомо слабые варианты и составить короткий список. Как основание для выбора он не работает.
Что взять в выборку
Самый важный шаг, и его чаще всего делают небрежно.
Берите реальные запросы, а не придуманные. Выгрузите из логов за неделю. Придуманные примеры систематически проще настоящих: вы бессознательно формулируете их так, как удобно модели.
Тридцать-пятьдесят штук достаточно для первого отсева. Это не даст статистически точных долей, но уверенно отличит «справляется» от «не справляется» — а именно этот вопрос вы и решаете.
Покройте разные типы. Простые, сложные, пограничные, с ошибками во входных данных. Пограничные важнее всего: обычные запросы отработают одинаково почти на любой модели, и разница проявится именно на трудных.
Включите то, что раньше ломалось. Если у вас есть случаи, где текущая модель ошибается, они обязаны быть в наборе. Иначе вы сравните модели там, где обе хороши, и не узнаете ничего полезного.
Как оценивать
Здесь развилка в зависимости от того, есть ли у задачи правильный ответ.
Если есть — сравнивайте с эталоном. Извлечение полей, классификация, преобразование формата. Считается доля точных совпадений, и всё однозначно. Важно: считать по документу, а не по полю — документ разобран верно, когда верны все поля сразу, и эта цифра всегда ниже.
Если нет — сравнивайте попарно. Два ответа рядом, выбираете лучший, не зная, какая модель какой выдала. Попарное сравнение надёжнее оценки в баллах: человек плохо ставит абсолютные оценки и хорошо выбирает из двух.
Те же две ветки по типам задач:
| Тип задачи | Способ сравнения | Что считать |
|---|---|---|
| Извлечение полей | Сверка с эталоном | Долю точных совпадений по документу целиком |
| Классификация | Сверка с эталоном | Долю точных совпадений |
| Преобразование формата | Сверка с эталоном | Долю точных совпадений |
| Задача без единственно верного ответа | Попарное сравнение | Выбор лучшего из двух, происхождение скрыто |
Скрывать происхождение ответов обязательно. Зная, что перед вами ответ дорогой модели, вы найдёте в нём достоинства — это работает даже у тех, кто про эффект знает.
Автоматическую оценку другой моделью на выборке в полсотни примеров использовать не стоит: шума она даёт больше, чем сигнала, и добавляет собственные предпочтения.
Где обычно ошибаются
Пять ловушек, каждая из которых портит результат сравнения незаметно.
Сравнивают на разных промптах. Промпт, отлаженный под одну модель, даёт ей фору. Честное сравнение начинается с одинакового промпта для обеих — и только потом, если модель выбрана, промпт под неё дотачивают.
Смотрят на первый ответ. Модели недетерминированы: два запуска одного запроса дают разные ответы. Сравнивать надо не одиночные ответы, а поведение на выборке.
Забывают про длину. Модель, дающая вдвое более длинные ответы, при симметричной ставке стоит вдвое дороже на выходе — при том же качестве. Это надо учитывать в цене, а не только в качестве.
Останавливаются на «работает». Вопрос не в том, справляется ли модель, а в том, справляется ли модель подешевле. Начинать сравнение стоит снизу, а не сверху.
Сравнивают один раз и навсегда. Каталог меняется еженедельно, ставки — тоже. Решение, принятое полгода назад, почти наверняка уже не оптимально.
Последний пункт стоит превратить в привычку: раз в квартал брать тот же набор из полусотни запросов и прогонять заново. Набор уже собран, процедура известна, занимает это час.
Лестница выбора
Порядок, который экономит и время, и деньги: идти снизу вверх, а не сверху вниз.
- Самая дешёвая позиция каталога. Прогнали набор — справляется? Вопрос закрыт, дальше можно не идти.
- Средняя по цене. Если не справилась дешёвая, поднимаемся на ступень, а не сразу к флагману.
- Флагман. Только когда предыдущие ступени показали, что задача действительно упирается в потолок возможностей.
Разница между верхом и низом каталога кратная — сегодня от 3 до 30 ₽ за миллион токенов. Прыжок сразу на верхнюю ступень означает, что вы платите за возможности, которых, возможно, не требуется.
Есть и нулевая ступень: в живом каталоге бывают модели с нулевой ставкой и обязательным подтверждённым пополнением. Их актуальный состав смотрите на странице моделей, потому что бесплатные маршруты меняются без предупреждения.
Что учесть кроме качества
Четыре фактора, которые решают не реже качества.
Цена на вашем профиле нагрузки. Не ставка за миллион, а стоимость вашего типичного запроса. У моделей с разной ценой входа и выхода профиль решает всё — почему.
Стабильность формата. Модель, которая на девяти запросах из десяти выдаёт корректную структуру, а на десятом ломает парсер, хуже той, что чуть слабее по существу, но предсказуема. Разброс мерится десятью одинаковыми запросами — подробности.
Скорость. Для интерфейса с человеком важнее время до первого символа, для агентской цепочки — общее время шага. Это разные числа, и путать их не стоит.
Доступность маршрута. Модель может быть в каталоге, но с закрытым протоколом. Читать нужно protocols в живой выдаче — разбор кодов отказа.
Как посчитать, стоит ли переплата
Простая арифметика, которая закрывает вопрос.
Возьмите разницу в стоимости вашего типичного запроса между двумя моделями и умножьте на месячный объём. Получится цена перехода на дорогую.
Дальше вопрос ставится честно: окупает ли выигрыш в качестве эту сумму. Если дорогая модель ошибается на два случая из ста реже, а разница в счёте — тысяча рублей в месяц, вопрос сводится к тому, во что вам обходятся эти два случая.
Иногда ответ очевиден: ошибка в юридическом документе дороже любой разницы в ставке. Иногда столь же очевиден обратный: черновая классификация, которую потом смотрит человек, не стоит переплаты вовсе.
Именно так, судя по данным о корпоративных расходах, рынок и рассуждает: флагманские модели собирают заметно меньшую долю объёма, чем можно было бы ожидать по их репутации.
Чего мы не утверждаем
Не утверждаем, что рейтинги бесполезны. Они хороши для широкого сравнения и для составления короткого списка. Плохи как единственное основание.
Не даём порогов достоверности. Пятьдесят примеров — практический ориентир для отсева, а не статистически обоснованный размер выборки.
Не сравниваем конкретные модели. Методика применима к любым; результат зависит от вашей задачи и переносу не подлежит.
Не утверждаем, что дешёвая всегда достаточна. Есть задачи, где разрыв в качестве реален и виден сразу. Мы говорим лишь о том, что проверять это надо, а не предполагать.
Слепое сравнение требует дисциплины. Если ответы размечает тот же человек, который выбирал модели, полностью снять предвзятость не выйдет. Идеально — чтобы размечал кто-то другой.
Что держать в голове
Сравнение на своих данных занимает вечер и стоит рубли. Всё остальное — включая рейтинги и статьи вроде этой — даёт основания для гипотезы, но не для решения.
Порядок простой: короткий список по рейтингу, полсотни реальных запросов, слепое попарное сравнение, затем арифметика переплаты на вашем объёме. И пересмотр раз в квартал, потому что и модели, и цены меняются быстрее, чем принято пересматривать решения.
Как мы отделяем проверенное от предполагаемого — на странице о проекте. Один ключ ко всему каталогу, чтобы сравнить на своих запросах: keydealer.ru/login.
Частые вопросы
Почему нельзя выбирать модель по рейтингу?
Потому что рейтинг измеряет усреднённый результат на чужом наборе задач. Ваша задача узкая, и корреляция между позицией в рейтинге и пригодностью для неё слабая.
Сколько примеров нужно для сравнения?
Для первого отсева хватает 30–50 реальных запросов. Точных цифр это не даёт, но уверенно отличает «справляется» от «не справляется».
Что мерить, если у задачи нет правильного ответа?
Сравнивать попарно: два ответа рядом, выбрать лучший, не зная какая модель какой выдала. Это надёжнее, чем оценивать по отдельности в баллах.
Нужно ли учитывать цену при сравнении?
Обязательно. Правильный вопрос не «какая лучше», а «оправдывает ли разница в качестве разницу в цене на моём объёме».
Как часто пересматривать выбор?
Раз в квартал. Модели выходят постоянно, цены меняются, и решение полугодовой давности почти наверняка уже не оптимально.