Мир ИИ

Astra for Law: вендор пошёл в отраслевые продукты

Astra for Law: вендор пошёл в отраслевые продукты

OpenAI 17 сентября представила Astra for Law: модель GPT-6 Astra плюс юридический поисковый индекс по праву США плюс инструкции под юридический анализ. На замере самой OpenAI связка прошла проверку на корректность на 54,0 % из 200 вопросов против 38,7 % у той же модели с обычным веб-поиском. Прирост в 40 процентов относительно — и одновременно честное напоминание: почти половина вопросов проверку не прошла даже у лучшей конфигурации.

Для нашего читателя это событие интересно не юридической частью, а прецедентом: вендор, который продаёт доступ к моделям, начал продавать готовые отраслевые продукты. Разберём, что именно собрано, что показал замер и что из этого следует тем, кто строит своё на API.

Что собрано в продукт

Три части, и ни одна из них не является новой моделью.

Модель. GPT-6 Astra, та же, что доступна и так.

Поисковый индекс. Прецедентное право США, законы, подзаконные акты, правила судов и решения административных органов — корпус более чем из 230 миллионов адресов с ежедневным пополнением. Отдельно названа работа с некоммерческим Free Law Project, чья коллекция покрывает, по их данным, более 99,9 % опубликованных прецедентных решений судов США.

Инструкции. Правила юридического анализа и письма: отличать позицию суда от попутных замечаний, разбирать ослабляющие аргумент дела, объяснять, как исключение в договоре перераспределяет риск.

То есть это не новая модель, а конфигурация вокруг существующей. Ровно то, что любая команда собирает у себя сама, — только собранное вендором и упакованное в продукт.

Что показал замер

Цифры взяты из анонса OpenAI, то есть это замер вендора о себе. Проверяли на 200 вопросах из закрытой проверочной части Vals AI Legal Research Bench.

Что мерилиAstra for LawGPT-6 Astra с веб-поиском
Прошли общую проверку на корректность54,0 %38,7 %
Найдено эталонных делна 24 % большебазовый уровень
Извлечено релевантных фрагментовдо 54 % большебазовый уровень

Оба результата — при максимальном уровне усилия рассуждения у обеих систем.

Вывод, который стоит проговорить вслух: 54 % — это лучший результат специально собранной под задачу конфигурации с профильным индексом. Почти половина вопросов проверку не прошла. Это не упрёк продукту, а калибровка ожиданий для всех, кто собирается строить похожее у себя.

Почему для российского читателя тут главное ограничение

Индекс охватывает право США. Для работы с российским правом он бесполезен целиком, а не частично: другая система права, другие источники, другая иерархия актов.

Отсюда практический вывод. Заявленные 54 % — это не характеристика модели, а характеристика связки «модель плюс профильный индекс плюс инструкции» в конкретной юрисдикции. Если вы собираете юридического помощника под российское право, база должна быть ваша, и ни один из этих процентов на неё не переносится. Что вообще можно и чего нельзя поручать модели в работе с договорами, разобрано в материале нейросеть для юриста: договоры.

Что это значит для тех, кто строит на API

Событие двусмысленное, и честно будет показать обе стороны.

Сторона первая: вендор заходит на территорию своих клиентов. Компании, которые собирали отраслевые решения поверх API, получают конкурента с доступом к модели изнутри и к ресурсам, которых у них нет.

Сторона вторая: в анонсе прямо сказано обратное. Клиенты API, названные поимённо, будут строить на этой же основе, а вокруг продукта выкатили партнёрские расширения к инструментам, которыми фирмы уже пользуются. Формулировка вендора — про открытость и дополнение экосистемы, а не про её замену.

Где здесь правда, покажет время. Практический вывод от этого не зависит: устойчиво то, что нельзя воспроизвести за неделю. Модель воспроизводима — её покупают все. Индекс воспроизводим, если есть деньги. Невоспроизводимы ваши данные, ваш процесс и ваше знание отрасли. Строить надо на них, а модель держать сменяемой — про это мы писали в разборе API или готовое решение.

Как устроен доступ

Деталь, которая важнее самой новости для тех, кто планирует бюджет.

Продукт сначала отдают отдельным фирмам через программу доверенного доступа — в интерфейсе ChatGPT и в среде разработки, — а в API обещают позже. То есть на момент анонса это не позиция, которую можно подключить запросом: это продажа через отбор.

Такая схема выката стала обычной, и у неё два следствия. Первое: заявленные цифры получены на конфигурации, к которой у большинства пока нет доступа, — проверить их самостоятельно нельзя. Второе: сроки появления в API не назначены, а значит планировать интеграцию на этот продукт сейчас не на что.

Отдельно названы имена в интерфейсе и в API: в списке моделей позиция называется одним образом, в API — другим. Это мелочь ровно до того момента, пока кто-то не зашьёт имя из интерфейса в код.

Отраслевой продукт против своей сборки

Сравнение полезно провести честно, без перетягивания на свою сторону.

Что даёт готовый отраслевой продукт. Профильный индекс, которого у вас нет и который вы не соберёте. Инструкции, написанные предметниками. Договор с условиями обработки данных под требования отрасли. Работающий результат в день подключения.

Что даёт своя сборка. Ваша база вместо чужой — а для локальной юрисдикции это единственный рабочий вариант. Ваш процесс приёмки. Возможность сменить модель, не переписывая продукт. Расход, который считается по токенам и виден по каждому запросу.

Где граница. Если ваша задача целиком укладывается в то, что вендор упаковал, — берите упакованное, своя сборка проиграет по срокам. Если ключевая часть знания живёт у вас и нигде больше, готовый продукт эту часть не закроет, сколько бы процентов ни показывал бенчмарк.

Практика обычно оказывается посередине: готовое под общее, своё под то, что отличает вас от соседа.

Деталь про конфиденциальность, которую стоит заметить

В анонсе для фирм в программе доверенного доступа обещаны нулевое хранение данных на API и исключение использования корпоративной версии ChatGPT из просмотра людьми по умолчанию.

Вторая формулировка интереснее первой. «Исключено из просмотра людьми по умолчанию» для отдельной программы означает, что в обычном режиме просмотр людьми — часть процесса. Это ровно то, о чём на прошлой неделе писало издание, разобравшее работу подрядчиков с реальными диалогами, и что мы разбирали в материале люди читают переписки с ChatGPT.

Практический вывод не меняется: режим обработки данных смотрят в условиях конкретного тарифа, а не предполагают по умолчанию. Что из рабочих данных вообще нельзя отправлять наружу — в материале коммерческая тайна и нейросети.

Чего мы не утверждаем

Три оговорки.

Все цифры — замер вендора о себе. Независимой проверки нет, закрытая часть бенчмарка на то и закрытая. Мы приводим их как заявление, а не как установленный факт.

Мы не оцениваем сравнение с чужими моделями. В анонсе есть пример, где конкурирующая модель, по утверждению OpenAI, сослалась на отменённое решение. Это утверждение одной стороны о другой, и без доступа к полному протоколу оно ничего не доказывает.

Мы не знаем, когда и на каких условиях это появится в API. Сказано «скоро», и придумывать срок мы не станем.

Что из этого забрать себе

Три вещи, и ни одна не требует отраслевого продукта.

Профильный индекс важнее модели. Разница между 38,7 % и 54,0 % получена не сменой модели, а добавлением источника и инструкций. У вас тот же рычаг: своя база даёт больше прироста, чем переезд на позицию подороже.

Инструкции — это часть продукта, а не настройка. «Отличать позицию суда от попутных замечаний» — не строчка в промпте, а формализованное знание предметника. Без него связка не работает.

Считайте долю непройденных проверок. Если у лучшей отраслевой сборки почти половина вопросов не проходит критерий, ваш собственный критерий приёмки должен существовать до запуска, а не после первой жалобы.

Проверять такие связки удобнее там, где смена позиции ничего не стоит: KeyDealer даёт один ключ на 56 позиций каталога, 43 из которых доступны сейчас, с оплатой российской картой в рублях и ставками от 1 ₽ за миллион токенов. Обычная gpt-6-astra в каталоге есть по 60 ₽ за миллион; отраслевой сборки в нём нет, и это не оговорка, а факт — она живёт у вендора отдельным продуктом.

Что держать в голове

Первое. Вендоры двинулись из платформы в готовые решения, и это будет повторяться в других отраслях. Обсуждать стоит не обиду, а вывод: то, что легко упаковать, упакуют без вас.

Второе. 54 % на лучшей конфигурации — самая полезная цифра этого анонса. Она задаёт трезвый уровень ожиданий от любой похожей системы, включая вашу.

Третье. Юрисдикция — не деталь. Индекс по чужому праву не делает модель полезной в вашем, сколько бы процентов ни было в пресс-релизе. Что мы за проект и как проверяем факты — на странице о проекте, ключ заводится на keydealer.ru/login.

Частые вопросы

Что представила OpenAI 17 сентября?

Astra for Law — связку из модели GPT-6 Astra, юридического поискового индекса и инструкций под юридический анализ и письмо. Доступ сначала даётся отдельным фирмам через программу доверенного доступа в ChatGPT и Codex, в API обещан позже. В интерфейсе позиция называется GPT-6 Astra Law.

Насколько эта связка точнее обычной модели?

По замеру самой OpenAI на 200 вопросах из закрытой части Vals AI Legal Research Bench: 54,0 % вопросов прошли проверку на корректность против 38,7 % у GPT-6 Astra с обычным веб-поиском. Это относительный прирост около 40 процентов — и одновременно значит, что почти половина вопросов проверку не прошла.

Подходит ли это для российского права?

Нет. Поисковый индекс охватывает право США — прецеденты, законы, подзаконные акты, правила судов и решения административных органов. Для работы с российским правом этот индекс бесполезен, и переносить заявленные цифры на другую юрисдикцию нельзя.

Что это значит для тех, кто строит своё на API?

Что вендор начал продавать готовое в вертикалях, оставаясь при этом платформой: в анонсе прямо сказано, что клиенты API вроде Harvey и Legora будут строить на этой же основе. То есть конкуренция и партнёрство идут одновременно, и опираться стоит на то, что нельзя воспроизвести за неделю, — на свои данные и свой процесс.

Есть ли Astra for Law в каталоге KeyDealer?

Нет. В каталоге 56 позиций, среди них gpt-6-astra как обычная модель. Отраслевая сборка — отдельный продукт вендора с собственным доступом, и в общий каталог она не входит.

Что там про конфиденциальность?

Для фирм в программе доверенного доступа обещаны нулевое хранение данных на API и исключение использования корпоративной версии ChatGPT из просмотра людьми по умолчанию. Формулировка «по умолчанию исключено» важна сама по себе: она подтверждает, что в обычном режиме просмотр людьми — часть процесса.

Источники