Мир ИИ
Astra for Law: вендор пошёл в отраслевые продукты
OpenAI 17 сентября представила Astra for Law: модель GPT-6 Astra плюс юридический поисковый индекс по праву США плюс инструкции под юридический анализ. На замере самой OpenAI связка прошла проверку на корректность на 54,0 % из 200 вопросов против 38,7 % у той же модели с обычным веб-поиском. Прирост в 40 процентов относительно — и одновременно честное напоминание: почти половина вопросов проверку не прошла даже у лучшей конфигурации.
Для нашего читателя это событие интересно не юридической частью, а прецедентом: вендор, который продаёт доступ к моделям, начал продавать готовые отраслевые продукты. Разберём, что именно собрано, что показал замер и что из этого следует тем, кто строит своё на API.
Что собрано в продукт
Три части, и ни одна из них не является новой моделью.
Модель. GPT-6 Astra, та же, что доступна и так.
Поисковый индекс. Прецедентное право США, законы, подзаконные акты, правила судов и решения административных органов — корпус более чем из 230 миллионов адресов с ежедневным пополнением. Отдельно названа работа с некоммерческим Free Law Project, чья коллекция покрывает, по их данным, более 99,9 % опубликованных прецедентных решений судов США.
Инструкции. Правила юридического анализа и письма: отличать позицию суда от попутных замечаний, разбирать ослабляющие аргумент дела, объяснять, как исключение в договоре перераспределяет риск.
То есть это не новая модель, а конфигурация вокруг существующей. Ровно то, что любая команда собирает у себя сама, — только собранное вендором и упакованное в продукт.
Что показал замер
Цифры взяты из анонса OpenAI, то есть это замер вендора о себе. Проверяли на 200 вопросах из закрытой проверочной части Vals AI Legal Research Bench.
| Что мерили | Astra for Law | GPT-6 Astra с веб-поиском |
|---|---|---|
| Прошли общую проверку на корректность | 54,0 % | 38,7 % |
| Найдено эталонных дел | на 24 % больше | базовый уровень |
| Извлечено релевантных фрагментов | до 54 % больше | базовый уровень |
Оба результата — при максимальном уровне усилия рассуждения у обеих систем.
Вывод, который стоит проговорить вслух: 54 % — это лучший результат специально собранной под задачу конфигурации с профильным индексом. Почти половина вопросов проверку не прошла. Это не упрёк продукту, а калибровка ожиданий для всех, кто собирается строить похожее у себя.
Почему для российского читателя тут главное ограничение
Индекс охватывает право США. Для работы с российским правом он бесполезен целиком, а не частично: другая система права, другие источники, другая иерархия актов.
Отсюда практический вывод. Заявленные 54 % — это не характеристика модели, а характеристика связки «модель плюс профильный индекс плюс инструкции» в конкретной юрисдикции. Если вы собираете юридического помощника под российское право, база должна быть ваша, и ни один из этих процентов на неё не переносится. Что вообще можно и чего нельзя поручать модели в работе с договорами, разобрано в материале нейросеть для юриста: договоры.
Что это значит для тех, кто строит на API
Событие двусмысленное, и честно будет показать обе стороны.
Сторона первая: вендор заходит на территорию своих клиентов. Компании, которые собирали отраслевые решения поверх API, получают конкурента с доступом к модели изнутри и к ресурсам, которых у них нет.
Сторона вторая: в анонсе прямо сказано обратное. Клиенты API, названные поимённо, будут строить на этой же основе, а вокруг продукта выкатили партнёрские расширения к инструментам, которыми фирмы уже пользуются. Формулировка вендора — про открытость и дополнение экосистемы, а не про её замену.
Где здесь правда, покажет время. Практический вывод от этого не зависит: устойчиво то, что нельзя воспроизвести за неделю. Модель воспроизводима — её покупают все. Индекс воспроизводим, если есть деньги. Невоспроизводимы ваши данные, ваш процесс и ваше знание отрасли. Строить надо на них, а модель держать сменяемой — про это мы писали в разборе API или готовое решение.
Как устроен доступ
Деталь, которая важнее самой новости для тех, кто планирует бюджет.
Продукт сначала отдают отдельным фирмам через программу доверенного доступа — в интерфейсе ChatGPT и в среде разработки, — а в API обещают позже. То есть на момент анонса это не позиция, которую можно подключить запросом: это продажа через отбор.
Такая схема выката стала обычной, и у неё два следствия. Первое: заявленные цифры получены на конфигурации, к которой у большинства пока нет доступа, — проверить их самостоятельно нельзя. Второе: сроки появления в API не назначены, а значит планировать интеграцию на этот продукт сейчас не на что.
Отдельно названы имена в интерфейсе и в API: в списке моделей позиция называется одним образом, в API — другим. Это мелочь ровно до того момента, пока кто-то не зашьёт имя из интерфейса в код.
Отраслевой продукт против своей сборки
Сравнение полезно провести честно, без перетягивания на свою сторону.
Что даёт готовый отраслевой продукт. Профильный индекс, которого у вас нет и который вы не соберёте. Инструкции, написанные предметниками. Договор с условиями обработки данных под требования отрасли. Работающий результат в день подключения.
Что даёт своя сборка. Ваша база вместо чужой — а для локальной юрисдикции это единственный рабочий вариант. Ваш процесс приёмки. Возможность сменить модель, не переписывая продукт. Расход, который считается по токенам и виден по каждому запросу.
Где граница. Если ваша задача целиком укладывается в то, что вендор упаковал, — берите упакованное, своя сборка проиграет по срокам. Если ключевая часть знания живёт у вас и нигде больше, готовый продукт эту часть не закроет, сколько бы процентов ни показывал бенчмарк.
Практика обычно оказывается посередине: готовое под общее, своё под то, что отличает вас от соседа.
Деталь про конфиденциальность, которую стоит заметить
В анонсе для фирм в программе доверенного доступа обещаны нулевое хранение данных на API и исключение использования корпоративной версии ChatGPT из просмотра людьми по умолчанию.
Вторая формулировка интереснее первой. «Исключено из просмотра людьми по умолчанию» для отдельной программы означает, что в обычном режиме просмотр людьми — часть процесса. Это ровно то, о чём на прошлой неделе писало издание, разобравшее работу подрядчиков с реальными диалогами, и что мы разбирали в материале люди читают переписки с ChatGPT.
Практический вывод не меняется: режим обработки данных смотрят в условиях конкретного тарифа, а не предполагают по умолчанию. Что из рабочих данных вообще нельзя отправлять наружу — в материале коммерческая тайна и нейросети.
Чего мы не утверждаем
Три оговорки.
Все цифры — замер вендора о себе. Независимой проверки нет, закрытая часть бенчмарка на то и закрытая. Мы приводим их как заявление, а не как установленный факт.
Мы не оцениваем сравнение с чужими моделями. В анонсе есть пример, где конкурирующая модель, по утверждению OpenAI, сослалась на отменённое решение. Это утверждение одной стороны о другой, и без доступа к полному протоколу оно ничего не доказывает.
Мы не знаем, когда и на каких условиях это появится в API. Сказано «скоро», и придумывать срок мы не станем.
Что из этого забрать себе
Три вещи, и ни одна не требует отраслевого продукта.
Профильный индекс важнее модели. Разница между 38,7 % и 54,0 % получена не сменой модели, а добавлением источника и инструкций. У вас тот же рычаг: своя база даёт больше прироста, чем переезд на позицию подороже.
Инструкции — это часть продукта, а не настройка. «Отличать позицию суда от попутных замечаний» — не строчка в промпте, а формализованное знание предметника. Без него связка не работает.
Считайте долю непройденных проверок. Если у лучшей отраслевой сборки почти половина вопросов не проходит критерий, ваш собственный критерий приёмки должен существовать до запуска, а не после первой жалобы.
Проверять такие связки удобнее там, где смена позиции ничего не стоит: KeyDealer даёт один ключ на 56 позиций каталога, 43 из которых доступны сейчас, с оплатой российской картой в рублях и ставками от 1 ₽ за миллион токенов. Обычная gpt-6-astra в каталоге есть по 60 ₽ за миллион; отраслевой сборки в нём нет, и это не оговорка, а факт — она живёт у вендора отдельным продуктом.
Что держать в голове
Первое. Вендоры двинулись из платформы в готовые решения, и это будет повторяться в других отраслях. Обсуждать стоит не обиду, а вывод: то, что легко упаковать, упакуют без вас.
Второе. 54 % на лучшей конфигурации — самая полезная цифра этого анонса. Она задаёт трезвый уровень ожиданий от любой похожей системы, включая вашу.
Третье. Юрисдикция — не деталь. Индекс по чужому праву не делает модель полезной в вашем, сколько бы процентов ни было в пресс-релизе. Что мы за проект и как проверяем факты — на странице о проекте, ключ заводится на keydealer.ru/login.
Частые вопросы
Что представила OpenAI 17 сентября?
Astra for Law — связку из модели GPT-6 Astra, юридического поискового индекса и инструкций под юридический анализ и письмо. Доступ сначала даётся отдельным фирмам через программу доверенного доступа в ChatGPT и Codex, в API обещан позже. В интерфейсе позиция называется GPT-6 Astra Law.
Насколько эта связка точнее обычной модели?
По замеру самой OpenAI на 200 вопросах из закрытой части Vals AI Legal Research Bench: 54,0 % вопросов прошли проверку на корректность против 38,7 % у GPT-6 Astra с обычным веб-поиском. Это относительный прирост около 40 процентов — и одновременно значит, что почти половина вопросов проверку не прошла.
Подходит ли это для российского права?
Нет. Поисковый индекс охватывает право США — прецеденты, законы, подзаконные акты, правила судов и решения административных органов. Для работы с российским правом этот индекс бесполезен, и переносить заявленные цифры на другую юрисдикцию нельзя.
Что это значит для тех, кто строит своё на API?
Что вендор начал продавать готовое в вертикалях, оставаясь при этом платформой: в анонсе прямо сказано, что клиенты API вроде Harvey и Legora будут строить на этой же основе. То есть конкуренция и партнёрство идут одновременно, и опираться стоит на то, что нельзя воспроизвести за неделю, — на свои данные и свой процесс.
Есть ли Astra for Law в каталоге KeyDealer?
Нет. В каталоге 56 позиций, среди них gpt-6-astra как обычная модель. Отраслевая сборка — отдельный продукт вендора с собственным доступом, и в общий каталог она не входит.
Что там про конфиденциальность?
Для фирм в программе доверенного доступа обещаны нулевое хранение данных на API и исключение использования корпоративной версии ChatGPT из просмотра людьми по умолчанию. Формулировка «по умолчанию исключено» важна сама по себе: она подтверждает, что в обычном режиме просмотр людьми — часть процесса.