Мир ИИ
Биофильтр Anthropic не работал 11 месяцев
Anthropic опубликовала отчёт о рисках за август 2026 и призналась в дыре, которую нашла у себя сама. С мая 2025 по апрель 2026 — одиннадцать месяцев — весь трафик платформ, где подрядчики размечают ответы моделей, шёл без блокирующих биологических классификаторов. Это около 133 млн обменов от примерно 50 000 человек, которых проверяли только вендоры, а часть вендоров не имела скрининга даже против самых слабых профильных угроз. Причина прозаическая: флаг, задуманный для внутреннего использования, отключал не только блокировку, но и запись срабатываний, поэтому в системы контроля не уходило ничего. Проверять пришлось задним числом: по всем репликам за период прогнали Claude Sonnet 5 в роли грейдера, получили 1197 подозрительных стенограмм, разобрали их и явных злоупотреблений не нашли. Клиентов API это не касалось — и об этом в отчёте есть отдельная сноска. Разбираем, что произошло и что из этой истории стоит проверить в собственном коде.
Что именно сломалось у Anthropic
Блокирующие биологические классификаторы не запускались на платформах сбора обратной связи — там, где подрядчики внешних вендоров данных общаются с моделями и оценивают ответы. Часть этой работы требует доступа к моделям, ещё не выпущенным публично.
Отсчёт идёт с мая 2025 — с первого развёртывания моделей, у которых вообще появились профильные защиты. То есть механизм не сломался посреди пути: он там не работал никогда, вплоть до апреля 2026.
Механика сбоя описана в отчёте прямо. Трафик управлялся флагом, предназначенным только для внутреннего использования. Флаг выключал у классификаторов и блокирующее поведение, и логирование пометок. Запрос, который в норме был бы помечен, не записывался и не попадал ни в один механизм разбора. Сам детектор был исправен. Не было способа заметить, что его выключили.
Подавляющее большинство этой аудитории имело доступ к свободному диалогу с моделями, а не к урезанному интерфейсу вида «оцените готовый ответ».
Почему это не задело клиентов API
Прямая цитата отчёта в сноске к таблице оценок: влияния на клиентов не было. Коммерческий API — отдельный контур, там классификаторы работали.
Стоит проговорить это явно, потому что заголовки в лентах звучат так, будто у Anthropic одиннадцать месяцев были открыты ворота. Открыт был вход в лабораторию, а не касса. Разница существенная: в этот контур попадали люди, нанятые вендорами для разметки, с идентификацией на стороне вендора и рабочим заданием.
Проблема в том, что вендорский скрининг был слабым. Отчёт признаёт, что многие вендоры не имели процессов, способных остановить даже наименее подготовленного профильного злоумышленника, — и что до апреля 2026 попасть на роль red teamer через одного из вендоров было бы, по оценке самой Anthropic, не особенно трудно.
Как проверяли 133 млн диалогов
Проверку сделали моделью: по всем человеческим репликам за период прогнали Claude Sonnet 5 с промптом-грейдером, оценивающим реплику на предмет опасной биологической информации.
Было по чему прогонять. Стенограммы сохранились почти по всему объёму — исключение только одна платформа, дающая около 1% трафика, где терялись диалоги, которые пользователь не отправил кнопкой.
| Что считали | Сколько |
|---|---|
| Помечено как «высокий» риск | 1197 стенограмм |
| Из них от внутренних команд Anthropic | 757 |
| Из остатка — заказанный red teaming | все, кроме 62 |
| Разобрано вручную | все 62 плюс случайные 30 из red teaming |
| Найдено явных злоупотреблений | нет |
Две цифры про длину дают представление о характере трафика: самая длинная внешняя стенограмма с помеченными запросами занимала 240 тысяч токенов, а 75-й процентиль длины — 2102 токена. То есть почти всё это короткие разговоры.
Anthropic честно оговаривает слабость метода: промпт грейдера изначально писался для оценки многоходового обмена целиком, а прогнали его по изолированным репликам человека.
Что изменилось в оценке риска после находки
Anthropic пересмотрела задним числом собственную прошлую публичную оценку. В феврале 2026 года риск по этому направлению был описан как «очень низкий». Теперь, зная про дыру, компания переоценивает февральское состояние как «низкий». Публичный документ полугодовой давности объявлен слишком оптимистичным. Ничего нового при этом не случилось. Просто уверенности в описанной картине стало меньше.
Формулировка в итоговой таблице звучит так: обнаружение этого пробела снизило уверенность в том, что похожих пробелов больше нет.
Это редкий по нынешним временам жанр. Обычно отраслевой отчёт о безопасности читается как перечень достижений. Здесь вендор публикует то, что работает против его же маркетинга, и делает это на фоне подготовки к выходу на биржу. Дарио Амодей неделей раньше говорил про кризис доверия к отрасли — этот отчёт как раз выглядит попыткой отвечать делом.
Второй инцидент: как подрядчики достали ключ
В том же отчёте описан второй случай, и он связан с первым. В апреле 2026 года по внешнему сообщению Anthropic подтвердила: несколько подрядчиков у вендоров разметки использовали свой легальный доступ, чтобы через уязвимость одной из платформ сбора данных получить API-ключ и общаться с моделями за пределами своих задач. В числе доступных оказалась Mythos Preview — модель, которая как раз работала без блокирующих биоклассификаторов.
Хронология в отчёте: путь доступа существовал несколько недель, из них около двух недель была достижима Mythos Preview. Активность локализовали в течение 90 минут после получения сигнала, отключив системы и аннулировав вендорские учётные данные. Саму уязвимость закрыли в день сообщения.
Что не пострадало, тоже перечислено: веса моделей, данные клиентов, сети и ключевые системы Anthropic. Доступ шёл через среду стороннего вендора, а не через продакшн-API.
Отдельная деталь из раздела про разведку угроз: Anthropic нанимает вендоров, которые мониторят даркнет на предмет утечек ключей. Утечки ключей находились, но ни одна не была связана с организациями, у которых есть официальное исключение из биоклассификаторов. Единственная утечка, связанная с этой историей, — ключ из инцидента выше.
Когда вышел отчёт и какой период он покрывает
Отчёт выпускается по политике ответственного масштабирования, сейчас версии 3.4. Дата покрытия — 15 июля 2026 года, документ описывает период с публикации предыдущего отчёта 24 февраля. Формат новый, и по нему теперь можно сравнивать вендоров между собой. Публичная версия редактируется, но сам факт редактуры и её объём политика требует раскрывать: в этом выпуске из версии для сотрудников убран только раздел про процесс разработки.
Неотредактированная версия расходится минимум на 200 сотрудников. Долгосрочный трест может потребовать внешнюю проверку отчёта и утверждает выбор проверяющих; пилотные внешние проверки прошлого отчёта делали METR и SecureBio.
Обратите внимание на инженерную деталь. Оба инцидента — про контроль доступа, а не про то, что модель повела себя плохо. Ровно та же природа была у трёх случаев на кибероценках, которые Anthropic разобрала в июле: дело было в обвязке вокруг весов.
Что классификатор делает в вашем коде
Классификатор — это поведение, которое ваш код увидит своими глазами. По документации Anthropic встроенные классификаторы безопасности есть у Claude Fable 5 и Claude Opus 5, и отчёт добавляет, что у Fable 5 покрытие блокирующих классификаторов шире.
Отказ приходит успешным ответом HTTP 200 со stop_reason: "refusal", а не ошибкой. Разбор этого механизма с примерами и тремя способами fallback у нас уже есть в материале про приезд Fable 5 в каталог, поэтому здесь только то, что важно для сегодняшней темы: у отказа есть объект stop_details, и в нём названа категория.
| Категория | Что за ней стоит |
|---|---|
cyber | Запрос может помочь навредить в кибербезопасности. Легальная работа по безопасности тоже иногда попадает сюда |
bio | Биологический вред. Полезная работа в науках о жизни тоже может сработать |
frontier_llm | Помощь в разработке конкурирующих моделей, это ограничено коммерческими условиями Anthropic |
reasoning_extraction | Просьба воспроизвести внутренние рассуждения в тексте ответа |
general_harms | Прочие области, признанные вредными |
Оба поля могут быть null — это нормальное постоянное значение для отказа без названной категории, а не заглушка. У всех остальных stop_reason объект stop_details равен null всегда.
Про деньги: за отказ, пришедший до генерации выхода, счёт не выставляется, но лимит частоты запрос расходует. Отказ посреди стрима оплачивается — вход и уже отданный выход по обычным ставкам.
И зеркальная сторона той же истории: модели, у которых фильтров нет вовсе, тоже существуют, но раздаются штучно и по проверке организации, а не запроса. Про это мы писали, когда OpenAI открыла программу Daybreak.
Что проверить в своей интеграции сегодня
Мораль отчёта для вас не «Anthropic ненадёжна», а «предохранитель может молчать, и узнать об этом снаружи нельзя». Отсюда четыре вещи, которые проверяются за полчаса.
- Не считайте HTTP 200 синонимом ответа. Читайте
stop_reason(в Messages API) илиfinish_reason(в Chat Completions) на каждом ответе. Код, который берёт первый текстовый блок и отдаёт его в интерфейс, на отказе покажет пустоту без единой записи в логе. - Логируйте категорию отказа. Поле
stop_details.category— это ваш собственный детектор того, что модель начала резать легальную задачу. Всплескcyberу команды, пишущей сканер уязвимостей, илиbioу медицинского продукта виден только в вашей статистике: у вендора ваша выборка не отделена от чужих. - Держите вторую модель наготове. Отказ по классификатору — не проблема качества, и на другой модели тот же запрос обычно проходит. В каталоге KeyDealer
opus-5идёт по 30 ₽ за миллион входных и столько же за миллион выходных токенов,haiku-4-5иsonnet-4-6— заметно дешевле. Рублёвые ставки по всем семействам собраны в разборе стоимости миллиона токенов. - Разведите права инструментов и ключи. Отчёт показывает, откуда приходит реальный ущерб: из доступа, который построен вокруг модели. Что именно ограничивать агенту, разобрано отдельно в материале про права агента.
Честная оговорка про наш маршрут. У opus-5 в каталоге протокол anthropic_messages открыт, а anthropic_messages, anthropic_streaming, anthropic_tools и работа с результатами инструментов имеют статус verified на 12 августа 2026 года. Но отдельной публичной пробы сценария stop_reason: refusal через маршрут KeyDealer не проводилось, поэтому утверждать, что отказ доедет до вас ровно в описанном виде, мы не будем. Кэш промптов у всех позиций каталога помечен unsupported — скидки за него нет.
Чего в отчёте нет
В отчёте нет трёх вещей, и это стоит знать до того, как вы начнёте его цитировать. Нет числа подрядчиков в разбивке по вендорам: коммерчески чувствительная часть про масштаб этой популяции отредактирована. Нет и точного момента обнаружения — сказано «вскоре после того, как узнали, в апреле 2026», без даты.
Нет ответа на главный вопрос, который отчёт сам же ставит. Anthropic пишет, что находка повышает вероятность существования других, ещё неизвестных ей пробелов такого же рода. Сколько их и где — не знает никто, включая её саму. Февральский отчёт вообще не рассматривал платформы обратной связи как поверхность риска и не делал про их контроль никаких утверждений — ни в одну, ни в другую сторону.
Полезнее итога здесь метод. Вендор описал свой контур доступа, нашёл в нём место, где предохранитель молчал, и опубликовал это вместе с пересмотром прошлой оценки. Такой документ можно спросить со всех остальных.
Ставки и статусы каждой модели в рублях видны в живой выдаче GET /v1/models и в кабинете. Ключ, чтобы посмотреть самому, берётся на keydealer.ru/login — рубли, оплата картой, один OpenAI-совместимый эндпоинт на все семейства каталога.
Частые вопросы
Что именно не работало у Anthropic?
Блокирующие биологические классификаторы на платформах, где подрядчики размечают и оценивают ответы моделей. С мая 2025 по апрель 2026 весь трафик этих платформ шёл без них.
Сколько диалогов это затронуло?
Около 133 млн обменов от примерно 50 000 человек, которых проверяли только сами подрядные вендоры.
Задело ли это клиентов API?
Нет. Anthropic отдельной сноской пишет, что влияния на клиентов не было: сбой касался внутренних платформ сбора обратной связи, а не коммерческого API.
Нашли ли реальные злоупотребления?
Нет. Автоматическая проверка пометила 1197 стенограмм как высокорисковые, из них 757 пришлись на внутренние команды Anthropic, а из остатка все, кроме 62, — на заказанный red teaming. Все 62 разобрали вручную и явных злоупотреблений не увидели.
Как классификатор проявляется в API?
Отказ приходит успешным ответом HTTP 200 с stop_reason refusal и объектом stop_details, где названа категория: cyber, bio, frontier_llm, reasoning_extraction или general_harms.
У каких моделей Claude есть классификаторы?
Документация Anthropic называет Claude Fable 5 и Claude Opus 5. Для Fable 5 в отчёте отдельно сказано, что покрытие блокирующих классификаторов шире.
Когда вышел отчёт и какой период он покрывает?
Отчёт о рисках за август 2026 года выпущен по политике ответственного масштабирования версии 3.4. Дата покрытия 15 июля 2026 года, документ описывает период с публикации предыдущего отчёта 24 февраля 2026 года.
Берут ли деньги за отказ?
За отказ, пришедший до генерации выхода, счёт не выставляется, но запрос всё равно расходует лимит частоты. Отказ посреди стрима оплачивается по входу и уже отданному выходу.