Мир ИИ
Claude спроектировал белки для 14 мишеней из 15
Anthropic опубликовала результаты кампании по проектированию белковых связывателей, в которой модель вела вычислительный конвейер автономно. Итог: успех против 14 мишеней из 15 в лабораторной проверке, 354 подтверждённых связывателя из 1320 спроектированных вариантов. Доля попаданий составила 26,7% у Mythos Preview и 22,6% у Opus 4.8 за 48-часовую сессию, а при сосредоточении на одной мишени за сутки поднималась до 35,1% — против типичных для отрасли 10–15%. Человек участвовал в начале: стартовый промпт примерно на 30 тысяч токенов написал эксперт. Дальше модель работала с публично доступными специализированными инструментами сама. Разбираем, что здесь действительно новое, и почему доступ к таким задачам ограничен даже у самого вендора.
Что такое белковый связыватель
Коротко о предметной области, потому что без неё непонятно, что именно измеряли.
Связыватель — это белок, спроектированный так, чтобы прицельно прикрепляться к заданной мишени: другому белку, участку клетки, молекуле. На этом принципе строятся лекарства, диагностические тесты и исследовательские инструменты.
Задача трудна тем, что свойства белка определяются его пространственной формой, а форма — последовательностью аминокислот. Связь между последовательностью и формой не выводится простым расчётом, вариантов астрономически много, и проверка каждого требует лабораторной работы.
Отсюда и смысл доли попаданий: из скольких спроектированных вариантов хоть один действительно прикрепился к мишени в пробирке. Типичные 10–15% означают, что большинство идей не работает, и цена перебора — это реальное лабораторное время.
Что именно сделала модель
Важное уточнение, без которого заголовок читается неверно: модель не изобретала новую науку и не заменяла специализированные инструменты.
Инструменты для проектирования белков существуют и общедоступны. Задача, которую решала модель, — управление процессом: что попробовать, как оценить промежуточный результат, что менять дальше, когда остановиться. То есть роль исследователя, ведущего вычислительную кампанию, а не роль самого метода.
Это ровно тот класс задач, который мы называем агентским: многошаговая работа с инструментами, где каждый следующий шаг зависит от результата предыдущего. Разница с обычными агентскими сценариями — в цене шага и в том, что проверка результата происходит в лаборатории, а не в коде.
Стартовый промпт на 30 тысяч токенов тоже стоит отметить. Это не «попроси модель придумать белок» — это подробная постановка задачи, написанная человеком, который знает предмет. Автономность начинается после неё.
Почему цифры выглядят убедительно
Три признака, отличающие этот результат от типичного анонса.
Проверка физическая, а не бенчмарком. Связыватель либо прикрепился в пробирке, либо нет. Здесь нет вопросов о методике оценки, которые преследуют сравнения языковых моделей.
Есть отрицательный результат. Одна мишень из пятнадцати не поддалась, и об этом сказано. Кампания, где получилось всё, вызывала бы больше вопросов, чем доверия.
Приведён знаменатель. 354 из 1320 — видно и числитель, и общее число попыток. Заявление «модель спроектировала 354 работающих белка» без второго числа не значило бы ничего.
Разница между 26,7% и 35,1% в зависимости от того, распыляется модель на пятнадцать мишеней или работает над одной, — тоже честная деталь. Она показывает, что автономность имеет цену: сфокусированная работа эффективнее.
Где здесь ограничение
Anthropic отдельно указывает, что задачи дизайна белков и другие исследования в науках о жизни ограничены в её самой сильной модели, пока разрабатываются меры безопасности для рисков двойного назначения.
Формулировка знакомая. Проектирование связывателя, который лечит, и проектирование связывателя, который вредит, — технически одна и та же работа. Различить их по тексту запроса нельзя, потому что запрос выглядит одинаково.
Мы разбирали, как отрасль отвечает на это в другой области: OpenAI вынесла киберзадачи в программу с проверкой заявителя, а Z.ai придержала веса, когда способности выросли быстрее ожидаемого. Здесь третий вариант того же ответа: возможность есть, доступ ограничен, критерии выдачи разрабатываются.
Практический вывод для читателя простой и неутешительный: повторить это через обычный API нельзя, и это ограничение осознанное, а не техническое.
Почему это ложится в разговор о доверии
Отдельное наблюдение, связывающее новость с тем, о чём та же компания говорила тремя днями раньше.
Глава Anthropic на прошлой неделе назвал негативное отношение к ИИ кризисом доверия и признал, что самая справедливая претензия к отрасли — что обещанной пользы миру она пока не принесла. И добавил, что убедить людей помогли бы конкретные результаты вроде реального лечения болезней, а не заверения.
Публикация про белковые связыватели — очевидная попытка предъявить именно такой результат. Это не упрёк: если компания говорит, что нужны конкретные достижения, и через несколько дней показывает конкретное достижение, последовательность как раз в порядке.
Но стоит держать пропорцию. Проверяемый лабораторный результат — это заметно больше, чем очередной бенчмарк, и заметно меньше, чем вылеченная болезнь. Расстояние между ними измеряется годами клинических испытаний, и сокращается оно не скоростью проектирования.
Осторожная формулировка, которая тут уместна: ускорение ранней стадии исследований — реальная и полезная вещь. Обещание изменить медицину на этом основании — пока обещание.
Что означает «ограничено в самой сильной модели»
Формулировка требует расшифровки, потому что она устроена тоньше, чем запрет.
Ограничение не означает, что модель не умеет. Оно означает, что вендор осознанно не даёт применять умение через обычный доступ, пока не выработаны критерии, кому и на каких условиях его открывать.
Такая конструкция появляется, когда способность растёт быстрее, чем механизм её выдачи. Вариантов ответа у отрасли ровно три, и все три мы наблюдали в августе: проверять заявителя, откладывать публикацию и ограничивать тематику. Четвёртого — фильтровать по тексту запроса — не существует, потому что защитная и опасная постановка задачи формулируются одинаково.
Для пользователя это означает практическую вещь: набор доступных возможностей у модели определяется не только техникой, но и решениями вендора, которые могут меняться в обе стороны. Проверять, что именно доступно сегодня, стоит в документации и в живой выдаче, а не по анонсам полугодовой давности.
Что из этого применимо к обычным задачам
Три наблюдения, которые переносятся за пределы биологии.
Автономность окупается там, где проверка объективна. Модель может вести многошаговую работу сама, если после каждого шага есть однозначный ответ, получилось или нет. В биологии это лаборатория, в программировании — тесты, в разборе документов — сверка полей. Там, где качество субъективно, автономный цикл разваливается.
Стартовый промпт — это работа эксперта, а не формальность. Тридцать тысяч токенов постановки задачи стоят дороже, чем вся последующая генерация. Мы разбирали похожее в материале про то, чему учат опубликованные системные промпты: качество промпта определяет результат сильнее выбора модели.
Фокус лучше широты. Прирост с 26,7% до 35,1% при сосредоточении на одной мишени — прямое указание на то, как строить агентские сценарии: одна задача за раз, а не всё сразу.
Стоимость такой работы, кстати, считается по тем же правилам, что и любая агентская: 48-часовая сессия — это тысячи обращений с растущей историей. Как прикинуть бюджет — в разборе стоимости агента в месяц.
Чего мы не утверждаем
Мы не проверяли результаты. Все цифры — из публикации Anthropic и материалов по ссылкам в источниках. Независимого воспроизведения на момент публикации нет.
Это не лекарство. Связыватель, сработавший в пробирке, отделён от препарата годами испытаний. Между «прикрепился к мишени» и «помогает пациенту» лежит вся клиническая разработка.
Mythos Preview в нашем каталоге нет. Из упомянутых моделей у нас доступна opus-4-8 по 40 ₽ за миллион токенов, но задачи в науках о жизни ограничены на стороне вендора независимо от того, как вы к модели обращаетесь.
Мы не оцениваем научную значимость. Для этого нужны специалисты в предметной области, а не разбор от сервиса доступа к моделям.
Что держать в голове
Модель автономно вела кампанию по проектированию белковых связывателей и получила подтверждённый результат по 14 мишеням из 15, с долей попаданий заметно выше типичной для отрасли. Человек написал постановку задачи, дальше работа шла без научного руководства.
Практическое для вас — не про биологию, а про устройство агентских сценариев: автономность работает там, где после каждого шага есть объективная проверка, и работает лучше, когда задача одна.
Как мы отделяем проверенное от предполагаемого — на странице о проекте. Модели каталога, включая Opus 4.8, доступны по одному ключу: keydealer.ru/login.
Частые вопросы
Что именно сделала модель?
Спроектировала белковые связыватели, успешно сработавшие против 14 мишеней из 15 в лабораторной проверке. Из 1320 вариантов подтвердились 354.
Модель работала сама?
По описанию Anthropic, агент вёл вычислительный конвейер автономно, без научного руководства в ходе выполнения. Стартовый промпт примерно на 30 тысяч токенов написал человек-эксперт.
Какие модели участвовали?
Mythos Preview и Opus 4.8. Доля попаданий за 48-часовую сессию — 26,7% и 22,6% соответственно; при сосредоточении на одной мишени за 24 часа у Mythos Preview она доходила до 35,1%.
Это много?
Для сравнения, в описании указано, что типичная доля попаданий в современных кампаниях по дизайну белков составляет 10–15%.
Можно ли повторить это через API?
Задачи дизайна белков и другие исследования в науках о жизни ограничены в самой сильной модели вендора, пока разрабатываются меры безопасности для рисков двойного назначения.