Мир ИИ

Книгу с маячком проследили до склада, где режут переплёты

Книгу с маячком проследили до склада, где режут переплёты

17 августа вышло расследование 404 Media о том, куда физически уезжают книги, скупаемые для обучения моделей. Началось всё с продавца, получившего анонимный заказ на тысячу томов и заподозрившего покупателя. В одну из книг вложили метку слежения. Посылка пришла на площадку Amazon в Лас-Вегасе, где, по словам работающих там сотрудников, поступающие партиями книги лишают переплёта — так их быстрее сканировать. Книга в этом процессе перестаёт существовать как предмет. Компания ответила, что закупает книги по обычным коммерческим каналам для улучшения своих продуктов и услуг. Разбираем, что из этой истории следует практического для тех, кто строит продукты на моделях.

Что произошло

Хронология короткая и говорящая.

Продавец редких книг получил через площадку, где покупатель может остаться анонимным, заказ на тысячу томов. Объём и состав заказа выглядели нетипично для обычного покупателя. Возникло подозрение, что за ним стоит компания, собирающая данные для обучения.

Проверить это обычным способом нельзя — анонимность на площадке предусмотрена по умолчанию. Тогда в одну из книг положили метку слежения и отправили заказ.

Метка привела на площадку в Лас-Вегасе. Сотрудники, работающие там, описывают процесс: приходят большие партии печатных книг, у них срезают переплёт, после чего страницы сканируют. Разрезанная книга собирается обратно только в виде файла.

Почему режут переплёт

Техническая деталь, объясняющая экономику происходящего.

Отсканировать книгу, не разрушая её, можно — на развороте, страница за страницей, с распрямлением изгиба у корешка. Так работают библиотеки и архивы. Это медленно и требует аккуратности.

Срезанная стопка листов сканируется поточным устройством, как обычные документы: страницы протягиваются автоматически, десятки в минуту. Разница в скорости — порядки, и при объёмах в миллионы книг она определяет всё.

То есть уничтожение здесь не цель и не небрежность, а следствие выбора между скоростью и сохранностью. Выбор сделан в пользу скорости, потому что нужен корпус, а не библиотека.

Почему именно книги

Логичный вопрос: интернет огромен, зачем скупать бумагу.

Ответ в качестве текста. Значительная часть сетевых текстов — короткие, повторяющиеся, плохо отредактированные. Книга устроена иначе: она длинная, связная, прошла редактуру и корректуру, держит тему на сотнях страниц и написана человеком, который умеет писать.

Для обучения это принципиально. Модель учится не только фактам, но и тому, как устроен связный текст на длинной дистанции — как удерживать мысль, как строить аргумент, как возвращаться к сказанному ранее. Форумный тред этому не научит.

Второе — редкость и отсутствие в сети. Тексты, которых нет в открытом доступе, дают то, чего нет у конкурентов. Отсюда и интерес именно к редким изданиям, а не только к массовым тиражам: массовое давно оцифровано, редкое существует только на бумаге.

Третье, о чём говорят реже: у бумажной книги понятная цепочка приобретения. Её купили — есть чек, есть продавец, есть физический объект. С текстом, собранным краулером, такой ясности нет. Парадоксально, но скупка бумаги может быть попыткой сделать происхождение данных более защитимым, а не менее.

Что известно об источниках обучения вообще

Полезно понимать, насколько мало известно, чтобы правильно оценивать риск.

Вендоры публикуют общие описания: веб-данные, лицензированные материалы, данные от партнёров, синтетика. Ни один не публикует перечня источников с объёмами. Причины называются разные — от коммерческой тайны до того, что состав менялся по ходу обучения.

Что известно надёжно: судебные разбирательства по поводу использования защищённых текстов идут в нескольких юрисдикциях, и часть из них ещё не завершена. Практика формируется прямо сейчас, и решения, принятые в ближайший год, будут определять правила надолго.

Что из этого следует для планирования: рассчитывать на то, что вопрос закрыт, нельзя. Разумная позиция — строить продукт так, чтобы изменение правил не потребовало его переделки. Для большинства это означает не завязывать ценность продукта на том, что сгенерированный текст выдаётся за оригинальный авторский.

Почему это стоит знать разработчику

Тут легко остановиться на эмоции по поводу книг, но практическая часть в другом.

Происхождение данных остаётся непрозрачным. Ни один крупный вендор не публикует полный состав обучающего корпуса. Вы пользуетесь моделью, не зная, на чём она обучена, и это касается любой модели, а не только чьей-то конкретной.

Из этого следуют юридические вопросы, на которые нет ответа. Кому принадлежит текст, который сгенерировала модель, обученная на защищённых произведениях? Ответ отличается по юрисдикциям и продолжает формироваться в судах.

Регулирование движется в сторону раскрытия. Маркировка сгенерированного контента по статье 50 AI Act действует со 2 августа. Требования к раскрытию источников обучения — логичный следующий шаг, и глава Anthropic на этой неделе сам предлагал обязательные внешние проверки.

Претензия приходит к тому, кто ближе к пользователю. Если ваш продукт выдал текст, вызвавший вопросы о правах, разбираться будут с вами, а не с вендором модели.

Что теряется вместе с переплётом

Отдельная сторона истории, которую стоит проговорить, хотя она и не про разработку.

Редкое издание — это не только текст. Это конкретный тираж, конкретная вёрстка, пометки прежних владельцев, штампы библиотек, качество бумаги и переплёта. Всё это несёт информацию, которую скан страниц не сохраняет: сканируется текст, а не книга.

Для обучения модели ничего из этого не нужно — нужен именно текст. Но экземпляр после этого не восстановить, и если тираж был мал, уменьшается общее число сохранившихся копий.

Заметим честно: библиотеки и архивы десятилетиями оцифровывают фонды, не разрушая их, — просто медленнее и дороже. То есть выбор между скоростью и сохранностью существует, и он был сделан осознанно, а не по незнанию.

Мы не выносим по этому поводу приговора: покупка книг на открытом рынке — законная операция, и распоряжаться купленным владелец вправе. Но фиксируем, что за фразой «модель обучена на большом корпусе текстов» стоят вполне физические последствия, которые обычно остаются за кадром.

Что с этим делать практически

Четыре шага, соразмерных риску вашего продукта.

  1. Определите, публикуется ли сгенерированное. Если модель помогает сотруднику внутри компании — риск один. Если её текст уходит в рекламу, в публикацию или в продукт клиента — совсем другой.
  2. Фиксируйте, что и когда сгенерировано. Не содержимое запроса, а факт: какая модель, когда, для какого материала. Это то, что понадобится, если вопрос возникнет через год.
  3. Не выдавайте сгенерированное за авторское там, где это имеет значение. Требования к раскрытию усиливаются, и задним числом менять позицию сложнее, чем занять её сразу.
  4. Не полагайтесь на детекторы. Ни определение сгенерированного текста, ни водяные знаки не дают надёжного ответа; отсутствие метки не доказывает ничего.

Отдельно про наш контур: KeyDealer передаёт запросы к моделям и не хранит их содержимое — остаются токены, модель, сумма, статус и время. На происхождение обучающих данных вендоров мы влиять не можем и не претендуем; перечень того, что хранится, — в llms.txt.

Чего мы не утверждаем

Не даём правовой оценки. Законна ли покупка и сканирование книг, и как это соотносится с последующим использованием данных — вопрос судов, а не наш.

Не пересказываем расследование целиком. Приводим установленные факты по публикациям, перечисленным в источниках.

Не утверждаем, что так поступают все. Речь о конкретной находке. Практики других компаний из неё не следуют, хотя сообщения о похожем встречались и раньше.

Не знаем масштаба. Сколько книг прошло через этот процесс, из публикаций не следует.

Не оспариваем позицию компании. Её ответ приводим как есть: закупка по коммерческим каналам для улучшения продуктов.

Что держать в голове

Метка слежения в книге привела на площадку, где у книг срезают переплёты ради скорости сканирования. Это конкретный ответ на обычно абстрактный вопрос о том, откуда берутся обучающие данные.

Практический вывод для вас — не про книги, а про непрозрачность: вы работаете с моделями, состав обучения которых неизвестен, и отвечать за результат перед своим пользователем будете вы. Значит фиксировать, что и чем сгенерировано, стоит начинать до того, как это понадобится.

Как мы проверяем факты и почему у каждого стоит источник — на странице о проекте. Сорок одна позиция каталога по одному ключу: keydealer.ru/login.

Частые вопросы

Что именно выяснило расследование?

Продавец книг заподозрил, что анонимный заказ на тысячу томов сделан для обучения ИИ, и вложил в одну из книг метку слежения. Посылка пришла на площадку Amazon в Лас-Вегасе, где, по словам сотрудников, у книг срезают переплёты для быстрого сканирования.

Книги действительно уничтожают?

Срезание переплёта уничтожает книгу как физический объект. Такой способ сканирования быстрее, чем полистный на развороте.

Что ответила компания?

Что закупает книги по обычным коммерческим каналам для улучшения продуктов и услуг, которыми пользуются клиенты.

Это законно?

Покупка книг и их сканирование для себя — отдельный вопрос от того, как затем используются данные. Правовая сторона обучения моделей на защищённых текстах остаётся предметом споров и разбирательств.

Как это касается разработчика?

Через происхождение данных: чем меньше известно об источниках обучения, тем сложнее отвечать на вопросы о правах на то, что ваша модель сгенерировала.

Источники