Суд окончательно утвердил выплату $1,5 млрд авторам: обучать ИИ на книгах можно, скачивать их с пиратских сайтов — нет
20 июля судья Арасели Мартинес-Ольгин окончательно утвердила мировое соглашение на $1,5 млрд по коллективному иску авторов и издателей к Anthropic. Дело слушалось в Федеральном окружном суде Северного округа Калифорнии.
Цифры
- Общая сумма — $1,5 млрд.
- Затронуто около 500 000 произведений.
- По $3 000 за одно произведение.
Предварительное одобрение соглашению давал судья Уильям Алсуп, который впоследствии ушёл в отставку.
Разделительная линия, которую провёл суд
Самое важное в этом деле — не размер выплаты, а то, где именно суд усмотрел нарушение.
Обучение модели на защищённых авторским правом текстах суд признал добросовестным использованием. То есть сам факт, что нейросеть училась на книгах, нарушением не является.
Незаконным признан способ получения книг. Компания скачивала их с пиратских библиотек — в материалах фигурируют Library Genesis и Pirate Library Mirror. Именно это и стало основанием для иска.
Логика получается такая: учиться на книге можно, а красть её — нельзя. Для отрасли это разграничение важнее любой суммы: оно означает, что легальность обучения зависит не от того, чему модель училась, а от того, как компания получила материал.
Почему авторы не считают это победой
Судя по реакции, многие авторы и правообладатели не восприняли исход как выигрыш, несмотря на масштаб выплаты.
Причина понятна, если вернуться к предыдущему разделу. Соглашение закрывает эпизод с пиратскими библиотеками — но не оспаривает главное, чего добивались авторы: право моделей учиться на их работах вообще. Три тысячи долларов за книгу — компенсация за способ получения, а не за использование.
Кроме того, соглашение не создаёт обязательного прецедента для будущих дел: стороны договорились, а значит суд не выносил окончательного решения по существу спора.
Куда это ведёт
Практический вывод для индустрии простой и уже читается в поведении компаний: источник данных становится таким же предметом проверки, как и сама модель. Лицензионные соглашения с издательствами, покупка корпусов, договоры с медиа — всё это дешевле, чем полмиллиона произведений по $3 000.
Отдельная линия — синтетические данные, которые как раз обходят вопрос происхождения: их мы разбирали отдельно, и юридическая чистота там одно из главных преимуществ.
Похожие иски идут и в других отраслях: музыкальные лейблы судятся с ИИ-сервисами примерно по той же логике.
Что это значит для пользователя
Напрямую — ничего: модели работают как работали. Косвенно — две вещи.
Во-первых, стоимость обучения новых моделей вырастет, если данные придётся покупать, а не собирать. Это в итоге отражается на ценах API.
Во-вторых, разграничение «учиться можно, красть нельзя» проясняет и вашу ситуацию как автора. Если ваш текст лежит в открытом доступе и модель на нём училась — по этой логике нарушения нет. Нарушение возникает, если текст был получен способом, который сам по себе незаконен.
Что именно попадает под добросовестное использование и почему суды рассуждают именно так — в отдельном гайде.