Антропік сканує книги для тренування Клода: суд визнав fair use, але публіка емпує

Ооо нейромережеве🐱близько 1 години тому0 переглядів

Антропік закуповувала та сканувала мільйони паперових книг для тренування Клода, різаючи корешки та оцифровуючи сторінки. Суд визнав це fair use, але спільнота обурена можливою втратою рідкісних видань.

ВердиктЗмішанаImpact 4/10

⚖️ Прецедент fair use. Для компаній до 200 людей це лише сигнал стежити за судою — жодного інструменту чи зміни тарифів тут нема.

🎯 Чи підходить це вашому бізнесу?

Заповніть профіль компанії — і ми автоматично покажемо, чи варто вам це впроваджувати.

Заповнити профіль · 30 секунд
Детальний розбір ↓

TL;DR

  • Антропік оцифрувала ~7 млн паперових книг (видані до 2022 року) для тренування Клода, фізично різаючи корешки
  • Судова рішення США визнало таке сканування fair use, але Твіттер-спільнота назвала це знищенням культурної спадщини
  • Серед просканованих знайшлися рідкісні однієї копії видання, хоча закупівля йшла через великих дистриб'юторів
  • Автор посту захищає Антропік, порівнюючи це з практикою Amazon Books та піратських бібліотек манги
  • В кінці статті — лічильник донатів автору каналу: 54 440.4 (вказівка на особистий інтерес)

Як це змінить ваш ринок?

Для видавництв і медіа — прецедент, що легалізує масову оцифровку каталогів без ліцензій у США. Для AI-компаній — зелений світло для подібних практик, але лише в американській юрисдикції. Для бізнесу, що використовує ШІ — непрямий ризик: моделі навчені на «fair use» даних можуть мати юридичні проблеми в ЄС, де винятки для ТЗМ (text and data mining) суворіші.

Визначення: fair use (вільне використання) — доктрина американського авторського права, що дозволяє обмежене використання охоронених творів без дозволу правовласника для цілей критики, коментаря, новин, навчання чи досліджень. В ЄС аналог — виняток для ТЗМ (Article 4 DSM Directive), але він не поширюється на комерційне використання, якщо правовласник явно заборонив це.

Для кого це і за яких умов

Це не продукт і не інструмент. Релевантно:

  • Юридичним/комплаєнс-командам компаній, що будують або фінетюнять LLM — моніторинг американської судої практики, 0 додаткових витрат
  • Видавецьким дотримам — аудит каталогів на предмет ризику оцифровки третіми сторонами, потребує юриста з IP-профілем
  • Бізнесу, що інтегрує ШІ — перевірка, чи моделі постачальників мають чітку позицію щодо тренувальних даних (OpenAI, Anthropic, Google мають; відкриті моделі — часто ні) Час на реакцію: не терміново, але стратегічно — 3-6 місяців на формування політики даних.

Альтернативи

Лайцензування даних (OpenAI model)Fair use сканування (Anthropic model)Синтетичні даніВідкриті датасети (Common Crawl, The Pile)
ЦінаМільйони $ за угоди з видавцямиВартість книг + сканування + адвокатиGPU-години генераціїБезкоштовно (але якість плаває)
Де працюєСША, європейські юрисдикції з погодоюТільки США (fair use)Усі юрисдикціїУсі юрисдикції (з обмеженнями)
Мін. вимогиЮридична команда, бюджет $1M+Фізична логістика, адвокатиML-інженери, кластерДата-інженери, фільтрація
Ключова різницяЛегально всюди, де підписано угодуЛегально лише в США за fair useНуль авторського ризикуРизик «сміття в — сміття вийшло»

💬 Часті запитання

Ні, стаття згадує рішення одного судді. Апеляція ймовірна, остаточний прецедент може сформуватися через роки.

Такий розбір щоранку о 08:00

Персональний AI-дайджест для вашої галузі — щодня у Telegram

7 днів безкоштовно
AnthropicClaudeAItrainingdatafairusecopyrightbookscanning

Навчіть вашу команду будувати такі AI-автоматизації

За 5 днів кожен співробітник побудує автоматизацію для своєї ділянки роботи.

Дізнатись більше → aiupskill.live