Антропік сканує книги для тренування Клода: суд визнав fair use, але публіка емпує
Антропік закуповувала та сканувала мільйони паперових книг для тренування Клода, різаючи корешки та оцифровуючи сторінки. Суд визнав це fair use, але спільнота обурена можливою втратою рідкісних видань.
⚖️ Прецедент fair use. Для компаній до 200 людей це лише сигнал стежити за судою — жодного інструменту чи зміни тарифів тут нема.
🎯 Чи підходить це вашому бізнесу?
Заповніть профіль компанії — і ми автоматично покажемо, чи варто вам це впроваджувати.
Заповнити профіль · 30 секундTL;DR
- •Антропік оцифрувала ~7 млн паперових книг (видані до 2022 року) для тренування Клода, фізично різаючи корешки
- •Судова рішення США визнало таке сканування fair use, але Твіттер-спільнота назвала це знищенням культурної спадщини
- •Серед просканованих знайшлися рідкісні однієї копії видання, хоча закупівля йшла через великих дистриб'юторів
- •Автор посту захищає Антропік, порівнюючи це з практикою Amazon Books та піратських бібліотек манги
- •В кінці статті — лічильник донатів автору каналу: 54 440.4 (вказівка на особистий інтерес)
Як це змінить ваш ринок?
Для видавництв і медіа — прецедент, що легалізує масову оцифровку каталогів без ліцензій у США. Для AI-компаній — зелений світло для подібних практик, але лише в американській юрисдикції. Для бізнесу, що використовує ШІ — непрямий ризик: моделі навчені на «fair use» даних можуть мати юридичні проблеми в ЄС, де винятки для ТЗМ (text and data mining) суворіші.
Визначення: fair use (вільне використання) — доктрина американського авторського права, що дозволяє обмежене використання охоронених творів без дозволу правовласника для цілей критики, коментаря, новин, навчання чи досліджень. В ЄС аналог — виняток для ТЗМ (Article 4 DSM Directive), але він не поширюється на комерційне використання, якщо правовласник явно заборонив це.
Для кого це і за яких умов
Це не продукт і не інструмент. Релевантно:
- •Юридичним/комплаєнс-командам компаній, що будують або фінетюнять LLM — моніторинг американської судої практики, 0 додаткових витрат
- •Видавецьким дотримам — аудит каталогів на предмет ризику оцифровки третіми сторонами, потребує юриста з IP-профілем
- •Бізнесу, що інтегрує ШІ — перевірка, чи моделі постачальників мають чітку позицію щодо тренувальних даних (OpenAI, Anthropic, Google мають; відкриті моделі — часто ні) Час на реакцію: не терміново, але стратегічно — 3-6 місяців на формування політики даних.
Альтернативи
| Лайцензування даних (OpenAI model) | Fair use сканування (Anthropic model) | Синтетичні дані | Відкриті датасети (Common Crawl, The Pile) | |
|---|---|---|---|---|
| Ціна | Мільйони $ за угоди з видавцями | Вартість книг + сканування + адвокати | GPU-години генерації | Безкоштовно (але якість плаває) |
| Де працює | США, європейські юрисдикції з погодою | Тільки США (fair use) | Усі юрисдикції | Усі юрисдикції (з обмеженнями) |
| Мін. вимоги | Юридична команда, бюджет $1M+ | Фізична логістика, адвокати | ML-інженери, кластер | Дата-інженери, фільтрація |
| Ключова різниця | Легально всюди, де підписано угоду | Легально лише в США за fair use | Нуль авторського ризику | Ризик «сміття в — сміття вийшло» |
💬 Часті запитання
Такий розбір щоранку о 08:00
Персональний AI-дайджест для вашої галузі — щодня у Telegram
Навчіть вашу команду будувати такі AI-автоматизації
За 5 днів кожен співробітник побудує автоматизацію для своєї ділянки роботи.
Дізнатись більше → aiupskill.live