Скандал навколо Anthropic: вони «убивали» паперові книги для навчання Claude 😢
Anthropic закупила паперові книги, видані до 2022 року, вирізала корешки та сканувала їх для навчання моделі Claude. Суд визnač таке використання fair use, проте скандал у соцмережах підняв питання про етичне використання культурної спадщини в тренуванні AI.
⚠️ Скандал навколо даних. Для компаній, що тренують AI на відкритих даних, це напоминання про юридичні та етичні ризики.
🎯 Чи підходить це вашому бізнесу?
Заповніть профіль компанії — і ми автоматично покажемо, чи варто вам це впроваджувати.
Заповнити профіль · 30 секундTL;DR
- •Anthropic купила паперові книги, видані до 2022 року, вирізала корешки та сканувала їх для тренування моделі Claude, беручи книги зі складів великих дистрибьюторів, а не з бібліотек або музеїв.
- •Суд США визnač таке використання fair use у справі щодо тренування AI на авторських творив, проте рішення може бути оскаржене та не є окончательным прецедентом.
- •Соцмережі обвинили компанію в знищенні рідкісних книжкових видань та культурної спадщини, поширюючи хештеги типу #BookBurning та викликаючи бойкот продуктів Anthropic.
- •Компанія стверджує, що це стандартна практика індустрії, що їх закупки збільшили продажи для видavnictв та що книги були придбані, а не викрадені.
- •Подія підкреслює ростуючу юридичну та репуційну невизначеність у сфері даних для генеративних AI, показуючи напругу між технологічним прогресом та охороною культурної спадщини.
Як це змінить ваш ринок?
Вирок про fair use може знизити правові бар’єри для компаній, які хочуть використовувати книги та друковані матеріали для тренування великих моделей, особливо якщо вони дотримуються принципу трансформативного використання. Однак публічний гнів та ризик репуційних втрат можуть заставити firmi шукати більш прозорих джерел даних, таких як ліцензовані бази, синтетичні тексти або партнерства з видавцями. Для видавців та бібліотек це сигнал про потрібність чітких ліцензуючих угод та компенсацій за використання творів у AI, щоб уникнути судебних спорів та зберегти довіру авторів. Підприємствам слід оцінювати, чи вигідно отримувати дані таким способом у порівнянні з альтернативними джерелами, щоб уникнути скандалів та судебних спорів, а також розглянути можливість створення власних ліцензованих архівів для тренування.
Визначення: fair use — доктрина американського авторського права, що дозволяє обмежене використання авторських творив без дозволу для таких цілей, як критика, новини, навчання або дослідження. Визначення: training data — набір текстів, зображень або інших даних, які використовують для навчання моделей штучного інтелекту, щоб вони вивчали закономірності та могли генерувати відповідні виходи. Визначення: data licensing — процес отримання дозволу на використання даних, захищених авторським правом або іншими правами, через угоду з власником прав, зазвичай з оплатою роялти або разового платежу.
Для кого це і за яких умов
Для AI-команд середніх компаній (50-200 осіб) з доступом до бюджету на придбання книг та сканерного обладнання (≈$5K–$20K) та можливості обробки великих обсягів тексту (GPU кластер). Потрібна фахівець з права інтелектуальної власності для оцінки ризиків fair use та підготовки документації про трансформативне використання. Впровадження такої практики може зайвати від 1 до 3 місяців, залежно від обсягу даних, доступності сканерних установ та готовності юридичного відділу.
Альтернативи
| Licensed book datasets | Synthetic text generation | Public domain archives | |
|---|---|---|---|
| Ціна | $0.02 за токен | $0.01 за 1K токен | Безкоштовно |
| Де працює | Хмарні платформи, локальні сервери | API або локальна модель | Будь-яке середовище з інтернетом |
| Мін. вимоги | Ліцензійна угодa, GPU | Доступ до великої моделі, обчислювальні ресурси | Очистка та форматування даних |
| Ключова різниця | Законне використання з виплатами правовласникам | Уникає авторських прав, можливі смещения | Вільно від авторських прав, обмежений охоплює старі твори |
💬 Часті запитання
Такий розбір щоранку о 08:00
Персональний AI-дайджест для вашої галузі — щодня у Telegram
Джерела
AI прорыв — оригіналНавчіть вашу команду будувати такі AI-автоматизації
За 5 днів кожен співробітник побудує автоматизацію для своєї ділянки роботи.
Дізнатись більше → aiupskill.live