Скандал навколо Anthropic: вони «убивали» паперові книги для навчання Claude 😢

AI прорывблизько 1 години тому0 переглядів

Anthropic закупила паперові книги, видані до 2022 року, вирізала корешки та сканувала їх для навчання моделі Claude. Суд визnač таке використання fair use, проте скандал у соцмережах підняв питання про етичне використання культурної спадщини в тренуванні AI.

ВердиктЗмішанаImpact 5/10

⚠️ Скандал навколо даних. Для компаній, що тренують AI на відкритих даних, це напоминання про юридичні та етичні ризики.

🎯 Чи підходить це вашому бізнесу?

Заповніть профіль компанії — і ми автоматично покажемо, чи варто вам це впроваджувати.

Заповнити профіль · 30 секунд
Детальний розбір ↓

TL;DR

  • Anthropic купила паперові книги, видані до 2022 року, вирізала корешки та сканувала їх для тренування моделі Claude, беручи книги зі складів великих дистрибьюторів, а не з бібліотек або музеїв.
  • Суд США визnač таке використання fair use у справі щодо тренування AI на авторських творив, проте рішення може бути оскаржене та не є окончательным прецедентом.
  • Соцмережі обвинили компанію в знищенні рідкісних книжкових видань та культурної спадщини, поширюючи хештеги типу #BookBurning та викликаючи бойкот продуктів Anthropic.
  • Компанія стверджує, що це стандартна практика індустрії, що їх закупки збільшили продажи для видavnictв та що книги були придбані, а не викрадені.
  • Подія підкреслює ростуючу юридичну та репуційну невизначеність у сфері даних для генеративних AI, показуючи напругу між технологічним прогресом та охороною культурної спадщини.

Як це змінить ваш ринок?

Вирок про fair use може знизити правові бар’єри для компаній, які хочуть використовувати книги та друковані матеріали для тренування великих моделей, особливо якщо вони дотримуються принципу трансформативного використання. Однак публічний гнів та ризик репуційних втрат можуть заставити firmi шукати більш прозорих джерел даних, таких як ліцензовані бази, синтетичні тексти або партнерства з видавцями. Для видавців та бібліотек це сигнал про потрібність чітких ліцензуючих угод та компенсацій за використання творів у AI, щоб уникнути судебних спорів та зберегти довіру авторів. Підприємствам слід оцінювати, чи вигідно отримувати дані таким способом у порівнянні з альтернативними джерелами, щоб уникнути скандалів та судебних спорів, а також розглянути можливість створення власних ліцензованих архівів для тренування.

Визначення: fair use — доктрина американського авторського права, що дозволяє обмежене використання авторських творив без дозволу для таких цілей, як критика, новини, навчання або дослідження. Визначення: training data — набір текстів, зображень або інших даних, які використовують для навчання моделей штучного інтелекту, щоб вони вивчали закономірності та могли генерувати відповідні виходи. Визначення: data licensing — процес отримання дозволу на використання даних, захищених авторським правом або іншими правами, через угоду з власником прав, зазвичай з оплатою роялти або разового платежу.

Для кого це і за яких умов

Для AI-команд середніх компаній (50-200 осіб) з доступом до бюджету на придбання книг та сканерного обладнання (≈$5K–$20K) та можливості обробки великих обсягів тексту (GPU кластер). Потрібна фахівець з права інтелектуальної власності для оцінки ризиків fair use та підготовки документації про трансформативне використання. Впровадження такої практики може зайвати від 1 до 3 місяців, залежно від обсягу даних, доступності сканерних установ та готовності юридичного відділу.

Альтернативи

Licensed book datasetsSynthetic text generationPublic domain archives
Ціна$0.02 за токен$0.01 за 1K токенБезкоштовно
Де працюєХмарні платформи, локальні сервериAPI або локальна модельБудь-яке середовище з інтернетом
Мін. вимогиЛіцензійна угодa, GPUДоступ до великої моделі, обчислювальні ресурсиОчистка та форматування даних
Ключова різницяЗаконне використання з виплатами правовласникамУникає авторських прав, можливі смещенияВільно від авторських прав, обмежений охоплює старі твори

💬 Часті запитання

Суд у справі Anthropic визnač таке використання fair use, проте це залежить від юрисдикції та конкретних обставин; в Європі може застосовуватися інша доктрина (fair dealing).

Такий розбір щоранку о 08:00

Персональний AI-дайджест для вашої галузі — щодня у Telegram

7 днів безкоштовно
AnthropicClaudetrainingdatafairuseculturalheritage

Навчіть вашу команду будувати такі AI-автоматизації

За 5 днів кожен співробітник побудує автоматизацію для своєї ділянки роботи.

Дізнатись більше → aiupskill.live