Старий OCR шкодить тренуванню мовних моделей, а FineBooks планує виправити це у масштабі
Проект FineBooks протестував 14 відкритих OCR-моделей на понад 2000 сторінок історичних книг. Найкраща модель dots.mocr показала 97,6% точності за менше ніж два долари за тисяч сторінок, достатньо для даних AI‑тренування, але не для академічних транскрипцій.
ВердиктПозитивнаImpact 5/10
📊 Висока точність. Докращений OCR зменшує шум у даних для тренування LLM — корисно для медиа- та освітніх компаній, що працюють з історичними текстами.
Ключові тези
- Проект FineBooks протестував 14 відкритих OCR-моделей на понад 2000 сторінок історичних книг.
- Найкраща модель dots.mocr досягла 97,6% символічної точності при вартості менше 2 доларів за 1000 сторінок.
- Така точність достатня для підготовки даних до тренування LLM, але не для академічних транскрипцій.
- Команда планує масштабувати покращення OCR для покращення AI‑тренування у великих обсягах даних.
- Доступний за низькою вартістю OCR може зменшити шум у даних, що використовуються для тренування мовних моделей.
🎯 Чи підходить це вашому бізнесу?
Заповніть профіль компанії — і ми автоматично покажемо, чи варто вам це впроваджувати.
Заповнити профіль · 30 секундТакий розбір щоранку о 08:00
Персональний AI-дайджест для вашої галузі — щодня у Telegram
Джерела
The Decoder — оригіналOCRlanguagemodeltrainingFineBooksdots.mocrHuggingFaceEleutherAIhistoricaltextdigitization
Навчіть вашу команду будувати такі AI-автоматизації
За 5 днів кожен співробітник побудує автоматизацію для своєї ділянки роботи.
Дізнатись більше → aiupskill.live