Модель ESPnet2 ASR для китайського тексту з архітектурою Conformer
Опублікована модель ESPnet2 ASR для розпізнавання китайської мови. Вона навчена на наборі даних WeNetSpeech та показує помилковості від 13,4% до 68,0% залежно від набору даних.
ВердиктНейтральнаImpact 4/10
🔬 Цікаво для дослідження, але не для продакшену. Висока варіативність WER (13,4–68,0%) робить модель непередбаченою для реальних задач — для тих, хто експериментує з архітектурами ASR.
Ключові тези
- Модель використовує архітектуру Conformer для розпізнавання мови
- Навчена на наборі даних WeNetSpeech
- Помилковість WER коливається від 13,4% до 68,0% за різними наборами даних
🎯 Чи підходить це вашому бізнесу?
Заповніть профіль компанії — і ми автоматично покажемо, чи варто вам це впроваджувати.
Заповнити профіль · 30 секундТакий розбір щоранку о 08:00
Персональний AI-дайджест для вашої галузі — щодня у Telegram
Джерела
Shir-man Trending — оригіналASRConformerWeNetSpeechESPnet2Chinesespeechrecognition
Навчіть вашу команду будувати такі AI-автоматизації
За 5 днів кожен співробітник побудує автоматизацію для своєї ділянки роботи.
Дізнатись більше → aiupskill.live