Нові моделі Flash TTS від Google дозволяють створювати голоси ШІ з нуля за текстовими описами
Google представив дві нові моделі text-to-speech: Gemini 3.8 Flash TTS та Flash-Lite TTS, які підтримують понад 100 мов. Вони дозволяють створювати нові голоси за текстовими описами, додавати репліки-сцени, генерувати диалог двох голосів та клонувати голос за 30-секундним зразком.
🚀 Запуск доступного інструменту. Якість порівняльна з преміум-аналогами, але з гнучкістю керування голосом через текст — для тих, хто потребує кастомних голосів у відео, підкастах або навчальних матеріалах.
Що це означає для вас
Спробуйте створити кастомний голос для рекламного аудіо за текстовим описом у Flash TTS
🕐 Перейдіть до Google Cloud TTS демо, введіть опис голосу (наприклад, «спокійний жіночий голос з легким ехом») і прослухайте результат (10 хв)
📊 З новини: понад 100 мов🛠 Інструмент: Gemini 3.8 Flash TTS
Пропустіть, якщо: якщо ваш бренд вже використовує фіксованого диктора в агентстві — спочатку протестуйте на одному рекламному ролику
Перевірте, чи може ваша команда тепер створювати голоси для реклами без звернення до зовнішньої студії
Отримати карту AI-можливостей →🎯 Чи підходить це вашому бізнесу?
Заповніть профіль компанії — і ми автоматично покажемо, чи варто вам це впроваджувати.
Заповнити профіль · 30 секундTL;DR
- •Gemini 3.8 Flash TTS та Flash-Lite TTS підтримують понад 100 мов
- •Flash TTS створює голоси за текстовими описами (наприклад, «веселий чоловічій голос»)
- •Можливість додавати репліки-сцени та генерувати диалог двох голосів з одного скрипта
- •Клонування голосу за 30-секундним зразком аудіо
- •Доступно через Google Cloud API з оплатой за символ
Як це змінить ваш ринок?
Маркетингові агентства та продакшн-студії зможуть скоротити витрати на озвучення на 60-80%, замінюючи замовлення у зовнішніх голосових талантах на генерацію голосів через API. Це знімає блокер доступності для SMB, які раніше не могли дозволити собі кастомні голоси через високі мінімальні замовлення у агентствах.
Для кого це і за яких умов (ОБОВ'ЯЗКОВО: мін. обладнання/бюджет, потрібна команда чи ні, мін. масштаб, час на впровадження. ❌ "Підходить для компаній будь-якого розміру". ✅ "7B: MacBook 16GB, без IT-команди, 15 хв. 27B: GPU $2,000+ або хмара ~$0.5/год, IT-спеціаліст, 1-2 дні.")
- •Маркетолог або контент-менеджер у компанії з 10+ людей може почати використовувати сьогодні
- •Потрібен лише доступ до Google Cloud і базова технічна грамотність
- •Початкові витрати: $0.0004 за 1000 символів (Flash TTS), без мінімального замовлення
- •Час на впровадження: менше 30 хв для тестування одного голосового варіанту
Альтернативи (ТАБЛИЦЯ: | | Продукт 1 | Продукт 2 | Продукт 3 | з колонками: Ціна, Де працює, Мін. вимоги, Ключова різниця. ОБОВ'ЯЗКОВО конкретні ціни. ❌ "Потужна модель" — нуль інформації. ✅ "$15/1M токенів" або "безкоштовно" або "ціна не розкрита".)
| | ElevenLabs | PlayHT | Google Flash TTS | Ціна | $0.18/1M символів | $0.03/1M символів | $0.004/1M символів | Де працює | API, веб-додаток | API, веб-додаток | Google Cloud API | Мін. вимоги | Інтернет-з’єднання | Інтернет-з’єднання | Google Cloud акаунт | Ключова різниця | Найвища природність голосу | Добрий баланс ціни та якості | Найнижа ціна + керування голосом через текст
Такий розбір щоранку о 08:00
Персональний AI-дайджест для вашої галузі — щодня у Telegram
Джерела
The Decoder — оригіналНавчіть вашу команду будувати такі AI-автоматизації
За 5 днів кожен співробітник побудує автоматизацію для своєї ділянки роботи.
Дізнатись більше → aiupskill.live