ПозитивнаImpact 5/10✅ Production-Ready👤 Для всіх📺 Медіа і Контент📊 Маркетинг і Реклама🎓 Освіта

Нові моделі Flash TTS від Google дозволяють створювати голоси ШІ з нуля за текстовими описами

The Decoderблизько 7 годин тому0 переглядів

Google представив дві нові моделі text-to-speech: Gemini 3.8 Flash TTS та Flash-Lite TTS, які підтримують понад 100 мов. Вони дозволяють створювати нові голоси за текстовими описами, додавати репліки-сцени, генерувати диалог двох голосів та клонувати голос за 30-секундним зразком.

ВердиктПозитивнаImpact 5/10

🚀 Запуск доступного інструменту. Якість порівняльна з преміум-аналогами, але з гнучкістю керування голосом через текст — для тих, хто потребує кастомних голосів у відео, підкастах або навчальних матеріалах.

Що це означає для вас

Маркетингу

Спробуйте створити кастомний голос для рекламного аудіо за текстовим описом у Flash TTS

🕐 Перейдіть до Google Cloud TTS демо, введіть опис голосу (наприклад, «спокійний жіночий голос з легким ехом») і прослухайте результат (10 хв)

📊 З новини: понад 100 мов

🛠 Інструмент: Gemini 3.8 Flash TTS

Пропустіть, якщо: якщо ваш бренд вже використовує фіксованого диктора в агентстві — спочатку протестуйте на одному рекламному ролику

Перевірте, чи може ваша команда тепер створювати голоси для реклами без звернення до зовнішньої студії

Отримати карту AI-можливостей →

🎯 Чи підходить це вашому бізнесу?

Заповніть профіль компанії — і ми автоматично покажемо, чи варто вам це впроваджувати.

Заповнити профіль · 30 секунд
Детальний розбір ↓

TL;DR

  • Gemini 3.8 Flash TTS та Flash-Lite TTS підтримують понад 100 мов
  • Flash TTS створює голоси за текстовими описами (наприклад, «веселий чоловічій голос»)
  • Можливість додавати репліки-сцени та генерувати диалог двох голосів з одного скрипта
  • Клонування голосу за 30-секундним зразком аудіо
  • Доступно через Google Cloud API з оплатой за символ

Як це змінить ваш ринок?

Маркетингові агентства та продакшн-студії зможуть скоротити витрати на озвучення на 60-80%, замінюючи замовлення у зовнішніх голосових талантах на генерацію голосів через API. Це знімає блокер доступності для SMB, які раніше не могли дозволити собі кастомні голоси через високі мінімальні замовлення у агентствах.

Для кого це і за яких умов (ОБОВ'ЯЗКОВО: мін. обладнання/бюджет, потрібна команда чи ні, мін. масштаб, час на впровадження. ❌ "Підходить для компаній будь-якого розміру". ✅ "7B: MacBook 16GB, без IT-команди, 15 хв. 27B: GPU $2,000+ або хмара ~$0.5/год, IT-спеціаліст, 1-2 дні.")

  • Маркетолог або контент-менеджер у компанії з 10+ людей може почати використовувати сьогодні
  • Потрібен лише доступ до Google Cloud і базова технічна грамотність
  • Початкові витрати: $0.0004 за 1000 символів (Flash TTS), без мінімального замовлення
  • Час на впровадження: менше 30 хв для тестування одного голосового варіанту

Альтернативи (ТАБЛИЦЯ: | | Продукт 1 | Продукт 2 | Продукт 3 | з колонками: Ціна, Де працює, Мін. вимоги, Ключова різниця. ОБОВ'ЯЗКОВО конкретні ціни. ❌ "Потужна модель" — нуль інформації. ✅ "$15/1M токенів" або "безкоштовно" або "ціна не розкрита".)

| | ElevenLabs | PlayHT | Google Flash TTS | Ціна | $0.18/1M символів | $0.03/1M символів | $0.004/1M символів | Де працює | API, веб-додаток | API, веб-додаток | Google Cloud API | Мін. вимоги | Інтернет-з’єднання | Інтернет-з’єднання | Google Cloud акаунт | Ключова різниця | Найвища природність голосу | Добрий баланс ціни та якості | Найнижа ціна + керування голосом через текст


Такий розбір щоранку о 08:00

Персональний AI-дайджест для вашої галузі — щодня у Telegram

7 днів безкоштовно
text-to-speechAIvoicegenerationvoicecloningGemini3.8FlashTTSmultilingualTTS

Навчіть вашу команду будувати такі AI-автоматизації

За 5 днів кожен співробітник побудує автоматизацію для своєї ділянки роботи.

Дізнатись більше → aiupskill.live