Gemini 3.8 Live та 3.8 Live Extended Thinking (Google DeepMind)
Google DeepMind представила дві рилтайм голосові моделі: Gemini 3.8 Live для швидкої багатомовної бесіди та 3.8 Live Extended Thinking для одночасного роздуму та мовлення. Обе моделі бачать екран, чують голос, розуміють паузи та перебивання, виконують інструменти та API у фоні під час розмови.
📊 Тренд у голосових AI. Прагматичне вдосколення для тих, хто інтегрує голос у продукти зараз.
Що це означає для вас
Тестуйте Gemini 3.8 Live у AI Studio для створення інтерактивних голосових демо продуктів
🕐 Увійдіть у Google AI Studio, виберіть модель Gemini 3.8 Live та запустіть тестовий голосовий запит з запитанням про продукт (10 хв)
📊 З новини: 97 мов з переключенням на лету🛠 Інструмент: Gemini 3.8 Live
Пропустіть, якщо: якщо ваша аудиторія використовує лише одну мову — сконцентруйтесь на якості вимови в цій мові
Перевірте, чи може голосова AI скоротити час на демо-продажі за тиждень
Отримати карту AI-можливостей →🎯 Чи підходить це вашому бізнесу?
Заповніть профіль компанії — і ми автоматично покажемо, чи варто вам це впроваджувати.
Заповнити профіль · 30 секундTL;DR
- •Дві нові рилтайм голосові моделі від Google DeepMind: Gemini 3.8 Live та 3.8 Live Extended Thinking
- •Підтримка 97 мов, зору в реальному часі, голосового вводу, пауз, перебивань
- •Модель Extended Thinking одночасно роздумує і говорить, вимовляючи 'дай-ка подумаю...'
- •Рейтинг #1 у штучному аналізі якості Speech to Speech з результатом 82,6
- •Усі аудіовиходи мають водяний знак SynthID для захисту від deepfake
Як це змінить ваш ринок?
Банки та страхові компанії зможуть аналізувати голосові звернення клієнтів у реальному часі без передачі даних третім сторонам — це знімає головний блокер у фінансах та страхуванні, де конфіденційність є критичною.
Для кого це і за яких умов (ОБОВ'ЯЗКОВО: мін. обладнання/бюджет, потрібна команда чи ні, мін. масштаб, час на впровадження.
- •Для API-доступу: потрібен доступ до Google Cloud, IT-спеціаліст для налаштування, бюджет від $0.0015/1K символів
- •Для тестування в AI Studio: достатньо браузера і Google-акаунту, без IT-команди, 15 хв на налаштування
- •Масштаб: корисно від 1+ співробітника для тестування, від 10+ для продакшен-у впровадження
Альтернативи
| Продукт | Ціна | Де працює | Мін. вимоги | Ключова різниця |
|---|---|---|---|---|
| Gemini 3.8 Live | $0.0015/1K символів | Google Cloud, AI Studio | Інтернет, Google-акаунт | Рилтайм зор + голос + інструменти у фоні |
| ElevenLabs Voice | від $0.18/міс | Веб, API | Інтернет, акаунт | Найкраща якість синтезу голосу, але без роздуму у реальному часі |
| OpenAI Whisper | безкоштовно (open-source) | Локально, хмара | GPU або CPU | Транскрипція, не генерація мовлення в реальному часі |
💬 Часті запитання
🔒 Підтекст (Insider)
Google не випромінює революцію — це крок у серії покращень Gemini. Мета: зберегти позицію у B2B-секторі голосових API, де OpenAI Whisper та ElevenLabs вже мають захоплення. Реальна перевага — інтеграція з інструментами та API під час розмови без зупинки діалогу.
Такий розбір щоранку о 08:00
Персональний AI-дайджест для вашої галузі — щодня у Telegram
Навчіть вашу команду будувати такі AI-автоматизації
За 5 днів кожен співробітник побудує автоматизацію для своєї ділянки роботи.
Дізнатись більше → aiupskill.live