ПозитивнаImpact 5/10✅ Production-Ready🏗️ Enterprise📺 Медіа і Контент📊 Маркетинг і Реклама💰 Продажі і CRM

Gemini 3.8 Live та 3.8 Live Extended Thinking (Google DeepMind)

Нейронавт | Нейросети в творчестве5 днів тому0 переглядів

Google DeepMind представила дві рилтайм голосові моделі: Gemini 3.8 Live для швидкої багатомовної бесіди та 3.8 Live Extended Thinking для одночасного роздуму та мовлення. Обе моделі бачать екран, чують голос, розуміють паузи та перебивання, виконують інструменти та API у фоні під час розмови.

ВердиктПозитивнаImpact 5/10

📊 Тренд у голосових AI. Прагматичне вдосколення для тих, хто інтегрує голос у продукти зараз.

Що це означає для вас

Маркетингу

Тестуйте Gemini 3.8 Live у AI Studio для створення інтерактивних голосових демо продуктів

🕐 Увійдіть у Google AI Studio, виберіть модель Gemini 3.8 Live та запустіть тестовий голосовий запит з запитанням про продукт (10 хв)

📊 З новини: 97 мов з переключенням на лету

🛠 Інструмент: Gemini 3.8 Live

Пропустіть, якщо: якщо ваша аудиторія використовує лише одну мову — сконцентруйтесь на якості вимови в цій мові

Перевірте, чи може голосова AI скоротити час на демо-продажі за тиждень

Отримати карту AI-можливостей →

🎯 Чи підходить це вашому бізнесу?

Заповніть профіль компанії — і ми автоматично покажемо, чи варто вам це впроваджувати.

Заповнити профіль · 30 секунд
Детальний розбір ↓

TL;DR

  • Дві нові рилтайм голосові моделі від Google DeepMind: Gemini 3.8 Live та 3.8 Live Extended Thinking
  • Підтримка 97 мов, зору в реальному часі, голосового вводу, пауз, перебивань
  • Модель Extended Thinking одночасно роздумує і говорить, вимовляючи 'дай-ка подумаю...'
  • Рейтинг #1 у штучному аналізі якості Speech to Speech з результатом 82,6
  • Усі аудіовиходи мають водяний знак SynthID для захисту від deepfake

Як це змінить ваш ринок?

Банки та страхові компанії зможуть аналізувати голосові звернення клієнтів у реальному часі без передачі даних третім сторонам — це знімає головний блокер у фінансах та страхуванні, де конфіденційність є критичною.

Для кого це і за яких умов (ОБОВ'ЯЗКОВО: мін. обладнання/бюджет, потрібна команда чи ні, мін. масштаб, час на впровадження.

  • Для API-доступу: потрібен доступ до Google Cloud, IT-спеціаліст для налаштування, бюджет від $0.0015/1K символів
  • Для тестування в AI Studio: достатньо браузера і Google-акаунту, без IT-команди, 15 хв на налаштування
  • Масштаб: корисно від 1+ співробітника для тестування, від 10+ для продакшен-у впровадження

Альтернативи

ПродуктЦінаДе працюєМін. вимогиКлючова різниця
Gemini 3.8 Live$0.0015/1K символівGoogle Cloud, AI StudioІнтернет, Google-акаунтРилтайм зор + голос + інструменти у фоні
ElevenLabs Voiceвід $0.18/місВеб, APIІнтернет, акаунтНайкраща якість синтезу голосу, але без роздуму у реальному часі
OpenAI Whisperбезкоштовно (open-source)Локально, хмараGPU або CPUТранскрипція, не генерація мовлення в реальному часі

💬 Часті запитання

Нет, модель доступна через Google Cloud API та AI Studio, працює в стандартному інтернет-з’єднанні.

🔒 Підтекст (Insider)

Google не випромінює революцію — це крок у серії покращень Gemini. Мета: зберегти позицію у B2B-секторі голосових API, де OpenAI Whisper та ElevenLabs вже мають захоплення. Реальна перевага — інтеграція з інструментами та API під час розмови без зупинки діалогу.

Такий розбір щоранку о 08:00

Персональний AI-дайджест для вашої галузі — щодня у Telegram

7 днів безкоштовно
Gemini3.8LiveExtendedThinkingvoiceAIreal-timeSynthIDGoogleDeepMindspeech-to-speech

Навчіть вашу команду будувати такі AI-автоматизації

За 5 днів кожен співробітник побудує автоматизацію для своєї ділянки роботи.

Дізнатись більше → aiupskill.live