Google випустила Gemini 3.8 Live — голосовий ШІ тепер може думати та виконувати завдання, не перериваючи розмови
Google представила дві speech-to-speech моделі: Gemini 3.8 Live та Gemini 3.8 Live Extended Thinking. Вони підтримують понад 97 мов, розуміють зображення та відео в реальному часі та можуть викликати інструменти та API під час розмови. Extended Thinking дозволяє моделі аналізувати складні завдання у фоне, повідомляючи про проміжний прогрес, і зайняла перше місце в індексі якості з оцінкою 82,6 балів.
📊 Тренд для комунікацій. Голосовий ШІ з фоновим розсудженням скорочує перебої у роботі з клієнтами — для команд, які активно використовують голосові асистенти в продажах або підтримці.
Що це означає для вас
Тестуйте Gemini 3.8 Live для автоматизації первинного зворотного зв’язку з лідами через голосові ботів
🕐 Зареєструйтеся в Google AI Studio та запустіть тестовий запит з голосовим вводом (10 хв)
📊 З новини: $0,005 за хвилину вхідного аудіо🛠 Інструмент: Gemini 3.8 Live
Пропустіть, якщо: якщо ваша маркетингова команда не працює з лідами або голосовими каналами
Перевірте, чи може голосовий ШІ скоротити час вашої команди на обробку запитів
Отримати карту AI-можливостей →🎯 Чи підходить це вашому бізнесу?
Заповніть профіль компанії — і ми автоматично покажемо, чи варто вам це впроваджувати.
Заповнити профіль · 30 секундTL;DR
- •Gemini 3.8 Live та Extended Thinking підтримують 97+ мов та реального часу розуміння зображень/відео
- •Extended Thinking дозволяє фонове розсудження без перериву розмови, досягнувши 82,6 балів у індексі якості
- •Вартість API: $0,005/хв вхідного, $0,018/хв вихідного аудіо (≈$1,38 за годину двозв’язкової розмови)
- •Доступно через Gemini API та Google AI Studio з подальшою інтеграцією у Search, Gemini та Workspace
- •Моделі вже доступні для розробників та бізнес-клієнтів
Як це змінить ваш ринок?
Компанії у сфері продажів та підтримки зможуть замінити частину скриптованих голосових ботів на ШІ, який розуміє контекст та може думати у фоне — це зменшить кількість передач оператору та підвистить задоволеність клієнтів без збільшення витрат на персонал.
Визначення:
Speech-to-speech model — тип ШІ, який приймає аудіо на вході та генерує аудіо на виході без тексту як посередника, що зменшує_latency та зберігає природність розмови.
Для кого це і за яких умов
- •Маркетинг та продажі: потрібен доступ до інтернету та микрофон, без додаткового обладнання, 10 хв на налаштування
- •Підтримка клієнтів: корисно при навантаженні від 20 голосових запитів/год, без потреби в IT-команді для базового тесту
- •Мін. масштаб: актуально для команд від 5 людей, де голосове спілкування — частина робочого процесу
Альтернативи
| Продукт | Ціна | Де працює | Мін. вимоги | Ключова різниця |
|---|---|---|---|---|
| Gemini 3.8 Live | $0,005/хв вх., $0,018/хв вих. | Google AI Studio, API | Інтернет, аудіо-ввід/вивід | Фонове розсудження під час розмови |
| OpenAI Realtime API | ~$0,06/хв | Azure, API | Інтернет, аудіо-ввід/вивід | Більш зріла екосистема, але дорожче |
| Anthropic Claude Voice (очікується) | дані не розкриті | ожидається | TBD | Фокус на безпеці та довірі |
💬 Часті запитання
🔒 Підтекст (Insider)
Google не просто оновлює модель — вона стиснеться між OpenAI та Anthropic у голосовому ШІ, де швидкість та контекст стають новим полем боротьби. Ціль — захопити B2B-сегмент, де голосові агенти вже заміняють частину колл-центрів.
Такий розбір щоранку о 08:00
Персональний AI-дайджест для вашої галузі — щодня у Telegram
Навчіть вашу команду будувати такі AI-автоматизації
За 5 днів кожен співробітник побудує автоматизацію для своєї ділянки роботи.
Дізнатись більше → aiupskill.live