Google випустив Gemini 3.8 Live для голосових агентів
Google випустив Gemini 3.8 Live — модель, що розуміє візуальний контекст з камери або екрана, автоматично перемикається між 97 мовами та викликає інструменти та API у фоні без переривання розмови. Доступна версія Extended Thinking для складних завдань з розумінням.
🚀 Google запускає реальний інструмент. Gemini 3.8 Live з візуальним контекстом і 97 мовами — для тих, хто будує голосових агентів з контекстною свідомістю.
Що це означає для вас
Тестуйте Gemini 3.8 Live для створення голосових агентів, які аналізують екран клієнта під час консультації
🕐 Запустіть тестовий запит через API з передачею зображення екрану і оцініть реакцію моделі (15 хв)
📊 З новини: 97 мов🛠 Інструмент: Gemini 3.8 Live
Пропустіть, якщо: якщо ваші клієнти не використовують відеозв’язок або спілкуються текстом
Перевірте, чи може ваш голосовий агент «бачити» екран клієнта — це може підвищити конверсию в консультаціях.
Отримати карту AI-можливостей →🎯 Чи підходить це вашому бізнесу?
Заповніть профіль компанії — і ми автоматично покажемо, чи варто вам це впроваджувати.
Заповнити профіль · 30 секундTL;DR
- •Google випустив Gemini 3.8 Live — модель для голосових агентів із візуальним розумінням
- •Підтримує автоматичне переключення між 97 мовами у реальному часі
- •Може викликати інструменти та API у фоні без переривання розмови
- •Доступна версія Extended Thinking для складного розуміння
- •Обидві моделі мають однакову ціну за токен у API
Як це змінить ваш ринок?
Компанії у сфері підтримки та продажів зможуть створювати голосових агентів, які аналізують екран клієнта під час спілкування — наприклад, бачать форму, яку клієнт заповнює, або помилку в інтерфейсі. Це знімає блокер у розумінні контексту, який сьогодні вимагає ручного опису або спільного екрану. Для бізнесу це означає скорочення часу на вирішення проблеми та підвищення задоволеності клієнта без додаткових працівників.
Визначення: Голосовий агент — це AI-система, що спілкується голосом, розуміє контекст і може виконувати дії за запитом користувача.
Для кого це і за яких умов (ОБОВ'ЯЗКОВО: мін. обладнання/бюджет, потрібна команда чи ні, мін. масштаб, час на впровадження.
- •Для голосових агентів: потрібен доступ до Gemini API, здатність передавати зображення з камери/екрану, обробка потокового аудіо
- •Мін. масштаб: від 10+ спілкувань/день, щоб виправдати інтеграцію
- •Бюджет: вартість за токен (ціна не вказано в статті, але однакова для обох версій)
- •Час на впровадження: 1-2 дні для базової інтеграції з візуальним вводом, якщо вже використовуєте Gemini API
- •Потрібна команда: один розробник з досвідом роботи з мультимедіа API
Альтернативи (ТАБЛИЦЯ: | | Продукт 1 | Продукт 2 | Продукт 3 |
| Ціна | дані не розкриті | $0.002/1K токенів (Whisper) | $0.006/1K токенів (GPT-4o реал-тайм) | | Де працює | API Google | OpenAI API | OpenAI API | | Мін. вимоги | інтернет, Gemini API ключ | інтернет, OpenAI ключ | інтернет, OpenAI ключ | | Ключова різниця | візуальний контекст + 97 мов | лише аудіо, англійська-орієнтований | аудіо + текст, обмежена мова |
💬 Часті запитання
🔒 Підтекст (Insider)
Це не просто ще одна модель — це крок до природного спілкування з AI, де бот «бачить» те, що бачите ви. Google відповідає на попит у B2B-секторі на агенти, що працюють у реальному часі з даними з екрану або камери — наприклад, підтримка або продажі через відеозв’язок.
Такий розбір щоранку о 08:00
Персональний AI-дайджест для вашої галузі — щодня у Telegram
Навчіть вашу команду будувати такі AI-автоматизації
За 5 днів кожен співробітник побудує автоматизацію для своєї ділянки роботи.
Дізнатись більше → aiupskill.live