Компанія Google презентувала дві нові голосові моделі — Gemini 3.8 Live і Gemini 3.8 Live Extended Thinking, які мають покращити швидкість, природність і складність взаємодії з штучним інтелектом. Про це повідомила сама компанія.
Gemini 3.8 Live орієнтована на масштабування та економічну ефективність, поєднуючи діалогові можливості, плавність розмови та роботу з візуальним контекстом. Модель Extended Thinking розрахована на складніші багатокрокові завдання, забезпечуючи глибший аналіз і посилене міркування. Обидві системи призначені для користувачів Gemini, Workspace, Search, а також для розробників корпоративних голосових агентів.
Google позиціонує ці моделі як основу для надійних голосових агентів, готових до використання у виробничих середовищах. Вони також покращують голосову взаємодію з Gemini у застосунку компанії, Google Workspace та пошуку. За даними Google, Gemini 3.8 Live Extended Thinking посіла перше місце у рейтингу Artificial Analysis Speech to Speech Quality Index із результатом 82,6 бала. У тесті τ-Voice на виконання агентних завдань вона показала 68,6%, а у банківському тесті Sierra τ-Voice — 35,1%. У Big Bench Audio модель набрала 97,7%. Google підкреслює, що ці результати поєднуються з конкурентною вартістю порівняно з іншими системами.
Gemini 3.8 Live також отримала високі оцінки користувачів і зайняла друге місце у Speech Agent Arena. Компанія окремо наголошує на її економічності та придатності для масштабного корпоративного використання. В EVA-Bench від ServiceNow обидві моделі досягли межі Парето — балансу між точністю виконання складних завдань і якістю діалогу.
Gemini 3.8 Live може обробляти візуальний контент майже в реальному часі, враховуючи зображення та інші візуальні дані під час розмови. Модель автоматично розпізнає та перемикається між 97 підтримуваними мовами без переривання діалогу, а також може запускати інструменти та API у фоновому режимі, не зупиняючи розмову з користувачем. Extended Thinking отримала можливість одночасно міркувати та говорити, виконуючи складні завдання у фоновому режимі й паралельно підтримуючи розмову. Google зазначає, що система використовує короткі природні фрази на кшталт "Дайте перевірю…" для миттєвої реакції на запит і може пояснювати хід виконання багатокрокових завдань у реальному часі.
"Дайте перевірю…"
Цю цитату компанія Google наводить як приклад природної реакції моделі під час виконання складних завдань.
Для розробників нові моделі доступні через Gemini Live API, який вже підтримують Agora, Fishjam, LangChain, LiveKit, Pipecat, Vercel і Vision Agents. Google також співпрацює з Salesforce, Genspark і Lumeris, де партнери позитивно оцінюють затримку, плавність діалогу та можливості виклику інструментів у нових моделях.
У липні Google розширила лінійку Gemini моделями 3.6 Flash, 3.5 Flash Lite та 3.5 Flash Cyber. Gemini 3.6 Flash замінила попередню версію та отримала покращені можливості програмування, а 3.5 Flash Lite стала найефективнішою для масштабування агентних рішень із мінімальними витратами. Gemini 3.5 Flash Cyber — перша велика мовна модель Google для кібербезпеки.
За словами Сундара Пічаї, у серпні застосунок Gemini перевищив 1 мільярд щомісячних активних користувачів і став 14-м продуктом Google із таким показником. Ця статистика стосується лише окремого застосунку й не враховує користувачів Gemini у Search, Workspace, Android та інших сервісах.

