Компания Google представила две новые голосовые модели — Gemini 3.8 Live и Gemini 3.8 Live Extended Thinking, которые призваны улучшить скорость, естественность и сложность взаимодействия с искусственным интеллектом. Об этом сообщила сама компания.
Gemini 3.8 Live ориентирована на масштабирование и экономическую эффективность, сочетая диалоговые возможности, плавность разговора и работу с визуальным контекстом. Модель Extended Thinking рассчитана на более сложные многошаговые задачи, обеспечивая более глубокий анализ и усиленное рассуждение. Обе системы предназначены для пользователей Gemini, Workspace, Search, а также для разработчиков корпоративных голосовых агентов.
Google позиционирует эти модели как основу для надежных голосовых агентов, готовых к использованию в производственных средах. Они также улучшают голосовое взаимодействие с Gemini в приложении компании, Google Workspace и поиске. По данным Google, Gemini 3.8 Live Extended Thinking заняла первое место в рейтинге Artificial Analysis Speech to Speech Quality Index с результатом 82,6 балла. В тесте τ-Voice на выполнение агентных задач она показала 68,6%, а в банковском тесте Sierra τ-Voice — 35,1%. В Big Bench Audio модель набрала 97,7%. Google подчеркивает, что эти результаты сочетаются с конкурентной стоимостью по сравнению с другими системами.
Gemini 3.8 Live также получила высокие оценки пользователей и заняла второе место в Speech Agent Arena. Компания отдельно отмечает её экономичность и пригодность для масштабного корпоративного использования. В EVA-Bench от ServiceNow обе модели достигли грани Парето — баланса между точностью выполнения сложных задач и качеством диалога.
Gemini 3.8 Live может обрабатывать визуальный контент почти в реальном времени, учитывая изображения и другие визуальные данные во время разговора. Модель автоматически распознаёт и переключается между 97 поддерживаемыми языками без прерывания диалога, а также может запускать инструменты и API в фоновом режиме, не останавливая разговор с пользователем. Extended Thinking получила возможность одновременно рассуждать и говорить, выполняя сложные задачи в фоновом режиме и параллельно поддерживая разговор. Google отмечает, что система использует короткие естественные фразы типа «Дайте проверю…» для мгновенной реакции на запрос и может объяснять ход выполнения многошаговых задач в реальном времени.
"Дайте проверю…"
Эту цитату компания Google приводит как пример естественной реакции модели при выполнении сложных задач.
Для разработчиков новые модели доступны через Gemini Live API, который уже поддерживают Agora, Fishjam, LangChain, LiveKit, Pipecat, Vercel и Vision Agents. Google также сотрудничает с Salesforce, Genspark и Lumeris, где партнёры положительно оценивают задержку, плавность диалога и возможности вызова инструментов в новых моделях.
В июле Google расширила линейку Gemini моделями 3.6 Flash, 3.5 Flash Lite и 3.5 Flash Cyber. Gemini 3.6 Flash заменила предыдущую версию и получила улучшенные возможности программирования, а 3.5 Flash Lite стала самой эффективной для масштабирования агентных решений с минимальными затратами. Gemini 3.5 Flash Cyber — первая крупная языковая модель Google для кибербезопасности.
По словам Сундара Пичаи, в августе приложение Gemini превысило 1 миллиард ежемесячных активных пользователей и стало 14-м продуктом Google с таким показателем. Эта статистика касается только отдельного приложения и не учитывает пользователей Gemini в Search, Workspace, Android и других сервисах.

