Компания представила Gemini 3.8 Live и расширенную версию Extended Thinking. Первая модель нацелена на масштабируемость и экономичность. Решение объединяет диалоговый интеллект с плавной речью. Также модель обладает развитым визуальным восприятием.
Вторая версия предназначена для сложных многоэтапных задач. Extended Thinking усиливает общий интеллект и многошаговые рассуждения модели.
Обе модели уже доступны разработчикам через Gemini API. Также доступ открыт в Google AI Studio. Корпоративные клиенты получат модели в Gemini Enterprise на этапе закрытого тестирования. Обычные пользователи уже могут попробовать 3.8 Live в Search Live.
Google опубликовала результаты тестирования качества голоса и выполнения задач. Extended Thinking заняла первое место в индексе Speech to Speech Quality. Модель набрала 82,6 балла в рейтинге Artificial Analysis.
В тестах τ-Voice и τ-Voice-banking от Sierra результаты составили 68,6 и 35,1 процента. По тесту Big Bench Audio модель показала результат 97,7 процента. Обычная версия Gemini 3.8 Live заняла второе место в Speech Agent Arena.
По заявлению Google, обе модели улучшили баланс точности и качества диалога. Тестирование проводилось на платформе EVA-Bench компании ServiceNow. Проверка велась через Live API платформы Gemini Enterprise Agent.
Gemini 3.8 Live обрабатывает визуальные данные практически в реальном времени. Модель автоматически определяет и переключает девяносто семь поддерживаемых языков. Вызовы инструментов и API-запросы выполняются в фоновом режиме. Модель сначала подтверждает запрос пользователя. Диалог продолжается без пауз во время выполнения задачи.
Версия Extended Thinking работает иначе, совмещая рассуждение с речью. Модель использует фразы вроде «дайте мне проверить» при получении вопроса. Затем система озвучивает прогресс выполнения многошаговых фоновых задач.
Google продемонстрировала несколько практических сценариев использования технологии. Модель помогала в реальном времени играть в шахматы. Система также превращала наброски на доске в готовые компоненты React. Голосовая обратная связь дополняла визуальный ввод в этом сценарии. Отдельная демонстрация показала координацию многоэтапных бронирований и асинхронных вызовов функций.
Компания назвала партнеров по развитию голосовой инфраструктуры для разработчиков. В список вошли Agora, Fishjam и LangChain. Также партнерами стали LiveKit, Pipecat, Vercel и Vision Agents. Эти компании обеспечивают потоковую передачу медиа через Gemini Live API. Разработчикам больше не нужно создавать базовую инфраструктуру самостоятельно.
Среди корпоративных партнеров Google назвала Salesforce, Genspark и Lumeris. Основной фокус этих компаний направлен на задержку и плавность речи. Также важна эффективность вызова инструментов в реальных сценариях.
Весь аудиоконтент от продуктов Google получает встроенный водяной знак SynthID. Технология работает незаметно для конечного пользователя.
Ранее в этом месяце Google уже выпустила модель Gemini 3.8 Flash. Также вышла специализированная версия Flash Cyber для поиска уязвимостей. Эта модель автоматически исправляет обнаруженные проблемы безопасности. Голосовые модели Live дополняют линейку 3.8 функцией реального общения.
Extended Thinking уже интегрирована в приложение Gemini Live. Функция также доступна в Google Docs для подписчиков AI Pro и Ultra. Пользователи Gmail и Keep получат доступ при любой подписке Google AI. Корпоративные версии продуктов пока обозначены статусом «скоро выйдут».
