Google представила Gemini 3.8 Live: она лучше и дешевле решений OpenAI и xAI

Кодик кратко объясняет суть статьи
Google представила голосовые модели Gemini 3.8 Live и Gemini 3.8 Live Extended Thinking, способные к диалогу и параллельному рассуждению в реальном времени. Базовая версия оптимизирована для энергоэффективности, поддерживает 97 языков, обрабатывает видеопоток и использует API без разрыва диалога. Версия Extended Thinking предназначена для сложных задач и может «думать вслух», применяя речевые связки и информируя пользователя о ходе выполнения действий. В тестах модель заняла первое место в бенчмарках Speech to Speech Quality Index (82,6%), τ-Voice (68,6%) и τ³-Banking (35,1%), а также показала точность 97,7% в тесте Big Bench Audio. При этом стоимость использования у Google ниже, чем у конкурентов: $0,84 и $3,50 в час против $4,80 у Grok и $5,83 у GPT-Live-1 Astra. Все аудиовыходы помечаются цифровым водяным знаком SynthID. Модели доступны в Google AI Studio, Gemini Live API, Search Live, а также внедряются в приложение Gemini Live и сервисы Google Workspace — Docs Live, Gmail Live и Keep Live — для подписчиков Google AI.
Читайте в Telegram
|
Google представила диалоговые голосовые модели Gemini 3.8 Live и Gemini 3.8 Live Extended Thinking с возможностью параллельного рассуждения в реальном времени, о чём сообщила в блоге разработчиков.
Базовая версия Gemini 3.8 Live создана для масштабного внедрения и отличается высокой энергоэффективностью. Модель способна обрабатывать видеопоток с камеры практически в реальном времени, на лету переключаться между 97 поддерживаемыми языками прямо посреди фразы и вызывать внешние инструменты через API в фоновом режиме, не прерывая живой диалог паузами.




Модификация Gemini 3.8 Live Extended Thinking разработана для решения комплексных многоэтапных задач. Её главное отличие — способность думать и говорить одновременно. Модель использует естественные речевые связки вроде «Дай-ка я проверю», вслух озвучивает пользователю ход своих действий и координирует фоновые процессы без возникновения эффекта «мёртвой тишины».
В бенчмарке качества голосового взаимодействия Speech to Speech Quality Index от исследовательской платформы Artificial Analysis версия Gemini 3.8 Live Extended Thinking заняла первое место с результатом 82,6%, обойдя GPT-Live-1 Astra от OpenAI (81,5%) и Grok Voice Think Fast 2.0 от xAI (81,3%). Базовая Gemini 3.8 Live набрала 76,0%.
В тестах на выполнение агентных сценариев τ-Voice модель Extended Thinking также опередила конкурентов с показателем 68,6% против 67,9% у GPT-Live-1 Astra и 56,5% у Grok Voice. В профильном финансовом бенчмарке τ³-Banking от компании Sierra новинка Google достигла 35,1%, тогда как результат GPT-Live-1 Astra составил 32,0%, а xAI-Realtime — 16,5%. Логический тест Big Bench Audio модель завершила с точностью 97,7%.

При этом стоимость работы с моделями оказалась ниже решений конкурентов. По данным Artificial Analysis, один час входящего аудио для Gemini 3.8 Live обходится разработчикам в $0,84, а для версии Extended Thinking — в $3,50. Для сравнения, аналогичный объём у Grok Voice Think Fast 2.0 стоит $4,80, а у флагманской GPT-Live-1 Astra — $5,83. Все сгенерированные голосовые ответы маркируются невидимым цифровым водяным знаком SynthID для защиты от дезинформации.
Обе модели уже доступны разработчикам в Google AI Studio и через Gemini Live API. Базовая Gemini 3.8 Live появилась в сервисе Search Live, а версия Extended Thinking начала развёртываться в приложении Gemini Live и офисных сервисах Google Workspace — Docs Live, Gmail Live и Keep Live для подписчиков тарифов Google AI.






