Google DeepMind представила Gemini 3.8 Live и Gemini 3.8 Live Extended Thinking. Обе модели работают в режиме speech-to-speech, поддерживают визуальный контекст и 97 языков. Для разработчиков Google открыла доступ через Gemini API и Google AI Studio, а Live-модели начала встраивать в Search, Gemini и Workspace.
У версий разные роли. Gemini 3.8 Live делает ставку на скорость и может вызывать инструменты прямо во время разговора, не прерывая диалог. Gemini 3.8 Live Extended Thinking рассчитана на более сложные многошаговые задачи: модель анализирует запрос и продолжает голосовой диалог, озвучивая промежуточный прогресс. Для голосовых ассистентов это сокращает паузы и оставляет пользователя в разговоре, пока система работает.
Цена Live API привязана к аудио: $0,005 за минуту входящего и $0,018 за минуту исходящего. Google также дала ориентир около $3 за 1 млн входных и $12 за 1 млн выходных аудиотокенов. Для контакт-центров, ботов и внутренних ассистентов это удобнее, чем считать только текстовые токены.