O Google anunciou, nesta terça-feira (15), dois novos modelos de inteligência artificial voltados para interações por voz: o Gemini 3.8 Live e o Gemini 3.8 Live Extended Thinking. Segundo a empresa, as ferramentas foram desenvolvidas para tornar as conversas com a IA mais naturais e inteligentes, além de permitir a execução de tarefas complexas durante a interação com o usuário.
Os modelos foram apresentados como as versões mais avançadas do Google para diálogos em tempo real. O Gemini 3.8 Live é voltado a interações de voz em maior escala e com eficiência, enquanto o Gemini 3.8 Live Extended Thinking acrescenta recursos de raciocínio avançado e processamento em várias etapas.
Um dos principais recursos do Gemini 3.8 Live é a possibilidade de executar ferramentas e chamadas de API em segundo plano sem interromper a conversa. Assim, o usuário pode fazer um pedido, e a IA reconhece a solicitação e continua o trabalho enquanto a interação por voz prossegue.
O modelo também consegue processar informações visuais fornecidas por câmeras e outras fontes praticamente em tempo real, usando esses dados como contexto para a conversa. Outra função é a identificação e alternância automática entre 97 idiomas durante uma interação.
De acordo com o Google, o Gemini 3.8 Live alcançou o segundo lugar nas avaliações de usuários do Speech Agent Arena, que mede o desempenho de sistemas de interação por voz. O modelo está sendo disponibilizado para desenvolvedores e empresas que buscam combinar desempenho com eficiência de custos.
Já o Gemini 3.8 Live Extended Thinking foi projetado para lidar com tarefas mais complexas, que exigem raciocínio e processamento em várias etapas. Entre os recursos destacados está a capacidade de raciocinar e falar simultaneamente, mantendo a interação com o usuário enquanto executa uma tarefa mais longa.
Em vez de permanecer em silêncio durante o processamento, o sistema pode responder de forma natural, com frases como “deixe-me verificar isso para você”, enquanto realiza as etapas necessárias em segundo plano. A IA também pode explicar o andamento de tarefas complexas conforme elas são executadas.
As novas capacidades também serão incorporadas a produtos e serviços do Google. No Workspace, o Gemini 3.8 Live Extended Thinking será usado em recursos de voz para Docs, Gmail e Keep. No Docs, o recurso Docs Live permitirá realizar tarefas em documentos por meio de comandos de voz. O mesmo princípio será aplicado ao Gmail Live e ao Keep Live.
O modelo também está chegando ao Search Live, com interações por voz, orientação em tempo real e instruções passo a passo.
O Google apresentou ainda resultados de avaliações do Gemini 3.8 Live Extended Thinking. O modelo ficou em primeiro lugar geral, com 82,6 pontos, no Speech to Speech Quality Index, da Artificial Analysis, voltado à qualidade de interações por voz. No teste τ-Voice, que avalia a capacidade de agentes executarem tarefas, obteve 68,6%. Já no benchmark τ-Voice-banking, direcionado a tarefas do setor financeiro, alcançou 35,1%.
O Gemini 3.8 Live já começou a ser disponibilizado para desenvolvedores por meio da Gemini API e do Google AI Studio. Empresas podem acessar o modelo em uma prévia privada do Gemini Enterprise, enquanto usuários comuns terão acesso pelo Search Live.
O Gemini 3.8 Live Extended Thinking também começou a chegar à Gemini API e ao Google AI Studio para desenvolvedores e está disponível em prévia privada no Gemini Enterprise. Para usuários finais, a tecnologia está sendo incorporada ao aplicativo Gemini e a recursos do Workspace.
No Google Docs, o recurso está disponível para assinantes dos planos Google AI Pro e Google AI Ultra. Gmail Live e Keep Live chegam aos assinantes dos planos Google AI Plus, Google AI Pro e Google AI Ultra.











