A gigante de tecnologia introduziu ao mercado as variantes Gemini 3.8 Live e Gemini 3.8 Live Extended Thinking. O grande diferencial das tecnologias reside na capacidade de processar pensamentos lógicos durante uma troca verbal com o usuário, realizando rotinas secundárias sem causar interrupções no fluxo da conversa. Enquanto a versão tradicional já opera no Search Live, as ferramentas avançadas de pensamento estendido chegam progressivamente ao aplicativo dedicado e ao ecossistema do Google Workspace, seguindo as regras de elegibilidade de cada modalidade de assinatura. A API do Gemini e o Google AI Studio também liberaram o acesso para desenvolvedores, além de iniciarem uma prévia restrita voltada a clientes corporativos no Gemini Enterprise.
No segmento corporativo e de produtividade, o recurso Docs Live foi integrado aos pacotes Google AI Pro e Ultra. Por sua vez, as funcionalidades Gmail Live e Keep Live tornaram-se acessíveis para os assinantes das faixas AI Plus, Pro e Ultra. Essas conexões permitem empregar comandos falados para manipular textos, mensagens eletrônicas e anotações enquanto a inteligência artificial executa as demandas em plano de fundo.
A separação fundamental entre as duas edições baseia-se no escopo do trabalho: o Gemini 3.8 Live foca em agilidade, escalabilidade e eficiência de custos, ao passo que o Gemini 3.8 Live Extended Thinking foi desenhado para demandas complexas que exigem múltiplos passos lógicos. Ambas as variações trazem suporte visual simultâneo e identificação automática de dialetos, podendo alternar dinamicamente entre 97 línguas durante o mesmo bate-papo.

Os novos modelos do Gemini conseguem manter conversas por voz enquanto executam tarefas em segundo plano. (Viviane França/Canaltech)
Capacidade de raciocinar durante o diálogo falado
Os novos algoritmos foram concebidos para analisar dados e efetuar comandos sem cortar a comunicação verbal. Em vez de congelar a interface até concluir uma atividade, o assistente reconhece o pedido, aciona a rotina interna e prossegue dialogando enquanto a tarefa é finalizada — cenário útil para buscas informacionais, geração de códigos ou agendamentos.
Na modalidade Extended Thinking, a interface emprega locuções breves para sinalizar o andamento das operações, a exemplo de expressões como “deixe-me verificar isso para você”. O objetivo é eliminar vazios prolongados de silêncio, tornando a experiência auditiva mais fluida e orgânica. Em dinâmicas complexas, o sistema chega a relatar o progresso das etapas enquanto executa as ações em paralelo.
A experiência também une áudio e visão computacional. Por meio da câmera do dispositivo, o Gemini interpreta o cenário físico ao redor e utiliza esses inputs para orientar o interlocutor, com aplicações práticas que vão desde o suporte estratégico em uma partida de xadrez até o treinamento interativo de novos colaboradores corporativos.
Desempenho em testes especializados e segurança

O Gemini consegue interpretar voz e imagens da câmera em tempo real para responder aos comandos do usuário. (Solen Feyissa/Unsplash)
As soluções foram submetidas a rigorosos testes comparativos de voz. O Gemini 3.8 Live Extended Thinking conquistou 82,6 pontos no índice de qualidade de conversação (Speech to Speech Quality Index), assegurando a liderança geral, além de atingir 97,7% no Big Bench Audio. O modelo também obteve 68,6% no parâmetro de conclusão de tarefas automatizadas para agentes de áudio (τ-Voice) e 35,1% na vertente financeira (τ-Voice-banking). Na arena de preferência dos usuários (Speech Agent Arena), o Gemini 3.8 Live tradicional garantiu a segunda colocação.
Para assegurar a autenticidade e a rastreabilidade das mídias, todas as faixas de áudio geradas por meio do recurso contêm uma marca d’água digital invisível implementada pelo sistema SynthID, tecnologia proprietária voltada a facilitar a identificação de mídias sintéticas e ampliar a transparência sobre a origem dos conteúdos.





