Google lança versão do Gemini que raciocina enquanto conversa por voz

Wait 5 sec.

O Google anunciou, nesta terça-feira (15), dois novos modelos de inteligência artificial (IA) voltados para interações por voz: o Gemini 3.8 Live e o Gemini 3.8 Live Extended Thinking. Segundo a empresa, as novidades foram desenvolvidas para tornar as conversas com IA mais naturais e inteligentes, além de permitir que os sistemas realizem tarefas complexas enquanto continuam conversando com o usuário.Os modelos foram apresentados como as versões mais avançadas do Google para diálogo em tempo real. A principal diferença entre eles está na capacidade de raciocínio: enquanto o Gemini 3.8 Live é voltado para interações de voz com maior escala e eficiência, o Gemini 3.8 Live Extended Thinking acrescenta recursos de raciocínio mais avançado e processamento de várias etapas.IA pode continuar trabalhando enquanto conversaUm dos principais recursos do Gemini 3.8 Live é a capacidade de executar ferramentas e chamadas de API em segundo plano sem interromper a conversa;Na prática, o usuário pode fazer um pedido e a IA pode reconhecer a solicitação e continuar o trabalho enquanto a interação por voz prossegue;O modelo também consegue processar informações visuais fornecidas por câmeras e outras fontes praticamente em tempo real, usando essas informações como contexto para a conversa;Outro recurso é a capacidade de identificar e alternar automaticamente entre 97 idiomas durante uma conversa;Segundo o Google, o Gemini 3.8 Live alcançou o segundo lugar nas avaliações de usuários do Speech Agent Arena, que mede o desempenho de sistemas de interação por voz;O modelo está sendo disponibilizado como uma opção voltada a desenvolvedores e empresas que buscam combinar desempenho com eficiência de custos.Versão com raciocínio avançadoO Gemini 3.8 Live Extended Thinking vai além da conversação e foi projetado para lidar com tarefas mais complexas que exigem raciocínio e processamento em várias etapas.Uma das características destacadas pelo Google é a capacidade de raciocinar e falar simultaneamente. Isso permite que a IA continue interagindo com o usuário enquanto trabalha em tarefa mais longa.Em vez de simplesmente ficar em silêncio durante o processamento, o sistema pode responder de maneira natural, com frases, como “deixe-me verificar isso para você”, enquanto executa as etapas necessárias em segundo plano.A IA também pode explicar o andamento de tarefas mais complexas conforme elas são realizadas.Novas versões chegam a aplicações, como Gmail, Docs, Keep e Search Live – Imagem: One Artist / ShutterstockLeia mais:7 usos criativos do Google Gemini que você deveria testar8 funções do Gemini que só funcionam no appFinalmente! Google lança app do Gemini para Windows — e ele quer ficar no seu PCGemini chega ao Gmail, Docs e KeepAs novas capacidades não ficarão restritas ao desenvolvimento de aplicativos. O Google está levando o Gemini 3.8 Live Extended Thinking para diferentes produtos e serviços. No Google Workspace, a tecnologia será usada em recursos de voz para Docs, Gmail e Keep.No Docs, por exemplo, o recurso Docs Live permite utilizar comandos de voz para realizar tarefas no documento. O mesmo princípio é aplicado ao Gmail Live e ao Keep Live.O modelo também está chegando ao Search Live, permitindo interações por voz com recursos de orientação em tempo real e instruções passo a passo.Desempenho em testesO Google também apresentou resultados de avaliações para demonstrar as capacidades do Gemini 3.8 Live Extended Thinking.O modelo ficou em primeiro lugar geral, com 82,6 pontos, no Speech to Speech Quality Index, da Artificial Analysis, voltado à qualidade de interação por voz.Em outro teste, o τ-Voice, que avalia a capacidade de agentes executarem tarefas, o modelo obteve 68,6%. Já no benchmark τ-Voice-banking, voltado a tarefas do setor financeiro, o resultado foi de 35,1%.DisponibilidadeO Gemini 3.8 Live já começou a ser disponibilizado para desenvolvedores por meio da Gemini API e do Google AI Studio. Empresas podem acessar o modelo por meio de uma prévia privada do Gemini Enterprise, enquanto usuários comuns terão acesso pelo Search Live.O Gemini 3.8 Live Extended Thinking também já começou a chegar à Gemini API e ao Google AI Studio para desenvolvedores e está disponível em prévia privada no Gemini Enterprise.Para usuários finais, a tecnologia está sendo incorporada ao aplicativo Gemini e a recursos do Workspace. No Google Docs, o recurso está disponível para assinantes dos planos Google AI Pro e Google AI Ultra. Gmail Live e Keep Live chegam aos assinantes dos planos Google AI Plus, Google AI Pro e Google AI Ultra.O post Google lança versão do Gemini que raciocina enquanto conversa por voz apareceu primeiro em Olhar Digital.