Google lança Gemini 3.8 Live e 3.8 Live Extended Thinking para assistentes de voz em tempo real
Modelos permitem que assistentes de voz narrem o progresso enquanto fazem chamadas de ferramentas em segundo plano — mudança que afeta latência, custos e integração para desenvolvedores e empresas.
O Google anunciou em 15 de setembro o Gemini 3.8 Live e o Gemini 3.8 Live Extended Thinking, disponíveis para desenvolvedores pela Gemini API, Google AI Studio e Live API, com implantações começando também para empresas e consumidores no Search Live e no Workspace.
O Gemini 3.8 Live foi otimizado para escala, baixa latência e menor custo por minuto. O Extended Thinking incorpora raciocínio em vários passos, e o modelo pode falar e raciocinar ao mesmo tempo, narrando o progresso durante tarefas longas em segundo plano.
O Google publicou tarifas da Live API de US$0,005 por minuto para entrada de áudio e US$0,018 por minuto para saída de áudio, e informou que o Extended Thinking adiciona cobranças por tokens de raciocínio e por entradas extras, como vídeo ao vivo e documentos.
A empresa informou resultados de benchmark favoráveis ao Extended Thinking em testes do setor, citando as principais pontuações no Speech-to-Speech Quality Index da Artificial Analysis e bom desempenho em tarefas de conclusão agente‑like. O Google também disse que todo áudio gerado inclui marcações imperceptíveis SynthID para rastreabilidade.
O lançamento evidencia uma divisão arquitetural no mercado de voz com IA: o Google mantém o raciocínio dentro de uma sessão de voz com estado, enquanto concorrentes separam uma camada de voz rápida dos mecanismos de raciocínio no back‑end. Essa escolha impacta a complexidade do middleware, o controle do desenvolvedor, a cobrança e a velocidade de implantação de agentes de voz em situações reais.