O Google lançou o Gemini 3.8 Live e o Gemini 3.8 Live Extended Thinking em 15 de setembro, classificando-os como seus modelos de áudio mais avançados até agora.
Os dois modelos conversam, raciocinam e executam tarefas, mas como eles são avaliados por analistas independentes? A versão Extended Thinking liderou o Índice Speech-to-Speech da Artificial Analysis, com 82,6, ficando à frente do GPT-Live-1 e do Grok Voice.
Say “hi” to our most advanced audio models from @GoogleDeepMind yet built for natural, production-ready voice applications.
🔷 Gemini 3.8 Live
🔷 Gemini 3.8 Live Extended Thinking
With these models, you can speak naturally, collaborate easily, and tackle complex tasks using… pic.twitter.com/TCcuANcIWl
— Google (@Google) September 15, 2026
Como os benchmarks avaliam o novo modelo de IA conversacional do Google
O Índice da Artificial Analysis faz uma média entre raciocínio para fala, desempenho como agente, preferência na arena e taxa de sucesso nas tarefas.
O Gemini 3.8 Live Extended Thinking, avaliado sob esforço elevado de raciocínio, estreou na primeira posição. O GPT-Live-1 Astra veio em seguida, com 81,5, e o Grok Voice Think Fast 2.0 High ficou com 81,3.
O Gemini 3.8 Live padrão ficou na quinta colocação, com pontuação de 76,0. As duas versões superaram o Gemini 3.1 Flash Live High, que registrou 71,5.
A diferença de desempenho como agente é ainda mais ampla. O Extended Thinking alcançou 68,6% no benchmark Tau Voice, frente aos 37,7% da geração anterior.
No benchmark de raciocínio para fala, o Extended Thinking marcou 97,7%, superando o Grok Voice, que atingiu 97,2%. No entanto, ficou atrás do Qwen Audio 3.0 Realtime Plus, que alcançou 99,2%.
Testadores humanos ainda preferem o modelo antigo do Gemini?
O preço é um fator decisivo. O modelo padrão custa US$ 0,84 por hora de áudio de entrada, valor cerca de metade do seu antecessor, de US$ 1,75, além de ser a menor tarifa entre os modelos avaliados no Índice.
O Extended Thinking tem custo de US$ 3,50 por hora, sendo mais acessível que o GPT-Live-1 Sol, a US$ 4,47 e o Grok Voice Think Fast 2.0 High, a US$ 4,80.
A latência também diminuiu. O tempo médio para emitir o primeiro áudio caiu para 1,18 segundo, frente aos 2,99 segundos do modelo Gemini anterior.
Apesar disso, os ouvintes ainda não estão totalmente convencidos. O Gemini 3.1 Flash Live lidera em preferência nas conversas às cegas do Speech Agent Arena, com Elo de 1.096.
O Gemini 3.8 Live aparece em segundo lugar, com 1.083. O Extended Thinking está atrás, com 990, apesar de concluir 89,1% das tarefas.
A Inteligência artificial de voz agora é avaliada por duas métricas que apontam para direções distintas: os benchmarks premiam o modelo com maior capacidade de raciocínio, enquanto a preferência favorece aquele com melhor habilidade de conversa. O Google atualmente lidera ambas as frentes, com diferentes modelos.
O artigo Google lança modelo de áudio mais avançado: veja como ele se classifica foi visto pela primeira vez em BeInCrypto Brasil.
