Google lanzó Gemini 3.8 Live y Gemini 3.8 Live Extended Thinking el 15 de septiembre, llamándolos sus modelos de audio más avanzados hasta la fecha.

Los dos modelos hablan, razonan y gestionan tareas. Pero, ¿cómo se posicionan frente a analistas independientes? La versión Extended Thinking encabezó el Speech-to-Speech Index de Artificial Analysis con 82.6, por delante de GPT-Live-1 y Grok Voice.

Síguenos en X para conocer las últimas novedades en el momento en que ocurren

Di “hola” a nuestros modelos de audio más avanzados de @GoogleDeepMind hasta ahora, diseñados para aplicaciones de voz naturales y listas para producción.🔷 Gemini 3.8 Live🔷 Gemini 3.8 Live Extended ThinkingCon estos modelos, puedes hablar con naturalidad, colaborar con facilidad y abordar tareas complejas usando… pic.twitter.com/TCcuANcIWl

— Google (@Google) 15 de septiembre de 2026

Cómo se clasifican los nuevos modelos de IA conversacional de Google en los benchmarks

El Index de Artificial Analysis promedia el razonamiento en voz, el rendimiento agentic, la preferencia en el arena y la tasa de éxito de tareas.

Gemini 3.8 Live con razonamiento extendido, probado con alto esfuerzo de razonamiento, debutó en el primer lugar. GPT-Live-1 Astra le siguió con 81,5 y Grok Voice Think Fast 2.0 High con 81,3.

La Gemini 3.8 Live estándar quedó quinta con una puntuación de 76,0. Ambas variantes superaron a Gemini 3.1 Flash Live High, que obtuvo 71,5.

La brecha es aún mayor en el enfoque agentic. Extended Thinking alcanzó 68,6% en el benchmark Tau Voice, frente al 37,7% de la generación anterior.

En el benchmark de razonamiento en voz, Extended Thinking obtuvo 97,7%, superando por poco a Grok Voice, que logró 97,2%. Sin embargo, quedó por detrás de Qwen Audio 3.0 Realtime Plus, que marcó 99,2%.

Los evaluadores humanos siguen apostando por el modelo Gemini más antiguo

El precio es donde se abre la distancia. El modelo estándar cuesta 0,84 $ por hora de audio de entrada. Eso equivale aproximadamente a la mitad del precio de su predecesor, 1,75 $, y de la tarifa más barata del Index. 

El razonamiento extendido funciona a 3,50 $ por hora. Eso rebaja a GPT-Live-1 Sol, que cuesta 4,47 $, y a Grok Voice Think Fast 2.0 High, que cuesta 4,80 $.

También bajó la latencia. El tiempo promedio hasta el primer audio cayó a 1,18 segundos, frente a los 2,99 segundos del modelo Gemini más antiguo.

Sin embargo, a los oyentes no les convence del todo. Gemini 3.1 Flash Live sigue liderando en preferencia en conversaciones del Speech Agent Arena a ciegas, con un Elo de 1096.

Gemini 3.8 Live ocupa el segundo lugar con 1083. La variante de Extended Thinking se queda atrás con 990, a pesar de completar el 89,1% de sus tareas.

Ahora la IA de voz se está evaluando en dos escalas que apuntan en direcciones distintas. Los benchmarks premian al modelo que razona con más fuerza. La preferencia recompensa a quien habla mejor. Google lidera ambos actualmente, con modelos distintos.

Suscríbete a nuestro canal de YouTube para ver cómo los líderes y los periodistas comparten información experta