Gemini 3.8 Live se lanzó el martes en tres niveles al mismo tiempo, ofreciendo a los consumidores el modelo dentro de Search Live, a los desarrolladores una vista previa pública mediante la Gemini API y a las empresas una vista previa privada a través de Gemini Enterprise. Google DeepMind, el laboratorio detrás de la familia de modelos Gemini, anunció el lanzamiento el martes, emparejando una versión estándar con una nueva variante de Gemini 3.8 Live Extended Thinking, diseñada para tareas conversacionales más largas y complejas.

El propio post de DeepMind describe los modelos como sus “modelos de Gemini Audio más avanzados hasta la fecha”, creados para hablar, pensar y manejar tareas en segundo plano sin interrumpir el flujo de la conversación. Esa distinción importa técnicamente.

Los asistentes de voz anteriores procesaban una solicitud, se detenían y luego respondían en un bucle rígido de turnos.

Los modelos en vivo están diseñados para seguir escuchando y razonando mientras ya están hablando, más parecido a cómo una persona mantiene una conversación pensando un paso adelante.

Cada clip de audio que generan los nuevos modelos incluye SynthID, el sistema de marcas de agua de DeepMind que incrusta una señal inaudible en el audio generado por IA para que pueda rastrearse como sintético incluso después de ediciones o compresión. El planteamiento de DeepMind presenta la marca de agua como una función predeterminada aplicada a toda la salida de audio de los nuevos modelos, no como un ajuste que los desarrolladores deban activar.

También lee: El modelo de IA local de Perplexity aterriza en las laptops de HP

Por qué la IA de voz necesitaba una capa de confianza

La clonación de voz sintética ha superado la capacidad de detección de la mayoría de las plataformas, alimentando una ola de llamadas de estafa y clips de audio fabricados que se difunden antes de que puedan desmentirse.

SynthID aborda un problema más acotado que la detección de deepfakes en general.

No puede impedir que los malos actores generen audio falso mediante otras herramientas, pero permite rastrear cualquier clip de Gemini 3.8 Live hasta su origen; una característica que las plataformas necesitan cada vez más para filtrar contenido sintético a gran escala.

Del texto a la conversación en vivo

La línea de productos en vivo de DeepMind comenzó como un modo de voz experimental acoplado a la API original de Gemini, lo que permitía a los desarrolladores probar una interacción de voz de baja latencia antes de un lanzamiento más amplio. El lanzamiento de este martes marca el paso de la línea de un complemento experimental a un producto de tres niveles que abarca de forma simultánea la búsqueda para consumidores, las herramientas para desarrolladores y la implementación empresarial, un impulso más amplio que las actualizaciones de investigación independientes de DeepMind, como su reciente estudio sobre impacto económico en los patrones de adopción de la IA.

Qué probarán primero las empresas

La vista previa privada para empresas es la parte que hay que observar.

Las empresas que adopten Gemini Enterprise necesitarán Gemini 3.8 Live para sostener la ejecución prolongada e ininterrumpida de tareas; la misma demanda está llevando a los competidores en las últimas semanas hacia agentes autónomos con poca supervisión. Si Extended Thinking puede mantener el contexto a través de flujos de trabajo empresariales de varios pasos sin comprobaciones constantes de humanos determinará si esta generación de modelos en vivo supera el estatus de demostración.

Lee siguiente: GPT-6 Astra le da a OpenAI su primer modelo diseñado para ejecutar sistemas sin supervisión