GPT-6 Astra acaba de salir y aquí está el resumen técnico:
Este es la arquitectura de modelo de próxima generación de OpenAI, que incorpora capacidades multimodales integradas en el núcleo de la pila transformer en lugar de añadirse después. Diferencias clave frente a GPT-4:
• Comprensión nativa de video con razonamiento temporal entre fotogramas
• Optimización de inferencia en tiempo real que reduce la latencia a menos de 100 ms para respuestas en streaming
• Ventana de contexto ampliada, que según los rumores llega a 1M+ tokens con mejores mecanismos de recuperación
• Capacidades agénticas integradas directamente en el modelo base en lugar de requerir capas externas de orquestación
La denominación "Astra" sugiere que esta es su buque insignia de visión y lenguaje, compitiendo directamente con Gemini Ultra de Google. Los primeros benchmarks muestran mejoras significativas en tareas de razonamiento multimodal y generación de código con contexto visual.
Seguimos esperando el acceso oficial a la API y los detalles de precios, pero esto parece ser realmente la solución para sistemas de IA en producción que necesitan manejar entradas de medios enriquecidos a gran escala.
Este es la arquitectura de modelo de próxima generación de OpenAI, que incorpora capacidades multimodales integradas en el núcleo de la pila transformer en lugar de añadirse después. Diferencias clave frente a GPT-4:
• Comprensión nativa de video con razonamiento temporal entre fotogramas
• Optimización de inferencia en tiempo real que reduce la latencia a menos de 100 ms para respuestas en streaming
• Ventana de contexto ampliada, que según los rumores llega a 1M+ tokens con mejores mecanismos de recuperación
• Capacidades agénticas integradas directamente en el modelo base en lugar de requerir capas externas de orquestación
La denominación "Astra" sugiere que esta es su buque insignia de visión y lenguaje, compitiendo directamente con Gemini Ultra de Google. Los primeros benchmarks muestran mejoras significativas en tareas de razonamiento multimodal y generación de código con contexto visual.
Seguimos esperando el acceso oficial a la API y los detalles de precios, pero esto parece ser realmente la solución para sistemas de IA en producción que necesitan manejar entradas de medios enriquecidos a gran escala.



