Mensaje de IA de ME. Hoy anunciamos que Grok 4.6 de xAI ya está disponible en Amazon Bedrock. Incorpora un modelo de frontera diseñado para agentes de larga ejecución, programación y tareas de conocimiento, ampliando el catálogo de modelos de Bedrock. Grok 4.6 se lanzó en Bedrock el 18 de agosto de 2026. Ofrece una ventana de contexto de 500K tokens y admite un nivel de esfuerzo de razonamiento configurable en cuatro niveles: bajo, medio, alto y xhigh. Este es el segundo modelo de xAI en Amazon Bedrock. Cuando Grok 4.3 estuvo disponible de forma general, xAI se unió a Amazon Bedrock como proveedor de modelos y el modelo era accesible mediante Bedrock Mantle, el motor de inferencia compatible con OpenAI en Amazon Bedrock. Grok 4.6 amplía considerablemente esa superficie: está disponible en los endpoints bedrock-mantle y bedrock-runtime, y admite la API de Converse junto con Chat Completions y Responses. Este post cubre para qué dice xAI que está diseñado Grok 4.6, cómo se empaqueta en Amazon Bedrock y cómo enviar tu primera solicitud. Para qué está construido Grok 4.6 Las capacidades y detalles de entrenamiento de esta sección provienen del anuncio de lanzamiento de xAI, Introducing Grok 4.6. Grok 4.6 se basa en Grok 4.5 con un enfoque particular en agentes de larga duración y en trabajos interactivos y visuales más ambiciosos. xAI describe el modelo como capaz de mantenerse con tareas complejas a través de muchos pasos, ya sea investigando un tema, analizando información, trabajando en una base de código o convirtiendo una idea en una aplicación o artefacto de trabajo pulido. En el entrenamiento, xAI informa una ejecución de entrenamiento suplementario más larga que la de Grok 4.5. Usa datos curados generados por modelos para razonamiento y conceptos técnicos avanzados, datos de ingeniería de alta calidad y un optimizador y receta de entrenamiento mejorados. Luego utilizó Grok 4.5 para regenerar las trayectorias de fine-tuning supervisado para distintos esfuerzos de razonamiento, “agent harnesses” y dominios que incluyen STEM, ingeniería de software y trabajo de conocimiento, filtrando trazas problemáticas mediante comprobaciones basadas en el modelo. A continuación, el modelo se entrenó con una amplia gama de tareas de reinforcement learning orientadas a agentes (agentic), que abarcan trabajo de conocimiento, programación general y entornos específicos del dominio como optimización de kernels, desarrollo web y diseño asistido por computadora. Dos comportamientos que xAI destaca y que vale la pena notar para quienes construyen agentes: En trayectorias más largas, el modelo comenzó a mostrar más autocorrección y verificación, revisando su propio trabajo antes de continuar. También produce primeros intentos más sólidos en proyectos visuales e interactivos: establece la estructura y el lenguaje visual de una aplicación en una sola pasada. El equipo encontró esto útil donde la ruta más rápida hacia un buen resultado era empezar con algo sustancial y luego iterar. En seguridad, xAI afirma que las salvaguardas (safeguards) de Grok 4.6 han mejorado y se han calibrado en línea con las capacidades del modelo. Esto se respalda con lo que describe como su mayor batería de pruebas hasta la fecha previa al despliegue para capacidades y calibración de salvaguardas, además de pruebas posteriores al despliegue y de terceros. La empresa posiciona su “stack” de seguridad como una forma de maximizar la utilidad y la seguridad en casos de uso legítimos en dominios como el parcheo de vulnerabilidades, acelerar el ciclo de diseño de ingeniería y potenciar la investigación en IA. Resultados de benchmarks reportados xAI reporta que Grok 4.6 logra inteligencia de frontera en varios benchmarks de programación de agentes y trabajo de conocimiento. Estas son las cifras que publicó para Grok 4.6 High en el lanzamiento del 12 de agosto de 2026: Evaluation Grok 4.6 High AA Intelligence Index 61 GDPVal-AA v2 1753 CursorBench v3.2 69.9% DeepSWE v1.1 65.9% FrontierCode v1.1 (Extended) 61.3% APEX-Agents 57.5% Terminal-Bench v3.0 26% APEX-SWE 56.4% AA-Briefcase 1577 Harvey LAB (Vals) 15.8% Fuente: xAI, según https://x.ai/news/grok-4-6. Varias de estas evaluaciones provienen de Artificial Analysis, así que ayuda saber qué miden. Según Artificial Analysis, el Artificial Analysis Intelligence Index v4.1.1 es un compuesto que incorpora nueve evaluaciones: GDPval-AA v2, τ³-Banking, Terminal-Bench v2.1, SciCode, Humanity’s Last Exam, GPQA Diamond, CritPt, AA-Omniscience y AA-LCR. Cubren el uso de herramientas por agentes, razonamiento y conocimiento, confiabilidad del conocimiento, razonamiento con contexto largo y análisis cuantitativo sobre hojas de cálculo y documentos. AA-Briefcase es su benchmark de trabajo de conocimiento “agentic”, donde AA-Briefcase Elo agrega tasa de aprobación de rúbrica, Elo de calidad analítica y Elo de presentación; con puntajes más altos es mejor. Artificial Analysis también hace seguimiento de costo y latencia junto con la inteligencia. Su métrica de costo por tarea es un promedio ponderado del costo por tarea del Intelligence Index, derivado de precios de tokens de entrada, aciertos de caché, escritura de caché, razonamiento y respuesta. Es una lente útil si estás dimensionando una carga de trabajo de agente intensiva en razonamiento, donde los tokens de razonamiento son una partida real. Qué agrega Grok 4.6 en Bedrock Varias capacidades de Bedrock son nuevas para este modelo en vez de venir heredadas del lanzamiento anterior de Grok. El endpoint bedrock-runtime. Grok 4.6 se sirve en bedrock-runtime además de bedrock-mantle, así que puedes accederlo con los AWS SDK y la interfaz de control estándar de Bedrock, en lugar de solo un cliente compatible con OpenAI. La API de Converse, incluyendo streaming. Están disponibles tanto converse como converse_stream. Este es el beneficio práctico del soporte de runtime: una sola forma de mensaje entre modelos y streaming a través de los eventos habituales de Converse (messageStart, contentBlockDelta, contentBlockStop, messageStop, metadata), sin necesidad de “reconstruir” parsing de eventos SSE. Un nivel de esfuerzo de razonamiento xhigh. Los niveles de esfuerzo incluyen low, medium, high, xhigh, extendiendo el rango en el extremo superior para problemas donde merece la pena un pase más profundo en tokens. En Converse, configúralo mediante additionalModelRequestFields={"reasoning_effort": "xhigh"} en lugar de usar un parámetro de razonamiento. Inferencia entre regiones (Cross-Region inference). En bedrock-runtime, enrutas a través de uno de dos perfiles de inferencia en lugar de fijar a una sola Región. us.xai.grok-4.6 mantiene el tráfico dentro de la geografía de EE. UU. cuando tienes requisitos de residencia de datos, y global.xai.grok-4.6 enruta a nivel mundial para el mayor grupo de capacidad. Global además es más barato: $2.00 por millón de tokens de entrada frente a $2.20. Así que, si no hay restricción de residencia, normalmente es la mejor opción por defecto. Amazon Bedrock Guardrails. Grok 4.6 ahora admite Guardrails en bedrock-runtime en todas sus APIs, dándote filtros de contenido, temas denegados, redacción de información de identificación personal (PII) y políticas de palabras. Adjuntas un guardrail por ID y versión en la solicitud, y la política se evalúa tanto contra el prompt como contra la respuesta del modelo. En cargas agentic esto importa porque establece un límite de política consistente alrededor de un modelo que podría ejecutarse sin supervisión durante muchos pasos. Registro de invocación (Invocation logging). Con el registro de invocaciones habilitado, las llamadas a Grok 4.6 se capturan como registros completos de Amazon CloudWatch: cuerpo de la solicitud, cuerpo de la respuesta, conteos de tokens incluyendo tokens de razonamiento, y el perfil de inferencia usado. Es útil para auditar ejecuciones de agentes cuando necesitas ver qué se le pidió realmente al modelo. Caché de prompts (Prompt caching). La entrada en caché se factura aproximadamente a una cuarta parte de la tarifa estándar de entrada. Esto importa para agentes que reenvían un gran prompt del sistema o un documento en cada turno. El caching aplica a un prefijo repetido: mantén el contenido estable al inicio de la solicitud y revisa el conteo de tokens cacheados en el bloque de uso para confirmar el descuento antes de incorporarlo a tu modelo de costos. También están disponibles el “tool calling”, la salida estructurada, la entrada de imágenes, el streaming de respuesta y el contenido de razonamiento cifrado; pero esas funciones datan del lanzamiento de Grok 4.3 y se cubren en ese post. Cómo se empaqueta Grok 4.6 en Amazon Bedrock Grok 4.6 acepta entrada de texto e imagen y devuelve texto. No se admiten modalidades de audio, voz, video ni “embeddings”, y no genera imágenes. El modelo se puede alcanzar mediante dos endpoints, y el ID del modelo cambia según cuál uses: Endpoint | Model ID | Base URL bedrock-mantle | xai.grok-4.6 | https://bedrock-mantle.{region}.api.aws/openai/v1 bedrock-runtime | us.xai.grok-4.6 (Geo) o global.xai.grok-4.6 (Global) | https://bedrock-runtime.{region}.amazonaws.com/openai/v1 En el lado de la API, Grok 4.6 admite la Responses API, la Chat Completions API y la Converse API. La Invoke API no está soportada. El soporte de funciones difiere por endpoint, y ese es el detalle que probablemente más afecte tu elección de integración: En bedrock-mantle, las funciones soportadas incluyen tool calling del lado del cliente, razonamiento, salidas estructuradas, prompt caching, streaming de respuesta, “projects” y detección de abusos. En bedrock-runtime, las funciones soportadas incluyen razonamiento, prompt caching, streaming de respuesta, logs de invocación y “projects” (solo proyecto predeterminado). En ese endpoint no se admiten salidas estructuradas, uso de herramientas en el servidor, enrutamiento inteligente de prompts, conteo de tokens y perfiles de inferencia de aplicaciones. Tool calling funciona en ambos endpoints. El modelo devuelve una solicitud de función estructurada; tu código la ejecuta y luego pasas el resultado de vuelta. En bedrock-runtime puedes impulsar ese ciclo usando toolConfig de Converse o el parámetro tools compatible con OpenAI, así que los agentes que dependen de llamadas a funciones no se limitan a bedrock-mantle. Si tu aplicación depende de una salida estructurada con JSON Schema, eso te dirige a bedrock-mantle. Si quieres la API de Converse o el invocation logging, eso te dirige a bedrock-runtime. Regiones y opciones de inferencia La disponibilidad difiere por endpoint. En bedrock-mantle, Grok 4.6 está disponible para inferencia en la misma Región (in-Region inference) en US West (Oregon) (us-west-2). En bedrock-runtime, no se ofrece in-Region inference. En su lugar, invocas el modelo mediante perfiles de inferencia entre regiones. La inferencia cross-Region Geo está disponible desde las Regiones de EE. UU. (us-east-1, us-east-2, us-west-1 y us-west-2), y la inferencia cross-Region Global está disponible desde una lista considerablemente más larga que abarca EE. UU., Canadá, Europa, Asia Pacífico, Medio Oriente, África y Sudamérica. Geo cross-Region enruta entre Regiones dentro de una geografía respetando la residencia de datos, mientras que Global cross-Region enruta en cualquier parte del mundo cuando no hay restricciones de residencia. La tabla completa llega a más de 30 Regiones, así que revisa la tarjeta del modelo y la disponibilidad regional por página del modelo antes de fijar una Región. Esto es un cambio respecto al lanzamiento de Grok 4.3, donde, como se señaló en el post de Grok 4.3, la inferencia in-Region usaba solo el modelo en Región y no se ofrecía Geo ni Global cross-Region. Nivel de servicio y precios Grok 4.6 admite tres niveles de servicio. Standard es “pago por token” sin compromiso, seleccionado estableciendo "service_tier": "default" u omitiendo el campo. Priority entrega procesamiento más rápido y priorizado para un plan premium ("service_tier": "priority"). Flex ofrece acceso más barato para trabajos que no son sensibles al tiempo ("service_tier": "flex"). Para precios por token en los distintos niveles, consulta la página de precios de Amazon Bedrock. Los otros dos niveles se fijan como multiplicadores sobre las tasas Standard: Priority a 1.75x (un 75% adicional) y Flex a 0.5x (un 50% de descuento). Así, la misma carga que cuesta $2.20 por millón de tokens de entrada en ejecuciones Standard in-Region cuesta $3.85 en Priority y $1.10 en Flex. Por lo tanto, la selección del nivel es un factor de costo mayor que la elección de la Región. Como referencia, xAI lista precios de Grok 4.6 que empiezan en $2 por millón de tokens de entrada y $6 por millón de tokens de salida, con una variante rápida al doble del precio. Confirma siempre las tarifas actuales en la página de precios de Amazon Bedrock, porque cambian precios y niveles. Enviar tu primera solicitud Antes de tu primera llamada, confirma que el modelo está disponible para ti en la consola de Bedrock en la Región que planeas usar. Grok 4.6 se sirve mediante perfiles de inferencia en lugar de “throughput” bajo demanda en un ID de modelo desnudo; por eso las solicitudes usan us.xai.grok-4.6 o global.xai.grok-4.6 en bedrock-runtime. Grok 4.6 usa APIs compatibles con OpenAI, así que el SDK de OpenAI funciona contra cualquiera de los endpoints después de configurar la URL base. Instala el SDK y boto3 si planeas usar la API de Converse: pip install openai pip install boto3 Genera una clave de API de Amazon Bedrock de largo plazo desde la consola de Amazon Bedrock para exploración y luego configura tu entorno. Para bedrock-mantle: export OPENAI_API_KEY="" export OPENAI_BASE_URL="https://bedrock-mantle.us-west-2.api.aws/openai/v1" Para bedrock-runtime: export OPENAI_API_KEY="" export OPENAI_BASE_URL="https://bedrock-runtime.us-east-1.amazonaws.com/openai/v1" Una primera solicitud en bedrock-mantle con la Chat Completions API: from openai import OpenAI client = OpenAI() response = client.chat.completions.create( model="xai.grok-4.6", messages=[{"role": "user", "content": "Can you explain the features of Amazon Bedrock?"}], ) print(response) En bedrock-runtime la diferencia es el nombre del modelo: pasas un perfil de inferencia entre regiones en lugar del ID de modelo desnudo. Este ejemplo también cambia a la Responses API para mostrar la forma (shape): from openai import OpenAI client = OpenAI() response = client.responses.create( model="us.xai.grok-4.6", input="Can you explain the features of Amazon Bedrock?", ) print(response) Y mediante la API de Converse con boto3. Como el razonamiento está activo, el primer bloque de contenido lleva el razonamiento y la respuesta queda en un bloque posterior, así que busca el texto en los bloques en lugar de indexar content[0]: import boto3 client = boto3.client("bedrock-runtime", region_name="us-east-1") response = client.converse( modelId="us.xai.grok-4.6", messages=[{"role": "user", "content": [{"text": "Can you explain the features of Amazon Bedrock?"}]}], inferenceConfig={"maxTokens": 2048}, ) blocks = response["output"]["message"]["content"] text = next(b["text"] for b in blocks if "text" in b) print(text) En Converse configuras el nivel de esfuerzo con additionalModelRequestFields en vez de un parámetro de razonamiento: response = client.converse( modelId="us.xai.grok-4.6", messages=[{"role": "user", "content": [{"text": "What is 17*23? Number only."}]}], inferenceConfig={"maxTokens": 3000}, additionalModelRequestFields={"reasoning_effort": "xhigh"}, ) Tres notas operativas. Primero, en bedrock-runtime, Grok 4.6 no está disponible para inferencia in-Region, así que las solicitudes deben nombrar us.xai.grok-4.6 o global.xai.grok-4.6. Segundo, bedrock:InvokeModel se evalúa contra tres recursos: el proyecto predeterminado de tu cuenta, el perfil de inferencia que indicas y el modelo de base subyacente. El ARN del modelo de base se wildcardifica a través de Regiones porque los perfiles cross-Region enrutan fuera de la Región desde la que se llama. La autenticación con token bearer en los endpoints compatibles con OpenAI además requiere bedrock:CallWithBearerToken, que boto3 y Converse no necesitan: { "Version": "2012-10-17", "Statement": [ { "Effect": "Allow", "Action": "bedrock:InvokeModel", "Resource": [ "arn:aws:bedrock:{region}:{account-id}:project/default", "arn:aws:bedrock:{region}:{account-id}:inference-profile/us.xai.grok-4.6", "arn:aws:bedrock:*::foundation-model/xai.grok-4.6" ] }, { "Effect": "Allow", "Action": "bedrock:CallWithBearerToken", "Resource": "*" } ] } Tercero, los dos mecanismos de autenticación cubren rutas de código distintas. Una clave de API de Amazon Bedrock en OPENAI_API_KEY viaja como token bearer y autentica las llamadas compatibles con OpenAI en ambos endpoints. Los ejemplos de boto3 Converse firman con SigV4; se basan en tus credenciales AWS ordinarias del entorno, un perfil o un role. Configura ambos si planeas usar Converse junto con las APIs compatibles con OpenAI. Trata una clave API de largo plazo como un credencial solo para exploración. Para producción, el post del lanzamiento de Grok 4.3 recomienda tokens bearer de corto plazo generados a partir de tus credenciales IAM con el paquete aws-bedrock-token-generator, porque expiran automáticamente y mantienen el acceso ligado a tu identidad IAM. Esa guía aplica igualmente aquí. Trabajar con esfuerzo de razonamiento El razonamiento está activo en Grok 4.6 por defecto, y configuras cuánto de él invierte el modelo mediante el parámetro de razonamiento con low (el predeterminado), medium, high o xhigh. El nivel xhigh es nuevo respecto a lo que documentó el post del lanzamiento de Grok 4.3, donde los niveles eran ninguno, low, medium y high. El contenido de razonamiento está cifrado. Puedes hacer que se devuelva pasando include: ["reasoning.encrypted_content"] en una solicitud a la Responses API, y luego enviar ese contenido de vuelta en turnos posteriores para darle al modelo su propio razonamiento previo como contexto en una conversación de múltiples turnos. La API de Chat Completions no devuelve tokens de razonamiento. El razonamiento cifrado es una característica de la Responses API, así que este ejemplo usa el cliente de OpenAI en lugar del cliente de boto3 de los ejemplos anteriores de Converse: from openai import OpenAI client = OpenAI() # OPENAI_BASE_URL apunta al endpoint bedrock-runtime response = client.responses.create( model="us.xai.grok-4.6", reasoning={"effort": "high"}, include=["reasoning.encrypted_content"], input="Explain quantum entanglement simply.", ) print(response.output_text) Como el razonamiento está habilitado por defecto y el esfuerzo se define por solicitud, el nivel de esfuerzo es un control real de costo y latencia. Ejecuta llamadas cortas de extracción y clasificación con low y reserva high o xhigh para pasos de planificación y trayectorias largas de agentes, donde un error temprano se amplifica. Evaluar los niveles de esfuerzo frente a tu propia carga es la forma más rápida de encontrar dónde el razonamiento adicional deja de compensar su costo en tokens. Para empezar Grok 4.6 en Amazon Bedrock te ofrece un modelo de xAI construido para agentes de larga ejecución y trabajos interactivos ambiciosos: una ventana de contexto de 500K tokens, cuatro niveles de esfuerzo de razonamiento, entrada de imágenes, prompt caching y una elección entre el endpoint bedrock-mantle compatible con OpenAI y el endpoint bedrock-runtime con API de Converse y soporte de inferencia entre regiones. Para comenzar a construir, revisa la tarjeta del modelo Grok 4.6 para la lista actual de Regiones, la matriz de funciones y los detalles de parámetros, y consulta la página de precios de Amazon Bedrock para las tarifas por token. Si generaste una clave API de Amazon Bedrock de largo plazo para exploración, elimínala de la consola de Amazon Bedrock cuando termines. Una credencial permanente que ya no necesitas solo amplía la superficie de exposición de tu cuenta. Fuentes Tarjeta del modelo Grok 4.6 en Amazon Bedrock: https://docs.aws.amazon.com/bedrock/latest/userguide/model-card-xai-grok-4-6.html Modelos de xAI en Amazon Bedrock: https://docs.aws.amazon.com/bedrock/latest/userguide/model-cards-xai.html xAI, Introducing Grok 4.6: https://x.ai/news/grok-4-6 Artificial Analysis, model comparison and benchmark methodology: https://artificialanalysis.ai/models AWS, Introducing Grok on Amazon Bedrock (Grok 4.3): https://aws.amazon.com/blogs/machine-learning/introducing-grok-on-amazon-bedrock/ Sobre los autores Suheel Farooq Suheel es Principal Solutions Architect en AWS, especializado en inteligencia artificial, machine learning y IA generativa. Ayuda a los clientes de Foundation Model Provider a diseñar, construir, modernizar y escalar sus cargas de trabajo de IA/ML y de IA generativa en AWS. Su experiencia abarca el portafolio de IA/ML y de IA generativa de AWS, en particular Amazon Bedrock, Amazon Bedrock AgentCore y Amazon SageMaker AI. En su tiempo libre, a Suheel le gusta hacer ejercicio y hacer senderismo. Ikenna Izugbokwe Ikenna es Principal Solutions Architect en AWS especializado en redes, contenedores e infraestructura de IA. Guía a los proveedores de modelos para escalar sus sistemas de entrenamiento e inferencia mientras habilita el despliegue rápido de modelos de frontera en evolución en AWS. Su trabajo abarca cada vez más la IA agentic: construir sistemas multiagente confiables y eficientes en costos, y la infraestructura de inferencia que los respalda en producción. Fabio Branco Fabio es Senior Customer Solutions Manager en Amazon Web Services (AWS) y asesor estratégico que guía a los proveedores de modelos fundacionales en su recorrido de “go-to-market”. Antes de AWS, ocupó roles de Product Management, Engineering, Consulting y Technology Delivery en múltiples empresas Fortune 500, en industrias que incluyen retail y bienes de consumo, petróleo y gas, servicios financieros, seguros, así como aeroespacial y defensa. Saurabh Trikande Saurabh es Senior Product Manager para Amazon Bedrock y Amazon SageMaker Inference. Le apasiona trabajar con clientes y partners, motivado por el objetivo de democratizar la IA. Se enfoca en retos centrales relacionados con desplegar aplicaciones de IA complejas, inferencia con modelos multi-tenant, optimizaciones de costo y hacer que el despliegue de modelos de IA generativa sea más accesible. En su tiempo libre, Saurabh disfruta hacer senderismo, aprender sobre tecnologías innovadoras, seguir TechCrunch y pasar tiempo con su familia. Anirban Gupta Anirban es Principal Engineer en AWS con base en Seattle, EE. UU., donde se enfoca en el diseño de infraestructura segura para servir modelos a gran escala para Amazon Bedrock. Ha impulsado el trabajo técnico detrás de varios lanzamientos de modelos fundacionales en la plataforma. Antes de unirse a Amazon Bedrock, fue Principal Engineer en AWS Outposts, construyendo infraestructura híbrida de nube en las instalaciones. (来源:ME)
