Mensagem da ME AI, Hoje, anunciamos que o xAI’s Grok 4.6 está disponível no Amazon Bedrock, adicionando um modelo de fronteira construído para agentes de longa duração, codificação e trabalho com conhecimento ao catálogo de modelos do Bedrock. O Grok 4.6 foi lançado no Bedrock em 18 de agosto de 2026. Ele oferece uma janela de contexto de 500K tokens e suporta esforço de raciocínio configurável em quatro níveis: low, medium, high e xhigh. Este é o segundo modelo do xAI no Amazon Bedrock. Quando o Grok 4.3 se tornou geralmente disponível, o xAI entrou no Amazon Bedrock como provedor de modelos e o modelo pôde ser acessado via Bedrock Mantle, o mecanismo de inferência compatível com OpenAI no Amazon Bedrock. O Grok 4.6 amplia consideravelmente essa superfície: está disponível tanto nos endpoints bedrock-mantle quanto bedrock-runtime, e suporta a Converse API além de Chat Completions e Responses. Este post aborda para que o xAI diz que o Grok 4.6 foi projetado, como ele é empacotado no Amazon Bedrock e como enviar seu primeiro pedido. O que o Grok 4.6 foi construído para A capacidade e os detalhes de treinamento nesta seção vêm do anúncio de lançamento do xAI, Introducing Grok 4.6. O Grok 4.6 se baseia no Grok 4.5 com um foco específico em agentes de longa duração e em trabalho interativo e visual mais ambicioso. O xAI descreve o modelo como mantendo tarefas complexas ao longo de muitos passos, seja pesquisando um tópico, analisando informações, trabalhando em uma base de código ou transformando uma ideia em um aplicativo ou artefato de trabalho bem polido. No treinamento, o xAI relata uma execução de treino suplementar mais longa do que a do Grok 4.5, usando dados de modelos gerados e curados para raciocínio e conceitos técnicos avançados, dados de engenharia de alta qualidade e um otimizador e receita de treinamento aprimorados. Em seguida, usou o Grok 4.5 para regenerar as trajetórias de fine-tuning supervisionado para esforços de raciocínio, frameworks de agentes e domínios, incluindo STEM, engenharia de software e trabalho com conhecimento, filtrando traços problemáticos com verificações baseadas no modelo. O modelo então foi treinado em uma ampla variedade de tarefas de reinforcement learning orientadas a agentes, cobrindo trabalho com conhecimento, codificação geral e ambientes específicos de domínio, como otimização de kernel, desenvolvimento web e design auxiliado por computador. Dois comportamentos que o xAI destaca valem a pena para quem está construindo agentes. Em trajetórias mais longas, o modelo começou a mostrar mais auto-testes e verificação, checando o próprio trabalho antes de avançar. Ele também produz primeiras passagens mais fortes em projetos visuais e interativos, estabelecendo a estrutura e a linguagem visual de um aplicativo em um único passo; o time achou isso útil quando a rota mais rápida para um bom resultado era começar com algo substancial e então iterar. Em segurança, o xAI afirma que as salvaguardas do Grok 4.6 foram melhoradas e calibradas de acordo com as capacidades do modelo, respaldadas pelo que ele descreve como o seu maior conjunto de testes pré-deployment já feito para calibração de capacidades e salvaguardas, além de testes pós-deployment e de terceiros. A empresa posiciona sua pilha de segurança como maximizando utilidade e segurança em casos de uso legítimos em domínios como remediação de vulnerabilidades, acelerar o ciclo de design de engenharia e aumentar a pesquisa em IA. Resultados de benchmarks reportados O xAI relata que o Grok 4.6 alcança inteligência de fronteira em vários benchmarks de codificação orientada a agentes e de trabalho com conhecimento. Estas são as figuras que ele publicou para o Grok 4.6 High no lançamento em 12 de agosto de 2026: Avaliação Grok 4.6 High AA Intelligence Index 61 GDPVal-AA v2 1753 CursorBench v3.2 69.9% DeepSWE v1.1 65.9% FrontierCode v1.1 (Extended) 61.3% APEX-Agents 57.5% Terminal-Bench v3.0 26% APEX-SWE 56.4% AA-Briefcase 1577 Harvey LAB (Vals) 15.8% Fonte: xAI, conforme https://x.ai/news/grok-4-6. Várias dessas avaliações vêm da Artificial Analysis, então ajuda saber o que elas medem. Segundo a Artificial Analysis, o Artificial Analysis Intelligence Index v4.1.1 é um compósito que incorpora nove avaliações: GDPval-AA v2, τ³-Banking, Terminal-Bench v2.1, SciCode, Humanity’s Last Exam, GPQA Diamond, CritPt, AA-Omniscience e AA-LCR. Elas cobrem uso de ferramentas por agentes, raciocínio e conhecimento, confiabilidade do conhecimento, raciocínio em contexto longo e análise quantitativa sobre planilhas e documentos. AA-Briefcase é o benchmark de trabalho com conhecimento orientado a agentes: o AA-Briefcase Elo agrega taxa de aprovação do rubric, qualidade analítica Elo e Elo de apresentação, com pontuações mais altas sendo melhores. A Artificial Analysis também acompanha custo e latência junto com inteligência. O seu métrica de custo por tarefa é uma média ponderada do custo por tarefa do Intelligence Index, derivada dos preços de tokens de entrada, cache hit, cache write, de raciocínio e de resposta; é uma lente útil se você estiver dimensionando uma carga de trabalho de agente com foco em raciocínio, onde os tokens de raciocínio são um item real de custo. O que o Grok 4.6 adiciona no Bedrock Várias capacidades do Bedrock são novas para este modelo, em vez de terem sido herdadas do lançamento anterior do Grok. O endpoint bedrock-runtime. O Grok 4.6 é servido no bedrock-runtime além do bedrock-mantle, então você consegue acessá-lo com os AWS SDKs e a superfície de controle padrão do Bedrock, e não apenas com um cliente compatível com OpenAI. A Converse API, incluindo streaming. Tanto converse quanto converse_stream estão disponíveis. Esse é o benefício prático do suporte a runtime: um formato de mensagem entre modelos e streaming através dos eventos Converse usuais (messageStart, contentBlockDelta, contentBlockStop, messageStop, metadata) sem precisar fazer parsing manual de SSE (Server-Sent Events). Um nível de esforço de raciocínio xhigh. O esforço é low, medium, high, xhigh, expandindo a faixa na ponta superior para problemas em que uma rodada mais profunda vale os tokens. Na Converse, defina isso via additionalModelRequestFields={"reasoning_effort": "xhigh"} em vez de um parâmetro de raciocínio. Inferência entre regiões. No bedrock-runtime, você roteia por um de dois perfis de inferência em vez de prender a uma única Região. us.xai.grok-4.6 mantém o tráfego dentro da geografia dos EUA quando você tem requisitos de residência de dados, e global.xai.grok-4.6 roteia mundialmente para o maior pool de capacidade. O Global também é o mais barato dos dois, a US$ 2,00 por milhão de tokens de entrada contra US$ 2,20; então, na ausência de uma restrição de residência, ele normalmente é a melhor opção padrão. Amazon Bedrock Guardrails. O Grok 4.6 agora suporta Guardrails no bedrock-runtime em todas as suas APIs, fornecendo filtros de conteúdo, tópicos negados, anonimização de informações pessoalmente identificáveis (PII) e políticas de palavras. Você anexa um guardrail por ID e versão na requisição, e a política é avaliada contra tanto o prompt quanto a resposta do modelo. Para cargas de trabalho orientadas a agentes, isso importa porque coloca uma fronteira de política consistente em torno de um modelo que pode rodar sem supervisão por muitos passos. Logging de invocação. Com o logging de invocação do modelo ativado, as chamadas do Grok 4.6 são capturadas como registros completos do Amazon CloudWatch: body da requisição, body da resposta, contagens de tokens, incluindo tokens de raciocínio, e o perfil de inferência utilizado. Útil para auditoria de execuções de agentes quando você precisa ver o que o modelo foi realmente solicitado. Cache de prompts. A entrada em cache é cobrada em cerca de um quarto da taxa padrão de entrada, o que importa para agentes que reenviam um grande prompt de sistema ou um documento a cada turno. O cache se aplica a um prefixo repetido, então mantenha conteúdo estável no início da requisição e confira a contagem de tokens em cache no bloco de usage para confirmar o desconto antes de incorporá-lo a um modelo de custo. Chamada de ferramentas, output estruturado, entrada de imagem, streaming de resposta e conteúdo de raciocínio criptografado também estão disponíveis, mas essas datas vêm do lançamento do Grok 4.3 e são cobertas neste post. Como o Grok 4.6 é empacotado no Amazon Bedrock O Grok 4.6 aceita entrada de texto e imagem e retorna texto. As modalidades de áudio, fala, vídeo e embeddings não são suportadas, e ele não gera imagens. O modelo pode ser acessado por dois endpoints, e o ID do modelo difere conforme qual deles você usa: Endpoint ID do modelo Base URL bedrock-mantle xai.grok-4.6 https://bedrock-mantle.{region}.api.aws/openai/v1 bedrock-runtime us.xai.grok-4.6 (Geo) ou global.xai.grok-4.6 (Global) https://bedrock-runtime.{region}.amazonaws.com/openai/v1 Do lado da API, o Grok 4.6 suporta a Responses API, a Chat Completions API e a Converse API. A Invoke API não é suportada. O suporte a recursos difere por endpoint, que é o detalhe mais provável de influenciar sua decisão de integração: No bedrock-mantle, recursos suportados incluem tool calling no lado do cliente, raciocínio, outputs estruturados, cache de prompts, streaming de resposta, projects e detecção de abuso. No bedrock-runtime, recursos suportados incluem raciocínio, cache de prompts, streaming de resposta, logs de invocação e projects (apenas project padrão). Outputs estruturados, uso de ferramentas no servidor, roteamento inteligente de prompts, contagem de tokens e perfis de inferência de aplicação não são suportados nesse endpoint. Tool calling funciona em ambos endpoints. O modelo retorna uma solicitação estruturada de função; seu código a executa e você devolve o resultado. No bedrock-runtime você pode conduzir esse loop via toolConfig da Converse ou o parâmetro tools compatível com OpenAI, então agentes que dependem de chamadas de função não ficam limitados ao bedrock-mantle. Se sua aplicação depende de output estruturado em JSON Schema, isso aponta para bedrock-mantle. Se você quer a Converse API ou logging de invocação, isso aponta para bedrock-runtime. Regiões e opções de inferência A disponibilidade difere por endpoint. No bedrock-mantle, o Grok 4.6 está disponível para inferência in-Region no Oeste dos EUA (Oregon) (us-west-2). No bedrock-runtime, a inferência in-Region não é oferecida. Em vez disso, você chama o modelo através de perfis de inferência entre regiões. A inferência Geo entre regiões está disponível a partir das Regiões dos EUA (us-east-1, us-east-2, us-west-1 e us-west-2), e a inferência Global entre regiões está disponível em uma lista consideravelmente maior, abrangendo EUA, Canadá, Europa, Ásia-Pacífico, Oriente Médio, África e América do Sul. Rotas Geo cruzam Regiões dentro de uma geografia respeitando a residência de dados, e rotas Global fazem qualquer lugar no mundo quando não há restrições de residência. A tabela completa vai para mais de 30 Regiões; então verifique o model card e a disponibilidade regional por página do modelo para a lista atual antes de fixar uma Região. Esta é uma mudança de formato em relação ao lançamento do Grok 4.3, onde, como observado no post do Grok 4.3, a inferência in-Region era usada apenas e não havia oferta de inferência Geo e Global entre regiões. Nível de serviço e preços O Grok 4.6 suporta três níveis de serviço. Standard é preço por token sem compromisso, selecionado definindo "service_tier": "default" ou omitindo o campo. Priority entrega processamento mais rápido e priorizado para um serviço premium ("service_tier": "priority"). Flex oferece acesso de menor custo para trabalho que não é sensível ao tempo ("service_tier": "flex"). Para preços por token em cada tier, veja a página de pricing do Amazon Bedrock. As outras duas tiers têm preços como multiplicadores sobre essas taxas Standard: Priority em 1,75x, um prêmio de 75%, e Flex em 0,5x, um desconto de 50%. Assim, a mesma carga de trabalho que custa US$ 2,20 por milhão de tokens de entrada em execuções Standard in-Region custa US$ 3,85 no Priority e US$ 1,10 no Flex, o que torna a escolha da tier um fator de custo maior do que a escolha da Região. Como referência, o xAI lista o pricing do Grok 4.6 começando em US$ 2 por milhão de tokens de entrada e US$ 6 por milhão de tokens de saída, com uma variante rápida custando o dobro. Confirme sempre as taxas atuais na página de pricing do Amazon Bedrock, pois preços e tiers mudam. Envie seu primeiro pedido Antes da sua primeira chamada, confirme que o modelo está disponível para você no console do Bedrock na Região que você planeja usar. O Grok 4.6 é servido por perfis de inferência em vez de capacidade sob demanda no ID do modelo em si; por isso, as requisições nomeiam us.xai.grok-4.6 ou global.xai.grok-4.6 no bedrock-runtime. O Grok 4.6 usa APIs compatíveis com OpenAI, então o SDK da OpenAI funciona com qualquer endpoint depois que você definir a base URL. Instale o SDK e o boto3 se você planeja usar a Converse API: pip install openai pip install boto3 Gere uma chave de API do Amazon Bedrock de longo prazo no console do Amazon Bedrock para exploração e então configure seu ambiente. Para bedrock-mantle: export OPENAI_API_KEY="" export OPENAI_BASE_URL="https://bedrock-mantle.us-west-2.api.aws/openai/v1" Para bedrock-runtime: export OPENAI_API_KEY="" export OPENAI_BASE_URL="https://bedrock-runtime.us-east-1.amazonaws.com/openai/v1" Um primeiro pedido no bedrock-mantle com a Chat Completions API: from openai import OpenAI client = OpenAI() response = client.chat.completions.create( model="xai.grok-4.6", messages=[ {"role": "user", "content": "Can you explain the features of Amazon Bedrock?"} ], ) print(response) No bedrock-runtime, a diferença é o nome do modelo: você passa um perfil de inferência entre regiões em vez do ID puro do modelo. Este exemplo também troca para a Responses API para mostrar esse formato: from openai import OpenAI client = OpenAI() response = client.responses.create( model="us.xai.grok-4.6", input="Can you explain the features of Amazon Bedrock?", ) print(response) E via Converse API com boto3. Como o raciocínio está ativo, o primeiro bloco de conteúdo carrega o raciocínio e a resposta fica em um bloco posterior; então busque os blocos pelo texto em vez de indexar content[0]: import boto3 client = boto3.client("bedrock-runtime", region_name="us-east-1") response = client.converse( modelId="us.xai.grok-4.6", messages=[ {"role": "user", "content": [{"text": "Can you explain the features of Amazon Bedrock?"}]} ], inferenceConfig={"maxTokens": 2048}, ) blocks = response["output"]["message"]["content"] text = next(b["text"] for b in blocks if "text" in b) print(text) Na Converse, você configura o nível de esforço via additionalModelRequestFields em vez de um parâmetro de raciocínio: response = client.converse( modelId="us.xai.grok-4.6", messages=[{"role": "user", "content": [{"text": "What is 17*23? Number only."}]}], inferenceConfig={"maxTokens": 3000}, additionalModelRequestFields={"reasoning_effort": "xhigh"}, ) Três notas operacionais. Primeiro, no bedrock-runtime, o Grok 4.6 não está disponível para inferência in-Region, então as requisições precisam nomear us.xai.grok-4.6 ou global.xai.grok-4.6. Segundo, bedrock:InvokeModel é avaliado contra três recursos: o projeto padrão da sua conta, o perfil de inferência que você nomeia e o modelo foundation subjacente. O ARN do foundation model é curinga (wildcard) através das Regiões porque os perfis entre regiões roteiam fora da Região de chamada. A autenticação com bearer token nos endpoints compatíveis com OpenAI também exige bedrock:CallWithBearerToken, que boto3 e Converse não precisam: { "Version": "2012-10-17", "Statement": [ { "Effect": "Allow", "Action": "bedrock:InvokeModel", "Resource": [ "arn:aws:bedrock:{region}:{account-id}:project/default", "arn:aws:bedrock:{region}:{account-id}:inference-profile/us.xai.grok-4.6", "arn:aws:bedrock:*::foundation-model/xai.grok-4.6" ] }, { "Effect": "Allow", "Action": "bedrock:CallWithBearerToken", "Resource": "*" } ] } Liste todos os perfis de inferência que você planeja chamar. Os perfis são escopados individualmente, então uma política que nomeia us.xai.grok-4.6 não cobre global.xai.grok-4.6. Terceiro, os dois mecanismos de autenticação cobrem caminhos de código diferentes. Uma chave de API do Amazon Bedrock em OPENAI_API_KEY viaja como token bearer e autentica as chamadas compatíveis com OpenAI em ambos os endpoints. Os exemplos de Converse do boto3 assinam com SigV4; eles usam suas credenciais comuns da AWS no ambiente, em um profile ou em uma role. Configure ambos se você pretende usar a Converse junto com as APIs compatíveis com OpenAI. Trate uma chave de API de longo prazo como uma credencial apenas para exploração. Para produção, o post do lançamento do Grok 4.3 recomenda tokens bearer de curto prazo gerados a partir de suas credenciais IAM com o pacote aws-bedrock-token-generator, porque eles expiram automaticamente e mantêm o acesso vinculado à sua identidade IAM; essa orientação se aplica igualmente aqui. Trabalhando com esforço de raciocínio O raciocínio está ativo no Grok 4.6 por padrão, e você configura quanto dele o modelo gasta via o parâmetro de raciocínio com low (o padrão), medium, high ou xhigh. O nível xhigh é novo em relação ao que o post do lançamento do Grok 4.3 documentou, onde os níveis eram none, low, medium e high. Conteúdo de raciocínio é criptografado. Você pode fazer com que ele seja retornado passando include: ["reasoning.encrypted_content"] em uma requisição da Responses API e, em seguida, envie esse conteúdo de volta em turnos subsequentes para dar ao modelo o próprio raciocínio prévio como contexto em uma conversa de múltiplos turnos. A Chat Completions API não retorna tokens de raciocínio. Raciocínio criptografado é um recurso da Responses API, então este exemplo usa o cliente OpenAI em vez do cliente boto3 dos exemplos da Converse acima: from openai import OpenAI client = OpenAI() # OPENAI_BASE_URL aponta para o endpoint bedrock-runtime response = client.responses.create( model="us.xai.grok-4.6", reasoning={"effort": "high"}, include=["reasoning.encrypted_content"], input="Explain quantum entanglement simply.", ) print(response.output_text) Como o raciocínio é padrão e o esforço é por requisição, o nível de esforço é um controle real de custo e latência. Execute chamadas curtas de extração e classificação em low, e reserve high ou xhigh para etapas de planejamento e trajetórias longas de agentes, onde um erro precoce se multiplica. Fazer benchmark dos níveis de esforço com sua própria carga de trabalho é a forma mais rápida de encontrar onde um raciocínio mais alto deixa de valer o custo dos tokens. Comece O Grok 4.6 no Amazon Bedrock te dá um modelo construído pela xAI para agentes de longa duração e trabalhos interativos ambiciosos, com uma janela de contexto de 500K tokens, quatro níveis de esforço de raciocínio, entrada de imagem, prompt caching e uma escolha entre o endpoint bedrock-mantle compatível com OpenAI e o endpoint bedrock-runtime com suporte à Converse API e inferência entre regiões. Para começar a construir, revise o Grok 4.6 model card para a lista atual de Região, a matriz de recursos e os detalhes de parâmetros, e confira a página de pricing do Amazon Bedrock para taxas por token. Se você gerou uma chave de API do Amazon Bedrock de longo prazo para exploração, exclua-a no console do Amazon Bedrock quando terminar. Uma credencial permanente que você não precisa mais só aumenta a superfície de exposição da sua conta. Fontes Amazon Bedrock Grok 4.6 model card: https://docs.aws.amazon.com/bedrock/latest/userguide/model-card-xai-grok-4-6.html Model cards do xAI no Amazon Bedrock: https://docs.aws.amazon.com/bedrock/latest/userguide/model-cards-xai.html xAI, Introducing Grok 4.6: https://x.ai/news/grok-4-6 Artificial Analysis, modelo comparativo e metodologia de benchmark: https://artificialanalysis.ai/models AWS, Introducing Grok on Amazon Bedrock (Grok 4.3): https://aws.amazon.com/blogs/machine-learning/introducing-grok-on-amazon-bedrock/ Sobre os autores Suheel Farooq Suheel é um Principal Solutions Architect na AWS, especializado em inteligência artificial, machine learning e IA generativa. Ele ajuda clientes provedoras de Foundation Model a projetar, construir, modernizar e dimensionar suas cargas de trabalho de IA/ML e IA generativa na AWS. Sua experiência abrange o portfólio de IA/ML e IA generativa da AWS, especialmente Amazon Bedrock, Amazon Bedrock AgentCore e Amazon SageMaker AI. No tempo livre, Suheel gosta de se exercitar e fazer trilhas. Ikenna Izugbokwe Ikenna é um Principal Solutions Architect na AWS especializado em redes, containers e infraestrutura de IA. Ele orienta provedores de modelos a dimensionar seus sistemas de treinamento e inferência, enquanto possibilita a implantação rápida de modelos de fronteira em evolução na AWS. Seu trabalho tem cada vez mais abrangido IA orientada a agentes — construir sistemas multiagente confiáveis e eficientes em custo e a infraestrutura de inferência por trás deles em produção. Fabio Branco Fabio é um Senior Customer Solutions Manager na Amazon Web Services (AWS) e consultor estratégico que orienta provedores de modelos fundamentais em sua jornada go-to-market. Antes da AWS, ele ocupou cargos de Product Management, Engineering, Consulting e Technology Delivery em várias empresas Fortune 500 em indústrias, incluindo varejo e bens de consumo, petróleo e gás, serviços financeiros, seguros e aeroespacial e defesa. Saurabh Trikande Saurabh é um Senior Product Manager para Amazon Bedrock e Amazon SageMaker Inference. Ele é apaixonado por trabalhar com clientes e parceiros, motivado pelo objetivo de democratizar a IA. Ele se concentra nos desafios centrais relacionados à implantação de aplicações complexas de IA, inferência com modelos multi-tenant, otimizações de custo e tornar a implantação de modelos de IA generativa mais acessível. No tempo livre, Saurabh gosta de fazer trilhas, aprender sobre tecnologias inovadoras, acompanhar o TechCrunch e passar tempo com sua família. Anirban Gupta Anirban é um Principal Engineer na AWS baseado em Seattle, EUA, onde se concentra no design de infraestrutura de fornecimento de modelos segura e em alta escala para o Amazon Bedrock. Ele impulsionou o trabalho técnico por trás de vários lançamentos de foundation model na plataforma. Antes de ingressar no Amazon Bedrock, ele era um Principal Engineer na AWS Outposts, construindo infraestrutura de nuvem híbrida no local. (来源:ME)
