Message d’IA de ME. Aujourd’hui, nous annonçons que Grok 4.6 de xAI est disponible dans Amazon Bedrock, en ajoutant un modèle de pointe conçu pour des agents de longue durée, le codage et le travail lié à la connaissance à la bibliothèque de modèles de Bedrock. Grok 4.6 a été lancé sur Bedrock le 18 août 2026. Il offre une fenêtre de contexte de 500K tokens et prend en charge un effort de raisonnement configurable à quatre niveaux : faible, moyen, élevé et xhigh. Il s’agit du deuxième modèle de xAI dans Amazon Bedrock. Lorsque Grok 4.3 est devenu généralement disponible, xAI a rejoint Amazon Bedrock comme fournisseur de modèles, et le modèle était accessible via Bedrock Mantle, le moteur d’inférence compatible avec OpenAI dans Amazon Bedrock. Grok 4.6 élargit considérablement cette couverture : il est disponible sur les points de terminaison bedrock-mantle et bedrock-runtime, et il prend en charge l’API Converse en plus de Chat Completions et Responses. Cet article explique pour quoi xAI indique que Grok 4.6 est conçu, comment il est empaqueté sur Amazon Bedrock, et comment envoyer votre première requête. À quoi Grok 4.6 est destiné Les capacités et détails d’entraînement de cette section proviennent de l’annonce de lancement de xAI, Introducing Grok 4.6. Grok 4.6 s’appuie sur Grok 4.5 avec un focus particulier sur les agents de longue durée et sur des tâches interactives et visuelles plus ambitieuses. xAI décrit le modèle comme capable de s’attaquer à des tâches complexes sur de nombreuses étapes, que ce soit pour rechercher un sujet, analyser des informations, travailler sur une base de code, ou transformer une idée en une application ou un artefact de travail abouti. Pour l’entraînement, xAI indique qu’il a réalisé une phase d’entraînement supplémentaire plus longue que celle de Grok 4.5, en utilisant des données générées par des modèles sélectionnées pour le raisonnement et des concepts techniques avancés, des données d’ingénierie de haute qualité, ainsi qu’un optimiseur et une recette d’entraînement améliorés. Ensuite, il a utilisé Grok 4.5 pour régénérer les trajectoires de fine-tuning supervisé sur les efforts de raisonnement, les “agent harnesses” et des domaines incluant la STEM, l’ingénierie logicielle et le travail lié à la connaissance, en filtrant les traces problématiques via des contrôles basés sur le modèle. Le modèle a ensuite été entraîné sur un large éventail de tâches d’apprentissage par renforcement “agentic”, couvrant le travail lié à la connaissance, le codage général, et des environnements spécifiques au domaine comme l’optimisation du noyau, le développement web et la conception assistée par ordinateur. Deux comportements que xAI met en avant méritent d’être notés pour toute personne qui construit des agents. Sur des trajectoires plus longues, le modèle a commencé à montrer davantage d’auto-tests et de vérification, en contrôlant son propre travail avant de passer à la suite. Il produit aussi de meilleures premières passes sur des projets visuels et interactifs, en établissant la structure et le langage visuel d’une application en une seule fois ; l’équipe a trouvé cela utile lorsque la voie la plus rapide vers un bon résultat consiste à commencer par quelque chose de substantiel puis à itérer. En matière de sécurité, xAI indique que les garde-fous de Grok 4.6 ont été améliorés et calibrés en fonction des capacités du modèle, appuyés par ce qu’elle décrit comme sa plus large suite de tests avant déploiement pour les capacités et la calibration des garde-fous, ainsi que des tests après déploiement et réalisés par des tiers. La société positionne sa pile de sécurité comme maximisant l’utilité et la sécurité pour des cas d’usage légitimes dans des domaines tels que la correction de vulnérabilités, l’accélération du cycle de conception d’ingénierie et l’amélioration de la recherche sur l’IA. Résultats de benchmarks rapportés xAI indique que Grok 4.6 atteint une intelligence de pointe sur plusieurs benchmarks de codage agentic et de travail lié à la connaissance. Voici les chiffres qu’elle a publiés pour Grok 4.6 High lors du lancement du 12 août 2026 : Evaluation Grok 4.6 High AA Intelligence Index 61 GDPVal-AA v2 1753 CursorBench v3.2 69.9% DeepSWE v1.1 65.9% FrontierCode v1.1 (Extended) 61.3% APEX-Agents 57.5% Terminal-Bench v3.0 26% APEX-SWE 56.4% AA-Briefcase 1577 Harvey LAB (Vals) 15.8% Source : xAI, selon https://x.ai/news/grok-4-6. Plusieurs de ces évaluations proviennent d’Artificial Analysis ; il est donc utile de savoir ce qu’elles mesurent. D’après Artificial Analysis, l’Artificial Analysis Intelligence Index v4.1.1 est un indicateur composite qui intègre neuf évaluations : GDPval-AA v2, τ³-Banking, Terminal-Bench v2.1, SciCode, Humanity’s Last Exam, GPQA Diamond, CritPt, AA-Omniscience et AA-LCR. Elles couvrent l’usage d’outils par agents, le raisonnement et la connaissance, la fiabilité de la connaissance, le raisonnement à long contexte et l’analyse quantitative sur des tableurs et documents. AA-Briefcase est son benchmark de travail agentic lié à la connaissance, où AA-Briefcase Elo agrège le taux de réussite de la grille d’évaluation (“rubric”), la qualité analytique Elo et le Elo de présentation ; des scores plus élevés sont meilleurs. Artificial Analysis suit aussi les coûts et la latence en plus de l’intelligence. Sa métrique coût-par-tâche est un coût moyen pondéré par tâche de l’Intelligence Index, dérivé des prix d’entrée, de cache hit, de cache write, de raisonnement et de tokens de réponse. C’est un prisme utile si vous dimensionnez une charge de travail d’agent très “reasoning-heavy”, où les tokens de raisonnement constituent un coût réel. Ce que Grok 4.6 ajoute sur Bedrock Plusieurs capacités de Bedrock sont nouvelles pour ce modèle, plutôt que d’être reprises de l’annonce de lancement Grok précédente. Le point de terminaison bedrock-runtime. Grok 4.6 est servi sur bedrock-runtime en plus de bedrock-mantle, ce qui vous permet de l’atteindre avec les AWS SDK et la surface de contrôle standard de Bedrock, au lieu de seulement un client compatible OpenAI. L’API Converse, y compris le streaming. Les deux, converse et converse_stream, sont disponibles. C’est le bénéfice pratique du support runtime : une forme de message unique entre modèles, et du streaming via les événements Converse habituels (messageStart, contentBlockDelta, contentBlockStop, messageStop, metadata) sans qu’il faille “customiser” le parsing des événements Server-Sent Events (SSE). Un niveau d’effort de raisonnement xhigh. L’effort passe par low, medium, high, xhigh, ce qui étend la plage au niveau supérieur pour des problèmes où un passage plus profond vaut les tokens. Sur Converse, définissez-le via additionalModelRequestFields={"reasoning_effort": "xhigh"} plutôt qu’avec un paramètre de raisonnement. Inférence cross-Region. Sur bedrock-runtime, vous passez par un des deux profils d’inférence plutôt que d’être “fixé” sur une seule Region. us.xai.grok-4.6 conserve le trafic au sein de la géographie US lorsque vous avez des exigences de résidence des données, et global.xai.grok-4.6 route à l’échelle mondiale pour le plus grand pool de capacité. Global est aussi le moins cher des deux, à 2,00 $ par million de tokens d’entrée contre 2,20 $ ; en l’absence de contrainte de résidence, c’est généralement le meilleur choix par défaut. Amazon Bedrock Guardrails. Grok 4.6 prend désormais en charge les Guardrails sur bedrock-runtime via ses API, vous donnant des filtres de contenu, des sujets refusés, la redaction des données d’identification personnelle (PII) et des politiques de mots. Vous joignez un garde-fou par ID et version dans la requête, et la politique est évaluée à la fois sur le prompt et sur la réponse du modèle. Pour des charges de travail “agentic”, cela compte parce que cela place une frontière de politique cohérente autour d’un modèle qui pourrait tourner sans surveillance sur de nombreuses étapes. Journalisation des invocations. Avec la journalisation des invocations du modèle activée, les appels de Grok 4.6 sont capturés en tant qu’enregistrements complets Amazon CloudWatch : corps de la requête, corps de la réponse, comptage de tokens incluant les tokens de raisonnement, et le profil d’inférence utilisé. Utile pour auditer les exécutions d’agents lorsque vous devez voir exactement ce qui a été demandé au modèle. Mise en cache des prompts. L’entrée mise en cache est facturée à environ un quart du taux standard d’entrée, ce qui est important pour les agents qui renvoient un grand prompt système ou un document à chaque tour. La mise en cache s’applique à un préfixe répété : conservez un contenu stable en début de requête, et lisez le nombre de tokens mis en cache dans le bloc d’utilisation pour confirmer la réduction avant de l’intégrer à un modèle de coûts. L’appel d’outils, la sortie structurée, l’entrée image, le streaming des réponses et le contenu chiffré de raisonnement sont aussi disponibles, mais ils datent du lancement Grok 4.3 et sont couverts dans cet article. Comment Grok 4.6 est empaqueté sur Amazon Bedrock Grok 4.6 accepte une entrée texte et image et renvoie du texte. Les modalités audio, parole, vidéo et embedding ne sont pas prises en charge, et il ne génère pas d’images. Le modèle est accessible via deux points de terminaison, et l’ID du modèle diffère selon celui que vous utilisez : Point de terminaison ID de modèle Base URL bedrock-mantle xai.grok-4.6 https://bedrock-mantle.{region}.api.aws/openai/v1 bedrock-runtime us.xai.grok-4.6 (Geo) ou global.xai.grok-4.6 (Global) https://bedrock-runtime.{region}.amazonaws.com/openai/v1 Côté API, Grok 4.6 prend en charge l’API Responses, l’API Chat Completions et l’API Converse. L’API Invoke n’est pas prise en charge. La prise en charge des fonctionnalités diffère selon le point de terminaison, ce qui est le détail le plus susceptible d’influencer votre choix d’intégration : sur bedrock-mantle, les fonctionnalités prises en charge incluent l’appel d’outils côté client, le raisonnement, les sorties structurées, la mise en cache des prompts, le streaming des réponses, les projets et la détection d’abus. Sur bedrock-runtime, les fonctionnalités prises en charge incluent le raisonnement, la mise en cache des prompts, le streaming des réponses, les logs d’invocation et les projets (projet par défaut uniquement). Les sorties structurées, l’usage d’outils côté serveur, le routage intelligent des prompts, le comptage des tokens et les profils d’inférence d’application ne sont pas pris en charge sur ce point de terminaison. L’appel d’outils fonctionne sur les deux points de terminaison. Le modèle renvoie une requête de fonction structurée, votre code l’exécute, puis vous renvoyez le résultat. Sur bedrock-runtime, vous pouvez piloter cette boucle via toolConfig de Converse ou le paramètre tools compatible OpenAI ; ainsi, les agents qui dépendent d’appels de fonctions ne sont pas limités à bedrock-mantle. Si votre application dépend d’une sortie structurée conforme à JSON Schema, cela vous oriente vers bedrock-mantle. Si vous voulez l’API Converse ou la journalisation d’invocation, cela vous oriente vers bedrock-runtime. Regions et options d’inférence La disponibilité diffère selon le point de terminaison. Sur bedrock-mantle, Grok 4.6 est disponible pour une inférence en In-Region aux États-Unis Ouest (Oregon) (us-west-2). Sur bedrock-runtime, l’inférence en In-Region n’est pas proposée. À la place, vous invoquez le modèle via des profils d’inférence cross-Region. L’inférence cross-Region “Geo” est disponible depuis les Regions US (us-east-1, us-east-2, us-west-1 et us-west-2), et l’inférence cross-Region “Global” est disponible depuis une liste nettement plus longue couvrant les États-Unis, le Canada, l’Europe, l’Asie-Pacifique, le Moyen-Orient, l’Afrique et l’Amérique du Sud. Les routes Geo cross-Region traversent les Regions au sein d’une géographie tout en respectant la résidence des données ; les routes Global cross-Region routent partout dans le monde lorsqu’il n’y a pas de contrainte de résidence. Le tableau complet s’étend sur plus de 30 Regions : vérifiez donc la model card et la disponibilité régionale par page de modèle avant de “fixer” une Region. Il s’agit d’un changement par rapport au lancement Grok 4.3 : comme indiqué dans le billet Grok 4.3, le modèle n’utilisait que l’inférence In-Region, et la Geo et la Global cross-Region n’étaient pas proposées. Niveau de service et tarification Grok 4.6 prend en charge trois niveaux de service. Standard : facturation à la token, sans engagement, sélectionné en définissant "service_tier": "default" ou en omettant le champ. Priority : traitement plus rapide et prioritaire pour un accès premium ("service_tier": "priority"). Flex : accès moins coûteux pour des travaux non sensibles au facteur temps ("service_tier": "flex"). Pour la tarification par token selon les niveaux, voir la page de tarification d’Amazon Bedrock. Les deux autres niveaux sont tarifés comme des multiplicateurs sur ces tarifs Standard : Priority à 1,75x (prime de 75 %) et Flex à 0,5x (remise de 50 %). Ainsi, la même charge de travail qui coûte 2,20 $ par million de tokens d’entrée sur des exécutions Standard en In-Region coûte 3,85 $ sur Priority et 1,10 $ sur Flex : le choix du niveau a donc un impact plus important que le choix de la Region. À titre de référence, xAI indique une tarification de Grok 4.6 à partir de 2 $ par million de tokens d’entrée et 6 $ par million de tokens de sortie, avec une variante “fast” à deux fois le prix. Confirmez toujours les tarifs actuels sur la page de tarification Amazon Bedrock, car ils évoluent. Envoyer votre première requête Avant votre premier appel, confirmez que le modèle vous est disponible dans la console Bedrock pour la Région que vous prévoyez d’utiliser. Grok 4.6 est servi via des profils d’inférence plutôt que via un débit “à la demande” sur le simple ID de modèle ; c’est pourquoi les requêtes indiquent us.xai.grok-4.6 ou global.xai.grok-4.6 sur bedrock-runtime. Grok 4.6 utilise des API compatibles OpenAI ; le SDK OpenAI fonctionne donc avec l’un ou l’autre point de terminaison après avoir défini l’URL de base. Installez le SDK et boto3 si vous prévoyez d’utiliser l’API Converse : pip install openai pip install boto3 Générez une clé API Amazon Bedrock à long terme depuis la console Amazon Bedrock pour l’exploration, puis définissez votre environnement. Pour bedrock-mantle : export OPENAI_API_KEY="" export OPENAI_BASE_URL="https://bedrock-mantle.us-west-2.api.aws/openai/v1" Pour bedrock-runtime : export OPENAI_API_KEY="" export OPENAI_BASE_URL="https://bedrock-runtime.us-east-1.amazonaws.com/openai/v1" Une première requête sur bedrock-mantle avec l’API Chat Completions : from openai import OpenAI client = OpenAI() response = client.chat.completions.create( model="xai.grok-4.6", messages=[ {"role": "user", "content": "Can you explain the features of Amazon Bedrock?"} ], ) print(response) Sur bedrock-runtime, la différence est le nom du modèle : vous passez un profil d’inférence cross-Region au lieu de l’ID de modèle nu. Cet exemple passe aussi à l’API Responses pour montrer cette forme : from openai import OpenAI client = OpenAI() response = client.responses.create( model="us.xai.grok-4.6", input="Can you explain the features of Amazon Bedrock?", ) print(response) Et via l’API Converse avec boto3. Comme le raisonnement est actif, le premier bloc de contenu contient le raisonnement et la réponse se trouve dans un bloc ultérieur : recherchez le texte dans les blocs plutôt que d’indexer content[0]. import boto3 client = boto3.client("bedrock-runtime", region_name="us-east-1") response = client.converse( modelId="us.xai.grok-4.6", messages=[ {"role": "user", "content": [{"text": "Can you explain the features of Amazon Bedrock?"}]} ], inferenceConfig={"maxTokens": 2048}, ) blocks = response["output"]["message"]["content"] text = next(b["text"] for b in blocks if "text" in b) print(text) Sur Converse, vous définissez le niveau d’effort via additionalModelRequestFields plutôt qu’un paramètre de raisonnement : response = client.converse( modelId="us.xai.grok-4.6", messages=[{"role": "user", "content": [{"text": "What is 17*23? Number only."}]}], inferenceConfig={"maxTokens": 3000}, additionalModelRequestFields={"reasoning_effort": "xhigh"}, ) Trois notes opérationnelles. Premièrement, sur bedrock-runtime, Grok 4.6 n’est pas disponible pour une inférence In-Region ; les requêtes doivent donc mentionner us.xai.grok-4.6 ou global.xai.grok-4.6. Deuxièmement, bedrock:InvokeModel est évalué par rapport à trois ressources : le projet par défaut de votre compte, le profil d’inférence que vous nommez, et le modèle de fond sous-jacent. L’ARN du modèle de fond est wildcardé à travers les Regions, car les profils cross-Region routent en dehors de la Region d’appel. L’authentification par jeton porteur (Bearer-token) sur les points de terminaison compatibles OpenAI requiert en plus bedrock:CallWithBearerToken, que boto3 et Converse ne nécessitent pas : { "Version": "2012-10-17", "Statement": [ { "Effect": "Allow", "Action": "bedrock:InvokeModel", "Resource": [ "arn:aws:bedrock:{region}:{account-id}:project/default", "arn:aws:bedrock:{region}:{account-id}:inference-profile/us.xai.grok-4.6", "arn:aws:bedrock:*::foundation-model/xai.grok-4.6" ] }, { "Effect": "Allow", "Action": "bedrock:CallWithBearerToken", "Resource": "*" } ] } Listez tous les profils d’inférence que vous prévoyez d’appeler. Les profils étant définis individuellement, une politique qui nomme us.xai.grok-4.6 ne couvre pas global.xai.grok-4.6. Troisièmement, les deux mécanismes d’authentification empruntent des chemins de code différents. Une clé API Amazon Bedrock dans OPENAI_API_KEY est transmise comme un jeton porteur et authentifie les appels compatibles OpenAI sur les deux points de terminaison. Les exemples boto3 Converse signent avec SigV4 à la place, en s’appuyant sur vos identifiants AWS ordinaires depuis l’environnement, un profil ou un rôle. Configurez les deux si vous prévoyez d’utiliser Converse en plus des API compatibles OpenAI. Traitez une clé API à long terme comme un identifiant réservé à l’exploration. Pour la production, le billet de lancement Grok 4.3 recommande des jetons porteurs à court terme générés à partir de vos identifiants IAM avec le package aws-bedrock-token-generator, car ils expirent automatiquement et gardent l’accès lié à votre identité IAM ; cette recommandation s’applique également ici. Travailler avec l’effort de raisonnement Le raisonnement est actif par défaut sur Grok 4.6, et vous configurez la quantité de raisonnement que le modèle utilise via le paramètre de raisonnement avec low (valeur par défaut), medium, high ou xhigh. Le niveau xhigh est nouveau par rapport à ce que le billet de lancement Grok 4.3 avait documenté, où les niveaux étaient none, low, medium et high. Le contenu de raisonnement est chiffré. Vous pouvez le faire renvoyer en passant include: ["reasoning.encrypted_content"] dans une requête de l’API Responses, puis renvoyer ce contenu sur les tours suivants afin de donner au modèle son propre raisonnement préalable comme contexte dans une conversation multi-tours. L’API Chat Completions ne renvoie pas les tokens de raisonnement. Le raisonnement chiffré est une fonctionnalité de l’API Responses : cet exemple utilise donc le client OpenAI plutôt que le client boto3 des exemples Converse ci-dessus : from openai import OpenAI client = OpenAI() # OPENAI_BASE_URL pointe vers le point de terminaison bedrock-runtime response = client.responses.create( model="us.xai.grok-4.6", reasoning={"effort": "high"}, include=["reasoning.encrypted_content"], input="Explain quantum entanglement simply.", ) print(response.output_text) Comme le raisonnement est activé par défaut et que l’effort est défini par requête, le niveau d’effort est un contrôle réel des coûts et de la latence. Faites des appels d’extraction et de classification courts avec low, et réservez high ou xhigh pour les étapes de planification et les trajectoires longues d’agents, où une erreur initiale se répercute en cascade. Évaluer les niveaux d’effort par rapport à votre propre charge de travail est le moyen le plus rapide de trouver jusqu’où un raisonnement plus poussé cesse de “rapporter” son coût en tokens. Pour commencer Avec Grok 4.6 sur Amazon Bedrock, vous obtenez un modèle conçu par xAI pour des agents de longue durée et des travaux interactifs ambitieux : fenêtre de contexte de 500K tokens, quatre niveaux d’effort de raisonnement, entrée image, mise en cache des prompts, et choix entre le point de terminaison bedrock-mantle compatible OpenAI et le point bedrock-runtime avec support de l’API Converse et de l’inférence cross-Region. Pour démarrer, consultez la model card de Grok 4.6 pour la liste actuelle des Regions, la matrice des fonctionnalités et les détails des paramètres, puis vérifiez la page de tarification d’Amazon Bedrock pour les tarifs des tokens. Si vous avez généré une clé API Amazon Bedrock à long terme pour l’exploration, supprimez-la de la console Amazon Bedrock lorsque vous avez terminé. Une information d’identification persistante dont vous n’avez plus besoin élargit seulement la surface d’exposition de votre compte. Sources Amazon Bedrock Grok 4.6 model card : https://docs.aws.amazon.com/bedrock/latest/userguide/model-card-xai-grok-4-6.html Modèles xAI dans Amazon Bedrock : https://docs.aws.amazon.com/bedrock/latest/userguide/model-cards-xai.html xAI, Introducing Grok 4.6 : https://x.ai/news/grok-4-6 Artificial Analysis, comparaison de modèles et méthodologie de benchmark : https://artificialanalysis.ai/models AWS, Introducing Grok on Amazon Bedrock (Grok 4.3) : https://aws.amazon.com/blogs/machine-learning/introducing-grok-on-amazon-bedrock/ À propos des auteurs Suheel Farooq Suheel est un Principal Solutions Architect chez AWS, spécialisé dans l’intelligence artificielle, le machine learning et l’IA générative. Il aide les clients fournisseurs de modèles de base à concevoir, construire, moderniser et faire évoluer leurs charges de travail IA/ML et IA générative sur AWS. Son expérience couvre le portefeuille AWS AI/ML et générative AI, notamment Amazon Bedrock, Amazon Bedrock AgentCore et Amazon SageMaker AI. Dans ses loisirs, Suheel aime faire de l’exercice et faire de la randonnée. Ikenna Izugbokwe Ikenna est un Principal Solutions Architect chez AWS spécialisé dans les réseaux, les conteneurs et l’infrastructure d’IA. Il guide les fournisseurs de modèles dans le scaling de leurs systèmes d’entraînement et d’inférence tout en permettant un déploiement rapide de modèles de pointe en évolution sur AWS. Son travail couvre de plus en plus l’IA agentic : concevoir des systèmes multi-agents fiables et rentables, ainsi que l’infrastructure d’inférence qui les sous-tend en production. Fabio Branco Fabio est Senior Customer Solutions Manager chez Amazon Web Services (AWS) et conseiller stratégique guidant les fournisseurs de modèles de base dans leur démarche go-to-market. Avant AWS, il a occupé des rôles en Product Management, Engineering, Consulting et Technology Delivery dans plusieurs entreprises Fortune 500, dans des secteurs incluant le retail et les biens de consommation, le pétrole et le gaz, les services financiers, l’assurance, ainsi que l’aérospatiale et la défense. Saurabh Trikande Saurabh est Senior Product Manager pour Amazon Bedrock et Amazon SageMaker Inference. Il est passionné par le travail avec les clients et partenaires, motivé par l’objectif de démocratiser l’IA. Il se concentre sur les défis fondamentaux liés au déploiement d’applications d’IA complexes, à l’inférence avec des modèles multi-tenant, aux optimisations des coûts, et à rendre le déploiement de modèles d’IA générative plus accessible. Dans ses loisirs, Saurabh aime faire de la randonnée, apprendre des technologies innovantes, suivre TechCrunch, et passer du temps avec sa famille. Anirban Gupta Anirban est un Principal Engineer chez AWS basé à Seattle, États-Unis, où il se concentre sur la conception d’une infrastructure de service de modèles sécurisée et à haute échelle pour Amazon Bedrock. Il a mené les travaux techniques derrière plusieurs lancements de modèles de base sur la plateforme. Avant de rejoindre Amazon Bedrock, il était Principal Engineer chez AWS Outposts, construisant une infrastructure cloud hybride sur site. (来源:ME)
