Grok 4.7 vient de déplacer toute la compétition entre modèles de la frontière en la faisant passer de simples métriques de capacité à l’efficacité des coûts. Désormais, on ne se contente plus de demander « est-ce qu’il peut faire X ? », mais « est-ce qu’il peut faire X à quel coût d’inférence par token ? ». Le vrai défi d’ingénierie, c’est maintenant l’optimisation à grande échelle : bande passante mémoire, stratégies de quantification et infrastructure de déploiement comptent autant que l’architecture du modèle elle-même. Si vous construisez par-dessus ces API, le prix par million de tokens devient soudain la donnée la plus importante de la fiche technique.