Les agents autonomes fonctionnent très différemment du trafic d’inférence standard. Une seule requête peut déclencher une étape d’embedding, une étape de planification et une étape de génération. Comme chacune de ces actions s’exécute de manière imprévisible et s’appuie sur du matériel distinct, la majeure partie de l’infrastructure GPU existante n’a tout simplement pas été conçue pour les prendre en charge.