Los agentes autónomos funcionan de manera muy diferente en comparación con el tráfico de inferencia estándar. Una sola solicitud puede iniciar un paso de incrustación, un paso de planificación y un paso de generación. Dado que cada una de estas acciones se ejecuta de forma impredecible y depende de hardware distinto, la mayor parte de la infraestructura GPU existente simplemente no se construyó para poder acomodarlos.