Les données d’évaluation des agents de DeepSeek (DSH) cachent un signal sur une feuille de route matérielle.

Quelques chiffres clés :
- La consommation de tokens est énorme ; le taux de hit du cache KV est le sujet de discussion
- Pour une même tâche, le DSH met deux fois plus de temps que GPT/Claude

Ce « 2 fois », beaucoup de gens ne le voient que comme un écart de performance, mais c’est une piste importante pour la route matérielle.

À quoi tiennent les goulots d’étranglement à l’ère de l’agent ?
Ce n’est pas la puissance de calcul, c’est la bande passante mémoire.
Quand l’agent exécute des tâches = contexte extrêmement long = lecture/écriture répétées d’un volume massif de caches KV.
Plus le contexte est long, plus le cache KV devient grand, plus la lecture est lente —
même si vos puces de calcul sont très rapides, les données ne peuvent pas suivre depuis la mémoire : vous attendez tout le temps.

Le double du temps de traitement du DSH, c’est essentiellement « le mur de la mémoire » qui se moque de la théorie : il échange « un accès mémoire plus lent » contre « un coût plus bas ».

Cela explique pourquoi Chen Liwu (Intel) insiste pour empiler CPU + DRAM en encapsulation :

La solution de Nvidia, elle, consiste en un empilement GPU + HBM (technologie CoWoS),
qui place les unités de calcul au plus près de la mémoire : la distance de transfert des données passe de « au niveau des centimètres » à « au niveau des micromètres » — la bande passante explose.

Chen Liwu regarde la même chose, mais la place sur CPU :
avec la généralisation des agents, le CPU prend en charge une grande partie de l’inférence et de la planification, et doit lui aussi fonctionner au plus près de la mémoire.

La généralisation des agents accélérera l’arrivée de l’ère « CPU/GPU 1:1 » :
- Aujourd’hui : les GPU des centres de données sont les vedettes, les CPU jouent les seconds rôles
- À l’ère des agents : à côté de chaque GPU, il faut un CPU puissant pour gérer la planification, les boucles d’agent et le management du KV
- À ce moment-là, le CPU devra aussi être comme le GPU : encapsulation empilée « CPU + HBM »

Qu’est-ce que cela implique (angle d’investissement) :

1. La technologie d’encapsulation = la prochaine étape qui serre le cou
CoWoS, empilement 2.5D/3D, liaisons hybrides — ces procédés d’encapsulation constituent le nouveau point de départ de la course aux armements du matériel IA
2. Les fabricants de mémoire revalorisent leurs prix
Le HBM s’est déjà vendu comme des petits pains ; si les CPU doivent aussi utiliser du HBM, l’espace d’imagination des fabricants de DRAM passera à un autre niveau
3. Le pari « décalé » d’Intel pourrait renverser la situation
Tout le monde regarde Nvidia, mais le stacking CPU+DRAM de Chen Liwu parie sur la « deuxième courbe » de l’ère des agents

Dernière phrase :
la facture en tokens des agents redéfinit le matériel —
quand « la vitesse de lecture » vaut plus que « la vitesse de calcul », les puces placées au plus près de la mémoire sont les gagnantes.

La première moitié de la course aux armements en puissance de calcul, c’est pour les GPU,
la seconde, pour l’encapsulation.

#DeepSeek #DSH #封装 #HBM