$Homard
DeepSeek publie une formation de proxys en mode sandbox DSec : le mémoire mentionne Liang Wenfeng parmi les auteurs

DeepSeek a publié un nouveau mémoire, dévoilant l’infrastructure de base d’une sandbox utilisée pour entraîner ses propres agents d’IA. D’après le mémoire sur arXiv « DeepSeek Elastic Compute (DSec) », ce système sert à soutenir l’entraînement et l’évaluation à grande échelle d’agents. Le fondateur, Liang Wenfeng, figure également parmi les auteurs. Un SDK gère quatre types de sandboxes. Le mémoire indique que, lorsqu’on utilise de grands modèles de langage pour entraîner et évaluer des agents à grande échelle, le modèle doit examiner les bibliothèques, appeler des outils, exécuter des commandes et interagir avec des services liés aux tâches dans un environnement d’exécution isolé et conservant l’état. Ces charges de travail créent en peu de temps un grand nombre de sandboxes ; leurs fonctions et leurs exigences d’isolation varient, et il faut en plus conserver l’état lors d’interactions sur des durées prolongées, tout en réutilisant des images provenant d’une énorme bibliothèque, avec un taux de réutilisation pourtant faible. Ainsi, le mémoire estime que ce qui est nécessaire pour prendre en charge ces travaux n’est pas un seul type d’environnement d’exécution en sandbox, mais une plateforme d’exécution flexible. La méthode de DSec consiste à fournir via un SDK unifié quatre backends : l’appel de fonctions, les conteneurs, les micro-machines virtuelles et les machines virtuelles complètes. Le système se charge d’ordonner le placement et la gestion du cycle de vie des environnements dans le cluster, en combinant des couches gérées séparément par contrôle de version, et en augmentant la densité d’exécution grâce au partage de mémoire, au recyclage et à la planification CPU ; les images sont chargées à la demande depuis un système de fichiers distribué au niveau du cluster, 3FS. Conçu conjointement avec des cadres d’apprentissage par renforcement, le mémoire explique que l’inférence avec état et l’entraînement pouvant être interrompu sont séparés. DSec et le cadre d’apprentissage par renforcement (RL) sont conçus de manière conjointe : découplage de l’exécution d’inférences avec état et de l’entraînement sur GPU pouvant être préempté, synchronisation du cycle de vie des sandboxes avec l’entraînement afin de conserver l’état d’inférence tout en recyclant les ressources inactives, et traitement des problèmes liés à des comportements inadaptés des agents. Selon un rapport de TechNode, une unité à l’échelle de production compte environ 160 nœuds, peut soutenir quelque 3 millions de sandboxes par jour, exécuter simultanément plus de 380 000 sandboxes et créer plus de 5 000 sandboxes par seconde. Les auteurs de ce mémoire comptent plus de 130 personnes. Le mémoire « DeepSeek publie une sandbox d’entraînement d’agents DSec » : Liang Wenfeng figure parmi les auteurs — apparaît pour la première fois sur .