$ langosta
DeepSeek publica un documento sobre su entorno de entrenamiento en proxy DSec; Liang Wenfeng figura como autor
DeepSeek publica un nuevo artículo y revela la infraestructura base de un sandbox que utiliza para entrenar agentes de IA. Según el paper de arXiv titulado «DeepSeek Elastic Compute (DSec)», este sistema se utiliza para respaldar el entrenamiento y la evaluación a gran escala de agentes, y el fundador Liang Wenfeng también aparece como autor. Un SDK gestiona cuatro tipos de sandboxes: el artículo señala que, cuando se emplean modelos de lenguaje a gran escala para entrenar y evaluar agentes, el modelo necesita inspeccionar librerías, llamar herramientas, ejecutar comandos e interactuar con servicios relacionados con la tarea dentro de un entorno de ejecución aislado y que conserve estado. Esta clase de cargas de trabajo crea sandboxes en gran cantidad durante períodos cortos; las funcionalidades y los requisitos de aislamiento varían, y además se debe conservar el estado durante interacciones prolongadas, tomando el material desde un enorme repositorio de imágenes, aunque la tasa de reutilización no es alta. Por ello, el documento sostiene que lo que se necesita para respaldar estos trabajos es una plataforma de ejecución flexible, y no un único entorno de ejecución de sandboxes. La propuesta de DSec consiste en que un SDK unificado ofrece cuatro tipos de backend: llamadas a funciones, contenedores, micro-VMs y máquinas virtuales completas. El sistema se encarga de organizar la ubicación y gestionar el ciclo de vida en el clúster, combinando capas que se versionan de forma independiente, y mejora la densidad de ejecución mediante el uso compartido de memoria, el reciclaje y la planificación de CPU. Los datos de las imágenes se cargan bajo demanda desde el sistema de archivos distribuido a nivel de clúster 3FS. Diseñado conjuntamente con el marco de aprendizaje por refuerzo: el artículo explica que DSec y el marco de aprendizaje por refuerzo (RL) se diseñan de manera conjunta: desacoplan la ejecución de inferencias con estado y el entrenamiento de GPU que puede ser interrumpido (preempted), y coordinan el ciclo de vida del sandbox con el entrenamiento. De este modo, al recuperar recursos ociosos se conserva el estado de la inferencia y, además, se aborda el problema de un comportamiento indebido de los agentes. Según el reporte de TechNode, una unidad a escala de producción consta de unos 160 nodos; al día puede sostener aproximadamente 3 millones de sandboxes, ejecutando simultáneamente más de 380.000, y puede crear más de 5.000 sandboxes por segundo. Los autores del artículo superan las 130 personas. El artículo DeepSeek publica un sandbox de entrenamiento para agentes DSec; Liang Wenfeng figura como autor. aparece por primera vez en .
DeepSeek publica un documento sobre su entorno de entrenamiento en proxy DSec; Liang Wenfeng figura como autor
DeepSeek publica un nuevo artículo y revela la infraestructura base de un sandbox que utiliza para entrenar agentes de IA. Según el paper de arXiv titulado «DeepSeek Elastic Compute (DSec)», este sistema se utiliza para respaldar el entrenamiento y la evaluación a gran escala de agentes, y el fundador Liang Wenfeng también aparece como autor. Un SDK gestiona cuatro tipos de sandboxes: el artículo señala que, cuando se emplean modelos de lenguaje a gran escala para entrenar y evaluar agentes, el modelo necesita inspeccionar librerías, llamar herramientas, ejecutar comandos e interactuar con servicios relacionados con la tarea dentro de un entorno de ejecución aislado y que conserve estado. Esta clase de cargas de trabajo crea sandboxes en gran cantidad durante períodos cortos; las funcionalidades y los requisitos de aislamiento varían, y además se debe conservar el estado durante interacciones prolongadas, tomando el material desde un enorme repositorio de imágenes, aunque la tasa de reutilización no es alta. Por ello, el documento sostiene que lo que se necesita para respaldar estos trabajos es una plataforma de ejecución flexible, y no un único entorno de ejecución de sandboxes. La propuesta de DSec consiste en que un SDK unificado ofrece cuatro tipos de backend: llamadas a funciones, contenedores, micro-VMs y máquinas virtuales completas. El sistema se encarga de organizar la ubicación y gestionar el ciclo de vida en el clúster, combinando capas que se versionan de forma independiente, y mejora la densidad de ejecución mediante el uso compartido de memoria, el reciclaje y la planificación de CPU. Los datos de las imágenes se cargan bajo demanda desde el sistema de archivos distribuido a nivel de clúster 3FS. Diseñado conjuntamente con el marco de aprendizaje por refuerzo: el artículo explica que DSec y el marco de aprendizaje por refuerzo (RL) se diseñan de manera conjunta: desacoplan la ejecución de inferencias con estado y el entrenamiento de GPU que puede ser interrumpido (preempted), y coordinan el ciclo de vida del sandbox con el entrenamiento. De este modo, al recuperar recursos ociosos se conserva el estado de la inferencia y, además, se aborda el problema de un comportamiento indebido de los agentes. Según el reporte de TechNode, una unidad a escala de producción consta de unos 160 nodos; al día puede sostener aproximadamente 3 millones de sandboxes, ejecutando simultáneamente más de 380.000, y puede crear más de 5.000 sandboxes por segundo. Los autores del artículo superan las 130 personas. El artículo DeepSeek publica un sandbox de entrenamiento para agentes DSec; Liang Wenfeng figura como autor. aparece por primera vez en .

