$Lobster
DeepSeek membuka sandbox pelatihan proxy (agen) DSec: makalah, Liang Wenfeng tercantum sebagai penulis

DeepSeek menerbitkan makalah baru dan membuka infrastruktur dasar sandbox yang digunakan sendiri untuk melatih AI agent (agen). Berdasarkan makalah di arXiv berjudul 《DeepSeek Elastic Compute (DSec)》, sistem ini digunakan untuk mendukung pelatihan dan evaluasi agen skala besar. Liang Wenfeng selaku pendiri juga tercantum sebagai penulis. 1 paket SDK mengelola 4 jenis sandbox Makalah tersebut menyatakan: saat menggunakan model bahasa besar untuk pelatihan dan evaluasi agen dalam skala besar, model perlu memeriksa library, memanggil alat, mengeksekusi perintah, serta berinteraksi dengan layanan yang terkait tugas, dalam lingkungan eksekusi yang terisolasi dan tetap menyimpan state. Beban kerja seperti ini akan membuat sandbox dalam jumlah besar dalam waktu singkat; kebutuhan fungsional dan tingkat isolasinya pun berbeda-beda. Selain itu, selama interaksi yang berlangsung lama, state harus tetap dipertahankan, dan sistem perlu mengambil dari gudang berkas image yang sangat besar—namun tingkat penggunaan ulangnya tidak tinggi. Karena itu, makalah berpendapat bahwa yang dibutuhkan untuk mendukung pekerjaan tersebut bukanlah satu jenis lingkungan eksekusi sandbox, melainkan platform yang fleksibel. Pendekatan DSec adalah menyediakan empat jenis backend melalui SDK yang seragam: pemanggilan fungsi, kontainer, virtual machine mikro, dan virtual machine lengkap. Sistem bertanggung jawab menyusun penempatan dan manajemen siklus hidup lingkungan di dalam klaster, mengombinasikan lapisan yang masing-masing dikontrol versi secara terpisah, lalu meningkatkan kepadatan eksekusi melalui berbagi memori, daur ulang, serta penjadwalan CPU. Untuk data image, dimuat sesuai kebutuhan dari sistem berkas terdistribusi tingkat-klaster 3FS. Dirancang bersama dengan kerangka reinforcement learning: pisahkan penalaran ber-state dan pelatihan yang bisa di-preempt Makalah menjelaskan bahwa DSec dan kerangka reinforcement learning (RL) dirancang bersama: eksekusi penalaran yang ber-state dipisahkan dari pelatihan GPU yang dapat di-preempt, serta siklus hidup sandbox diselaraskan dengan pelatihan. Dengan begitu, saat sumber daya menganggur direklamasi, state penalaran tetap dipertahankan, sekaligus menangani masalah perilaku agen yang tidak semestinya. Menurut laporan TechNode, unit skala produksi biasanya terdiri dari sekitar 160 node; setiap hari dapat mendukung sekitar 3 juta sandbox, sambil menjalankan lebih dari 380 ribu sandbox secara bersamaan. Dalam satu detik, bisa membuat lebih dari 5.000 sandbox. Jumlah penulis makalah ini lebih dari 130 orang. Artikel ini DeepSeek membuka sandbox pelatihan proxy (agen) DSec, Liang Wenfeng tercantum sebagai penulis pertama kali muncul di .