$OPENAI

DeepSeek memublikasikan makalah baru dan merilis infrastruktur dasar sandbox untuk melatih AI agent milik mereka sendiri. Berdasarkan paper di arXiv (DeepSeek Elastic Compute (DSec)), sistem ini digunakan untuk mendukung pelatihan dan evaluasi agent dalam skala besar. Pendiri, Liang Wenfeng, juga tercantum sebagai penulis.

Sebuah SDK mengelola empat jenis sandbox

Makalah tersebut menyatakan bahwa saat melakukan pelatihan dan evaluasi berskala besar untuk agent dengan menggunakan model bahasa besar, model perlu memeriksa pustaka, memanggil alat, menjalankan perintah, dan berinteraksi dengan layanan yang relevan dengan tugas tersebut di lingkungan eksekusi yang terisolasi serta tetap mempertahankan status. Beban kerja seperti ini dalam waktu singkat akan membangun banyak sandbox, dengan kebutuhan fitur dan isolasi yang berbeda-beda. Selain itu, diperlukan pemeliharaan status dalam interaksi jangka panjang, serta penggunaan ulang yang diambil dari kumpulan image yang sangat besar, namun tingkat pemakaian ulangnya tidak tinggi. Karena itu, makalah berpendapat bahwa yang dibutuhkan untuk mendukung pekerjaan tersebut adalah platform eksekusi yang fleksibel, bukan satu jenis lingkungan sandbox.

Pendekatan DSec menggunakan SDK terpadu yang menyediakan empat jenis backend: pemanggilan fungsi, container, virtual machine mikro, dan virtual machine penuh. Sistem bertanggung jawab mengatur penempatan dan manajemen siklus hidup di klaster, menggabungkan lapisan-lapisan yang masing-masing dikendalikan versi independen. Sistem juga memanfaatkan berbagi memori, daur ulang, dan penjadwalan CPU untuk meningkatkan kepadatan eksekusi. Data image dimuat sesuai kebutuhan dari sistem file terdistribusi tingkat klaster 3FS.

Merancang bersama dengan framework reinforcement learning, memisahkan inferensi yang berkeadaan (stateful) dan pelatihan yang dapat diinterupsi/di-preempt

Penjelasan dalam makalah: DSec dan framework reinforcement learning (RL) dirancang bersama—memisahkan eksekusi inferensi berkeadaan dari pelatihan GPU yang dapat di-preempt, serta menyelaraskan siklus hidup sandbox dengan pelatihan. Dengan begitu, status inferensi tetap dipertahankan sambil mendaur ulang sumber daya yang menganggur, dan juga menangani masalah perilaku agen yang tidak tepat.

Menurut laporan TechNode, skala produksi dalam satu unit kira-kira terdiri dari 160 node; setiap hari mampu mendukung sekitar 3 juta sandbox, sambil menjalankan lebih dari 380 ribu sandbox secara bersamaan. Setiap detik dapat membuat lebih dari 5.000 sandbox. Penulis makalah ini berjumlah lebih dari 130 orang.

Artikel ini memublikasikan makalah pelatihan agen sandbox DeepSeek, DSec. Nama penulis Liang Wenfeng muncul pertama kali pada.

$Udang

#AI #加密監管