#OpenAIReportedlyCompletesBelModelPretraining teori saya adalah gpt bel tidak akan pernah selesai pelatihan.
yang dilaporkan >10t pretrain hanya akan menjadi status awalnya. setelah itu, bel bisa belajar dengan dua kecepatan.
lapisan cepat akan menyerap pelajaran dari bukti terverifikasi, pengujian kode, eksperimen, dan jejak alat saat ia bekerja. loop yang lebih lambat akan mengonsolidasikan peningkatan yang lolos dari evaluasi menjadi bobot dan resep pelatihan yang persisten.
pemisahan yang persis ini baru saja mulai bekerja dalam riset publik. sebuah paper Mei dari Berkeley, Mila, dan UT Austin membuat konteks menjadi bobot cepat, sementara bobot dan parameter menjadi bobot lambat. satu model tanpa henti terus belajar saat tugas berubah, sedangkan weight-only RL mandek. ia mencapai reward yang sama dengan hingga 3x lebih sedikit rollout dan melenceng hingga 70% lebih sedikit dari model dasar.
lalu, sebuah paper Agustus menunjukkan transformer terprasertifikasi yang memperbarui parameter selama inferensi. seorang guru dengan jendela panjang menentukan apa yang harus ditulis oleh murid dengan jendela pendek ke dalam bobot cepat agar informasi yang berguna tetap ada setelah ia keluar dari konteks.
openai sudah memiliki bagian yang rekursif. rilis resmi gpt-5.6 mereka mencakup “RSI Index” yang dibangun dari riset untuk debugging, optimasi kernel dan resep pelatihan, eksperimen ML, serta menyempurnakan model lain. sol memperoleh tambahan 16,2 poin dibanding gpt-5.5.
kemudian sol merancang ratusan eksperimen arsitektur untuk model draft yang lebih kecil, meluncurkan pelatihannya, dan ikut campur melalui kegagalan hardware serta ketidakstabilan pelatihan. model yang dihasilkan meningkatkan efisiensi generasi token lebih dari 15%.
sekarang tambahkan laporan bahwa bel adalah >10t base yang menurut openai bisa melampaui gpt-6 dan berpotensi mendekati ambang batas AGI.
dugaan saya adalah bel menjadi pengajar permanen. ia belajar cepat di memori cepat, memindahkan peningkatan yang terverifikasi ke bobot lambat, memperbaiki mesin yang menjalankan siklus pembelajaran berikutnya, dan menyuling hasilnya ke model-model yang lebih kecil agar benar-benar bisa digunakan orang.
$STORJ $MUBARAK $SCRT
yang dilaporkan >10t pretrain hanya akan menjadi status awalnya. setelah itu, bel bisa belajar dengan dua kecepatan.
lapisan cepat akan menyerap pelajaran dari bukti terverifikasi, pengujian kode, eksperimen, dan jejak alat saat ia bekerja. loop yang lebih lambat akan mengonsolidasikan peningkatan yang lolos dari evaluasi menjadi bobot dan resep pelatihan yang persisten.
pemisahan yang persis ini baru saja mulai bekerja dalam riset publik. sebuah paper Mei dari Berkeley, Mila, dan UT Austin membuat konteks menjadi bobot cepat, sementara bobot dan parameter menjadi bobot lambat. satu model tanpa henti terus belajar saat tugas berubah, sedangkan weight-only RL mandek. ia mencapai reward yang sama dengan hingga 3x lebih sedikit rollout dan melenceng hingga 70% lebih sedikit dari model dasar.
lalu, sebuah paper Agustus menunjukkan transformer terprasertifikasi yang memperbarui parameter selama inferensi. seorang guru dengan jendela panjang menentukan apa yang harus ditulis oleh murid dengan jendela pendek ke dalam bobot cepat agar informasi yang berguna tetap ada setelah ia keluar dari konteks.
openai sudah memiliki bagian yang rekursif. rilis resmi gpt-5.6 mereka mencakup “RSI Index” yang dibangun dari riset untuk debugging, optimasi kernel dan resep pelatihan, eksperimen ML, serta menyempurnakan model lain. sol memperoleh tambahan 16,2 poin dibanding gpt-5.5.
kemudian sol merancang ratusan eksperimen arsitektur untuk model draft yang lebih kecil, meluncurkan pelatihannya, dan ikut campur melalui kegagalan hardware serta ketidakstabilan pelatihan. model yang dihasilkan meningkatkan efisiensi generasi token lebih dari 15%.
sekarang tambahkan laporan bahwa bel adalah >10t base yang menurut openai bisa melampaui gpt-6 dan berpotensi mendekati ambang batas AGI.
dugaan saya adalah bel menjadi pengajar permanen. ia belajar cepat di memori cepat, memindahkan peningkatan yang terverifikasi ke bobot lambat, memperbaiki mesin yang menjalankan siklus pembelajaran berikutnya, dan menyuling hasilnya ke model-model yang lebih kecil agar benar-benar bisa digunakan orang.
$STORJ $MUBARAK $SCRT
