#OpenAIReportedlyCompletesBelModelPretraining theo lý thuyết của tôi là GPT Bel sẽ không bao giờ kết thúc việc huấn luyện.
bản pretrain được báo cáo “>10t” chỉ là trạng thái khởi đầu của nó. sau đó, Bel có thể học với hai tốc độ.
một lớp nhanh sẽ hấp thụ các bài học từ các chứng minh đã được xác thực, kiểm thử mã, thí nghiệm và dấu vết công cụ trong lúc nó hoạt động. một vòng lặp chậm hơn sẽ củng cố các cải tiến vượt qua đánh giá (eval) thành các trọng số và công thức huấn luyện bền vững.
sự tách chính xác này vừa mới bắt đầu hoạt động trong nghiên cứu công khai. một bài báo tháng 5 từ Berkeley, Mila và UT Austin đã biến “context” thành trọng số nhanh và “parameters” thành trọng số chậm. một mô hình duy nhất không bị gián đoạn vẫn tiếp tục học khi tác vụ thay đổi, trong khi weight-only RL bị đình trệ. nó đạt cùng mức thưởng với số lần lăn (rollouts) ít hơn tới 3 lần và giảm trôi dạt (drift) so với mô hình gốc tới 70%.
sau đó, một bài báo tháng 8 cho thấy các transformer đã được pretrained có thể cập nhật tham số trong khi suy luận (inference). một “teacher” có cửa sổ dài quyết định nên viết gì vào “fast weights” để một “student” cửa sổ ngắn giữ lại được thông tin hữu ích sau khi nó rời khỏi context.
OpenAI đã có sẵn nửa đệ quy. bản phát hành chính thức GPT-5.6 của họ bao gồm “RSI Index” được xây dựng từ việc debug nghiên cứu, tối ưu hóa kernel và công thức huấn luyện, các thí nghiệm ML và cải thiện một mô hình khác. Sol đạt thêm 16.2 điểm so với GPT-5.5.
rồi Sol tiếp tục thiết kế hàng trăm thí nghiệm kiến trúc cho mô hình draft nhỏ hơn của mình, khởi chạy quá trình huấn luyện và can thiệp qua các sự cố phần cứng và tình trạng bất ổn khi huấn luyện. mô hình kết quả đã cải thiện hiệu suất sinh token (token-generation efficiency) hơn 15%.
bây giờ hãy cộng thêm báo cáo rằng Bel là một >10t base mà OpenAI nghĩ có thể vượt qua GPT-6 và tiềm năng gần ngưỡng AGI của họ.
đoán của tôi là Bel trở thành “giáo viên” vĩnh viễn. nó học nhanh trong bộ nhớ nhanh, đẩy các cải tiến đã được xác thực vào trọng số chậm, cải thiện bộ máy vận hành cho chu kỳ học tiếp theo và chắt lọc kết quả thành các mô hình nhỏ hơn mà con người thực sự có thể dùng.
$STORJ $MUBARAK $SCRT
bản pretrain được báo cáo “>10t” chỉ là trạng thái khởi đầu của nó. sau đó, Bel có thể học với hai tốc độ.
một lớp nhanh sẽ hấp thụ các bài học từ các chứng minh đã được xác thực, kiểm thử mã, thí nghiệm và dấu vết công cụ trong lúc nó hoạt động. một vòng lặp chậm hơn sẽ củng cố các cải tiến vượt qua đánh giá (eval) thành các trọng số và công thức huấn luyện bền vững.
sự tách chính xác này vừa mới bắt đầu hoạt động trong nghiên cứu công khai. một bài báo tháng 5 từ Berkeley, Mila và UT Austin đã biến “context” thành trọng số nhanh và “parameters” thành trọng số chậm. một mô hình duy nhất không bị gián đoạn vẫn tiếp tục học khi tác vụ thay đổi, trong khi weight-only RL bị đình trệ. nó đạt cùng mức thưởng với số lần lăn (rollouts) ít hơn tới 3 lần và giảm trôi dạt (drift) so với mô hình gốc tới 70%.
sau đó, một bài báo tháng 8 cho thấy các transformer đã được pretrained có thể cập nhật tham số trong khi suy luận (inference). một “teacher” có cửa sổ dài quyết định nên viết gì vào “fast weights” để một “student” cửa sổ ngắn giữ lại được thông tin hữu ích sau khi nó rời khỏi context.
OpenAI đã có sẵn nửa đệ quy. bản phát hành chính thức GPT-5.6 của họ bao gồm “RSI Index” được xây dựng từ việc debug nghiên cứu, tối ưu hóa kernel và công thức huấn luyện, các thí nghiệm ML và cải thiện một mô hình khác. Sol đạt thêm 16.2 điểm so với GPT-5.5.
rồi Sol tiếp tục thiết kế hàng trăm thí nghiệm kiến trúc cho mô hình draft nhỏ hơn của mình, khởi chạy quá trình huấn luyện và can thiệp qua các sự cố phần cứng và tình trạng bất ổn khi huấn luyện. mô hình kết quả đã cải thiện hiệu suất sinh token (token-generation efficiency) hơn 15%.
bây giờ hãy cộng thêm báo cáo rằng Bel là một >10t base mà OpenAI nghĩ có thể vượt qua GPT-6 và tiềm năng gần ngưỡng AGI của họ.
đoán của tôi là Bel trở thành “giáo viên” vĩnh viễn. nó học nhanh trong bộ nhớ nhanh, đẩy các cải tiến đã được xác thực vào trọng số chậm, cải thiện bộ máy vận hành cho chu kỳ học tiếp theo và chắt lọc kết quả thành các mô hình nhỏ hơn mà con người thực sự có thể dùng.
$STORJ $MUBARAK $SCRT
