Tencent HunYuan Buka Sumber UniRL: Menggabungkan Model Besar dan Model Difusi dalam Satu Kerangka Pembelajaran Penguatan
Tim HunYuan Tencent mengumumkan pembukaan sumber UniRL, yang merupakan yang pertama di industri menggabungkan model bahasa besar (LLM) dan model difusi dalam satu kerangka pelatihan pasca pembelajaran penguatan. UniRL memisahkan arsitektur model dan algoritma pelatihan, memungkinkan model generasi teks, bahasa visual, gambar, dan video untuk berbagi siklus pelatihan yang sama. Untuk model difusi dan pencocokan aliran, tim HunYuan juga meluncurkan algoritma Flow-DPPO. Sebelumnya, proses pelatihan RL untuk model bahasa besar dan model difusi tidak saling terhubung, UniRL mengisi kekosongan ini.
Mengapa ini penting: Pembukaan UniRL berarti infrastruktur RL untuk pelatihan AI multimodal dapat dibagikan, secara signifikan mengurangi biaya pengembangan dan pemeliharaan berbagai jalur pelatihan model.
#腾讯 #AI #开源 #大模型 #Web3
Tim HunYuan Tencent mengumumkan pembukaan sumber UniRL, yang merupakan yang pertama di industri menggabungkan model bahasa besar (LLM) dan model difusi dalam satu kerangka pelatihan pasca pembelajaran penguatan. UniRL memisahkan arsitektur model dan algoritma pelatihan, memungkinkan model generasi teks, bahasa visual, gambar, dan video untuk berbagi siklus pelatihan yang sama. Untuk model difusi dan pencocokan aliran, tim HunYuan juga meluncurkan algoritma Flow-DPPO. Sebelumnya, proses pelatihan RL untuk model bahasa besar dan model difusi tidak saling terhubung, UniRL mengisi kekosongan ini.
Mengapa ini penting: Pembukaan UniRL berarti infrastruktur RL untuk pelatihan AI multimodal dapat dibagikan, secara signifikan mengurangi biaya pengembangan dan pemeliharaan berbagai jalur pelatihan model.
#腾讯 #AI #开源 #大模型 #Web3