Tencent lanza UniRL de código abierto: unificando grandes modelos y modelos de difusión en un mismo marco de aprendizaje reforzado

El equipo de Tencent ha anunciado el lanzamiento de UniRL, que es la primera solución en la industria que integra grandes modelos de lenguaje (LLM) y modelos de difusión en un único marco de entrenamiento posterior de aprendizaje reforzado. UniRL desacopla la arquitectura del modelo y el algoritmo de entrenamiento, permitiendo que los modelos de generación de texto, lenguaje visual, imágenes y videos compartan un bucle de entrenamiento unificado. Para los modelos de difusión y coincidencia de flujo, el equipo de Mingyuan ha lanzado simultáneamente el algoritmo Flow-DPPO. En el pasado, los procesos de entrenamiento y algoritmos de RL para grandes modelos de lenguaje y modelos de difusión no eran interoperables, y UniRL llena este vacío.

¿Por qué es importante?: La apertura de UniRL significa que la infraestructura de RL para el entrenamiento de IA multimodal puede ser compartida, reduciendo significativamente los costos de desarrollo y mantenimiento de múltiples tuberías de entrenamiento de modelos.

#腾讯 #AI #开源 #大模型 #Web3