La investigación de Nous confirma: los tokenizadores pueden ser simulados con bytes puros, se acerca la era de los modelos de lenguaje sin tokenización
Nous Research publicó un paper que sugiere que los tokenizadores, de los que dependen los modelos de lenguaje a gran escala, podrían ser reemplazados en el futuro. A través de pruebas controladas con un modelo de 1.7B de parámetros, el equipo de investigación cuantificó sistemáticamente las ventajas de rendimiento del mecanismo de tokenización, demostrando la viabilidad de la simulación con bytes puros.
¿Por qué es importante? La tokenización es el paso fundamental en el tratamiento de texto de modelos grandes como GPT; si se valida con éxito un modelo sin tokenización, tendrá un impacto profundo en los paradigmas de entrenamiento de modelos de IA, la eficiencia de inferencia y la capacidad multilingüe. El avance de un equipo chino en esta dirección tiene un significado crucial. #NousResearch #AI #大模型 #分词 #开源
Nous Research publicó un paper que sugiere que los tokenizadores, de los que dependen los modelos de lenguaje a gran escala, podrían ser reemplazados en el futuro. A través de pruebas controladas con un modelo de 1.7B de parámetros, el equipo de investigación cuantificó sistemáticamente las ventajas de rendimiento del mecanismo de tokenización, demostrando la viabilidad de la simulación con bytes puros.
¿Por qué es importante? La tokenización es el paso fundamental en el tratamiento de texto de modelos grandes como GPT; si se valida con éxito un modelo sin tokenización, tendrá un impacto profundo en los paradigmas de entrenamiento de modelos de IA, la eficiencia de inferencia y la capacidad multilingüe. El avance de un equipo chino en esta dirección tiene un significado crucial. #NousResearch #AI #大模型 #分词 #开源