O artigo da Nous Research comprova: o tokenizador pode ser simulado apenas com bytes; a era do fim do tokenizador para grandes modelos de linguagem está chegando

A Nous Research publicou um estudo apontando que, no futuro, os tokenizadores que os grandes modelos de linguagem têm usado por muito tempo poderão ser substituídos. Por meio de testes controlados em escala de 1,7 bilhão de parâmetros, a equipe de pesquisa quantificou de forma sistemática as vantagens de desempenho do mecanismo de tokenização, provando a viabilidade de um caminho de simulação puramente em bytes.

Por que isso é importante: a tokenização é uma etapa fundamental para modelos como o GPT processarem texto; se a validação de grandes modelos sem tokenização for bem-sucedida, isso terá impactos profundos nos paradigmas de treinamento dos modelos de IA atuais, na eficiência da inferência e nas capacidades entre idiomas. A conquista de avanços nesse sentido por uma equipe chinesa tem grande relevância.#NousResearch #AI #大模型 #分词 #开源