A Q Labs acaba de lançar o Dust — uma nova e ousada forma de pré-treinar LLMs transformer SEM retropropagação. Sim, leu bem. Sem gradientes.
Como funciona:
→ Injeta ruído aleatório nas saídas das camadas em cada token
→ Recompensa as alterações que reduzem a perda
→ Testado em modelos de 2M a 243M de parâmetros
Resultados iniciais? Fica atrás da retropropagação no início, mas a diferença diminui bastante à medida que se escala para dezenas de milhões de tokens. Modelos maiores = utilização mais eficiente do método.
O código é de código aberto. Isto pode mudar a forma como pensamos sobre a eficiência do treino e os custos de computação na infraestrutura de IA.
Se isto escalar para modelos com milhares de milhões de parâmetros, poderemos estar perante uma mudança de paradigma para os tokens de infraestrutura de IA $AI e os mercados de computação.
Como funciona:
→ Injeta ruído aleatório nas saídas das camadas em cada token
→ Recompensa as alterações que reduzem a perda
→ Testado em modelos de 2M a 243M de parâmetros
Resultados iniciais? Fica atrás da retropropagação no início, mas a diferença diminui bastante à medida que se escala para dezenas de milhões de tokens. Modelos maiores = utilização mais eficiente do método.
O código é de código aberto. Isto pode mudar a forma como pensamos sobre a eficiência do treino e os custos de computação na infraestrutura de IA.
Se isto escalar para modelos com milhares de milhões de parâmetros, poderemos estar perante uma mudança de paradigma para os tokens de infraestrutura de IA $AI e os mercados de computação.