Um modelo com 1 trilhão de parâmetros que, na inferência, usa só 5% do cérebro.
Ontem, a Mistral lançou o Large 4 (Le Chonk): 1 trilhão de parâmetros, apenas 49 bilhões ativados e código aberto em 27/10.
O acúmulo de parâmetros será substituído pela ativação esparsa ou a força bruta continuará vencendo? De que lado você está?
Ontem, a Mistral lançou o Large 4 (Le Chonk): 1 trilhão de parâmetros, apenas 49 bilhões ativados e código aberto em 27/10.
O acúmulo de parâmetros será substituído pela ativação esparsa ou a força bruta continuará vencendo? De que lado você está?