Un modelo de 1 billón de parámetros que, al inferir, solo usa el 5 % de su cerebro.
Ayer, Mistral lanzó Large 4 (Le Chonk): 1 billón de parámetros, solo activa 49.000 millones y será de código abierto el 27/10.
¿La activación dispersa sustituirá a la acumulación de parámetros, o seguirá ganando la fuerza bruta? ¿De qué lado estás?
Ayer, Mistral lanzó Large 4 (Le Chonk): 1 billón de parámetros, solo activa 49.000 millones y será de código abierto el 27/10.
¿La activación dispersa sustituirá a la acumulación de parámetros, o seguirá ganando la fuerza bruta? ¿De qué lado estás?