1兆パラメータのモデル、推論では脳の5%しか使わない。
Mistralは昨日、Large 4(Le Chonk)を発表。1兆パラメータのうち、活性化するのは490億だけ。10月27日にオープンソース化。
パラメータを積み上げる手法は、スパース活性化に取って代わられるのか。それとも「力こそパワー」が勝ち続けるのか?あなたはどっち派?