#OpenAIReportedlyCompletesBelModelPretraining 私の理論では、GPTベルは学習を完了することは決してない。
報告されている「>10tプリトレイン」は、開始状態にすぎないはずだ。その後、ベルは2つの速度で学習できる。
速い層は、検証済みの証明、コードのテスト、実験、ツールのトレースから得た教訓を吸収しながら働く。遅いループは、評価で生き残った改善を永続的な重みと学習レシピに定着させていく。
このような厳密な分割は、ちょうど今、公開研究で動き始めた。バークレー、ミラ、UTオースティンの5月の論文では、コンテキストを速い重み、パラメータを遅い重みとすることが示された。中断のない単一モデルは課題が変わっても学習を続けたが、重みのみのRLは停滞した。3倍まで少ないロールアウトで同じ報酬に到達し、ベースモデルからのドリフトも最大70%減少した。
その後、8月の論文では、推論中に学習済みトランスフォーマがパラメータを更新することが示された。長いウィンドウの教師が、短いウィンドウの生徒に対して、役に立つ情報がコンテキストを離れても残るように、その書き込み先となる速い重みを決める。
OpenAIはすでに再帰的な半分を持っている。公式のGPT-5.6リリースには、「研究デバッグ、カーネル、学習レシピ最適化、ML実験、そして別のモデルを改善する」から構築された「RSI Index」が含まれている。solはGPT-5.5に対して16.2ポイント上積みした。
その後solは、より小さなドラフトモデルのために数百件のアーキテクチャ実験を設計し、学習を開始して、ハードウェアの故障や学習の不安定さを介入で食い止めた。その結果のモデルは、トークン生成の効率が15%以上向上した。
そして、ベルが「>10t」の基礎モデルであり、OpenAIが考えるところではGPT-6の先まで到達し、場合によってはそのAGI閾値にかなり近い可能性がある、という報告を加えよう。
私の見立てでは、ベルは永続的な教師になる。速いメモリにおいて素早く学び、検証済みの伸びを遅い重みに移し、次の学習サイクルを回す仕組みを改善し、その結果を人々が実際に使えるより小さなモデルへと蒸留していく。
$STORJ $MUBARAK $SCRT
報告されている「>10tプリトレイン」は、開始状態にすぎないはずだ。その後、ベルは2つの速度で学習できる。
速い層は、検証済みの証明、コードのテスト、実験、ツールのトレースから得た教訓を吸収しながら働く。遅いループは、評価で生き残った改善を永続的な重みと学習レシピに定着させていく。
このような厳密な分割は、ちょうど今、公開研究で動き始めた。バークレー、ミラ、UTオースティンの5月の論文では、コンテキストを速い重み、パラメータを遅い重みとすることが示された。中断のない単一モデルは課題が変わっても学習を続けたが、重みのみのRLは停滞した。3倍まで少ないロールアウトで同じ報酬に到達し、ベースモデルからのドリフトも最大70%減少した。
その後、8月の論文では、推論中に学習済みトランスフォーマがパラメータを更新することが示された。長いウィンドウの教師が、短いウィンドウの生徒に対して、役に立つ情報がコンテキストを離れても残るように、その書き込み先となる速い重みを決める。
OpenAIはすでに再帰的な半分を持っている。公式のGPT-5.6リリースには、「研究デバッグ、カーネル、学習レシピ最適化、ML実験、そして別のモデルを改善する」から構築された「RSI Index」が含まれている。solはGPT-5.5に対して16.2ポイント上積みした。
その後solは、より小さなドラフトモデルのために数百件のアーキテクチャ実験を設計し、学習を開始して、ハードウェアの故障や学習の不安定さを介入で食い止めた。その結果のモデルは、トークン生成の効率が15%以上向上した。
そして、ベルが「>10t」の基礎モデルであり、OpenAIが考えるところではGPT-6の先まで到達し、場合によってはそのAGI閾値にかなり近い可能性がある、という報告を加えよう。
私の見立てでは、ベルは永続的な教師になる。速いメモリにおいて素早く学び、検証済みの伸びを遅い重みに移し、次の学習サイクルを回す仕組みを改善し、その結果を人々が実際に使えるより小さなモデルへと蒸留していく。
$STORJ $MUBARAK $SCRT
