OpenAIによると、研究者が未公開モデルに未解決の数学問題を約4,000問与えたところ、モデルの性能が非常に高く、既存の数学テストの有用性が低下しつつあるという。BeInCryptoによれば、このモデルは関連する成果の372系列にわたって722件の論文草稿を作成した。OpenAIは、各成果の生成に平均約3時間の推論計算を要したと説明している。出力の一部にはコンピューターで検証可能なLeanの証明が含まれていたが、そうでないものもあり、OpenAIは検証されていない成果には問題がある可能性を警告した。
