OpenAI vient de lancer o3, son modèle de raisonnement le plus performant à ce jour. Ce n’est pas simplement une nouvelle version de GPT, mais un changement fondamental dans la manière dont l’IA s’attaque aux problèmes complexes.

Son architecture introduit un temps de réflexion adaptatif : le modèle peut littéralement consacrer davantage de cycles de calcul aux problèmes les plus difficiles. Imaginez une allocation dynamique des ressources au moment de l’inférence, un peu comme AlphaGo qui effectuait davantage de simulations MCTS pour les positions cruciales sur le plateau.

Mode pulvérisation des benchmarks : 87,5 % au GPQA Diamond (questions scientifiques de niveau doctorat), 96,7 % à l’AIME 2024 (concours de mathématiques avancées) et 25,2 % au Frontier Math (problèmes jusque-là non résolus, qui avaient résisté à tous les systèmes d’IA).

Le plus impressionnant ? Vous pouvez ajuster le budget de calcul. Avec un budget faible, vous obtenez des performances de niveau GPT-4o. Réglez-le au maximum et vous pourrez résoudre des problèmes qui demandaient des semaines de travail à des experts humains.

C’est le premier modèle qui raisonne véritablement en plusieurs étapes, au lieu de simplement faire correspondre des motifs. Les conséquences pour la recherche scientifique, la démonstration de théorèmes et les problèmes d’ingénierie complexes sont considérables.

Nous assistons en temps réel à l’évolution des modèles de langage vers de véritables moteurs de raisonnement. La phase de découverte vient de s’accélérer fortement.