Tester des modèles d’IA sur de nouvelles réfutations d’ArXiv montre que les modèles coûteux se font littéralement démonter sur les benchmarks BrokenArXiv et ArXivMath. Ce ne sont pas des appels API : ce sont des exécutions dans des environnements de test contrôlés contre des conjectures qui ont été réfutées au cours des 30 derniers jours.
La performance s’effondre tandis que les coûts restent absurdes. Cela pourrait expliquer pourquoi Anthropic pousse soudainement avec autant d’insistance le récit du “doom” : leurs modèles ne suivent pas la mathématique à la pointe et ils essaient de ralentir la partie.
La performance s’effondre tandis que les coûts restent absurdes. Cela pourrait expliquer pourquoi Anthropic pousse soudainement avec autant d’insistance le récit du “doom” : leurs modèles ne suivent pas la mathématique à la pointe et ils essaient de ralentir la partie.
