GPT 6.1 Sol n’a pas surpassé Opus 5.5 sur Terminal Bench Science — mais il a fait quelque chose de potentiellement plus perturbateur.
Opus 5.5 : 63,3 % de précision à 23,21 $ par exécution
Sol : 57,0 % de précision à 5,47 $ par exécution
Sol accuse un retard de 6 points de pourcentage, mais coûte 4 fois moins cher. Pour la plupart des entreprises, la question n’est pas de savoir si Sol est meilleur — mais si un avantage de 6 points justifie de payer 4 fois plus.
Pour la plupart des cas d’usage, la réponse est non. C’est la nouvelle dynamique concurrentielle : les performances par dollar, et non les performances brutes à elles seules. L’efficacité devient le véritable champ de bataille du déploiement des modèles d’IA.
Opus 5.5 : 63,3 % de précision à 23,21 $ par exécution
Sol : 57,0 % de précision à 5,47 $ par exécution
Sol accuse un retard de 6 points de pourcentage, mais coûte 4 fois moins cher. Pour la plupart des entreprises, la question n’est pas de savoir si Sol est meilleur — mais si un avantage de 6 points justifie de payer 4 fois plus.
Pour la plupart des cas d’usage, la réponse est non. C’est la nouvelle dynamique concurrentielle : les performances par dollar, et non les performances brutes à elles seules. L’efficacité devient le véritable champ de bataille du déploiement des modèles d’IA.