**Anthropic** a dévoilé lundi son nouveau modèle IA intermédiaire de prochaine génération, **Claude Sonnet 5.5**. La société affirme que ce modèle accélère le traitement de plus de 30% par rapport à son prédécesseur et réduit le coût par tâche jusqu’à 30%.

Point clé

  • Le sonnet 5.5 a obtenu 70,6% sur le benchmark de codage Terminal-Bench 4.0. C’est une nette progression par rapport aux 10,3% du sonnet 5.

  • Anthropic a pour la première fois intégré à la gamme Sonnet un dispositif de cybersécurité qu’il appliquait auparavant uniquement à ses modèles haut de gamme.

  • Cependant, dans une analyse comparative indépendante, il apparaît que, en mode de performances maximales, le coût par tâche de Sonnet 5 est plus élevé que celui de Sonnet 5.

Analyse comparative des performances de Claude Sonnet 5.5

Sonnet 5.5 est le deuxième modèle de la famille Claude 5.5 et a été dévoilé seulement six jours après la sortie du modèle phare « Claude Opus 5.5 » (le 22 septembre). Dans le communiqué de lancement, Anthropic présente Sonnet 5.5 comme un modèle « plus rapide et moins coûteux » qui vient compléter Opus 5.5. Il est indiqué qu’il est adapté aux tâches quotidiennes, aux tâches définies avec précision, à la correction de bugs, ainsi qu’à la purification de documents, de diapositives et de tableurs.

Le prix a été fixé à 2 dollars pour 1 million de tokens en entrée et à 10 dollars pour 1 million de tokens en sortie.

Lors du test de codage avec agents Terminal-Bench 4.0, Sonnet 5.5 a obtenu 70,6 %. Il s’agit d’un score supérieur à celui de Sonnet 5 (10,3 %), ainsi qu’à celui—plus coûteux—d’Opus 5.5 (66,4 %). En outre, Sonnet 5.5 a été le premier modèle Sonnet à réussir Pokémon Red en ne regardant que des captures d’écran. Il s’agit d’un benchmark qui teste la capacité à mener des tâches de longue durée ainsi que la compréhension d’images.

Le nouveau modèle est disponible dès à présent sur toutes les plateformes prises en charge par Anthropic, notamment Amazon Web Services (AWS), Google Cloud et Microsoft Azure. La société a également déclaré avoir prévu de lancer, dans les prochaines semaines, une version « Claude Haiku 5.5 » encore plus légère. Haiku 5.5 est un modèle ciblant les appels en grand volume et la demande sensible aux coûts ; à son lancement, la gamme complète de trois modèles de la génération 5.5 sera constituée.

Article connexe : OpenAI, ralentissement du rythme de développement de l’IA « Frontier » après l’incident de « sortie de bac à sable » du 20 septembre

Dispositifs de sécurité et structure des coûts de Sonnet 5.5

Dans son annonce de lancement, Anthropic a cité l’évaluation du directeur des opérations (COO) d’Epic Games, **Daniel Vogel**. Vogel a indiqué que Sonnet 5.5 avait traité, lors des premiers tests, du code système de jeux pouvant atteindre des dizaines de milliers de lignes, et qu’« il a franchi sans difficulté les critères de qualité attendus d’un modèle de niveau supérieur ».

Selon une évaluation selon laquelle les performances de Sonnet 5.5 en cybersécurité atteignent un niveau similaire à celui d’Opus 5, la société a transféré pour la première fois à la gamme Sonnet des dispositifs de sécurité qui n’étaient jusqu’alors appliqués qu’aux modèles les plus haut de gamme. Cela ne semble pas affecter les corrections de bugs de routine, mais les demandes de cybersécurité présentant un risque élevé sont conçues pour être « rétrogradées » de façon notable vers Sonnet 5. Par ailleurs, une nouvelle classification a été introduite pour empêcher les tentatives d’exfiltration du processus de raisonnement.

Cependant, tous les tests ne confirment pas pleinement les arguments d’Anthropic concernant la « réduction des coûts ». L’entreprise de recherche Artificial Analysis a estimé le coût moyen pondéré des tâches du benchmark effectuées par Sonnet 5.5 en mode de performances maximales à 7,60 dollars par tâche. C’est en fait plus élevé que les 5,09 dollars de Sonnet 5. En revanche, dans les mêmes conditions, le score d’indice (index score) de Sonnet 5.5 est passé de 38 à 56. On peut donc aussi y voir une interprétation selon laquelle l’accent a davantage été mis sur l’amélioration des performances absolues que sur l’efficacité des coûts.

Avant ce lancement, Anthropic a présenté le 22 septembre son modèle phare Opus 5.5 et a réduit de 20 % le prix par million de tokens en entrée, le ramenant à 4 dollars, ainsi qu’à 20 dollars par million de tokens en sortie. À l’époque, l’entreprise a expliqué qu’en se basant sur des charges de travail typiques, elle réduisait les coûts d’environ 40 % par rapport à Opus 5, tout en augmentant la vitesse de génération de sortie de plus de 30 %. Le même jour, **OpenAI** a également dévoilé GPT-6 Sol et GPT-6 Luna, en affichant des prix correspondant à la moitié de ceux des modèles des générations précédentes.

Prochain article : BlackRock, « la puissance de calcul finit par se diriger vers les marchés de l’« avenir » (futures) », selon une projection »