$MSFTB $AMZNB $GOOGLB
Claude Opus 5.5 est désormais disponible : -20 % par rapport à la génération précédente, -40 % de coûts
Anthropic a annoncé le 22, la sortie de Claude Opus 5.5, le premier modèle de la série Claude 5.5. D’après le fabricant, Opus 5.5 atteint, pour la plupart des tâches, le niveau de Claude Fable 5.1, tandis que ses coûts de fonctionnement sont inférieurs de 40 % à ceux d’Opus 5. Sonnet 5.5 et Haiku 5.5 seront lancés dans les prochaines semaines. Les tarifs pour l’entrée et la sortie sont de 4 et 20 dollars par million de tokens, et la lecture du cache baisse de 60 % selon Anthropic. Opus 5.5 nécessite moins de ressources de calcul que Opus 5, et son prix reflète également cette différence. L’entrée et la sortie reviennent respectivement à 4 et 20 dollars par million de tokens, soit 20 % de moins qu’Opus 5. Pour la lecture du cache, qui représente une large part des coûts des agents et du travail de programmation, le coût tombe à 0,2 dollar par million de tokens, soit 60 % de moins qu’Opus 5. Avec les réglages par défaut, une charge de travail typique coûte 40 % de moins qu’Opus 5, et la vitesse de sortie est aussi supérieure de plus de 30 %.
En plus de la baisse de prix, Anthropic a relevé aussi les limites de consommation sur 5 heures des formules Pro, Max et Team, et a fourni aux abonnés une réinitialisation des limites de débit qu’ils peuvent choisir au moment qui leur convient. Claude Code et la plateforme Claude proposent par ailleurs un mode rapide, jusqu’à 2,5 fois plus rapide, au prix de 8 dollars par million de tokens en entrée et 40 dollars en sortie.
La migration de 680 000 lignes de code est effectuée en une journée : le fabricant indique que l’écart aux benchmark reflète désormais de moins en moins la différence réelle. Anthropic précise qu’Opus 5.5 dépasse Opus 5 sur des tests internes portant sur la programmation par agents, les opérations sur ordinateur et le travail de connaissance. Un testeur précoce l’a utilisé pour accomplir en un jour une migration de 680 000 lignes de code, ce qui nécessitait auparavant un ensemble d’équipe d’ingénierie pendant plusieurs semaines ; un autre testeur a revu et corrigé une bibliothèque de 200 000 lignes en moins de 3 heures, là où Opus 5 a pris plus de 20 heures et a consommé 2,5 fois plus de tokens.
Lors de l’évaluation GDPval-AA v2.1, qui mesure le PIB de 44 professions dans des situations réelles, Opus 5.5 obtient 1846 Elo en réglage de puissance maximal, Fable 5.1 1735, et Opus 5 1708. Anthropic rappelle aussi que, une fois ce niveau de capacité atteint, l’écart de performance aux benchmark reflète moins de manière fiable les différences dans le monde réel ; d’après leur propre expérience, la différence entre Opus 5.5 et Fable 5.1 semble donc plus faible en termes de scores.
La manière de communiquer constitue aussi l’un des axes majeurs de cette mise à jour. Anthropic indique qu’avec Opus 5, l’avis le plus fréquent concernait une sortie trop longue et difficile à lire. Opus 5.5 place les informations les plus importantes en premier, emploie moins de jargon ou d’expressions particulières, et respecte mieux les règles d’écriture que les utilisateurs fournissent.
Premier modèle « après avoir freiné pour les technologies de pointe », la plupart des tâches de cybersécurité sont désormais confiées à Opus 4.8. Anthropic affirme qu’Opus 5.5 est le premier modèle de la société après son appel à freiner sur les technologies de pointe. Avant sa publication, il a été testé par des organismes d’évaluation externes comme METR et Frontier Design. Dans le cadre d’audits automatisés de comportements couvrant près de 2 000 scénarios, Opus 5.5 est le modèle qui a obtenu les meilleurs résultats parmi ceux testés à ce jour, et il est aussi le plus performant sur la majorité des indicateurs de fiabilité.
Le fabricant indique qu’à l’occasion d’un nouveau test, où l’on évalue la tendance des modèles à franchir des limites de séparation, Opus 5.5 tente de contourner ces limites environ 85 % de fois de moins que Opus 5 ou Claude Mythos 5.1, et que chaque tentative relève d’une gravité faible, tout en étant rapportée par le modèle lui-même. Toutefois, Anthropic précise également que construire des évaluations permettant de détecter de façon fiable, avant le déploiement, chaque type d’échec reste un problème non résolu ; de plus, ils observent des signes montrant qu’Opus 5.5 soupçonne souvent qu’il est en cours d’évaluation, ce qui peut affaiblir leur capacité à juger la façon dont le modèle se comportera dans un environnement réel.
Étant donné que la capacité d’Opus 5.5 dans les domaines de la biologie et de la cybersécurité est comparable à celle de Claude Mythos 5.1, Anthropic applique, comme pour Fable 5.1, des mesures de déploiement renforcées : la plupart des tâches de cybersécurité seront confiées à Opus 4.8, tandis que le domaine de la biologie exigera de passer par un nouveau programme de validation en sciences de la vie. Seules les laboratoires académiques, les start-ups et les entreprises pharmaceutiques ayant réussi les validations pourront utiliser le modèle. Anthropic indique aussi que, dans les prochaines semaines, le programme de validation en cybersécurité sera étendu afin que les professionnels ayant validé puissent utiliser Opus 5.5 dans leur travail.
Opus 5.5 est déjà disponible sur toutes les plateformes, notamment Amazon Web Services, Google Cloud et Microsoft Azure. Le code du modèle utilisé par les développeurs sur la plateforme Claude est : claude-opus-5-5.
Cet article « Claude Opus 5.5 est désormais disponible : -20 % par rapport à la génération précédente, -40 % de coûts » est apparu pour la première fois sur .
Claude Opus 5.5 est désormais disponible : -20 % par rapport à la génération précédente, -40 % de coûts
Anthropic a annoncé le 22, la sortie de Claude Opus 5.5, le premier modèle de la série Claude 5.5. D’après le fabricant, Opus 5.5 atteint, pour la plupart des tâches, le niveau de Claude Fable 5.1, tandis que ses coûts de fonctionnement sont inférieurs de 40 % à ceux d’Opus 5. Sonnet 5.5 et Haiku 5.5 seront lancés dans les prochaines semaines. Les tarifs pour l’entrée et la sortie sont de 4 et 20 dollars par million de tokens, et la lecture du cache baisse de 60 % selon Anthropic. Opus 5.5 nécessite moins de ressources de calcul que Opus 5, et son prix reflète également cette différence. L’entrée et la sortie reviennent respectivement à 4 et 20 dollars par million de tokens, soit 20 % de moins qu’Opus 5. Pour la lecture du cache, qui représente une large part des coûts des agents et du travail de programmation, le coût tombe à 0,2 dollar par million de tokens, soit 60 % de moins qu’Opus 5. Avec les réglages par défaut, une charge de travail typique coûte 40 % de moins qu’Opus 5, et la vitesse de sortie est aussi supérieure de plus de 30 %.
En plus de la baisse de prix, Anthropic a relevé aussi les limites de consommation sur 5 heures des formules Pro, Max et Team, et a fourni aux abonnés une réinitialisation des limites de débit qu’ils peuvent choisir au moment qui leur convient. Claude Code et la plateforme Claude proposent par ailleurs un mode rapide, jusqu’à 2,5 fois plus rapide, au prix de 8 dollars par million de tokens en entrée et 40 dollars en sortie.
La migration de 680 000 lignes de code est effectuée en une journée : le fabricant indique que l’écart aux benchmark reflète désormais de moins en moins la différence réelle. Anthropic précise qu’Opus 5.5 dépasse Opus 5 sur des tests internes portant sur la programmation par agents, les opérations sur ordinateur et le travail de connaissance. Un testeur précoce l’a utilisé pour accomplir en un jour une migration de 680 000 lignes de code, ce qui nécessitait auparavant un ensemble d’équipe d’ingénierie pendant plusieurs semaines ; un autre testeur a revu et corrigé une bibliothèque de 200 000 lignes en moins de 3 heures, là où Opus 5 a pris plus de 20 heures et a consommé 2,5 fois plus de tokens.
Lors de l’évaluation GDPval-AA v2.1, qui mesure le PIB de 44 professions dans des situations réelles, Opus 5.5 obtient 1846 Elo en réglage de puissance maximal, Fable 5.1 1735, et Opus 5 1708. Anthropic rappelle aussi que, une fois ce niveau de capacité atteint, l’écart de performance aux benchmark reflète moins de manière fiable les différences dans le monde réel ; d’après leur propre expérience, la différence entre Opus 5.5 et Fable 5.1 semble donc plus faible en termes de scores.
La manière de communiquer constitue aussi l’un des axes majeurs de cette mise à jour. Anthropic indique qu’avec Opus 5, l’avis le plus fréquent concernait une sortie trop longue et difficile à lire. Opus 5.5 place les informations les plus importantes en premier, emploie moins de jargon ou d’expressions particulières, et respecte mieux les règles d’écriture que les utilisateurs fournissent.
Premier modèle « après avoir freiné pour les technologies de pointe », la plupart des tâches de cybersécurité sont désormais confiées à Opus 4.8. Anthropic affirme qu’Opus 5.5 est le premier modèle de la société après son appel à freiner sur les technologies de pointe. Avant sa publication, il a été testé par des organismes d’évaluation externes comme METR et Frontier Design. Dans le cadre d’audits automatisés de comportements couvrant près de 2 000 scénarios, Opus 5.5 est le modèle qui a obtenu les meilleurs résultats parmi ceux testés à ce jour, et il est aussi le plus performant sur la majorité des indicateurs de fiabilité.
Le fabricant indique qu’à l’occasion d’un nouveau test, où l’on évalue la tendance des modèles à franchir des limites de séparation, Opus 5.5 tente de contourner ces limites environ 85 % de fois de moins que Opus 5 ou Claude Mythos 5.1, et que chaque tentative relève d’une gravité faible, tout en étant rapportée par le modèle lui-même. Toutefois, Anthropic précise également que construire des évaluations permettant de détecter de façon fiable, avant le déploiement, chaque type d’échec reste un problème non résolu ; de plus, ils observent des signes montrant qu’Opus 5.5 soupçonne souvent qu’il est en cours d’évaluation, ce qui peut affaiblir leur capacité à juger la façon dont le modèle se comportera dans un environnement réel.
Étant donné que la capacité d’Opus 5.5 dans les domaines de la biologie et de la cybersécurité est comparable à celle de Claude Mythos 5.1, Anthropic applique, comme pour Fable 5.1, des mesures de déploiement renforcées : la plupart des tâches de cybersécurité seront confiées à Opus 4.8, tandis que le domaine de la biologie exigera de passer par un nouveau programme de validation en sciences de la vie. Seules les laboratoires académiques, les start-ups et les entreprises pharmaceutiques ayant réussi les validations pourront utiliser le modèle. Anthropic indique aussi que, dans les prochaines semaines, le programme de validation en cybersécurité sera étendu afin que les professionnels ayant validé puissent utiliser Opus 5.5 dans leur travail.
Opus 5.5 est déjà disponible sur toutes les plateformes, notamment Amazon Web Services, Google Cloud et Microsoft Azure. Le code du modèle utilisé par les développeurs sur la plateforme Claude est : claude-opus-5-5.
Cet article « Claude Opus 5.5 est désormais disponible : -20 % par rapport à la génération précédente, -40 % de coûts » est apparu pour la première fois sur .

