Le modèle d'IA le plus puissant vient de baisser de 40 %. Ce que ça change.
Le modèle phare d'Anthropic, Claude Opus 5.5, coûte désormais environ 40% moins cher à faire tourner, avec les lectures de cache en baisse de 60% — et ça change l'équation économique pour les équipes qui font tourner des agents IA en production.
- $4
- prix par million de tokens en entrée
- –40%
- moins cher que Opus 5 sur les workloads typiques
- –60%
- réduction sur les lectures de cache
- 66,4%
- score sur Terminal-Bench 4.0
Faire tourner le modèle d'IA le plus performant du marché vient de coûter nettement moins cher. Le 22 septembre, Anthropic a lancé Claude Opus 5.5 — son modèle le plus capable — à des prix environ 40% inférieurs à ceux de son prédécesseur sur des charges de travail typiques. Un million de tokens en entrée passe de $5 à $4 ; les tokens en sortie tombent de $25 à $20.
La baisse la plus forte concerne les lectures de cache : –60%, de $0,50 à $0,20 par million de tokens. Une lecture de cache correspond au moment où le modèle relit les mêmes documents ou instructions d'une requête à l'autre. Les tâches longues d'agents — révision de contrats, analyse de bases de code, traitement de rapports volumineux — s'en servent en permanence. Cette réduction de 60% rend les workflows chargés en documents beaucoup plus économiques à grande échelle.
Anthropic affirme qu'Opus 5.5 atteint le même niveau que leur meilleur modèle de recherche sur la plupart des tâches. Il obtient 66,4% sur Terminal-Bench 4.0, un test standard pour les agents de code. Payer moins ne signifie pas recevoir moins — le modèle est moins cher et tout aussi performant.
Il y a néanmoins un point d'attention réel. Anthropic a modifié quatre aspects de l'API d'une manière qui cassera le code existant écrit pour Opus 5. L'économie annoncée de 40% dépend aussi de la façon dont vous réglez le niveau d'effort du modèle, un paramètre qui a changé avec cette version. Testez d'abord sur votre charge de travail réelle avant de migrer.
Si vous avez des workflows IA qui étaient trop coûteux pour fonctionner à l'échelle souhaitée, c'est le bon moment pour refaire le calcul. La baisse des lectures de cache est particulièrement pertinente pour tout ce qui traite des documents longs de manière répétée — révision juridique, analyse de code, pipelines de support. Action concrète : recalculez votre consommation du mois passé avec les nouveaux tarifs, puis testez une migration en environnement de staging.