Bonjour Tom,
Bon réflexe de demander avant. Le prix est bien identique (5 $ le million de tokens en entrée, 25 $ en sortie) et l’identifiant est simplement claude-opus-5. Mais non, ce n’est pas un remplacement à l’aveugle, il y a deux pièges.
Le premier, et c’est le vicieux : le raisonnement est actif par défaut sur Opus 5, alors qu’une requête sans paramètre thinking ne raisonnait pas sur Opus 4.8. Comme max_tokens plafonne le raisonnement et la réponse ensemble, un appel calibré au plus juste se fait couper en plein milieu. Regardez vos max_tokens avant toute chose.
Le second : couper le raisonnement n’est autorisé qu’à un effort high ou en dessous. thinking désactivé avec xhigh ou max, c’est une 400 directe, et la vérification se fait requête par requête.
Deux bonnes nouvelles pour finir. Le seuil minimal du cache de prompt descend de 1 024 à 512 tokens, et les fallbacks automatiques (en bêta) renvoient une requête refusée par les classifiers de sécurité vers Opus 4.8 dans le même appel, sans que vous ayez à gérer le cas. Sur le fond ça vaut le déplacement : 70,1 sur CursorBench contre 62,3 pour Opus 4.8, à tarif identique. Le comparatif complet est dans notre rubrique Modèles.