Migrer d’Opus 4.8 vers Opus 5 : des pièges à connaître ?

  • Auteur
    Sujet
  • #406
    Tom
    Membre

    QuestionMigrer d’Opus 4.8 vers Opus 5 : des pièges à connaître ?

    Bonjour, j’ai une petite app en prod qui tourne sur Opus 4.8 via l’API. Je vois qu’Opus 5 vient de sortir et que le prix ne bouge pas, donc a priori je n’ai qu’à changer l’identifiant du modèle. C’est vraiment aussi simple, ou il y a des choses qui changent dans le comportement ? Je préfère demander avant de casser quelque chose en prod.

Réponses 1 à 9 (sur 9 au total)
  • Auteur
    Réponses
  • #407
    seiche
    Modérateur

    Bonjour Tom,

    Bon réflexe de demander avant. Le prix est bien identique (5 $ le million de tokens en entrée, 25 $ en sortie) et l’identifiant est simplement claude-opus-5. Mais non, ce n’est pas un remplacement à l’aveugle, il y a deux pièges.

    Le premier, et c’est le vicieux : le raisonnement est actif par défaut sur Opus 5, alors qu’une requête sans paramètre thinking ne raisonnait pas sur Opus 4.8. Comme max_tokens plafonne le raisonnement et la réponse ensemble, un appel calibré au plus juste se fait couper en plein milieu. Regardez vos max_tokens avant toute chose.

    Le second : couper le raisonnement n’est autorisé qu’à un effort high ou en dessous. thinking désactivé avec xhigh ou max, c’est une 400 directe, et la vérification se fait requête par requête.

    Deux bonnes nouvelles pour finir. Le seuil minimal du cache de prompt descend de 1 024 à 512 tokens, et les fallbacks automatiques (en bêta) renvoient une requête refusée par les classifiers de sécurité vers Opus 4.8 dans le même appel, sans que vous ayez à gérer le cas. Sur le fond ça vaut le déplacement : 70,1 sur CursorBench contre 62,3 pour Opus 4.8, à tarif identique. Le comparatif complet est dans notre rubrique Modèles.

    #408
    Tom
    Membre

    Merci, ça répond pile à ma question.

    Le coup du raisonnement actif par défaut, je serais passé à côté à 100 %. Je viens de vérifier : j’ai deux routes avec max_tokens à 1500 parce que les réponses sont censées tenir en trois lignes. Elles auraient sauté dès le premier appel.

    Par contre sur l’effort je patauge un peu. Vous dites xhigh pour le code, mais mon app fait surtout de l’extraction structurée sur des PDF, rien de créatif. Je mets quoi ? J’aimerais éviter de tripler la facture pour rien.

    #409
    Kevin
    Membre

    +1 sur la question de Tom, même cas chez moi (classification de tickets support, zéro créativité là-dedans). J’étais parti pour coller xhigh partout en me disant que c’était la reco officielle, du coup je préfère demander aussi avant de faire une bêtise.

    #410
    nao
    Modérateur

    Bonjour Tom, Kevin,

    Non, surtout pas partout, vous alliez payer pour rien tous les deux.

    La recommandation xhigh vise le code et l’agentique, c’est-à-dire les tâches longues où le modèle enchaîne des appels d’outils et doit tenir un plan dans la durée. De l’extraction sur PDF ou de la classification de tickets, c’est exactement le cas inverse.

    Commencez à medium, et testez low pour voir. C’est la vraie surprise d’Opus 5 : le bas de l’échelle tient remarquablement bien, et suffit souvent là où un réglage hérité d’Opus 4.8 dépenserait trois fois plus. Balayer les cinq niveaux sur votre propre jeu de test, c’est une heure de travail qui se rembourse vite.

    Un dernier truc pendant que vous y êtes : les quotas de débit d’Opus 5 forment un pool séparé de celui des modèles Opus 4.x. On s’est fait avoir en interne, on pensait récupérer la marge de l’ancien pool, elle ne se reporte pas.

    #411
    Leila
    Membre

    Je squatte le fil, désolée, mais mon cas est l’exact inverse de celui de Tom.

    On est sur Fable 5 depuis juin, pour de la revue de code. Ça marche très bien, mais la rétention de 30 jours nous a coûté trois semaines d’aller-retour avec le juridique avant d’avoir le feu vert. Si Opus 5 n’impose vraiment rien de ce côté, ça change beaucoup de choses pour nous.

    Ma crainte, c’est la marche à descendre. On perd quoi, concrètement, en passant de Fable 5 à Opus 5 ?

    #412
    teuthis
    Administrateur

    Bonjour Leila,

    Aucune rétention imposée sur Opus 5, vous pouvez rouvrir le dossier avec votre juridique dès demain. C’est précisément ce point qui bloquait les organisations en rétention zéro.

    Sur la marche à descendre : elle est plus petite que l’écart de tarif ne le laisse croire. À effort maximal sur CursorBench, Opus 5 fait 70,1 contre 70,4 pour Fable 5. Trois dixièmes de point, pour environ 8 $ par tâche au lieu de 17 $. Sur de la revue de code au quotidien, personne ici n’a vu la différence. Ajoutez que les classifiers de sécurité se déclenchent environ 85 % moins souvent, ce qui compte si vos revues touchent parfois à du code sensible.

    Deux réflexes quand même, on s’est fait prendre sur les deux. Opus 5 rédige plus long que ses prédécesseurs, et baisser l’effort ne raccourcit pas le texte visible de façon fiable : la consigne de concision doit passer par le prompt. Et si vos prompts traînent des « vérifie bien ton travail » hérités d’un modèle précédent, supprimez-les. Le modèle vérifie déjà tout seul, les redemander ne produit que du travail en double.

    #420
    Leila
    Membre

    Nickel, merci. Je relance le juridique demain matin, ça va leur faire plaisir de rouvrir le sujet trois semaines après l’avoir fermé.

    #421
    Tom
    Membre

    Retour de préprod comme promis.

    Bascule faite tout à l’heure, medium sur l’extraction et high sur la seule route qui raisonne vraiment. Côté qualité je ne vois aucune régression, l’extraction est même un poil plus propre sur les PDF mal scannés.

    Et effectivement : deux appels coupés en pleine réponse, pile sur les routes où max_tokens était trop juste. Remonté à 4000, plus rien. Vous aviez raison de commencer par là.

    Edit : le truc que je n’avais pas anticipé, c’est que les réponses sont sensiblement plus longues à consigne égale. J’ai dû ajouter une phrase dans le prompt système pour brider, sinon je récupérais des pavés là où j’attendais trois lignes.

    #422
    Kevin
    Membre

    Merci pour le retour, ça m’évite de refaire le test de mon côté. Je pars sur medium aussi.

Réponses 1 à 9 (sur 9 au total)
  • Vous devez être connecté pour répondre à ce sujet.