Tom

Forum Replies Created

Réponses 1 à 2 (sur 2 au total)
  • Auteur
    Réponses
  • Tom
    Membre

    Retour de préprod comme promis.

    Bascule faite tout à l’heure, medium sur l’extraction et high sur la seule route qui raisonne vraiment. Côté qualité je ne vois aucune régression, l’extraction est même un poil plus propre sur les PDF mal scannés.

    Et effectivement : deux appels coupés en pleine réponse, pile sur les routes où max_tokens était trop juste. Remonté à 4000, plus rien. Vous aviez raison de commencer par là.

    Edit : le truc que je n’avais pas anticipé, c’est que les réponses sont sensiblement plus longues à consigne égale. J’ai dû ajouter une phrase dans le prompt système pour brider, sinon je récupérais des pavés là où j’attendais trois lignes.

    Tom
    Membre

    Merci, ça répond pile à ma question.

    Le coup du raisonnement actif par défaut, je serais passé à côté à 100 %. Je viens de vérifier : j’ai deux routes avec max_tokens à 1500 parce que les réponses sont censées tenir en trois lignes. Elles auraient sauté dès le premier appel.

    Par contre sur l’effort je patauge un peu. Vous dites xhigh pour le code, mais mon app fait surtout de l’extraction structurée sur des PDF, rien de créatif. Je mets quoi ? J’aimerais éviter de tripler la facture pour rien.

Réponses 1 à 2 (sur 2 au total)