Discuter de mon projet
Un rayon de supermarché rempli de dizaines de paquets de pâtes de marques et de formes différentes.
9 min de lectureSeekwel

Mardi 22 septembre, à quelques minutes d'intervalle, Anthropic a sorti Claude Opus 5.5 et OpenAI a répondu avec GPT-6 Sol et GPT-6 Luna. Tous annoncés meilleurs, tous moins chers. Si votre PME a mis un outil IA en production cet été, vous vous demandez peut-être s'il est déjà dépassé. Dans la plupart des cas, non. On vous donne la règle qu'on applique pour décider quand changer de modèle, et le test d'une demi-journée pour le faire sans casser ce qui marche.

Ce qui s'est passé cette semaine, sans jargon

Trois nouveaux modèles en une journée, ça mérite une traduction. Un « modèle », c'est le moteur qui tourne derrière ChatGPT, Claude ou l'agent que vous avez branché sur votre boîte mail. Chaque éditeur en vend plusieurs, à des prix très différents, un peu comme un constructeur vend une citadine, une berline et un utilitaire.

Ce que le 22 septembre change, c'est surtout le prix. D'après VentureBeat, GPT-6 Luna, le plus petit des trois, coûte un centième de GPT-6 Astra, le modèle haut de gamme d'OpenAI sorti début septembre. Il est prévu pour le travail en volume : résumer, extraire une information d'un document, répondre à une question simple. GPT-6 Sol, au milieu, vise le travail répété des équipes : analyser des données, rédiger, corriger. De son côté, Anthropic annonce pour Opus 5.5 un coût d'usage nettement inférieur à celui d'Opus 5, selon The Decoder, avec des réponses plus courtes et plus rapides.

Le contexte compte aussi. Le Blog du Modérateur a compté 32 annonces de modèles depuis janvier 2026, soit une tous les huit jours, plus que sur toute l'année 2025. Ce rythme n'est pas près de ralentir. La question n'est donc pas « quel modèle est le meilleur aujourd'hui ? », elle change chaque semaine. La bonne question, c'est : « à quel moment ça vaut la peine de bouger ? »

Vous ne changez pas de camionnette à chaque nouveau millésime

On a vu des dirigeants passer une journée à comparer des benchmarks parce qu'un titre annonçait un nouveau champion. C'est du temps perdu. Une PME qui a une camionnette en bon état ne la remplace pas parce que le constructeur a sorti le millésime suivant. Elle la remplace quand l'ancienne coûte trop cher à entretenir, tombe en panne, ou ne passe plus le contrôle technique.

Un modèle IA, c'est pareil. C'est une pièce de votre workflow, pas le workflow. Ce qui fait la valeur de votre automatisation, ce sont vos consignes (les prompts), vos données, vos contrôles et l'habitude que votre équipe a prise. Tout ça reste en place quand le modèle change. Et tout ça peut casser si vous changez pour de mauvaises raisons.

Avant d'aller plus loin, situez-vous. Il y a trois cas, et un seul vous demande une décision.

  • Vous utilisez un abonnement (ChatGPT, Claude, Gemini). L'éditeur bascule ses abonnés sur ses nouveaux modèles au fil de l'eau. Vous n'avez rien à faire, à part vérifier que vos réponses habituelles n'ont pas changé de ton.
  • Vous utilisez un logiciel métier avec de l'IA dedans (votre CRM, votre outil de facturation). C'est le problème de votre éditeur, pas le vôtre. Posez-lui la question au prochain point.
  • Vous avez un workflow automatisé branché sur un modèle précis, construit par vous, un freelance ou une agence. Là, c'est vous qui décidez. Le reste de l'article est pour ce cas.

La règle : trois déclencheurs, pas un calendrier

Chez nous, un changement de modèle ne se décide jamais parce qu'un nouveau modèle est sorti. Il se décide parce qu'un des trois déclencheurs suivants est activé.

Déclencheur 1 : la facture

Vous regardez votre facture API mensuelle et un poste dépasse ce que la tâche rapporte. Ou, comme cette semaine, un modèle nettement moins cher prétend faire le même travail. Attention au réflexe : moins cher par million de tokens ne veut pas dire moins cher par tâche. Un petit modèle qui se trompe une fois sur cinq vous coûte une relecture humaine à chaque fois. C'est le test ci-dessous qui tranche, pas la grille tarifaire.

Déclencheur 2 : des erreurs que vous avez notées

Vous avez une liste de cas où le modèle actuel se plante : il invente une référence produit, il rate un montant dans un devis scanné, il répond en anglais à un client français. Si cette liste existe et qu'elle s'allonge, un nouveau modèle mérite un essai. Si elle n'existe pas, commencez par la tenir. Sans elle, vous ne saurez jamais si le nouveau fait mieux ou juste différemment.

Déclencheur 3 : la fin de vie annoncée

Les éditeurs retirent leurs anciens modèles, en général avec quelques mois de préavis. Ce mail, personne ne le lit. Notez pour chaque workflow le nom exact du modèle qu'il utilise, et abonnez-vous aux annonces de dépréciation de votre fournisseur. Ce déclencheur-là ne se négocie pas, mais il se prévoit.

Aucun de ces trois déclencheurs n'est actif ? Ne faites rien. Ne lisez même pas les benchmarks. Revenez-y dans un trimestre.

Le test de non-régression : une demi-journée, pas plus

Un déclencheur est activé. Voilà comment on compare l'ancien et le nouveau modèle sans se fier aux promesses des éditeurs. Le principe : vous rejouez vos vrais cas, pas des exemples de démonstration.

Étape 1 : constituer le jeu d'essai

Sortez vingt cas réels de votre workflow. Pour un tri de mails au support client, ce sont vingt vrais mails reçus le mois dernier. Pour un reporting automatisé, vingt exports de données réels. Choisissez-les avec soin :

  • 12 cas ordinaires, ceux que le modèle traite tous les jours.
  • 5 cas difficiles, tirés de votre liste d'erreurs (déclencheur 2).
  • 3 cas pièges, où la bonne réponse est « je ne sais pas » ou « à transmettre à un humain ».

Pour chaque cas, écrivez la réponse attendue avant de lancer quoi que ce soit. Sinon, vous jugerez la réponse du nouveau modèle avec sa propre logique, et il gagnera toujours.

Étape 2 : rejouer avec les deux modèles

Lancez les vingt cas avec le modèle actuel, puis avec le candidat. Même prompt, mêmes données, mêmes réglages. Si votre outil d'automatisation (Make, n8n, Zapier ou un script maison) vous permet de dupliquer le scénario en changeant seulement le nom du modèle, c'est l'affaire d'une heure. Sinon, faites-le à la main dans l'interface de test de l'éditeur, c'est plus long mais ça reste faisable en une matinée.

Étape 3 : noter avec la grille

Voici la grille qu'on utilise. Copiez-la dans un tableur, une ligne par cas.

Cas n° | Type (ordinaire / difficile / piège) | Attendu | Actuel : juste ? (0/1) | Candidat : juste ? (0/1) | Actuel : format respecté ? (0/1) | Candidat : format respecté ? (0/1) | Coût actuel | Coût candidat | Remarque

Règles de notation :
- "Juste" = la réponse permet d'agir sans correction humaine. Un détail faux = 0.
- "Format respecté" = même structure que d'habitude (champs, longueur, langue, ton).
- Un cas piège est "juste" seulement si le modèle a passé la main ou signalé le doute.
- Le coût se lit dans la console de l'éditeur, par appel.

Décision :
- Candidat juste sur les 3 pièges ET au moins aussi bon sur les cas difficiles → on continue.
- Candidat moins bon sur un seul cas piège → on arrête, quel que soit le prix.
- Format cassé sur plus de 2 cas → on continue seulement si on a le temps de réécrire le prompt.
- Coût par cas : on ne compte pas le prix du token, on compte (coût de l'appel + temps de relecture humaine).

Étape 4 : basculer une seule tâche, pas tout

Le candidat passe la grille ? Basculez un seul workflow, le moins risqué, pendant deux semaines. Gardez l'ancien prêt à revenir (un simple changement de nom de modèle dans le scénario). Si personne ne remarque de différence, passez au suivant. Si quelqu'un remarque quelque chose, votre liste d'erreurs vient de gagner une ligne, et c'est exactement ce que vous vouliez savoir.

Où ça coince en prod

Trois choses nous surprennent encore régulièrement, même quand la grille est bonne.

Le style change, et vos outils en dépendent. Anthropic présente Opus 5.5 comme un modèle qui écrit plus court et va droit au but. C'est une bonne nouvelle pour un humain qui lit. C'est un problème pour un scénario qui attend un texte d'une certaine longueur ou une réponse dans un ordre précis. Si un de vos workflows découpe la réponse du modèle pour la ranger dans des champs, testez ce découpage en priorité.

Les prompts sont réglés pour un modèle. Une consigne écrite pour contourner un défaut de l'ancien modèle peut dégrader le nouveau. Quand un cas passe de 1 à 0, relisez le prompt avant d'accuser le modèle. Souvent, une phrase ajoutée il y a six mois n'a plus lieu d'être.

Le mode « réflexion maximale » coûte plus qu'il ne rapporte. Sur les nouveaux modèles, le réglage qui fait « réfléchir » longtemps peut consommer des dizaines de milliers de tokens sur une tâche banale, et parfois buter sur une limite avant de répondre. Pour du tri de mails ou de l'extraction, gardez le réglage par défaut. Vous réservez le mode long aux tâches qui le méritent.

C'est là que la complexité sans équipe technique se fait sentir. Rien de tout ça n'est difficile, mais chaque point demande quelqu'un qui sait où regarder. Si personne dans l'équipe n'a ce rôle, nommez-le, même à temps très partiel. Sinon le modèle ne sera jamais changé, ou il sera changé un vendredi soir sans test.

Par où commencer cette semaine

Ne testez rien aujourd'hui. Faites plutôt l'inventaire. Sur une feuille, listez chaque workflow IA de votre PME, le nom exact du modèle qu'il utilise, ce qu'il coûte par mois, et la personne qui saurait le changer. Ajoutez une colonne « erreurs notées ». Si cette colonne est vide, votre premier chantier n'est pas Opus 5.5 ou GPT-6 Sol. C'est de commencer à noter.

Le jour où un déclencheur s'active, vous aurez le jeu d'essai à moitié prêt, et une demi-journée suffira.


Sources :

Besoin d'aller plus loin ?

On peut le faire pour vous.

Vous avez un workflow IA en place et vous ne savez pas s'il tourne sur le bon modèle ? On l'audite avec vous, on teste les alternatives sur vos vrais cas, et on ne change que si ça vaut le coup.

Discutons de votre projet

Contact

Discutons de votre projet.

  • Réponse sous 24 heures
  • NDA signé si vous le souhaitez
  • Premier diagnostic sans engagement
  • Objectifs mesurables dès le départ
ou

15 min · sans engagement

Échange rapide