Imaginez cette situation : votre assistant d’intelligence artificielle produit un document impeccable à l’écran. Pourtant, une collègue passe ensuite une demi-heure à retrouver les informations manquantes. Le tarif du modèle semblait intéressant ; le travail livré l’est beaucoup moins. Pour choisir une IA au travail, la bonne unité de comparaison mérite donc d’être précisée : combien coûte un dossier que l’équipe peut réellement utiliser ?
Le guide consacré à la famille GPT-6, publié par OpenAI le 2 octobre 2026, remet cette question en évidence. Voici notre proposition pour transformer cette nouvelle documentation en décision concrète : séparer les dépenses techniques, le travail humain et les résultats acceptés. La méthode ci-dessous est une construction de la rédaction, pas un test de modèles ni une promesse d’économie.
Ce que le nouveau guide apporte au choix d’un modèle
OpenAI recommande de mesurer la réussite des tâches, leur délai et leur coût par tâche réussie avant un déploiement. Le fournisseur distingue les usages : Astra pour les raisonnements les plus difficiles, GPT-6.1 Sol pour le code complexe, la recherche et l’utilisation d’applications, Luna pour les tâches ciblées et répétées. Ces orientations ne constituent pas un classement valable pour tous les métiers.
Le document invite aussi à adapter l’effort de raisonnement à la difficulté et à définir le résultat attendu. Il s’agit d’un guide publié le 2 octobre, pas de l’annonce d’un nouveau modèle ce jour-là. Les réglages réellement accessibles dépendent du produit utilisé ; un utilisateur d’un logiciel métier ne dispose pas forcément des paramètres de l’API, l’interface qui relie une application au modèle.
Notre angle porte sur la décision économique à partir des dossiers acceptés. Pour comprendre les délais techniques, le décryptage d’Astra Ultrafast et des goulots d’attente répond à une autre question : quelle étape fait attendre l’utilisateur ?
Définissez « utilisable » avant de regarder la facture
Prenez une tâche dont quelqu’un connaît les exigences. « Préparer une fiche de demande commerciale » est encore trop large. Écrivez ce que la fiche doit contenir : besoin exprimé, délai demandé, pièces reçues et questions restant à poser. Un champ absent du message doit rester absent ou être marqué « à confirmer ». Une date devinée rendrait la fiche trompeuse.
Fixez ensuite la frontière entre une retouche normale et une reprise importante. Corriger une tournure de phrase peut faire partie de la finition. Reconstruire la moitié des informations impose un autre travail. L’équipe doit s’accorder sur cette différence avant l’essai ; sinon, le modèle préféré bénéficiera facilement d’une définition plus indulgente de la réussite.
Une proposition simple consiste à utiliser trois états : accepté après la vérification prévue, repris avant acceptation, abandonné. Comptez comme acceptés les dossiers finalement utilisables, y compris après une reprise, et conservez le détail de ces reprises. Gardez également la nature des erreurs importantes. Ces états décrivent le dossier dans votre organisation, pas une qualité universelle du modèle. Notre grille pour vérifier une réponse d’IA aide à détailler les contrôles de faits.

Conservez deux comptes au lieu d’un chiffre séduisant
Le premier compte rassemble les dépenses techniques observables : appels au modèle, outils facturés, tentatives supplémentaires et éventuels frais du circuit testé. Demandez à votre prestataire ce que son relevé inclut. Si une ligne ne peut pas être attribuée à la tâche, gardez-la séparée en expliquant cette limite. N’inventez pas un montant pour obtenir un tableau complet.
Le second compte rassemble le temps humain : préparer les documents, vérifier, corriger et reprendre les échecs. Notez des durées observées, sans prétendre qu’une minute libérée devient automatiquement une économie salariale. Un salarié reste rémunéré ; le temps dégagé peut servir à une autre activité, mais cet usage doit lui aussi être constaté.
Pour un service sur abonnement, le calcul demande davantage de prudence. Répartir arbitrairement tout l’abonnement sur un petit essai peut exagérer son coût ; l’ignorer peut le minimiser. Présentez donc le coût des appels lorsqu’il est connu, les frais fixes séparément et le temps humain à côté. Vous disposerez d’une comparaison lisible sans mélanger trésorerie, capacité de travail et hypothèses.
Un calcul fictif qui fait apparaître les échecs
Imaginons l’entreprise fictive Atelier Rivage. Elle compare deux configurations sur dix demandes commerciales fictives identiques. Les montants suivants sont entièrement inventés pour expliquer le calcul : ils ne correspondent à aucun tarif OpenAI ni à une mesure réalisée par la rédaction.
La configuration A consomme trois euros de traitement, tentatives incluses. Six fiches sont acceptées dans le cadre prévu ; quatre sont abandonnées et doivent être refaites manuellement. La configuration B consomme cinq euros et fournit dix fiches acceptées. Le coût technique par fiche acceptée atteint cinquante centimes dans les deux cas : trois divisés par six, cinq divisés par dix.
Dire simplement « A coûte moins cher » masquerait les quatre dossiers sans résultat utilisable. Dire « les deux solutions se valent » serait également prématuré. Atelier Rivage doit encore comparer les durées de contrôle, la reprise manuelle des dossiers abandonnés et les erreurs constatées. Le même coût technique par fiche acceptée peut accompagner deux charges de travail très différentes.
Ce petit échantillon fictif explique une opération, pas une probabilité de réussite. Il ne prouve aucune stabilité future. En situation réelle, conservez les échecs dans le relevé et indiquez le nombre de dossiers examinés. Lorsque rien n’est accepté, le coût par résultat accepté n’est pas calculable ; inscrivez « aucun résultat accepté », sans remplacer cette absence par zéro.
Comparez des cas difficiles, puis gardez des cas inédits
Dans sa documentation sur les évaluations, OpenAI conseille des essais propres à la tâche, des cas habituels et difficiles, ainsi qu’un jugement humain. Vous pouvez traduire ce principe en un petit dossier de comparaison : demande complète, document contradictoire, pièce manquante et demande hors périmètre. Utilisez des données fictives ou explicitement autorisées.
Réservez quelques cas que vous ne consultez pas pendant l’ajustement des consignes. Ils serviront ensuite à vérifier si le circuit fonctionne au-delà des exemples qui ont guidé sa mise au point. Sans cette séparation, on risque de produire des instructions parfaitement adaptées à quelques dossiers connus, puis de découvrir leurs faiblesses dès le premier dossier différent.
Présentez les sorties au relecteur sans le nom du modèle, lorsque c’est possible. Demandez une décision selon les critères écrits et une explication des refus. Une réponse longue ou élégante ne doit pas obtenir un avantage si elle invente une information. Quand deux relecteurs divergent, examinez le dossier : le désaccord peut révéler un critère flou plutôt qu’un défaut du modèle.

Changez une variable et expliquez la décision
Évitez de changer ensemble le modèle, les instructions, les documents disponibles et le format de sortie. Vous ne sauriez plus ce qui a produit une différence. Commencez par comparer deux configurations décrites précisément ; gardez les mêmes cas et les mêmes critères. Si vous modifiez ensuite les consignes, notez la nouvelle version et refaites la comparaison concernée.
Une décision peut être limitée à une famille de tâches. Le classement de demandes complètes et la synthèse de pièces contradictoires n’imposent pas les mêmes exigences. Vous pouvez conserver une configuration pour le premier cas et poursuivre l’essai pour le second, à condition que l’équipe sache reconnaître la frontière et dispose d’un passage vers une personne compétente.
Préparer un dossier n’autorise pas automatiquement son envoi ou une modification dans le logiciel client. Le guide sur les responsabilités avec les agents IA permet de préciser ces passages. Pour sélectionner le terrain de départ, notre parcours premier usage de l’IA en PME reste complémentaire.
La prochaine action : une fiche de décision d’une page
Avant votre prochain rendez-vous avec un prestataire, préparez une page comportant le livrable attendu, les défauts bloquants, les cas retenus et le nom du responsable de validation. Ajoutez deux colonnes de relevé, dépenses techniques et temps humain, puis les trois états des dossiers. Demandez comment obtenir les informations manquantes sans élargir inutilement l’essai.
Terminez le bilan par une phrase précise : « Nous retenons cette configuration pour ces demandes, avec cette vérification, et nous réexaminerons le choix si ces erreurs réapparaissent. » Si les observations restent insuffisantes, inscrivez ce qui manque et prolongez seulement l’essai nécessaire. Une décision provisoire documentée sera plus utile qu’un palmarès de modèles sans lien avec votre travail.
Repère éditorial : analyse du guide OpenAI du 2 octobre 2026 et de sa documentation évolutive Evaluation best practices, consultés le 3 octobre. La rédaction n’a testé aucun modèle. Les fiches, le scénario Atelier Rivage et ses montants sont des propositions pédagogiques originales. Aucun achat de livre ou de produit n’est nécessaire pour appliquer cette démarche.
Relier cette méthode à votre organisation
Pour compléter ce dossier : Compétences IA : 40 questions pour faire le point et obtenir un certificat ; Vous repoussez toujours la même tâche ? Préparez une réponse à l’obstacle. Ces guides abordent des décisions complémentaires, du choix d’une prochaine action aux conditions de sa réalisation.







