Anthropic a lancé Claude Fable il y a quelques mois. J’ai l’impression qu’il a pris la place d’Opus pour beaucoup d’utilisateurs qui veulent le modèle le plus puissant. Et le 3 septembre 2026, OpenAI a sorti Astra.

Ces modèles sont géniaux. Mais les coûts peuvent devenir ASTRA-nomiques.

Là, je vois ce qu’Astra arrive à faire sur des présentations PowerPoint, c’est vraiment bluffant. Il y a eu un vrai bond par rapport à Sol. Je travaille avec ces outils tous les jours et je vois bien la différence.

Mais moi, j’ai un forfait à 200 € et j’ai utilisé près de 40 % de mon quota en deux jours, simplement en migrant un site web assez simple et en refaisant une présentation PowerPoint.

Ce sont de vrais projets, avec du travail derrière. Mais ce ne sont pas non plus des usages exceptionnels. C’est justement le genre de choses que j’ai envie de pouvoir faire régulièrement avec l’I.A.

Claude Fable 3 septembre 2026, OpenAI a sorti Astra

Le conseil que je ne donne plus

En janvier ou en février dernier, je disais aux indépendants de prendre le modèle le plus puissant à chaque fois. Parce qu’en gros, on pouvait. Autant utiliser celui qui comprenait le mieux la demande et qui avait le plus de chances de faire correctement le travail.

Aujourd’hui, je leur dis de faire attention au choix du modèle. Je le fais moi-même : est-ce que cette tâche a vraiment besoin du plus puissant ? Est-ce qu’un modèle moins cher pourrait faire le travail correctement ?

Quand tu prends un abonnement, tu as envie de travailler avec. Pas de te demander à chaque demande combien il va te rester pour finir la semaine.

Alors forcément, je me pose la question pour quelqu’un qui a un forfait autour de 20 € par mois. Quelle place peut-il réellement donner aux modèles les plus puissants dans son quotidien ?

Des tokens moins chers, mais des usages plus coûteux

En cherchant un peu, je me rends compte que je ne suis pas le seul à me poser la question.

Dans The Price of Progress, des chercheurs montrent que, sur les tests étudiés, accéder à un même niveau de performance coûte de moins en moins cher, alors qu’utiliser les modèles les plus avancés peut coûter de plus en plus cher. Les deux peuvent donc être vrais en même temps.

Pour donner un ordre d’idée, les tarifs API standard de Fable 5.1 sont de 10 dollars par million de tokens en entrée et 50 dollars en sortie, contre 5 et 25 dollars pour Opus 5. Deux fois plus au token, donc. Pas forcément deux fois plus pour une tâche terminée.

La quantité de tokens utilisée change le calcul, tout comme la réutilisation d’informations déjà traitées, ce qu’on appelle le cache. Anthropic a d’ailleurs réduit le prix de lecture du cache avec Fable 5.1.

Et ces tarifs API ne se convertissent pas directement en pourcentages de quota dans un abonnement.

Gartner décrit aussi ce décalage : les gains d’efficacité peuvent être absorbés par des modèles plus coûteux et des tâches qui demandent beaucoup plus de tokens. Faire travailler l’I.A dans un navigateur, avec des étapes successives, n’a pas la même économie qu’une simple question-réponse.

Pour une petite entreprise, ce sont pourtant ces usages qui m’intéressent : traiter des documents, récupérer des informations, mettre à jour des outils. Des tâches qu’on voudrait lui confier régulièrement.

The Price of Progress tarifs API standard de Fable 5.1 réduit le prix de lecture du cache avec Fable 5.1 Gartner décrit aussi ce décalage

On veut surtout éviter de devoir tout refaire

Les grandes entreprises peuvent consacrer du budget et des équipes à comparer les modèles, répartir le travail et suivre la consommation.

Mais même là, choisir le moins cher n’est pas si simple. Une autre étude montre qu’un modèle moins cher au token peut finalement coûter davantage s’il consomme plus de tokens pour raisonner sur la même demande.

Et il y a un autre truc : on a vraiment envie d’éviter la fois où le workflow I.A fait n’importe quoi.

Je pense que ça pousse les entreprises à « overkill » une tâche avec un modèle plus puissant que nécessaire. De peur qu’en ayant voulu économiser un peu, le travail soit mal fait et qu’un humain doive tout reprendre.

Je comprends cette logique. L’économie perd vite son intérêt si quelqu’un doit passer du temps à refaire la tâche. Le modèle le plus puissant peut aussi se tromper, mais sans tests sur ses propres usages, c’est difficile de savoir où économiser sans dégrader le résultat.

Et moi, je pense surtout aux entrepreneurs individuels, aux TPE et aux PME. Ils n’ont pas forcément cette compétence en interne, ni le temps de construire et de maintenir tout le système autour.

autre étude

Il faut que ce travail soit plus ou moins prémâché

Ce qui m’intéresserait, c’est qu’en fonction du forfait que j’ai sélectionné et des tâches que je demande, les modèles s’ajustent un peu automatiquement.

Si je demande quelque chose de simple, Codex utiliserait un modèle économique. Si le travail demande vraiment plus de raisonnement, il passerait sur un modèle plus puissant, en tenant compte de ce qu’il me reste dans mon forfait. Et si je veux pousser la qualité sur une présentation importante, je pourrais toujours modifier ce choix moi-même.

Le principe d’orienter les demandes selon leur complexité et leur coût existe déjà : Associated Press rapporte que des entreprises recherchent ce type de système. Ça ne veut pas dire que l’ajustement à un quota hebdomadaire est réglé. Mais je pense qu’on serait capable d’aller dans cette direction.

Pour une petite entreprise, il faut que ce travail soit plus ou moins prémâché dans l’outil. Avec des réglages compréhensibles qu’on peut modifier si on en a besoin.

J’entends la logique commerciale derrière. Un utilisateur ou une entreprise ne va pas payer 200 € par personne s’il ne se rend pas compte qu’il en a besoin. Mais pour toucher le grand public, je pense que ces outils doivent aussi modérer leur consommation par défaut.

Parce que moi, j’ai envie de pouvoir utiliser Codex toute la semaine sans me demander si le modèle sélectionné ne va pas me flinguer tout mon quota en quelques heures. Tu pars sur un PowerPoint un peu trop vénère avec Astra, tu n’as pas fait attention au réglage, et ça peut aller très vite.

Je suis content de voir ce que les nouveaux modèles arrivent à faire. J’en profite moi-même. Mais je me demande à quel moment l’argument principal du prochain lancement sera : avec le même budget, tu vas pouvoir en faire beaucoup plus.

Pour moi, il va arriver un moment où ce ne sera plus « smarter is better ». Ce sera « smarter is cheaper ».

Pour voir un de ces usages au quotidien : comment je nettoie ma to-do list avec Codex.

Associated Press rapporte que des entreprises recherchent ce type de système comment je nettoie ma to-do list avec Codex