Analyse complète de Claude Fable 5.1 : benchmarks, améliorations, prix et vitesse
Les résultats complets de Claude Fable 5.1 sur 7 catégories de benchmarks majeurs, comparés point par point avec Fable 5, Opus 5 et GPT-5.6 Sol, ainsi qu'une explication des tâches longues, de l'appel d'outils, des coûts de cache, de la vitesse, des limites des forfaits et des changements de migration de la version 5.1.

Claude Fable 5.1 a été officiellement publié le 1er septembre 2026. Commençons par la conclusion : il ne s'agit pas d'une mise à niveau classique destinée aux questions-réponses ordinaires, mais d'un modèle phare coûteux, conçu pour la programmation de longue durée, la recherche complexe, les appels d'outils inter-applications et les agents autonomes sans supervision. Dans les 7 grandes catégories de benchmarks publiées par Anthropic, Fable 5.1 surpasse Fable 5 dans toutes ; en revanche, son prix unitaire API reste le double de celui d'Opus 5, et sa latence relative est officiellement qualifiée de « plus lente ».
Si votre tâche consiste simplement à modifier un fichier, à rédiger un court texte ou à répondre à des questions ordinaires, Anthropic recommande toujours de commencer avec Opus 5. Fable 5.1 est davantage adapté aux tâches à longue chaîne que les modèles ordinaires ne parviennent toujours pas à accomplir de manière stable, même avec un effort High. Cet article rassemble les données de publication officielles, la signification de chaque benchmark, les améliorations spécifiques de la 5.1, son prix, sa vitesse et ses limites de migration, afin d'éviter de se contenter d'un simple tableau de scores « qui bat qui ».
Les spécifications de Fable 5.1 en un tableau
| Élément | Claude Fable 5.1 | Claude Opus 5 | Claude Sonnet 5 |
|---|---|---|---|
| Fenêtre de contexte | 1M de tokens | 1M de tokens | 1M de tokens |
| Sortie maximale | 128K de tokens | 128K de tokens | 128K de tokens |
| Prix d'entrée | $10 / MTok | $5 / MTok | $2 / MTok |
| Prix de sortie | $50 / MTok | $25 / MTok | $10 / MTok |
| Latence relative | Plus lente | Modérée | Rapide |
| Thinking | Adaptive, toujours activé | Adaptive | Adaptive |
| Effort par défaut | High | High | High |
| Date limite des connaissances fiables | Juin 2026 | Mai 2026 | Janvier 2026 |
Le terme « plus lente » provient du catalogue de modèles d'Anthropic et désigne un niveau de latence relative, et non un nombre fixe de tokens par seconde. La durée réelle d'exécution d'une tâche dépend également de l'effort, du nombre de tours d'appels d'outils, du taux de succès du cache, de la longueur du contexte et du nombre de nouvelles tentatives après échec.
Tableau complet des principaux benchmarks de Fable 5.1
Le tableau ci-dessous reprend directement le tableau principal de la page de publication d'Anthropic du 1er septembre 2026. Pour éviter toute lecture erronée, les pourcentages, les scores bruts de GDPval-AA, les résultats partial/strict d'OSWorld, ainsi que les résultats avec/sans outils de HLE sont tous présentés séparément. Chaque benchmark conserve son nom officiel en anglais, avec sa traduction affichée sur la ligne suivante, comme dans les autres versions linguistiques.
| Capacité | Benchmark | Fable 5.1 | Fable 5 | Opus 5 | GPT-5.6 Sol | 5.1 vs Fable 5 |
|---|---|---|---|---|---|---|
| Recherche scientifique par agent | Terminal-Bench-Science 0.1 Benchmark de recherche scientifique par agent en terminal |
52.6% | 24.7% | 29.0% | 22.4% | +27.9 pts |
| Programmation en terminal par agent | Terminal-Bench 4.0 Benchmark de programmation en terminal par agent |
55.8% | 42.0% | 52.3% | 37.3% | +13.8 pts |
| Travail de connaissances professionnel | GDPval-AA v2 Benchmark de tâches professionnelles à valeur économique réelle |
1853 | 1723 | 1824 | 1711 | +130 points |
| Opérations sur ordinateur | OSWorld 2.0 — Partial Benchmark d'opérations réelles sur ordinateur : score de complétion partielle |
77.9% | 72.9% | 75.4% | — | +5.0 pts |
| Opérations sur ordinateur | OSWorld 2.0 — Strict Benchmark d'opérations réelles sur ordinateur : taux de réussite strict |
41.7% | 36.1% | 39.6% | — | +5.6 pts |
| Raisonnement multidisciplinaire | Humanity's Last Exam — No tools Le dernier examen de l'humanité : sans outils |
60.9% | 57.8% | 56.6% | — | +3.1 pts |
| Raisonnement multidisciplinaire | Humanity's Last Exam — With tools Le dernier examen de l'humanité : avec outils |
65.0% | 63.8% | 63.6% | — | +1.2 pt |
| Workflows métier | AutomationBench Benchmark de workflows d'automatisation métier inter-applications |
31.4% | 17.1% | 26.9% | 19.6% | +14.3 pts |
| Programmation par agent | CursorBench 3.2.0 Benchmark de tâches réelles de programmation multi-fichiers |
73.4% | 70.5% | 70.0% | 67.2% | +2.9 pts |
— signifie qu'Anthropic n'a pas fourni de score correspondant dans ce tableau principal ; cela ne signifie pas que le modèle est incapable d'accomplir la tâche. Dans Terminal-Bench 4.0, Mythos 5.1, moins restreint et réservé à des programmes de confiance, obtient 60.9 % ; cet article se concentre sur Fable 5.1, disponible pour les utilisateurs ordinaires, et ne mélange pas les résultats de Mythos avec ceux de la colonne Fable.
Que mesure Terminal-Bench-Science 0.1 ?
Terminal-Bench-Science 0.1 comprend 70 flux de travail de recherche réels couvrant cinq grands domaines : sciences de la vie, sciences physiques, sciences de la Terre, mathématiques et ingénierie. Les tâches ne sont pas des questions à choix multiples : l'Agent doit effectuer dans le terminal des analyses de données, des inférences statistiques, des simulations, des optimisations, des preuves de théorèmes, des reconstructions d'images ou de l'apprentissage automatique scientifique, puis vérifier les livrables à l'aide de tests reproductibles.
Le score de 52.6 % de Fable 5.1, contre 24.7 % pour Fable 5 dans les expériences de réplication officielles, représente une amélioration de 27.9 points de pourcentage, soit le bond le plus spectaculaire du tableau. Toutefois, Anthropic indique également une erreur standard d'environ ±3.5 à 4.5 points de pourcentage pour chaque modèle : on ne peut donc pas considérer la première décimale comme un classement absolument précis.
Que mesurent Terminal-Bench 4.0 et CursorBench 3.2.0 ?
Terminal-Bench demande à l'Agent de traiter des tâches complexes dans un véritable environnement de terminal, en vérifiant notamment sa capacité à comprendre l'environnement, à appeler des outils, à modifier des fichiers et à réussir finalement la validation. Fable 5.1 obtient 55.8 %, soit 13.8 points de pourcentage de plus que Fable 5, et dépasse également les 52.3 % d'Opus 5.
CursorBench 3.2 repose sur des tâches floues et multi-fichiers issues de sessions Cursor réelles ; la version 3.2 ajoute des problèmes de suivi d'instructions et d'utilisation avancée d'outils. Fable 5.1 Max obtient 73.4 % — une avance moins spectaculaire que sur Terminal-Bench-Science — mais il utilise en moyenne 72 060 tokens par tâche pour un coût de $9.64 ; Fable 5 Max en utilise 103 525 pour $17.32. Ce qui mérite ici davantage d'attention, c'est la baisse des tokens et des coûts pour accomplir le même type de tâches, plutôt que les 2.9 points de pourcentage en eux-mêmes.
Que mesure GDPval-AA v2 ?
GDPval-AA v2 utilise 220 tâches conçues par des professionnels du secteur, couvrant 44 professions et 9 secteurs d'activité, afin d'évaluer la capacité des modèles à traiter un travail de connaissance réel et à valeur économique. Son score de 1853 est un score composite, et non un pourcentage. Ce résultat montre que Fable 5.1 dépasse Fable 5 sur les documents professionnels, les analyses et les livrables, et devance également Opus 5 d'une courte tête.
Pourquoi OSWorld 2.0 a-t-il deux scores ?
OSWorld 2.0 contient 108 flux de travail d'opérations informatiques à longue chaîne, avec un temps de réalisation humain médian d'environ 1.6 heure par tâche. Partial attribue des points de complétion partielle en fonction de plusieurs points de contrôle ; Strict ne considère la tâche comme réussie que si l'objectif est atteint dans son intégralité.
Ainsi, les 77.9 % en partial et 41.7 % en strict de Fable 5.1 ne sont pas contradictoires : il parvient souvent à accomplir la plupart des étapes, mais une partie des tâches n'est toujours pas menée à bien de bout en bout. Cela nous rappelle aussi qu'un agent informatique qui « semble continuellement à l'œuvre » ne signifie pas que la tâche a réussi.
Que mesure Humanity's Last Exam ?
Humanity's Last Exam a été créé par le Center for AI Safety et Scale AI. Il comprend 2 500 questions interdisciplinaires de niveau expert, difficiles à résoudre par une simple recherche documentaire. Sans outils, Fable 5.1 dépasse Fable 5 de 3.1 points de pourcentage ; avec outils, l'écart n'est plus que de 1.2 point. Il est effectivement plus fort, mais tous les benchmarks n'affichent pas des améliorations démultipliées.
Que mesure AutomationBench ?
AutomationBench vérifie si un Agent peut mener à bien des workflows commerciaux, marketing, opérationnels, de service client, financiers et RH à travers des outils SaaS simulés tels que CRM, messagerie électronique, calendrier, messagerie et gestion de projet. Fable 5.1 passe de 17.1 % à 31.4 %, soit une amélioration relative d'environ 84 %, ce qui témoigne d'un progrès concret dans la gestion d'état multi-applications et l'exécution de longues suites d'étapes ; mais les 31.4 % montrent aussi que ce type d'automatisation métier sans supervision est encore loin d'être résolu.
Ce que Fable 5.1 améliore par rapport à Fable 5
1. Les tâches de longue durée empruntent moins volontiers les raccourcis
Anthropic positionne Fable 5.1 comme un modèle d'agent de longue durée : il planifie d'abord, puis utilise des outils, récupère après un échec, valide les résultats et rend compte de l'avancement de manière proactive. Il met davantage l'accent sur la correction de la cause racine que sur des contournements locaux visant à faire passer un test isolé au vert le plus rapidement possible. Les cas d'usage ciblés annoncés incluent les fonctionnalités multi-dépôts, la revue de code, l'optimisation des performances, les sessions autonomes de plusieurs jours, la recherche, les documents, les feuilles de calcul et les diapositives.
2. Un effort Low peut se rapprocher des résultats coûteux de la génération précédente
Fable 5.1 introduit la possibilité d'ajuster l'effort par message. Les courbes de coût officielles montrent qu'avec un effort Low ou Medium, il peut égaler ou dépasser Fable 5 sur certaines tâches, tout en réduisant les tokens et les coûts. Claude Code utilise par défaut un effort High ; Claude.ai et Cowork utilisent par défaut Medium. Lorsque l'on compare des modèles, il faut d'abord vérifier l'effort : on ne peut pas mettre côte à côte des résultats obtenus avec des niveaux différents.
3. Des progrès lisibles peuvent être affichés entre les appels d'outils
L'API ajoute une capacité expérimentale display: "updates" qui permet au modèle de fournir, entre les appels d'outils, des mises à jour de progression destinées à l'utilisateur. Pour des tâches qui durent plusieurs heures, on peut ainsi juger plus facilement ce que fait le modèle et s'il s'écarte de l'objectif, plutôt que de voir défiler sans fin des cartes d'appels d'outils.
4. Rédaction, vérification visuelle et auto-tests plus complets
Anthropic indique que la 5.1 rédige activement des tests pour valider ses propres modifications et exploite ses capacités visuelles afin de vérifier ses sorties par rapport aux objectifs de conception. Les retours des partenaires portent également sur des comptes rendus plus concis, des réponses plus complètes aux questions à plusieurs volets, le suivi des chaînes d'appels à travers plusieurs services, et le maintien de la lisibilité après de longues exécutions. Il s'agit de retours qualitatifs, qui ne doivent pas être présentés comme des conclusions de benchmark uniformes.
5. Des blocages de sécurité plus précis, mais pas disparus
Les faux positifs de la protection en cybersécurité de Fable 5.1 ont diminué d'environ 60 % par rapport au lancement de Fable 5, et les questions élémentaires de biologie et de médecine déclenchent un déclassement environ 85 % moins souvent. Il peut désormais être utilisé pour découvrir des vulnérabilités logicielles, mais les tâches à double usage telles que les tests d'intrusion, la génération de code d'exploitation ou l'analyse de vulnérabilités binaires peuvent encore être routées vers Opus. Une fois routées, ces requêtes ne sont pas facturées au tarif de Fable.
6. Nouveau marquage de la provenance du contenu
Fable 5.1 introduit la provenance du contenu (content provenance). Les textes générés peuvent comporter un filigrane statistique, vérifiable à l'aide de l'outil de vérification de contenu d'Anthropic. Aucun marqueur visible n'est ajouté dans le corps du texte, mais pour les plateformes de contenu, l'éducation et les audits d'entreprise, c'est un nouveau comportement à connaître à l'avance.
Comment sont calculés les coûts de Fable 5.1 ?
| Élément de facturation | Prix Fable 5.1 | Comparé à Fable 5 |
|---|---|---|
| Entrée | $10 / MTok | Identique |
| Sortie | $50 / MTok | Identique |
| Écriture en cache 5 minutes | $12.50 / MTok | Même barème |
| Écriture en cache 1 heure | $20 / MTok | Même barème |
| Lecture en cache | $0.25 / MTok | Baisse de 75 % |
| Batch API | 50 % des prix d'entrée et de sortie | Selon les règles Batch |
Supposons qu'une longue tâche cumule 10 millions de tokens de cache lus, 200 000 nouveaux tokens d'entrée et 50 000 tokens de sortie, sans tenir compte des écritures en cache :
缓存读取:10 × $0.25 = $2.50
新输入:0.2 × $10 = $2.00
输出:0.05 × $50 = $2.50
合计:$7.00Les mêmes 10 millions de lectures en cache coûtent environ $10 sur Fable 5 ; le seul écart sur ce poste est donc de $7.50. Anthropic estime ainsi que le coût réel des tâches typiques facturées au token peut baisser d'environ 25 %, et jusqu'à environ 45 % pour les tâches très orientées agent qui réutilisent fréquemment de longs contextes. Il ne s'agit pas d'une baisse globale des prix catalogue de l'API, mais : plus les hits de cache sont nombreux, plus les économies sont importantes.
Les abonnés ne bénéficient pas nécessairement directement de la baisse du cache API
Les sièges premium (premium seats) de Max et de Team/Enterprise peuvent utiliser jusqu'à 50 % de leur quota hebdomadaire pour les modèles Fable ; Pro et les sièges standard utilisent quant à eux des crédits d'utilisation (usage credits) dès le départ. La consommation exacte est indiquée sur la page Usage du compte. La baisse de la lecture en cache concerne principalement les scénarios de facturation au token : on ne peut pas convertir directement la réduction de 75 % du cache API en « quatre fois plus d'utilisation avec l'offre Max ».
Fable 5.1 est-il vraiment rapide ?
La réponse est : les réponses individuelles sont plutôt lentes, mais le temps total nécessaire pour accomplir une tâche complexe peut être plus court.
- Le catalogue de modèles d'Anthropic classe Fable 5.1 comme
Slower, Opus 5 commeModerateet Sonnet 5 commeFast. - Claude Code utilise High effort par défaut, ce qui consomme naturellement plus de temps de raisonnement que Low ou Medium.
- Every indique que, sur ses propres charges de travail, Fable 5.1 est environ deux fois plus rapide qu'Opus 5 et consomme moitié moins de tokens ; il s'agit d'un test spécifique du partenaire, et non d'une garantie générale de vitesse.
- Dans CursorBench, Fable 5.1 Max effectue en moyenne 70 étapes avec 72 060 tokens ; Fable 5 Max effectue également 72 étapes, mais avec 103 525 tokens. L'avantage de la 5.1 ressemble davantage à « moins de détours, moins de tokens consommés », et ne se traduit pas nécessairement par un premier token plus rapide.
Par conséquent, pour la conversation, le code court et les interactions fréquentes, privilégiez Sonnet 5 ou Opus 5 ; pour le débogage multi-dépôts, la recherche longue et les tâches sans supervision nécessitant une auto-validation, envisagez Fable 5.1.
Les changements de compatibilité à traiter avant de passer à Fable 5.1
Mettre à jour Claude Code au moins vers la version 2.1.250
La documentation d'Anthropic sur les formules et la disponibilité exige Claude Code 2.1.250 ou une version ultérieure. Si Fable 5.1 n'apparaît pas, commencez par vérifier :
claude --versionMettez ensuite à jour selon la procédure officielle de Claude Code, puis redémarrez la session. L'ID de modèle API de Fable 5.1 est :
claude-fable-5-1L'utilisation forcée d'outils (forced tool use) peut renvoyer une erreur
Si une requête force le modèle à appeler un outil donné, Fable 5.1 peut renvoyer une erreur. Avant la migration, vérifiez tool_choice et les flux d'utilisation forcée d'outils dans vos agents personnalisés ; ne supposez pas que le comportement de Fable 5 est entièrement compatible.
Les thinking blocks ne peuvent pas être réutilisés librement entre modèles
Les modèles antérieurs ne peuvent pas lire les thinking blocks de Fable 5.1. Lors d'un changement de modèle, laissez le SDK traiter ces blocs conformément aux règles officielles, plutôt que de les transmettre tels quels à un autre modèle.
Modifier un ancien historique peut entraîner une erreur 400
Pour les nouveaux comptes API créés après le 31 août 2026, les thinking blocks ne sont valides que dans le préfixe de conversation d'origine qui les a générés. Rejouer ces blocs après avoir modifié le system, les tools ou des messages antérieurs peut renvoyer une erreur 400. Anthropic recommande de conserver un historique en mode ajout seul (append-only) ; si une compression est nécessaire, remplacez l'intégralité de l'ancien historique par un nouveau résumé, plutôt que de conserver les thinking blocks d'origine tout en modifiant les tours précédents. Pour plus de détails, voir le Guide de prompting et de migration de Fable 5.1.
Quand faut-il choisir Fable 5.1 ?
Adapté à :
- les longues tâches s'étendant sur plusieurs dépôts, services ou applications ;
- les agents devant s'exécuter pendant des heures et se remettre eux-mêmes d'un échec ;
- la recherche scientifique, l'analyse de données complexes et les livrables professionnels en plusieurs étapes ;
- les problèmes système difficiles à reproduire, l'optimisation des performances et la recherche de causes racines ;
- les charges de travail API qui réutilisent massivement de longs contextes, avec une part élevée de lectures en cache.
Pas adapté à :
- la conversation simple, les textes courts ou les petites modifications sur un seul fichier ;
- les interactions en temps réel très sensibles à la latence du premier token ;
- les tâches à forte sortie, avec un budget fixe et sans réutilisation du cache ;
- les scénarios où l'on ne peut pas accepter la conservation par défaut de 30 jours des données de surveillance de sécurité et qui ne satisfont pas aux conditions d'exception pour les entreprises ;
- les workflows qui exigent qu'aucune requête en cybersécurité ou en sciences de la vie ne déclenche de déclassement.
Comment suivre les longues tâches à distance
La valeur de Fable 5.1 se révèle souvent dans des tâches qui durent plusieurs heures, voire plusieurs jours, mais cela ne signifie pas que l'on doive rester en permanence devant sa machine de développement. Vérifiez d'abord que Fable 5.1 est disponible dans Claude Code 2.1.250+ sur la machine locale, puis utilisez PandaNpc Agent pour consulter depuis un navigateur, un ordinateur de bureau ou un téléphone les sessions Claude Code sur cette même machine de développement, gérer les interactions et continuer à donner des instructions.
Ce qui change ici, c'est le point d'entrée de contrôle : le code, les outils et les builds continuent de s'exécuter sur votre machine de développement. Vous pouvez d'abord lire le Guide d'accès à distance à Claude Code et le Tutoriel pour connecter Claude Code depuis un téléphone, puis confier vos longues tâches à Fable 5.1 une fois la liaison à distance confirmée.
FAQ
De combien Fable 5.1 est-il plus fort que Fable 5 ?
Les écarts varient considérablement selon les tâches. Terminal-Bench-Science progresse de 27.9 points de pourcentage, AutomationBench de 14.3 points ; HLE avec outils ne progresse que de 1.2 point. On ne peut pas résumer toutes les tâches à la plus forte augmentation.
Fable 5.1 est-il plus rapide qu'Opus 5 ?
Dans le tableau officiel des latences relatives, Fable 5.1 est « plus lent » et Opus 5 « modéré ». Certains partenaires observent que Fable 5.1 est plus rapide sur des tâches complètes, car il utilise moins de tokens et effectue moins de reprises. Ces deux conclusions ne mesurent pas la même chose.
Fable 5.1 est-il plus adapté à la programmation que GPT-5.6 Sol ?
Dans le tableau publié par Anthropic, Fable 5.1 obtient des scores plus élevés sur Terminal-Bench-Science, Terminal-Bench, AutomationBench et CursorBench ; mais les différents modèles utilisent des environnements d'agent (Agent harness), des efforts, des outils et des prix différents. On ne peut donc pas en conclure que Fable remporte tous les dépôts réels. Vous pouvez consulter le Tutoriel de configuration du contexte 1M de GPT-5.6 Sol, puis effectuer vos propres tests A/B sur des tâches représentatives.
Pourquoi Fable 5.1 bascule-t-il soudainement vers Opus ?
Certaines requêtes en cybersécurité et en sciences de la vie sont routées vers Opus par les mécanismes de protection (safeguards). Ce changement de modèle n'est pas nécessairement un dysfonctionnement ; Anthropic indique que ces requêtes routées ne sont pas facturées au tarif de Fable.
Fable 5.1 possède-t-il un filigrane ?
Oui, il existe un mécanisme statistique de provenance du contenu (content provenance), mais aucun label visible n'est ajouté à la surface du texte. Cela n'a rien à voir avec un filigrane visible dans le coin d'une image.
Résumé
Les progrès les plus nets de Claude Fable 5.1 se concentrent sur la recherche scientifique, les tâches en terminal et les workflows métier inter-applications : il est plus capable d'exécuter des tâches en continu, de se remettre d'un échec et de valider les résultats, tout en réduisant le coût des longues tâches grâce à des lectures en cache moins chères. Mais il reste cher, avec une latence par tour plutôt lente, et introduit des changements de compatibilité concernant les thinking blocks, l'utilisation forcée d'outils et la modification des historiques.
La bonne question pour le choisir n'est pas « est-il premier au classement ? », mais : votre tâche est-elle suffisamment longue et complexe, et le coût d'un échec ou d'une reprise est-il suffisamment élevé pour justifier le recours à Fable 5.1 ? Si la réponse est non, commencer avec Opus 5 ou Sonnet 5 est généralement plus approprié.
Guides associés

Activer le contexte 1M de GPT-5.6 Sol avec Codex : tutoriel de configuration en 3 lignes dans `config.toml`
GPT-5.6 Sol prend officiellement en charge un contexte de 1,05 million de jetons. Il suffit d'ajouter 3 lignes de configuration en haut du config.toml de Codex pour l'exécuter avec une fenêtre d'un million de jetons et compresser automatiquement l'historique à environ 900 000 jetons. Inclut configuration permanente, commande unique, vérification et rappels de coûts.
Lire l'article →
Claude Code Remote Control : comment l'utiliser ? Contrôle à distance depuis le téléphone, limitations officielles et alternatives (2026)
Comment activer Claude Code Remote Control ? Cet article présente trois utilisations officielles : claude remote-control, claude --remote-control et /remote-control, explique la connexion depuis mobile et navigateur, les exigences de compte, les méthodes de vérification et les erreurs courantes, et compare les solutions PandaNpc pour les modèles personnalisés, Codex et les scénarios multi-machines.
Lire l'article →
Connecter Claude Code depuis son téléphone : visualiser les sessions et approuver les outils sur iOS à tout moment
Cet article s'adresse aux développeurs et partage les bonnes pratiques pour connecter Claude Code depuis un téléphone. Grâce à l'application iOS PandaNpc, vous pouvez consulter les sessions en temps réel, approuver les appels d'outils et répondre aux questions. À l'aide de pandapaw et d'iOS Live Activity, vous pouvez contrôler à distance efficacement et améliorer la flexibilité du codage.
Lire l'article →