Claude Fable 5.1 Komplet gennemgang: benchmarks, forbedringer, pris og hastighed
Claude Fable 5.1s fulde resultater på 7 kategorier af mainstream benchmarks, med punkt-for-punkt sammenligning med Fable 5, Opus 5 og GPT-5.6 Sol, samt en forklaring af 5.1s lange opgaver, værktøjskald, cache-omkostninger, hastighed, pakkebegrænsninger og migrationsændringer.

Claude Fable 5.1 blev officielt udgivet den 1. september 2026. Lad os starte med konklusionen: Det er ikke en almindelig modelopgradering til almindelige spørgsmål og svar, men en kostbar flagskabsmodel bygget til langvarig programmering, kompleks research, værktøjskald på tværs af applikationer og ubemandede agenter. I Anthropics officielt offentliggjorte 7 kategorier af mainstream-benchmarks overgår Fable 5.1 alle resultaterne for Fable 5; men dens API-enhedspris er stadig dobbelt så høj som Opus 5's, og den officielle relative latenstid er angivet som "langsommere".
Hvis din opgave blot er at ændre en fil, skrive en kort tekst eller besvare almindelige spørgsmål, anbefaler Anthropic stadig at starte med Opus 5. Fable 5.1 egner sig bedre til langkædede opgaver, som almindelige modeller stadig ikke kan løse stabilt ved høj effort. Denne artikel samler de officielle udgivelsesdata, betydningen af hvert benchmark, de konkrete forbedringer i 5.1, pris, hastighed og migrationsbegrænsninger, så man undgår kun at se på ét "hvem vandt"-benchmarkdiagram.
Fable 5.1's specifikationer i én tabel
| Punkt | Claude Fable 5.1 | Claude Opus 5 | Claude Sonnet 5 |
|---|---|---|---|
| Kontekstvindue | 1M tokens | 1M tokens | 1M tokens |
| Maks. output | 128K tokens | 128K tokens | 128K tokens |
| Inputpris | $10 / MTok | $5 / MTok | $2 / MTok |
| Outputpris | $50 / MTok | $25 / MTok | $10 / MTok |
| Relativ latenstid | Langsom | Moderat | Hurtig |
| Thinking | Adaptiv, altid aktiveret | Adaptiv | Adaptiv |
| Standardeffort | High | High | High |
| Pålidelig vidensgrænse | Juni 2026 | Maj 2026 | Januar 2026 |
"Langsom" her stammer fra Anthropics modelkatalog og angiver en relativ latenstidsklasse, ikke et fast antal tokens i sekundet. Hvor lang tid en opgave reelt tager afhænger også af effort, antallet af værktøjskald, cache-træfrate, kontekstlængde og antal fejl-forsøg.
Fable 5.1's samlede tabel over mainstream-benchmarks
Tabellen nedenfor er hentet direkte fra hovedtabellen på Anthropics udgivelsesside af 1. september 2026. For at undgå fejllæsning er procenter, GDPval-AA's råscore, OSWorlds partial/strict og HLE's resultater med/uden værktøjer adskilt. Hvert benchmark beholder sit officielle engelske navn, og på næste linje angives det danske navn; andre sprogversioner viser også deres oversatte navn under det engelske navn.
| Evne | Benchmark | Fable 5.1 | Fable 5 | Opus 5 | GPT-5.6 Sol | 5.1 ift. Fable 5 |
|---|---|---|---|---|---|---|
| Agentisk videnskabelig forskning | Terminal-Bench-Science 0.1 Terminalbenchmark for agentisk videnskabelig forskning |
52.6% | 24.7% | 29.0% | 22.4% | +27.9 procentpoint |
| Agentisk terminalprogrammering | Terminal-Bench 4.0 Terminalbenchmark for agentisk programmering |
55.8% | 42.0% | 52.3% | 37.3% | +13.8 procentpoint |
| Professionelt vidensarbejde | GDPval-AA v2 Benchmark for professionelle opgaver med reel økonomisk værdi |
1853 | 1723 | 1824 | 1711 | +130 point |
| Computerbetjening | OSWorld 2.0 — Partial Benchmark for reel computerbetjening: Delvis gennemførelse |
77.9% | 72.9% | 75.4% | — | +5.0 procentpoint |
| Computerbetjening | OSWorld 2.0 — Strict Benchmark for reel computerbetjening: Streng gennemførelse |
41.7% | 36.1% | 39.6% | — | +5.6 procentpoint |
| Tværfaglig ræsonnering | Humanity's Last Exam — No tools Humanity's Last Exam: Uden værktøjer |
60.9% | 57.8% | 56.6% | — | +3.1 procentpoint |
| Tværfaglig ræsonnering | Humanity's Last Exam — With tools Humanity's Last Exam: Med værktøjer |
65.0% | 63.8% | 63.6% | — | +1.2 procentpoint |
| Forretningsworkflows | AutomationBench Benchmark for forretningsautomatisering på tværs af applikationer |
31.4% | 17.1% | 26.9% | 19.6% | +14.3 procentpoint |
| Agentisk programmering | CursorBench 3.2.0 Benchmark for ægte multi-fil-programmeringsopgaver |
73.4% | 70.5% | 70.0% | 67.2% | +2.9 procentpoint |
— betyder, at Anthropics hovedtabel ikke indeholder et tilsvarende resultat; det betyder ikke, at modellen ikke kan løse opgaven. I Terminal-Bench 4.0 opnår Mythos 5.1, som har færre begrænsninger og kun er åben for betroede programmer, 60.9%; denne artikel fokuserer på Fable 5.1, som er tilgængelig for almindelige brugere, og blander ikke Mythos' resultater ind i Fable-kolonnen.
Hvad måler Terminal-Bench-Science 0.1?
Terminal-Bench-Science 0.1 indeholder 70 reelle forskningsarbejdsgange inden for life science, fysik, geovidenskab, matematik og ingeniørvidenskab. Opgaverne er ikke multiple choice. De kræver, at agenten i terminalen udfører dataanalyse, statistisk inferens, simulering, optimering, teorembevis, billedrekonstruktion eller scientific machine learning og kontrollerer resultaterne med reproducerbare tests.
Fable 5.1's 52.6% mod Fable 5's 24.7% i de officielle replikationseksperimenter er en forbedring på 27.9 procentpoint – det største spring i hele tabellen. Officielt angiver Anthropic dog en standardfejl på ca. ±3.5–4.5 procentpoint for hver model, så man skal ikke behandle et enkelt decimaltal som en absolut præcis rangering.
Hvad måler Terminal-Bench 4.0 og CursorBench 3.2.0?
Terminal-Bench lader agenten håndtere komplekse opgaver i et ægte terminalmiljø. Fokus er på, om den kan forstå miljøet, kalde værktøjer, ændre filer og til sidst bestå valideringen. Fable 5.1 opnår 55.8% – 13.8 procentpoint højere end Fable 5 og også højere end Opus 5's 52.3%.
CursorBench 3.2 er baseret på vage, multi-fil-opgaver fra rigtige Cursor-sessioner. Version 3.2 tilføjer udfordringer omkring instruktionsfølgning og avanceret værktøjsbrug. Fable 5.1 Max opnår 73.4% – forspringet er ikke lige så ekstremt som ved Terminal-Bench-Science, men den bruger i gennemsnit 72,060 tokens per opgave til en pris på $9.64; Fable 5 Max bruger 103,525 tokens og $17.32. Her er faldet i token- og prisforbrug ved samme type opgave mere interessant end selve de 2.9 procentpoint.
Hvad måler GDPval-AA v2?
GDPval-AA v2 bruger 220 opgaver designet af branchefolk på tværs af 44 professioner og 9 brancher til at vurdere modellens evne til at håndtere ægte, økonomisk værdifuldt vidensarbejde. Resultatet 1853 er en samlet score, ikke 1853%. Resultatet viser, at Fable 5.1 overgår Fable 5 på professionelle dokumenter, analyser og leverancer og også ligger en anelse over Opus 5.
Hvorfor har OSWorld 2.0 to scores?
OSWorld 2.0 indeholder 108 langvarige computerbetjenings-workflows. Medianen for menneskelig gennemførelsestid er ca. 1.6 time per opgave. Partial giver delvis score ud fra flere checkpoints; Strict tæller kun som succes, hvis målet er fuldt opnået.
Derfor er Fable 5.1's 77.9% partial og 41.7% strict ikke modstridende: Den gennemfører ofte størstedelen af trinene, men en del opgaver bliver stadig ikke afsluttet end-to-end. Det minder os også om, at en computeragent, der "hele tiden arbejder", ikke nødvendigvis betyder, at opgaven er fuldført.
Hvad måler Humanity's Last Exam?
Humanity's Last Exam er skabt af Center for AI Safety og Scale AI og indeholder 2,500 tværfaglige spørgsmål på ekspertniveau, som er svære at besvare ved simpel informationssøgning. Fable 5.1 er 3.1 procentpoint over Fable 5 uden værktøjer, men kun 1.2 procentpoint højere, når værktøjer er tilladt. Den er ganske vist stærkere, men ikke alle benchmarks viser en fordobling.
Hvad måler AutomationBench?
AutomationBench tester, om agenten på tværs af simulerede SaaS-værktøjer som CRM, e-mail, kalender, beskeder og projektstyring kan gennemføre salgs-, marketing-, drifts-, support-, økonomi- og HR-workflows. Fable 5.1 forbedres fra 17.1% til 31.4% – en relativ forbedring på ca. 84%. Det viser reelle fremskridt i håndteringen af tilstand på tværs af applikationer og udførelsen af lange sekvenser; men 31.4% viser også, at ubemandet forretningsautomatisering stadig er langt fra løst.
Hvad er forbedret i Fable 5.1 sammenlignet med Fable 5?
1. Langvarige opgaver tager sjældnere genveje
Anthropic positionerer Fable 5.1 som en model til langvarige agentopgaver: først planlægning, derefter brug af værktøjer, genopretning efter fejl, validering af resultater og proaktiv rapportering af fremdrift. Den lægger mere vægt på at rette rodårsagen frem for at lave lokale genveje for hurtigt at få en enkelt test til at blive grøn. Officielt oplistede målopgaver inkluderer funktionalitet på tværs af kodebaser, kodegennemgang, performanceoptimering, flerdages autonome sessioner, research, dokumentation, regneark og præsentationer.
2. Lav effort kan nærme sig tidligere generationers kostbare resultater
Fable 5.1 tilføjer muligheden for at justere effort per besked. De officielle omkostningskurver viser, at Low- eller Medium-effort på nogle opgaver kan matche eller overgå Fable 5 og samtidig reducere tokens og omkostninger. Claude Code bruger High-effort som standard; Claude.ai og Cowork bruger Medium-effort som standard. Når man sammenligner modeller, skal man først bekræfte effort – man kan ikke bare sammenligne resultater fra forskellige niveauer.
3. Læsbar fremdrift mellem værktøjskald
API'et får en ny testfunktion, display: "updates", som lader modellen vise brugerrettede statusopdateringer mellem værktøjskald. Ved opgaver, der kører i timevis, er det nemmere at vurdere, hvad den laver, og om den er på vej væk fra målet, end hvis man kun ser værktøjskort blive ved med at dukke op.
4. Mere komplet skrivning, visuel validering og selvtest
Officielt skriver 5.1 aktivt tests for at validere sine egne ændringer og bruger visuelle evner til at sammenholde output med designmålene. Samarbejdspartnernes vurderinger handler også om mere kortfattet fremdrift, mere fuldstændige svar på flerdelte spørgsmål, sporing af kaldkæder på tværs af flere tjenester og fastholdt læsbarhed under lange kørsler. Det er kvalitativ feedback og bør ikke behandles som en samlet benchmarkkonklusion.
5. Sikkerhedsfiltrering er mere præcis – men den er ikke forsvundet
Fable 5.1 har ca. 60% færre falske positiver i cybersikkerhedsbeskyttelsen end ved Fable 5's udgivelse, og grundlæggende biologiske og medicinske spørgsmål udløser nedgradering ca. 85% sjældnere. Den kan nu bruges til at finde software-sårbarheder, men dual-use-opgaver som penetrationstest, generering af exploit-kode og scanning af binære sårbarheder kan stadig blive dirigeret til Opus. Efter en sådan dirigering faktureres der ikke til Fable-priser.
6. Ny mærkning af indholdsoprindelse
Fable 5.1 introducerer content provenance. Genereret tekst kan bære et statistisk vandmærke, som kan verificeres med Anthropics indholdskontrolværktøj. Der tilføjes ingen synlig markering i selve teksten, men for indholdsplatforme, uddannelse og virksomhedsrevision er det en ny opførsel, man bør kende til på forhånd.
Sådan beregnes prisen for Fable 5.1
| Faktureringspost | Fable 5.1-pris | Sammenlignet med Fable 5 |
|---|---|---|
| Input | $10 / 1 million tokens | Samme |
| Output | $50 / 1 million tokens | Samme |
| Cache-skrivning (5 min) | $12.50 / 1 million tokens | Samme niveau |
| Cache-skrivning (1 time) | $20 / 1 million tokens | Samme niveau |
| Cache-læsning | $0.25 / 1 million tokens | 75% billigere |
| Batch API | 50% af input- og outputprisen | Følger Batch-reglerne |
Antag en lang opgave med i alt 10 millioner læste cache-tokens, 200,000 nye input-tokens og 50,000 output-tokens, uden cache-skrivning:
缓存读取:10 × $0.25 = $2.50
新输入:0.2 × $10 = $2.00
输出:0.05 × $50 = $2.50
合计:$7.00De samme 10 millioner cache-læsninger koster ca. $10 på Fable 5 – alene på denne ene post er forskellen $7.50. På den baggrund estimerer Anthropic, at de faktiske omkostninger for en typisk token-faktureret opgave kan falde med ca. 25%, og for stærkt agentiske opgaver, der ofte genbruger lang kontekst, med op til ca. 45%. Det er ikke et generelt prisfald på API'ets listepriser, men jo flere cache-træf, desto større besparelse.
Abonnenter får ikke nødvendigvis direkte glæde af API'ets cache-prisfald
Max og premium-sæder i Team/Enterprise kan bruge op til 50% af den ugentlige kvote på Fable-modeller; Pro og standardsæder bruger fra starten usage credits. Det konkrete forbrug fremgår af Usage-siden på kontoen. Prisfaldet på cache-læsning er primært en ændring for token-fakturerede scenarier – man kan altså ikke direkte omregne API'ets 75% rabat på cache til "fire gange mere med Max-pakken".
Er Fable 5.1 overhovedet hurtig?
Svaret er: Enkelt-svar-latenstiden er langsommere, men den samlede gennemførelsestid for komplekse opgaver kan være kortere.
- Anthropics modelkatalog markerer Fable 5.1 som
Slower, Opus 5 somModerateog Sonnet 5 somFast. - Claude Code bruger High-effort som standard, hvilket naturligt kræver mere tænketid end Low eller Medium.
- Every siger om deres egen arbejdsbyrde, at Fable 5.1 er ca. dobbelt så hurtig som Opus 5 og bruger halvt så mange tokens; det er en samarbejdspartners specifikke test, ikke en generel hastighedsgaranti.
- I CursorBench bruger Fable 5.1 Max i gennemsnit 70 trin og 72,060 tokens; Fable 5 Max bruger også 72 trin, men 103,525 tokens. 5.1's fordel ligner mere "færre omveje og mindre token-forbrug" og viser sig ikke nødvendigvis som et hurtigere første token.
Derfor: Til chat, kort kode og hyppig interaktion bør man vælge Sonnet 5 eller Opus 5. Til fejlfinding på tværs af kodebaser, langvarig research og ubemandede opgaver, der kræver selvvalidering, bør man overveje Fable 5.1.
Kompatibilitetsændringer, du skal håndtere, før du opgraderer til Fable 5.1
Claude Code skal mindst opgraderes til 2.1.250
Anthropics pakke- og tilgængelighedsnote kræver Claude Code 2.1.250 eller nyere. Hvis Fable 5.1 ikke er synlig, så tjek først:
claude --versionOpdatér derefter efter Claude Codes officielle opgraderingsmetode, og start sessionen igen. Fable 5.1's API-model-id er:
claude-fable-5-1Forced tool use kan give direkte fejl
Hvis en anmodning tvinger modellen til at kalde et bestemt værktøj, kan Fable 5.1 returnere en fejl. Før migreringen bør du tjekke tool_choice og dine egne agenters flows for tvungne værktøjskald – antag ikke, at Fable 5's adfærd er fuldt kompatibel.
Thinking blocks kan ikke genbruges frit på tværs af modeller
Ældre modeller kan ikke læse Fable 5.1's thinking blocks. Ved modelskift bør du lade SDK'et håndtere disse blokke efter de officielle regler i stedet for at sende dem uændret til en anden model.
Ændring af gammel historik kan give fejl 400
For nye API-konti oprettet efter 31. august 2026 er thinking blocks kun gyldige i den oprindelige dialogkontekst, hvor de blev genereret. Hvis du ændrer system, tools eller tidligere beskeder og derefter afspiller thinking blocks igen, kan du få en 400-fejl. Officielt anbefales det at holde historikken append-only. Når du har brug for at komprimere, så erstat hele den gamle historik med én ny oversigt – lad være med at ændre gamle runder og samtidig bevare de oprindelige thinking blocks. Detaljeret vejledning findes i Fable 5.1 prompt- og migreringsvejledning.
Hvornår bør du vælge Fable 5.1?
Velegnet til:
- Lange opgaver på tværs af flere repositories, tjenester eller applikationer;
- Agenter, der skal køre i flere timer og selv genoprette efter fejl;
- Videnskabelig forskning, kompleks dataanalyse og flerfasede professionelle leverancer;
- Svært reproducerbare systemproblemer, performanceoptimering og rodårsagsanalyse;
- API-arbejdsbelastninger, der genbruger meget lang kontekst og har en høj andel af cache-læsninger.
Ikke velegnet til:
- Simpel chat, korte tekster eller små ændringer i en enkelt fil;
- Realtidsinteraktion med høj følsomhed over for tid til første token;
- Opgaver med fast budget og stort output, men uden cache-genbrug;
- Scenarier, hvor man ikke kan acceptere standardopbevaring af sikkerhedsovervågningsdata i 30 dage, og som ikke opfylder virksomhedens undtagelsesvilkår;
- Workflows, hvor man forventer, at alle cybersikkerheds- eller life science-anmodninger ikke udløser nedgradering.
Sådan fjernovervåger du lange opgaver
Fable 5.1's værdi viser sig ofte i opgaver, der varer flere timer eller dage – men det betyder ikke, at man skal sidde klistret til udviklingsmaskinen. Bekræft først, at Fable 5.1 er tilgængelig i din lokale Claude Code 2.1.250+. Brug derefter PandaNpc Agent til at se Claude Code-sessionen på den samme udviklingsmaskine fra browser, desktop eller mobil, håndtere interaktioner og fortsætte med at give instruktioner.
Det, der ændres, er adgangspunktet. Koden, værktøjerne og buildet kører stadig på din egen udviklingsmaskine. Du kan først læse Claude Code-vejledningen til fjernadgang og selvstudiet om at forbinde til Claude Code fra mobilen og bekræfte den eksterne forbindelse, før du lader Fable 5.1 køre lange opgaver.
FAQ
Hvor meget stærkere er Fable 5.1 end Fable 5?
Det varierer meget fra opgave til opgave. Terminal-Bench-Science er 27.9 procentpoint højere, AutomationBench 14.3 procentpoint højere, mens HLE kun er 1.2 procentpoint højere, når værktøjer bruges. Man kan ikke lade det største enkeltspring repræsentere alle opgaver.
Er Fable 5.1 hurtigere end Opus 5?
I den officielle relative latenstidstabel er Fable 5.1 "langsommere", og Opus 5 er "moderat". Nogle samarbejdspartnere har observeret, at Fable 5.1 er hurtigere på hele opgaver, fordi den bruger færre tokens og mindre omarbejdning. De to konklusioner måler ikke det samme.
Er Fable 5.1 bedre end GPT-5.6 Sol til programmering?
I Anthropics udgivelsestabel ligger Fable 5.1 højere på Terminal-Bench-Science, Terminal-Bench, AutomationBench og CursorBench. Men forskellige modeller bruger forskellige agent-harness, effort-niveauer, værktøjer og priser, så man kan ikke ud fra dette konkludere, at Fable vinder på alle rigtige repositories. Du kan eventuelt se GPT-5.6 Sol 1M-kontekst konfigurationsvejledning og derefter lave din egen A/B-test med repræsentative opgaver.
Hvorfor skifter Fable 5.1 pludselig til Opus?
Visse cybersikkerheds- og life science-anmodninger dirigeres af safeguards til Opus. Et modelskift er ikke nødvendigvis en fejl; Anthropic oplyser, at sådanne dirigerede anmodninger ikke faktureres til Fable-priser.
Har Fable 5.1 vandmærker?
Der findes en statistisk content provenance-mekanisme, men der tilføjes ingen synlig etiket på selve teksten. Det er ikke det samme som et synligt vandmærke i hjørnet af et billede.
Opsummering
Claude Fable 5.1's tydeligste fremskridt ligger i videnskabelig forskning, terminalopgaver og forretningsworkflows på tværs af applikationer: Den er bedre til at udføre opgaver vedholdende, genoprette efter fejl og validere resultater, og billigere cache-læsning har samtidig sænket omkostningerne ved lange opgaver. Men den er stadig dyr, har langsommere enkelt-svar-latenstid og medfører kompatibilitetsændringer omkring thinking blocks, tvungne værktøjskald og redigering af historik.
Det rigtige spørgsmål ved valget er ikke "er den nummer ét på benchmarks?", men: Er din opgave lang og kompleks nok – og er omkostningen ved fejl og omarbejdning høj nok – til at det kan betale sig at bruge Fable 5.1? Hvis svaret er nej, er det som regel bedre at starte med Opus 5 eller Sonnet 5.
Relaterede guider

Codex: Sådan aktiverer du GPT-5.6 Sol 1M-kontekst: 3-linjers `config.toml` konfigurationsvejledning
GPT-5.6 Sol understøtter officielt en kontekst på 1,05 millioner tokens. Du skal blot tilføje 3 linjers konfiguration øverst i Codex's config.toml for at køre med et 1 million-vindue og automatisk komprimere historikken ved omkring 900.000 tokens. Medfølger: permanent konfiguration, enkeltkommando, verifikation og omkostningsadvarsel.
Læs artikel →
Sådan bruger du Claude Code Remote Control? Fjernbetjening fra mobilen, officielle begrænsninger og alternativer (2026)
Hvordan aktiverer man Claude Code Remote Control? Denne artikel præsenterer de tre officielle anvendelser: claude remote-control, claude --remote-control og /remote-control, forklarer mobil- og browserforbindelse, kontokrav, verifikationsmetoder og almindelige fejl, og sammenligner PandaNpc-løsninger i scenarier med brugerdefinerede modeller, Codex og flere maskiner.
Læs artikel →
Forbind mobilen til Claude Code: Se sessioner og godkend værktøjer når som helst på iOS
Denne artikel henvender sig til udviklere og deler bedste praksis for at forbinde til Claude Code fra en mobiltelefon. Via PandaNpc iOS-appen kan du se sessioner i realtid, godkende værktøjsopkald og svare på spørgsmål. Ved hjælp af pandapaw og iOS Live Activity opnår du effektiv fjernbetjening og øget fleksibilitet i kodning.
Læs artikel →