Claude Fable 5.1 – komplett gjennomgang: benchmark, forbedringer, pris og hastighet
Claude Fable 5.1s fullstendige resultater på 7 kategorier av ledende benchmarks, med sammenligninger punkt for punkt mot Fable 5, Opus 5 og GPT-5.6 Sol, samt forklaring av 5.1s lange oppgaver, verktøykall, cache-kostnader, hastighet, plangrenser og migreringsendringer.

Claude Fable 5.1 ble offisielt utgitt 1. september 2026. Konklusjonen først: dette er ikke en vanlig modelloppgradering for hverdagslige spørsmål og svar, men en kostbar flaggskipmodell for langvarig programmering, kompleks forskning, verktøykall på tvers av applikasjoner og ubemannede agenter. Blant de sju kategoriene av offentliggjorte benchmarker fra Anthropic slår Fable 5.1 Fable 5 i alle sammen; men API-prisen per enhet er fortsatt dobbelt så høy som for Opus 5, og offisielt er relativ latens merket som «langsom».
Hvis oppgaven din bare er å endre én fil, skrive en kort tekst eller svare på vanlige spørsmål, anbefaler Anthropic fortsatt å starte med Opus 5. Fable 5.1 passer bedre for langvarige oppgavekjeder som vanlige modeller ikke klarer å fullføre stabilt selv med høy effort. Denne artikkelen samler de offisielle lanseringsdataene, betydningen av hver benchmark, de konkrete forbedringene i 5.1, pris, hastighet og migreringsbegrensninger – slik at du ikke bare ser på ett «hvem vant»-skjermbilde.
Spesifikasjonene til Fable 5.1 i én tabell
| Egenskap | Claude Fable 5.1 | Claude Opus 5 | Claude Sonnet 5 |
|---|---|---|---|
| Kontekstvindu | 1M token | 1M token | 1M token |
| Maksimal utgang | 128K token | 128K token | 128K token |
| Input-pris | $10 / MTok | $5 / MTok | $2 / MTok |
| Output-pris | $50 / MTok | $25 / MTok | $10 / MTok |
| Relativ latens | Langsom | Middels | Rask |
| Thinking | Adaptive, alltid på | Adaptive | Adaptive |
| Standard effort | High | High | High |
| Pålitelig kunnskapsgrense | juni 2026 | mai 2026 | januar 2026 |
Dette «langsom»-nivået kommer fra Anthropic-modellkatalogen og angir en relativ latenskategori, ikke et fast antall token per sekund. Hvor lang tid en oppgave faktisk tar, avhenger også av effort, antall verktøykallsrunder, cache-treffrate, kontekstlengde og antall feilforsøk.
Full tabell over Fable 5.1s viktigste benchmarker
Tabellen nedenfor følger hovedtabellen fra Anthropics lanseringsside av 1. september 2026. For å unngå feiltolkning er prosentandeler, GDPval-AA-råskåren, OSWorlds partial/strict-resultater og HLEs resultater med/uten verktøy listet hver for seg. Hvert benchmark er oppført med sitt offisielle engelske navn, og på neste linje står det oversatte navnet; andre språkversjoner viser også den relevante oversettelsen under det engelske navnet.
| Evne | Benchmark | Fable 5.1 | Fable 5 | Opus 5 | GPT-5.6 Sol | 5.1 vs. Fable 5 |
|---|---|---|---|---|---|---|
| Agentbasert vitenskapelig forskning | Terminal-Bench-Science 0.1 Terminal-benchmark for agentbasert vitenskapelig forskning |
52.6% | 24.7% | 29.0% | 22.4% | +27.9 prosentpoeng |
| Agentbasert terminalprogrammering | Terminal-Bench 4.0 Benchmark for agentbasert terminalprogrammering |
55.8% | 42.0% | 52.3% | 37.3% | +13.8 prosentpoeng |
| Profesjonelt kunnskapsarbeid | GDPval-AA v2 Benchmark for profesjonelle oppgaver med reell økonomisk verdi |
1853 | 1723 | 1824 | 1711 | +130 poeng |
| Datamaskinoperasjoner | OSWorld 2.0 – Partial Benchmark for ekte datamaskinoperasjoner: delvis fullføringspoeng |
77.9% | 72.9% | 75.4% | — | +5.0 prosentpoeng |
| Datamaskinoperasjoner | OSWorld 2.0 – Strict Benchmark for ekte datamaskinoperasjoner: streng fullføringsgrad |
41.7% | 36.1% | 39.6% | — | +5.6 prosentpoeng |
| Tverrfaglig resonnering | Humanity's Last Exam – No tools Menneskehetens siste eksamen: uten verktøy |
60.9% | 57.8% | 56.6% | — | +3.1 prosentpoeng |
| Tverrfaglig resonnering | Humanity's Last Exam – With tools Menneskehetens siste eksamen: med verktøy |
65.0% | 63.8% | 63.6% | — | +1.2 prosentpoeng |
| Forretningsarbeidsflyter | AutomationBench Benchmark for forretningsautomatisering på tvers av applikasjoner |
31.4% | 17.1% | 26.9% | 19.6% | +14.3 prosentpoeng |
| Agentprogrammering | CursorBench 3.2.0 Benchmark for virkelige flerfilsoppgaver i programmering |
73.4% | 70.5% | 70.0% | 67.2% | +2.9 prosentpoeng |
— betyr at Anthropics hovedtabell ikke oppgir noen skåre for dette punktet, ikke at modellen ikke kan utføre oppgaven. I Terminal-Bench 4.0 får Mythos 5.1, som har færre begrensninger og kun er åpen for et betrodd program, 60.9%; denne artikkelen fokuserer på Fable 5.1 som er tilgjengelig for vanlige brukere, og blander ikke Mythos-resultatene inn i Fable-kolonnen.
Hva tester Terminal-Bench-Science 0.1?
Terminal-Bench-Science 0.1 inneholder 70 realistiske forskningsarbeidsflyter innen fem fagområder: livsvitenskap, fysikk, geovitenskap, matematikk og ingeniørvitenskap. Oppgavene er ikke flervalgsspørsmål; agenten må i terminalen gjennomføre dataanalyse, statistisk slutning, simulering, optimalisering, teorembevis, bilderekonstruksjon eller vitenskapelig maskinlæring, og resultatene kontrolleres med reproduserbare tester.
Fable 5.1 med 52.6% sammenlignet med Fable 5s 24.7% i offisielle gjentatte eksperimenter er en økning på 27.9 prosentpoeng – det klareste spranget i hele tabellen. Samtidig oppgir Anthropic en standardfeil på omtrent ±3.5–4.5 prosentpoeng for hver modell, så man bør ikke behandle første desimal som en absolutt presis rangering.
Hva tester Terminal-Bench 4.0 og CursorBench 3.2.0?
Terminal-Bench lar agenter håndtere komplekse oppgaver i et reelt terminalmiljø, med fokus på om de forstår miljøet, kaller verktøy, endrer filer og til slutt består verifisering. Fable 5.1 oppnår 55.8%, 13.8 prosentpoeng høyere enn Fable 5 og også høyere enn Opus 5s 52.3%.
CursorBench 3.2 består av vage, flerfilsoppgaver fra ekte Cursor-økter; versjon 3.2 har lagt til problemer om instruksjonsoppfølging og avansert verktøybruk. Fable 5.1 Max får 73.4%; ledelsen er ikke like dramatisk som i Terminal-Bench-Science, men modellen bruker i gjennomsnitt 72,060 token og koster $9.64 per oppgave, mot Fable 5 Max sine 103,525 token og $17.32. Det mest interessante her er reduksjonen i token- og kostnadsforbruk for samme type oppgave, ikke selve 2.9 prosentpoeng.
Hva måler GDPval-AA v2?
GDPval-AA v2 bruker 220 oppgaver utformet av bransjeprofesjonelle, fordelt på 44 yrker og 9 bransjer, for å vurdere modellens evne til å håndtere ekte kunnskapsarbeid med økonomisk verdi. Skåren 1853 er en samlet vurderingsskåre, ikke 1853%. Resultatet viser at Fable 5.1 er bedre enn Fable 5 på profesjonelle dokumenter, analyser og leveranser, og så vidt bedre enn Opus 5.
Hvorfor har OSWorld 2.0 to skårer?
OSWorld 2.0 inneholder 108 langvarige datamaskinoperasjonsarbeidsflyter; median tiden et menneske bruker på hver oppgave er omtrent 1.6 timer. Partial gir delvis fullføringspoeng basert på flere sjekkpunkter; Strict krever at målet nås fullstendig for at oppgaven skal regnes som vellykket.
At Fable 5.1 får 77.9% på Partial og 41.7% på Strict er altså ikke selvmotsigende: modellen fullfører ofte de fleste trinnene, men noen oppgaver blir likevel ikke fullført fra start til slutt. Det minner oss også på at en datamaskinagent som «ser ut til å holde på» ikke nødvendigvis betyr at oppgaven er løst.
Hva tester Humanity's Last Exam?
Humanity's Last Exam er laget av Center for AI Safety og Scale AI, og inneholder 2,500 tverrfaglige spørsmål på ekspertnivå som er vanskelige å besvare med enkelt oppslag. Fable 5.1 er 3.1 prosentpoeng bedre enn Fable 5 uten verktøy, men bare 1.2 prosentpoeng bedre når verktøy er tillatt. Den er riktignok sterkere, men ikke alle benchmarker viser en dobling.
Hva tester AutomationBench?
AutomationBench undersøker om en agent kan gjennomføre salgs-, markedsførings-, drifts-, kundestøtte-, økonomi- og HR-arbeidsflyter på tvers av simulerte SaaS-verktøy som CRM, e-post, kalender, meldinger og prosjektstyring. Fable 5.1 øker fra 17.1% til 31.4%, en relativ forbedring på omtrent 84%, noe som viser reelle fremskritt i administrasjon av tilstander på tvers av applikasjoner og utføring av lange operasjonssekvenser. Samtidig viser 31.4% at denne typen ubemannet forretningsautomatisering fortsatt er langt fra løst.
Hva er forbedret i Fable 5.1 sammenlignet med Fable 5?
1. Færre snarveier i langvarige oppgaver
Anthropic posisjonerer Fable 5.1 som en langvarig agentmodell: først planlegge, deretter bruke verktøy, gjenopprette etter feil, verifisere resultater og proaktivt rapportere fremdrift. Den vektlegger å fikse grunnårsaken fremfor å gjøre lokale omgåelser for raskest mulig å få en enkelt test til å bli grønn. De offisielt nevnte måloppgavene inkluderer funksjonalitet på tvers av kodebaser, kodegjennomgang, ytelsesoptimalisering, flerdagers autonome økter, forskning, dokumenter, regneark og presentasjoner.
2. Lav effort kan også nærme seg forrige generasjons kostbare resultater
Fable 5.1 har fått en ny evne til å justere effort per melding. De offisielle kostnadskurvene viser at Low- eller Medium-effort på enkelte oppgaver kan nå eller overgå Fable 5, samtidig som token- og kostnadsbruken reduseres. Claude Code bruker High effort som standard; Claude.ai og Cowork bruker Medium som standard. Når du sammenligner modeller, må du først bekrefte effort – du kan ikke sette resultater fra ulike nivåer side om side direkte.
3. Lesbar fremdrift mellom verktøykall
API-et har fått en ny testfunksjon, display: "updates", som lar modellen vise brukervennlige fremdriftsoppdateringer mellom verktøykall. For oppgaver som kjører i flere timer, er dette enklere enn bare å se verktøykort dukke opp om igjen, for å forstå hva modellen driver med og om den er på vei bort fra målet.
4. Mer fullstendig skriving, visuell verifisering og selvtesting
Anthropic sier at 5.1 aktivt skriver tester for å verifisere egne endringer og bruker visuelle evner til å sjekke utdataene mot designmålene. Partnernes tilbakemeldinger trekker også frem strammere fremdriftsrapportering, mer fullstendige svar på sammensatte spørsmål, sporing av kallrekker på tvers av flere tjenester, og at lesbarheten opprettholdes selv etter lang kjøretid. Dette er kvalitative tilbakemeldinger og bør ikke fremstilles som enhetlige benchmark-konklusjoner.
5. Mer presise sikkerhetsblokkeringer – men de er ikke borte
Fable 5.1 har omtrent 60% færre falske positiver i nettsikkerhetsvernet enn ved lanseringen av Fable 5, og frekvensen av nedgraderinger utløst av grunnleggende biologi- og medisinspørsmål er redusert med omtrent 85%. Modellen kan nå brukes til å finne sårbarheter i programvare, men dobbeltbruksoppgaver som penetrasjonstesting, generering av utnyttelseskode og skanning av binære sårbarheter kan fortsatt bli rutet til Opus. Når forespørsler blir rutet om, faktureres de ikke til Fable-pris.
6. Ny markering av innholdsopprinnelse
Fable 5.1 introduserer content provenance. Generert tekst kan bære et statistisk vannmerke som kan verifiseres med Anthropics verktøy for innholdskontroll. Det legges ikke til synlige markører i brødteksten, men for innholdsplattformer, utdanning og virksomhetsrevisjon er dette ny atferd man bør kjenne til på forhånd.
Hvordan beregnes kostnaden for Fable 5.1?
| Faktureringspost | Fable 5.1-pris | Sammenlignet med Fable 5 |
|---|---|---|
| Input | $10 / 1 million token | Samme |
| Output | $50 / 1 million token | Samme |
| 5-minutters cache-skriving | $12.50 / 1 million token | Samme sats |
| 1-times cache-skriving | $20 / 1 million token | Samme sats |
| Cache-lesing | $0.25 / 1 million token | Redusert med 75% |
| Batch API | 50% av input- og output-prisene | Etter Batch-reglene |
Anta at en lang oppgave totalt leser 10 millioner cache-token, produserer 200 000 nye input-token og 50 000 output-token, uten å ta hensyn til cache-skriving:
缓存读取:10 × $0.25 = $2.50
新输入:0.2 × $10 = $2.00
输出:0.05 × $50 = $2.50
合计:$7.00De samme 10 millionene med cache-avlesninger koster omtrent $10 på Fable 5, så bare denne posten utgjør en forskjell på $7.50. Anthropic anslår på dette grunnlaget at den faktiske kostnaden for typiske token-baserte oppgaver kan reduseres med omtrent 25%, og for svært agentifiserte oppgaver som gjenbruker lang kontekst hyppig, med opptil 45%. Dette er ikke en generell prissenkning i API-prislisten, men jo flere cache-treff, desto større besparelse.
Abonnenter får ikke nødvendigvis direkte glede av API-ets cache-prisreduksjon
Premium-seter i Max- og Team/Enterprise-planene kan bruke inntil 50% av den ukentlige kvoten på Fable-modeller; Pro og standardseter bruker derimot usage credits fra første stund. Den konkrete forbruksvisningen avgjøres av Usage-siden på kontoen din. Cache-prisreduksjonen gjelder først og fremst tokenbasert fakturering, så du kan ikke oversette API-ets 75% cache-rabatt direkte til «fire ganger så mye i Max-abonnementet».
Er Fable 5.1 egentlig rask?
Svaret er: én runde er tregere, men totaltiden for komplekse oppgaver kan bli kortere.
- Anthropics modellkatalog merker Fable 5.1 som
Slower, Opus 5 somModerateog Sonnet 5 somFast. - Claude Code bruker High effort som standard og bruker dermed naturlig mer resonneringstid enn Low eller Medium.
- Every sier på sin egen arbeidsmengde at Fable 5.1 er omtrent dobbelt så rask som Opus 5 og bruker halvparten så mange token; dette er en bestemt test fra en partner, ikke en generell hastighetsgaranti.
- I CursorBench bruker Fable 5.1 Max i snitt 70 trinn og 72,060 token; Fable 5 Max har også 72 trinn, men bruker 103,525 token. Fordelen med 5.1 ligner mer på «færre omveier og mindre token-bruk» enn på raskere første token.
Derfor: for chatting, korte kodeoppgaver og hyppige interaksjoner velger du Sonnet 5 eller Opus 5. Først for feilsøking på tvers av kodebaser, lang forskning og ubemannede oppgaver som krever egenverifisering bør du vurdere Fable 5.1.
Kompatibilitetsendringer du må håndtere før du oppgraderer til Fable 5.1
Claude Code må oppgraderes til minst 2.1.250
Anthropics dokumentasjon for planer og tilgjengelighet krever Claude Code 2.1.250 eller nyere. Hvis du ikke ser Fable 5.1, må du først sjekke:
claude --versionDeretter oppgraderer du etter den offisielle Claude Code-oppgraderingsprosedyren og starter økten på nytt. API-modell-ID-en for Fable 5.1 er:
claude-fable-5-1Forced tool use kan gi feilmelding
Hvis en forespørsel tvinger modellen til å kalle et bestemt verktøy, kan Fable 5.1 returnere en feil. Før du migrerer, bør du sjekke tool_choice og eventuelle tvungne verktøy-flyter i dine egne agenter – ikke anta at Fable 5s atferd er fullstendig kompatibel.
Thinking blocks kan ikke fritt gjenbrukes på tvers av modeller
Eldre modeller kan ikke lese Fable 5.1s thinking blocks. Når du bytter modell, bør du la SDK-en håndtere disse blokkene etter de offisielle reglene, i stedet for å sende dem uforandret til en annen modell.
Endring av gammel historikk kan gi 400
For nye API-kontoer opprettet etter 31. august 2026 er thinking blocks bare gyldige i det opprinnelige dialogprefikset de ble generert i. Hvis du endrer system, tools eller tidligere meldinger og deretter spiller av thinking blocks på nytt, kan du få 400. Anthropic anbefaler at historikken forblir append-only; hvis du må komprimere, erstatter du hele den gamle historikken med et nytt sammendrag – ikke endre gamle runder og samtidig beholde de opprinnelige thinking blocks. Se Fable 5.1-veiledningen for prompt- og migrering for detaljer.
Når bør du velge Fable 5.1
Passer for:
- lange oppgaver på tvers av flere repoer, tjenester eller applikasjoner;
- agenter som må kjøre i timevis og gjenopprette seg selv etter feil;
- vitenskapelig forskning, kompleks dataanalyse og flerfasede profesjonelle leveranser;
- vanskelig reproduserbare systemproblemer, ytelsesoptimalisering og grunnårsaksanalyse;
- API-arbeidslaster med mye gjenbruk av lang kontekst og høy andel cache-lesing.
Passer ikke for:
- enkel chat, korte tekster eller små endringer i én fil;
- sanntidsinteraksjoner som er svært følsomme for tid til første token;
- oppgaver med høyt output og fast budsjett, uten cache-gjenbruk;
- scenarioer som ikke kan akseptere standard 30 dagers oppbevaring av sikkerhetsovervåkingsdata, og som ikke oppfyller unntaksvilkårene for bedrifter;
- arbeidsflyter der du forventer at ingen nettsikkerhets- eller livsvitenskapsforespørsler utløser nedgradering.
Slik følger du lange oppgaver eksternt
Verdien av Fable 5.1 viser seg ofte i oppgaver som varer i flere timer eller dager, men det betyr ikke at du må sitte foran utviklingsmaskinen hele tiden. Først bekrefter du at Fable 5.1 er tilgjengelig i lokal Claude Code 2.1.250+, deretter kan du se Claude Code-øktene på den samme utviklingsmaskinen fra nettleseren, skrivebordet eller mobilen via PandaNpc Agent, håndtere interaksjoner og gi nye instrukser.
Det som endres her er kontrollinngangen; koden, verktøyene og byggene kjører fortsatt på din egen utviklingsmaskin. Du kan først lese Claude Code-veiledningen for ekstern tilgang og opplæringen for å koble mobilen til Claude Code, og deretter overlate lange oppgaver til Fable 5.1 når den eksterne koblingen er bekreftet.
Vanlige spørsmål (FAQ)
Hvor mye sterkere er Fable 5.1 enn Fable 5?
Forskjellen varierer mye mellom oppgaver. Terminal-Bench-Science er 27.9 prosentpoeng høyere og AutomationBench 14.3 prosentpoeng høyere; HLE er bare 1.2 prosentpoeng høyere med verktøy. Du kan ikke la én enkelt største økning representere alle oppgaver.
Er Fable 5.1 raskere enn Opus 5?
I den offisielle tabellen over relativ latens er Fable 5.1 «langsom» (Slower), mens Opus 5 er «middels» (Moderate). Noen partnere har observert at Fable 5.1 er raskere på hele oppgaver, fordi den bruker færre token og mindre omarbeiding. Disse to konklusjonene måler ikke det samme.
Er Fable 5.1 bedre enn GPT-5.6 Sol til programmering?
I Anthropics publiseringstabell scorer Fable 5.1 høyere på Terminal-Bench-Science, Terminal-Bench, AutomationBench og CursorBench; men ulike modeller bruker ulike agent-harnesjer (Agent harness), effort, verktøy og priser, så du kan ikke slutte ut fra dette at Fable vinner på alle virkelige repoer. Du kan se på oppsettveiledningen for GPT-5.6 Sol med 1M kontekst og deretter kjøre A/B-tester på dine egne representative oppgaver.
Hvorfor bytter Fable 5.1 plutselig til Opus?
Enkelte nettsikkerhets- og livsvitenskapsforespørsler blir rutet til Opus av safeguards. Et modellbytte er ikke nødvendigvis en feil; Anthropic sier at slike rutede forespørsler ikke faktureres til Fable-pris.
Har Fable 5.1 vannmerke?
Ja, det finnes en statistisk content provenance-mekanisme, men den legger ikke synlige etiketter på selve teksten. Den er ikke det samme som synlige vannmerker i hjørnet av bilder.
Oppsummering
De tydeligste fremskrittene i Claude Fable 5.1 ligger i vitenskapelig forskning, terminaloppgaver og forretningsarbeidsflyter på tvers av applikasjoner: modellen er bedre til å utføre kontinuerlig, gjenopprette etter feil og verifisere resultater, og den reduserer også kostnadene for lange oppgaver gjennom billigere cache-lesing. Likevel er prisen fortsatt høy, latensen per runde er tregere, og modellen fører med seg kompatibilitetsendringer rundt thinking blocks, tvungen verktøykall og redigering av historikk.
Det riktige spørsmålet for valget er ikke «er den først på benchmark-listen?», men: er oppgaven din lang og kompleks nok, og er kostnaden ved feil og omarbeiding høy nok til at Fable 5.1 er verdt det? Hvis svaret er nei, er det vanligvis bedre å starte med Opus 5 eller Sonnet 5.
Relaterte guider

Codex: Slik aktiverer du GPT-5.6 Sol 1M-kontekst med 3 linjer i `config.toml`
GPT-5.6 Sol støtter offisielt 105 000 token kontekst. Bare legg til 3 linjer med konfigurasjon øverst i Codex sin config.toml, så kan du kjøre med 1 million vindu, og den komprimerer historikken automatisk rundt 900 000 token. Vedlagt er permanent konfigurasjon, enkeltkommando, verifisering og kostnadspåminnelse.
Les artikkel →
Hvordan bruker du Claude Code Remote Control? Fjernkontroll fra mobil, offisielle begrensninger og alternativer (2026)
Hvordan aktiverer man Claude Code Remote Control? Denne artikkelen gir tre offisielle bruksmåter: claude remote-control, claude --remote-control og /remote-control. Den forklarer tilkobling mellom mobil og nettleser, kontokrav, verifiseringsmetoder og vanlige feilmeldinger, og sammenligner PandaNpc-løsningen for tilpassede modeller, Codex og flermaskin-scenarier.
Les artikkel →
Koble til Claude Code fra mobilen: Se sesjoner og godkjenn verktøy på iOS når som helst
Denne artikkelen er rettet mot utviklere og deler beste praksis for å koble til Claude Code fra mobilen. Via PandaNpc iOS-appen kan du se samtaler i sanntid, godkjenne verktøykall og svare på spørsmål. Med pandapaw og iOS Live Activity oppnår du effektiv fjernstyring og større kodingsfleksibilitet.
Les artikkel →