Claude Fable 5.1 – en fullständig genomgång: benchmark, förbättringar, pris och hastighet

Claude Fable 5.1:s fullständiga resultat på 7 huvudkategorier av benchmarks, jämförda punkt för punkt med Fable 5, Opus 5 och GPT-5.6 Sol, samt en förklaring av 5.1:s långa uppgifter, verktygsanrop, cacheavgifter, hastighet, abonnemangsbegränsningar och migreringsändringar.

PandaNpcFörsta publicering
Claude Fable 5.1 – en fullständig genomgång: benchmark, förbättringar, pris och hastighet

Claude Fable 5.1 lanserades officiellt den 1 september 2026. Vi börjar med slutsatsen: det är ingen vanlig modelluppgradering för allmänna frågor och svar, utan en högkostnadsflaggskeppsmodell för långvarig programmering, komplex forskning, verktygsanrop över appar och obevakade agenter. I de sju huvudkategorier av benchmark som Anthropic publicerat överträffar Fable 5.1 Fable 5 i samtliga; men API-priset per enhet är fortfarande dubbelt så högt som Opus 5:s, och officiellt anges den relativa latensen som ”långsammare”.

Om din uppgift bara handlar om att ändra en fil, skriva en kort text eller besvara vanliga frågor, rekommenderar Anthropic fortfarande att du börjar med Opus 5. Fable 5.1 passar bättre för långa kedjeuppgifter som vanliga modeller inte kan utföra tillförlitligt ens med hög effort. Den här artikeln samlar officiella lanseringsdata, vad de olika benchmarks innebär, de konkreta förbättringarna i 5.1, priser, hastighet och migreringsbegränsningar – så att man inte bara tittar på en enda ”vem vann”-poängtavla.

Se specifikationerna för Fable 5.1 i en enda tabell

Post Claude Fable 5.1 Claude Opus 5 Claude Sonnet 5
Kontextfönster 1M token 1M token 1M token
Maximal utdata 128K token 128K token 128K token
Inmatningspris $10 / MTok $5 / MTok $2 / MTok
Utmatningspris $50 / MTok $25 / MTok $10 / MTok
Relativ latens Långsammare Medel Snabb
Thinking Adaptive, alltid på Adaptive Adaptive
Förvald effort High High High
Kunskapsgräns juni 2026 maj 2026 januari 2026

”Långsammare” här kommer från Anthropics modellkatalog och anger en relativ latensnivå, inte ett fast antal token per sekund. Hur lång tid en uppgift faktiskt tar beror också på effort, antalet rundor med verktygsanrop, cacheträfffrekvens, kontextlängd och antalet återförsök efter fel.

Fable 5.1:s långvariga agentarbetsflöde från planering till verifiering
Fable 5.1 är inte till för engångssvar, utan för långa uppgifter med kontinuerlig planering, exekvering, återhämtning, verifiering och rapportering.

Komplett tabell över Fable 5.1:s viktigaste benchmarks

Tabellen nedan följer huvudtabellen på Anthropics releasesida från den 1 september 2026. För att undvika feltolkningar listas procentsatser, GDPval-AA:s råpoäng, OSWorlds partial/strict samt HLE:s resultat med/utan verktyg var för sig. Varje benchmark behåller sitt officiella engelska namn; på raden under anges den svenska översättningen.

Förmåga Benchmark Fable 5.1 Fable 5 Opus 5 GPT-5.6 Sol 5.1 jämfört med Fable 5
Agentisk vetenskaplig forskning Terminal-Bench-Science 0.1
Terminalbenchmark för agentisk vetenskaplig forskning
52,6 % 24,7 % 29,0 % 22,4 % +27,9 procentenheter
Agentisk terminalprogrammering Terminal-Bench 4.0
Benchmark för agentisk terminalprogrammering
55,8 % 42,0 % 52,3 % 37,3 % +13,8 procentenheter
Professionellt kunskapsarbete GDPval-AA v2
Benchmark för professionella uppgifter med verkligt ekonomiskt värde
1853 1723 1824 1711 +130 poäng
Datoranvändning OSWorld 2.0 – Partial
Benchmark för verklig datoranvändning: delpoäng för delvis slutförande
77,9 % 72,9 % 75,4 % — +5,0 procentenheter
Datoranvändning OSWorld 2.0 – Strict
Benchmark för verklig datoranvändning: strikt slutförandegrad
41,7 % 36,1 % 39,6 % — +5,6 procentenheter
Tvärvetenskapligt resonemang Humanity's Last Exam – No tools
Mänsklighetens sista prov: utan verktyg
60,9 % 57,8 % 56,6 % — +3,1 procentenheter
Tvärvetenskapligt resonemang Humanity's Last Exam – With tools
Mänsklighetens sista prov: med verktyg
65,0 % 63,8 % 63,6 % — +1,2 procentenheter
Affärsarbetsflöden AutomationBench
Benchmark för automatiserade affärsarbetsflöden över appar
31,4 % 17,1 % 26,9 % 19,6 % +14,3 procentenheter
Agentisk programmering CursorBench 3.2.0
Benchmark för verkliga flerfiliga programmeringsuppgifter
73,4 % 70,5 % 70,0 % 67,2 % +2,9 procentenheter

— betyder att Anthropics huvudtabell inte anger något resultat för just den modellen, inte att modellen inte klarar uppgiften. I Terminal-Bench 4.0 fick Mythos 5.1, som har färre begränsningar och bara är öppen för betrodda program, 60,9 %; den här artikeln fokuserar på Fable 5.1 som är tillgänglig för vanliga användare och blandar inte in Mythos resultat i Fable-kolumnen.

Vad mäter Terminal-Bench-Science 0.1?

Terminal-Bench-Science 0.1 innehåller 70 verkliga forskningsarbetsflöden inom livsvetenskap, fysikaliska vetenskaper, geovetenskap, matematik och ingenjörsvetenskap. Uppgifterna är inte flervalsfrågor: agenten ska i terminalen utföra dataanalys, statistisk inferens, simulering, optimering, teorembevis, bildrekonstruktion eller vetenskaplig maskininlärning och kontrollera resultaten med reproducerbara tester.

Fable 5.1:s 52,6 % jämfört med Fable 5:s 24,7 % i de officiella reproduktionsexperimenten innebär en förbättring på 27,9 procentenheter – det tydligaste språnget i hela tabellen. Men Anthropic anger samtidigt ett standardfel på ungefär ±3,5–4,5 procentenheter för varje modell, så man ska inte behandla en decimal som en absolut exakt rangordning.

Vad mäter Terminal-Bench 4.0 och CursorBench 3.2.0?

Terminal-Bench låter agenten hantera komplexa uppgifter i en verklig terminalmiljö; fokus ligger på om den kan förstå miljön, anropa verktyg, ändra filer och slutligen klara verifieringen. Fable 5.1 uppnår 55,8 %, vilket är 13,8 procentenheter högre än Fable 5 och även över Opus 5:s 52,3 %.

CursorBench 3.2 bygger på vaga flerfiliga uppgifter från verkliga Cursor-sessioner; version 3.2 har lagt till problem kring instruktionsföljning och avancerad verktygsanvändning. Fable 5.1 Max når 73,4 % – ledningen är inte lika dramatisk som i Terminal-Bench-Science, men den använder i genomsnitt 72 060 token per uppgift till en kostnad av $9.64; Fable 5 Max använder 103 525 token och kostar $17.32. Det som är mer värt att notera här är minskningen av token- och kostnadsförbrukning för samma typ av uppgift, snarare än själva ökningen på 2,9 procentenheter.

Vad mäter GDPval-AA v2?

GDPval-AA v2 använder 220 uppgifter utformade av branschexperter, fördelade över 44 yrken och 9 branscher, för att bedöma modellens förmåga att hantera verkligt kunskapsarbete med ekonomiskt värde. 1853 är en sammansatt poäng, inte 1853 %. Resultatet visar att Fable 5.1 överträffar Fable 5 på professionella dokument, analyser och leveranser, och ligger även något över Opus 5.

Varför har OSWorld 2.0 två poäng?

OSWorld 2.0 innehåller 108 långa datorarbetsflöden, där medianen för hur lång tid en människa behöver för att slutföra varje uppgift är cirka 1,6 timmar. Partial ger delpoäng utifrån flera kontrollpunkter; Strict räknar bara fullständig måluppfyllelse som framgång.

Fable 5.1:s 77,9 % partial och 41,7 % strict motsäger alltså inte varandra: den klarar ofta de flesta stegen, men en del uppgifter slutförs ändå inte hela vägen. Det påminner oss också om att en datoragent som ”ser ut att vara igång hela tiden” inte är detsamma som att uppgiften har lyckats.

Vad mäter Humanity's Last Exam?

Humanity's Last Exam skapades av Center for AI Safety och Scale AI och innehåller 2 500 tvärvetenskapliga frågor på expertnivå som är svåra att besvara med enkel informationssökning. Fable 5.1 är 3,1 procentenheter bättre än Fable 5 utan verktyg, men bara 1,2 procentenheter bättre när verktyg tillåts. Den är verkligen starkare, men det är inte alla benchmarks som uppvisar fördubblad förbättring.

Vad mäter AutomationBench?

AutomationBench testar om agenten klarar arbetsflöden inom försäljning, marknadsföring, drift, kundtjänst, ekonomi och HR över simulerade SaaS-verktyg som CRM, e-post, kalender, meddelanden och projektledning. Fable 5.1 har gått från 17,1 % till 31,4 %, en relativ förbättring på cirka 84 %, vilket visar att 5.1 gjort påtagliga framsteg när det gäller hantering av tillstånd över flera appar och exekvering av långa steg; men 31,4 % visar också att den här typen av obevakad affärsautomation fortfarande är långt ifrån löst.

Fable 5.1:s täckningsmatris över sju huvudbenchmarks
De sju riktmärkena täcker vetenskaplig forskning, terminalprogrammering, professionellt kunskapsarbete, datoranvändning, tvärvetenskapligt resonemang, affärsprocesser och flerfilig programmering.

Vad har Fable 5.1 förbättrat jämfört med Fable 5?

1. Färre genvägar vid långvariga uppgifter

Anthropic positionerar Fable 5.1 som en modell för långvariga agentuppgifter: först planering, sedan verktygsanvändning, återhämtning efter fel, verifiering av resultat och proaktiv rapportering av framsteg. Den lägger större vikt vid att åtgärda grundorsaken i stället för att göra lokala kringgåenden för att snabbt få ett enskilt test att bli grönt. Officiellt listade målsituationer omfattar funktionsutveckling över kodbaser, kodgranskning, prestandaoptimering, flerdagars autonoma sessioner, forskning, dokument, kalkylblad och presentationer.

2. Låg effort kan närma sig förra generationens högkostnadsresultat

Fable 5.1 har fått möjligheten att justera effort per meddelande. Officiella kostnadskurvor visar att Low eller Medium effort på vissa uppgifter kan nå eller överträffa Fable 5 samtidigt som token och kostnader minskar. Claude Code använder High effort som standard; Claude.ai och Cowork har Medium som standard. När du jämför modeller måste du först fastställa effort – resultat från olika nivåer kan inte ställas direkt mot varandra.

3. Läsbara framsteg mellan verktygsanrop

API:et har fått en ny testfunktion, display: "updates", som låter modellen ge användaren läsbara framstegsuppdateringar mellan verktygsanrop. För uppgifter som pågår i flera timmar är det lättare att bedöma vad den gör och om den avvikit från målet, jämfört med att bara se verktygskort dyka upp.

4. Mer komplett skrivande, visuell verifiering och självtestning

Officiellt uppges att 5.1 proaktivt skriver tester för att verifiera sina egna ändringar och använder visuella förmågor för att jämföra utdata med designmålen. Samarbetspartnernas omdömen handlar också om mer koncisa framsteg, mer fullständiga svar på flerdelade frågor, spårning av anropskedjor över flera tjänster samt bibehållen läsbarhet även efter långa körtider. Detta är kvalitativ återkoppling och ska inte framställas som enhetliga benchmarkslutsatser.

5. Mer träffsäkra säkerhetsblockeringar – men de finns kvar

Jämfört med lanseringen av Fable 5 har antalet falska positiva i Fable 5.1:s cybersäkerhetsskydd minskat med cirka 60 %, och grundläggande biologiska och medicinska frågor utlöser nedgradering cirka 85 % mer sällan. Den kan nu användas för att hitta programvarusårbarheter, men dual-use-uppgifter som penetrationstestning, generering av exploateringskod och sårbarhetsskanning av binärer kan fortfarande dirigeras om till Opus. Omdirigerade anrop debiteras inte enligt Fable-priserna.

6. Ny funktion för innehållsursprung

Fable 5.1 introducerar content provenance. Genererad text kan bära en statistisk vattenstämpel som kan verifieras med Anthropics verktyg för innehållskontroll. Det handlar inte om synliga markeringar i själva texten, men för innehållsplattformar, utbildning och företagsrevision är det ett nytt beteende man bör känna till i förväg.

Fable 5.1:s sex viktigaste förbättringar jämfört med föregångaren
Förändringarna i 5.1 rör långa uppgifter, effektivitet vid låg effort, framstegsrapportering, självverifiering, färre falska positiva och märkning av innehållsursprung.

Hur beräknas kostnaden för Fable 5.1?

Debiteringspost Fable 5.1-pris Jämfört med Fable 5
Inmatning $10 / 1 miljon token Samma
Utmatning $50 / 1 miljon token Samma
Cache-skrivning, 5 minuter $12.50 / 1 miljon token Samma nivå
Cache-skrivning, 1 timme $20 / 1 miljon token Samma nivå
Cacheläsning $0.25 / 1 miljon token 75 % lägre
Batch API 50 % av inmatnings- och utmatningspriset Enligt Batch-reglerna

Anta att en lång uppgift totalt läser 10 miljoner cache-token, genererar 200 000 nya inmatningstoken och 50 000 utmatningstoken, utan cache-skrivningar:

text
缓存读取:10 × $0.25 = $2.50
新输入:0.2 × $10 = $2.00
输出:0.05 × $50 = $2.50
合计:$7.00

Samma 10 miljoner cacheläsningar på Fable 5 kostar cirka $10 – redan på den här posten skiljer det $7.50. Anthropic uppskattar utifrån detta att den faktiska kostnaden för typiska tokenbaserade uppgifter kan minska med cirka 25 %, och för starkt agentdrivna uppgifter som ofta återanvänder långa kontexter med upp till cirka 45 %. Det är ingen generell prissänkning av API:ts listpriser, utan ju fler cacheträffar, desto större besparingar.

Prenumeranter får inte nödvändigtvis API:ts cachesänkning direkt

Max och premiumplatser för Team/Enterprise kan använda upp till 50 % av den veckovisa kvoten till Fable-modeller; Pro och standardplatser använder usage credits från början. Exakt förbrukning framgår av Usage-sidan på kontot. Prissänkningen på cacheläsning gäller främst tokenbaserade debiteringsscenarier – man kan inte direkt räkna om API:ts 75-procentiga cachesänkning till ”fyra gånger mer i Max-paketet”.

Fable 5.1:s kostnadsstruktur för inmatning, utmatning och cache
In- och utmatningspriserna för Fable 5.1 är oförändrade; den stora prissänkningen ligger i cacheläsning. Ju mer lång kontext återanvänds, desto större nytta.

Är Fable 5.1 verkligen snabb?

Svaret är: enskilda svar är långsammare, men den totala tiden för komplexa uppgifter kan bli kortare.

  • Anthropics modellkatalog anger Fable 5.1 som Slower, Opus 5 som Moderate och Sonnet 5 som Fast.
  • Claude Code har High effort som standard och använder därför naturligt mer resonemangstid än Low eller Medium.
  • Every uppger att Fable 5.1 i deras arbetsbelastningar är ungefär dubbelt så snabb som Opus 5 och förbrukar hälften så många token; det är en specifik mätning från en samarbetspartner, inte en allmän hastighetsgaranti.
  • I CursorBench tar Fable 5.1 Max i genomsnitt 70 steg och 72 060 token; Fable 5 Max tar också 72 steg men förbrukar 103 525 token. Fördelen med 5.1 är mer lik ”färre omvägar och färre token” och behöver inte visa sig som snabbare första token.

För chatt, kort kod och tät interaktion väljer man därför i första hand Sonnet 5 eller Opus 5. För felsökning över kodbaser, lång forskning och obevakade uppgifter som kräver egen verifiering kan man överväga Fable 5.1.

Kompatibilitetsändringar att hantera före uppgradering till Fable 5.1

Claude Code måste uppgraderas till minst 2.1.250

Anthropics dokumentation om abonnemang och tillgänglighet kräver Claude Code 2.1.250 eller senare. Om du inte ser Fable 5.1 börjar du med att kontrollera:

bash
claude --version

Uppdatera därefter på det sätt som Claude Code officiellt anger och starta om sessionen. API-modell-ID:t för Fable 5.1 är:

text
claude-fable-5-1

Forced tool use kan ge direkt fel

Om en begäran tvingar modellen att anropa ett visst verktyg kan Fable 5.1 returnera ett fel. Kontrollera tool_choice och hur din egen agent hanterar tvångsanrop av verktyg före migreringen; utgå inte från att Fable 5:s beteende är helt kompatibelt.

Thinking blocks kan inte återanvändas fritt mellan modeller

Äldre modeller kan inte läsa Fable 5.1:s thinking blocks. När du byter modell bör du låta SDK:n hantera blocken enligt de officiella reglerna i stället för att skicka in dem oförändrade till en annan modell.

Ändring av gammal historik kan ge 400

För nya API-konton som skapats efter den 31 augusti 2026 är thinking blocks bara giltiga i det ursprungliga konversationsprefix där de genererades. Ändrar du system, tools eller tidigare meddelanden och spelar sedan upp thinking blocks igen kan du få 400. Officiell rekommendation är att hålla historiken append-only: när du behöver komprimera ersätter du hela den gamla historiken med en ny sammanfattning – modifiera inte gamla meddelanderundor och behåll samtidigt ursprungliga thinking blocks. Detaljerade mönster finns i Fable 5.1:s prompt- och migreringsguide.

När bör du välja Fable 5.1?

Lämplig för:

  • Långa uppgifter över flera kodbaser, tjänster eller appar;
  • Agenter som ska köra i timmar och själva återhämta sig från fel;
  • Vetenskaplig forskning, komplex dataanalys och professionella leveranser i flera steg;
  • Svårreproducerbara systemproblem, prestandaoptimering och grundorsaksanalys;
  • API-arbetsbelastningar med omfattande återanvändning av lång kontext och hög andel cacheläsning.

Inte lämplig för:

  • Enkel chatt, korta texter eller små ändringar i en enda fil;
  • Realtidsinteraktioner som är mycket känsliga för tiden till första token;
  • Uppgifter med hög utmatning, fast budget och ingen cacheåteranvändning;
  • Scenarier där standardlagringen av säkerhetsövervakningsdata i 30 dagar inte är acceptabel och där man inte heller omfattas av företagsundantagen;
  • Arbetsflöden där man vill att alla cybersäkerhets- eller livsvetenskapsförfrågningar ska gå igenom utan nedgradering.

Så övervakar du långa uppgifter på distans

Fable 5.1:s värde märks ofta i uppgifter som pågår i timmar eller till och med flera dagar, men det betyder inte att du måste sitta kvar vid utvecklingsdatorn. Bekräfta först att Fable 5.1 är tillgänglig i Claude Code 2.1.250+ på den egna datorn. Följ sedan Claude Code-sessionerna på samma utvecklingsdator via PandaNpc Agent från webbläsaren, datorn eller mobilen, hantera interaktioner och fortsätt ge instruktioner.

Det som ändras är kontrollpunkten – kod, verktyg och byggen körs fortfarande på din utvecklingsdator. Du kan först läsa guiden om fjärrstyrning av Claude Code och självstudien om att använda Claude Code från mobilen. Låt Fable 5.1 köra långa uppgifter först när du har bekräftat att fjärrlänken fungerar.

Vanliga frågor (FAQ)

Hur mycket bättre är Fable 5.1 än Fable 5?

Skillnaderna varierar kraftigt mellan uppgifter. Terminal-Bench-Science förbättrades med 27,9 procentenheter, AutomationBench med 14,3 procentenheter; med verktyg förbättrades HLE bara med 1,2 procentenheter. Ett enda maximalt lyft kan inte representera alla uppgifter.

Är Fable 5.1 snabbare än Opus 5?

I den officiella relativa latenstabellen är Fable 5.1 ”långsammare” och Opus 5 ”medel”. Vissa samarbetspartners har observerat att Fable 5.1 är snabbare på hela uppgifter eftersom den använder färre token och kräver mindre omarbetning. De två slutsatserna mäter olika saker.

Är Fable 5.1 bättre för programmering än GPT-5.6 Sol?

I Anthropics releasedata ligger Fable 5.1 högre på Terminal-Bench-Science, Terminal-Bench, AutomationBench och CursorBench. Men olika modeller använder olika agent-harness, effort, verktyg och priser, så man kan inte av detta dra slutsatsen att Fable vinner på alla verkliga kodbaser. Du kan utgå från självstudien om GPT-5.6 Sol med 1M-kontext och sedan göra egna A/B-tester med representativa uppgifter.

Varför växlar Fable 5.1 plötsligt till Opus?

Vissa cybersäkerhets- och livsvetenskapsförfrågningar dirigeras av safeguards till Opus. Ett modellbyte är inte nödvändigtvis ett fel; Anthropic uppger att sådana omdirigerade förfrågningar inte debiteras enligt Fable-priserna.

Har Fable 5.1 vattenstämpel?

Den har en statistisk mekanism för content provenance, men den sätter inga synliga etiketter på själva texten. Det är inte samma sak som en synlig vattenstämpel i hörnet av en bild.

Sammanfattning

De tydligaste framstegen i Claude Fable 5.1 finns inom vetenskaplig forskning, terminaluppgifter och affärsarbetsflöden över appar: den är bättre på att fortsätta exekvera, återhämta sig från fel och verifiera resultat, och den sänker kostnaderna för långa uppgifter genom billigare cacheläsning. Men den är fortfarande dyr, har långsammare svar per omgång och för med sig kompatibilitetsändringar kring thinking blocks, tvångsanrop av verktyg och redigering av historik.

Den rätta frågan när du väljer är inte ”ligger den först på benchmarklistan?”, utan: är din uppgift tillräckligt lång och komplex, och väger kostnaden för misslyckanden och omarbetning så tungt att det lönar sig med Fable 5.1? Om svaret är nej är det oftast bättre att börja med Opus 5 eller Sonnet 5.