Claude Fable 5.1 – en fullständig genomgång: benchmark, förbättringar, pris och hastighet
Claude Fable 5.1:s fullständiga resultat på 7 huvudkategorier av benchmarks, jämförda punkt för punkt med Fable 5, Opus 5 och GPT-5.6 Sol, samt en förklaring av 5.1:s långa uppgifter, verktygsanrop, cacheavgifter, hastighet, abonnemangsbegränsningar och migreringsändringar.

Claude Fable 5.1 lanserades officiellt den 1 september 2026. Vi börjar med slutsatsen: det är ingen vanlig modelluppgradering för allmänna frågor och svar, utan en högkostnadsflaggskeppsmodell för långvarig programmering, komplex forskning, verktygsanrop över appar och obevakade agenter. I de sju huvudkategorier av benchmark som Anthropic publicerat överträffar Fable 5.1 Fable 5 i samtliga; men API-priset per enhet är fortfarande dubbelt så högt som Opus 5:s, och officiellt anges den relativa latensen som ”långsammare”.
Om din uppgift bara handlar om att ändra en fil, skriva en kort text eller besvara vanliga frågor, rekommenderar Anthropic fortfarande att du börjar med Opus 5. Fable 5.1 passar bättre för långa kedjeuppgifter som vanliga modeller inte kan utföra tillförlitligt ens med hög effort. Den här artikeln samlar officiella lanseringsdata, vad de olika benchmarks innebär, de konkreta förbättringarna i 5.1, priser, hastighet och migreringsbegränsningar – så att man inte bara tittar på en enda ”vem vann”-poängtavla.
Se specifikationerna för Fable 5.1 i en enda tabell
| Post | Claude Fable 5.1 | Claude Opus 5 | Claude Sonnet 5 |
|---|---|---|---|
| Kontextfönster | 1M token | 1M token | 1M token |
| Maximal utdata | 128K token | 128K token | 128K token |
| Inmatningspris | $10 / MTok | $5 / MTok | $2 / MTok |
| Utmatningspris | $50 / MTok | $25 / MTok | $10 / MTok |
| Relativ latens | Långsammare | Medel | Snabb |
| Thinking | Adaptive, alltid på | Adaptive | Adaptive |
| Förvald effort | High | High | High |
| Kunskapsgräns | juni 2026 | maj 2026 | januari 2026 |
”Långsammare” här kommer från Anthropics modellkatalog och anger en relativ latensnivå, inte ett fast antal token per sekund. Hur lång tid en uppgift faktiskt tar beror också på effort, antalet rundor med verktygsanrop, cacheträfffrekvens, kontextlängd och antalet återförsök efter fel.
Komplett tabell över Fable 5.1:s viktigaste benchmarks
Tabellen nedan följer huvudtabellen på Anthropics releasesida från den 1 september 2026. För att undvika feltolkningar listas procentsatser, GDPval-AA:s råpoäng, OSWorlds partial/strict samt HLE:s resultat med/utan verktyg var för sig. Varje benchmark behåller sitt officiella engelska namn; på raden under anges den svenska översättningen.
| Förmåga | Benchmark | Fable 5.1 | Fable 5 | Opus 5 | GPT-5.6 Sol | 5.1 jämfört med Fable 5 |
|---|---|---|---|---|---|---|
| Agentisk vetenskaplig forskning | Terminal-Bench-Science 0.1 Terminalbenchmark för agentisk vetenskaplig forskning |
52,6 % | 24,7 % | 29,0 % | 22,4 % | +27,9 procentenheter |
| Agentisk terminalprogrammering | Terminal-Bench 4.0 Benchmark för agentisk terminalprogrammering |
55,8 % | 42,0 % | 52,3 % | 37,3 % | +13,8 procentenheter |
| Professionellt kunskapsarbete | GDPval-AA v2 Benchmark för professionella uppgifter med verkligt ekonomiskt värde |
1853 | 1723 | 1824 | 1711 | +130 poäng |
| Datoranvändning | OSWorld 2.0 – Partial Benchmark för verklig datoranvändning: delpoäng för delvis slutförande |
77,9 % | 72,9 % | 75,4 % | — | +5,0 procentenheter |
| Datoranvändning | OSWorld 2.0 – Strict Benchmark för verklig datoranvändning: strikt slutförandegrad |
41,7 % | 36,1 % | 39,6 % | — | +5,6 procentenheter |
| Tvärvetenskapligt resonemang | Humanity's Last Exam – No tools Mänsklighetens sista prov: utan verktyg |
60,9 % | 57,8 % | 56,6 % | — | +3,1 procentenheter |
| Tvärvetenskapligt resonemang | Humanity's Last Exam – With tools Mänsklighetens sista prov: med verktyg |
65,0 % | 63,8 % | 63,6 % | — | +1,2 procentenheter |
| Affärsarbetsflöden | AutomationBench Benchmark för automatiserade affärsarbetsflöden över appar |
31,4 % | 17,1 % | 26,9 % | 19,6 % | +14,3 procentenheter |
| Agentisk programmering | CursorBench 3.2.0 Benchmark för verkliga flerfiliga programmeringsuppgifter |
73,4 % | 70,5 % | 70,0 % | 67,2 % | +2,9 procentenheter |
— betyder att Anthropics huvudtabell inte anger något resultat för just den modellen, inte att modellen inte klarar uppgiften. I Terminal-Bench 4.0 fick Mythos 5.1, som har färre begränsningar och bara är öppen för betrodda program, 60,9 %; den här artikeln fokuserar på Fable 5.1 som är tillgänglig för vanliga användare och blandar inte in Mythos resultat i Fable-kolumnen.
Vad mäter Terminal-Bench-Science 0.1?
Terminal-Bench-Science 0.1 innehåller 70 verkliga forskningsarbetsflöden inom livsvetenskap, fysikaliska vetenskaper, geovetenskap, matematik och ingenjörsvetenskap. Uppgifterna är inte flervalsfrågor: agenten ska i terminalen utföra dataanalys, statistisk inferens, simulering, optimering, teorembevis, bildrekonstruktion eller vetenskaplig maskininlärning och kontrollera resultaten med reproducerbara tester.
Fable 5.1:s 52,6 % jämfört med Fable 5:s 24,7 % i de officiella reproduktionsexperimenten innebär en förbättring på 27,9 procentenheter – det tydligaste språnget i hela tabellen. Men Anthropic anger samtidigt ett standardfel på ungefär ±3,5–4,5 procentenheter för varje modell, så man ska inte behandla en decimal som en absolut exakt rangordning.
Vad mäter Terminal-Bench 4.0 och CursorBench 3.2.0?
Terminal-Bench låter agenten hantera komplexa uppgifter i en verklig terminalmiljö; fokus ligger på om den kan förstå miljön, anropa verktyg, ändra filer och slutligen klara verifieringen. Fable 5.1 uppnår 55,8 %, vilket är 13,8 procentenheter högre än Fable 5 och även över Opus 5:s 52,3 %.
CursorBench 3.2 bygger på vaga flerfiliga uppgifter från verkliga Cursor-sessioner; version 3.2 har lagt till problem kring instruktionsföljning och avancerad verktygsanvändning. Fable 5.1 Max når 73,4 % – ledningen är inte lika dramatisk som i Terminal-Bench-Science, men den använder i genomsnitt 72 060 token per uppgift till en kostnad av $9.64; Fable 5 Max använder 103 525 token och kostar $17.32. Det som är mer värt att notera här är minskningen av token- och kostnadsförbrukning för samma typ av uppgift, snarare än själva ökningen på 2,9 procentenheter.
Vad mäter GDPval-AA v2?
GDPval-AA v2 använder 220 uppgifter utformade av branschexperter, fördelade över 44 yrken och 9 branscher, för att bedöma modellens förmåga att hantera verkligt kunskapsarbete med ekonomiskt värde. 1853 är en sammansatt poäng, inte 1853 %. Resultatet visar att Fable 5.1 överträffar Fable 5 på professionella dokument, analyser och leveranser, och ligger även något över Opus 5.
Varför har OSWorld 2.0 två poäng?
OSWorld 2.0 innehåller 108 långa datorarbetsflöden, där medianen för hur lång tid en människa behöver för att slutföra varje uppgift är cirka 1,6 timmar. Partial ger delpoäng utifrån flera kontrollpunkter; Strict räknar bara fullständig måluppfyllelse som framgång.
Fable 5.1:s 77,9 % partial och 41,7 % strict motsäger alltså inte varandra: den klarar ofta de flesta stegen, men en del uppgifter slutförs ändå inte hela vägen. Det påminner oss också om att en datoragent som ”ser ut att vara igång hela tiden” inte är detsamma som att uppgiften har lyckats.
Vad mäter Humanity's Last Exam?
Humanity's Last Exam skapades av Center for AI Safety och Scale AI och innehåller 2 500 tvärvetenskapliga frågor på expertnivå som är svåra att besvara med enkel informationssökning. Fable 5.1 är 3,1 procentenheter bättre än Fable 5 utan verktyg, men bara 1,2 procentenheter bättre när verktyg tillåts. Den är verkligen starkare, men det är inte alla benchmarks som uppvisar fördubblad förbättring.
Vad mäter AutomationBench?
AutomationBench testar om agenten klarar arbetsflöden inom försäljning, marknadsföring, drift, kundtjänst, ekonomi och HR över simulerade SaaS-verktyg som CRM, e-post, kalender, meddelanden och projektledning. Fable 5.1 har gått från 17,1 % till 31,4 %, en relativ förbättring på cirka 84 %, vilket visar att 5.1 gjort påtagliga framsteg när det gäller hantering av tillstånd över flera appar och exekvering av långa steg; men 31,4 % visar också att den här typen av obevakad affärsautomation fortfarande är långt ifrån löst.
Vad har Fable 5.1 förbättrat jämfört med Fable 5?
1. Färre genvägar vid långvariga uppgifter
Anthropic positionerar Fable 5.1 som en modell för långvariga agentuppgifter: först planering, sedan verktygsanvändning, återhämtning efter fel, verifiering av resultat och proaktiv rapportering av framsteg. Den lägger större vikt vid att åtgärda grundorsaken i stället för att göra lokala kringgåenden för att snabbt få ett enskilt test att bli grönt. Officiellt listade målsituationer omfattar funktionsutveckling över kodbaser, kodgranskning, prestandaoptimering, flerdagars autonoma sessioner, forskning, dokument, kalkylblad och presentationer.
2. Låg effort kan närma sig förra generationens högkostnadsresultat
Fable 5.1 har fått möjligheten att justera effort per meddelande. Officiella kostnadskurvor visar att Low eller Medium effort på vissa uppgifter kan nå eller överträffa Fable 5 samtidigt som token och kostnader minskar. Claude Code använder High effort som standard; Claude.ai och Cowork har Medium som standard. När du jämför modeller måste du först fastställa effort – resultat från olika nivåer kan inte ställas direkt mot varandra.
3. Läsbara framsteg mellan verktygsanrop
API:et har fått en ny testfunktion, display: "updates", som låter modellen ge användaren läsbara framstegsuppdateringar mellan verktygsanrop. För uppgifter som pågår i flera timmar är det lättare att bedöma vad den gör och om den avvikit från målet, jämfört med att bara se verktygskort dyka upp.
4. Mer komplett skrivande, visuell verifiering och självtestning
Officiellt uppges att 5.1 proaktivt skriver tester för att verifiera sina egna ändringar och använder visuella förmågor för att jämföra utdata med designmålen. Samarbetspartnernas omdömen handlar också om mer koncisa framsteg, mer fullständiga svar på flerdelade frågor, spårning av anropskedjor över flera tjänster samt bibehållen läsbarhet även efter långa körtider. Detta är kvalitativ återkoppling och ska inte framställas som enhetliga benchmarkslutsatser.
5. Mer träffsäkra säkerhetsblockeringar – men de finns kvar
Jämfört med lanseringen av Fable 5 har antalet falska positiva i Fable 5.1:s cybersäkerhetsskydd minskat med cirka 60 %, och grundläggande biologiska och medicinska frågor utlöser nedgradering cirka 85 % mer sällan. Den kan nu användas för att hitta programvarusårbarheter, men dual-use-uppgifter som penetrationstestning, generering av exploateringskod och sårbarhetsskanning av binärer kan fortfarande dirigeras om till Opus. Omdirigerade anrop debiteras inte enligt Fable-priserna.
6. Ny funktion för innehållsursprung
Fable 5.1 introducerar content provenance. Genererad text kan bära en statistisk vattenstämpel som kan verifieras med Anthropics verktyg för innehållskontroll. Det handlar inte om synliga markeringar i själva texten, men för innehållsplattformar, utbildning och företagsrevision är det ett nytt beteende man bör känna till i förväg.
Hur beräknas kostnaden för Fable 5.1?
| Debiteringspost | Fable 5.1-pris | Jämfört med Fable 5 |
|---|---|---|
| Inmatning | $10 / 1 miljon token | Samma |
| Utmatning | $50 / 1 miljon token | Samma |
| Cache-skrivning, 5 minuter | $12.50 / 1 miljon token | Samma nivå |
| Cache-skrivning, 1 timme | $20 / 1 miljon token | Samma nivå |
| Cacheläsning | $0.25 / 1 miljon token | 75 % lägre |
| Batch API | 50 % av inmatnings- och utmatningspriset | Enligt Batch-reglerna |
Anta att en lång uppgift totalt läser 10 miljoner cache-token, genererar 200 000 nya inmatningstoken och 50 000 utmatningstoken, utan cache-skrivningar:
缓存读取:10 × $0.25 = $2.50
新输入:0.2 × $10 = $2.00
输出:0.05 × $50 = $2.50
合计:$7.00Samma 10 miljoner cacheläsningar på Fable 5 kostar cirka $10 – redan på den här posten skiljer det $7.50. Anthropic uppskattar utifrån detta att den faktiska kostnaden för typiska tokenbaserade uppgifter kan minska med cirka 25 %, och för starkt agentdrivna uppgifter som ofta återanvänder långa kontexter med upp till cirka 45 %. Det är ingen generell prissänkning av API:ts listpriser, utan ju fler cacheträffar, desto större besparingar.
Prenumeranter får inte nödvändigtvis API:ts cachesänkning direkt
Max och premiumplatser för Team/Enterprise kan använda upp till 50 % av den veckovisa kvoten till Fable-modeller; Pro och standardplatser använder usage credits från början. Exakt förbrukning framgår av Usage-sidan på kontot. Prissänkningen på cacheläsning gäller främst tokenbaserade debiteringsscenarier – man kan inte direkt räkna om API:ts 75-procentiga cachesänkning till ”fyra gånger mer i Max-paketet”.
Är Fable 5.1 verkligen snabb?
Svaret är: enskilda svar är långsammare, men den totala tiden för komplexa uppgifter kan bli kortare.
- Anthropics modellkatalog anger Fable 5.1 som
Slower, Opus 5 somModerateoch Sonnet 5 somFast. - Claude Code har High effort som standard och använder därför naturligt mer resonemangstid än Low eller Medium.
- Every uppger att Fable 5.1 i deras arbetsbelastningar är ungefär dubbelt så snabb som Opus 5 och förbrukar hälften så många token; det är en specifik mätning från en samarbetspartner, inte en allmän hastighetsgaranti.
- I CursorBench tar Fable 5.1 Max i genomsnitt 70 steg och 72 060 token; Fable 5 Max tar också 72 steg men förbrukar 103 525 token. Fördelen med 5.1 är mer lik ”färre omvägar och färre token” och behöver inte visa sig som snabbare första token.
För chatt, kort kod och tät interaktion väljer man därför i första hand Sonnet 5 eller Opus 5. För felsökning över kodbaser, lång forskning och obevakade uppgifter som kräver egen verifiering kan man överväga Fable 5.1.
Kompatibilitetsändringar att hantera före uppgradering till Fable 5.1
Claude Code måste uppgraderas till minst 2.1.250
Anthropics dokumentation om abonnemang och tillgänglighet kräver Claude Code 2.1.250 eller senare. Om du inte ser Fable 5.1 börjar du med att kontrollera:
claude --versionUppdatera därefter på det sätt som Claude Code officiellt anger och starta om sessionen. API-modell-ID:t för Fable 5.1 är:
claude-fable-5-1Forced tool use kan ge direkt fel
Om en begäran tvingar modellen att anropa ett visst verktyg kan Fable 5.1 returnera ett fel. Kontrollera tool_choice och hur din egen agent hanterar tvångsanrop av verktyg före migreringen; utgå inte från att Fable 5:s beteende är helt kompatibelt.
Thinking blocks kan inte återanvändas fritt mellan modeller
Äldre modeller kan inte läsa Fable 5.1:s thinking blocks. När du byter modell bör du låta SDK:n hantera blocken enligt de officiella reglerna i stället för att skicka in dem oförändrade till en annan modell.
Ändring av gammal historik kan ge 400
För nya API-konton som skapats efter den 31 augusti 2026 är thinking blocks bara giltiga i det ursprungliga konversationsprefix där de genererades. Ändrar du system, tools eller tidigare meddelanden och spelar sedan upp thinking blocks igen kan du få 400. Officiell rekommendation är att hålla historiken append-only: när du behöver komprimera ersätter du hela den gamla historiken med en ny sammanfattning – modifiera inte gamla meddelanderundor och behåll samtidigt ursprungliga thinking blocks. Detaljerade mönster finns i Fable 5.1:s prompt- och migreringsguide.
När bör du välja Fable 5.1?
Lämplig för:
- Långa uppgifter över flera kodbaser, tjänster eller appar;
- Agenter som ska köra i timmar och själva återhämta sig från fel;
- Vetenskaplig forskning, komplex dataanalys och professionella leveranser i flera steg;
- Svårreproducerbara systemproblem, prestandaoptimering och grundorsaksanalys;
- API-arbetsbelastningar med omfattande återanvändning av lång kontext och hög andel cacheläsning.
Inte lämplig för:
- Enkel chatt, korta texter eller små ändringar i en enda fil;
- Realtidsinteraktioner som är mycket känsliga för tiden till första token;
- Uppgifter med hög utmatning, fast budget och ingen cacheåteranvändning;
- Scenarier där standardlagringen av säkerhetsövervakningsdata i 30 dagar inte är acceptabel och där man inte heller omfattas av företagsundantagen;
- Arbetsflöden där man vill att alla cybersäkerhets- eller livsvetenskapsförfrågningar ska gå igenom utan nedgradering.
Så övervakar du långa uppgifter på distans
Fable 5.1:s värde märks ofta i uppgifter som pågår i timmar eller till och med flera dagar, men det betyder inte att du måste sitta kvar vid utvecklingsdatorn. Bekräfta först att Fable 5.1 är tillgänglig i Claude Code 2.1.250+ på den egna datorn. Följ sedan Claude Code-sessionerna på samma utvecklingsdator via PandaNpc Agent från webbläsaren, datorn eller mobilen, hantera interaktioner och fortsätt ge instruktioner.
Det som ändras är kontrollpunkten – kod, verktyg och byggen körs fortfarande på din utvecklingsdator. Du kan först läsa guiden om fjärrstyrning av Claude Code och självstudien om att använda Claude Code från mobilen. Låt Fable 5.1 köra långa uppgifter först när du har bekräftat att fjärrlänken fungerar.
Vanliga frågor (FAQ)
Hur mycket bättre är Fable 5.1 än Fable 5?
Skillnaderna varierar kraftigt mellan uppgifter. Terminal-Bench-Science förbättrades med 27,9 procentenheter, AutomationBench med 14,3 procentenheter; med verktyg förbättrades HLE bara med 1,2 procentenheter. Ett enda maximalt lyft kan inte representera alla uppgifter.
Är Fable 5.1 snabbare än Opus 5?
I den officiella relativa latenstabellen är Fable 5.1 ”långsammare” och Opus 5 ”medel”. Vissa samarbetspartners har observerat att Fable 5.1 är snabbare på hela uppgifter eftersom den använder färre token och kräver mindre omarbetning. De två slutsatserna mäter olika saker.
Är Fable 5.1 bättre för programmering än GPT-5.6 Sol?
I Anthropics releasedata ligger Fable 5.1 högre på Terminal-Bench-Science, Terminal-Bench, AutomationBench och CursorBench. Men olika modeller använder olika agent-harness, effort, verktyg och priser, så man kan inte av detta dra slutsatsen att Fable vinner på alla verkliga kodbaser. Du kan utgå från självstudien om GPT-5.6 Sol med 1M-kontext och sedan göra egna A/B-tester med representativa uppgifter.
Varför växlar Fable 5.1 plötsligt till Opus?
Vissa cybersäkerhets- och livsvetenskapsförfrågningar dirigeras av safeguards till Opus. Ett modellbyte är inte nödvändigtvis ett fel; Anthropic uppger att sådana omdirigerade förfrågningar inte debiteras enligt Fable-priserna.
Har Fable 5.1 vattenstämpel?
Den har en statistisk mekanism för content provenance, men den sätter inga synliga etiketter på själva texten. Det är inte samma sak som en synlig vattenstämpel i hörnet av en bild.
Sammanfattning
De tydligaste framstegen i Claude Fable 5.1 finns inom vetenskaplig forskning, terminaluppgifter och affärsarbetsflöden över appar: den är bättre på att fortsätta exekvera, återhämta sig från fel och verifiera resultat, och den sänker kostnaderna för långa uppgifter genom billigare cacheläsning. Men den är fortfarande dyr, har långsammare svar per omgång och för med sig kompatibilitetsändringar kring thinking blocks, tvångsanrop av verktyg och redigering av historik.
Den rätta frågan när du väljer är inte ”ligger den först på benchmarklistan?”, utan: är din uppgift tillräckligt lång och komplex, och väger kostnaden för misslyckanden och omarbetning så tungt att det lönar sig med Fable 5.1? Om svaret är nej är det oftast bättre att börja med Opus 5 eller Sonnet 5.
Relaterade guider

Codex aktiverar GPT-5.6 Sol 1M-kontext: handledning med 3 rader i `config.toml`
GPT-5.6 Sol stödjer officiellt 1,05 miljoner token kontext. Lägg bara till 3 rader konfiguration överst i Codex config.toml, så kan den köras med ett fönster på 1 miljon och automatiskt komprimera historiken vid cirka 900 000 token. Inkluderar permanent konfiguration, engångskommando, verifiering och kostnadspåminnelse.
Läs artikel →
Hur använder man Claude Code Remote Control? Fjärrstyrning från mobil, officiella begränsningar och alternativ (2026)
Hur aktiverar man Claude Code-fjärrstyrning? Den här artikeln ger tre officiella användningssätt: claude remote-control, claude --remote-control och /remote-control, förklarar mobil- och webbläsaranslutning, kontokrav, verifieringsmetoder och vanliga fel, och jämför PandaNpc-lösningar för anpassade modeller, Codex och flermaskinsscenarier.
Läs artikel →
Anslut Claude Code från mobilen: se sessioner och godkännanden när som helst på iOS
Denna artikel riktar sig till utvecklare och delar bästa praxis för att ansluta till Claude Code från mobilen. Genom PandaNpc iOS-appen kan du se konversationer i realtid, godkänna verktygsanrop och svara på frågor. Med pandapaw och iOS Live Activity kan du fjärrstyra effektivt och öka kodningsflexibiliteten.
Läs artikel →