Claude Fable 5.1: Kompletní analýza benchmarků, vylepšení, ceny a rychlosti

Kompletní výsledky Claude Fable 5.1 v 7 kategoriích hlavních benchmarků, srovnání jednotlivých položek s Fable 5, Opus 5 a GPT-5.6 Sol, a vysvětlení dlouhých úloh, volání nástrojů, nákladů na cache, rychlosti, omezení tarifů a migračních změn verze 5.1.

PandaNpcPoprvé publikováno
Claude Fable 5.1: Kompletní analýza benchmarků, vylepšení, ceny a rychlosti

Claude Fable 5.1 byl oficiálně vydán 1. září 2026. Řeknu to rovnou: nejde o běžný upgrade modelu pro běžné dotazy a odpovědi, ale o nákladný vlajkový model určený pro dlouhé programování, komplexní výzkum, volání nástrojů napříč aplikacemi a agenty pracující bez dozoru. Ve všech 7 kategoriích hlavních benchmarků zveřejněných společností Anthropic překonal Fable 5.1 model Fable 5. Jeho cena za API je ale stále dvojnásobná oproti modelu Opus 5 a oficiálně je relativní latence označena jako „pomalejší“.

Pokud je vaším úkolem jen upravit jeden soubor, napsat krátký text nebo odpovědět na běžný dotaz, Anthropic stále doporučuje začít s modelem Opus 5. Fable 5.1 je vhodnější pro dlouhé vícekrokové úlohy, které běžné modely ani při vysokém effort nedokážou spolehlivě dokončit. Tento článek dává dohromady oficiální data k vydání, význam jednotlivých benchmarků, konkrétní vylepšení verze 5.1, ceny, rychlost a omezení při migraci, abyste se nedívali jen na jednu tabulku „kdo vyhrál“.

Specifikace Fable 5.1 na první pohled

Parametr Claude Fable 5.1 Claude Opus 5 Claude Sonnet 5
Kontextové okno 1M tokenů 1M tokenů 1M tokenů
Maximální výstup 128K tokenů 128K tokenů 128K tokenů
Cena za vstup $10 / MTok $5 / MTok $2 / MTok
Cena za výstup $50 / MTok $25 / MTok $10 / MTok
Relativní latence Pomalejší Střední Rychlá
Thinking Adaptive, vždy zapnutý Adaptive Adaptive
Výchozí effort High High High
Hranice spolehlivých znalostí červen 2026 květen 2026 leden 2026

„Pomalejší“ zde pochází z katalogu modelů Anthropic a označuje úroveň relativní latence, nikoli pevný počet tokenů za sekundu. Jak dlouho bude úloha skutečně trvat, závisí také na effort, počtu kol volání nástrojů, úspěšnosti cache, délce kontextu a počtu opakování po selhání.

Dlouhý pracovní postup agenta Fable 5.1 od plánování po ověření
Fable 5.1 není určen pro jednorázové odpovědi, ale pro dlouhé úlohy, při kterých průběžně plánuje, provádí, zotavuje se z chyb, ověřuje a podává zprávy.

Kompletní tabulka hlavních benchmarků Fable 5.1

Následující tabulka přebírá hlavní tabulku ze stránky vydání Anthropic z 1. září 2026. Aby nedošlo k chybnému výkladu, jsou procenta, hrubé skóre GDPval-AA, výsledky partial/strict z OSWorld a výsledky HLE s nástroji / bez nástrojů uvedeny zvlášť. Každý benchmark si ponechává oficiální anglický název a na dalším řádku je uveden český název; jiné jazykové verze pak pod anglickým názvem zobrazí odpovídající překlad.

Schopnost Benchmark Fable 5.1 Fable 5 Opus 5 GPT-5.6 Sol 5.1 oproti Fable 5
Agentní vědecký výzkum Terminal-Bench-Science 0.1
Terminálový benchmark pro agentní vědecký výzkum
52.6% 24.7% 29.0% 22.4% +27.9 p. b.
Agentní práce v terminálu Terminal-Bench 4.0
Benchmark pro agentní práci v terminálu
55.8% 42.0% 52.3% 37.3% +13.8 p. b.
Odborná znalostní práce GDPval-AA v2
Benchmark profesních úloh s reálnou ekonomickou hodnotou
1853 1723 1824 1711 +130 bodů
Ovládání počítače OSWorld 2.0 — Partial
Benchmark reálného ovládání počítače: skóre částečného dokončení
77.9% 72.9% 75.4% — +5.0 p. b.
Ovládání počítače OSWorld 2.0 — Strict
Benchmark reálného ovládání počítače: přísná úspěšnost
41.7% 36.1% 39.6% — +5.6 p. b.
Multidisciplinární uvažování Humanity's Last Exam — No tools
Humanity's Last Exam: bez nástrojů
60.9% 57.8% 56.6% — +3.1 p. b.
Multidisciplinární uvažování Humanity's Last Exam — With tools
Humanity's Last Exam: s nástroji
65.0% 63.8% 63.6% — +1.2 p. b.
Obchodní pracovní toky AutomationBench
Benchmark automatizace obchodních procesů napříč aplikacemi
31.4% 17.1% 26.9% 19.6% +14.3 p. b.
Agentní programování CursorBench 3.2.0
Benchmark reálných vícesouborových programovacích úloh
73.4% 70.5% 70.0% 67.2% +2.9 p. b.

— znamená, že v této hlavní tabulce Anthropic pro daný výsledek chybí údaj; neznamená to, že by model danou úlohu nedokázal splnit. V benchmarku Terminal-Bench 4.0 dosáhl model Mythos 5.1, který má méně omezení a je dostupný pouze v důvěryhodném programu, skóre 60.9%. Tento článek se zaměřuje na Fable 5.1 dostupný běžným uživatelům, takže výsledky Mythos nesměšuje do sloupce Fable.

Co měří Terminal-Bench-Science 0.1?

Terminal-Bench-Science 0.1 obsahuje 70 skutečných výzkumných pracovních postupů z pěti oblastí: vědy o živé přírodě, fyzikální vědy, vědy o Zemi, matematika a inženýrství. Úlohy nejsou výběrové testy, ale vyžadují, aby agent v terminálu provedl analýzu dat, statistickou inferenci, simulace, optimalizaci, důkazy matematických vět, rekonstrukci obrazu nebo vědecké strojové učení a výsledky ověřil pomocí reprodukovatelných testů.

Skóre 52.6% u Fable 5.1 oproti 24.7% u Fable 5 v oficiálním replikačním experimentu znamená zlepšení o 27.9 procentního bodu, což je nejvýraznější skok v celé tabulce. Oficiálně je ale u každého modelu uváděna standardní chyba přibližně ±3.5–4.5 procentního bodu, takže jedno desetinné místo nelze považovat za naprosto přesné pořadí.

Co měří Terminal-Bench 4.0 a CursorBench 3.2.0?

Terminal-Bench nechává agenty řešit složité úlohy v reálném terminálovém prostředí a sleduje, zda rozumí prostředí, umí volat nástroje, upravovat soubory a nakonec projít ověřením. Fable 5.1 dosáhl 55.8%, tedy o 13.8 procentního bodu více než Fable 5, a překonal také Opus 5 s 52.3%.

CursorBench 3.2 vychází z nejednoznačných vícesouborových úloh zachycených v reálných relacích Cursoru; verze 3.2 přidala úlohy na dodržování instrukcí a pokročilou práci s nástroji. Fable 5.1 Max dosáhl 73.4%. Náskok není tak dramatický jako u Terminal-Bench-Science, ale v průměru na úlohu spotřeboval 72 060 tokenů při nákladech $9.64; Fable 5 Max potřeboval 103 525 tokenů a $17.32. Zajímavější než samotných 2.9 procentního bodu je zde pokles počtu tokenů a nákladů při plnění stejného typu úloh.

Co měří GDPval-AA v2?

GDPval-AA v2 používá 220 úloh navržených profesionály z oboru, pokrývá 44 profesí a 9 odvětví a hodnotí schopnost modelu zvládat reálnou znalostní práci s ekonomickou hodnotou. Skóre 1853 je celkové skóre, nikoli 1853%. Tento výsledek ukazuje, že Fable 5.1 překonává Fable 5 v profesních dokumentech, analýzách a výstupech a mírně předčí také Opus 5.

Proč má OSWorld 2.0 dvě skóre?

OSWorld 2.0 obsahuje 108 dlouhých pracovních postupů ovládání počítače; medián doby, za kterou člověk úlohu dokončí, je přibližně 1.6 hodiny. Partial uděluje částečné skóre na základě více kontrolních bodů; Strict počítá jako úspěch pouze úplné dosažení cíle.

Skóre 77.9% u partial a 41.7% u strict si proto neodporují: model často zvládne většinu kroků, ale část úloh se mu nepodaří dotáhnout do konce. To zároveň připomíná, že počítačový agent, který „vypadá, že neustále pracuje“, ještě neznamená, že úloha skončila úspěchem.

Co měří Humanity's Last Exam?

Humanity's Last Exam vytvořily Center for AI Safety a Scale AI. Obsahuje 2 500 expertních otázek napříč obory, na které nelze snadno odpovědět pouhým vyhledáváním. Fable 5.1 je bez nástrojů o 3.1 procentního bodu lepší než Fable 5, ale s povolenými nástroji už jen o 1.2 procentního bodu. Je skutečně lepší, ale ne ve všech benchmarcích dochází k dvojnásobnému nárůstu.

Co měří AutomationBench?

AutomationBench ověřuje, zda agent zvládne napříč simulovanými SaaS nástroji, jako jsou CRM, e-mail, kalendář, zprávy a řízení projektů, dokončit pracovní toky z oblasti prodeje, marketingu, provozu, zákaznické podpory, financí a personalistiky. Fable 5.1 se zlepšil ze 17.1% na 31.4%, což je relativní nárůst přibližně o 84%. Ukazuje to výrazný pokrok 5.1 ve správě stavů napříč aplikacemi a v provádění dlouhých sekvencí kroků; zároveň ale 31.4% ukazuje, že tento typ automatizace bez dozoru má k vyřešení stále daleko.

Matice pokrytí schopností Fable 5.1 v sedmi hlavních kategoriích benchmarků
Sedm kategorií benchmarků pokrývá vědecký výzkum, programování v terminálu, profesní znalostní práci, ovládání počítače, multidisciplinární uvažování, obchodní procesy a vícesouborové programování.

Co Fable 5.1 oproti Fable 5 zlepšil

1. U dlouhých úloh méně často volí zkratky

Anthropic staví Fable 5.1 do role modelu pro dlouhodobé agenty: nejprve plánuje, pak používá nástroje, po selhání se zotavuje, ověřuje výsledky a aktivně podává zprávy o průběhu. Více se soustředí na opravu hlavní příčiny než na lokální obcházení problému, aby co nejrychleji „zezelenal“ jediný test. Oficiálně uváděné cílové scénáře zahrnují funkce napříč kódovými bázemi, code review, optimalizaci výkonu, vícedenní autonomní relace, výzkum, dokumenty, tabulky a prezentace.

2. I při nízkém effort se výsledky blíží nákladným výsledkům předchozí generace

Fable 5.1 nově umožňuje upravovat effort pro jednotlivé zprávy. Oficiální křivky nákladů ukazují, že u některých úloh dokáže při effort Low nebo Medium dosáhnout výsledků srovnatelných s Fable 5 nebo lepších a zároveň snížit spotřebu tokenů i náklady. Claude Code ve výchozím nastavení používá effort High; Claude.ai a Cowork mají výchozí Medium. Při porovnávání modelů je proto nutné nejdřív ověřit effort – výsledky různých úrovní nelze dávat vedle sebe.

3. Mezi voláními nástrojů lze zobrazit srozumitelný průběh

API nově nabízí testovací možnost display: "updates", která modelu umožňuje poskytovat mezi jednotlivými voláními nástrojů uživatelsky orientované aktualizace průběhu. U úloh, které běží několik hodin, se díky tomu snáze pozná, co model právě dělá a zda se neodchýlil od cíle, než když se jen opakovaně objevují karty nástrojů.

4. Propracovanější psaní, vizuální ověřování a vlastní testování

Podle oficiálních informací verze 5.1 aktivně píše testy na ověření vlastních změn a využívá vizuální schopnosti ke kontrole výstupů proti návrhovým cílům. Hodnocení partnerů se soustředí také na stručnější zprávy o průběhu, úplnější odpovědi na vícečlenné otázky, sledování řetězců volání napříč službami a zachování srozumitelnosti při dlouhém běhu. Jde o kvalitativní zpětnou vazbu, kterou nelze vydávat za výsledek jednotného benchmarku.

5. Bezpečnostní zásahy jsou přesnější, ale nezmizely

Falešně pozitivní zásahy kyberbezpečnostní ochrany Fable 5.1 se oproti vydání Fable 5 snížily přibližně o 60% a frekvence, s jakou základní biologické a lékařské dotazy spouštějí downgrade, klesla přibližně o 85%. Model lze nyní použít k vyhledávání chyb v softwaru, ale úlohy s dvojím použitím, jako je penetrační testování, generování zneužitelného kódu nebo skenování binárních zranitelností, mohou být stále přesměrovány na Opus. Po přesměrování se neúčtují ceny modelu Fable.

6. Přibylo označení původu obsahu

Fable 5.1 zavádí content provenance. Generovaný text může nést statistický vodoznak, který lze ověřit nástrojem pro kontrolu obsahu od Anthropic. Do textu nepřidává žádné viditelné značky, ale pro obsahové platformy, vzdělávání a firemní audity jde o nové chování, které je dobré znát předem.

Šest klíčových vylepšení Fable 5.1 oproti předchozí generaci
Změny ve verzi 5.1 se soustředí na dlouhé úlohy, efektivitu při nízkém effort, zprávy o průběhu, vlastní ověřování, méně falešných poplachů a označování původu obsahu.

Jak se počítají náklady na Fable 5.1

Položka Cena Fable 5.1 Srovnání s Fable 5
Vstup $10 / 1 milion tokenů stejná
Výstup $50 / 1 milion tokenů stejná
Zápis do cache (5 minut) $12.50 / 1 milion tokenů stejná kategorie
Zápis do cache (1 hodina) $20 / 1 milion tokenů stejná kategorie
Čtení z cache $0.25 / 1 milion tokenů o 75% nižší
Batch API 50% ceny za vstup a výstup podle pravidel Batch

Předpokládejme dlouhou úlohu, která celkem přečte 10 milionů tokenů z cache, vytvoří 200 000 nových vstupních tokenů a 50 000 výstupních tokenů, přičemž zápisy do cache neuvažujeme:

text
缓存读取:10 × $0.25 = $2.50
新输入:0.2 × $10 = $2.00
输出:0.05 × $50 = $2.50
合计:$7.00

Stejných 10 milionů čtení z cache by u Fable 5 vyšlo zhruba na $10, takže jen tento rozdíl činí $7.50. Anthropic na tomto základě odhaduje, že skutečné náklady typických úloh účtovaných podle tokenů lze snížit přibližně o 25%; u vysoce agentních úloh s častým opakovaným využitím dlouhého kontextu až o 45%. Nejde o celkové zlevnění ceníku API, ale o to, že čím více zásahů v cache, tím výraznější úspora.

Předplatitelé nemusí zlevnění API cache využít přímo

V tarifech Max a u prémiových míst (premium seat) v Team/Enterprise lze až 50% týdenního limitu použít na modely Fable. Pro a standardní místa od začátku čerpají usage credits. Konkrétní spotřeba se řídí stavem na stránce Usage v účtu. Zlevnění čtení z cache se týká hlavně scénářů účtovaných podle tokenů; nelze 75% slevu API na cache jednoduše přepočítat na „čtyřnásobně větší využití tarifu Max“.

Struktura nákladů na vstup, výstup a cache u Fable 5.1
Jednotkové ceny vstupu a výstupu Fable 5.1 se nezměnily; hlavní zlevnění pochází ze čtení cache – čím více se dlouhý kontext znovu používá, tím větší je přínos.

Jak je to s rychlostí Fable 5.1?

Odpověď zní: odpověď v jednom kole je pomalejší, ale celkový čas dokončení složitých úloh může být kratší.

  • Katalog modelů Anthropic označuje Fable 5.1 jako Slower, Opus 5 jako Moderate a Sonnet 5 jako Fast.
  • Claude Code ve výchozím nastavení používá High effort, takže přirozeně spotřebuje více času na přemýšlení než Low nebo Medium.
  • Společnost Every u vlastních pracovních zátěží uvádí, že Fable 5.1 je zhruba dvakrát rychlejší než Opus 5 a spotřebuje polovinu tokenů. Jde o konkrétní test partnera, nikoli o obecnou záruku rychlosti.
  • V CursorBench provedl Fable 5.1 Max v průměru 70 kroků a spotřeboval 72 060 tokenů; Fable 5 Max měl rovněž 72 kroků, ale spotřeboval 103 525 tokenů. Výhoda 5.1 spočívá spíše v tom, že „méně bloudí a spotřebuje méně tokenů“, což se nemusí projevit rychlejším prvním tokenem.

Proto pro chat, krátký kód a časté interakce volte raději Sonnet 5 nebo Opus 5. Fable 5.1 zvažte u ladění napříč kódovými bázemi, dlouhého výzkumu a autonomních úloh bez dozoru, které vyžadují vlastní ověřování.

Změny kompatibility, které je třeba ošetřit před přechodem na Fable 5.1

Claude Code aktualizujte alespoň na 2.1.250

Dokumentace k tarifům a dostupnosti od Anthropic vyžaduje Claude Code 2.1.250 nebo novější. Pokud Fable 5.1 nevidíte, nejprve zkontrolujte:

bash
claude --version

Poté aktualizujte oficiálním postupem pro Claude Code a relaci spusťte znovu. ID modelu Fable 5.1 v API je:

text
claude-fable-5-1

Forced tool use může skončit chybou

Pokud požadavek nutí model zavolat konkrétní nástroj, může Fable 5.1 vrátit chybu. Před migrací proto zkontrolujte tool_choice a procesy s vynuceným voláním nástrojů u vlastních agentů; nepředpokládejte, že chování Fable 5 bude plně kompatibilní.

Thinking blocks nelze libovolně přenášet mezi modely

Starší modely nedokážou číst thinking blocks modelu Fable 5.1. Při přepínání modelů by mělo SDK zpracovat tyto bloky podle oficiálních pravidel, ne je beze změny předat jinému modelu.

Úpravy staré historie mohou vést k chybě 400

U nových API účtů vytvořených po 31. srpnu 2026 jsou thinking blocks platné pouze v rámci původního konverzačního prefixu, ve kterém vznikly. Pokud upravíte system, tools nebo starší zprávy a thinking blocks pak přehrajete znovu, může API vrátit chybu 400. Oficiálně se doporučuje držet historii v režimu append-only. Když je třeba historii zkrátit, nahraďte celý starý úsek jedním novým shrnutím a neupravujte stará kola při zachování původních thinking blocks. Podrobný postup najdete v Průvodci promptováním a migrací pro Fable 5.1.

Kdy zvolit Fable 5.1

Vhodné pro:

  • dlouhé úlohy napříč více repozitáři, službami nebo aplikacemi;
  • agenty, kteří běží několik hodin a sami se zotavují z chyb;
  • vědecký výzkum, komplexní analýzu dat a vícestupňové profesní výstupy;
  • obtížně reprodukovatelné systémové problémy, optimalizaci výkonu a hledání hlavní příčiny;
  • API zátěže s rozsáhlým opakovaným využitím dlouhého kontextu a vysokým podílem čtení z cache.

Nevhodné pro:

  • jednoduchý chat, krátké texty nebo malé úpravy jednoho souboru;
  • interakce v reálném čase vysoce citlivé na latenci prvního tokenu;
  • úlohy s velkým výstupem a pevným rozpočtem bez možnosti opakovaného využití cache;
  • scénáře, které nemohou akceptovat výchozí uchovávání dat bezpečnostního monitorování po dobu 30 dnů a nesplňují výjimky pro podniky;
  • pracovní postupy, u kterých se očekává, že žádný kyberbezpečnostní ani biologický dotaz nespustí downgrade.

Jak na dálku sledovat dlouhé úlohy

Hodnota Fable 5.1 se obvykle projeví u úloh trvajících několik hodin nebo dokonce dní, ale to neznamená, že musíte celou dobu sedět u vývojového počítače. Nejprve ověřte, že je Fable 5.1 dostupný v lokálním Claude Code 2.1.250+, a poté si prostřednictvím PandaNpc Agent v prohlížeči, na desktopu nebo v mobilu zobrazte relaci Claude Code na stejném vývojovém stroji, reagujte na interakce a zadávejte další příkazy.

Mění se pouze vstupní bod ovládání; kód, nástroje a buildy dál běží na vašem vývojovém počítači. Než Fable 5.1 pustíte na dlouhé úlohy, můžete si přečíst Průvodce vzdáleným přístupem k Claude Code a Návod na připojení k Claude Code z mobilu, a teprve když je vzdálené spojení ověřené, svěřit Fable 5.1 dlouhé úlohy.

FAQ: Časté dotazy

O kolik je Fable 5.1 lepší než Fable 5?

Rozdíly mezi jednotlivými typy úloh jsou velké. V Terminal-Bench-Science se zlepšil o 27.9 procentního bodu, v AutomationBench o 14.3 procentního bodu; v HLE s nástroji pouze o 1.2 procentního bodu. Nelze jeden největší nárůst považovat za reprezentativní pro všechny úlohy.

Je Fable 5.1 rychlejší než Opus 5?

V oficiální tabulce relativní latence je Fable 5.1 „pomalejší“ a Opus 5 „střední“. Někteří partneři ale u kompletních úloh pozorují, že je Fable 5.1 rychlejší, protože spotřebuje méně tokenů a méně práce se musí předělávat. Tyto dva závěry neměří totéž.

Je Fable 5.1 pro programování vhodnější než GPT-5.6 Sol?

V tabulce vydání Anthropic dosahuje Fable 5.1 vyšších skóre v Terminal-Bench-Science, Terminal-Bench, AutomationBench a CursorBench. Různé modely ale používají různé agent harness, effort, nástroje a ceny, takže z toho nelze usuzovat, že Fable vyhrává ve všech reálných repozitářích. Můžete se podívat na Návod na konfiguraci GPT-5.6 Sol s 1M kontextem a pak provést A/B test na vlastních reprezentativních úlohách.

Proč se Fable 5.1 najednou přepne na Opus?

Některé kyberbezpečnostní a biologické dotazy jsou bezpečnostními mechanismy safeguards přesměrovány na Opus. Přepnutí modelu nemusí nutně znamenat poruchu. Anthropic uvádí, že takto přesměrované požadavky se neúčtují cenami modelu Fable.

Má Fable 5.1 vodoznak?

Ano, má statistický mechanismus content provenance, ale do textu nepřidává žádné viditelné označení. Není to totéž co viditelný vodoznak v rohu obrázku.

Shrnutí

Nejvýraznější pokrok modelu Claude Fable 5.1 se soustředí na vědecký výzkum, úlohy v terminálu a obchodní pracovní toky napříč aplikacemi: dokáže déle soustavně pracovat, zotavit se z chyb, ověřovat výsledky a díky levnějšímu čtení z cache také snižovat náklady dlouhých úloh. Stále je ale drahý, má pomalejší latenci v jednotlivých kolech a přináší změny v kompatibilitě týkající se thinking blocks, vynuceného volání nástrojů a úprav historie.

Správná otázka při výběru nezní „je první v benchmarcích?“, ale: je vaše úloha dostatečně dlouhá a složitá a jsou náklady na selhání a přepracování tak vysoké, že se Fable 5.1 vyplatí? Pokud ne, je obvykle vhodnější začít s Opus 5 nebo Sonnet 5.