Claude Fable 5.1: Kompletní analýza benchmarků, vylepšení, ceny a rychlosti
Kompletní výsledky Claude Fable 5.1 v 7 kategoriích hlavních benchmarků, srovnání jednotlivých položek s Fable 5, Opus 5 a GPT-5.6 Sol, a vysvětlení dlouhých úloh, volání nástrojů, nákladů na cache, rychlosti, omezení tarifů a migračních změn verze 5.1.

Claude Fable 5.1 byl oficiálně vydán 1. září 2026. Řeknu to rovnou: nejde o běžný upgrade modelu pro běžné dotazy a odpovědi, ale o nákladný vlajkový model určený pro dlouhé programování, komplexní výzkum, volání nástrojů napříč aplikacemi a agenty pracující bez dozoru. Ve všech 7 kategoriích hlavních benchmarků zveřejněných společností Anthropic překonal Fable 5.1 model Fable 5. Jeho cena za API je ale stále dvojnásobná oproti modelu Opus 5 a oficiálně je relativní latence označena jako „pomalejší“.
Pokud je vaším úkolem jen upravit jeden soubor, napsat krátký text nebo odpovědět na běžný dotaz, Anthropic stále doporučuje začít s modelem Opus 5. Fable 5.1 je vhodnější pro dlouhé vícekrokové úlohy, které běžné modely ani při vysokém effort nedokážou spolehlivě dokončit. Tento článek dává dohromady oficiální data k vydání, význam jednotlivých benchmarků, konkrétní vylepšení verze 5.1, ceny, rychlost a omezení při migraci, abyste se nedívali jen na jednu tabulku „kdo vyhrál“.
Specifikace Fable 5.1 na první pohled
| Parametr | Claude Fable 5.1 | Claude Opus 5 | Claude Sonnet 5 |
|---|---|---|---|
| Kontextové okno | 1M tokenů | 1M tokenů | 1M tokenů |
| Maximální výstup | 128K tokenů | 128K tokenů | 128K tokenů |
| Cena za vstup | $10 / MTok | $5 / MTok | $2 / MTok |
| Cena za výstup | $50 / MTok | $25 / MTok | $10 / MTok |
| Relativní latence | Pomalejší | Střední | Rychlá |
| Thinking | Adaptive, vždy zapnutý | Adaptive | Adaptive |
| Výchozí effort | High | High | High |
| Hranice spolehlivých znalostí | červen 2026 | květen 2026 | leden 2026 |
„Pomalejší“ zde pochází z katalogu modelů Anthropic a označuje úroveň relativní latence, nikoli pevný počet tokenů za sekundu. Jak dlouho bude úloha skutečně trvat, závisí také na effort, počtu kol volání nástrojů, úspěšnosti cache, délce kontextu a počtu opakování po selhání.
Kompletní tabulka hlavních benchmarků Fable 5.1
Následující tabulka přebírá hlavní tabulku ze stránky vydání Anthropic z 1. září 2026. Aby nedošlo k chybnému výkladu, jsou procenta, hrubé skóre GDPval-AA, výsledky partial/strict z OSWorld a výsledky HLE s nástroji / bez nástrojů uvedeny zvlášť. Každý benchmark si ponechává oficiální anglický název a na dalším řádku je uveden český název; jiné jazykové verze pak pod anglickým názvem zobrazí odpovídající překlad.
| Schopnost | Benchmark | Fable 5.1 | Fable 5 | Opus 5 | GPT-5.6 Sol | 5.1 oproti Fable 5 |
|---|---|---|---|---|---|---|
| Agentní vědecký výzkum | Terminal-Bench-Science 0.1 Terminálový benchmark pro agentní vědecký výzkum |
52.6% | 24.7% | 29.0% | 22.4% | +27.9 p. b. |
| Agentní práce v terminálu | Terminal-Bench 4.0 Benchmark pro agentní práci v terminálu |
55.8% | 42.0% | 52.3% | 37.3% | +13.8 p. b. |
| Odborná znalostní práce | GDPval-AA v2 Benchmark profesních úloh s reálnou ekonomickou hodnotou |
1853 | 1723 | 1824 | 1711 | +130 bodů |
| Ovládání počítače | OSWorld 2.0 — Partial Benchmark reálného ovládání počítače: skóre částečného dokončení |
77.9% | 72.9% | 75.4% | — | +5.0 p. b. |
| Ovládání počítače | OSWorld 2.0 — Strict Benchmark reálného ovládání počítače: přísná úspěšnost |
41.7% | 36.1% | 39.6% | — | +5.6 p. b. |
| Multidisciplinární uvažování | Humanity's Last Exam — No tools Humanity's Last Exam: bez nástrojů |
60.9% | 57.8% | 56.6% | — | +3.1 p. b. |
| Multidisciplinární uvažování | Humanity's Last Exam — With tools Humanity's Last Exam: s nástroji |
65.0% | 63.8% | 63.6% | — | +1.2 p. b. |
| Obchodní pracovní toky | AutomationBench Benchmark automatizace obchodních procesů napříč aplikacemi |
31.4% | 17.1% | 26.9% | 19.6% | +14.3 p. b. |
| Agentní programování | CursorBench 3.2.0 Benchmark reálných vícesouborových programovacích úloh |
73.4% | 70.5% | 70.0% | 67.2% | +2.9 p. b. |
— znamená, že v této hlavní tabulce Anthropic pro daný výsledek chybí údaj; neznamená to, že by model danou úlohu nedokázal splnit. V benchmarku Terminal-Bench 4.0 dosáhl model Mythos 5.1, který má méně omezení a je dostupný pouze v důvěryhodném programu, skóre 60.9%. Tento článek se zaměřuje na Fable 5.1 dostupný běžným uživatelům, takže výsledky Mythos nesměšuje do sloupce Fable.
Co měří Terminal-Bench-Science 0.1?
Terminal-Bench-Science 0.1 obsahuje 70 skutečných výzkumných pracovních postupů z pěti oblastí: vědy o živé přírodě, fyzikální vědy, vědy o Zemi, matematika a inženýrství. Úlohy nejsou výběrové testy, ale vyžadují, aby agent v terminálu provedl analýzu dat, statistickou inferenci, simulace, optimalizaci, důkazy matematických vět, rekonstrukci obrazu nebo vědecké strojové učení a výsledky ověřil pomocí reprodukovatelných testů.
Skóre 52.6% u Fable 5.1 oproti 24.7% u Fable 5 v oficiálním replikačním experimentu znamená zlepšení o 27.9 procentního bodu, což je nejvýraznější skok v celé tabulce. Oficiálně je ale u každého modelu uváděna standardní chyba přibližně ±3.5–4.5 procentního bodu, takže jedno desetinné místo nelze považovat za naprosto přesné pořadí.
Co měří Terminal-Bench 4.0 a CursorBench 3.2.0?
Terminal-Bench nechává agenty řešit složité úlohy v reálném terminálovém prostředí a sleduje, zda rozumí prostředí, umí volat nástroje, upravovat soubory a nakonec projít ověřením. Fable 5.1 dosáhl 55.8%, tedy o 13.8 procentního bodu více než Fable 5, a překonal také Opus 5 s 52.3%.
CursorBench 3.2 vychází z nejednoznačných vícesouborových úloh zachycených v reálných relacích Cursoru; verze 3.2 přidala úlohy na dodržování instrukcí a pokročilou práci s nástroji. Fable 5.1 Max dosáhl 73.4%. Náskok není tak dramatický jako u Terminal-Bench-Science, ale v průměru na úlohu spotřeboval 72 060 tokenů při nákladech $9.64; Fable 5 Max potřeboval 103 525 tokenů a $17.32. Zajímavější než samotných 2.9 procentního bodu je zde pokles počtu tokenů a nákladů při plnění stejného typu úloh.
Co měří GDPval-AA v2?
GDPval-AA v2 používá 220 úloh navržených profesionály z oboru, pokrývá 44 profesí a 9 odvětví a hodnotí schopnost modelu zvládat reálnou znalostní práci s ekonomickou hodnotou. Skóre 1853 je celkové skóre, nikoli 1853%. Tento výsledek ukazuje, že Fable 5.1 překonává Fable 5 v profesních dokumentech, analýzách a výstupech a mírně předčí také Opus 5.
Proč má OSWorld 2.0 dvě skóre?
OSWorld 2.0 obsahuje 108 dlouhých pracovních postupů ovládání počítače; medián doby, za kterou člověk úlohu dokončí, je přibližně 1.6 hodiny. Partial uděluje částečné skóre na základě více kontrolních bodů; Strict počítá jako úspěch pouze úplné dosažení cíle.
Skóre 77.9% u partial a 41.7% u strict si proto neodporují: model často zvládne většinu kroků, ale část úloh se mu nepodaří dotáhnout do konce. To zároveň připomíná, že počítačový agent, který „vypadá, že neustále pracuje“, ještě neznamená, že úloha skončila úspěchem.
Co měří Humanity's Last Exam?
Humanity's Last Exam vytvořily Center for AI Safety a Scale AI. Obsahuje 2 500 expertních otázek napříč obory, na které nelze snadno odpovědět pouhým vyhledáváním. Fable 5.1 je bez nástrojů o 3.1 procentního bodu lepší než Fable 5, ale s povolenými nástroji už jen o 1.2 procentního bodu. Je skutečně lepší, ale ne ve všech benchmarcích dochází k dvojnásobnému nárůstu.
Co měří AutomationBench?
AutomationBench ověřuje, zda agent zvládne napříč simulovanými SaaS nástroji, jako jsou CRM, e-mail, kalendář, zprávy a řízení projektů, dokončit pracovní toky z oblasti prodeje, marketingu, provozu, zákaznické podpory, financí a personalistiky. Fable 5.1 se zlepšil ze 17.1% na 31.4%, což je relativní nárůst přibližně o 84%. Ukazuje to výrazný pokrok 5.1 ve správě stavů napříč aplikacemi a v provádění dlouhých sekvencí kroků; zároveň ale 31.4% ukazuje, že tento typ automatizace bez dozoru má k vyřešení stále daleko.
Co Fable 5.1 oproti Fable 5 zlepšil
1. U dlouhých úloh méně často volí zkratky
Anthropic staví Fable 5.1 do role modelu pro dlouhodobé agenty: nejprve plánuje, pak používá nástroje, po selhání se zotavuje, ověřuje výsledky a aktivně podává zprávy o průběhu. Více se soustředí na opravu hlavní příčiny než na lokální obcházení problému, aby co nejrychleji „zezelenal“ jediný test. Oficiálně uváděné cílové scénáře zahrnují funkce napříč kódovými bázemi, code review, optimalizaci výkonu, vícedenní autonomní relace, výzkum, dokumenty, tabulky a prezentace.
2. I při nízkém effort se výsledky blíží nákladným výsledkům předchozí generace
Fable 5.1 nově umožňuje upravovat effort pro jednotlivé zprávy. Oficiální křivky nákladů ukazují, že u některých úloh dokáže při effort Low nebo Medium dosáhnout výsledků srovnatelných s Fable 5 nebo lepších a zároveň snížit spotřebu tokenů i náklady. Claude Code ve výchozím nastavení používá effort High; Claude.ai a Cowork mají výchozí Medium. Při porovnávání modelů je proto nutné nejdřív ověřit effort – výsledky různých úrovní nelze dávat vedle sebe.
3. Mezi voláními nástrojů lze zobrazit srozumitelný průběh
API nově nabízí testovací možnost display: "updates", která modelu umožňuje poskytovat mezi jednotlivými voláními nástrojů uživatelsky orientované aktualizace průběhu. U úloh, které běží několik hodin, se díky tomu snáze pozná, co model právě dělá a zda se neodchýlil od cíle, než když se jen opakovaně objevují karty nástrojů.
4. Propracovanější psaní, vizuální ověřování a vlastní testování
Podle oficiálních informací verze 5.1 aktivně píše testy na ověření vlastních změn a využívá vizuální schopnosti ke kontrole výstupů proti návrhovým cílům. Hodnocení partnerů se soustředí také na stručnější zprávy o průběhu, úplnější odpovědi na vícečlenné otázky, sledování řetězců volání napříč službami a zachování srozumitelnosti při dlouhém běhu. Jde o kvalitativní zpětnou vazbu, kterou nelze vydávat za výsledek jednotného benchmarku.
5. Bezpečnostní zásahy jsou přesnější, ale nezmizely
Falešně pozitivní zásahy kyberbezpečnostní ochrany Fable 5.1 se oproti vydání Fable 5 snížily přibližně o 60% a frekvence, s jakou základní biologické a lékařské dotazy spouštějí downgrade, klesla přibližně o 85%. Model lze nyní použít k vyhledávání chyb v softwaru, ale úlohy s dvojím použitím, jako je penetrační testování, generování zneužitelného kódu nebo skenování binárních zranitelností, mohou být stále přesměrovány na Opus. Po přesměrování se neúčtují ceny modelu Fable.
6. Přibylo označení původu obsahu
Fable 5.1 zavádí content provenance. Generovaný text může nést statistický vodoznak, který lze ověřit nástrojem pro kontrolu obsahu od Anthropic. Do textu nepřidává žádné viditelné značky, ale pro obsahové platformy, vzdělávání a firemní audity jde o nové chování, které je dobré znát předem.
Jak se počítají náklady na Fable 5.1
| Položka | Cena Fable 5.1 | Srovnání s Fable 5 |
|---|---|---|
| Vstup | $10 / 1 milion tokenů | stejná |
| Výstup | $50 / 1 milion tokenů | stejná |
| Zápis do cache (5 minut) | $12.50 / 1 milion tokenů | stejná kategorie |
| Zápis do cache (1 hodina) | $20 / 1 milion tokenů | stejná kategorie |
| Čtení z cache | $0.25 / 1 milion tokenů | o 75% nižší |
| Batch API | 50% ceny za vstup a výstup | podle pravidel Batch |
Předpokládejme dlouhou úlohu, která celkem přečte 10 milionů tokenů z cache, vytvoří 200 000 nových vstupních tokenů a 50 000 výstupních tokenů, přičemž zápisy do cache neuvažujeme:
缓存读取:10 × $0.25 = $2.50
新输入:0.2 × $10 = $2.00
输出:0.05 × $50 = $2.50
合计:$7.00Stejných 10 milionů čtení z cache by u Fable 5 vyšlo zhruba na $10, takže jen tento rozdíl činí $7.50. Anthropic na tomto základě odhaduje, že skutečné náklady typických úloh účtovaných podle tokenů lze snížit přibližně o 25%; u vysoce agentních úloh s častým opakovaným využitím dlouhého kontextu až o 45%. Nejde o celkové zlevnění ceníku API, ale o to, že čím více zásahů v cache, tím výraznější úspora.
Předplatitelé nemusí zlevnění API cache využít přímo
V tarifech Max a u prémiových míst (premium seat) v Team/Enterprise lze až 50% týdenního limitu použít na modely Fable. Pro a standardní místa od začátku čerpají usage credits. Konkrétní spotřeba se řídí stavem na stránce Usage v účtu. Zlevnění čtení z cache se týká hlavně scénářů účtovaných podle tokenů; nelze 75% slevu API na cache jednoduše přepočítat na „čtyřnásobně větší využití tarifu Max“.
Jak je to s rychlostí Fable 5.1?
Odpověď zní: odpověď v jednom kole je pomalejší, ale celkový čas dokončení složitých úloh může být kratší.
- Katalog modelů Anthropic označuje Fable 5.1 jako
Slower, Opus 5 jakoModeratea Sonnet 5 jakoFast. - Claude Code ve výchozím nastavení používá High effort, takže přirozeně spotřebuje více času na přemýšlení než Low nebo Medium.
- Společnost Every u vlastních pracovních zátěží uvádí, že Fable 5.1 je zhruba dvakrát rychlejší než Opus 5 a spotřebuje polovinu tokenů. Jde o konkrétní test partnera, nikoli o obecnou záruku rychlosti.
- V CursorBench provedl Fable 5.1 Max v průměru 70 kroků a spotřeboval 72 060 tokenů; Fable 5 Max měl rovněž 72 kroků, ale spotřeboval 103 525 tokenů. Výhoda 5.1 spočívá spíše v tom, že „méně bloudí a spotřebuje méně tokenů“, což se nemusí projevit rychlejším prvním tokenem.
Proto pro chat, krátký kód a časté interakce volte raději Sonnet 5 nebo Opus 5. Fable 5.1 zvažte u ladění napříč kódovými bázemi, dlouhého výzkumu a autonomních úloh bez dozoru, které vyžadují vlastní ověřování.
Změny kompatibility, které je třeba ošetřit před přechodem na Fable 5.1
Claude Code aktualizujte alespoň na 2.1.250
Dokumentace k tarifům a dostupnosti od Anthropic vyžaduje Claude Code 2.1.250 nebo novější. Pokud Fable 5.1 nevidíte, nejprve zkontrolujte:
claude --versionPoté aktualizujte oficiálním postupem pro Claude Code a relaci spusťte znovu. ID modelu Fable 5.1 v API je:
claude-fable-5-1Forced tool use může skončit chybou
Pokud požadavek nutí model zavolat konkrétní nástroj, může Fable 5.1 vrátit chybu. Před migrací proto zkontrolujte tool_choice a procesy s vynuceným voláním nástrojů u vlastních agentů; nepředpokládejte, že chování Fable 5 bude plně kompatibilní.
Thinking blocks nelze libovolně přenášet mezi modely
Starší modely nedokážou číst thinking blocks modelu Fable 5.1. Při přepínání modelů by mělo SDK zpracovat tyto bloky podle oficiálních pravidel, ne je beze změny předat jinému modelu.
Úpravy staré historie mohou vést k chybě 400
U nových API účtů vytvořených po 31. srpnu 2026 jsou thinking blocks platné pouze v rámci původního konverzačního prefixu, ve kterém vznikly. Pokud upravíte system, tools nebo starší zprávy a thinking blocks pak přehrajete znovu, může API vrátit chybu 400. Oficiálně se doporučuje držet historii v režimu append-only. Když je třeba historii zkrátit, nahraďte celý starý úsek jedním novým shrnutím a neupravujte stará kola při zachování původních thinking blocks. Podrobný postup najdete v Průvodci promptováním a migrací pro Fable 5.1.
Kdy zvolit Fable 5.1
Vhodné pro:
- dlouhé úlohy napříč více repozitáři, službami nebo aplikacemi;
- agenty, kteří běží několik hodin a sami se zotavují z chyb;
- vědecký výzkum, komplexní analýzu dat a vícestupňové profesní výstupy;
- obtížně reprodukovatelné systémové problémy, optimalizaci výkonu a hledání hlavní příčiny;
- API zátěže s rozsáhlým opakovaným využitím dlouhého kontextu a vysokým podílem čtení z cache.
Nevhodné pro:
- jednoduchý chat, krátké texty nebo malé úpravy jednoho souboru;
- interakce v reálném čase vysoce citlivé na latenci prvního tokenu;
- úlohy s velkým výstupem a pevným rozpočtem bez možnosti opakovaného využití cache;
- scénáře, které nemohou akceptovat výchozí uchovávání dat bezpečnostního monitorování po dobu 30 dnů a nesplňují výjimky pro podniky;
- pracovní postupy, u kterých se očekává, že žádný kyberbezpečnostní ani biologický dotaz nespustí downgrade.
Jak na dálku sledovat dlouhé úlohy
Hodnota Fable 5.1 se obvykle projeví u úloh trvajících několik hodin nebo dokonce dní, ale to neznamená, že musíte celou dobu sedět u vývojového počítače. Nejprve ověřte, že je Fable 5.1 dostupný v lokálním Claude Code 2.1.250+, a poté si prostřednictvím PandaNpc Agent v prohlížeči, na desktopu nebo v mobilu zobrazte relaci Claude Code na stejném vývojovém stroji, reagujte na interakce a zadávejte další příkazy.
Mění se pouze vstupní bod ovládání; kód, nástroje a buildy dál běží na vašem vývojovém počítači. Než Fable 5.1 pustíte na dlouhé úlohy, můžete si přečíst Průvodce vzdáleným přístupem k Claude Code a Návod na připojení k Claude Code z mobilu, a teprve když je vzdálené spojení ověřené, svěřit Fable 5.1 dlouhé úlohy.
FAQ: Časté dotazy
O kolik je Fable 5.1 lepší než Fable 5?
Rozdíly mezi jednotlivými typy úloh jsou velké. V Terminal-Bench-Science se zlepšil o 27.9 procentního bodu, v AutomationBench o 14.3 procentního bodu; v HLE s nástroji pouze o 1.2 procentního bodu. Nelze jeden největší nárůst považovat za reprezentativní pro všechny úlohy.
Je Fable 5.1 rychlejší než Opus 5?
V oficiální tabulce relativní latence je Fable 5.1 „pomalejší“ a Opus 5 „střední“. Někteří partneři ale u kompletních úloh pozorují, že je Fable 5.1 rychlejší, protože spotřebuje méně tokenů a méně práce se musí předělávat. Tyto dva závěry neměří totéž.
Je Fable 5.1 pro programování vhodnější než GPT-5.6 Sol?
V tabulce vydání Anthropic dosahuje Fable 5.1 vyšších skóre v Terminal-Bench-Science, Terminal-Bench, AutomationBench a CursorBench. Různé modely ale používají různé agent harness, effort, nástroje a ceny, takže z toho nelze usuzovat, že Fable vyhrává ve všech reálných repozitářích. Můžete se podívat na Návod na konfiguraci GPT-5.6 Sol s 1M kontextem a pak provést A/B test na vlastních reprezentativních úlohách.
Proč se Fable 5.1 najednou přepne na Opus?
Některé kyberbezpečnostní a biologické dotazy jsou bezpečnostními mechanismy safeguards přesměrovány na Opus. Přepnutí modelu nemusí nutně znamenat poruchu. Anthropic uvádí, že takto přesměrované požadavky se neúčtují cenami modelu Fable.
Má Fable 5.1 vodoznak?
Ano, má statistický mechanismus content provenance, ale do textu nepřidává žádné viditelné označení. Není to totéž co viditelný vodoznak v rohu obrázku.
Shrnutí
Nejvýraznější pokrok modelu Claude Fable 5.1 se soustředí na vědecký výzkum, úlohy v terminálu a obchodní pracovní toky napříč aplikacemi: dokáže déle soustavně pracovat, zotavit se z chyb, ověřovat výsledky a díky levnějšímu čtení z cache také snižovat náklady dlouhých úloh. Stále je ale drahý, má pomalejší latenci v jednotlivých kolech a přináší změny v kompatibilitě týkající se thinking blocks, vynuceného volání nástrojů a úprav historie.
Správná otázka při výběru nezní „je první v benchmarcích?“, ale: je vaše úloha dostatečně dlouhá a složitá a jsou náklady na selhání a přepracování tak vysoké, že se Fable 5.1 vyplatí? Pokud ne, je obvykle vhodnější začít s Opus 5 nebo Sonnet 5.
Související průvodci

Codex: povolení 1M kontextu pro GPT-5.6 Sol – tutoriál se 3 řádky konfigurace `config.toml`
GPT-5.6 Sol oficiálně podporuje kontext 1,05 milionu tokenů. Stačí přidat 3 řádky konfigurace na začátek config.toml v Codex a můžete běžet s oknem 1 milionu tokenů, přičemž při přibližně 900 tisících tokenech se historie automaticky komprimuje. Přiloženo: trvalá konfigurace, jednorázový příkaz, ověření a upozornění na náklady.
Přečíst článek →
Jak používat Claude Code Remote Control? Ovládání z mobilu, oficiální omezení a alternativy (2026)
Jak zapnout Claude Code Remote Control? Tento článek uvádí tři oficiální způsoby použití: claude remote-control, claude --remote-control a /remote-control, vysvětluje připojení telefonu a prohlížeče, požadavky na účet, metody ověřování a běžné chyby, a porovnává řešení PandaNpc pro vlastní modely, Codex a scénáře s více stroji.
Přečíst článek →
Připojení telefonu k Claude Code: prohlížení relací a schvalování nástrojů na iOS kdykoli
Tento článek je určen vývojářům a představuje nejlepší postupy pro připojení k Claude Code pomocí mobilního telefonu. Přes aplikaci PandaNpc pro iOS můžete v reálném čase sledovat relace, schvalovat volání nástrojů a reagovat na dotazy. S využitím pandapaw a iOS Live Activity získáte efektivní vzdálené ovládání a větší flexibilitu při kódování.
Přečíst článek →