GPT-6 Astra vs Claude Fable 5.1: Srovnání programování, agentů, cen a benchmarků

GPT-6 Astra a Claude Fable 5.1 jsou oba veřejně dostupné a oba jsou vlajkové modely za 10 dolarů za milion tokenů na vstupu a 50 dolarů na výstupu, ale v programování, ovládání počítače, dlouhých úlohách, nákladech na cache a kontextu mají různé kompromisy. Tento článek je porovnává bod po bodu pomocí společných benchmarků a uvádí metodu výběru modelu podle typu úkolu.

PandaNpcPoprvé publikováno Aktualizováno dne
GPT-6 Astra vs Claude Fable 5.1: Srovnání programování, agentů, cen a benchmarků

Nejprve závěr: ve společných benchmarcích je GPT-6 Astra silnějším univerzálním modelem, zatímco Claude Fable 5.1 je přitažlivější pro dlouhodobé agenty, náklady na cache a pracovní postupy Claude Code. Pokud jsou úlohy zaměřeny především na programování v terminálu, ovládání počítače, matematiku, migraci databází nebo provádění napříč nástroji, vyzkoušejte nejprve GPT-6 Astra; pokud má agent běžet nepřetržitě několik hodin a ve velké míře opakovaně číst kontext, nebo pokud tým již hloubkově používá Claude Code, může být vhodnější Fable 5.1.

Nejde přitom o to, „v kolika položkách GPT-6 vyhrál“. Oba modely mají naprosto stejné API ceny pro vstup i výstup, ale cena za čtení cache se liší čtyřnásobně; u benchmarků zveřejněných výrobci se navíc liší harness, effort, bezpečnostní politiky a chybějící data. Tento článek je aktuální k 5. září 2026; porovnává pouze oficiálně ověřitelné údaje a místa, která nelze přímo srovnávat, výslovně označuje.

GPT-6 Astra a Claude Fable 5.1 v jedné tabulce

Položka GPT-6 Astra Claude Fable 5.1
Oficiální zaměření Nejobtížnější end-to-end úlohy Náročné uvažování a dlouhodobá práce agenta
Kontextové okno 1 050 000 tokenů 1 000 000 tokenů
Maximální výstup 128 000 tokenů 128 000 tokenů
Cena vstupu API $10 / MTok $10 / MTok
Cena výstupu API $50 / MTok $50 / MTok
Čtení cache $1 / MTok $0.25 / MTok
Zápis do cache $12.50 / MTok 5 min $12.50 / MTok; 1 h $20 / MTok
Batch 50 % standardní ceny 50 % standardní ceny pro vstup i výstup
Řízení uvažování low / medium / high / xhigh / max Adaptive thinking; effort nastavitelný pro jednotlivé zprávy
Knowledge cutoff 30. dubna 2026 červen 2026
ID modelu API gpt-6-astra claude-fable-5-1
Dostupnost k 2026-09-05 Plně otevřeno pro způsobilé placené tarify, Codex a API Dostupný v Claude API a na hlavních cloudových platformách; k dispozici v placených tarifech Claude

Specifikace pocházejí ze stránky modelu OpenAI GPT-6 Astra a stránky modelu Anthropic Fable 5.1. OpenAI dále uvádí: když vstup překročí 272K tokenů, cena vstupu a cache se pro celý požadavek zdvojnásobí a cena výstupu se zvýší 1,5násobně. „Kontext GPT-6 o 50 000 tokenů větší“ tedy neznamená, že velmi dlouhé úlohy budou nutně levnější.

Postupné zpřístupňování GPT-6 Astra skončilo, takže „kdo získá přístup dřív“ už není hlavním kritériem volby mezi oběma modely. Plná dostupnost zde stále znamená pouze způsobilé placené tarify, Codex a API: tarify Free/Go, oprávnění GPT-6 Pro v Chatu a omezené schopnosti v oblasti kybernetické bezpečnosti mají stále vlastní hranice. Podrobnosti viz vysvětlení dostupnosti a bezpečnostního sdílení GPT-6 Astra.

Srovnání specifikací, cen a aktuální dostupnosti GPT-6 Astra a Claude Fable 5.1
Základní ceny vstupu i výstupu jsou u obou modelů stejné a oba jsou veřejně dostupné; Fable 5.1 má levnější čtení cache, GPT-6 Astra o něco větší kontext.

Srovnání benchmarků GPT-6 Astra vs Claude Fable 5.1

Níže uvádíme pouze metriky, u nichž mají výsledky obě strany, nebo u nichž chybějící údaj stojí za vysvětlení. Výsledky pocházejí z oficiálně zveřejněných materiálů obou stran. Tučně je vyšší hodnota v daném řádku; — znamená pouze to, že zveřejněná tabulka data neobsahuje, nikoli že model získal nula bodů.

Schopnost Benchmark GPT-6 Astra Fable 5.1 Vedoucí model
Vědecký terminál Terminal-Bench Science 64.6% 52.6% GPT-6 +12.0
Náročná matematika FrontierMath Tier 4 97.6% 87.8% GPT-6 +9.8
Vědecké otázky GPQA Diamond 96.0% 93.7% GPT-6 +2.3
Multidisciplinární uvažování HLE (s nástroji) 57.2% 65.0% Fable +7.8
Zdravotnické otázky HealthBench Pro 63.4% 56.6% GPT-6 +6.8
Automatizace podnikových procesů AutomationBench 41.4% 31.4% GPT-6 +10.0
CAD BenchCAD 95.9% 84.3% GPT-6 +11.6
Obecná inteligence AA Intelligence Index 61.2 65.7 Fable +4.5
Programování v terminálu Terminal-Bench 4.0 57.7% 55.8% GPT-6 +1.9
Softwarové inženýrství DeepSWE v1.1 74.1% 67.4% GPT-6 +6.7
Rozšířené kódování FrontierCode Ext. 64.5% 63.6% GPT-6 +0.9
Hlavní kódování FrontierCode Main 53.3% 50.9% GPT-6 +2.4
Migrace databází DB Migration 63.9% 57.8% GPT-6 +6.1
Abstraktní uvažování ARC-AGI-2 95.0% 90.0% GPT-6 +5.0
Abstraktní uvažování ARC-AGI-1 98.5% 97.5% GPT-6 +1.0

Tato data podporují tři omezené závěry:

  1. Výhody GPT-6 Astra pokrývají širší oblast, zejména vědecký terminál, matematiku, CAD, automatizaci podnikových procesů a migraci databází.
  2. Fable 5.1 nezaostává ve všem; vede v režimu HLE s nástroji a v Artificial Analysis Intelligence Index.
  3. Rozdíly menší než dva až tři procentní body není vhodné přeceňovat. Provozovatel běhu, vzorky, nástroje, rozpočet na uvažování nebo náhodnost mohou pořadí změnit.

Materiály OpenAI dále uvádějí Agents' Last Exam 59.3 %, OSWorld 2.0 72.6 % a ScreenSpot-Pro 92.7 %, ale ve stejné tabulce chybí odpovídající hodnoty pro Fable 5.1, takže na základě těchto řádků nelze Fable označit za poraženého. Naopak hodnoty CursorBench 3.2.0, GDPval-AA v2 a OSWorld partial/strict z publikační stránky Anthropic nelze přímo spojovat s čísly OpenAI, která používají jinou konfiguraci.

Oblasti, ve kterých GPT-6 Astra a Claude Fable 5.1 vedou ve společných benchmarcích
GPT-6 Astra vede ve většině společných metrik, Fable 5.1 vede v režimu HLE s nástroji a v AA Intelligence Index.

Programátorské schopnosti: GPT-6 je silnější, ale rozdíl závisí na úloze

Pokud je otázka, „který model je pro programování vhodnější, GPT-6 Astra nebo Fable 5.1“, oficiální společná data hovoří spíše ve prospěch GPT-6: v Terminal-Bench 4.0 je vyšší o 1,9 procentního bodu, v DeepSWE v1.1 o 6,7 a v DB Migration o 6,1. Jeho výsledky ve ScreenSpot-Pro, BenchCAD a v úlohách souvisejících s Computer Use rovněž ukazují, že nejen generuje kód, ale je lepší i v plnění úkolů v reálných softwarových rozhraních.

Jednotlivé programátorské benchmarky ale neměří totéž:

  • Terminal-Bench se více blíží porozumění prostředí v terminálu, úpravám souborů a úspěšnému projití ověřením;
  • DeepSWE se zaměřuje na úlohy softwarového inženýrství;
  • FrontierCode klade větší důraz na kvalitu reálného kódu a jeho slučitelnost;
  • DB Migration je užší, ale velmi praktická úloha změn v databázi;
  • Artificial Analysis Coding Agent Index agreguje více agentních programátorských hodnocení a Fable 5.1 zůstává konkurenceschopný v některých externích agregovaných metrikách.

Proto se u malých oprav nebo generování jednotlivých souborů nevyplatí vybírat model pouze podle špičkových benchmarků. To, co byste měli skutečně testovat metodou A/B, jsou vaše vlastní reprezentativní úlohy: stejný repozitář, stejný počáteční stav, stejná oprávnění k nástrojům, stejné akceptační testy – a zaznamenávat míru úspěšnosti, počet zásahů člověka, celkový počet tokenů, celkové náklady a dobu dokončení.

Dlouhodobí agenti: výhoda Fable 5.1 není jen v benchmarcích

Anthropic navrhl Fable 5.1 explicitně jako model pro úlohy, které trvají několik hodin a probíhají napříč více aplikacemi. Klade důraz na plánování, volání nástrojů, zotavení z chyb, samotestování a čitelný průběh a podporuje nastavení effort pro jednotlivé zprávy. Pro týmy, které již vybudovaly pracovní postupy kolem Claude Code, Cowork nebo Claude API, mohou být tyto běhové vlastnosti důležitější než pár bodů navíc v některém benchmarku.

GPT-6 Astra je rovněž zaměřen na end-to-end agenty a podporuje vyhledávání na webu, vyhledávání v souborech, interpret kódu, hostovaný Shell, Computer Use, MCP, Skills a asynchronní volání nástrojů. Umožňuje také doplňovat požadavky za běhu úlohy a upravovat intenzitu uvažování bez přerušení prefixu cache. Jinými slovy, ani jeden z modelů není „pouze chatovací“ model; rozdíly se projevují spíše v agentním rámci, integraci do ekosystému a struktuře nákladů.

Pokud má úloha běžet několik hodin, můžete prostřednictvím PandaNpc Agent z mobilu, webu nebo desktopu sledovat relace Claude Code nebo Codex běžící na vašem vlastním počítači. Model a nástroje se stále spouštějí na vývojovém stroji; vzdálený vstup slouží pouze ke sledování průběhu, řešení problémů s oprávněními a zadávání dalších pokynů. Podrobněji viz srovnání Claude Code a Codex.

Stejné ceny, ale skutečné náklady se mohou výrazně lišit

Oba modely mají vstup za $10/MTok a výstup za $50/MTok; při pohledu pouze na tyto základní ceny by se mohlo zdát, že náklady jsou stejné. Ve skutečnosti existují nejméně čtyři proměnné:

  • Čtení cache: Fable 5.1 stojí $0.25/MTok, GPT-6 Astra $1/MTok;
  • Velmi dlouhé vstupy: u GPT-6 se po překročení 272K tokenů aktivuje násobná sazba pro celý požadavek;
  • Délka výstupu: výstup u obou modelů stojí 50 dolarů za milion tokenů, takže přepracování a zdlouhavé uvažování náklady rychle zvyšují;
  • Míra úspěšnosti úlohy: dražší model, který úlohu dokončí napoprvé, může být levnější než levnější model, u něhož je třeba úlohu spustit třikrát.

Předpokládejme úlohu, která přečte 10 milionů tokenů z cache, a dále má 200 000 tokenů nového vstupu a 50 000 tokenů výstupu; zápis do cache zatím pomiňme:

Nákladová položka GPT-6 Astra Fable 5.1
Čtení cache $10.00 $2.50
Nový vstup $2.00 $2.00
Výstup $2.50 $2.50
Celkem $14.50 $7.00

Tento příklad ukazuje pouze cenový rozdíl ve „scénáři s vysokým opětovným využitím cache“ a neznamená, že je Fable u všech úloh o polovinu levnější. Pokud úloha cache téměř nevyužívá, nebo pokud GPT-6 úlohu dokončí v méně krocích napoprvé, může být výsledek opačný.

Rozhodovací strom pro výběr mezi GPT-6 Astra a Claude Fable 5.1
Dostupnost již není hlavní překážkou; vybírejte podle ovládání počítače a práce v terminálu, nebo podle dlouhých úloh, opětovného využití cache a ekosystému Claude Code.

Jak bezpečnostní politiky ovlivňují reálné použití

Požadavky Fable 5.1 v oblasti kybernetické bezpečnosti, biologie a chemie mohou spustit safeguards a být odmítnuty nebo přesměrovány na modely Opus. Anthropic výslovně uvádí, že přesměrované požadavky nejsou účtovány podle ceníku Fable. Oficiální benchmarky rovněž poznamenávají, že některé úlohy jsou kvůli zásahu produkčních bezpečnostních politik hodnoceny nulou, takže „odmítnutí odpovědi“ není totéž jako „nedostatečná vnitřní schopnost“.

GPT-6 Astra rovněž používá přísnější bezpečnostní a alignment mechanismy. OpenAI hodnotí jeho schopnosti v oblasti kybernetické bezpečnosti jako Critical a u vysoce rizikových schopností zavádí Trusted Access, monitorování a postupné zpřístupňování. Běžný vývoj, code review a obranné bezpečnostní činnosti obvykle nepatří mezi vysoce rizikové schopnosti, ale to, zda je lze skutečně provést, stále závisí na obsahu požadavku, oprávněních účtu a právech k nástrojům.

To je také důvod, proč se u bezpečnostních benchmarků nelze zaměřovat pouze na „míru dokončení“. Pro podnikové nasazení jsou důležitější otázky: je povoleno automatické provádění, lze omezit oprávnění nástrojů, uchovávají se záznamy o činnosti, jaká jsou pravidla uchovávání dat a umí aplikace správně rozpoznat skutečný model, pokud dojde k downgradu?

Jak si vybrat mezi GPT-6 Astra a Fable 5.1

Rozhodněte se pro GPT-6 Astra, pokud:

  • se věnujete především složitému programování v terminálu, migraci databází, ovládání počítače nebo práci napříč nástroji;
  • vám více záleží na společných benchmarcích v matematice, abstraktním uvažování, CAD a práci s profesionálním softwarem;
  • potřebujete kombinaci asynchronních nástrojů OpenAI Responses API, hostovaného Shell, Computer Use nebo MCP;
  • chcete používat Astra přímo v již zpřístupněném Codex nebo OpenAI API a jste ochotni počítat s násobnými sazbami u vstupů delších než 272K.

Rozhodněte se pro Claude Fable 5.1, pokud:

  • je vaším hlavním pracovním postupem již Claude Code nebo Claude API;
  • úlohy poběží dlouhou dobu a budou opakovaně číst rozsáhlé části stejného kontextu;
  • vám více záleží na nákladech na čtení cache, čitelnosti průběhu a zotavení dlouhých úloh;
  • vaše vlastní vyhodnocení ukazují, že Fable vyžaduje méně přepracování u úloh s kódovou bází nebo odbornými dokumenty.

Pokud máte přístup k oběma, nejjistějším postupem není sázet na jednoho celkového vítěze, ale zavést dvouúrovňové směrování: běžné úlohy nejprve zpracovávají levnější modely řady Opus, Sonnet nebo GPT-5.6; teprve vysoce hodnotné úlohy s dlouhým řetězcem kroků se předávají GPT-6 Astra nebo Fable 5.1 a dále se rozdělují podle naměřené míry úspěšnosti.

Jak oba modely spravedlivě srovnávat

Doporučujeme připravit 10–30 reálných úloh a u každé z nich pevně stanovit:

  1. stejný kód a datový snapshot;
  2. stejná oprávnění k nástrojům, síti a souborům;
  3. odpovídající reasoning effort, ne na jedné straně max a na druhé výchozí úroveň;
  4. stejný časový limit i limit nákladů;
  5. automatické testy nebo standardy zaslepeného hodnocení lidmi;
  6. alespoň tři opakování běhu, aby nebyl jeden náhodný úspěch zaměněn za stabilní schopnost.

Výsledná tabulka by měla zaznamenávat přinejmenším míru dokončení, míru úspěchu napoprvé, počet zásahů člověka, celkové náklady, dobu běhu a výstupní tokeny. Pokud model odmítne odpovědět, dojde k downgradu nebo k nedostatku oprávnění, zaznamenejte důvod zvlášť a nepočítejte to paušálně jako „neumí to“.

FAQ

Je GPT-6 Astra lepší než Claude Fable 5.1?

Ve většině dosud zveřejněných společných benchmarků má GPT-6 Astra vyšší skóre, zejména ve vědeckém terminálu, matematice, CAD, automatizaci a migraci databází. Fable 5.1 však vede v režimu HLE s nástroji a v AA Intelligence Index a skutečné úlohy dále ovlivňují harness, effort, nástroje a bezpečnostní politiky.

Který model je vhodnější pro psaní kódu?

GPT-6 Astra má ve společných programátorských benchmarcích celkově navrch a hodí se pro úlohy v terminálu, databázích a napříč aplikacemi; Fable 5.1 klade větší důraz na dlouhodobé autonomní programování, zotavení a ověřování. U velkých projektů je nejlepší provést A/B test na vlastní kódové bázi za stejných podmínek.

Mají oba modely stejné API ceny?

Základní ceny vstupu a výstupu jsou stejné: $10/MTok a $50/MTok. Fable 5.1 má ale čtení cache pouze za $0.25/MTok, zatímco GPT-6 Astra za $1/MTok; u GPT-6 se u vstupu nad 272K navíc aktivuje násobná sazba, takže skutečné náklady nemusejí být stejné.

Který model má delší kontext?

GPT-6 Astra má 1 050 000 tokenů, Fable 5.1 má 1 000 000 tokenů a maximální výstup je u obou 128K. Rozdíl v samotné kapacitě je malý; obvykle jsou důležitější cena velmi dlouhých vstupů, kvalita vyhledávání a míra zásahu cache.

Proč GPT-6 Astra nevidím?

K 5. září 2026 je GPT-6 Astra plně zpřístupněn způsobilým placeným tarifům, Codexu a API. Pokud jej stále nevidíte, zkontrolujte, zda nemáte tarif Free/Go, zda hledáte základní model Astra nebo GPT-6 Pro, zda model povolil správce pracovního prostoru a zda klient nevyžaduje aktualizaci nebo nové přihlášení. Úpl přehled hranic viz vysvětlení oprávnění a sdílení GPT-6 Astra.

Lze přímo důvěřovat benchmarkům výrobců?

Lze je brát jako signál pro předvýběr, ne jako konečný závěr pro rozhodování. Nejprve ověřte, zda je u daného řádku použita stejná verze úloh, nástroje, rozpočet na uvažování a způsob hodnocení, a poté výsledky ověřte na vlastní reprezentativní zátěži.

Shrnutí

Klíčem srovnání GPT-6 Astra vs Claude Fable 5.1 není to, „kdo je chytřejší ve všech scénářích“. Oba modely jsou veřejně dostupné. GPT-6 vede ve většině společných benchmarků a hodí se především pro ovládání počítače, náročnou práci v terminálu, matematiku a provádění napříč nástroji. Fable 5.1 si zachovává jasnou výhodu díky nižším nákladům na čtení cache, vyspělým pracovním postupům Claude a designu pro dlouhodobé agenty.

Pokud lze dát jen jedno výchozí doporučení: máte-li přístup a úlohy se týkají spíše složitého provádění, vyzkoušejte nejprve GPT-6 Astra; pokud úlohy ve velké míře znovu využívají dlouhý kontext, nebo jste již hluboce svázáni s Claude Code, vyzkoušejte nejprve Fable 5.1. Týmy citlivé na náklady nebo spolehlivost by měly konečné rozhodnutí opřít o vlastní míru úspěšnosti a o náklady na každý úspěšně dokončený úkol.