Claude Fable 5.1 im Detail: Benchmarks, Verbesserungen, Preis und Geschwindigkeit

Die vollständigen Ergebnisse von Claude Fable 5.1 in 7 gängigen Benchmark-Kategorien, im Einzelnen verglichen mit Fable 5, Opus 5 und GPT-5.6 Sol, sowie Erläuterungen zu den Langzeitaufgaben, Tool-Aufrufen, Cache-Gebühren, Geschwindigkeit, Tariflimits und Migrationsänderungen von 5.1.

PandaNpcErstveröffentlicht am
Claude Fable 5.1 im Detail: Benchmarks, Verbesserungen, Preis und Geschwindigkeit

Claude Fable 5.1 wurde am 1. September 2026 offiziell veröffentlicht. Vorweg das Fazit: Es handelt sich nicht um ein gewöhnliches Modell-Upgrade für allgemeine Fragen und Antworten, sondern um ein hochpreisiges Flaggschiff-Modell für langlaufende Programmieraufgaben, komplexe Recherchen, anwendungsübergreifende Tool-Aufrufe und unbeaufsichtigte Agenten. In den sieben von Anthropic veröffentlichten Kategorien etablierter Benchmarks übertrifft Fable 5.1 Fable 5 in allen Bereichen; der API-Preis pro Token ist jedoch weiterhin doppelt so hoch wie bei Opus 5, und die relative Latenz wird offiziell als „langsamer“ eingestuft.

Wenn Ihre Aufgabe lediglich darin besteht, eine Datei zu ändern, einen kurzen Text zu schreiben oder alltägliche Fragen zu beantworten, empfiehlt Anthropic weiterhin, mit Opus 5 zu beginnen. Fable 5.1 ist besser geeignet für langkettige Aufgaben, die normale Modelle selbst bei hohem effort nicht zuverlässig abschließen können. Dieser Artikel führt die offiziellen Veröffentlichungsdaten, die Bedeutung der einzelnen Benchmarks, die konkreten Verbesserungen von 5.1, Preise, Geschwindigkeit und Migrationseinschränkungen zusammen, damit Sie nicht nur eine einzelne „Wer hat gewonnen“-Bestwerttabelle betrachten.

Die Spezifikationen von Fable 5.1 auf einen Blick

Eigenschaft Claude Fable 5.1 Claude Opus 5 Claude Sonnet 5
Kontextfenster 1M Token 1M Token 1M Token
Maximale Ausgabe 128K Token 128K Token 128K Token
Eingabepreis 10 $ / MTok 5 $ / MTok 2 $ / MTok
Ausgabepreis 50 $ / MTok 25 $ / MTok 10 $ / MTok
Relative Latenz Langsamer Mittel Schnell
Thinking Adaptiv, stets aktiv Adaptiv Adaptiv
Standard-effort High High High
Zuverlässiger Wissensstand Juni 2026 Mai 2026 Januar 2026

Die Angabe „langsamer“ stammt aus dem Anthropic-Modellkatalog und kennzeichnet die Stufe der relativen Latenz, nicht eine feste Anzahl von Token pro Sekunde. Wie lange die Bearbeitung einer Aufgabe tatsächlich dauert, hängt außerdem von effort, der Anzahl der Tool-Aufruf-Runden, der Cache-Trefferquote, der Kontextlänge und der Anzahl der Wiederholungen nach Fehlern ab.

Langfristiger Agent-Workflow von Fable 5.1 von der Planung bis zur Validierung
Fable 5.1 zielt nicht auf einmalige Antworten ab, sondern auf lange Aufgaben mit kontinuierlicher Planung, Ausführung, Wiederherstellung, Validierung und Berichterstattung.

Vollständige Tabelle der wichtigsten Benchmarks von Fable 5.1

Die folgende Tabelle übernimmt direkt die Haupttabelle der Anthropic-Veröffentlichung vom 1. September 2026. Um Fehlinterpretationen zu vermeiden, werden Prozentwerte, die Rohpunktzahl von GDPval-AA, die Partial-/Strict-Ergebnisse von OSWorld sowie die HLE-Ergebnisse mit und ohne Werkzeuge getrennt aufgeführt. Jeder Benchmark behält seinen offiziellen englischen Namen; in der Zeile darunter steht die Übersetzung in die jeweilige Sprache – hier ins Deutsche.

Kompetenz Benchmark Fable 5.1 Fable 5 Opus 5 GPT-5.6 Sol 5.1 ggü. Fable 5
Agentische Forschung Terminal-Bench-Science 0.1
Terminal-Benchmark für agentische Forschung
52,6 % 24,7 % 29,0 % 22,4 % +27,9 Prozentpunkte
Agentisches Terminal-Programmieren Terminal-Bench 4.0
Benchmark für agentisches Programmieren im Terminal
55,8 % 42,0 % 52,3 % 37,3 % +13,8 Prozentpunkte
Fachliche Wissensarbeit GDPval-AA v2
Benchmark für reale, wirtschaftlich wertvolle Fachaufgaben
1853 1723 1824 1711 +130 Punkte
Computerbedienung OSWorld 2.0 — Partial
Benchmark für reale Computerbedienung: Teilabschluss-Punktzahl
77,9 % 72,9 % 75,4 % — +5,0 Prozentpunkte
Computerbedienung OSWorld 2.0 — Strict
Benchmark für reale Computerbedienung: strikte Erfolgsquote
41,7 % 36,1 % 39,6 % — +5,6 Prozentpunkte
Multidisziplinäres Denken Humanity's Last Exam — No tools
Letzte Prüfung der Menschheit: ohne Werkzeuge
60,9 % 57,8 % 56,6 % — +3,1 Prozentpunkte
Multidisziplinäres Denken Humanity's Last Exam — With tools
Letzte Prüfung der Menschheit: mit Werkzeugen
65,0 % 63,8 % 63,6 % — +1,2 Prozentpunkte
Geschäftsworkflows AutomationBench
Benchmark für anwendungsübergreifende Geschäftsautomatisierung
31,4 % 17,1 % 26,9 % 19,6 % +14,3 Prozentpunkte
Agentisches Programmieren CursorBench 3.2.0
Benchmark für reale Multi-Datei-Programmieraufgaben
73,4 % 70,5 % 70,0 % 67,2 % +2,9 Prozentpunkte

— bedeutet, dass die Haupttabelle von Anthropic für dieses Modell keinen Wert ausweist; es bedeutet nicht, dass das Modell die Aufgabe nicht bewältigen kann. Bei Terminal-Bench 4.0 erreicht Mythos 5.1 – das weniger Einschränkungen hat und nur für vertrauenswürdige Programme geöffnet ist – 60,9 %; dieser Artikel konzentriert sich auf das für normale Nutzer verfügbare Fable 5.1 und vermischt die Ergebnisse von Mythos nicht mit der Fable-Spalte.

Was Terminal-Bench-Science 0.1 misst

Terminal-Bench-Science 0.1 umfasst 70 reale Forschungsworkflows aus fünf Bereichen: Lebenswissenschaften, physikalische Wissenschaften, Geowissenschaften, Mathematik und Ingenieurwesen. Die Aufgaben sind keine Multiple-Choice-Fragen, sondern verlangen vom Agenten, Datenanalyse, statistische Inferenz, Simulation, Optimierung, Theorem-Beweise, Bildrekonstruktion oder wissenschaftliches maschinelles Lernen im Terminal durchzuführen und die Ergebnisse mit reproduzierbaren Tests zu prüfen.

Die 52,6 % von Fable 5.1 gegenüber 24,7 % für Fable 5 in den offiziellen Replikationsexperimenten bedeuten eine Steigerung um 27,9 Prozentpunkte – der deutlichste Sprung in der gesamten Tabelle. Allerdings weist Anthropic darauf hin, dass jedes Modell einen Standardfehler von etwa ±3,5–4,5 Prozentpunkten aufweist; die Nachkommastelle sollte daher nicht als exakte Rangfolge gelesen werden.

Was Terminal-Bench 4.0 und CursorBench 3.2.0 messen

Terminal-Bench lässt Agenten komplexe Aufgaben in einer realen Terminalumgebung bearbeiten. Im Mittelpunkt steht, ob sie die Umgebung verstehen, Werkzeuge aufrufen, Dateien ändern und schließlich die Validierung bestehen. Fable 5.1 erreicht 55,8 % – 13,8 Prozentpunkte mehr als Fable 5 und ebenfalls mehr als die 52,3 % von Opus 5.

CursorBench 3.2 basiert auf vagen Multi-Datei-Aufgaben aus realen Cursor-Sitzungen; Version 3.2 ergänzt Fragen zur Anweisungsbefolgung und zur fortgeschrittenen Tool-Nutzung. Fable 5.1 Max erreicht 73,4 % – der Vorsprung ist nicht so extrem wie bei Terminal-Bench-Science –, verbraucht aber durchschnittlich 72.060 Token pro Aufgabe bei Kosten von 9,64 $; Fable 5 Max benötigt 103.525 Token und kostet 17,32 $. Hier ist der Rückgang bei Token und Kosten für vergleichbare Aufgaben beachtlicher als die 2,9 Prozentpunkte selbst.

Was GDPval-AA v2 misst

GDPval-AA v2 verwendet 220 von Branchenfachleuten entwickelte Aufgaben aus 44 Berufen und neun Branchen, um zu bewerten, wie gut Modelle reale, wirtschaftlich wertvolle Wissensarbeit bewältigen. Die 1853 sind ein Gesamtwert, nicht 1853 %. Dieses Ergebnis zeigt, dass Fable 5.1 bei professionellen Dokumenten, Analysen und Arbeitsergebnissen Fable 5 übertrifft und Opus 5 leicht überlegen ist.

Warum OSWorld 2.0 zwei Werte hat

OSWorld 2.0 enthält 108 langkettige Computerbedienungs-Workflows; die mediane menschliche Bearbeitungszeit liegt bei etwa 1,6 Stunden pro Aufgabe. Partial vergibt anhand mehrerer Kontrollpunkte Teilpunkte für teilweise abgeschlossene Aufgaben; Strict wertet nur eine vollständige Zielerreichung als Erfolg.

Die 77,9 % (Partial) und 41,7 % (Strict) von Fable 5.1 widersprechen sich also nicht: Das Modell schafft oft die meisten Schritte, scheitert bei einem Teil der Aufgaben aber dennoch daran, sie durchgängig bis zum Ende abzuschließen. Das erinnert auch daran, dass ein Computer-Agent, der „ständig in Betrieb zu sein scheint“, nicht bedeutet, dass die Aufgabe erfolgreich abgeschlossen wurde.

Was Humanity's Last Exam misst

Humanity's Last Exam wurde vom Center for AI Safety und Scale AI erstellt und umfasst 2.500 interdisziplinäre Fragen auf Expertenniveau, die sich nicht durch einfaches Nachschlagen beantworten lassen. Ohne Werkzeuge liegt Fable 5.1 um 3,1 Prozentpunkte über Fable 5; mit erlaubten Werkzeugen sind es nur 1,2 Prozentpunkte. Fable 5.1 ist also tatsächlich stärker, aber nicht bei jedem Benchmark ergeben sich Verdopplungen.

Was AutomationBench misst

AutomationBench prüft, ob Agenten über simulierte SaaS-Tools wie CRM, E-Mail, Kalender, Messaging und Projektmanagement hinweg Workflows aus Vertrieb, Marketing, Betrieb, Kundenservice, Finanzen und Personalwesen ausführen können. Fable 5.1 steigt von 17,1 % auf 31,4 % – eine relative Verbesserung von etwa 84 %. Das zeigt substanzielle Fortschritte bei anwendungsübergreifendem Zustandsmanagement und der Ausführung langer Arbeitsschritte; zugleich macht die 31,4 % deutlich, dass eine unbeaufsichtigte Geschäftsautomatisierung dieser Art noch lange nicht gelöst ist.

Abdeckungsmatrix der Fähigkeiten von Fable 5.1 in sieben wichtigen Benchmark-Kategorien
Die sieben Benchmark-Kategorien decken Forschung, Terminal-Programmierung, fachliche Wissensarbeit, Computerbedienung, multidisziplinäres Denken, Geschäftsprozesse und Multi-Datei-Programmierung ab.

Was sich bei Fable 5.1 gegenüber Fable 5 verbessert hat

1. Weniger Abkürzungen bei langen Aufgaben

Anthropic positioniert Fable 5.1 als Modell für langlaufende Agenten: erst planen, dann Werkzeuge einsetzen, nach Fehlern erholen, Ergebnisse validieren und proaktiv über den Fortschritt berichten. Es legt mehr Wert darauf, die Grundursache zu beheben, anstatt lokale Umwege zu nehmen, nur um einen einzelnen Test möglichst schnell grün zu bekommen. Zu den offiziell genannten Zielanwendungen gehören Änderungen über Codebasen hinweg, Code-Reviews, Leistungsoptimierung, mehrtägige autonome Sitzungen, Recherche, Dokumente, Tabellen und Präsentationen.

2. Niedriger effort erreicht annähernd die Ergebnisse der teuren Vorgängerstufe

Fable 5.1 bietet neu die Möglichkeit, den effort pro Nachricht anzupassen. Die offizielle Kostenkurve zeigt, dass Fable 5.1 bei einigen Aufgaben schon mit Low- oder Medium-effort das Niveau von Fable 5 erreichen oder übertreffen kann, und zwar bei geringerem Token-Verbrauch und niedrigeren Kosten. Claude Code verwendet standardmäßig High effort; Claude.ai und Cowork verwenden standardmäßig Medium. Beim Modellvergleich muss daher zunächst der effort geprüft werden; Ergebnisse unterschiedlicher Stufen dürfen nicht einfach zusammengeworfen werden.

3. Lesbarer Fortschritt zwischen Tool-Aufrufen

Mit der neuen Testfunktion display: "updates" in der API kann das Modell zwischen Tool-Aufrufen für Nutzer lesbare Fortschrittsmeldungen ausgeben. Bei Aufgaben, die mehrere Stunden laufen, lässt sich so leichter erkennen, was das Modell gerade tut und ob es vom Ziel abkommt, als wenn man nur sieht, wie ständig neue Tool-Karten erscheinen.

4. Besser beim Schreiben, bei visueller Validierung und bei Selbsttests

Offiziellen Angaben zufolge schreibt 5.1 aktiv Tests, um seine eigenen Änderungen zu validieren, und nutzt visuelle Fähigkeiten, um Ausgaben gegen die Designziele zu prüfen. Auch die Rückmeldungen von Partnern heben kompaktere Fortschrittsmeldungen, vollständigere Antworten auf mehrteilige Fragen, die Nachverfolgung von Aufrufketten über mehrere Dienste hinweg sowie die Lesbarkeit auch nach langen Laufzeiten hervor. Dabei handelt es sich um qualitative Rückmeldungen, die nicht als einheitliche Benchmark-Ergebnisse ausgegeben werden sollten.

5. Sicherheitsfilter sind präziser, aber nicht verschwunden

Die Cybersicherheitsfilter von Fable 5.1 lösen im Vergleich zum Start von Fable 5 etwa 60 % seltener Fehlalarme aus; grundlegende biologische und medizinische Fragen führen rund 85 % seltener zu einer Herabstufung. Das Modell kann nun zum Auffinden von Software-Schwachstellen eingesetzt werden, aber Dual-Use-Aufgaben wie Penetrationstests, das Erzeugen von Exploit-Code oder das Scannen von Binärdateien auf Schwachstellen können weiterhin an Opus weitergeleitet werden. Weitergeleitete Anfragen werden nicht zu Fable-Preisen abgerechnet.

6. Herkunftsnachweis für Inhalte

Fable 5.1 führt Content-Provenienz ein. Generierter Text kann ein statistisches Wasserzeichen tragen, das sich mit dem Inhaltsprüfwerkzeug von Anthropic verifizieren lässt. Im Text selbst werden keine sichtbaren Markierungen angebracht. Für Content-Plattformen, Bildung und Unternehmensprüfungen ist das ein neues Verhalten, über das man sich im Voraus informieren sollte.

Sechs zentrale Verbesserungen von Fable 5.1 gegenüber der Vorgängergeneration
Die Änderungen von 5.1 betreffen lange Aufgaben, Effizienz bei niedrigem effort, Fortschrittsberichte, Selbstvalidierung, weniger Fehlalarme und die Herkunftskennzeichnung von Inhalten.

So berechnen sich die Kosten von Fable 5.1

Abrechnungsposten Preis bei Fable 5.1 Vergleich mit Fable 5
Eingabe 10 $ / 1 Mio. Token Gleich
Ausgabe 50 $ / 1 Mio. Token Gleich
Cache-Schreiben (5 Min.) 12,50 $ / 1 Mio. Token Gleiche Preisstufe
Cache-Schreiben (1 Std.) 20 $ / 1 Mio. Token Gleiche Preisstufe
Cache-Lesen 0,25 $ / 1 Mio. Token 75 % günstiger
Batch-API 50 % des Eingabe-/Ausgabepreises Gemäß Batch-Regeln

Angenommen, eine lange Aufgabe liest insgesamt 10 Millionen Cache-Token, erzeugt 200.000 neue Eingabe-Token und 50.000 Ausgabe-Token, ohne Berücksichtigung von Cache-Schreiben:

text
缓存读取:10 × $0.25 = $2.50
新输入:0.2 × $10 = $2.00
输出:0.05 × $50 = $2.50
合计:$7.00

Für dieselben 10 Millionen Cache-Zugriffe fallen bei Fable 5 etwa 10 $ an – allein hier liegt die Differenz bei 7,50 $. Anthropic schätzt auf dieser Grundlage, dass sich die tatsächlichen Kosten typischer, nach Token abgerechneter Aufgaben um etwa 25 % senken lassen; bei stark agentischen Aufgaben, die lange Kontexte häufig wiederverwenden, sind es maximal etwa 45 %. Das ist keine allgemeine Preissenkung der API-Listenpreise, sondern: Je mehr Cache-Treffer, desto größer die Ersparnis.

Abonnenten profitieren nicht unbedingt direkt von der API-Cache-Preissenkung

Bei Max sowie bei Premium-Sitzen von Team/Enterprise können bis zu 50 % der wöchentlichen Zuteilung für Fable-Modelle verwendet werden; Pro- und Standardsitze verbrauchen von Anfang an Usage-Credits. Maßgeblich für die konkrete Anzeige des Verbrauchs ist die Usage-Seite im Konto. Die Senkung der Cache-Lesepreise betrifft in erster Linie nach Token abgerechnete Szenarien; die 75-prozentige Cache-Preissenkung der API lässt sich also nicht einfach in „viermal so viel Nutzung im Max-Tarif“ umrechnen.

Kostenstruktur von Fable 5.1 für Eingabe, Ausgabe und Cache
Die Eingabe- und Ausgabepreise von Fable 5.1 sind unverändert; die wichtigste Preissenkung kommt vom Cache-Lesen – je mehr lange Kontexte wiederverwendet werden, desto größer der Vorteil.

Wie schnell ist Fable 5.1 wirklich?

Die Antwort lautet: Bei einzelnen Antworten ist es eher langsam, aber die Gesamtzeit für komplexe Aufgaben kann kürzer sein.

  • Im Modellkatalog von Anthropic ist Fable 5.1 als Slower eingestuft, Opus 5 als Moderate und Sonnet 5 als Fast.
  • Claude Code verwendet standardmäßig High effort und benötigt dadurch naturgemäß mehr Denkzeit als bei Low oder Medium.
  • Every gibt an, dass Fable 5.1 in ihrer eigenen Arbeitslast etwa doppelt so schnell ist wie Opus 5 und nur halb so viele Token verbraucht; das ist ein spezifischer Test eines Partners, keine allgemeine Geschwindigkeitsgarantie.
  • Bei CursorBench benötigt Fable 5.1 Max durchschnittlich 70 Schritte und 72.060 Token; Fable 5 Max braucht ebenfalls 72 Schritte, aber 103.525 Token. Der Vorteil von 5.1 ähnelt eher „weniger Umwege, weniger Token“ und zeigt sich nicht unbedingt in einem schnelleren ersten Zeichen.

Für Chat, kurze Codeabschnitte und häufige Interaktionen sind Sonnet 5 oder Opus 5 daher die erste Wahl; für die Fehlersuche über Codebasen hinweg, lange Recherchen und unbeaufsichtigte Aufgaben, die selbstständig validiert werden müssen, sollte man Fable 5.1 in Betracht ziehen.

Kompatibilitätsänderungen, die Sie vor dem Umstieg auf Fable 5.1 beachten müssen

Claude Code muss mindestens auf 2.1.250 aktualisiert werden

In den Hinweisen zu Tarifen und Verfügbarkeit von Anthropic wird Claude Code 2.1.250 oder höher vorausgesetzt. Wenn Fable 5.1 nicht angezeigt wird, prüfen Sie zuerst:

bash
claude --version

Aktualisieren Sie dann auf dem offiziell für Claude Code vorgesehenen Weg und starten Sie die Sitzung neu. Die API-Modell-ID von Fable 5.1 lautet:

text
claude-fable-5-1

Forced Tool Use kann direkt einen Fehler auslösen

Wenn die Anfrage das Modell zwingt, ein bestimmtes Werkzeug aufzurufen, kann Fable 5.1 einen Fehler zurückgeben. Prüfen Sie vor der Migration tool_choice und die Abläufe für erzwungene Tool-Aufrufe in Ihren eigenen Agenten; gehen Sie nicht davon aus, dass das Verhalten von Fable 5 vollständig kompatibel ist.

Thinking-Blöcke lassen sich nicht beliebig zwischen Modellen wiederverwenden

Ältere Modelle können die Thinking-Blöcke von Fable 5.1 nicht lesen. Beim Modellwechsel sollte das SDK diese Blöcke gemäß den offiziellen Regeln behandeln, anstatt sie unverändert an ein anderes Modell weiterzureichen.

Das Bearbeiten älterer Verläufe kann zu Fehler 400 führen

Bei neuen API-Konten, die nach dem 31. August 2026 erstellt wurden, sind Thinking-Blöcke nur im ursprünglichen Gesprächspräfix gültig, in dem sie erzeugt wurden. Wenn Sie system, tools oder frühere Nachrichten ändern und Thinking-Blöcke dann erneut abspielen, kann die Antwort 400 lauten. Offiziell wird empfohlen, den Verlauf append-only zu halten; wenn eine Verdichtung nötig ist, ersetzen Sie den gesamten alten Verlauf durch eine neue Zusammenfassung, anstatt alte Runden zu verändern und die ursprünglichen Thinking-Blöcke beizubehalten. Ausführliche Muster finden Sie im Leitfaden zu Prompting und Migration für Fable 5.1.

Wann sollten Sie Fable 5.1 wählen?

Geeignet für:

  • lange Aufgaben über mehrere Repositories, Dienste oder Anwendungen hinweg;
  • Agenten, die mehrere Stunden laufen und sich nach Fehlern selbstständig erholen müssen;
  • wissenschaftliche Forschung, komplexe Datenanalysen und mehrstufige professionelle Arbeitsergebnisse;
  • schwer reproduzierbare Systemprobleme, Leistungsoptimierung und Ursachenanalyse;
  • API-Workloads, die lange Kontexte stark wiederverwenden und einen hohen Anteil an Cache-Reads aufweisen.

Nicht geeignet für:

  • einfache Chats, kurze Texte oder kleine Änderungen an einzelnen Dateien;
  • Echtzeitinteraktionen, die sehr empfindlich auf die Zeit bis zum ersten Zeichen reagieren;
  • ausgabeintensive Aufgaben mit festem Budget ohne Cache-Wiederverwendung;
  • Szenarien, in denen die standardmäßige 30-tägige Aufbewahrung von Sicherheitsüberwachungsdaten nicht akzeptabel ist und keine Ausnahmeregelung für Unternehmen greift;
  • Workflows, bei denen alle Cybersicherheits- oder Lebenswissenschaftsanfragen ohne Herabstufung durchlaufen sollen.

Lange Aufgaben aus der Ferne verfolgen

Der Wert von Fable 5.1 zeigt sich oft bei Aufgaben, die mehrere Stunden oder sogar Tage dauern – das bedeutet aber nicht, dass Sie dauerhaft vor dem Entwicklungsrechner sitzen müssen. Vergewissern Sie sich zunächst im lokalen Claude Code 2.1.250+, dass Fable 5.1 verfügbar ist. Über den PandaNpc Agent können Sie dann vom Browser, Desktop oder Handy aus auf die Claude-Code-Sitzungen auf demselben Entwicklungsrechner zugreifen, Interaktionen bearbeiten und weitere Anweisungen erteilen.

Geändert wird nur der Zugang für die Steuerung; Code, Tools und Builds laufen weiterhin auf Ihrem Entwicklungsrechner. Lesen Sie zunächst den Leitfaden für den Remote-Zugriff auf Claude Code und das Tutorial: Claude Code per Handy verbinden. Erst wenn die Remote-Verbindung bestätigt ist, sollten Sie Fable 5.1 lange Aufgaben ausführen lassen.

Häufig gestellte Fragen (FAQ)

Wie viel besser ist Fable 5.1 als Fable 5?

Die Unterschiede fallen je nach Aufgabe sehr unterschiedlich aus. Bei Terminal-Bench-Science sind es +27,9 Prozentpunkte, bei AutomationBench +14,3 Prozentpunkte; bei HLE mit Werkzeugen sind es nur +1,2 Prozentpunkte. Der einzelne größte Anstieg lässt sich nicht auf alle Aufgaben verallgemeinern.

Ist Fable 5.1 schneller als Opus 5?

In der offiziellen Tabelle zur relativen Latenz ist Fable 5.1 „langsamer“, Opus 5 „mittel“. Einige Partner beobachten bei vollständigen Aufgaben, dass Fable 5.1 schneller ist, weil es weniger Token verbraucht und weniger Nacharbeit anfällt. Diese beiden Aussagen messen nicht dasselbe.

Ist Fable 5.1 besser für die Programmierung geeignet als GPT-5.6 Sol?

In der Veröffentlichungstabelle von Anthropic liegt Fable 5.1 bei Terminal-Bench-Science, Terminal-Bench, AutomationBench und CursorBench vorn. Da die Modelle jedoch unterschiedliche Agent-Harnesses, effort, Werkzeuge und Preise verwenden, lässt sich daraus nicht ableiten, dass Fable bei allen realen Repositories gewinnt. Sie können sich am Tutorial zur Konfiguration von GPT-5.6 Sol mit 1M-Kontext orientieren und anschließend A/B-Tests mit eigenen repräsentativen Aufgaben durchführen.

Warum wechselt Fable 5.1 plötzlich zu Opus?

Einige Cybersicherheits- und Lebenswissenschaftsanfragen werden von den Safeguards an Opus weitergeleitet. Ein Modellwechsel ist nicht unbedingt ein Fehler; Anthropic gibt an, dass solche weitergeleiteten Anfragen nicht zu Fable-Preisen abgerechnet werden.

Hat Fable 5.1 ein Wasserzeichen?

Es gibt einen statistischen Content-Provenienz-Mechanismus, der auf der Textoberfläche jedoch keine sichtbaren Kennzeichnungen anbringt. Das ist nicht dasselbe wie ein sichtbares Wasserzeichen in der Ecke eines Bildes.

Fazit

Die deutlichsten Fortschritte von Claude Fable 5.1 zeigen sich bei wissenschaftlicher Forschung, Terminal-Aufgaben und anwendungsübergreifenden Geschäftsworkflows: Das Modell kann Aufgaben ausdauernder ausführen, Fehler beheben, Ergebnisse validieren und senkt dank günstigerer Cache-Reads die Kosten langer Aufgaben. Dennoch bleibt es teuer, bei einzelnen Antwortrunden eher langsam und bringt Kompatibilitätsänderungen bei Thinking-Blöcken, erzwungenen Tool-Aufrufen und der Bearbeitung von Verläufen mit sich.

Die richtige Frage bei der Wahl ist nicht „Ist es bei Benchmarks die Nummer eins?“, sondern: Ist Ihre Aufgabe lang und komplex genug, und sind die Kosten für Fehler und Nacharbeit hoch genug, um Fable 5.1 zu rechtfertigen? Wenn die Antwort Nein lautet, ist es meist sinnvoller, mit Opus 5 oder Sonnet 5 zu beginnen.