Claude Fable 5.1 im Detail: Benchmarks, Verbesserungen, Preis und Geschwindigkeit
Die vollständigen Ergebnisse von Claude Fable 5.1 in 7 gängigen Benchmark-Kategorien, im Einzelnen verglichen mit Fable 5, Opus 5 und GPT-5.6 Sol, sowie Erläuterungen zu den Langzeitaufgaben, Tool-Aufrufen, Cache-Gebühren, Geschwindigkeit, Tariflimits und Migrationsänderungen von 5.1.

Claude Fable 5.1 wurde am 1. September 2026 offiziell veröffentlicht. Vorweg das Fazit: Es handelt sich nicht um ein gewöhnliches Modell-Upgrade für allgemeine Fragen und Antworten, sondern um ein hochpreisiges Flaggschiff-Modell für langlaufende Programmieraufgaben, komplexe Recherchen, anwendungsübergreifende Tool-Aufrufe und unbeaufsichtigte Agenten. In den sieben von Anthropic veröffentlichten Kategorien etablierter Benchmarks übertrifft Fable 5.1 Fable 5 in allen Bereichen; der API-Preis pro Token ist jedoch weiterhin doppelt so hoch wie bei Opus 5, und die relative Latenz wird offiziell als „langsamer“ eingestuft.
Wenn Ihre Aufgabe lediglich darin besteht, eine Datei zu ändern, einen kurzen Text zu schreiben oder alltägliche Fragen zu beantworten, empfiehlt Anthropic weiterhin, mit Opus 5 zu beginnen. Fable 5.1 ist besser geeignet für langkettige Aufgaben, die normale Modelle selbst bei hohem effort nicht zuverlässig abschließen können. Dieser Artikel führt die offiziellen Veröffentlichungsdaten, die Bedeutung der einzelnen Benchmarks, die konkreten Verbesserungen von 5.1, Preise, Geschwindigkeit und Migrationseinschränkungen zusammen, damit Sie nicht nur eine einzelne „Wer hat gewonnen“-Bestwerttabelle betrachten.
Die Spezifikationen von Fable 5.1 auf einen Blick
| Eigenschaft | Claude Fable 5.1 | Claude Opus 5 | Claude Sonnet 5 |
|---|---|---|---|
| Kontextfenster | 1M Token | 1M Token | 1M Token |
| Maximale Ausgabe | 128K Token | 128K Token | 128K Token |
| Eingabepreis | 10 $ / MTok | 5 $ / MTok | 2 $ / MTok |
| Ausgabepreis | 50 $ / MTok | 25 $ / MTok | 10 $ / MTok |
| Relative Latenz | Langsamer | Mittel | Schnell |
| Thinking | Adaptiv, stets aktiv | Adaptiv | Adaptiv |
| Standard-effort | High | High | High |
| Zuverlässiger Wissensstand | Juni 2026 | Mai 2026 | Januar 2026 |
Die Angabe „langsamer“ stammt aus dem Anthropic-Modellkatalog und kennzeichnet die Stufe der relativen Latenz, nicht eine feste Anzahl von Token pro Sekunde. Wie lange die Bearbeitung einer Aufgabe tatsächlich dauert, hängt außerdem von effort, der Anzahl der Tool-Aufruf-Runden, der Cache-Trefferquote, der Kontextlänge und der Anzahl der Wiederholungen nach Fehlern ab.
Vollständige Tabelle der wichtigsten Benchmarks von Fable 5.1
Die folgende Tabelle übernimmt direkt die Haupttabelle der Anthropic-Veröffentlichung vom 1. September 2026. Um Fehlinterpretationen zu vermeiden, werden Prozentwerte, die Rohpunktzahl von GDPval-AA, die Partial-/Strict-Ergebnisse von OSWorld sowie die HLE-Ergebnisse mit und ohne Werkzeuge getrennt aufgeführt. Jeder Benchmark behält seinen offiziellen englischen Namen; in der Zeile darunter steht die Übersetzung in die jeweilige Sprache – hier ins Deutsche.
| Kompetenz | Benchmark | Fable 5.1 | Fable 5 | Opus 5 | GPT-5.6 Sol | 5.1 ggü. Fable 5 |
|---|---|---|---|---|---|---|
| Agentische Forschung | Terminal-Bench-Science 0.1 Terminal-Benchmark für agentische Forschung |
52,6 % | 24,7 % | 29,0 % | 22,4 % | +27,9 Prozentpunkte |
| Agentisches Terminal-Programmieren | Terminal-Bench 4.0 Benchmark für agentisches Programmieren im Terminal |
55,8 % | 42,0 % | 52,3 % | 37,3 % | +13,8 Prozentpunkte |
| Fachliche Wissensarbeit | GDPval-AA v2 Benchmark für reale, wirtschaftlich wertvolle Fachaufgaben |
1853 | 1723 | 1824 | 1711 | +130 Punkte |
| Computerbedienung | OSWorld 2.0 — Partial Benchmark für reale Computerbedienung: Teilabschluss-Punktzahl |
77,9 % | 72,9 % | 75,4 % | — | +5,0 Prozentpunkte |
| Computerbedienung | OSWorld 2.0 — Strict Benchmark für reale Computerbedienung: strikte Erfolgsquote |
41,7 % | 36,1 % | 39,6 % | — | +5,6 Prozentpunkte |
| Multidisziplinäres Denken | Humanity's Last Exam — No tools Letzte Prüfung der Menschheit: ohne Werkzeuge |
60,9 % | 57,8 % | 56,6 % | — | +3,1 Prozentpunkte |
| Multidisziplinäres Denken | Humanity's Last Exam — With tools Letzte Prüfung der Menschheit: mit Werkzeugen |
65,0 % | 63,8 % | 63,6 % | — | +1,2 Prozentpunkte |
| Geschäftsworkflows | AutomationBench Benchmark für anwendungsübergreifende Geschäftsautomatisierung |
31,4 % | 17,1 % | 26,9 % | 19,6 % | +14,3 Prozentpunkte |
| Agentisches Programmieren | CursorBench 3.2.0 Benchmark für reale Multi-Datei-Programmieraufgaben |
73,4 % | 70,5 % | 70,0 % | 67,2 % | +2,9 Prozentpunkte |
— bedeutet, dass die Haupttabelle von Anthropic für dieses Modell keinen Wert ausweist; es bedeutet nicht, dass das Modell die Aufgabe nicht bewältigen kann. Bei Terminal-Bench 4.0 erreicht Mythos 5.1 – das weniger Einschränkungen hat und nur für vertrauenswürdige Programme geöffnet ist – 60,9 %; dieser Artikel konzentriert sich auf das für normale Nutzer verfügbare Fable 5.1 und vermischt die Ergebnisse von Mythos nicht mit der Fable-Spalte.
Was Terminal-Bench-Science 0.1 misst
Terminal-Bench-Science 0.1 umfasst 70 reale Forschungsworkflows aus fünf Bereichen: Lebenswissenschaften, physikalische Wissenschaften, Geowissenschaften, Mathematik und Ingenieurwesen. Die Aufgaben sind keine Multiple-Choice-Fragen, sondern verlangen vom Agenten, Datenanalyse, statistische Inferenz, Simulation, Optimierung, Theorem-Beweise, Bildrekonstruktion oder wissenschaftliches maschinelles Lernen im Terminal durchzuführen und die Ergebnisse mit reproduzierbaren Tests zu prüfen.
Die 52,6 % von Fable 5.1 gegenüber 24,7 % für Fable 5 in den offiziellen Replikationsexperimenten bedeuten eine Steigerung um 27,9 Prozentpunkte – der deutlichste Sprung in der gesamten Tabelle. Allerdings weist Anthropic darauf hin, dass jedes Modell einen Standardfehler von etwa ±3,5–4,5 Prozentpunkten aufweist; die Nachkommastelle sollte daher nicht als exakte Rangfolge gelesen werden.
Was Terminal-Bench 4.0 und CursorBench 3.2.0 messen
Terminal-Bench lässt Agenten komplexe Aufgaben in einer realen Terminalumgebung bearbeiten. Im Mittelpunkt steht, ob sie die Umgebung verstehen, Werkzeuge aufrufen, Dateien ändern und schließlich die Validierung bestehen. Fable 5.1 erreicht 55,8 % – 13,8 Prozentpunkte mehr als Fable 5 und ebenfalls mehr als die 52,3 % von Opus 5.
CursorBench 3.2 basiert auf vagen Multi-Datei-Aufgaben aus realen Cursor-Sitzungen; Version 3.2 ergänzt Fragen zur Anweisungsbefolgung und zur fortgeschrittenen Tool-Nutzung. Fable 5.1 Max erreicht 73,4 % – der Vorsprung ist nicht so extrem wie bei Terminal-Bench-Science –, verbraucht aber durchschnittlich 72.060 Token pro Aufgabe bei Kosten von 9,64 $; Fable 5 Max benötigt 103.525 Token und kostet 17,32 $. Hier ist der Rückgang bei Token und Kosten für vergleichbare Aufgaben beachtlicher als die 2,9 Prozentpunkte selbst.
Was GDPval-AA v2 misst
GDPval-AA v2 verwendet 220 von Branchenfachleuten entwickelte Aufgaben aus 44 Berufen und neun Branchen, um zu bewerten, wie gut Modelle reale, wirtschaftlich wertvolle Wissensarbeit bewältigen. Die 1853 sind ein Gesamtwert, nicht 1853 %. Dieses Ergebnis zeigt, dass Fable 5.1 bei professionellen Dokumenten, Analysen und Arbeitsergebnissen Fable 5 übertrifft und Opus 5 leicht überlegen ist.
Warum OSWorld 2.0 zwei Werte hat
OSWorld 2.0 enthält 108 langkettige Computerbedienungs-Workflows; die mediane menschliche Bearbeitungszeit liegt bei etwa 1,6 Stunden pro Aufgabe. Partial vergibt anhand mehrerer Kontrollpunkte Teilpunkte für teilweise abgeschlossene Aufgaben; Strict wertet nur eine vollständige Zielerreichung als Erfolg.
Die 77,9 % (Partial) und 41,7 % (Strict) von Fable 5.1 widersprechen sich also nicht: Das Modell schafft oft die meisten Schritte, scheitert bei einem Teil der Aufgaben aber dennoch daran, sie durchgängig bis zum Ende abzuschließen. Das erinnert auch daran, dass ein Computer-Agent, der „ständig in Betrieb zu sein scheint“, nicht bedeutet, dass die Aufgabe erfolgreich abgeschlossen wurde.
Was Humanity's Last Exam misst
Humanity's Last Exam wurde vom Center for AI Safety und Scale AI erstellt und umfasst 2.500 interdisziplinäre Fragen auf Expertenniveau, die sich nicht durch einfaches Nachschlagen beantworten lassen. Ohne Werkzeuge liegt Fable 5.1 um 3,1 Prozentpunkte über Fable 5; mit erlaubten Werkzeugen sind es nur 1,2 Prozentpunkte. Fable 5.1 ist also tatsächlich stärker, aber nicht bei jedem Benchmark ergeben sich Verdopplungen.
Was AutomationBench misst
AutomationBench prüft, ob Agenten über simulierte SaaS-Tools wie CRM, E-Mail, Kalender, Messaging und Projektmanagement hinweg Workflows aus Vertrieb, Marketing, Betrieb, Kundenservice, Finanzen und Personalwesen ausführen können. Fable 5.1 steigt von 17,1 % auf 31,4 % – eine relative Verbesserung von etwa 84 %. Das zeigt substanzielle Fortschritte bei anwendungsübergreifendem Zustandsmanagement und der Ausführung langer Arbeitsschritte; zugleich macht die 31,4 % deutlich, dass eine unbeaufsichtigte Geschäftsautomatisierung dieser Art noch lange nicht gelöst ist.
Was sich bei Fable 5.1 gegenüber Fable 5 verbessert hat
1. Weniger Abkürzungen bei langen Aufgaben
Anthropic positioniert Fable 5.1 als Modell für langlaufende Agenten: erst planen, dann Werkzeuge einsetzen, nach Fehlern erholen, Ergebnisse validieren und proaktiv über den Fortschritt berichten. Es legt mehr Wert darauf, die Grundursache zu beheben, anstatt lokale Umwege zu nehmen, nur um einen einzelnen Test möglichst schnell grün zu bekommen. Zu den offiziell genannten Zielanwendungen gehören Änderungen über Codebasen hinweg, Code-Reviews, Leistungsoptimierung, mehrtägige autonome Sitzungen, Recherche, Dokumente, Tabellen und Präsentationen.
2. Niedriger effort erreicht annähernd die Ergebnisse der teuren Vorgängerstufe
Fable 5.1 bietet neu die Möglichkeit, den effort pro Nachricht anzupassen. Die offizielle Kostenkurve zeigt, dass Fable 5.1 bei einigen Aufgaben schon mit Low- oder Medium-effort das Niveau von Fable 5 erreichen oder übertreffen kann, und zwar bei geringerem Token-Verbrauch und niedrigeren Kosten. Claude Code verwendet standardmäßig High effort; Claude.ai und Cowork verwenden standardmäßig Medium. Beim Modellvergleich muss daher zunächst der effort geprüft werden; Ergebnisse unterschiedlicher Stufen dürfen nicht einfach zusammengeworfen werden.
3. Lesbarer Fortschritt zwischen Tool-Aufrufen
Mit der neuen Testfunktion display: "updates" in der API kann das Modell zwischen Tool-Aufrufen für Nutzer lesbare Fortschrittsmeldungen ausgeben. Bei Aufgaben, die mehrere Stunden laufen, lässt sich so leichter erkennen, was das Modell gerade tut und ob es vom Ziel abkommt, als wenn man nur sieht, wie ständig neue Tool-Karten erscheinen.
4. Besser beim Schreiben, bei visueller Validierung und bei Selbsttests
Offiziellen Angaben zufolge schreibt 5.1 aktiv Tests, um seine eigenen Änderungen zu validieren, und nutzt visuelle Fähigkeiten, um Ausgaben gegen die Designziele zu prüfen. Auch die Rückmeldungen von Partnern heben kompaktere Fortschrittsmeldungen, vollständigere Antworten auf mehrteilige Fragen, die Nachverfolgung von Aufrufketten über mehrere Dienste hinweg sowie die Lesbarkeit auch nach langen Laufzeiten hervor. Dabei handelt es sich um qualitative Rückmeldungen, die nicht als einheitliche Benchmark-Ergebnisse ausgegeben werden sollten.
5. Sicherheitsfilter sind präziser, aber nicht verschwunden
Die Cybersicherheitsfilter von Fable 5.1 lösen im Vergleich zum Start von Fable 5 etwa 60 % seltener Fehlalarme aus; grundlegende biologische und medizinische Fragen führen rund 85 % seltener zu einer Herabstufung. Das Modell kann nun zum Auffinden von Software-Schwachstellen eingesetzt werden, aber Dual-Use-Aufgaben wie Penetrationstests, das Erzeugen von Exploit-Code oder das Scannen von Binärdateien auf Schwachstellen können weiterhin an Opus weitergeleitet werden. Weitergeleitete Anfragen werden nicht zu Fable-Preisen abgerechnet.
6. Herkunftsnachweis für Inhalte
Fable 5.1 führt Content-Provenienz ein. Generierter Text kann ein statistisches Wasserzeichen tragen, das sich mit dem Inhaltsprüfwerkzeug von Anthropic verifizieren lässt. Im Text selbst werden keine sichtbaren Markierungen angebracht. Für Content-Plattformen, Bildung und Unternehmensprüfungen ist das ein neues Verhalten, über das man sich im Voraus informieren sollte.
So berechnen sich die Kosten von Fable 5.1
| Abrechnungsposten | Preis bei Fable 5.1 | Vergleich mit Fable 5 |
|---|---|---|
| Eingabe | 10 $ / 1 Mio. Token | Gleich |
| Ausgabe | 50 $ / 1 Mio. Token | Gleich |
| Cache-Schreiben (5 Min.) | 12,50 $ / 1 Mio. Token | Gleiche Preisstufe |
| Cache-Schreiben (1 Std.) | 20 $ / 1 Mio. Token | Gleiche Preisstufe |
| Cache-Lesen | 0,25 $ / 1 Mio. Token | 75 % günstiger |
| Batch-API | 50 % des Eingabe-/Ausgabepreises | Gemäß Batch-Regeln |
Angenommen, eine lange Aufgabe liest insgesamt 10 Millionen Cache-Token, erzeugt 200.000 neue Eingabe-Token und 50.000 Ausgabe-Token, ohne Berücksichtigung von Cache-Schreiben:
缓存读取:10 × $0.25 = $2.50
新输入:0.2 × $10 = $2.00
输出:0.05 × $50 = $2.50
合计:$7.00Für dieselben 10 Millionen Cache-Zugriffe fallen bei Fable 5 etwa 10 $ an – allein hier liegt die Differenz bei 7,50 $. Anthropic schätzt auf dieser Grundlage, dass sich die tatsächlichen Kosten typischer, nach Token abgerechneter Aufgaben um etwa 25 % senken lassen; bei stark agentischen Aufgaben, die lange Kontexte häufig wiederverwenden, sind es maximal etwa 45 %. Das ist keine allgemeine Preissenkung der API-Listenpreise, sondern: Je mehr Cache-Treffer, desto größer die Ersparnis.
Abonnenten profitieren nicht unbedingt direkt von der API-Cache-Preissenkung
Bei Max sowie bei Premium-Sitzen von Team/Enterprise können bis zu 50 % der wöchentlichen Zuteilung für Fable-Modelle verwendet werden; Pro- und Standardsitze verbrauchen von Anfang an Usage-Credits. Maßgeblich für die konkrete Anzeige des Verbrauchs ist die Usage-Seite im Konto. Die Senkung der Cache-Lesepreise betrifft in erster Linie nach Token abgerechnete Szenarien; die 75-prozentige Cache-Preissenkung der API lässt sich also nicht einfach in „viermal so viel Nutzung im Max-Tarif“ umrechnen.
Wie schnell ist Fable 5.1 wirklich?
Die Antwort lautet: Bei einzelnen Antworten ist es eher langsam, aber die Gesamtzeit für komplexe Aufgaben kann kürzer sein.
- Im Modellkatalog von Anthropic ist Fable 5.1 als
Slowereingestuft, Opus 5 alsModerateund Sonnet 5 alsFast. - Claude Code verwendet standardmäßig High effort und benötigt dadurch naturgemäß mehr Denkzeit als bei Low oder Medium.
- Every gibt an, dass Fable 5.1 in ihrer eigenen Arbeitslast etwa doppelt so schnell ist wie Opus 5 und nur halb so viele Token verbraucht; das ist ein spezifischer Test eines Partners, keine allgemeine Geschwindigkeitsgarantie.
- Bei CursorBench benötigt Fable 5.1 Max durchschnittlich 70 Schritte und 72.060 Token; Fable 5 Max braucht ebenfalls 72 Schritte, aber 103.525 Token. Der Vorteil von 5.1 ähnelt eher „weniger Umwege, weniger Token“ und zeigt sich nicht unbedingt in einem schnelleren ersten Zeichen.
Für Chat, kurze Codeabschnitte und häufige Interaktionen sind Sonnet 5 oder Opus 5 daher die erste Wahl; für die Fehlersuche über Codebasen hinweg, lange Recherchen und unbeaufsichtigte Aufgaben, die selbstständig validiert werden müssen, sollte man Fable 5.1 in Betracht ziehen.
Kompatibilitätsänderungen, die Sie vor dem Umstieg auf Fable 5.1 beachten müssen
Claude Code muss mindestens auf 2.1.250 aktualisiert werden
In den Hinweisen zu Tarifen und Verfügbarkeit von Anthropic wird Claude Code 2.1.250 oder höher vorausgesetzt. Wenn Fable 5.1 nicht angezeigt wird, prüfen Sie zuerst:
claude --versionAktualisieren Sie dann auf dem offiziell für Claude Code vorgesehenen Weg und starten Sie die Sitzung neu. Die API-Modell-ID von Fable 5.1 lautet:
claude-fable-5-1Forced Tool Use kann direkt einen Fehler auslösen
Wenn die Anfrage das Modell zwingt, ein bestimmtes Werkzeug aufzurufen, kann Fable 5.1 einen Fehler zurückgeben. Prüfen Sie vor der Migration tool_choice und die Abläufe für erzwungene Tool-Aufrufe in Ihren eigenen Agenten; gehen Sie nicht davon aus, dass das Verhalten von Fable 5 vollständig kompatibel ist.
Thinking-Blöcke lassen sich nicht beliebig zwischen Modellen wiederverwenden
Ältere Modelle können die Thinking-Blöcke von Fable 5.1 nicht lesen. Beim Modellwechsel sollte das SDK diese Blöcke gemäß den offiziellen Regeln behandeln, anstatt sie unverändert an ein anderes Modell weiterzureichen.
Das Bearbeiten älterer Verläufe kann zu Fehler 400 führen
Bei neuen API-Konten, die nach dem 31. August 2026 erstellt wurden, sind Thinking-Blöcke nur im ursprünglichen Gesprächspräfix gültig, in dem sie erzeugt wurden. Wenn Sie system, tools oder frühere Nachrichten ändern und Thinking-Blöcke dann erneut abspielen, kann die Antwort 400 lauten. Offiziell wird empfohlen, den Verlauf append-only zu halten; wenn eine Verdichtung nötig ist, ersetzen Sie den gesamten alten Verlauf durch eine neue Zusammenfassung, anstatt alte Runden zu verändern und die ursprünglichen Thinking-Blöcke beizubehalten. Ausführliche Muster finden Sie im Leitfaden zu Prompting und Migration für Fable 5.1.
Wann sollten Sie Fable 5.1 wählen?
Geeignet für:
- lange Aufgaben über mehrere Repositories, Dienste oder Anwendungen hinweg;
- Agenten, die mehrere Stunden laufen und sich nach Fehlern selbstständig erholen müssen;
- wissenschaftliche Forschung, komplexe Datenanalysen und mehrstufige professionelle Arbeitsergebnisse;
- schwer reproduzierbare Systemprobleme, Leistungsoptimierung und Ursachenanalyse;
- API-Workloads, die lange Kontexte stark wiederverwenden und einen hohen Anteil an Cache-Reads aufweisen.
Nicht geeignet für:
- einfache Chats, kurze Texte oder kleine Änderungen an einzelnen Dateien;
- Echtzeitinteraktionen, die sehr empfindlich auf die Zeit bis zum ersten Zeichen reagieren;
- ausgabeintensive Aufgaben mit festem Budget ohne Cache-Wiederverwendung;
- Szenarien, in denen die standardmäßige 30-tägige Aufbewahrung von Sicherheitsüberwachungsdaten nicht akzeptabel ist und keine Ausnahmeregelung für Unternehmen greift;
- Workflows, bei denen alle Cybersicherheits- oder Lebenswissenschaftsanfragen ohne Herabstufung durchlaufen sollen.
Lange Aufgaben aus der Ferne verfolgen
Der Wert von Fable 5.1 zeigt sich oft bei Aufgaben, die mehrere Stunden oder sogar Tage dauern – das bedeutet aber nicht, dass Sie dauerhaft vor dem Entwicklungsrechner sitzen müssen. Vergewissern Sie sich zunächst im lokalen Claude Code 2.1.250+, dass Fable 5.1 verfügbar ist. Über den PandaNpc Agent können Sie dann vom Browser, Desktop oder Handy aus auf die Claude-Code-Sitzungen auf demselben Entwicklungsrechner zugreifen, Interaktionen bearbeiten und weitere Anweisungen erteilen.
Geändert wird nur der Zugang für die Steuerung; Code, Tools und Builds laufen weiterhin auf Ihrem Entwicklungsrechner. Lesen Sie zunächst den Leitfaden für den Remote-Zugriff auf Claude Code und das Tutorial: Claude Code per Handy verbinden. Erst wenn die Remote-Verbindung bestätigt ist, sollten Sie Fable 5.1 lange Aufgaben ausführen lassen.
Häufig gestellte Fragen (FAQ)
Wie viel besser ist Fable 5.1 als Fable 5?
Die Unterschiede fallen je nach Aufgabe sehr unterschiedlich aus. Bei Terminal-Bench-Science sind es +27,9 Prozentpunkte, bei AutomationBench +14,3 Prozentpunkte; bei HLE mit Werkzeugen sind es nur +1,2 Prozentpunkte. Der einzelne größte Anstieg lässt sich nicht auf alle Aufgaben verallgemeinern.
Ist Fable 5.1 schneller als Opus 5?
In der offiziellen Tabelle zur relativen Latenz ist Fable 5.1 „langsamer“, Opus 5 „mittel“. Einige Partner beobachten bei vollständigen Aufgaben, dass Fable 5.1 schneller ist, weil es weniger Token verbraucht und weniger Nacharbeit anfällt. Diese beiden Aussagen messen nicht dasselbe.
Ist Fable 5.1 besser für die Programmierung geeignet als GPT-5.6 Sol?
In der Veröffentlichungstabelle von Anthropic liegt Fable 5.1 bei Terminal-Bench-Science, Terminal-Bench, AutomationBench und CursorBench vorn. Da die Modelle jedoch unterschiedliche Agent-Harnesses, effort, Werkzeuge und Preise verwenden, lässt sich daraus nicht ableiten, dass Fable bei allen realen Repositories gewinnt. Sie können sich am Tutorial zur Konfiguration von GPT-5.6 Sol mit 1M-Kontext orientieren und anschließend A/B-Tests mit eigenen repräsentativen Aufgaben durchführen.
Warum wechselt Fable 5.1 plötzlich zu Opus?
Einige Cybersicherheits- und Lebenswissenschaftsanfragen werden von den Safeguards an Opus weitergeleitet. Ein Modellwechsel ist nicht unbedingt ein Fehler; Anthropic gibt an, dass solche weitergeleiteten Anfragen nicht zu Fable-Preisen abgerechnet werden.
Hat Fable 5.1 ein Wasserzeichen?
Es gibt einen statistischen Content-Provenienz-Mechanismus, der auf der Textoberfläche jedoch keine sichtbaren Kennzeichnungen anbringt. Das ist nicht dasselbe wie ein sichtbares Wasserzeichen in der Ecke eines Bildes.
Fazit
Die deutlichsten Fortschritte von Claude Fable 5.1 zeigen sich bei wissenschaftlicher Forschung, Terminal-Aufgaben und anwendungsübergreifenden Geschäftsworkflows: Das Modell kann Aufgaben ausdauernder ausführen, Fehler beheben, Ergebnisse validieren und senkt dank günstigerer Cache-Reads die Kosten langer Aufgaben. Dennoch bleibt es teuer, bei einzelnen Antwortrunden eher langsam und bringt Kompatibilitätsänderungen bei Thinking-Blöcken, erzwungenen Tool-Aufrufen und der Bearbeitung von Verläufen mit sich.
Die richtige Frage bei der Wahl ist nicht „Ist es bei Benchmarks die Nummer eins?“, sondern: Ist Ihre Aufgabe lang und komplex genug, und sind die Kosten für Fehler und Nacharbeit hoch genug, um Fable 5.1 zu rechtfertigen? Wenn die Antwort Nein lautet, ist es meist sinnvoller, mit Opus 5 oder Sonnet 5 zu beginnen.
Verwandte Anleitungen

Codex: GPT-5.6 Sol 1M-Kontext aktivieren: 3-Zeilen-`config.toml`-Konfigurationstutorial
GPT-5.6 Sol unterstützt offiziell einen Kontext von 1,05 Millionen Token. Fügen Sie einfach 3 Zeilen Konfiguration am Anfang der config.toml von Codex hinzu, um mit einem 1-Millionen-Fenster zu laufen und den Verlauf bei etwa 900.000 Token automatisch zu komprimieren. Inklusive permanenter Konfiguration, Einzelbefehl, Verifizierung und Kostenerinnerung.
Artikel lesen →
Claude Code Remote Control: So funktioniert's – Fernsteuerung per Handy, offizielle Einschränkungen und Alternativen (2026)
Wie aktiviert man Claude Code Remote Control? Dieser Artikel stellt drei offizielle Nutzungsmöglichkeiten vor: claude remote-control, claude --remote-control und /remote-control, erläutert die Verbindung von Handy und Browser, Kontenanforderungen, Verifizierungsmethoden und häufige Fehlermeldungen und vergleicht die PandaNpc-Lösung in Szenarien mit benutzerdefinierten Modellen, Codex und mehreren Maschinen.
Artikel lesen →
Claude Code auf dem Handy: Sitzungen und Genehmigungen jederzeit auf iOS ansehen
Dieser Artikel richtet sich an Entwickler und teilt Best Practices für die Verbindung mit Claude Code über das Handy. Mit der PandaNpc iOS-App können Sie Sitzungen in Echtzeit anzeigen, Tool-Aufrufe genehmigen und auf Fragen antworten. Mit pandapaw und iOS Live Activity lässt sich eine effiziente Fernsteuerung erreichen und die Codierungsflexibilität erhöhen.
Artikel lesen →