GPT-6 Sol vs Claude Opus 5.5: Preis, Benchmarks und Programmieraufgaben – wie wählen?

Für allgemeine API-Programmieraufgaben sollten Sie zuerst GPT-6 Sol ausprobieren; bei komplexen Aufgaben können Sie Claude Opus 5.5 vergleichen und anschließend GPT-6 Astra sowie Claude Fable 5.1 als Optionen für hohe Schwierigkeitsgrade heranziehen. Dieser Artikel prüft die offiziellen Spezifikationen der vier Modelle, Cache- und Batch-Preise sowie Third-Party-Benchmark-Ergebnisse nach einheitlichem Maßstab und bietet fünf nachrechenbare Kostenszenarien.

PandaNpcErstveröffentlicht am
GPT-6 Sol vs Claude Opus 5.5: Preis, Benchmarks und Programmieraufgaben – wie wählen?

Das Wichtigste zuerst: Für allgemeine API-Programmieraufgaben kann man zunächst GPT-6 Sol ausprobieren. Sein Standard-Input-/Output-Preis liegt bei $2/$10 pro Million Token und damit jeweils bei der Hälfte von Claude Opus 5.5; in der höchsten Konfiguration desselben Evaluierungssystems von Artificial Analysis (AA) liegt der Gesamtindex von Opus 5.5 bei 58 und der von Sol bei 48. Die beiden stehen nicht in einem „gleicher Preis, stärker“-Verhältnis: Vergleichen Sie zuerst mit Aufgaben aus Ihrem eigenen Repository die Bestehensrate, die Anzahl der Runden, die Gesamtzahl der Token und manuelle Nacharbeit, bevor Sie entscheiden, ob Sie für die höheren Werte von Opus bezahlen. Für schwierigere Long-Run-Aufgaben kann man außerdem GPT-6 Astra oder Claude Fable 5.1 in Betracht ziehen; die Stückpreise und Fähigkeiten der vier Modelle sind nicht in derselben Reihenfolge angeordnet.

Wir betreiben PandaNpc, das Codex und Claude Code unterstützt, daher gibt es einen Produktanwendungskontext; dieser Artikel enthält keinen eigenen Test der vier Modelle mit identischen Aufgaben und gibt die unten stehenden öffentlichen Benchmarks auch nicht als eigene Tests aus. Preise beziehen sich auf Modell-API-Kosten, nicht auf Abonnementpreise von Tools. Stand der Recherche: 23. September 2026, alle Währungen in US-Dollar.

Spezifikationen der vier Modelle: Zuerst Kapazität, Ausgabe und Standardstufe unterscheiden

Zur besseren Lesbarkeit auf dem Smartphone sind die folgenden Tabellen nach OpenAI und Anthropic gruppiert; „Maximale Ausgabe“ ist die Obergrenze für eine einzelne Antwort, der Kontext ist das gemeinsam für Eingabe und Ausgabe verfügbare Fenster und bedeutet nicht, dass jedes Mal eine gleich lange Ausgabe erzeugt werden kann. Die API-Modell-IDs können direkt zur Überprüfung von Abrechnung oder Evaluierungskonfiguration verwendet werden.

OpenAI-Spezifikationen GPT-6 Sol GPT-6 Astra
API-Modell-ID gpt-6-sol gpt-6-astra
Offizielle Positionierung Kosten und Fähigkeiten ausbalanciert Komplexeste End-to-End-Aufgaben
Kontextfenster 1.050.000 token 1.050.000 token
Maximale Ausgabe pro Antwort 128.000 token 128.000 token
Eingabe-/Ausgabemodalitäten Text, Bild → Text Text, Bild → Text
Reasoning-Effort none / low / medium / high / xhigh / max low / medium / high / xhigh / max
Standard-Effort medium Auf der offiziellen Modellseite nicht angegeben
Wissensstand 2026-04-20 2026-04-30
Verfügbarkeitsstatus Über API verfügbar Über API verfügbar
API-Modell-ID
GPT-6 Sol
gpt-6-sol
GPT-6 Astra
gpt-6-astra
Offizielle Positionierung
GPT-6 Sol
Kosten und Fähigkeiten ausbalanciert
GPT-6 Astra
Komplexeste End-to-End-Aufgaben
Kontextfenster
GPT-6 Sol
1.050.000 token
GPT-6 Astra
1.050.000 token
Maximale Ausgabe pro Antwort
GPT-6 Sol
128.000 token
GPT-6 Astra
128.000 token
Eingabe-/Ausgabemodalitäten
GPT-6 Sol
Text, Bild → Text
GPT-6 Astra
Text, Bild → Text
Reasoning-Effort
GPT-6 Sol
none / low / medium / high / xhigh / max
GPT-6 Astra
low / medium / high / xhigh / max
Standard-Effort
GPT-6 Sol
medium
GPT-6 Astra
Auf der offiziellen Modellseite nicht angegeben
Wissensstand
GPT-6 Sol
2026-04-20
GPT-6 Astra
2026-04-30
Verfügbarkeitsstatus
GPT-6 Sol
Über API verfügbar
GPT-6 Astra
Über API verfügbar

Daten: Offizielle Modellseite von GPT-6 Sol, Offizielle Modellseite von GPT-6 Astra.

Anthropic-Spezifikationen Claude Opus 5.5 Claude Fable 5.1
API-Modell-ID claude-opus-5-5 claude-fable-5-1
Offizielle Positionierung Long-Run-Agent-Programmierung und Wissensarbeit Schwierigere Reasoning- und Long-Run-Agent-Aufgaben
Kontextfenster 1.000.000 token 1.000.000 token
Maximale Ausgabe pro Antwort 128.000 token; Batch-Beta bis zu 300.000 128.000 token
Eingabe-/Ausgabemodalitäten Text, Bild → Text Text, Bild → Text
Reasoning-Methode adaptive thinking, immer aktiviert adaptive thinking, immer aktiviert
Standard-Effort medium high
Wissensstand 2026-06 2026-06
Verfügbarkeitsstatus Über Claude API verfügbar Über Claude API verfügbar
API-Modell-ID
Claude Opus 5.5
claude-opus-5-5
Claude Fable 5.1
claude-fable-5-1
Offizielle Positionierung
Claude Opus 5.5
Long-Run-Agent-Programmierung und Wissensarbeit
Claude Fable 5.1
Schwierigere Reasoning- und Long-Run-Agent-Aufgaben
Kontextfenster
Claude Opus 5.5
1.000.000 token
Claude Fable 5.1
1.000.000 token
Maximale Ausgabe pro Antwort
Claude Opus 5.5
128.000 token; Batch-Beta bis zu 300.000
Claude Fable 5.1
128.000 token
Eingabe-/Ausgabemodalitäten
Claude Opus 5.5
Text, Bild → Text
Claude Fable 5.1
Text, Bild → Text
Reasoning-Methode
Claude Opus 5.5
adaptive thinking, immer aktiviert
Claude Fable 5.1
adaptive thinking, immer aktiviert
Standard-Effort
Claude Opus 5.5
medium
Claude Fable 5.1
high
Wissensstand
Claude Opus 5.5
2026-06
Claude Fable 5.1
2026-06
Verfügbarkeitsstatus
Claude Opus 5.5
Über Claude API verfügbar
Claude Fable 5.1
Über Claude API verfügbar

Daten: Offizielle Modellseite von Opus 5.5, Offizielle Modellseite von Fable 5.1. Die 300K-Ausgabe von Opus gilt nur für die angegebene Batch-Beta und den output-300k-2026-03-24-Header, nicht als Obergrenze für normale interaktive Anfragen.

Abrechnung der vier Modelle: Normaler Input, Cache-Schreibvorgänge und Cache-Treffer sind unterschiedliche Token

Die folgenden Tabellen geben jeweils US-Dollar pro Million Token an und beziehen sich auf den Preis der entsprechenden Token-Kategorie. Beim normalen Input wird keine zusätzliche „Cache-Schreibgebühr“ aufgeschlagen; nur Token, die erstmals in den Cache geschrieben werden, verwenden den Schreibpreis. Nach einem Cache-Treffer wird zum Lesepreis abgerechnet, die Ausgabe wird weiterhin separat berechnet. Beide Anbieter haben 50 % Rabatt auf Batch-Input/Output, aber Batch ist asynchron und eignet sich nicht für Programmierdialoge, die unmittelbares Feedback erfordern.

OpenAI Standard-API GPT-6 Sol GPT-6 Astra
Normaler Input $2,00 $10,00
Cache-Schreiben $2,50 $12,50
Cache-Lesen $0,20 $1,00
Ausgabe $10,00 $50,00
Batch-Input/Output $1,00 / $5,00 $5,00 / $25,00
Input über 272K Gesamte Anfrage Input- und Cache-Gebühren ×2, Ausgabegebühren ×1,5 Gesamte Anfrage Input- und Cache-Gebühren ×2, Ausgabegebühren ×1,5
Normaler Input
GPT-6 Sol
$2,00
GPT-6 Astra
$10,00
Cache-Schreiben
GPT-6 Sol
$2,50
GPT-6 Astra
$12,50
Cache-Lesen
GPT-6 Sol
$0,20
GPT-6 Astra
$1,00
Ausgabe
GPT-6 Sol
$10,00
GPT-6 Astra
$50,00
Batch-Input/Output
GPT-6 Sol
$1,00 / $5,00
GPT-6 Astra
$5,00 / $25,00
Input über 272K
GPT-6 Sol
Gesamte Anfrage Input- und Cache-Gebühren ×2, Ausgabegebühren ×1,5
GPT-6 Astra
Gesamte Anfrage Input- und Cache-Gebühren ×2, Ausgabegebühren ×1,5

Quelle: Sol, Astra, OpenAI-Preistabelle, OpenAI-Cache-Dokumentation. Bei über 272K wird nicht nur der übersteigende Teil teurer; ob die Grenze überschritten wird, wird anhand der Input-Token der gesamten Anfrage berechnet, einschließlich cachebezogener Inputs.

Anthropic Standard-API Claude Opus 5.5 Claude Fable 5.1
Normaler Input $4,00 $10,00
Cache-Schreiben (5 Minuten) $5,00 $12,50
Cache-Schreiben (1 Stunde) $8,00 $20,00
Cache-Lesen $0,20 $0,25
Ausgabe $20,00 $50,00
Batch-Input/Output $2,00 / $10,00 $5,00 / $25,00
1M langer Kontext Standardpreis, kein >200K-Aufschlag Standardpreis, kein >200K-Aufschlag
Normaler Input
Claude Opus 5.5
$4,00
Claude Fable 5.1
$10,00
Cache-Schreiben (5 Minuten)
Claude Opus 5.5
$5,00
Claude Fable 5.1
$12,50
Cache-Schreiben (1 Stunde)
Claude Opus 5.5
$8,00
Claude Fable 5.1
$20,00
Cache-Lesen
Claude Opus 5.5
$0,20
Claude Fable 5.1
$0,25
Ausgabe
Claude Opus 5.5
$20,00
Claude Fable 5.1
$50,00
Batch-Input/Output
Claude Opus 5.5
$2,00 / $10,00
Claude Fable 5.1
$5,00 / $25,00
1M langer Kontext
Claude Opus 5.5
Standardpreis, kein >200K-Aufschlag
Claude Fable 5.1
Standardpreis, kein >200K-Aufschlag

Quelle: Opus 5.5, Fable 5.1, Anthropic-Preise und Batch-/Cache-Regeln, Dokumentation zu langem Kontext. Anthropic erlaubt ausdrücklich, Batch- und Cache-Rabatte zu kombinieren; ein Cache-Treffer muss die jeweilige Gültigkeitsdauer und die Bedingung desselben Präfixes erfüllen.

Konkrete Ergebnisse der vier Modelle im selben Evaluierungssystem

Die folgenden Tabellen stammen vollständig aus dem Artificial Analysis Intelligence Index v4.3.2. Die Testkonfiguration ist GPT-6 Sol max, GPT-6 Astra max, Claude Opus 5.5 und Fable 5.1 jeweils mit adaptive reasoning max effort und aktiviertem default fallback. Dies sind nicht die Standardstufen der vier Modelle, insbesondere ist Opus standardmäßig medium und Fable standardmäßig high; selbst wenn verschiedene Modelle mit max gekennzeichnet sind, ist der tatsächliche Reasoning-Token-Verbrauch unterschiedlich. AA vereinheitlicht Aufgaben und eigenes harness, daher kann man die Ergebnisse innerhalb dieser Testkonfiguration horizontal vergleichen; Herstellerangaben aus Produktankündigungen dürfen nicht in diese Tabelle gemischt werden. Links: Originalvergleich Sol–Opus, Originalvergleich Astra–Fable, AA-Methodik.

AA-Gesamtindex und Engineering-Aufgaben Sol Opus 5.5 Astra Fable 5.1
Gesamtindex v4.3.2 (Punkte) 48 58 53 53
Terminal-Bench 4.0 (Bestehensrate) 44% 60% 59% 52%
AutomationBench-AA (Erfolgsrate) 62% 70% 68% 59%
SciCode (Bestehensrate) 58% 67% 56% 63%
AA-LCR v1.1 langer Kontext (Bestehensrate) 84% 85% 81% 85%
Gesamtindex v4.3.2 (Punkte)
Sol
48
Opus 5.5
58
Astra
53
Fable 5.1
53
Terminal-Bench 4.0 (Bestehensrate)
Sol
44%
Opus 5.5
60%
Astra
59%
Fable 5.1
52%
AutomationBench-AA (Erfolgsrate)
Sol
62%
Opus 5.5
70%
Astra
68%
Fable 5.1
59%
SciCode (Bestehensrate)
Sol
58%
Opus 5.5
67%
Astra
56%
Fable 5.1
63%
AA-LCR v1.1 langer Kontext (Bestehensrate)
Sol
84%
Opus 5.5
85%
Astra
81%
Fable 5.1
85%

Die Quellen der Werte in jeder Zeile sind die beiden oben genannten AA-Modellvergleichsseiten derselben Version und die Astra–Fable-Seite. Beispielsweise liegt Opus 5.5 im eigenen Terminal-Bench-4.0-Harness von AA um 16 Prozentpunkte über Sol; dies darf nicht mit den 66,4 % der Anthropic-Website vermischt oder verrechnet werden, da die Ausführungseinstellungen des letzteren anders sind.

AA-Wissens- und Fachaufgaben Sol Opus 5.5 Astra Fable 5.1
AA-Briefcase v1.1 (Elo) 1483 1822 1569 1678
GDPval-AA v2.1 (Elo) 1487 1846 1542 1735
Humanity's Last Exam (Bestehensrate) 48% 61% 55% 59%
GDP.pdf (Gesamtbestehensrate) 25% 26% 31% 26%
CritPt (Bestehensrate) 31% 32% 32% 30%
AA-Omniscience (Indexpunktzahl, kein Prozentsatz) 27 46 43 43
AA-Briefcase v1.1 (Elo)
Sol
1483
Opus 5.5
1822
Astra
1569
Fable 5.1
1678
GDPval-AA v2.1 (Elo)
Sol
1487
Opus 5.5
1846
Astra
1542
Fable 5.1
1735
Humanity's Last Exam (Bestehensrate)
Sol
48%
Opus 5.5
61%
Astra
55%
Fable 5.1
59%
GDP.pdf (Gesamtbestehensrate)
Sol
25%
Opus 5.5
26%
Astra
31%
Fable 5.1
26%
CritPt (Bestehensrate)
Sol
31%
Opus 5.5
32%
Astra
32%
Fable 5.1
30%
AA-Omniscience (Indexpunktzahl, kein Prozentsatz)
Sol
27
Opus 5.5
46
Astra
43
Fable 5.1
43

Die Quellen der Werte in jeder Zeile: AA Sol–Opus, AA Astra–Fable. Kleine Unterschiede von 1–2 Prozentpunkten sollten nicht als sicherer Sieg oder Niederlage interpretiert werden; Elo, Indexpunktzahlen und Bestehensraten sind auch nicht dieselbe Einheit.

AA-Testkosten und -Nutzung Sol Opus 5.5 Astra Fable 5.1
Durchschnittliche Kosten pro Indexaufgabe $1,06 $5,98 $3,26 $7,63
Durchschnittliche Output-Token pro Aufgabe 31K 119K 27K 78K
Davon Reasoning-Token 21K 84K 17K 47K
Durchschnittliche Kosten pro Indexaufgabe
Sol
$1,06
Opus 5.5
$5,98
Astra
$3,26
Fable 5.1
$7,63
Durchschnittliche Output-Token pro Aufgabe
Sol
31K
Opus 5.5
119K
Astra
27K
Fable 5.1
78K
Davon Reasoning-Token
Sol
21K
Opus 5.5
84K
Astra
17K
Fable 5.1
47K

Quellen sind weiterhin AA Sol–Opus und AA Astra–Fable. Die Aufgabenkosten sind ein gewichteter Mittelwert der AA-Testnutzung, kein Angebot für „eine Anforderung in Ihrem Repository abschließen“. Die max-Konfiguration von Opus verbraucht mehr Output- und Reasoning-Token; dies ist einer der Gründe, warum die Rechnungsdifferenz größer ist als die Stückpreisdifferenz.

Die Diagramme der beiden offiziellen Websites: Sie können die jeweiligen Schlussfolgerungen belegen, aber kein direktes Duell auf demselben Spielfeld ergeben

Das DeepSWE-v1.1-Diagramm von OpenAI zeigt GPT-6 Sol max mit 68,8 %, im Diagramm erreicht Claude Fable 5 mit xhigh 69,9 %; Opus 5.5 fehlt. Die horizontale Achse sind die Kosten pro Aufgabe, logarithmische Skala. Das Opus 5 im Diagramm ist auch nicht Opus 5.5. Es zeigt, dass Sol unter den von OpenAI veröffentlichten Einstellungen Programmier-Agent-Ergebnisse in der Nähe von High-End-Modellen erzielt, kann aber keinen Test aller vier Modelle unter gleichen Bedingungen ersetzen.

OpenAI-offizielles DeepSWE-v1.1-Diagramm: GPT-6 Sol max erreicht 68,8 %, Opus 5.5 fehlt im Diagramm

Abbildung 1: OpenAI《Introducing GPT-6 Sol and Luna》 „Coding“, 2026-09-22. Modelle und Effort richten sich nach der Legende und den Fußnoten des Originaltexts. Vollständiges Originalbild zum Lesen der kleinen Schrift öffnen.

Das Terminal-Bench-4.0-Diagramm von Anthropic zeigt Claude Opus 5.5 xhigh mit 66,4 %. Das GPT-6 Astra im Diagramm erreicht 57,9 % mit high, nicht GPT-6 Sol. Die Kurve enthält außerdem Punkte für den Standard-Effort, aber deren Position darf nicht als xhigh-Punktzahl behandelt werden. Das Hersteller-Harness hier unterscheidet sich vom Terminal-Bench 4.0 in der AA-Tabelle oben; man darf nicht 66,4 % minus die 44 %, die AA Sol gibt, rechnen.

Anthropic-offizielles Terminal-Bench-4.0-Diagramm: Opus 5.5 xhigh erreicht 66,4 %, GPT-6 Sol fehlt im Diagramm

Abbildung 2: Anthropic《Claude Opus 5.5》 „Coding“, 2026-09-22. Die horizontale Achse sind die Kosten pro Versuch, logarithmische Skala; dargestellte Stufen, statistische Intervalle und Einschränkungen siehe Originaltext. Vollständiges Originalbild zum Lesen der kleinen Schrift öffnen.

Es gibt außerdem einseitig von Herstellern veröffentlichte Ergebnisse, die man nicht direkt voneinander abziehen sollte: OpenAI berichtet für Sol xhigh bei AutomationBench 1.0.6 33,2 %, für max bei Agents' Last Exam V1 56,4 % und für xhigh bei OSWorld 2.0 offline 60,5 %; Quelle wie auf der OpenAI-Veröffentlichungsseite; Anthropic berichtet für Opus 5.5 bei FrontierCode v1.1 Main 54,4 %, CursorBench 4.0 57,8 %, GDPval-AA v2.1 1846 Elo und Humanity's Last Exam with tools 67,7 %; Quelle wie auf der Anthropic-Veröffentlichungsseite. Versionen, Tools, Effort oder Harness dieser Projekte sind nicht als mit der anderen Seite übereinstimmend bestätigt, daher wird kein „wie viel Vorsprung“ angegeben. Nicht veröffentlichte Werte der vier Modelle nach gleichem Maßstab dürfen nicht erraten werden.

Wie viel kostet dieselbe Aufgabenmenge? Fünf nachrechenbare Beispiele

Im Folgenden wird der Input in drei sich gegenseitig ausschließende Token-Kategorien unterteilt: normal, erstmaliges Cache-Schreiben und späteres Cache-Lesen, zuzüglich Output. Jede Zeile ist eine Anfrage und enthält keine Tool-Aufrufe, Plattform-Zusatzgebühren oder zusätzlichen Runden; die Ausgaben liegen alle unter der 128K-Obergrenze normaler Anfragen. Die Preise werden nach den offiziellen Preisen oben berechnet, daher können Sie die Token-Zahlen anhand Ihrer eigenen Usageogs ersetzen.

Szenario und Token-Nutzung Sol Opus 5.5 Astra Fable 5.1
A Normal: 100K neuer Input + 50K Output $0,70 $1,40 $3,50 $3,50
B Erstmaliges Cache-Schreiben: 200K Schreiben + 50K neuer Input + 20K Output $0,80 $1,60 (5m) / $2,20 (1h) $4,00 $4,00 (5m) / $5,50 (1h)
C Späterer Treffer: 200K Cache-Lesen + 50K neuer Input + 20K Output $0,34 $0,64 $1,70 $1,55
D Asynchrone Batch-Version von A: 100K neuer Input + 50K Output $0,35 $0,70 $1,75 $1,75
E Langer: 300K neuer Input + 20K Output $1,50 $1,60 $7,50 $4,00
A Normal: 100K neuer Input + 50K Output
Sol
$0,70
Opus 5.5
$1,40
Astra
$3,50
Fable 5.1
$3,50
B Erstmaliges Cache-Schreiben: 200K Schreiben + 50K neuer Input + 20K Output
Sol
$0,80
Opus 5.5
$1,60 (5m) / $2,20 (1h)
Astra
$4,00
Fable 5.1
$4,00 (5m) / $5,50 (1h)
C Späterer Treffer: 200K Cache-Lesen + 50K neuer Input + 20K Output
Sol
$0,34
Opus 5.5
$0,64
Astra
$1,70
Fable 5.1
$1,55
D Asynchrone Batch-Version von A: 100K neuer Input + 50K Output
Sol
$0,35
Opus 5.5
$0,70
Astra
$1,75
Fable 5.1
$1,75
E Langer: 300K neuer Input + 20K Output
Sol
$1,50
Opus 5.5
$1,60
Astra
$7,50
Fable 5.1
$4,00

Rechenbeispiel: A für Sol = 0,1×$2 + 0,05×$10 = $0,70. B für Opus 5m = 0,2×$5 + 0,05×$4 + 0,02×$20 = $1,60; C für Opus = 0,2×$0,20 + 0,05×$4 + 0,02×$20 = $0,64. Bei E hat der Sol-Input 300K und überschreitet damit 272K, die gesamte Anfrage wird mit $4 Input und $15 Output berechnet; Astra entsprechend $20/$75. Der 1M-Kontext von Opus/Fable behält den Standardpreis. B und C sind unterschiedliche Anfragen: erst schreiben, dann lesen; bei C muss sichergestellt sein, dass der Cache noch gültig ist. Die Cache-Aufbewahrungsdauer von OpenAI unterscheidet sich vom 5m/1h-Abrechnungsmechanismus von Anthropic; die Schreibgebühr von B darf nicht fälschlich auf jede Anfrage von C aufgeschlagen werden. Grundlage: Preise der beiden OpenAI-Modelle, Anthropic-Preisregeln.

In den tatsächlichen Programmier-Workflow einordnen: Wie aufteilen?

Sol übernimmt zuerst die tägliche Iteration. Anforderungszerlegung, kleine Änderungen in bestehenden Repositories, Test-Patches und Arbeit, die sich in Stapeln überprüfen lässt, zunächst von Sol erledigen lassen und dann Aufgaben-Erfolgsrate, Anzahl der Nacharbeiten und Gesamttoken erfassen. Sein niedriger Stückpreis wirkt sich in Beispielen wie A–D, die 272K nicht überschreiten, am direktesten aus; bei sehr langen Anfragen schrumpft der Preisvorteil.

Opus 5.5 übernimmt Agent-Aufgaben, die schwer in einem Durchgang zu einem Ergebnis zu bringen sind. Der AA-Test unter gleichen Bedingungen gibt ihm höhere Werte in Gesamt-, Terminal- und Wissensarbeit, aber in der max-Konfiguration sind auch die durchschnittlichen Kosten pro Aufgabe deutlich höher. Man kann zunächst mit dem Standard medium oder dem von Ihnen tatsächlich verwendeten Effort eine lokale Baseline erstellen und dann für schwierige Aufgaben höher stufen. Betrachten Sie die max-Ergebnisse von AA nicht als Standarderlebnis.

Astra und Fable 5.1 sind die höheren Ausbaustufen. Astra ist bei AutomationBench-AA, Terminal-Bench 4.0 und GDP.pdf von AA wettbewerbsfähig, Fable 5.1 ist bei einigen Kennzahlen für Long-Run-Wissensarbeit stärker, aber der Basis-Input-/Output-Preis von $10/$50 liegt bei beiden deutlich über Sol. Der Cache-Lesepreis von Fable beträgt $0,25 und ist niedriger als die $1,00 von Astra; wenn ein großer Präfix wiederholt gelesen wird, kann sich die Kostenreihenfolge ändern. Für schwierige Aufgaben wird empfohlen, mit einer kleinen Stichprobe an Anforderungen aus demselben Repository eine Abnahme mit allen vier Modellen durchzuführen und nach „Kosten für erfolgreich abgeschlossene und zusammenführbare Aufgaben“ zu wählen, nicht nach der Punktzahl einer einzelnen Rangliste.

In PandaNpc sind Codex und Claude Code zwei verfügbare Agent Engines. Bei der Wahl des Einstiegspunkts kommt es auch auf Ihre bestehenden Abonnements oder API-Kanäle, Tool-Berechtigungen, Repository-Kontext und Team-Review-Prozesse an; Modell-API-Preise lassen sich nicht direkt in Tool-Abonnementkontingente umrechnen. Dieser Artikel zeigt öffentliche Spezifikationen und Benchmarks und behauptet kein eigenes Ranking der vier Modelle innerhalb von PandaNpc.

FAQ

Ist Sol unbedingt halb so teuer wie Opus 5.5? Nur die Input- und Output-Stückpreise der Standard-API sind jeweils halb so hoch. Input über 272K, Cache-Schreiben und -Lesen, tatsächliche Reasoning-Token, Runden und Tool-Gebühren verändern alle die Rechnung für die gesamte Aufgabe. Szenario E oben hat die Einzelpreise der beiden bereits auf $1,50 und $1,60 angenähert.

Können die beiden offiziellen Programmierdiagramme beweisen, wer gewinnt? Nein. Das OpenAI-Diagramm enthält kein Opus 5.5, das Anthropic-Diagramm kein Sol, und Benchmarks und Harness sind ebenfalls unterschiedlich. Wenn Sie Ergebnisse aller vier Modelle unter gleichen Bedingungen sehen möchten, sehen Sie sich die Tabelle mit fester Konfiguration von AA v4.3.2 an; wenn Sie Ihre eigene Tool-Auswahl entscheiden möchten, müssen Sie Ihre eigenen Repository-Aufgaben erneut durchlaufen lassen.

Lassen sich Cache und Batch kombinieren? Die Anthropic-Preisdokumentation unterstützt dies ausdrücklich; ob tatsächlich ein Cache-Treffer erzielt wird, hängt von Präfix, Gültigkeitsdauer und Anfrageeinstellungen ab. Bei den beiden OpenAI-Modellen beträgt Batch 50 % des Standardtarifs; konkrete Rechnungen bitte anhand der entsprechenden API-Nutzungsaufzeichnungen prüfen.