GPT-6 Sol vs Claude Opus 5.5: ceny, wyniki i jak wybrać do zadań programistycznych?

Najpierw wypróbuj GPT-6 Sol do ogólnych zadań programistycznych API; w przypadku złożonych zadań możesz porównać Claude Opus 5.5, a GPT-6 Astra i Claude Fable 5.1 potraktować jako opcje dla najtrudniejszych przypadków. W tym artykule weryfikujemy oficjalne specyfikacje czterech modeli, ceny cache'owania i Batch, wyniki benchmarków firm trzecich według jednolitej metodologii oraz przedstawiamy pięć możliwych do ponownego przeliczenia scenariuszy kosztowych.

PandaNpcPierwsza publikacja
GPT-6 Sol vs Claude Opus 5.5: ceny, wyniki i jak wybrać do zadań programistycznych?

Najpierw wniosek: ogólne zadania programistyczne API można najpierw przetestować z GPT-6 Sol. Jego standardowa cena wejścia/wyjścia wynosi $2/$10 za milion tokenów, czyli połowę ceny Claude Opus 5.5; w najwyższej konfiguracji tego samego systemu ewaluacji Artificial Analysis (AA) Opus 5.5 ma ogólny indeks 58, a Sol 48. Nie jest to relacja „ten sam koszt, większa moc”: najpierw porównaj na zadaniach ze swojego repozytorium wskaźnik przejścia za pierwszym razem, liczbę rund, całkowitą liczbę tokenów i ręczną poprawę, a potem zdecyduj, czy płacić za wyższe wyniki Opus. Trudniejsze długodystansowe zadania można też sprawdzić z GPT-6 Astra lub Claude Fable 5.1; cena jednostkowa i możliwości czterech modeli nie układają się w tym samym porządku.

Prowadzimy PandaNpc wspierające Codex i Claude Code, więc mamy scenariusz użycia produktu; w tym artykule nie przeprowadzono testów czterech modeli na tych samych zadaniach ani nie przedstawia się poniższych publicznych ewaluacji jako własnych testów. Ceny oznaczają koszty API modelu, a nie cenę subskrypcji narzędzia. Źródła zweryfikowano 23 września 2026 r., waluty są w USD.

Specyfikacje czterech modeli: najpierw rozróżnij pojemność, wyjście i domyślny poziom

Dla wygodnego czytania na telefonie poniższa tabela grupuje OpenAI i Anthropic; „maksymalne wyjście” to limit pojedynczej odpowiedzi, a kontekst to łącznie dostępne okno wejścia i wyjścia; nie oznacza, że za każdym razem można wygenerować taką samą długość. ID modeli API można wykorzystać bezpośrednio do weryfikacji rozliczeń lub konfiguracji ewaluacji.

Specyfikacja OpenAI GPT-6 Sol GPT-6 Astra
ID modelu API gpt-6-sol gpt-6-astra
Oficjalne pozycjonowanie Równowaga kosztu i możliwości Najbardziej złożone zadania end-to-end
Okno kontekstu 1 050 000 tokenów 1 050 000 tokenów
Maksymalne wyjście jednorazowe 128 000 tokenów 128 000 tokenów
Modalności wejścia/wyjścia tekst, obraz → tekst tekst, obraz → tekst
Reasoning effort none / low / medium / high / xhigh / max low / medium / high / xhigh / max
Domyślny effort medium Nie podano na oficjalnej stronie modelu
Granica wiedzy 2026-04-20 2026-04-30
Status dostępności Dostępny przez API Dostępny przez API
ID modelu API
GPT-6 Sol
gpt-6-sol
GPT-6 Astra
gpt-6-astra
Oficjalne pozycjonowanie
GPT-6 Sol
Równowaga kosztu i możliwości
GPT-6 Astra
Najbardziej złożone zadania end-to-end
Okno kontekstu
GPT-6 Sol
1 050 000 tokenów
GPT-6 Astra
1 050 000 tokenów
Maksymalne wyjście jednorazowe
GPT-6 Sol
128 000 tokenów
GPT-6 Astra
128 000 tokenów
Modalności wejścia/wyjścia
GPT-6 Sol
tekst, obraz → tekst
GPT-6 Astra
tekst, obraz → tekst
Reasoning effort
GPT-6 Sol
none / low / medium / high / xhigh / max
GPT-6 Astra
low / medium / high / xhigh / max
Domyślny effort
GPT-6 Sol
medium
GPT-6 Astra
Nie podano na oficjalnej stronie modelu
Granica wiedzy
GPT-6 Sol
2026-04-20
GPT-6 Astra
2026-04-30
Status dostępności
GPT-6 Sol
Dostępny przez API
GPT-6 Astra
Dostępny przez API

Dane: Oficjalna strona modelu GPT-6 Sol, Oficjalna strona modelu GPT-6 Astra.

Specyfikacja Anthropic Claude Opus 5.5 Claude Fable 5.1
ID modelu API claude-opus-5-5 claude-fable-5-1
Oficjalne pozycjonowanie Długodystansowe programowanie agentowe i praca z wiedzą Trudniejsze rozumowanie i długodystansowa praca agentowa
Okno kontekstu 1 000 000 tokenów 1 000 000 tokenów
Maksymalne wyjście jednorazowe 128 000 tokenów; Batch beta do 300 000 128 000 tokenów
Modalności wejścia/wyjścia tekst, obraz → tekst tekst, obraz → tekst
Metoda rozumowania adaptive thinking, zawsze włączone adaptive thinking, zawsze włączone
Domyślny effort medium high
Granica wiedzy 2026-06 2026-06
Status dostępności Dostępny przez Claude API Dostępny przez Claude API
ID modelu API
Claude Opus 5.5
claude-opus-5-5
Claude Fable 5.1
claude-fable-5-1
Oficjalne pozycjonowanie
Claude Opus 5.5
Długodystansowe programowanie agentowe i praca z wiedzą
Claude Fable 5.1
Trudniejsze rozumowanie i długodystansowa praca agentowa
Okno kontekstu
Claude Opus 5.5
1 000 000 tokenów
Claude Fable 5.1
1 000 000 tokenów
Maksymalne wyjście jednorazowe
Claude Opus 5.5
128 000 tokenów; Batch beta do 300 000
Claude Fable 5.1
128 000 tokenów
Modalności wejścia/wyjścia
Claude Opus 5.5
tekst, obraz → tekst
Claude Fable 5.1
tekst, obraz → tekst
Metoda rozumowania
Claude Opus 5.5
adaptive thinking, zawsze włączone
Claude Fable 5.1
adaptive thinking, zawsze włączone
Domyślny effort
Claude Opus 5.5
medium
Claude Fable 5.1
high
Granica wiedzy
Claude Opus 5.5
2026-06
Claude Fable 5.1
2026-06
Status dostępności
Claude Opus 5.5
Dostępny przez Claude API
Claude Fable 5.1
Dostępny przez Claude API

Dane: Oficjalna strona modelu Opus 5.5, Oficjalna strona modelu Fable 5.1. Wyjście 300K w Opus dotyczy tylko wskazanego Batch beta i nagłówka output-300k-2026-03-24, a nie limitu zwykłego żądania interaktywnego.

Rozliczanie czterech modeli: zwykłe wejście, zapis do cache i trafienie to różne tokeny

Wszystkie wartości w poniższej tabeli to ceny w USD za milion tokenów dla odpowiedniej kategorii tokenów. Zwykłe wejście nie ma dodatkowo doliczanej „opłaty za zapis do cache”; tylko tokeny po raz pierwszy zapisane do cache używają ceny zapisu. Po trafieniu w cache rozliczenie odbywa się według ceny odczytu, a wyjście nadal jest rozliczane osobno. Obie firmy oferują 50% zniżki na wejście/wyjście w Batch, ale Batch jest przetwarzany asynchronicznie i nie nadaje się do rozmów programistycznych wymagających natychmiastowej informacji zwrotnej.

Standardowe API OpenAI GPT-6 Sol GPT-6 Astra
Zwykłe wejście $2.00 $10.00
Zapis do cache $2.50 $12.50
Odczyt z cache $0.20 $1.00
Wyjście $10.00 $50.00
Wejście/wyjście Batch $1.00 / $5.00 $5.00 / $25.00
Wejście powyżej 272K Całe żądanie: opłaty za wejście i cache ×2, opłata za wyjście ×1,5 Całe żądanie: opłaty za wejście i cache ×2, opłata za wyjście ×1,5
Zwykłe wejście
GPT-6 Sol
$2.00
GPT-6 Astra
$10.00
Zapis do cache
GPT-6 Sol
$2.50
GPT-6 Astra
$12.50
Odczyt z cache
GPT-6 Sol
$0.20
GPT-6 Astra
$1.00
Wyjście
GPT-6 Sol
$10.00
GPT-6 Astra
$50.00
Wejście/wyjście Batch
GPT-6 Sol
$1.00 / $5.00
GPT-6 Astra
$5.00 / $25.00
Wejście powyżej 272K
GPT-6 Sol
Całe żądanie: opłaty za wejście i cache ×2, opłata za wyjście ×1,5
GPT-6 Astra
Całe żądanie: opłaty za wejście i cache ×2, opłata za wyjście ×1,5

Źródła: Sol, Astra, Cennik OpenAI, Dokumentacja cache OpenAI. Przekroczenie 272K nie oznacza dopłaty tylko za nadwyżkę; to, czy rozliczenie przekroczy próg, jest liczone według tokenów wejściowych całego żądania, w tym danych wejściowych związanych z cache.

Standardowe API Anthropic Claude Opus 5.5 Claude Fable 5.1
Zwykłe wejście $4.00 $10.00
Zapis do cache 5-minutowy $5.00 $12.50
Zapis do cache 1-godzinny $8.00 $20.00
Odczyt z cache $0.20 $0.25
Wyjście $20.00 $50.00
Wejście/wyjście Batch $2.00 / $10.00 $5.00 / $25.00
Długi kontekst 1M Standardowa cena jednostkowa, bez dopłaty >200K Standardowa cena jednostkowa, bez dopłaty >200K
Zwykłe wejście
Claude Opus 5.5
$4.00
Claude Fable 5.1
$10.00
Zapis do cache 5-minutowy
Claude Opus 5.5
$5.00
Claude Fable 5.1
$12.50
Zapis do cache 1-godzinny
Claude Opus 5.5
$8.00
Claude Fable 5.1
$20.00
Odczyt z cache
Claude Opus 5.5
$0.20
Claude Fable 5.1
$0.25
Wyjście
Claude Opus 5.5
$20.00
Claude Fable 5.1
$50.00
Wejście/wyjście Batch
Claude Opus 5.5
$2.00 / $10.00
Claude Fable 5.1
$5.00 / $25.00
Długi kontekst 1M
Claude Opus 5.5
Standardowa cena jednostkowa, bez dopłaty >200K
Claude Fable 5.1
Standardowa cena jednostkowa, bez dopłaty >200K

Źródła: Opus 5.5, Fable 5.1, Zasady cenowe oraz Batch/cache Anthropic, Opis długiego kontekstu. Anthropic wyraźnie dopuszcza łączenie zniżek Batch i cache; trafienie w cache musi spełniać warunki odpowiedniego okresu ważności i tego samego prefiksu.

W tym samym systemie ewaluacji: konkretne wyniki czterech modeli

Wszystkie wartości w poniższej tabeli pochodzą z Artificial Analysis Intelligence Index v4.3.2. Konfiguracja testu: GPT-6 Sol max, GPT-6 Astra max, Claude Opus 5.5 i Fable 5.1 — wszystkie z adaptive reasoning max effort i włączonym default fallback. Nie są to domyślne poziomy czterech modeli; zwłaszcza Opus domyślnie ma medium, a Fable high; nawet jeśli modele są oznaczone jako max, rzeczywiste zużycie tokenów rozumowania jest różne. AA ujednolica zadania i używa własnego harnessu, więc wyniki można porównywać poziomo w ramach tej konfiguracji testowej; wyników z prezentacji producentów nie można wrzucać do tej tabeli. Linki: Oryginalne porównanie Sol–Opus, Oryginalne porównanie Astra–Fable, Metodyka AA.

AA: zadania ogólne i inżynieryjne Sol Opus 5.5 Astra Fable 5.1
Indeks ogólny v4.3.2 (pkt) 48 58 53 53
Terminal-Bench 4.0 (wskaźnik przejścia) 44% 60% 59% 52%
AutomationBench-AA (wskaźnik sukcesu) 62% 70% 68% 59%
SciCode (wskaźnik przejścia) 58% 67% 56% 63%
AA-LCR v1.1 długi kontekst (wskaźnik przejścia) 84% 85% 81% 85%
Indeks ogólny v4.3.2 (pkt)
Sol
48
Opus 5.5
58
Astra
53
Fable 5.1
53
Terminal-Bench 4.0 (wskaźnik przejścia)
Sol
44%
Opus 5.5
60%
Astra
59%
Fable 5.1
52%
AutomationBench-AA (wskaźnik sukcesu)
Sol
62%
Opus 5.5
70%
Astra
68%
Fable 5.1
59%
SciCode (wskaźnik przejścia)
Sol
58%
Opus 5.5
67%
Astra
56%
Fable 5.1
63%
AA-LCR v1.1 długi kontekst (wskaźnik przejścia)
Sol
84%
Opus 5.5
85%
Astra
81%
Fable 5.1
85%

Źródłem wartości w każdym wierszu są dwa powyższe porównania modeli AA w tej samej wersji i strona Astra–Fable. Na przykład w własnym harnessie Terminal-Bench 4.0 od AA Opus 5.5 jest o 16 punktów procentowych wyżej niż Sol; nie można tego mieszać z 66,4% ze strony Anthropic, ponieważ ustawienia uruchomienia są inne.

AA: zadania wiedzowe i profesjonalne Sol Opus 5.5 Astra Fable 5.1
AA-Briefcase v1.1 (Elo) 1483 1822 1569 1678
GDPval-AA v2.1 (Elo) 1487 1846 1542 1735
Humanity's Last Exam (wskaźnik przejścia) 48% 61% 55% 59%
GDP.pdf (pełny wskaźnik przejścia) 25% 26% 31% 26%
CritPt (wskaźnik przejścia) 31% 32% 32% 30%
AA-Omniscience (punkty indeksu, nie procent) 27 46 43 43
AA-Briefcase v1.1 (Elo)
Sol
1483
Opus 5.5
1822
Astra
1569
Fable 5.1
1678
GDPval-AA v2.1 (Elo)
Sol
1487
Opus 5.5
1846
Astra
1542
Fable 5.1
1735
Humanity's Last Exam (wskaźnik przejścia)
Sol
48%
Opus 5.5
61%
Astra
55%
Fable 5.1
59%
GDP.pdf (pełny wskaźnik przejścia)
Sol
25%
Opus 5.5
26%
Astra
31%
Fable 5.1
26%
CritPt (wskaźnik przejścia)
Sol
31%
Opus 5.5
32%
Astra
32%
Fable 5.1
30%
AA-Omniscience (punkty indeksu, nie procent)
Sol
27
Opus 5.5
46
Astra
43
Fable 5.1
43

Źródła wartości w każdym wierszu: AA Sol–Opus, AA Astra–Fable. Niewielkich różnic 1–2 punktów procentowych nie należy interpretować jako pewnego zwycięstwa; Elo, punkty indeksu i wskaźnik przejścia to też nie te same jednostki.

AA: koszt i użycie w testach Sol Opus 5.5 Astra Fable 5.1
Średni koszt na zadanie indeksu $1.06 $5.98 $3.26 $7.63
Średnia liczba tokenów wyjściowych na zadanie 31K 119K 27K 78K
w tym tokeny rozumowania 21K 84K 17K 47K
Średni koszt na zadanie indeksu
Sol
$1.06
Opus 5.5
$5.98
Astra
$3.26
Fable 5.1
$7.63
Średnia liczba tokenów wyjściowych na zadanie
Sol
31K
Opus 5.5
119K
Astra
27K
Fable 5.1
78K
w tym tokeny rozumowania
Sol
21K
Opus 5.5
84K
Astra
17K
Fable 5.1
47K

Źródła nadal: AA Sol–Opus i AA Astra–Fable. Koszt zadania to ważona średnia użycia w testach AA, a nie wycena „ukończenia jednego wymagania” w Twoim repozytorium. Konfiguracja max Opus zużywa więcej tokenów wyjściowych i rozumowania, co jest jedną z przyczyn, dla których różnica w rachunkach przewyższa różnicę w cenie jednostkowej.

Wykresy na stronach obu firm: mogą potwierdzać własne wnioski, ale nie można ich złożyć w bezpośrednie porównanie

Wykres DeepSWE v1.1 od OpenAI podaje GPT-6 Sol max jako 68,8%, a Claude Fable 5 xhigh na wykresie jako 69,9%; nie ma tam Opus 5.5. Oś pozioma to koszt na zadanie, skala logarytmiczna. Opus 5 na wykresie to również nie Opus 5.5. Pokazuje to, że Sol w ustawieniach opublikowanych przez OpenAI osiąga wyniki agenta programistycznego zbliżone do modeli wysokiej klasy, ale nie zastępuje bezpośredniego testu czterech modeli.

Oficjalny wykres DeepSWE v1.1 od OpenAI: GPT-6 Sol max wynosi 68,8%, na wykresie nie ma Opus 5.5

Rysunek 1: OpenAI „Introducing GPT-6 Sol and Luna”, „Coding”, 2026-09-22. Model i effort zgodnie z legendą i przypisami w oryginale. Otwórz pełny oryginalny obraz, aby przeczytać drobny druk.

Wykres Terminal-Bench 4.0 od Anthropic podaje Claude Opus 5.5 xhigh jako 66,4%. GPT-6 Astra na wykresie ma 57,9% przy high, a nie jest to GPT-6 Sol. Krzywa ma też punkty dla domyślnego effortu, ale ich położenia nie można traktować jako wyniku xhigh. Ten firmowy harness różni się od Terminal-Bench 4.0 w tabeli AA powyżej, więc nie można odejmować 66,4% od 44%, które AA przyznaje Sol.

Oficjalny wykres Terminal-Bench 4.0 od Anthropic: Opus 5.5 xhigh wynosi 66,4%, na wykresie nie ma GPT-6 Sol

Rysunek 2: Anthropic „Claude Opus 5.5”, „Coding”, 2026-09-22. Oś pozioma to koszt na próbę, skala logarytmiczna; poziomy, przedziały statystyczne i ograniczenia przedstawione na wykresie opisano w oryginale. Otwórz pełny oryginalny obraz, aby przeczytać drobny druk.

Są też wyniki publikowane jednostronnie przez producentów, których nie należy bezpośrednio odejmować: OpenAI raportuje dla Sol xhigh w AutomationBench 1.0.6 33,2%, dla max w Agents' Last Exam V1 56,4%, dla xhigh w OSWorld 2.0 offline 60,5%, źródło jak wyżej strona premiery OpenAI; Anthropic raportuje dla Opus 5.5 FrontierCode v1.1 Main 54,4%, CursorBench 4.0 57,8%, GDPval-AA v2.1 1846 Elo, Humanity's Last Exam with tools 67,7%, źródło jak wyżej strona premiery Anthropic. Wersje, narzędzia, effort lub harness tych projektów nie zostały potwierdzone jako zgodne z drugą stroną, dlatego nie podajemy „o ile wyprzedza”. Nieopublikowanych wartości dla czterech modeli w tym samym ujęciu nie można zgadywać.

Ile kosztuje przy tej samej liczbie zadań? Pięć przykładów do przeliczenia

Poniżej dzielimy wejście na trzy rozłączne kategorie tokenów: zwykłe, pierwszy zapis do cache i późniejszy odczyt z cache, a następnie dodajemy wyjście. Każdy wiersz to jedno żądanie, bez wywołań narzędzi, dodatkowych opłat platformowych ani dodatkowych rund; wyjście w każdym przypadku jest poniżej limitu 128K dla zwykłego żądania. Ceny obliczono według powyższych cen oficjalnych, więc można zastąpić liczby tokenów na podstawie własnych logów usage.

Scenariusz i użycie tokenów Sol Opus 5.5 Astra Fable 5.1
A zwykły: 100K nowego wejścia + 50K wyjścia $0.70 $1.40 $3.50 $3.50
B pierwszy zapis do cache: 200K zapisu + 50K nowego wejścia + 20K wyjścia $0.80 $1.60 (5m) / $2.20 (1h) $4.00 $4.00 (5m) / $5.50 (1h)
C późniejsze trafienie: 200K odczytu z cache + 50K nowego wejścia + 20K wyjścia $0.34 $0.64 $1.70 $1.55
D asynchroniczna wersja Batch dla A: 100K nowego wejścia + 50K wyjścia $0.35 $0.70 $1.75 $1.75
E długie wejście: 300K nowego wejścia + 20K wyjścia $1.50 $1.60 $7.50 $4.00
A zwykły: 100K nowego wejścia + 50K wyjścia
Sol
$0.70
Opus 5.5
$1.40
Astra
$3.50
Fable 5.1
$3.50
B pierwszy zapis do cache: 200K zapisu + 50K nowego wejścia + 20K wyjścia
Sol
$0.80
Opus 5.5
$1.60 (5m) / $2.20 (1h)
Astra
$4.00
Fable 5.1
$4.00 (5m) / $5.50 (1h)
C późniejsze trafienie: 200K odczytu z cache + 50K nowego wejścia + 20K wyjścia
Sol
$0.34
Opus 5.5
$0.64
Astra
$1.70
Fable 5.1
$1.55
D asynchroniczna wersja Batch dla A: 100K nowego wejścia + 50K wyjścia
Sol
$0.35
Opus 5.5
$0.70
Astra
$1.75
Fable 5.1
$1.75
E długie wejście: 300K nowego wejścia + 20K wyjścia
Sol
$1.50
Opus 5.5
$1.60
Astra
$7.50
Fable 5.1
$4.00

Przykład przeliczenia: A dla Sol = 0,1×$2 + 0,05×$10 = $0.70. B dla Opus 5m = 0,2×$5 + 0,05×$4 + 0,02×$20 = $1.60; C dla Opus = 0,2×$0.20 + 0,05×$4 + 0,02×$20 = $0.64. W E wejście Sol 300K przekracza 272K, więc całe żądanie liczy się po $4 wejścia i $15 wyjścia; Astra odpowiednio $20/$75. Opus/Fable przy kontekście 1M zachowują standardową cenę jednostkową. B i C to różne żądania: najpierw zapis, potem odczyt; w C trzeba upewnić się, że cache jest jeszcze ważny. Okres przechowywania cache w OpenAI i mechanizm rozliczania 5m/1h w Anthropic są różne, więc nie można opłaty za zapis z B błędnie doliczać do każdego żądania w C. Podstawa: Ceny dwóch modeli OpenAI, Zasady cenowe Anthropic.

W praktycznym workflow programistycznym: jak podzielić zadania?

Najpierw Sol do codziennych iteracji. Rozbijanie wymagań, drobne zmiany w istniejącym repozytorium, poprawki testów i prace możliwe do zbiorczej weryfikacji najpierw zleć Sol, a następnie zapisz wskaźnik sukcesu zadań, liczbę poprawek i całkowitą liczbę tokenów. Jego niska cena jednostkowa jest najbardziej bezpośrednia w przykładach A–D, które nie przekraczają 272K; przy bardzo długich żądaniach przewaga cenowa się zmniejsza.

Opus 5.5 do zadań agentowych, które trudno doprowadzić do zbieżności za pierwszym razem. Testy AA w tym samym zestawie dają mu wyższe wyniki w zadaniach ogólnych, terminalowych i wiedzowych, ale w konfiguracji max średni koszt na zadanie jest również wyraźnie wyższy. Można najpierw zbudować lokalną linię bazową z domyślnym medium lub z effortem, którego faktycznie używasz, a potem podnosić poziom dla trudnych problemów. Nie traktuj wyników AA dla max jako domyślnego doświadczenia.

Astra i Fable 5.1 to wyższe półki. Astra jest konkurencyjna w AA w AutomationBench-AA, Terminal-Bench 4.0 i GDP.pdf, a Fable 5.1 jest silniejsza w niektórych wskaźnikach długodystansowej pracy z wiedzą, ale oba modele mają podstawową cenę wejścia/wyjścia $10/$50 znacząco wyższą niż Sol. Odczyt z cache w Fable kosztuje $0.25, mniej niż $1.00 w Astra; jeśli często odczytuje się duży prefiks, kolejność kosztów może się zmienić. W przypadku trudnych zadań zaleca się przeprowadzenie małego testu akceptacyjnego czterech modeli na wymaganiach z tego samego repozytorium i wybór według „kosztu zadania ukończonego pomyślnie i nadającego się do scalenia”, a nie według wyniku z jednego rankingu.

W PandaNpc Codex i Claude Code to dwa dostępne Agent Engine. Wybierając punkt wejścia, trzeba też wziąć pod uwagę posiadaną subskrypcję lub kanał API, uprawnienia narzędzi, kontekst repozytorium i proces przeglądu zespołowego; ceny API modeli nie przekładają się bezpośrednio na limit subskrypcji narzędzia. W tym artykule przedstawiono publiczne specyfikacje i ewaluacje, nie twierdzimy, że stanowią one rzeczywisty ranking czterech modeli w PandaNpc.

FAQ

Czy Sol zawsze jest o połowę tańszy niż Opus 5.5? Tylko cena jednostkowa wejścia i wyjścia w standardowym API jest o połowę niższa. Wejście powyżej 272K, zapis i odczyt cache, rzeczywiste tokeny rozumowania, liczba rund i opłaty za narzędzia zmieniają rachunek za całe zadanie. Powyższy scenariusz E zbliżył jednorazową cenę obu do $1.50 i $1.60.

Czy dwa oficjalne wykresy programistyczne dowodzą, kto wygrywa? Nie. Na wykresie OpenAI nie ma Opus 5.5, na wykresie Anthropic nie ma Sol, a benchmarki i harnessy też są różne. Aby zobaczyć wyniki czterech modeli w tym samym zestawie, spójrz na tabelę stałej konfiguracji AA v4.3.2; aby zdecydować o wyborze własnych narzędzi, uruchom ponownie zadania we własnym repozytorium.

Czy cache i Batch można łączyć? Dokumentacja cenowa Anthropic wyraźnie to dopuszcza; to, czy faktycznie nastąpi trafienie w cache, zależy od prefiksu, okresu ważności i ustawień żądania. Batch dla dwóch modeli OpenAI wynosi 50% standardowej stawki; konkretny rachunek należy zweryfikować na podstawie odpowiednich zapisów użycia API.