GPT-6 Sol vs Claude Opus 5.5: prijs, benchmarks en programmeertaken — hoe kies je?

Probeer voor algemene API-programmeertaken eerst GPT-6 Sol; vergelijk voor complexe taken Claude Opus 5.5 en gebruik GPT-6 Astra en Claude Fable 5.1 als opties voor hoge moeilijkheidsgraad. Dit artikel controleert de officiële specificaties van de vier modellen, cache- en Batch-prijzen en benchmarks van derden volgens dezelfde meetmethode, en biedt vijf narekenbare kostenscenario's.

PandaNpcEerst gepubliceerd op
GPT-6 Sol vs Claude Opus 5.5: prijs, benchmarks en programmeertaken — hoe kies je?

Eerst de conclusie: voor algemene API-programmeertaken kun je eerst GPT-6 Sol proberen. De standaardprijs voor input/output is $2/$10 per miljoen tokens, de helft van Claude Opus 5.5; in de hoogste configuratie van hetzelfde evaluatiesysteem van Artificial Analysis (AA) heeft Opus 5.5 een samengestelde index van 58 en Sol 48. De twee verhouden zich niet als “sterker voor dezelfde prijs”: vergelijk eerst met je eigen repositorytaken de slagingskans in één keer, het aantal rondes, het totale tokengebruik en handmatig herwerk, en beslis dan of je voor de hogere scores van Opus wilt betalen. Voor moeilijkere langdurige taken kun je ook GPT-6 Astra of Claude Fable 5.1 overwegen; de prijs per eenheid en de capaciteiten van de vier modellen staan niet in dezelfde volgorde.

Wij beheren PandaNpc, dat Codex en Claude Code ondersteunt, en hebben dus productgebruiksscenario’s; in dit artikel is geen praktijktest met de vier modellen op dezelfde opgave uitgevoerd, en de onderstaande openbare benchmarks worden niet voorgesteld als onze eigen metingen. Prijzen verwijzen naar model-API-kosten, niet naar abonnementsprijzen voor tools. De gegevens zijn gecontroleerd op 23 september 2026; alle bedragen zijn in Amerikaanse dollars.

Specificaties van de vier modellen: onderscheid eerst capaciteit, output en standaardinstellingen

Voor het lezen op mobiel zijn de onderstaande tabellen gegroepeerd per OpenAI en Anthropic; “maximale output” is de bovengrens per antwoord, de context is het venster dat beschikbaar is voor input en output samen, en betekent niet dat er elke keer een even lange uitvoer wordt geproduceerd. De API-model-ID’s kunnen direct worden gebruikt om facturen of evaluatieconfiguraties te controleren.

OpenAI-specificaties GPT-6 Sol GPT-6 Astra
API-model-ID gpt-6-sol gpt-6-astra
Officiële positionering Balans tussen kosten en capaciteiten Complexste end-to-endtaken
Contextvenster 1,050,000 token 1,050,000 token
Maximale output per keer 128,000 token 128,000 token
Input-/outputmodaliteiten Tekst, afbeeldingen → tekst Tekst, afbeeldingen → tekst
Reasoning-effort none / low / medium / high / xhigh / max low / medium / high / xhigh / max
Standaard-effort medium Niet vermeld op de officië modelpagina
Kennisafsluitdatum 2026-04-20 2026-04-30
Beschikbaarheidsstatus Beschikbaar via API Beschikbaar via API
API-model-ID
GPT-6 Sol
gpt-6-sol
GPT-6 Astra
gpt-6-astra
Officiële positionering
GPT-6 Sol
Balans tussen kosten en capaciteiten
GPT-6 Astra
Complexste end-to-endtaken
Contextvenster
GPT-6 Sol
1,050,000 token
GPT-6 Astra
1,050,000 token
Maximale output per keer
GPT-6 Sol
128,000 token
GPT-6 Astra
128,000 token
Input-/outputmodaliteiten
GPT-6 Sol
Tekst, afbeeldingen → tekst
GPT-6 Astra
Tekst, afbeeldingen → tekst
Reasoning-effort
GPT-6 Sol
none / low / medium / high / xhigh / max
GPT-6 Astra
low / medium / high / xhigh / max
Standaard-effort
GPT-6 Sol
medium
GPT-6 Astra
Niet vermeld op de officië modelpagina
Kennisafsluitdatum
GPT-6 Sol
2026-04-20
GPT-6 Astra
2026-04-30
Beschikbaarheidsstatus
GPT-6 Sol
Beschikbaar via API
GPT-6 Astra
Beschikbaar via API

Bronnen: Officiële modelpagina van GPT-6 Sol, Officiële modelpagina van GPT-6 Astra.

Anthropic-specificaties Claude Opus 5.5 Claude Fable 5.1
API-model-ID claude-opus-5-5 claude-fable-5-1
Officiële positionering Langdurig agent-programmeren en kenniswerk Moeilijkere redeneertaken en langdurig agent-werk
Contextvenster 1,000,000 token 1,000,000 token
Maximale output per keer 128,000 token; Batch-beta tot 300,000 128,000 token
Input-/outputmodaliteiten Tekst, afbeeldingen → tekst Tekst, afbeeldingen → tekst
Redeneermethode adaptive thinking, altijd ingeschakeld adaptive thinking, altijd ingeschakeld
Standaard-effort medium high
Kennisafsluitdatum 2026-06 2026-06
Beschikbaarheidsstatus Beschikbaar via Claude API Beschikbaar via Claude API
API-model-ID
Claude Opus 5.5
claude-opus-5-5
Claude Fable 5.1
claude-fable-5-1
Officiële positionering
Claude Opus 5.5
Langdurig agent-programmeren en kenniswerk
Claude Fable 5.1
Moeilijkere redeneertaken en langdurig agent-werk
Contextvenster
Claude Opus 5.5
1,000,000 token
Claude Fable 5.1
1,000,000 token
Maximale output per keer
Claude Opus 5.5
128,000 token; Batch-beta tot 300,000
Claude Fable 5.1
128,000 token
Input-/outputmodaliteiten
Claude Opus 5.5
Tekst, afbeeldingen → tekst
Claude Fable 5.1
Tekst, afbeeldingen → tekst
Redeneermethode
Claude Opus 5.5
adaptive thinking, altijd ingeschakeld
Claude Fable 5.1
adaptive thinking, altijd ingeschakeld
Standaard-effort
Claude Opus 5.5
medium
Claude Fable 5.1
high
Kennisafsluitdatum
Claude Opus 5.5
2026-06
Claude Fable 5.1
2026-06
Beschikbaarheidsstatus
Claude Opus 5.5
Beschikbaar via Claude API
Claude Fable 5.1
Beschikbaar via Claude API

Bronnen: Officiële modelpagina van Opus 5.5, Officiële modelpagina van Fable 5.1. De 300K-output van Opus geldt alleen voor de aangewezen Batch-beta en de output-300k-2026-03-24-header, niet als bovengrens voor gewone interactieve verzoeken.

Facturering van de vier modellen: gewone input, cache-schrijfacties en cache-hits zijn verschillende tokens

De onderstaande tabellen tonen prijzen in dollars per miljoen tokens, de eenheidsprijs voor de betreffende tokencategorie. Bij gewone input komt er geen extra “cache-schrijfkosten” bovenop; alleen tokens die voor het eerst naar de cache worden geschreven, gebruiken de schrijfprijs. Na een cache-hit wordt de leesprijs gerekend; output wordt nog steeds apart in rekening gebracht. Beide partijen bieden 50% korting op Batch-input/output, maar Batch is asynchrone verwerking en is niet geschikt voor programmeergesprekken die directe feedback nodig hebben.

OpenAI standaard-API GPT-6 Sol GPT-6 Astra
Gewone input $2.00 $10.00
Cache-schrijfactie $2.50 $12.50
Cache-lezing $0.20 $1.00
Output $10.00 $50.00
Batch-input/output $1.00 / $5.00 $5.00 / $25.00
Input boven 272K Het hele verzoek: input- en cachekosten ×2, outputkosten ×1.5 Het hele verzoek: input- en cachekosten ×2, outputkosten ×1.5
Gewone input
GPT-6 Sol
$2.00
GPT-6 Astra
$10.00
Cache-schrijfactie
GPT-6 Sol
$2.50
GPT-6 Astra
$12.50
Cache-lezing
GPT-6 Sol
$0.20
GPT-6 Astra
$1.00
Output
GPT-6 Sol
$10.00
GPT-6 Astra
$50.00
Batch-input/output
GPT-6 Sol
$1.00 / $5.00
GPT-6 Astra
$5.00 / $25.00
Input boven 272K
GPT-6 Sol
Het hele verzoek: input- en cachekosten ×2, outputkosten ×1.5
GPT-6 Astra
Het hele verzoek: input- en cachekosten ×2, outputkosten ×1.5

Bronnen: Sol, Astra, OpenAI-prijstabel, OpenAI-cache-uitleg. Boven 272K wordt niet alleen het overschrijdende deel extra belast; of de grens wordt overschreden, wordt berekend op basis van de input-tokens van het hele verzoek, inclusief cachegerelateerde input.

Anthropic standaard-API Claude Opus 5.5 Claude Fable 5.1
Gewone input $4.00 $10.00
Cache-schrijfactie van 5 minuten $5.00 $12.50
Cache-schrijfactie van 1 uur $8.00 $20.00
Cache-lezing $0.20 $0.25
Output $20.00 $50.00
Batch-input/output $2.00 / $10.00 $5.00 / $25.00
1M lange context Standaardtarief, geen >200K-toeslag Standaardtarief, geen >200K-toeslag
Gewone input
Claude Opus 5.5
$4.00
Claude Fable 5.1
$10.00
Cache-schrijfactie van 5 minuten
Claude Opus 5.5
$5.00
Claude Fable 5.1
$12.50
Cache-schrijfactie van 1 uur
Claude Opus 5.5
$8.00
Claude Fable 5.1
$20.00
Cache-lezing
Claude Opus 5.5
$0.20
Claude Fable 5.1
$0.25
Output
Claude Opus 5.5
$20.00
Claude Fable 5.1
$50.00
Batch-input/output
Claude Opus 5.5
$2.00 / $10.00
Claude Fable 5.1
$5.00 / $25.00
1M lange context
Claude Opus 5.5
Standaardtarief, geen >200K-toeslag
Claude Fable 5.1
Standaardtarief, geen >200K-toeslag

Bronnen: Opus 5.5, Fable 5.1, Anthropic-prijzen en Batch-/cacheregels, uitleg over lange context. Anthropic staat expliciet toe dat Batch- en cachekortingen worden gecombineerd; een cache-hit moet voldoen aan de betreffende geldigheidsduur en de voorwaarde van dezelfde prefix.

Concrete scores van de vier modellen binnen hetzelfde evaluatiesysteem

De onderstaande tabellen komen allemaal uit Artificial Analysis Intelligence Index v4.3.2. De testconfiguratie is GPT-6 Sol max, GPT-6 Astra max, en Claude Opus 5.5 en Fable 5.1 met adaptive reasoning max effort en default fallback ingeschakeld. Dit zijn niet de standaardinstellingen van de vier modellen; vooral Opus staat standaard op medium en Fable op high; zelfs als verschillende modellen allemaal op max staan, verschilt het werkelijke verbruik van reasoning-tokens. AA gebruikt uniforme taken en een eigen harness, dus resultaten kunnen binnen deze testconfiguratie horizontaal worden vergeleken; cijfers uit leveranciersaankondigingen mogen niet in deze tabel worden gemengd. Links: oorspronkelijke vergelijking Sol–Opus, oorspronkelijke vergelijking Astra–Fable, AA-methodologie.

AA samengesteld en engineeringtaken Sol Opus 5.5 Astra Fable 5.1
Samengestelde index v4.3.2 (punten) 48 58 53 53
Terminal-Bench 4.0 (slagingspercentage) 44% 60% 59% 52%
AutomationBench-AA (succespercentage) 62% 70% 68% 59%
SciCode (slagingspercentage) 58% 67% 56% 63%
AA-LCR v1.1 lange context (slagingspercentage) 84% 85% 81% 85%
Samengestelde index v4.3.2 (punten)
Sol
48
Opus 5.5
58
Astra
53
Fable 5.1
53
Terminal-Bench 4.0 (slagingspercentage)
Sol
44%
Opus 5.5
60%
Astra
59%
Fable 5.1
52%
AutomationBench-AA (succespercentage)
Sol
62%
Opus 5.5
70%
Astra
68%
Fable 5.1
59%
SciCode (slagingspercentage)
Sol
58%
Opus 5.5
67%
Astra
56%
Fable 5.1
63%
AA-LCR v1.1 lange context (slagingspercentage)
Sol
84%
Opus 5.5
85%
Astra
81%
Fable 5.1
85%

De cijfers per rij komen allemaal uit de twee hierboven genoemde AA-modelvergelijkingen van dezelfde versie en de Astra–Fable-pagina. In AA’s eigen Terminal-Bench 4.0-harness is Opus 5.5 bijvoorbeeld 16 procentpunten hoger dan Sol; dit mag niet worden vermengd met de 66,4% van de Anthropic-website, omdat de uitvoeringsinstellingen verschillen.

AA kennis- en professionele taken Sol Opus 5.5 Astra Fable 5.1
AA-Briefcase v1.1 (Elo) 1483 1822 1569 1678
GDPval-AA v2.1 (Elo) 1487 1846 1542 1735
Humanity's Last Exam (slagingspercentage) 48% 61% 55% 59%
GDP.pdf (volledig slagingspercentage) 25% 26% 31% 26%
CritPt (slagingspercentage) 31% 32% 32% 30%
AA-Omniscience (indexscore, geen percentage) 27 46 43 43
AA-Briefcase v1.1 (Elo)
Sol
1483
Opus 5.5
1822
Astra
1569
Fable 5.1
1678
GDPval-AA v2.1 (Elo)
Sol
1487
Opus 5.5
1846
Astra
1542
Fable 5.1
1735
Humanity's Last Exam (slagingspercentage)
Sol
48%
Opus 5.5
61%
Astra
55%
Fable 5.1
59%
GDP.pdf (volledig slagingspercentage)
Sol
25%
Opus 5.5
26%
Astra
31%
Fable 5.1
26%
CritPt (slagingspercentage)
Sol
31%
Opus 5.5
32%
Astra
32%
Fable 5.1
30%
AA-Omniscience (indexscore, geen percentage)
Sol
27
Opus 5.5
46
Astra
43
Fable 5.1
43

Bronnen per rij: AA Sol–Opus, AA Astra–Fable. Kleine verschillen van 1–2 procentpunten moeten niet als een solide overwinning worden geïnterpreteerd; Elo, indexscores en slagingspercentages zijn ook niet dezelfde eenheid.

AA testkosten en verbruik Sol Opus 5.5 Astra Fable 5.1
Gemiddelde kosten per indextaak $1.06 $5.98 $3.26 $7.63
Gemiddelde output-tokens per taak 31K 119K 27K 78K
Waarvan reasoning-tokens 21K 84K 17K 47K
Gemiddelde kosten per indextaak
Sol
$1.06
Opus 5.5
$5.98
Astra
$3.26
Fable 5.1
$7.63
Gemiddelde output-tokens per taak
Sol
31K
Opus 5.5
119K
Astra
27K
Fable 5.1
78K
Waarvan reasoning-tokens
Sol
21K
Opus 5.5
84K
Astra
17K
Fable 5.1
47K

Bronnen zijn nog steeds AA Sol–Opus en AA Astra–Fable. De taakkosten zijn een gewogen gemiddelde van het verbruik in AA-tests, niet een prijsopgave voor “het voltooien van één vereiste” in jouw repository. De max-configuratie van Opus verbruikt meer output- en reasoning-tokens, wat een van de redenen is waarom het factuurverschil groter is dan het verschil in eenheidsprijs.

Grafieken van beide officiële websites: ze kunnen de eigen conclusies bevestigen, maar niet worden gecombineerd tot eenzelfde wedstrijduitslag

De DeepSWE v1.1-grafiek van OpenAI geeft GPT-6 Sol max als 68.8%, en in de grafiek staat Claude Fable 5 met xhigh op 69.9%; Opus 5.5 ontbreekt. De horizontale as is de kosten per taak, met een logaritmische schaal. De Opus 5 in de grafiek is ook niet Opus 5.5. Dit laat zien dat Sol onder de door OpenAI gepubliceerde instellingen programmeeragent-scores heeft die dicht bij die van high-end modellen liggen, maar het kan geen gezamenlijke test van de vier modellen vervangen.

Officiële DeepSWE v1.1-grafiek van OpenAI: GPT-6 Sol max is 68.8%, Opus 5.5 staat niet in de grafiek

Figuur 1: OpenAI, ‘Introducing GPT-6 Sol and Luna’ ‘Coding’, 2026-09-22. Modellen en effort zijn volgens de legenda en de voetnoten in de originele tekst. Open de volledige originele afbeelding om de kleine letters te lezen.

De Terminal-Bench 4.0-grafiek van Anthropic geeft Claude Opus 5.5 xhigh als 66.4%. De GPT-6 Astra in de grafiek staat op 57.9% met high, niet GPT-6 Sol. De curve heeft ook punten voor de standaard-effort, maar hun positie mag niet als een xhigh-score worden opgevat. De leveranciersharness hier verschilt van de Terminal-Bench 4.0 in de AA-tabel hierboven; je mag 66.4% niet aftrekken van de 44% die AA aan Sol geeft.

Officiële Terminal-Bench 4.0-grafiek van Anthropic: Opus 5.5 xhigh is 66.4%, GPT-6 Sol staat niet in de grafiek

Figuur 2: Anthropic, ‘Claude Opus 5.5’ ‘Coding’, 2026-09-22. De horizontale as is de kosten per poging, met een logaritmische schaal; de weergegeven niveaus, betrouwbaarheidsintervallen en beperkingen staan in de originele tekst. Open de volledige originele afbeelding om de kleine letters te lezen.

Er zijn ook door leveranciers eenzijdig gepubliceerde scores die niet direct van elkaar mogen worden afgetrokken: OpenAI rapporteert voor Sol xhigh AutomationBench 1.0.6 als 33.2%, voor max Agents' Last Exam V1 als 56.4%, en voor xhigh OSWorld 2.0 offline als 60.5%, met dezelfde bron OpenAI-aankondigingspagina; Anthropic rapporteert voor Opus 5. FrontierCode v1.1 Main **54.4% CursorBench 4.0 **57.8% GDPval-AA v2.1 1846 Elo, en Humanity's Last Exam with tools 67.7%, met dezelfde bron Anthropic-aankondigingspagina. Van deze items is niet bevestigd dat versie, tools, effort of harness overeenkomen met die van de andere partij, dus vermelden we niet “hoeveel voorloopt”. Niet-gepubliceerde waarden voor de vier modellen volgens dezelfde maatstaf mogen niet worden gegokt.

Hoeveel kost het bij dezelfde taakomvang? Vijf voorbeelden die je zelf kunt narekenen

Hieronder wordt de input opgesplitst in drie elkaar uitsluitende tokencategorieën: gewone input, eerste cache-schrijfactie en latere cache-lezing, plus output. Elke rij is één verzoek, exclusief tool-aanroepen, platformtoeslagen of extra rondes; de output blijft in alle gevallen onder de 128K-limiet voor gewone verzoeken. De prijzen zijn berekend volgens de officiële prijzen hierboven, dus je kunt de tokenaantallen vervangen op basis van je eigen usage-logboeken.

Scenario en tokenverbruik Sol Opus 5.5 Astra Fable 5.1
A Gewoon: 100K nieuwe input + 50K output $0.70 $1.40 $3.50 $3.50
B Eerste cache-schrijfactie: 200K geschreven + 50K nieuwe input + 20K output $0.80 $1.60 (5m) / $2.20 (1h) $4.00 $4.00 (5m) / $5.50 (1h)
C Latere hit: 200K cache-lezing + 50K nieuwe input + 20K output $0.34 $0.64 $1.70 $1.55
D Asynchrone Batch-versie van A: 100K nieuwe input + 50K output $0.35 $0.70 $1.75 $1.75
E Lange input: 300K nieuwe input + 20K output $1.50 $1.60 $7.50 $4.00
A Gewoon: 100K nieuwe input + 50K output
Sol
$0.70
Opus 5.5
$1.40
Astra
$3.50
Fable 5.1
$3.50
B Eerste cache-schrijfactie: 200K geschreven + 50K nieuwe input + 20K output
Sol
$0.80
Opus 5.5
$1.60 (5m) / $2.20 (1h)
Astra
$4.00
Fable 5.1
$4.00 (5m) / $5.50 (1h)
C Latere hit: 200K cache-lezing + 50K nieuwe input + 20K output
Sol
$0.34
Opus 5.5
$0.64
Astra
$1.70
Fable 5.1
$1.55
D Asynchrone Batch-versie van A: 100K nieuwe input + 50K output
Sol
$0.35
Opus 5.5
$0.70
Astra
$1.75
Fable 5.1
$1.75
E Lange input: 300K nieuwe input + 20K output
Sol
$1.50
Opus 5.5
$1.60
Astra
$7.50
Fable 5.1
$4.00

Rekenvoorbeeld: A voor Sol = 0,1×$2 + 0,05×$10 = $0.70. B voor Opus 5m = 0,2×$5 + 0,05×$4 + 0,02×$20 = $1.60; C voor Opus = 0,2×$0.20 + 0,05×$4 + 0,02×$20 = $0.64. Bij E is de Sol-input 300K, dus boven 272K, en wordt het hele verzoek gerekend tegen $4 input en $15 output; Astra komt overeen met $20/$75. De 1M-context van Opus/Fable behoudt het standaardtarief. B en C zijn verschillende verzoeken: eerst schrijven, daarna lezen; bij C moet de cache nog geldig zijn. De cache-bewaartermijn van OpenAI en het 5m/1h-factureringsmechanisme van Anthropic verschillen; je mag de schrijfkosten van B niet per ongeluk bij elk verzoek van C optellen. Grondslag: prijzen van OpenAI’s twee modellen, Anthropic-prijsregels.

In een echte programmeerworkflow: hoe verdeel je het werk?

Laat Sol eerst de dagelijkse iteraties doen. Laat Sol eerst werk doen zoals het opsplitsen van vereisten, kleine wijzigingen in een bestaande repository, testpatches en werk dat in batch kan worden gecontroleerd, en registreer daarna de taaksuccesgraad, het aantal keren herwerk en het totale tokengebruik. De lage eenheidsprijs is het meest direct in voorbeelden zoals A–D die de 272K niet overschrijden; bij extreem lange verzoeken wordt het prijsvoordeel kleiner.

Laat Opus 5.5 agenttaken doen die moeilijk in één keer convergeren. De gezamenlijke AA-tests geven het hogere scores bij samengestelde, terminal- en kennistaken, maar onder de max-configuratie zijn de gemiddelde kosten per taak ook duidelijk hoger. Je kunt eerst een lokale baseline opbouwen met de standaard medium of het effort dat je daadwerkelijk gebruikt, en daarna voor moeilijke problemen opschalen. Zie de max-resultaten van AA niet als de standaardervaring.

Astra en Fable 5.1 zijn de zwaardere opties. Astra is competitief op AA’s AutomationBench-AA, Terminal-Bench 4.0 en GDP.pdf, en Fable 5.1 is sterker op sommige indicatoren voor langdurig kenniswerk, maar hun basisprijs voor input/output van $10/$50 is aanzienlijk hoger dan die van Sol. De cache-lezing van Fable is $0.25, lager dan de $1.00 van Astra; als je herhaaldelijk een grote prefix leest, kan de kostenrangorde veranderen. Voor moeilijke taken is het aan te raden om met de vier modellen een kleine acceptatietest op dezelfde repositorybehoefte te doen, en te kiezen op basis van “de kosten van een taak die succesvol is voltooid en kan worden samengevoegd”, niet op basis van de score op één ranglijst.

In PandaNpc zijn Codex en Claude Code twee beschikbare Agent Engines. Bij het kiezen van een ingang moet je ook kijken naar je bestaande abonnement of API-kanaal, toolrechten, repositorycontext en het reviewproces van je team; een model-API-prijsopgave kan niet direct worden omgerekend naar een toolabonnementslimiet. Dit artikel toont openbare specificaties en benchmarks, en claimt geen gemeten rangorde van de vier modellen binnen PandaNpc.

FAQ

Is Sol altijd half zo duur als Opus 5.5? Alleen de standaard-API-eenheidsprijzen voor input en output zijn elk de helft. Input boven 272K, cache-schrijven en -lezen, werkelijke reasoning-tokens, rondes en toolkosten veranderen allemaal de factuur voor de hele taak. Scenario E hierboven brengt de prijs per keer voor beide al dichter bij elkaar, op $1.50 en $1.60.

Kunnen de twee officiële programmeergrafieken bewijzen wie wint? Nee. De OpenAI-grafiek bevat geen Opus 5.5, de Anthropic-grafiek bevat geen Sol, en de benchmarks en harness verschillen. Wil je gezamenlijke resultaten van de vier modellen zien, kijk dan naar de vaste configuratietabel van AA v4.3.2; wil je je eigen toolkeuze bepalen, dan moet je je eigen repositorytaken opnieuw uitvoeren.

Kunnen cache en Batch worden gecombineerd? De prijsdocumentatie van Anthropic ondersteunt combinatie expliciet; of er daadwerkelijk een cache-hit plaatsvindt, hangt af van de prefix, geldigheidsduur en verzoekinstellingen. Bij OpenAI is Batch voor beide modellen 50% van het standaardtarief; controleer de specifieke factuur aan de hand van de overeenkomstige API-gebruiksrecords.