GPT-6 Sol vs Claude Opus 5.5: prezzi, punteggi e attività di programmazione: come scegliere?

Prova prima GPT-6 Sol per i compiti generali di programmazione API; per i compiti complessi puoi confrontare Claude Opus 5.5 e poi considerare GPT-6 Astra e Claude Fable 5.1 come opzioni per i compiti di difficoltà elevata. Questo articolo verifica le specifiche ufficiali dei quattro modelli, i prezzi per cache e Batch, i benchmark di terze parti a parità di criteri e fornisce cinque scenari di costo ricalcolabili.

PandaNpcPubblicato per la prima volta il
GPT-6 Sol vs Claude Opus 5.5: prezzi, punteggi e attività di programmazione: come scegliere?

In sintesi: per le normali attività di programmazione via API si può provare prima GPT-6 Sol. Il suo prezzo standard di input/output è di $2/$10 per milione di token, la metà di Claude Opus 5.5; nella configurazione di fascia più alta dello stesso sistema di valutazione di Artificial Analysis (AA), l'indice complessivo di Opus 5.5 è 58, mentre quello di Sol è 48. Non si tratta di un rapporto "a parità di prezzo, più forte": confronta prima i tassi di successo al primo tentativo, il numero di turni, i token totali e il lavoro manuale di rifacimento sulle attività del tuo repository, poi decidi se pagare per i punteggi più alti di Opus. Per attività a lungo raggio più difficili si può salire a GPT-6 Astra o Claude Fable 5.1; i prezzi unitari e le capacità dei quattro modelli non sono ordinati allo stesso modo.

Gestiamo PandaNpc, che supporta Codex e Claude Code, quindi abbiamo uno scenario d'uso del prodotto; questo articolo non contiene un test diretto degli stessi task sui quattro modelli, né spaccia le valutazioni pubbliche seguenti per test condotti da noi. I prezzi si riferiscono ai costi API del modello, non ai prezzi degli abbonamenti agli strumenti. Dati verificati al 23 settembre 2026; la valuta è il dollaro statunitense.

Specifiche dei quattro modelli: distinguere prima capacità, output e profilo predefinito

Per facilitare la lettura su mobile, la tabella seguente è raggruppata per OpenAI e Anthropic; l'"output massimo" è il limite per singola risposta, mentre la finestra di contesto è lo spazio disponibile complessivo per input e output, e non significa che ogni volta si possa generare la stessa lunghezza. Gli ID modello API possono essere usati direttamente per verificare la fatturazione o la configurazione di valutazione.

Specifiche OpenAI GPT-6 Sol GPT-6 Astra
ID modello API gpt-6-sol gpt-6-astra
Posizionamento ufficiale Equilibrio tra costo e capacità Attività end-to-end più complesse
Finestra di contesto 1,050,000 token 1,050,000 token
Output massimo per risposta 128,000 token 128,000 token
Modalità input/output Testo, immagini → testo Testo, immagini → testo
Effort di ragionamento none / low / medium / high / xhigh / max low / medium / high / xhigh / max
Effort predefinito medium Non indicato nella pagina ufficiale del modello
Data limite delle conoscenze 2026-04-20 2026-04-30
Stato di disponibilità Disponibile via API Disponibile via API
ID modello API
GPT-6 Sol
gpt-6-sol
GPT-6 Astra
gpt-6-astra
Posizionamento ufficiale
GPT-6 Sol
Equilibrio tra costo e capacità
GPT-6 Astra
Attività end-to-end più complesse
Finestra di contesto
GPT-6 Sol
1,050,000 token
GPT-6 Astra
1,050,000 token
Output massimo per risposta
GPT-6 Sol
128,000 token
GPT-6 Astra
128,000 token
Modalità input/output
GPT-6 Sol
Testo, immagini → testo
GPT-6 Astra
Testo, immagini → testo
Effort di ragionamento
GPT-6 Sol
none / low / medium / high / xhigh / max
GPT-6 Astra
low / medium / high / xhigh / max
Effort predefinito
GPT-6 Sol
medium
GPT-6 Astra
Non indicato nella pagina ufficiale del modello
Data limite delle conoscenze
GPT-6 Sol
2026-04-20
GPT-6 Astra
2026-04-30
Stato di disponibilità
GPT-6 Sol
Disponibile via API
GPT-6 Astra
Disponibile via API

Dati: pagina ufficiale del modello GPT-6 Sol, pagina ufficiale del modello GPT-6 Astra.

Specifiche Anthropic Claude Opus 5.5 Claude Fable 5.1
ID modello API claude-opus-5-5 claude-fable-5-1
Posizionamento ufficiale Programmazione agent a lungo raggio e knowledge work Ragionamento più difficile e lavoro agent a lungo raggio
Finestra di contesto 1,000,000 token 1,000,000 token
Output massimo per risposta 128,000 token; Batch beta fino a 300,000 128,000 token
Modalità input/output Testo, immagini → testo Testo, immagini → testo
Metodo di ragionamento adaptive thinking, sempre attivo adaptive thinking, sempre attivo
Effort predefinito medium high
Data limite delle conoscenze 2026-06 2026-06
Stato di disponibilità Disponibile via Claude API Disponibile via Claude API
ID modello API
Claude Opus 5.5
claude-opus-5-5
Claude Fable 5.1
claude-fable-5-1
Posizionamento ufficiale
Claude Opus 5.5
Programmazione agent a lungo raggio e knowledge work
Claude Fable 5.1
Ragionamento più difficile e lavoro agent a lungo raggio
Finestra di contesto
Claude Opus 5.5
1,000,000 token
Claude Fable 5.1
1,000,000 token
Output massimo per risposta
Claude Opus 5.5
128,000 token; Batch beta fino a 300,000
Claude Fable 5.1
128,000 token
Modalità input/output
Claude Opus 5.5
Testo, immagini → testo
Claude Fable 5.1
Testo, immagini → testo
Metodo di ragionamento
Claude Opus 5.5
adaptive thinking, sempre attivo
Claude Fable 5.1
adaptive thinking, sempre attivo
Effort predefinito
Claude Opus 5.5
medium
Claude Fable 5.1
high
Data limite delle conoscenze
Claude Opus 5.5
2026-06
Claude Fable 5.1
2026-06
Stato di disponibilità
Claude Opus 5.5
Disponibile via Claude API
Claude Fable 5.1
Disponibile via Claude API

Dati: pagina ufficiale del modello Opus 5.5, pagina ufficiale del modello Fable 5.1. L'output da 300K di Opus si applica solo al Batch beta specificato e all'header output-300k-2026-03-24, non è il limite per le normali richieste interattive.

Prezzi dei quattro modelli: input normale, scrittura in cache e cache hit sono token diversi

Le tabelle seguenti indicano tutte il prezzo in dollari per milione di token, cioè il prezzo unitario della corrispondente categoria di token. L'input normale non aggiunge una "tariffa di scrittura in cache"; solo i token scritti per la prima volta nella cache usano il prezzo di scrittura. Dopo un cache hit si paga il prezzo di lettura, mentre l'output viene comunque addebitato separatamente. Entrambe le aziende offrono uno sconto del 50% su input/output Batch, ma Batch è elaborazione asincrona e non è adatta a conversazioni di programmazione che richiedono feedback immediato.

API standard OpenAI GPT-6 Sol GPT-6 Astra
Input normale $2.00 $10.00
Scrittura in cache $2.50 $12.50
Lettura cache $0.20 $1.00
Output $10.00 $50.00
Input/output Batch $1.00 / $5.00 $5.00 / $25.00
Input oltre 272K Intera richiesta: costi di input e cache ×2, costo di output ×1,5 Intera richiesta: costi di input e cache ×2, costo di output ×1,5
Input normale
GPT-6 Sol
$2.00
GPT-6 Astra
$10.00
Scrittura in cache
GPT-6 Sol
$2.50
GPT-6 Astra
$12.50
Lettura cache
GPT-6 Sol
$0.20
GPT-6 Astra
$1.00
Output
GPT-6 Sol
$10.00
GPT-6 Astra
$50.00
Input/output Batch
GPT-6 Sol
$1.00 / $5.00
GPT-6 Astra
$5.00 / $25.00
Input oltre 272K
GPT-6 Sol
Intera richiesta: costi di input e cache ×2, costo di output ×1,5
GPT-6 Astra
Intera richiesta: costi di input e cache ×2, costo di output ×1,5

Fonti: Sol, Astra, listino prezzi OpenAI, documentazione OpenAI sulla cache dei. Superare 272K non significa che venga maggiorato solo l'eccedenza; se la soglia viene superata si calcola in base ai token di input dell'intera richiesta, inclusi gli input relativi alla cache.

API Anthropic standard Claude Opus 5.5 Claude Fable 5.1
Input normale $4.00 $10.00
Scrittura in cache 5 minuti $5.00 $12.50
Scrittura in cache 1 ora $8.00 $20.00
Lettura cache $0.20 $0.25
Output $20.00 $50.00
Input/output Batch $2.00 / $10.00 $5.00 / $25.00
Contesto lungo 1M Prezzo standard, nessun sovrapprezzo >200K Prezzo standard, nessun sovrapprezzo >200K
Input normale
Claude Opus 5.5
$4.00
Claude Fable 5.1
$10.00
Scrittura in cache 5 minuti
Claude Opus 5.5
$5.00
Claude Fable 5.1
$12.50
Scrittura in cache 1 ora
Claude Opus 5.5
$8.00
Claude Fable 5.1
$20.00
Lettura cache
Claude Opus 5.5
$0.20
Claude Fable 5.1
$0.25
Output
Claude Opus 5.5
$20.00
Claude Fable 5.1
$50.00
Input/output Batch
Claude Opus 5.5
$2.00 / $10.00
Claude Fable 5.1
$5.00 / $25.00
Contesto lungo 1M
Claude Opus 5.5
Prezzo standard, nessun sovrapprezzo >200K
Claude Fable 5.1
Prezzo standard, nessun sovrapprezzo >200K

Fonti: Opus 5.5, Fable 5.1, prezzi Anthropic e regole Batch/cache, documentazione sul contesto lungo. Anthropic consente esplicitamente di combinare gli sconti Batch e cache; un cache hit deve rispettare il periodo di validità corrispondente e le stesse condizioni di prefisso.

Punteggi specifici dei quattro modelli nello stesso sistema di valutazione

Le tabelle seguenti provengono tutte dall'Artificial Analysis Intelligence Index v4.3.2. La configurazione di test è GPT-6 Sol max, GPT-6 Astra max, Claude Opus 5.5 e Fable 5.1 tutti con adaptive reasoning max effort e default fallback abilitato. Non sono i profili predefiniti dei quattro modelli, in particolare Opus usa medium come default e Fable high; anche se tutti i modelli sono indicati come max, il consumo effettivo di token di ragionamento è diverso. AA usa task uniformi e un proprio harness, quindi i risultati si possono confrontare orizzontalmente all'interno di questa configurazione di test; i punteggi delle presentazioni dei produttori non possono essere mescolati in questa tabella. Link: confronto originale Sol–Opus, confronto originale Astra–Fable, metodologia AA.

Attività AA complessive e di ingegneria Sol Opus 5.5 Astra Fable 5.1
Indice complessivo v4.3.2 (punti) 48 58 53 53
Terminal-Bench 4.0 (tasso di successo) 44% 60% 59% 52%
AutomationBench-AA (tasso di successo) 62% 70% 68% 59%
SciCode (tasso di successo) 58% 67% 56% 63%
AA-LCR v1.1 contesto lungo (tasso di successo) 84% 85% 81% 85%
Indice complessivo v4.3.2 (punti)
Sol
48
Opus 5.5
58
Astra
53
Fable 5.1
53
Terminal-Bench 4.0 (tasso di successo)
Sol
44%
Opus 5.5
60%
Astra
59%
Fable 5.1
52%
AutomationBench-AA (tasso di successo)
Sol
62%
Opus 5.5
70%
Astra
68%
Fable 5.1
59%
SciCode (tasso di successo)
Sol
58%
Opus 5.5
67%
Astra
56%
Fable 5.1
63%
AA-LCR v1.1 contesto lungo (tasso di successo)
Sol
84%
Opus 5.5
85%
Astra
81%
Fable 5.1
85%

I valori riga per riga provengono dalle due pagine di confronto dei modelli AA della stessa versione sopra indicate: pagina AA Sol–Opus e pagina Astra–Fable. Per esempio, nell'harness Terminal-Bench 4.0 di AA Opus 5.5 supera Sol di 16 punti percentuali; questo dato non va combinato con il 66.4% del sito ufficiale Anthropic, perché le impostazioni di esecuzione sono diverse.

Attività AA di conoscenza e professionali Sol Opus 5.5 Astra Fable 5.1
AA-Briefcase v1.1 (Elo) 1483 1822 1569 1678
GDPval-AA v2.1 (Elo) 1487 1846 1542 1735
Humanity's Last Exam (tasso di successo) 48% 61% 55% 59%
GDP.pdf (tasso di successo complessivo) 25% 26% 31% 26%
CritPt (tasso di successo) 31% 32% 32% 30%
AA-Omniscience (punteggio indice, non percentuale) 27 46 43 43
AA-Briefcase v1.1 (Elo)
Sol
1483
Opus 5.5
1822
Astra
1569
Fable 5.1
1678
GDPval-AA v2.1 (Elo)
Sol
1487
Opus 5.5
1846
Astra
1542
Fable 5.1
1735
Humanity's Last Exam (tasso di successo)
Sol
48%
Opus 5.5
61%
Astra
55%
Fable 5.1
59%
GDP.pdf (tasso di successo complessivo)
Sol
25%
Opus 5.5
26%
Astra
31%
Fable 5.1
26%
CritPt (tasso di successo)
Sol
31%
Opus 5.5
32%
Astra
32%
Fable 5.1
30%
AA-Omniscience (punteggio indice, non percentuale)
Sol
27
Opus 5.5
46
Astra
43
Fable 5.1
43

I valori riga per riga provengono da: AA Sol–Opus, AA Astra–Fable. Piccole differenze di 1–2 punti percentuali non vanno interpretate come una vittoria stabile; inoltre Elo, punteggio indice e tasso di successo non sono la stessa unità di misura.

Costi e utilizzo dei test AA Sol Opus 5.5 Astra Fable 5.1
Costo medio per attività dell'indice $1.06 $5.98 $3.26 $7.63
Token di output medi per attività 31K 119K 27K 78K
Di cui token di ragionamento 21K 84K 17K 47K
Costo medio per attività dell'indice
Sol
$1.06
Opus 5.5
$5.98
Astra
$3.26
Fable 5.1
$7.63
Token di output medi per attività
Sol
31K
Opus 5.5
119K
Astra
27K
Fable 5.1
78K
Di cui token di ragionamento
Sol
21K
Opus 5.5
84K
Astra
17K
Fable 5.1
47K

Le fonti sono ancora AA Sol–Opus e AA Astra–Fable. Il costo per attività è la media ponderata dell'utilizzo nei test AA, non un preventivo per "completare una richiesta" nel tuo repository. La configurazione max di Opus consuma più token di output e di ragionamento, ed è una delle ragioni per cui il divario in fattura supera quello dei prezzi unitari.

Grafici dei due siti ufficiali: confermano le rispettive conclusioni, ma non si possono combinare in un confronto diretto

Il grafico DeepSWE v1.1 di OpenAI indica GPT-6 Sol max al 68.8%, mentre nel grafico Claude Fable 5 con xhigh è al 69.9%; non c'è Opus 5.5. L'asse orizzontale è il costo per attività, su scala logaritmica. Anche l'Opus 5 nel grafico non è Opus 5.5. Questo mostra che Sol, nelle impostazioni pubblicate da OpenAI, ha risultati da agente di programmazione vicini a quelli dei modelli di fascia alta, ma non può sostituire un test diretto dei quattro modelli.

Grafico ufficiale OpenAI DeepSWE v1.1: GPT-6 Sol max è al 68,8%, nel grafico non c'è Opus 5.5

Figura 1: OpenAI《Introducing GPT-6 Sol and Luna》 "Coding", 2026-09-22. Modelli ed effort fanno fede secondo la legenda e le note a piè di pagina del testo originale. Apri l'immagine originale completa per leggere i caratteri piccoli.

Il grafico Terminal-Bench 4.0 di Anthropic indica Claude Opus 5.5 xhigh al 66.4%. Nel grafico GPT-6 Astra è al 57.9% con high, non è GPT-6 Sol. La curva ha anche punti per l'effort predefinito, ma la loro posizione non va considerata come punteggio xhigh. L'harness del produttore qui è diverso dal Terminal-Bench 4.0 della tabella AA sopra, quindi non si può sottrarre 66.4% dal 44% che AA assegna a Sol.

Grafico ufficiale Anthropic Terminal-Bench 4.0: Opus 5.5 xhigh è al 66,4%, nel grafico non c'è GPT-6 Sol

Figura 2: Anthropic《Claude Opus 5.5》 "Coding", 2026-09-22. L'asse orizzontale è il costo per tentativo, su scala logaritmica; per profili mostrati, intervalli statistici e limitazioni, vedere il testo originale. Apri l'immagine originale completa per leggere i caratteri piccoli.

Ci sono anche punteggi pubblicati separatamente dai produttori, che non è opportuno sottrarre direttamente: OpenAI riporta per Sol xhigh AutomationBench 1.0.6 al 33.2%, per max Agents' Last Exam V1 al 56.4%, e per xhigh OSWorld 2.0 offline al 60.5%, dalla stessa pagina di annuncio OpenAI; Anthropic riporta per Opus 5.5 FrontierCode v1.1 Main 54.4%, CursorBench 4.0 57.8%, GDPval-AA v2.1 1846 Elo, Humanity's Last Exam with tools 67.7%, dalla stessa pagina di annuncio Anthropic. Non è confermato che versioni, strumenti, effort o harness di queste voci coincidano con quelli dell'altra parte, quindi non si indica "quanto è in vantaggio". I valori non pubblicati per i quattro modelli con lo stesso protocollo non si possono indovinare.

Quanto costa a parità di volume di attività? Cinque esempi ricalcolabili

Qui sotto dividiamo l'input in tre categorie mutuamente esclusive di token (normale, prima scrittura in cache e successive letture dalla cache), più l'output. Ogni riga è una singola richiesta, senza chiamate a strumenti, costi aggiuntivi della piattaforma o turni extra; gli output sono tutti sotto il limite di 128K delle richieste normali. I prezzi sono calcolati secondo i listini ufficiali sopra, quindi puoi sostituire il numero di token in base ai tuoi log di utilizzo.

Scenario e utilizzo token Sol Opus 5.5 Astra Fable 5.1
A Normale: 100K nuovo input + 50K output $0.70 $1.40 $3.50 $3.50
B Prima scrittura in cache: 200K scrittura + 50K nuovo input + 20K output $0.80 $1.60 (5m) / $2.20 (1h) $4.00 $4.00 (5m) / $5.50 (1h)
C Cache hit successivo: 200K lettura cache + 50K nuovo input + 20K output $0.34 $0.64 $1.70 $1.55
D Versione Batch asincrona di A: 100K nuovo input + 50K output $0.35 $0.70 $1.75 $1.75
E Input lungo: 300K nuovo input + 20K output $1.50 $1.60 $7.50 $4.00
A Normale: 100K nuovo input + 50K output
Sol
$0.70
Opus 5.5
$1.40
Astra
$3.50
Fable 5.1
$3.50
B Prima scrittura in cache: 200K scrittura + 50K nuovo input + 20K output
Sol
$0.80
Opus 5.5
$1.60 (5m) / $2.20 (1h)
Astra
$4.00
Fable 5.1
$4.00 (5m) / $5.50 (1h)
C Cache hit successivo: 200K lettura cache + 50K nuovo input + 20K output
Sol
$0.34
Opus 5.5
$0.64
Astra
$1.70
Fable 5.1
$1.55
D Versione Batch asincrona di A: 100K nuovo input + 50K output
Sol
$0.35
Opus 5.5
$0.70
Astra
$1.75
Fable 5.1
$1.75
E Input lungo: 300K nuovo input + 20K output
Sol
$1.50
Opus 5.5
$1.60
Astra
$7.50
Fable 5.1
$4.00

Esempio di calcolo: Sol per A = 0,1×$2 + 0,05×$10 = $0.70. Opus 5m per B =0,2×$5 + 0,05×$4 + 0,02×$20 = $1.60; Opus per C = 0,2×$0.20 + 0,05×$4 + 0,02×$20 = $0.64. Per E, l'input di Sol 300K ha superato 272K, quindi l'intera richiesta si calcola con $4 di input e $15 di output; per Astra i valori corrispondenti sono $20/$75. Opus/Fable mantengono il prezzo standard con contesto 1M. B e C sono richieste diverse, prima scrittura e poi lettura; C deve assicurarsi che la cache sia ancora valida. Il periodo di conservazione della cache di OpenAI e il meccanismo di fatturazione 5m/1h di Anthropic sono diversi, quindi non si deve aggiungere per errore il costo di scrittura di B a ogni richiesta di C. Fonti: prezzi dei due modelli OpenAI, regole di prezzo Anthropic.

Inseriti in un flusso di lavoro di programmazione reale, come dividere i compiti?

Sol per le iterazioni quotidiane. Per la scomposizione dei requisiti, piccole modifiche a repository esistenti, patch di test e lavoro verificabile in batch, fai gestire prima a Sol, poi registra tasso di successo delle attività, numero di rifacimenti e token totali. Il suo prezzo unitario basso è più evidente negli esempi A–D, che non superano 272K; il vantaggio di prezzo si riduce per richieste molto lunghe.

Opus 5.5 per attività agent difficili da far convergere in un solo passaggio. Nei test diretti di AA ottiene punteggi più alti in attività complessive, terminale e di conoscenza, ma con la configurazione max anche il costo medio per attività è nettamente più alto. Puoi prima stabilire una baseline locale con il default medium o con leffort che usi realmente, poi passare a un profilo più alto per i problemi difficili. Non considerare i risultati max di AA come l'esperienza predefinita.

Astra e Fable 5.1 sono i profili di fascia superiore. Astra è competitivo su AutomationBench-AA, Terminal-Bench 4.0 e GDP.pdf di AA, mentre Fable 5.1 è più forte su alcuni indicatori di knowledge work a lungo raggio, ma il prezzo base di input/output $10/$50 di entrambi è nettamente superiore a quello di Sol. La lettura cache di Fable costa $0.25, meno di $1.00 di Astra; se si legge ripetutamente un prefisso grande, l'ordine dei costi può cambiare. Per attività molto difficili si consiglia di fare una piccola validazione dei quattro modelli sullo stesso requisito del repository e scegliere in base al "costo di un'attività completata con successo e integrabile", non in base al punteggio di una singola classifica.

In PandaNpc, Codex e Claude Code sono due Agent Engine disponibili. Quando scegli il punto di accesso devi anche considerare l'abbonamento o il canale API che già hai, i permessi degli strumenti, il contesto del repository e il processo di revisione del team; il listino API del modello non si converte direttamente in quota di abbonamento allo strumento. Questo articolo mostra specifiche e valutazioni pubbliche, senza dichiarare una classifica basata su test reali dei quattro modelli all'interno di PandaNpc.

FAQ

Sol costa sempre la metà di Opus 5.5? Solo i prezzi unitari di input e output dell'API standard sono ciascuno la metà. Input oltre 272K, scrittura e lettura della cache, token di ragionamento effettivi, turni e costi degli strumenti cambiano il conto totale dell'attività. Lo scenario E sopra ha già avvicinato i prezzi per singola richiesta a $1.50 e $1.60.

I due grafici ufficiali sulla programmazione dimostrano chi vince? No. Il grafico OpenAI non ha Opus 5.5, quello Anthropic non ha Sol, e anche benchmark e harness sono diversi. Per vedere i risultati diretti dei quattro modelli, guarda la tabella AA v4.3.2 con configurazione fissa; per decidere quale strumento usare, devi invece rieseguire le attività sul tuo repository.

Cache e Batch si possono combinare? La documentazione prezzi di Anthropic supporta esplicitamente la combinazione; se il cache hit avvenga realmente dipende da prefisso, validità e impostazioni della richiesta. Per i due modelli OpenAI, Batch è al 50% della tariffa standard; per il conto specifico verifica i registri di utilizzo della corrispondente API.