Claude Fable 5.1: analisi completa di benchmark, miglioramenti, prezzi e velocità

I risultati completi di Claude Fable 5.1 su 7 categorie di benchmark principali, confronto punto per punto con Fable 5, Opus 5 e GPT-5.6 Sol, e spiegazione dei cambiamenti della versione 5.1 riguardanti attività a lungo termine, chiamate agli strumenti, costi di cache, velocità, limiti dei piani e migrazione.

PandaNpcPubblicato per la prima volta il
Claude Fable 5.1: analisi completa di benchmark, miglioramenti, prezzi e velocità

Claude Fable 5.1 è stato rilasciato ufficialmente il 1° settembre 2026. Partiamo dalle conclusioni: non è un normale aggiornamento del modello pensato per il Q&A generico, ma un modello di punta ad alto costo progettato per programmazione di lunga durata, ricerca complessa, chiamate a strumenti su più applicazioni e Agent non supervisionati. Nei 7 benchmark principali pubblicati da Anthropic, Fable 5.1 supera Fable 5 in tutti; ma il suo prezzo unitario API è ancora il doppio di Opus 5 e la latenza relativa è ufficialmente indicata come "più lenta".

Se il tuo compito è soltanto modificare un file, scrivere un breve testo o rispondere a domande comuni, Anthropic consiglia comunque di partire da Opus 5. Fable 5.1 è più indicato per i compiti a catena lunga che i modelli normali non riescono a completare in modo stabile nemmeno con un effort elevato. Questo articolo riunisce i dati ufficiali di rilascio, il significato dei vari benchmark, i miglioramenti specifici della 5.1, i prezzi, la velocità e i vincoli di migrazione, per evitare di guardare soltanto a un grafico di punteggi del tipo "chi vince".

Le specifiche di Fable 5.1 in una tabella

Elemento Claude Fable 5.1 Claude Opus 5 Claude Sonnet 5
Finestra di contesto 1M token 1M token 1M token
Output massimo 128K token 128K token 128K token
Prezzo di input $10 / MTok $5 / MTok $2 / MTok
Prezzo di output $50 / MTok $25 / MTok $10 / MTok
Latenza relativa Più lenta Media Veloce
Thinking Adaptive, sempre attivo Adaptive Adaptive
Effort predefinito High High High
Knowledge cutoff affidabile Giugno 2026 Maggio 2026 Gennaio 2026

Il "più lenta" qui proviene dal catalogo dei modelli Anthropic e indica un livello di latenza relativa, non un numero fisso di token al secondo. Quanto tempo serve davvero per completare un'attività dipende anche da effort, dal numero di cicli di chiamate agli strumenti, dal tasso di hit nella cache, dalla lunghezza del contesto e dai nuovi tentativi dopo errori.

Workflow a lungo orizzonte di Agent di Fable 5.1, dalla pianificazione alla verifica
Fable 5.1 non è pensato per risposte usa-e-getta, ma per attività lunghe che richiedono pianificazione, esecuzione, recupero, verifica e rendicontazione continue.

Tabella completa dei benchmark principali di Fable 5.1

La tabella seguente riprende direttamente la tabella principale della pagina di rilascio di Anthropic del 1° settembre 2026. Per evitare letture errate, percentuali, punteggi grezzi di GDPval-AA, risultati partial/strict di OSWorld e risultati HLE con/senza strumenti sono elencati separatamente. Ogni benchmark mantiene il nome ufficiale in inglese, con il nome italiano nella riga successiva.

Capacità Benchmark Fable 5.1 Fable 5 Opus 5 GPT-5.6 Sol 5.1 vs Fable 5
Ricerca scientifica con agenti Terminal-Bench-Science 0.1
Benchmark terminale per la ricerca scientifica con agenti
52,6% 24,7% 29,0% 22,4% +27,9 punti percentuali
Programmazione terminale con agenti Terminal-Bench 4.0
Benchmark di programmazione terminale per agenti
55,8% 42,0% 52,3% 37,3% +13,8 punti percentuali
Lavoro professionale basato su conoscenza GDPval-AA v2
Benchmark di compiti professionali a valore economico reale
1853 1723 1824 1711 +130 punti
Operazioni al computer OSWorld 2.0 — Partial
Benchmark di operazioni reali al computer: punteggio di completamento parziale
77,9% 72,9% 75,4% — +5,0 punti percentuali
Operazioni al computer OSWorld 2.0 — Strict
Benchmark di operazioni reali al computer: tasso di completamento rigoroso
41,7% 36,1% 39,6% — +5,6 punti percentuali
Ragionamento multidisciplinare Humanity's Last Exam — No tools
L'ultimo esame dell'umanità: senza strumenti
60,9% 57,8% 56,6% — +3,1 punti percentuali
Ragionamento multidisciplinare Humanity's Last Exam — With tools
L'ultimo esame dell'umanità: con strumenti
65,0% 63,8% 63,6% — +1,2 punti percentuali
Flussi di lavoro aziendali AutomationBench
Benchmark di flussi di lavoro aziendali automatizzati su più applicazioni
31,4% 17,1% 26,9% 19,6% +14,3 punti percentuali
Programmazione con agenti CursorBench 3.2.0
Benchmark di attività di programmazione reali multi-file
73,4% 70,5% 70,0% 67,2% +2,9 punti percentuali

— indica che la tabella principale di Anthropic non fornisce un punteggio corrispondente, non che il modello non sia in grado di svolgere il compito. In Terminal-Bench 4.0, Mythos 5.1 — che ha meno restrizioni ed è aperto solo a programmi fidati — ha ottenuto il 60,9%; questo articolo si concentra su Fable 5.1, disponibile per gli utenti normali, e non mescola i risultati di Mythos nella colonna di Fable.

Cosa misura Terminal-Bench-Science 0.1

Terminal-Bench-Science 0.1 contiene 70 flussi di lavoro di ricerca reali in cinque ambiti: scienze della vita, scienze fisiche, scienze della Terra, matematica e ingegneria. I compiti non sono domande a scelta multipla: richiedono che l'Agent completi analisi dei dati, inferenza statistica, simulazioni, ottimizzazione, dimostrazioni di teoremi, ricostruzione di immagini o machine learning scientifico nel terminale, e verifichi i risultati con test riproducibili.

Il 52,6% di Fable 5.1, contro il 24,7% di Fable 5 negli esperimenti ufficiali di riproduzione, rappresenta un miglioramento di 27,9 punti percentuali: è il balzo più evidente dell'intera tabella. Ma Anthropic segnala anche un errore standard di circa ±3,5–4,5 punti percentuali per ogni modello: non si può trattare la cifra decimale come una classifica assolutamente precisa.

Cosa misurano Terminal-Bench 4.0 e CursorBench 3.2.0

Terminal-Bench fa sì che l'Agent gestisca attività complesse in un vero ambiente terminale, verificando soprattutto se è in grado di comprendere l'ambiente, chiamare strumenti, modificare file e superare infine la validazione. Fable 5.1 raggiunge il 55,8%, 13,8 punti percentuali in più di Fable 5, superando anche il 52,3% di Opus 5.

CursorBench 3.2 deriva da attività ambigue e multi-file tratte da sessioni Cursor reali; la versione 3.2 aggiunge problemi di aderenza alle istruzioni e di uso avanzato degli strumenti. Fable 5.1 Max ottiene il 73,4%: il vantaggio non è vistoso come in Terminal-Bench-Science, ma in media usa 72.060 token e costa $9,64 per attività; Fable 5 Max ne usa 103.525 e costa $17,32. Qui l'aspetto più interessante è la riduzione di token e costi a parità di attività, non i 2,9 punti percentuali in sé.

Cosa misura GDPval-AA v2

GDPval-AA v2 usa 220 attività progettate da professionisti del settore, che coprono 44 professioni e 9 settori, per valutare la capacità del modello di gestire lavoro intellettuale reale con valore economico. Il suo 1853 è un punteggio composito, non 1853%. Questo risultato indica che Fable 5.1 supera Fable 5 in documenti professionali, analisi e deliverable, superando di poco anche Opus 5.

Perché OSWorld 2.0 ha due punteggi

OSWorld 2.0 contiene 108 flussi di lavoro di lunga durata per operazioni al computer; il tempo umano mediano di completamento per ogni attività è di circa 1,6 ore. Partial assegna un punteggio di completamento parziale basato su più checkpoint; Strict considera riuscita solo la piena realizzazione dell'obiettivo.

Quindi il 77,9% partial e il 41,7% strict di Fable 5.1 non sono contraddittori: spesso riesce a completare la maggior parte dei passaggi, ma una parte dei compiti non arriva alla chiusura end-to-end. Questo ci ricorda anche che un Agent per computer che "sembra sempre al lavoro" non equivale a un'attività riuscita.

Cosa misura Humanity's Last Exam

Humanity's Last Exam è stato creato da Center for AI Safety e Scale AI e contiene 2.500 domande trasversali, di livello esperto, difficili da risolvere con una semplice ricerca. Fable 5.1 supera Fable 5 di 3,1 punti percentuali senza strumenti e solo di 1,2 punti percentuali quando gli strumenti sono consentiti. È sicuramente più forte, ma non su tutti i benchmark i miglioramenti raddoppiano.

Cosa misura AutomationBench

AutomationBench verifica se l'Agent riesce a completare flussi di vendita, marketing, operations, assistenza clienti, finanza e risorse umane attraverso strumenti SaaS simulati come CRM, posta elettronica, calendario, messaggistica e project management. Fable 5.1 passa dal 17,1% al 31,4%, con un miglioramento relativo di circa l'84%: ciò indica che la 5.1 ha fatto progressi sostanziali nella gestione dello stato tra più applicazioni e nell'esecuzione di passaggi lunghi; ma il 31,4% mostra anche che questo tipo di automazione aziendale non supervisionata è ancora lontano dall'essere risolto.

Matrice di copertura delle capacità di Fable 5.1 nei sette benchmark principali
I sette benchmark coprono rispettivamente ricerca scientifica, programmazione terminale, lavoro professionale basato su conoscenza, operazioni al computer, ragionamento multidisciplinare, processi aziendali e programmazione multi-file.

Miglioramenti di Fable 5.1 rispetto a Fable 5

1. Nei compiti lunghi, meno scorciatoie

Anthropic posiziona Fable 5.1 come un modello Agent di lunga durata: prima pianifica, poi usa gli strumenti, si riprende dagli errori, verifica i risultati e riferisce attivamente lo stato di avanzamento. Dà più importanza alla correzione delle cause profonde, invece degli aggiramenti locali per far diventare verde un singolo test il prima possibile. Gli scenari target elencati ufficialmente includono funzionalità su più codebase, code review, ottimizzazione delle prestazioni, sessioni autonome di più giorni, ricerca, documenti, fogli di calcolo e presentazioni.

2. A effort basso, risultati paragonabili a quelli costosi della generazione precedente

Fable 5.1 aggiunge la possibilità di regolare l'effort per messaggio. Le curve di costo ufficiali mostrano che con effort Low o Medium, su alcune attività può eguagliare o superare Fable 5, riducendo al contempo token e costi. Claude Code usa High effort come default; Claude.ai e Cowork usano Medium come default: quando si confrontano i modelli bisogna prima verificare l'effort, senza mettere direttamente a confronto risultati ottenuti con livelli diversi.

3. Progressi leggibili tra le chiamate agli strumenti

L'API aggiunge la capacità in test display: "updates", che consente al modello di fornire aggiornamenti di avanzamento rivolti all'utente tra una chiamata e l'altra agli strumenti. Per le attività che durano ore, questo rende più facile capire cosa sta facendo e se si sta discostando dall'obiettivo, rispetto a vedere soltanto comparire in continuazione schede di strumenti.

4. Scrittura, verifica visiva e auto-test più completi

Secondo la comunicazione ufficiale, la 5.1 scrive attivamente test per verificare le proprie modifiche e usa le capacità visive per controllare l'output rispetto agli obiettivi di progettazione. Le valutazioni dei partner si concentrano inoltre su avanzamenti più concisi, risposte più complete alle domande in più parti, tracciamento delle catene di chiamate su più servizi e leggibilità mantenuta anche dopo lunghe esecuzioni. Sono feedback qualitativi e non devono spacciarsi per conclusioni uniformi di benchmark.

5. Blocchi di sicurezza più precisi, ma non scomparsi

Rispetto al lancio di Fable 5, i falsi positivi delle protezioni di cybersicurezza di Fable 5.1 si riducono di circa il 60%, e le domande di base di biologia e medicina attivano un downgrade con una frequenza inferiore di circa l'85%. Ora può essere usato per individuare vulnerabilità software, ma i compiti a duplice uso come i test di penetrazione, la generazione di codice di exploit e la scansione di vulnerabilità binarie possono ancora essere instradati a Opus. Una volta instradati, la fatturazione non avviene secondo le tariffe Fable.

6. Nuova marcatura della provenienza dei contenuti

Fable 5.1 introduce la content provenance. Il testo generato può contenere una filigrana statistica, verificabile con lo strumento di controllo dei contenuti di Anthropic. Non aggiunge marcatori visibili nel corpo del testo, ma per piattaforme di contenuti, istruzione e audit aziendali è un nuovo comportamento da conoscere in anticipo.

I sei miglioramenti principali di Fable 5.1 rispetto alla generazione precedente
I cambiamenti della 5.1 riguardano attività lunghe, efficienza a effort basso, rendicontazione dei progressi, auto-verifica, meno falsi positivi e marcatura della provenienza dei contenuti.

Come si calcola il costo di Fable 5.1

Voce di fatturazione Prezzo di Fable 5.1 Confronto con Fable 5
Input $10 / 1 milione di token Invariato
Output $50 / 1 milione di token Invariato
Scrittura in cache di 5 minuti $12,50 / 1 milione di token Stessa fascia
Scrittura in cache di 1 ora $20 / 1 milione di token Stessa fascia
Lettura dalla cache $0,25 / 1 milione di token Ridotta del 75%
Batch API 50% dei prezzi di input e output Secondo le regole Batch

Supponiamo che una lunga attività legga in totale 10 milioni di token dalla cache, produca 200.000 nuovi token di input e 50.000 token di output, senza considerare le scritture in cache:

text
缓存读取:10 × $0.25 = $2.50
新输入:0.2 × $10 = $2.00
输出:0.05 × $50 = $2.50
合计:$7.00

Gli stessi 10 milioni di letture dalla cache su Fable 5 costano circa $10, quindi solo questa voce fa risparmiare $7,50. Su questa base Anthropic stima che il costo reale dei tipici task fatturati a token possa ridursi di circa il 25%, e fino a circa il 45% per i task fortemente basati su Agent che riutilizzano spesso contesti lunghi. Non è un taglio generalizzato dei prezzi dell'API, ma più hit nella cache ci sono, più il risparmio è evidente.

Gli abbonati non godono necessariamente dello sconto sulla cache API

I seat premium di Max e Team/Enterprise possono destinare ai modelli Fable fino al 50% della quota settimanale; Pro e i seat standard consumano invece usage credits fin dall'inizio. Per il consumo effettivo fai riferimento alla pagina Usage dell'account. Lo sconto sulla lettura della cache riguarda soprattutto gli scenari fatturati a token: non si può convertire lo sconto del 75% sulla cache API in "quattro volte di più con il piano Max".

Struttura dei costi di input, output e cache di Fable 5.1
I prezzi unitari di input e output di Fable 5.1 non sono cambiati; il calo principale arriva dalla lettura della cache: più si riutilizza un contesto lungo, più si guadagna.

Fable 5.1 è veloce o no?

La risposta è: la risposta al singolo turno è piuttosto lenta, ma il tempo totale di completamento dei task complessi può essere più breve.

  • Il catalogo modelli di Anthropic classifica Fable 5.1 come Slower, Opus 5 come Moderate e Sonnet 5 come Fast.
  • Claude Code usa High effort come default e quindi impiega naturalmente più tempo di ragionamento rispetto a Low o Medium.
  • Every, sui propri carichi di lavoro, sostiene che Fable 5.1 sia circa due volte più veloce di Opus 5 con la metà dei token; è un test specifico di un partner, non una garanzia di velocità generale.
  • In CursorBench, Fable 5.1 Max fa in media 70 passaggi con 72.060 token; Fable 5 Max fa gli stessi 72 passaggi ma usa 103.525 token. Il vantaggio della 5.1 sta più nel "fare meno deviazioni e consumare meno token", non necessariamente nell'essere più veloce sul primo token.

Perciò per chat, codice breve e interazioni frequenti conviene scegliere Sonnet 5 o Opus 5; per debug su più codebase, ricerche lunghe e task non supervisionati che richiedono auto-verifica, valuta allora Fable 5.1.

Modifiche di compatibilità da gestire prima di passare a Fable 5.1

Aggiorna Claude Code almeno alla 2.1.250

Le note su piani e disponibilità di Anthropic richiedono Claude Code 2.1.250 o versioni successive. Se Fable 5.1 non compare, controlla prima:

bash
claude --version

Poi aggiorna seguendo la procedura ufficiale di Claude Code e riavvia la sessione. L'ID del modello API di Fable 5.1 è:

text
claude-fable-5-1

Il forced tool use può restituire errori

Se la richiesta obbliga il modello a chiamare un determinato strumento, Fable 5.1 può restituire un errore. Prima di migrare, controlla tool_choice e i flussi di strumenti forzati dei tuoi Agent personalizzati: non dare per scontato che il comportamento di Fable 5 sia del tutto compatibile.

I thinking block non sono riutilizzabili liberamente tra modelli

I modelli precedenti non possono leggere i thinking block di Fable 5.1. Quando cambi modello, lascia che l'SDK gestisca questi blocchi secondo le regole ufficiali, invece di passarli così come sono a un altro modello.

Modificare la cronologia precedente può causare errore 400

Per i nuovi account API creati dopo il 31 agosto 2026, i thinking block sono validi solo nel prefisso di conversazione originale in cui sono stati generati. Riprodurre i thinking block dopo aver modificato system, tools o messaggi precedenti può restituire un errore 400. Anthropic consiglia di mantenere una cronologia append-only; quando serve comprimere, sostituisci l'intera cronologia vecchia con un nuovo riassunto, senza modificare i turni precedenti conservando al contempo i thinking block originali. La procedura dettagliata è descritta nella guida ai prompt e alla migrazione di Fable 5.1.

Quando scegliere Fable 5.1

Adatto per:

  • Compiti lunghi su più repository, servizi o applicazioni;
  • Agent che devono girare per ore e recuperare autonomamente dagli errori;
  • Ricerca scientifica, analisi di dati complessi e deliverable professionali in più fasi;
  • Problemi di sistema difficili da riprodurre, ottimizzazione delle prestazioni e indagine sulle cause profonde;
  • Carichi di lavoro API che richiedono un ampio riuso di contesti lunghi, con una percentuale elevata di letture dalla cache.

Non adatto per:

  • Chat semplici, testi brevi o piccole modifiche a un singolo file;
  • Interazioni in tempo reale molto sensibili alla latenza del primo token;
  • Task ad alto output con budget fisso ma senza riuso della cache;
  • Scenari che non accettano la conservazione predefinita di 30 giorni dei dati di monitoraggio della sicurezza e non soddisfano le condizioni di eccezione aziendale;
  • Flussi di lavoro che richiedono che nessuna richiesta di cybersicurezza o scienze della vita attivi un downgrade.

Come seguire a distanza i task lunghi

Il valore di Fable 5.1 emerge soprattutto nei compiti che durano ore o addirittura giorni, ma questo non significa che bisogna restare sempre davanti alla macchina di sviluppo. Dopo aver verificato che Fable 5.1 sia disponibile in Claude Code 2.1.250+ sulla macchina locale, puoi usare PandaNpc Agent per vedere da browser, desktop o telefono le sessioni di Claude Code sulla stessa macchina di sviluppo, gestire le interazioni e continuare a dare istruzioni.

Qui cambia solo il punto di accesso al controllo: codice, strumenti e build restano in esecuzione sulla tua macchina di sviluppo. Puoi leggere prima la guida all'accesso remoto di Claude Code e il tutorial per collegare Claude Code dal telefono, e solo dopo aver verificato il collegamento remoto affidare i task lunghi a Fable 5.1.

FAQ

Quanto è più forte Fable 5.1 di Fable 5?

Le differenze variano molto da un compito all'altro. Su Terminal-Bench-Science il miglioramento è di 27,9 punti percentuali, su AutomationBench di 14,3 punti percentuali; su HLE con strumenti è solo di 1,2 punti percentuali. Non si può usare il singolo aumento più grande per rappresentare tutti i task.

Fable 5.1 è più veloce di Opus 5?

Nella tabella ufficiale delle latenze relative, Fable 5.1 è "più lenta" e Opus 5 è "media". Alcuni partner hanno osservato Fable 5.1 più veloce su compiti completi, perché usa meno token e richiede meno rilavorazioni. Le due conclusioni non misurano la stessa cosa.

Fable 5.1 è più adatto di GPT-5.6 Sol alla programmazione?

Nella tabella di rilascio di Anthropic, Fable 5.1 ottiene punteggi più alti su Terminal-Bench-Science, Terminal-Bench, AutomationBench e CursorBench; ma modelli diversi usano harness Agent, effort, strumenti e prezzi diversi, quindi non si può affermare che Fable vinca su tutti i repository reali. Puoi consultare il tutorial di configurazione per il contesto da 1M di GPT-5.6 Sol e poi fare test A/B con i tuoi task rappresentativi.

Perché Fable 5.1 passa improvvisamente a Opus?

Alcune richieste di cybersicurezza e scienze della vita vengono instradate a Opus dai safeguards. Il cambio di modello non è necessariamente un malfunzionamento; Anthropic dichiara che queste richieste instradate non vengono fatturate alle tariffe Fable.

Fable 5.1 ha una filigrana?

Sì, ha un meccanismo statistico di content provenance, ma non aggiunge etichette visibili sulla superficie del testo. Non è la stessa cosa di una filigrana visibile nell'angolo di un'immagine.

I progressi più evidenti di Claude Fable 5.1 si concentrano su ricerca scientifica, attività su terminale e flussi di lavoro aziendali su più applicazioni: riesce meglio a eseguire in modo continuativo, a recuperare dagli errori e a verificare i risultati, e grazie alla lettura della cache più economica riduce i costi dei task lunghi. Ma resta un modello costoso, con latenza al singolo turno piuttosto lenta, e introduce cambi di compatibilità legati a thinking block, chiamate forzate agli strumenti e modifica della cronologia.

La domanda giusta per sceglierlo non è "è il primo nei benchmark?", ma: il tuo compito è abbastanza lungo e complesso, e il costo di errori e rilavorazioni è abbastanza alto da giustificare Fable 5.1? Se la risposta è no, di solito è più opportuno partire da Opus 5 o Sonnet 5.