Claude Fable 5.1: analisi completa di benchmark, miglioramenti, prezzi e velocità
I risultati completi di Claude Fable 5.1 su 7 categorie di benchmark principali, confronto punto per punto con Fable 5, Opus 5 e GPT-5.6 Sol, e spiegazione dei cambiamenti della versione 5.1 riguardanti attività a lungo termine, chiamate agli strumenti, costi di cache, velocità, limiti dei piani e migrazione.

Claude Fable 5.1 è stato rilasciato ufficialmente il 1° settembre 2026. Partiamo dalle conclusioni: non è un normale aggiornamento del modello pensato per il Q&A generico, ma un modello di punta ad alto costo progettato per programmazione di lunga durata, ricerca complessa, chiamate a strumenti su più applicazioni e Agent non supervisionati. Nei 7 benchmark principali pubblicati da Anthropic, Fable 5.1 supera Fable 5 in tutti; ma il suo prezzo unitario API è ancora il doppio di Opus 5 e la latenza relativa è ufficialmente indicata come "più lenta".
Se il tuo compito è soltanto modificare un file, scrivere un breve testo o rispondere a domande comuni, Anthropic consiglia comunque di partire da Opus 5. Fable 5.1 è più indicato per i compiti a catena lunga che i modelli normali non riescono a completare in modo stabile nemmeno con un effort elevato. Questo articolo riunisce i dati ufficiali di rilascio, il significato dei vari benchmark, i miglioramenti specifici della 5.1, i prezzi, la velocità e i vincoli di migrazione, per evitare di guardare soltanto a un grafico di punteggi del tipo "chi vince".
Le specifiche di Fable 5.1 in una tabella
| Elemento | Claude Fable 5.1 | Claude Opus 5 | Claude Sonnet 5 |
|---|---|---|---|
| Finestra di contesto | 1M token | 1M token | 1M token |
| Output massimo | 128K token | 128K token | 128K token |
| Prezzo di input | $10 / MTok | $5 / MTok | $2 / MTok |
| Prezzo di output | $50 / MTok | $25 / MTok | $10 / MTok |
| Latenza relativa | Più lenta | Media | Veloce |
| Thinking | Adaptive, sempre attivo | Adaptive | Adaptive |
| Effort predefinito | High | High | High |
| Knowledge cutoff affidabile | Giugno 2026 | Maggio 2026 | Gennaio 2026 |
Il "più lenta" qui proviene dal catalogo dei modelli Anthropic e indica un livello di latenza relativa, non un numero fisso di token al secondo. Quanto tempo serve davvero per completare un'attività dipende anche da effort, dal numero di cicli di chiamate agli strumenti, dal tasso di hit nella cache, dalla lunghezza del contesto e dai nuovi tentativi dopo errori.
Tabella completa dei benchmark principali di Fable 5.1
La tabella seguente riprende direttamente la tabella principale della pagina di rilascio di Anthropic del 1° settembre 2026. Per evitare letture errate, percentuali, punteggi grezzi di GDPval-AA, risultati partial/strict di OSWorld e risultati HLE con/senza strumenti sono elencati separatamente. Ogni benchmark mantiene il nome ufficiale in inglese, con il nome italiano nella riga successiva.
| Capacità | Benchmark | Fable 5.1 | Fable 5 | Opus 5 | GPT-5.6 Sol | 5.1 vs Fable 5 |
|---|---|---|---|---|---|---|
| Ricerca scientifica con agenti | Terminal-Bench-Science 0.1 Benchmark terminale per la ricerca scientifica con agenti |
52,6% | 24,7% | 29,0% | 22,4% | +27,9 punti percentuali |
| Programmazione terminale con agenti | Terminal-Bench 4.0 Benchmark di programmazione terminale per agenti |
55,8% | 42,0% | 52,3% | 37,3% | +13,8 punti percentuali |
| Lavoro professionale basato su conoscenza | GDPval-AA v2 Benchmark di compiti professionali a valore economico reale |
1853 | 1723 | 1824 | 1711 | +130 punti |
| Operazioni al computer | OSWorld 2.0 — Partial Benchmark di operazioni reali al computer: punteggio di completamento parziale |
77,9% | 72,9% | 75,4% | — | +5,0 punti percentuali |
| Operazioni al computer | OSWorld 2.0 — Strict Benchmark di operazioni reali al computer: tasso di completamento rigoroso |
41,7% | 36,1% | 39,6% | — | +5,6 punti percentuali |
| Ragionamento multidisciplinare | Humanity's Last Exam — No tools L'ultimo esame dell'umanità: senza strumenti |
60,9% | 57,8% | 56,6% | — | +3,1 punti percentuali |
| Ragionamento multidisciplinare | Humanity's Last Exam — With tools L'ultimo esame dell'umanità: con strumenti |
65,0% | 63,8% | 63,6% | — | +1,2 punti percentuali |
| Flussi di lavoro aziendali | AutomationBench Benchmark di flussi di lavoro aziendali automatizzati su più applicazioni |
31,4% | 17,1% | 26,9% | 19,6% | +14,3 punti percentuali |
| Programmazione con agenti | CursorBench 3.2.0 Benchmark di attività di programmazione reali multi-file |
73,4% | 70,5% | 70,0% | 67,2% | +2,9 punti percentuali |
— indica che la tabella principale di Anthropic non fornisce un punteggio corrispondente, non che il modello non sia in grado di svolgere il compito. In Terminal-Bench 4.0, Mythos 5.1 — che ha meno restrizioni ed è aperto solo a programmi fidati — ha ottenuto il 60,9%; questo articolo si concentra su Fable 5.1, disponibile per gli utenti normali, e non mescola i risultati di Mythos nella colonna di Fable.
Cosa misura Terminal-Bench-Science 0.1
Terminal-Bench-Science 0.1 contiene 70 flussi di lavoro di ricerca reali in cinque ambiti: scienze della vita, scienze fisiche, scienze della Terra, matematica e ingegneria. I compiti non sono domande a scelta multipla: richiedono che l'Agent completi analisi dei dati, inferenza statistica, simulazioni, ottimizzazione, dimostrazioni di teoremi, ricostruzione di immagini o machine learning scientifico nel terminale, e verifichi i risultati con test riproducibili.
Il 52,6% di Fable 5.1, contro il 24,7% di Fable 5 negli esperimenti ufficiali di riproduzione, rappresenta un miglioramento di 27,9 punti percentuali: è il balzo più evidente dell'intera tabella. Ma Anthropic segnala anche un errore standard di circa ±3,5–4,5 punti percentuali per ogni modello: non si può trattare la cifra decimale come una classifica assolutamente precisa.
Cosa misurano Terminal-Bench 4.0 e CursorBench 3.2.0
Terminal-Bench fa sì che l'Agent gestisca attività complesse in un vero ambiente terminale, verificando soprattutto se è in grado di comprendere l'ambiente, chiamare strumenti, modificare file e superare infine la validazione. Fable 5.1 raggiunge il 55,8%, 13,8 punti percentuali in più di Fable 5, superando anche il 52,3% di Opus 5.
CursorBench 3.2 deriva da attività ambigue e multi-file tratte da sessioni Cursor reali; la versione 3.2 aggiunge problemi di aderenza alle istruzioni e di uso avanzato degli strumenti. Fable 5.1 Max ottiene il 73,4%: il vantaggio non è vistoso come in Terminal-Bench-Science, ma in media usa 72.060 token e costa $9,64 per attività; Fable 5 Max ne usa 103.525 e costa $17,32. Qui l'aspetto più interessante è la riduzione di token e costi a parità di attività, non i 2,9 punti percentuali in sé.
Cosa misura GDPval-AA v2
GDPval-AA v2 usa 220 attività progettate da professionisti del settore, che coprono 44 professioni e 9 settori, per valutare la capacità del modello di gestire lavoro intellettuale reale con valore economico. Il suo 1853 è un punteggio composito, non 1853%. Questo risultato indica che Fable 5.1 supera Fable 5 in documenti professionali, analisi e deliverable, superando di poco anche Opus 5.
Perché OSWorld 2.0 ha due punteggi
OSWorld 2.0 contiene 108 flussi di lavoro di lunga durata per operazioni al computer; il tempo umano mediano di completamento per ogni attività è di circa 1,6 ore. Partial assegna un punteggio di completamento parziale basato su più checkpoint; Strict considera riuscita solo la piena realizzazione dell'obiettivo.
Quindi il 77,9% partial e il 41,7% strict di Fable 5.1 non sono contraddittori: spesso riesce a completare la maggior parte dei passaggi, ma una parte dei compiti non arriva alla chiusura end-to-end. Questo ci ricorda anche che un Agent per computer che "sembra sempre al lavoro" non equivale a un'attività riuscita.
Cosa misura Humanity's Last Exam
Humanity's Last Exam è stato creato da Center for AI Safety e Scale AI e contiene 2.500 domande trasversali, di livello esperto, difficili da risolvere con una semplice ricerca. Fable 5.1 supera Fable 5 di 3,1 punti percentuali senza strumenti e solo di 1,2 punti percentuali quando gli strumenti sono consentiti. È sicuramente più forte, ma non su tutti i benchmark i miglioramenti raddoppiano.
Cosa misura AutomationBench
AutomationBench verifica se l'Agent riesce a completare flussi di vendita, marketing, operations, assistenza clienti, finanza e risorse umane attraverso strumenti SaaS simulati come CRM, posta elettronica, calendario, messaggistica e project management. Fable 5.1 passa dal 17,1% al 31,4%, con un miglioramento relativo di circa l'84%: ciò indica che la 5.1 ha fatto progressi sostanziali nella gestione dello stato tra più applicazioni e nell'esecuzione di passaggi lunghi; ma il 31,4% mostra anche che questo tipo di automazione aziendale non supervisionata è ancora lontano dall'essere risolto.
Miglioramenti di Fable 5.1 rispetto a Fable 5
1. Nei compiti lunghi, meno scorciatoie
Anthropic posiziona Fable 5.1 come un modello Agent di lunga durata: prima pianifica, poi usa gli strumenti, si riprende dagli errori, verifica i risultati e riferisce attivamente lo stato di avanzamento. Dà più importanza alla correzione delle cause profonde, invece degli aggiramenti locali per far diventare verde un singolo test il prima possibile. Gli scenari target elencati ufficialmente includono funzionalità su più codebase, code review, ottimizzazione delle prestazioni, sessioni autonome di più giorni, ricerca, documenti, fogli di calcolo e presentazioni.
2. A effort basso, risultati paragonabili a quelli costosi della generazione precedente
Fable 5.1 aggiunge la possibilità di regolare l'effort per messaggio. Le curve di costo ufficiali mostrano che con effort Low o Medium, su alcune attività può eguagliare o superare Fable 5, riducendo al contempo token e costi. Claude Code usa High effort come default; Claude.ai e Cowork usano Medium come default: quando si confrontano i modelli bisogna prima verificare l'effort, senza mettere direttamente a confronto risultati ottenuti con livelli diversi.
3. Progressi leggibili tra le chiamate agli strumenti
L'API aggiunge la capacità in test display: "updates", che consente al modello di fornire aggiornamenti di avanzamento rivolti all'utente tra una chiamata e l'altra agli strumenti. Per le attività che durano ore, questo rende più facile capire cosa sta facendo e se si sta discostando dall'obiettivo, rispetto a vedere soltanto comparire in continuazione schede di strumenti.
4. Scrittura, verifica visiva e auto-test più completi
Secondo la comunicazione ufficiale, la 5.1 scrive attivamente test per verificare le proprie modifiche e usa le capacità visive per controllare l'output rispetto agli obiettivi di progettazione. Le valutazioni dei partner si concentrano inoltre su avanzamenti più concisi, risposte più complete alle domande in più parti, tracciamento delle catene di chiamate su più servizi e leggibilità mantenuta anche dopo lunghe esecuzioni. Sono feedback qualitativi e non devono spacciarsi per conclusioni uniformi di benchmark.
5. Blocchi di sicurezza più precisi, ma non scomparsi
Rispetto al lancio di Fable 5, i falsi positivi delle protezioni di cybersicurezza di Fable 5.1 si riducono di circa il 60%, e le domande di base di biologia e medicina attivano un downgrade con una frequenza inferiore di circa l'85%. Ora può essere usato per individuare vulnerabilità software, ma i compiti a duplice uso come i test di penetrazione, la generazione di codice di exploit e la scansione di vulnerabilità binarie possono ancora essere instradati a Opus. Una volta instradati, la fatturazione non avviene secondo le tariffe Fable.
6. Nuova marcatura della provenienza dei contenuti
Fable 5.1 introduce la content provenance. Il testo generato può contenere una filigrana statistica, verificabile con lo strumento di controllo dei contenuti di Anthropic. Non aggiunge marcatori visibili nel corpo del testo, ma per piattaforme di contenuti, istruzione e audit aziendali è un nuovo comportamento da conoscere in anticipo.
Come si calcola il costo di Fable 5.1
| Voce di fatturazione | Prezzo di Fable 5.1 | Confronto con Fable 5 |
|---|---|---|
| Input | $10 / 1 milione di token | Invariato |
| Output | $50 / 1 milione di token | Invariato |
| Scrittura in cache di 5 minuti | $12,50 / 1 milione di token | Stessa fascia |
| Scrittura in cache di 1 ora | $20 / 1 milione di token | Stessa fascia |
| Lettura dalla cache | $0,25 / 1 milione di token | Ridotta del 75% |
| Batch API | 50% dei prezzi di input e output | Secondo le regole Batch |
Supponiamo che una lunga attività legga in totale 10 milioni di token dalla cache, produca 200.000 nuovi token di input e 50.000 token di output, senza considerare le scritture in cache:
缓存读取:10 × $0.25 = $2.50
新输入:0.2 × $10 = $2.00
输出:0.05 × $50 = $2.50
合计:$7.00Gli stessi 10 milioni di letture dalla cache su Fable 5 costano circa $10, quindi solo questa voce fa risparmiare $7,50. Su questa base Anthropic stima che il costo reale dei tipici task fatturati a token possa ridursi di circa il 25%, e fino a circa il 45% per i task fortemente basati su Agent che riutilizzano spesso contesti lunghi. Non è un taglio generalizzato dei prezzi dell'API, ma più hit nella cache ci sono, più il risparmio è evidente.
Gli abbonati non godono necessariamente dello sconto sulla cache API
I seat premium di Max e Team/Enterprise possono destinare ai modelli Fable fino al 50% della quota settimanale; Pro e i seat standard consumano invece usage credits fin dall'inizio. Per il consumo effettivo fai riferimento alla pagina Usage dell'account. Lo sconto sulla lettura della cache riguarda soprattutto gli scenari fatturati a token: non si può convertire lo sconto del 75% sulla cache API in "quattro volte di più con il piano Max".
Fable 5.1 è veloce o no?
La risposta è: la risposta al singolo turno è piuttosto lenta, ma il tempo totale di completamento dei task complessi può essere più breve.
- Il catalogo modelli di Anthropic classifica Fable 5.1 come
Slower, Opus 5 comeModeratee Sonnet 5 comeFast. - Claude Code usa High effort come default e quindi impiega naturalmente più tempo di ragionamento rispetto a Low o Medium.
- Every, sui propri carichi di lavoro, sostiene che Fable 5.1 sia circa due volte più veloce di Opus 5 con la metà dei token; è un test specifico di un partner, non una garanzia di velocità generale.
- In CursorBench, Fable 5.1 Max fa in media 70 passaggi con 72.060 token; Fable 5 Max fa gli stessi 72 passaggi ma usa 103.525 token. Il vantaggio della 5.1 sta più nel "fare meno deviazioni e consumare meno token", non necessariamente nell'essere più veloce sul primo token.
Perciò per chat, codice breve e interazioni frequenti conviene scegliere Sonnet 5 o Opus 5; per debug su più codebase, ricerche lunghe e task non supervisionati che richiedono auto-verifica, valuta allora Fable 5.1.
Modifiche di compatibilità da gestire prima di passare a Fable 5.1
Aggiorna Claude Code almeno alla 2.1.250
Le note su piani e disponibilità di Anthropic richiedono Claude Code 2.1.250 o versioni successive. Se Fable 5.1 non compare, controlla prima:
claude --versionPoi aggiorna seguendo la procedura ufficiale di Claude Code e riavvia la sessione. L'ID del modello API di Fable 5.1 è:
claude-fable-5-1Il forced tool use può restituire errori
Se la richiesta obbliga il modello a chiamare un determinato strumento, Fable 5.1 può restituire un errore. Prima di migrare, controlla tool_choice e i flussi di strumenti forzati dei tuoi Agent personalizzati: non dare per scontato che il comportamento di Fable 5 sia del tutto compatibile.
I thinking block non sono riutilizzabili liberamente tra modelli
I modelli precedenti non possono leggere i thinking block di Fable 5.1. Quando cambi modello, lascia che l'SDK gestisca questi blocchi secondo le regole ufficiali, invece di passarli così come sono a un altro modello.
Modificare la cronologia precedente può causare errore 400
Per i nuovi account API creati dopo il 31 agosto 2026, i thinking block sono validi solo nel prefisso di conversazione originale in cui sono stati generati. Riprodurre i thinking block dopo aver modificato system, tools o messaggi precedenti può restituire un errore 400. Anthropic consiglia di mantenere una cronologia append-only; quando serve comprimere, sostituisci l'intera cronologia vecchia con un nuovo riassunto, senza modificare i turni precedenti conservando al contempo i thinking block originali. La procedura dettagliata è descritta nella guida ai prompt e alla migrazione di Fable 5.1.
Quando scegliere Fable 5.1
Adatto per:
- Compiti lunghi su più repository, servizi o applicazioni;
- Agent che devono girare per ore e recuperare autonomamente dagli errori;
- Ricerca scientifica, analisi di dati complessi e deliverable professionali in più fasi;
- Problemi di sistema difficili da riprodurre, ottimizzazione delle prestazioni e indagine sulle cause profonde;
- Carichi di lavoro API che richiedono un ampio riuso di contesti lunghi, con una percentuale elevata di letture dalla cache.
Non adatto per:
- Chat semplici, testi brevi o piccole modifiche a un singolo file;
- Interazioni in tempo reale molto sensibili alla latenza del primo token;
- Task ad alto output con budget fisso ma senza riuso della cache;
- Scenari che non accettano la conservazione predefinita di 30 giorni dei dati di monitoraggio della sicurezza e non soddisfano le condizioni di eccezione aziendale;
- Flussi di lavoro che richiedono che nessuna richiesta di cybersicurezza o scienze della vita attivi un downgrade.
Come seguire a distanza i task lunghi
Il valore di Fable 5.1 emerge soprattutto nei compiti che durano ore o addirittura giorni, ma questo non significa che bisogna restare sempre davanti alla macchina di sviluppo. Dopo aver verificato che Fable 5.1 sia disponibile in Claude Code 2.1.250+ sulla macchina locale, puoi usare PandaNpc Agent per vedere da browser, desktop o telefono le sessioni di Claude Code sulla stessa macchina di sviluppo, gestire le interazioni e continuare a dare istruzioni.
Qui cambia solo il punto di accesso al controllo: codice, strumenti e build restano in esecuzione sulla tua macchina di sviluppo. Puoi leggere prima la guida all'accesso remoto di Claude Code e il tutorial per collegare Claude Code dal telefono, e solo dopo aver verificato il collegamento remoto affidare i task lunghi a Fable 5.1.
FAQ
Quanto è più forte Fable 5.1 di Fable 5?
Le differenze variano molto da un compito all'altro. Su Terminal-Bench-Science il miglioramento è di 27,9 punti percentuali, su AutomationBench di 14,3 punti percentuali; su HLE con strumenti è solo di 1,2 punti percentuali. Non si può usare il singolo aumento più grande per rappresentare tutti i task.
Fable 5.1 è più veloce di Opus 5?
Nella tabella ufficiale delle latenze relative, Fable 5.1 è "più lenta" e Opus 5 è "media". Alcuni partner hanno osservato Fable 5.1 più veloce su compiti completi, perché usa meno token e richiede meno rilavorazioni. Le due conclusioni non misurano la stessa cosa.
Fable 5.1 è più adatto di GPT-5.6 Sol alla programmazione?
Nella tabella di rilascio di Anthropic, Fable 5.1 ottiene punteggi più alti su Terminal-Bench-Science, Terminal-Bench, AutomationBench e CursorBench; ma modelli diversi usano harness Agent, effort, strumenti e prezzi diversi, quindi non si può affermare che Fable vinca su tutti i repository reali. Puoi consultare il tutorial di configurazione per il contesto da 1M di GPT-5.6 Sol e poi fare test A/B con i tuoi task rappresentativi.
Perché Fable 5.1 passa improvvisamente a Opus?
Alcune richieste di cybersicurezza e scienze della vita vengono instradate a Opus dai safeguards. Il cambio di modello non è necessariamente un malfunzionamento; Anthropic dichiara che queste richieste instradate non vengono fatturate alle tariffe Fable.
Fable 5.1 ha una filigrana?
Sì, ha un meccanismo statistico di content provenance, ma non aggiunge etichette visibili sulla superficie del testo. Non è la stessa cosa di una filigrana visibile nell'angolo di un'immagine.
Riepilogo
I progressi più evidenti di Claude Fable 5.1 si concentrano su ricerca scientifica, attività su terminale e flussi di lavoro aziendali su più applicazioni: riesce meglio a eseguire in modo continuativo, a recuperare dagli errori e a verificare i risultati, e grazie alla lettura della cache più economica riduce i costi dei task lunghi. Ma resta un modello costoso, con latenza al singolo turno piuttosto lenta, e introduce cambi di compatibilità legati a thinking block, chiamate forzate agli strumenti e modifica della cronologia.
La domanda giusta per sceglierlo non è "è il primo nei benchmark?", ma: il tuo compito è abbastanza lungo e complesso, e il costo di errori e rilavorazioni è abbastanza alto da giustificare Fable 5.1? Se la risposta è no, di solito è più opportuno partire da Opus 5 o Sonnet 5.
Guide correlate

Codex: attivare il contesto GPT-5.6 Sol 1M — tutorial di configurazione con 3 righe in `config.toml`
GPT-5.6 Sol supporta ufficialmente un contesto di 1,05 milioni di token. Basta aggiungere 3 righe di configurazione all'inizio di config.toml di Codex per eseguirlo con una finestra di 1 milione e comprimere automaticamente la cronologia a circa 900.000 token. Include configurazione permanente, comando singolo, verifica e promemoria sui costi.
Leggi l'articolo →
Come usare Claude Code Remote Control? Controllo remoto da telefono, limiti ufficiali e alternative (2026)
Come si attiva Claude Code Remote Control? Questo articolo presenta tre usi ufficiali: claude remote-control, claude --remote-control e /remote-control, spiega la connessione tra telefono e browser, i requisiti dell'account, i metodi di verifica e gli errori comuni, e confronta le soluzioni PandaNpc in scenari di modelli personalizzati, Codex e multi-macchina.
Leggi l'articolo →
Claude Code sul telefono: visualizza sessioni e approva strumenti in qualsiasi momento su iOS
Questo articolo è rivolto agli sviluppatori e condivide le migliori pratiche per collegare Claude Code dal telefono. Tramite l'app iOS PandaNpc è possibile visualizzare le sessioni in tempo reale, approvare le chiamate agli strumenti e rispondere alle domande. Grazie a pandapaw e all'iOS Live Activity, si ottiene un controllo remoto efficiente, migliorando la flessibilità di codifica.
Leggi l'articolo →