Testa a testa
Claude Sonnet 5 vs Claude Fable 5: quale modello IA vince nel 2026?
Claude Sonnet 5 ($15/1M out ($10 intro until 2026-08-31)) e Claude Fable 5 ($50/1M out) sono tra i modelli IA più usati del 2026. Su 7 voti della community, Claude Fable 5 è in testa con il 63% di approvazione.
Verdetto rapido
Su Ragionamento, scegli Claude Fable 5: l'arena lo valuta 5/5 contro 4.5/5 per Claude Sonnet 5. Sul budget vince Claude Sonnet 5: parte da $15/1M out ($10 intro until 2026-08-31) contro $50/1M out per Claude Fable 5.
Confronto riga per riga
Punti di forza e debolezze
Claude Sonnet 5
- Grandi progressi agentici rispetto a Sonnet 4.6: Terminal-Bench 2.1 80.4% contro 67.0%, OSWorld-Verified 81.2% contro 78.5%, SWE-bench Pro 63.2% contro 58.1%
- Eguaglia Opus 4.8 sul lavoro di conoscenza (GDPval-AA v2: 1,618 contro 1,615) e quasi lo pareggia su Humanity's Last Exam con tool (57.4% contro 57.9%) al 60% del prezzo di Opus 4.8 (40% durante la finestra di lancio)
- Finestra di contesto da 1M di tokens e 128K di output max; prezzo di lancio di $2/$10 per 1M di tokens fino al 31 ago 2026
- Comportamento da agente auto-verificante e tenace: le recensioni sul campo notano che testa il proprio codice e itera sui problemi difficili fino a risolverli, a differenza di Sonnet 4.6
- Primo Sonnet con livello di effort xhigh e visione ad alta risoluzione (immagini a 2576px); adaptive thinking attivo di default
- Precisione superiore nella code review rispetto a Sonnet 4.6 (38-40% contro 29%), con meno falsi positivi
- Il nuovo tokenizer gonfia il conteggio dei tokens di circa il 30% a parità di testo (1.0-1.35x secondo Anthropic; ~1.4x in inglese, ~1.28x in Python misurati da Simon Willison), alzando il costo effettivo nonostante il prezzo di listino invariato
- Prolisso e vorace di tokens: ~$2.29 per task contro ~$1.20 di Sonnet 4.6 nei test indipendenti (101° su 161 per efficienza di costo); a effort alto il costo per task può superare Opus 4.8
- Misurabilmente più lento di Sonnet 4.6 sulle piccole modifiche di routine e incline all'over-engineering sui task semplici (recensione hands-on di CodeRabbit)
- Parametri di sampling (temperature, top_p, top_k) rimossi; i valori non di default restituiscono un errore 400, rompendo le pipeline esistenti
- Sentiment al lancio misto su HN/Reddit: l'etichetta '5' è stata vista come una promessa eccessiva, e le protezioni cybersecurity più severe possono rifiutare lavoro benigno vicino alla sicurezza
Claude Fable 5
- 80.3% su SWE-bench Pro contro 69.2% di Opus 4.8, 58.6% di GPT-5.5 e 54.2% di Gemini 3.1 Pro, circa 11 punti davanti al modello di frontiera successivo
- 95.0% su SWE-bench Verified (Opus 4.8: 88.6%, GPT-5.5: 82.6%) e 29.3% sullo split FrontierCode Diamond di Cognition, più del doppio del 13.4% di Opus 4.8
- L'autonomia a lungo orizzonte è la vera notizia: Stripe ha riportato la migrazione di una codebase Ruby da 50 milioni di righe fatta in un giorno invece di 2+ mesi, e il CEO di Cursor lo definisce stato dell'arte su CursorBench
- I riscontri sul campo confermano i benchmark: gli ingegneri su HN lo descrivono al lavoro 'come un vero ingegnere' (CRDT con supervisione minima, fuzzer scritti da solo, una riduzione delle allocazioni di 46x), Simon Willison ha misurato 'diversi giorni di lavoro' in una singola sessione
- Finestra di contesto da 1M di tokens di default più 128K di output, e visione allo stato dell'arte sui documenti densi (29.8% su GDP.pdf contro 24.9% di GPT-5.5 e 22.5% di Opus 4.8)
- Le richieste rifiutate prima dell'output non vengono fatturate, e il fallback lato server verso Opus 4.8 con credito di fallback è integrato nell'API
- Il doppio del prezzo di Opus 4.8 ($10/$50 contro $5/$25) e lento: le singole richieste sui task difficili durano regolarmente parecchi minuti, Simon Willison lo definisce senza giri di parole 'slow, expensive'
- I classificatori di sicurezza dual-use sbagliano sul lavoro legittimo: un fisico medico ha riportato problemi di fluidodinamica e codice di segmentazione MRI rifiutati come rischi di biosicurezza, con richieste reindirizzate in silenzio verso Opus 4.8 (il thread virale su HN si intitolava 'If Claude Fable stops helping you, you'll never know'; Anthropic parla di meno del 5% delle sessioni)
- Lancio travagliato: i controlli USA sulle esportazioni hanno costretto Anthropic a sospendere l'accesso in tutto il mondo dal 12 al 30 giugno 2026, tre giorni dopo la release, con ripristino completo solo il 1° luglio
- Richiede 30 giorni di conservazione dei dati e non è disponibile in zero data retention, un blocco totale per le organizzazioni a compliance rigida; inoltre niente modalità senza thinking, la chain of thought grezza non viene mai restituita, il prefill dell'assistente restituisce un 400
- Non è universalmente allo stato dell'arte: GPT-5.5 guida ancora ARC-AGI-2 (85.0% contro 77.1%), e Andon Labs ha rilevato che Mythos 5 senza blocchi rendeva meno sia di Opus 4.7 che di GPT-5.5 su Vending-Bench, con un ragionamento che ottimizzava per la rilevabilità invece che per il danno reale
Emetti il tuo verdetto
Una raccomandazione per strumento per gladiatore. Plasma il punteggio della folla che tutti vedono.
Il verdetto dell'arena su Claude Sonnet 5
Scegli Sonnet 5 se usi agenti di coding, da terminale o computer-use e vuoi qualità vicina a Opus 4.8 a prezzi da Sonnet, soprattutto durante la finestra di lancio a $2/$10; è un upgrade netto rispetto a Sonnet 4.6 a effort basso e medio. Metti in conto il nuovo tokenizer e la sua prolissità: i costi reali per task superano di parecchio Sonnet 4.6, e ai livelli di effort più alti Opus 4.8 può essere l'affare migliore per task risolto. Evitalo per le piccole modifiche sensibili alla latenza o per le pipeline che dipendono da temperature e top_p, che ora vanno in errore. Sonnet 4.6 resta la scelta pragmatica per i carichi ad alto volume di micro-diff.
Il verdetto dell'arena su Claude Fable 5
Prendi Claude Fable 5 se il tuo carico è davvero a lungo orizzonte: sessioni agentiche notturne, migrazioni monstre, task dove una singola sessione di più ore sostituisce giorni di lavoro supervisionato. Lì, il premio 2x rispetto a Opus 4.8 si ripaga da solo in compressione dei task, e i benchmark (80.3% su SWE-bench Pro, 11 punti sopra il resto del campo) sono confermati da deployment reali presso Stripe e Cursor. Per il coding interattivo e il lavoro quotidiano, resta su Opus 4.8: 88.6% su SWE-bench Verified a metà prezzo, niente falsi positivi dei classificatori, turni più rapidi. I team attenti ai costi ottengono un coding quasi da Opus con Sonnet 5 a $3/$15 (prezzo lancio $2/$10 fino ad agosto 2026). Evita Fable 5 del tutto se la tua organizzazione richiede zero data retention o se lavori anche solo vicino a biologia, imaging medico o strumenti di sicurezza, dove i classificatori dual-use producono ancora falsi positivi e sostituiscono in silenzio Opus 4.8 a metà sessione.
Cosa dice la folla
Su Claude Sonnet 5
“Cheap per token, pricey per task. Independent tests had it near $2.29 a task vs $1.20 on 4.6, and at high effort it can out-cost Opus 4.8. It will not stop talking.”
“Terminal-Bench going 67 to 80 over Sonnet 4.6 matches what I see. My CI-fix agent went from constant babysitting to mostly hands-off overnight.”
“Matches Opus 4.8 on knowledge work at 60% of the price, and the intro $2/$10 window makes it silly value. My research agent runs on Sonnet 5 now, zero regrets.”
Su Claude Fable 5
“I do medical imaging research and the bio classifier keeps flagging my MRI segmentation prompts, then it silently falls back to Opus 4.8 mid-session. At $50 per million output tokens I expect to at least know which model actually answered me.”
“Yes it's 2x the price of Opus and yes the turns are slow. But one overnight Fable run replaced what used to be a week of supervising shorter runs. On a per-task basis it's actually the cheapest model we use.”
“The 1M context is real, not marketing. I fed it our entire service mesh config plus six months of incident postmortems and it traced a flaky timeout to a retry policy nobody remembered writing. Opus 4.8 never connected those dots.”
“Gave it a monorepo migration that Opus 4.8 kept stalling on. It ran for about 40 minutes, came back with the whole thing done plus a test harness it wrote for itself. Felt like reviewing a senior engineer's PR, not babysitting a chatbot.”
Continua a confrontare
Domande frequenti
Claude Sonnet 5 è meglio di Claude Fable 5?
La folla oggi sta con Claude Fable 5: il 63% lo consiglia, contro il 57% per Claude Sonnet 5 (7 voti). Su Ragionamento, Claude Fable 5 ottiene il voto più alto (5/5 contro 4.5/5). La scelta giusta dipende dal tuo caso d'uso. Il confronto riga per riga di questa pagina analizza prezzi, specifiche chiave e voti dell'arena.
Quale costa meno, Claude Sonnet 5 o Claude Fable 5?
Claude Sonnet 5 costa meno: parte da $15/1M out ($10 intro until 2026-08-31), mentre Claude Fable 5 parte da $50/1M out.
Quanto costano Claude Sonnet 5 e Claude Fable 5 per 1M di token?
Claude Sonnet 5: $3/1M in ($2 intro until 2026-08-31) per 1M di token in input, $15/1M out ($10 intro until 2026-08-31) per 1M di token in output. Claude Fable 5: $10/1M in per 1M di token in input, $50/1M out per 1M di token in output.