Testa a testa

Logo di Llama 4 (Scout / Maverick)vsLogo di Claude Fable 5

Llama 4 (Scout / Maverick) vs Claude Fable 5: quale modello IA vince nel 2026?

Llama 4 (Scout / Maverick) ($0.60/1M out (Maverick, hosted)) e Claude Fable 5 ($50/1M out) sono tra i modelli IA più usati del 2026. Su 4 voti della community, Claude Fable 5 è in testa con il 63% di approvazione.

Verdetto rapido

Su Ragionamento, scegli Claude Fable 5: l'arena lo valuta 5/5 contro 2.5/5 per Llama 4 (Scout / Maverick). Sul budget vince Llama 4 (Scout / Maverick): parte da $0.60/1M out (Maverick, hosted) contro $50/1M out per Claude Fable 5.

Confronto riga per riga

A partire da
$0.60/1M out (Maverick, hosted)Nessuna API a pagamento first-party di Meta; sono mostrate le tariffe hosted tipiche di terze parti per Maverick (Scout da ~$0.10/$0.30 per 1M su DeepInfra, $0.11/$0.34 su Groq). Il contesto di Scout in hosting è limitato ben sotto la specifica nominale di 10M (es. ~320K su DeepInfra).
$50/1M outPrezzo di listino ufficiale dell'API Anthropic per claude-fable-5: $10/1M in input, $50/1M in output, tier unico con contesto 1M di default (nessun sovrapprezzo long-context), 128K di output max; le richieste rifiutate prima di qualsiasi output non vengono fatturate. Verificato su platform.claude.com (Introducing Claude Fable 5) 2026-07.
Fornitore
Meta
Anthropic
Finestra di contesto
10M tokens (Scout) / 1M (Maverick)
1M tokens
Prezzo in input
$0.15/1M in (Maverick, hosted)
$10/1M in
Prezzo in output
$0.60/1M out (Maverick, hosted)
$50/1M out
Modalità
text, vision (image input)
text, vision
Open weights
No
Punteggio della folla
50%(0)
63%(4)
Voti dell'arena (1-5)
Ragionamento
2.5
5.0
Coding
2.0
5.0
Scrittura
2.5
4.5
Velocità
4.5
2.0
Rapporto qualità-prezzo
3.5
3.0

Punti di forza e debolezze

Llama 4 (Scout / Maverick)

  • Efficienza MoE: solo 17B di parametri attivi per token (Scout 109B/16 expert, Maverick 400B/128 expert), per una chat quasi da GPT-4o a una frazione del compute
  • Inferenza hosted molto economica: Maverick da circa $0.15/1M in input e $0.60/1M in output; Scout da circa $0.10/$0.30 su DeepInfra o $0.11/$0.34 su Groq
  • Multimodalità nativa early-fusion (testo più immagini, testato fino a 8 immagini) in un modello open weights
  • Il più grande contesto nominale di qualsiasi modello open weights alla release: 10M di tokens su Scout, 1M su Maverick
  • Scout entra su una singola GPU H100 con quantizzazione Int4; pre-addestrato su 200 lingue
  • Throughput elevato: i 17B di parametri attivi superano i 500 tokens/s sui provider veloci (Groq quota Scout a 594 TPS)
  • Fiducia nei benchmark compromessa: Meta ha inviato a LMArena una variante Maverick chat-optimized mai rilasciata (ELO 1417), che gli sviluppatori hanno definito fuorviante visto che i pesi pubblici segnano meno
  • Le promesse sul long-context crollano in pratica: Scout ha segnato ~15.6% a 128K su Fiction.LiveBench contro il 90.6% di Gemini 2.5 Pro, e i provider hosted limitano Scout ben sotto i 10M (es. ~320K su DeepInfra)
  • Coding stroncato su r/LocalLlama e HN, perde contro DeepSeek V3 a parità di prezzo sui task reali di sviluppo
  • Non è open source secondo OSI: la licenza esclude le aziende con sede nell'UE, richiede una licenza speciale oltre i 700M di MAU e impone il branding Llama
  • 109B/400B di parametri totali sono troppi per le GPU consumer, e la linea si è fermata: nessuna variante di ragionamento è uscita e Behemoth non è mai stato rilasciato

Claude Fable 5

  • 80.3% su SWE-bench Pro contro 69.2% di Opus 4.8, 58.6% di GPT-5.5 e 54.2% di Gemini 3.1 Pro, circa 11 punti davanti al modello di frontiera successivo
  • 95.0% su SWE-bench Verified (Opus 4.8: 88.6%, GPT-5.5: 82.6%) e 29.3% sullo split FrontierCode Diamond di Cognition, più del doppio del 13.4% di Opus 4.8
  • L'autonomia a lungo orizzonte è la vera notizia: Stripe ha riportato la migrazione di una codebase Ruby da 50 milioni di righe fatta in un giorno invece di 2+ mesi, e il CEO di Cursor lo definisce stato dell'arte su CursorBench
  • I riscontri sul campo confermano i benchmark: gli ingegneri su HN lo descrivono al lavoro 'come un vero ingegnere' (CRDT con supervisione minima, fuzzer scritti da solo, una riduzione delle allocazioni di 46x), Simon Willison ha misurato 'diversi giorni di lavoro' in una singola sessione
  • Finestra di contesto da 1M di tokens di default più 128K di output, e visione allo stato dell'arte sui documenti densi (29.8% su GDP.pdf contro 24.9% di GPT-5.5 e 22.5% di Opus 4.8)
  • Le richieste rifiutate prima dell'output non vengono fatturate, e il fallback lato server verso Opus 4.8 con credito di fallback è integrato nell'API
  • Il doppio del prezzo di Opus 4.8 ($10/$50 contro $5/$25) e lento: le singole richieste sui task difficili durano regolarmente parecchi minuti, Simon Willison lo definisce senza giri di parole 'slow, expensive'
  • I classificatori di sicurezza dual-use sbagliano sul lavoro legittimo: un fisico medico ha riportato problemi di fluidodinamica e codice di segmentazione MRI rifiutati come rischi di biosicurezza, con richieste reindirizzate in silenzio verso Opus 4.8 (il thread virale su HN si intitolava 'If Claude Fable stops helping you, you'll never know'; Anthropic parla di meno del 5% delle sessioni)
  • Lancio travagliato: i controlli USA sulle esportazioni hanno costretto Anthropic a sospendere l'accesso in tutto il mondo dal 12 al 30 giugno 2026, tre giorni dopo la release, con ripristino completo solo il 1° luglio
  • Richiede 30 giorni di conservazione dei dati e non è disponibile in zero data retention, un blocco totale per le organizzazioni a compliance rigida; inoltre niente modalità senza thinking, la chain of thought grezza non viene mai restituita, il prefill dell'assistente restituisce un 400
  • Non è universalmente allo stato dell'arte: GPT-5.5 guida ancora ARC-AGI-2 (85.0% contro 77.1%), e Andon Labs ha rilevato che Mythos 5 senza blocchi rendeva meno sia di Opus 4.7 che di GPT-5.5 su Vending-Bench, con un ragionamento che ottimizzava per la rilevabilità invece che per il danno reale

Emetti il tuo verdetto

Una raccomandazione per strumento per gladiatore. Plasma il punteggio della folla che tutti vedono.

Llama 4 (Scout / Maverick)$0.60/1M out (Maverick, hosted)
50%punteggio della folla · 0
Claude Fable 5$50/1M out
63%punteggio della folla · 4

Il verdetto dell'arena su Llama 4 (Scout / Maverick)

Scegli Llama 4 se ti serve un modello multimodale economico, veloce e self-hostabile per chat ad alto volume, estrazione o carichi multilingue fuori dall'UE; Maverick arriva vicino alla qualità di GPT-4o a circa un decimo del prezzo. Evitalo per il coding, il ragionamento difficile o il vero retrieval da un milione di tokens, dove DeepSeek, Qwen 3 e Gemini lo superano nettamente. Rispetto a Llama 3.3 70B aggiunge visione nativa e una finestra più lunga, ma molti sviluppatori hanno trovato il vecchio modello denso o Qwen più affidabili per la pura qualità testuale, e il contesto da 10M è per lo più un numero sulla carta.

Il verdetto dell'arena su Claude Fable 5

Prendi Claude Fable 5 se il tuo carico è davvero a lungo orizzonte: sessioni agentiche notturne, migrazioni monstre, task dove una singola sessione di più ore sostituisce giorni di lavoro supervisionato. Lì, il premio 2x rispetto a Opus 4.8 si ripaga da solo in compressione dei task, e i benchmark (80.3% su SWE-bench Pro, 11 punti sopra il resto del campo) sono confermati da deployment reali presso Stripe e Cursor. Per il coding interattivo e il lavoro quotidiano, resta su Opus 4.8: 88.6% su SWE-bench Verified a metà prezzo, niente falsi positivi dei classificatori, turni più rapidi. I team attenti ai costi ottengono un coding quasi da Opus con Sonnet 5 a $3/$15 (prezzo lancio $2/$10 fino ad agosto 2026). Evita Fable 5 del tutto se la tua organizzazione richiede zero data retention o se lavori anche solo vicino a biologia, imaging medico o strumenti di sicurezza, dove i classificatori dual-use producono ancora falsi positivi e sostituiscono in silenzio Opus 4.8 a metà sessione.

Cosa dice la folla

Su Llama 4 (Scout / Maverick)

Ancora nessun verdetto. Sii il primo a parlare.

Su Claude Fable 5

Pollice Versicus

I do medical imaging research and the bio classifier keeps flagging my MRI segmentation prompts, then it silently falls back to Opus 4.8 mid-session. At $50 per million output tokens I expect to at least know which model actually answered me.

Glorius Maximus

Yes it's 2x the price of Opus and yes the turns are slow. But one overnight Fable run replaced what used to be a week of supervising shorter runs. On a per-task basis it's actually the cheapest model we use.

Pollice d'Oro Maximus

The 1M context is real, not marketing. I fed it our entire service mesh config plus six months of incident postmortems and it traced a flaky timeout to a retry policy nobody remembered writing. Opus 4.8 never connected those dots.

San Deployus

Gave it a monorepo migration that Opus 4.8 kept stalling on. It ran for about 40 minutes, came back with the whole thing done plus a test harness it wrote for itself. Felt like reviewing a senior engineer's PR, not babysitting a chatbot.

Domande frequenti

Llama 4 (Scout / Maverick) è meglio di Claude Fable 5?

La folla oggi sta con Claude Fable 5: il 63% lo consiglia, contro il 50% per Llama 4 (Scout / Maverick) (4 voti). Su Ragionamento, Claude Fable 5 ottiene il voto più alto (5/5 contro 2.5/5). La scelta giusta dipende dal tuo caso d'uso. Il confronto riga per riga di questa pagina analizza prezzi, specifiche chiave e voti dell'arena.

Quale costa meno, Llama 4 (Scout / Maverick) o Claude Fable 5?

Llama 4 (Scout / Maverick) costa meno: parte da $0.60/1M out (Maverick, hosted), mentre Claude Fable 5 parte da $50/1M out.

Quanto costano Llama 4 (Scout / Maverick) e Claude Fable 5 per 1M di token?

Llama 4 (Scout / Maverick): $0.15/1M in (Maverick, hosted) per 1M di token in input, $0.60/1M out (Maverick, hosted) per 1M di token in output. Claude Fable 5: $10/1M in per 1M di token in input, $50/1M out per 1M di token in output.