Testa a testa

Logo di Llama 4 (Scout / Maverick)vsLogo di Claude Sonnet 5

Llama 4 (Scout / Maverick) vs Claude Sonnet 5: quale modello IA vince nel 2026?

Llama 4 (Scout / Maverick) ($0.60/1M out (Maverick, hosted)) e Claude Sonnet 5 ($15/1M out ($10 intro until 2026-08-31)) sono tra i modelli IA più usati del 2026. Su 3 voti della community, Claude Sonnet 5 è in testa con il 57% di approvazione.

Verdetto rapido

Su Ragionamento, scegli Claude Sonnet 5: l'arena lo valuta 4.5/5 contro 2.5/5 per Llama 4 (Scout / Maverick). Sul budget vince Llama 4 (Scout / Maverick): parte da $0.60/1M out (Maverick, hosted) contro $15/1M out ($10 intro until 2026-08-31) per Claude Sonnet 5.

Confronto riga per riga

A partire da
$0.60/1M out (Maverick, hosted)Nessuna API a pagamento first-party di Meta; sono mostrate le tariffe hosted tipiche di terze parti per Maverick (Scout da ~$0.10/$0.30 per 1M su DeepInfra, $0.11/$0.34 su Groq). Il contesto di Scout in hosting è limitato ben sotto la specifica nominale di 10M (es. ~320K su DeepInfra).
$15/1M out ($10 intro until 2026-08-31)Tier unico: $3/$15 per 1M di tokens standard, $2/$10 di lancio fino al 31 ago 2026; Batch API -50%; il nuovo tokenizer produce circa il 30% di tokens in più a parità di testo (1.0-1.35x secondo Anthropic), alzando il costo effettivo.
Fornitore
Meta
Anthropic
Finestra di contesto
10M tokens (Scout) / 1M (Maverick)
1M tokens (128K max output)
Prezzo in input
$0.15/1M in (Maverick, hosted)
$3/1M in ($2 intro until 2026-08-31)
Prezzo in output
$0.60/1M out (Maverick, hosted)
$15/1M out ($10 intro until 2026-08-31)
Modalità
text, vision (image input)
text, vision (image input, text output)
Open weights
No
Punteggio della folla
50%(0)
57%(3)
Voti dell'arena (1-5)
Ragionamento
2.5
4.5
Coding
2.0
4.5
Scrittura
2.5
4.5
Velocità
4.5
4.0
Rapporto qualità-prezzo
3.5
4.5

Punti di forza e debolezze

Llama 4 (Scout / Maverick)

  • Efficienza MoE: solo 17B di parametri attivi per token (Scout 109B/16 expert, Maverick 400B/128 expert), per una chat quasi da GPT-4o a una frazione del compute
  • Inferenza hosted molto economica: Maverick da circa $0.15/1M in input e $0.60/1M in output; Scout da circa $0.10/$0.30 su DeepInfra o $0.11/$0.34 su Groq
  • Multimodalità nativa early-fusion (testo più immagini, testato fino a 8 immagini) in un modello open weights
  • Il più grande contesto nominale di qualsiasi modello open weights alla release: 10M di tokens su Scout, 1M su Maverick
  • Scout entra su una singola GPU H100 con quantizzazione Int4; pre-addestrato su 200 lingue
  • Throughput elevato: i 17B di parametri attivi superano i 500 tokens/s sui provider veloci (Groq quota Scout a 594 TPS)
  • Fiducia nei benchmark compromessa: Meta ha inviato a LMArena una variante Maverick chat-optimized mai rilasciata (ELO 1417), che gli sviluppatori hanno definito fuorviante visto che i pesi pubblici segnano meno
  • Le promesse sul long-context crollano in pratica: Scout ha segnato ~15.6% a 128K su Fiction.LiveBench contro il 90.6% di Gemini 2.5 Pro, e i provider hosted limitano Scout ben sotto i 10M (es. ~320K su DeepInfra)
  • Coding stroncato su r/LocalLlama e HN, perde contro DeepSeek V3 a parità di prezzo sui task reali di sviluppo
  • Non è open source secondo OSI: la licenza esclude le aziende con sede nell'UE, richiede una licenza speciale oltre i 700M di MAU e impone il branding Llama
  • 109B/400B di parametri totali sono troppi per le GPU consumer, e la linea si è fermata: nessuna variante di ragionamento è uscita e Behemoth non è mai stato rilasciato

Claude Sonnet 5

  • Grandi progressi agentici rispetto a Sonnet 4.6: Terminal-Bench 2.1 80.4% contro 67.0%, OSWorld-Verified 81.2% contro 78.5%, SWE-bench Pro 63.2% contro 58.1%
  • Eguaglia Opus 4.8 sul lavoro di conoscenza (GDPval-AA v2: 1,618 contro 1,615) e quasi lo pareggia su Humanity's Last Exam con tool (57.4% contro 57.9%) al 60% del prezzo di Opus 4.8 (40% durante la finestra di lancio)
  • Finestra di contesto da 1M di tokens e 128K di output max; prezzo di lancio di $2/$10 per 1M di tokens fino al 31 ago 2026
  • Comportamento da agente auto-verificante e tenace: le recensioni sul campo notano che testa il proprio codice e itera sui problemi difficili fino a risolverli, a differenza di Sonnet 4.6
  • Primo Sonnet con livello di effort xhigh e visione ad alta risoluzione (immagini a 2576px); adaptive thinking attivo di default
  • Precisione superiore nella code review rispetto a Sonnet 4.6 (38-40% contro 29%), con meno falsi positivi
  • Il nuovo tokenizer gonfia il conteggio dei tokens di circa il 30% a parità di testo (1.0-1.35x secondo Anthropic; ~1.4x in inglese, ~1.28x in Python misurati da Simon Willison), alzando il costo effettivo nonostante il prezzo di listino invariato
  • Prolisso e vorace di tokens: ~$2.29 per task contro ~$1.20 di Sonnet 4.6 nei test indipendenti (101° su 161 per efficienza di costo); a effort alto il costo per task può superare Opus 4.8
  • Misurabilmente più lento di Sonnet 4.6 sulle piccole modifiche di routine e incline all'over-engineering sui task semplici (recensione hands-on di CodeRabbit)
  • Parametri di sampling (temperature, top_p, top_k) rimossi; i valori non di default restituiscono un errore 400, rompendo le pipeline esistenti
  • Sentiment al lancio misto su HN/Reddit: l'etichetta '5' è stata vista come una promessa eccessiva, e le protezioni cybersecurity più severe possono rifiutare lavoro benigno vicino alla sicurezza

Emetti il tuo verdetto

Una raccomandazione per strumento per gladiatore. Plasma il punteggio della folla che tutti vedono.

Llama 4 (Scout / Maverick)$0.60/1M out (Maverick, hosted)
50%punteggio della folla · 0
Claude Sonnet 5$15/1M out ($10 intro until 2026-08-31)
57%punteggio della folla · 3

Il verdetto dell'arena su Llama 4 (Scout / Maverick)

Scegli Llama 4 se ti serve un modello multimodale economico, veloce e self-hostabile per chat ad alto volume, estrazione o carichi multilingue fuori dall'UE; Maverick arriva vicino alla qualità di GPT-4o a circa un decimo del prezzo. Evitalo per il coding, il ragionamento difficile o il vero retrieval da un milione di tokens, dove DeepSeek, Qwen 3 e Gemini lo superano nettamente. Rispetto a Llama 3.3 70B aggiunge visione nativa e una finestra più lunga, ma molti sviluppatori hanno trovato il vecchio modello denso o Qwen più affidabili per la pura qualità testuale, e il contesto da 10M è per lo più un numero sulla carta.

Il verdetto dell'arena su Claude Sonnet 5

Scegli Sonnet 5 se usi agenti di coding, da terminale o computer-use e vuoi qualità vicina a Opus 4.8 a prezzi da Sonnet, soprattutto durante la finestra di lancio a $2/$10; è un upgrade netto rispetto a Sonnet 4.6 a effort basso e medio. Metti in conto il nuovo tokenizer e la sua prolissità: i costi reali per task superano di parecchio Sonnet 4.6, e ai livelli di effort più alti Opus 4.8 può essere l'affare migliore per task risolto. Evitalo per le piccole modifiche sensibili alla latenza o per le pipeline che dipendono da temperature e top_p, che ora vanno in errore. Sonnet 4.6 resta la scelta pragmatica per i carichi ad alto volume di micro-diff.

Cosa dice la folla

Su Llama 4 (Scout / Maverick)

Ancora nessun verdetto. Sii il primo a parlare.

Su Claude Sonnet 5

Capitan Churn

Cheap per token, pricey per task. Independent tests had it near $2.29 a task vs $1.20 on 4.6, and at high effort it can out-cost Opus 4.8. It will not stop talking.

Pollice d'Oro Maximus

Terminal-Bench going 67 to 80 over Sonnet 4.6 matches what I see. My CI-fix agent went from constant babysitting to mostly hands-off overnight.

San Deployus

Matches Opus 4.8 on knowledge work at 60% of the price, and the intro $2/$10 window makes it silly value. My research agent runs on Sonnet 5 now, zero regrets.

Domande frequenti

Llama 4 (Scout / Maverick) è meglio di Claude Sonnet 5?

La folla oggi sta con Claude Sonnet 5: il 57% lo consiglia, contro il 50% per Llama 4 (Scout / Maverick) (3 voti). Su Ragionamento, Claude Sonnet 5 ottiene il voto più alto (4.5/5 contro 2.5/5). La scelta giusta dipende dal tuo caso d'uso. Il confronto riga per riga di questa pagina analizza prezzi, specifiche chiave e voti dell'arena.

Quale costa meno, Llama 4 (Scout / Maverick) o Claude Sonnet 5?

Llama 4 (Scout / Maverick) costa meno: parte da $0.60/1M out (Maverick, hosted), mentre Claude Sonnet 5 parte da $15/1M out ($10 intro until 2026-08-31).

Quanto costano Llama 4 (Scout / Maverick) e Claude Sonnet 5 per 1M di token?

Llama 4 (Scout / Maverick): $0.15/1M in (Maverick, hosted) per 1M di token in input, $0.60/1M out (Maverick, hosted) per 1M di token in output. Claude Sonnet 5: $3/1M in ($2 intro until 2026-08-31) per 1M di token in input, $15/1M out ($10 intro until 2026-08-31) per 1M di token in output.