Testa a testa
Llama 4 (Scout / Maverick) vs Claude Sonnet 5: quale modello IA vince nel 2026?
Llama 4 (Scout / Maverick) ($0.60/1M out (Maverick, hosted)) e Claude Sonnet 5 ($15/1M out ($10 intro until 2026-08-31)) sono tra i modelli IA più usati del 2026. Su 3 voti della community, Claude Sonnet 5 è in testa con il 57% di approvazione.
Verdetto rapido
Su Ragionamento, scegli Claude Sonnet 5: l'arena lo valuta 4.5/5 contro 2.5/5 per Llama 4 (Scout / Maverick). Sul budget vince Llama 4 (Scout / Maverick): parte da $0.60/1M out (Maverick, hosted) contro $15/1M out ($10 intro until 2026-08-31) per Claude Sonnet 5.
Confronto riga per riga
Punti di forza e debolezze
Llama 4 (Scout / Maverick)
- Efficienza MoE: solo 17B di parametri attivi per token (Scout 109B/16 expert, Maverick 400B/128 expert), per una chat quasi da GPT-4o a una frazione del compute
- Inferenza hosted molto economica: Maverick da circa $0.15/1M in input e $0.60/1M in output; Scout da circa $0.10/$0.30 su DeepInfra o $0.11/$0.34 su Groq
- Multimodalità nativa early-fusion (testo più immagini, testato fino a 8 immagini) in un modello open weights
- Il più grande contesto nominale di qualsiasi modello open weights alla release: 10M di tokens su Scout, 1M su Maverick
- Scout entra su una singola GPU H100 con quantizzazione Int4; pre-addestrato su 200 lingue
- Throughput elevato: i 17B di parametri attivi superano i 500 tokens/s sui provider veloci (Groq quota Scout a 594 TPS)
- Fiducia nei benchmark compromessa: Meta ha inviato a LMArena una variante Maverick chat-optimized mai rilasciata (ELO 1417), che gli sviluppatori hanno definito fuorviante visto che i pesi pubblici segnano meno
- Le promesse sul long-context crollano in pratica: Scout ha segnato ~15.6% a 128K su Fiction.LiveBench contro il 90.6% di Gemini 2.5 Pro, e i provider hosted limitano Scout ben sotto i 10M (es. ~320K su DeepInfra)
- Coding stroncato su r/LocalLlama e HN, perde contro DeepSeek V3 a parità di prezzo sui task reali di sviluppo
- Non è open source secondo OSI: la licenza esclude le aziende con sede nell'UE, richiede una licenza speciale oltre i 700M di MAU e impone il branding Llama
- 109B/400B di parametri totali sono troppi per le GPU consumer, e la linea si è fermata: nessuna variante di ragionamento è uscita e Behemoth non è mai stato rilasciato
Claude Sonnet 5
- Grandi progressi agentici rispetto a Sonnet 4.6: Terminal-Bench 2.1 80.4% contro 67.0%, OSWorld-Verified 81.2% contro 78.5%, SWE-bench Pro 63.2% contro 58.1%
- Eguaglia Opus 4.8 sul lavoro di conoscenza (GDPval-AA v2: 1,618 contro 1,615) e quasi lo pareggia su Humanity's Last Exam con tool (57.4% contro 57.9%) al 60% del prezzo di Opus 4.8 (40% durante la finestra di lancio)
- Finestra di contesto da 1M di tokens e 128K di output max; prezzo di lancio di $2/$10 per 1M di tokens fino al 31 ago 2026
- Comportamento da agente auto-verificante e tenace: le recensioni sul campo notano che testa il proprio codice e itera sui problemi difficili fino a risolverli, a differenza di Sonnet 4.6
- Primo Sonnet con livello di effort xhigh e visione ad alta risoluzione (immagini a 2576px); adaptive thinking attivo di default
- Precisione superiore nella code review rispetto a Sonnet 4.6 (38-40% contro 29%), con meno falsi positivi
- Il nuovo tokenizer gonfia il conteggio dei tokens di circa il 30% a parità di testo (1.0-1.35x secondo Anthropic; ~1.4x in inglese, ~1.28x in Python misurati da Simon Willison), alzando il costo effettivo nonostante il prezzo di listino invariato
- Prolisso e vorace di tokens: ~$2.29 per task contro ~$1.20 di Sonnet 4.6 nei test indipendenti (101° su 161 per efficienza di costo); a effort alto il costo per task può superare Opus 4.8
- Misurabilmente più lento di Sonnet 4.6 sulle piccole modifiche di routine e incline all'over-engineering sui task semplici (recensione hands-on di CodeRabbit)
- Parametri di sampling (temperature, top_p, top_k) rimossi; i valori non di default restituiscono un errore 400, rompendo le pipeline esistenti
- Sentiment al lancio misto su HN/Reddit: l'etichetta '5' è stata vista come una promessa eccessiva, e le protezioni cybersecurity più severe possono rifiutare lavoro benigno vicino alla sicurezza
Emetti il tuo verdetto
Una raccomandazione per strumento per gladiatore. Plasma il punteggio della folla che tutti vedono.
Il verdetto dell'arena su Llama 4 (Scout / Maverick)
Scegli Llama 4 se ti serve un modello multimodale economico, veloce e self-hostabile per chat ad alto volume, estrazione o carichi multilingue fuori dall'UE; Maverick arriva vicino alla qualità di GPT-4o a circa un decimo del prezzo. Evitalo per il coding, il ragionamento difficile o il vero retrieval da un milione di tokens, dove DeepSeek, Qwen 3 e Gemini lo superano nettamente. Rispetto a Llama 3.3 70B aggiunge visione nativa e una finestra più lunga, ma molti sviluppatori hanno trovato il vecchio modello denso o Qwen più affidabili per la pura qualità testuale, e il contesto da 10M è per lo più un numero sulla carta.
Il verdetto dell'arena su Claude Sonnet 5
Scegli Sonnet 5 se usi agenti di coding, da terminale o computer-use e vuoi qualità vicina a Opus 4.8 a prezzi da Sonnet, soprattutto durante la finestra di lancio a $2/$10; è un upgrade netto rispetto a Sonnet 4.6 a effort basso e medio. Metti in conto il nuovo tokenizer e la sua prolissità: i costi reali per task superano di parecchio Sonnet 4.6, e ai livelli di effort più alti Opus 4.8 può essere l'affare migliore per task risolto. Evitalo per le piccole modifiche sensibili alla latenza o per le pipeline che dipendono da temperature e top_p, che ora vanno in errore. Sonnet 4.6 resta la scelta pragmatica per i carichi ad alto volume di micro-diff.
Cosa dice la folla
Su Llama 4 (Scout / Maverick)
Ancora nessun verdetto. Sii il primo a parlare.
Su Claude Sonnet 5
“Cheap per token, pricey per task. Independent tests had it near $2.29 a task vs $1.20 on 4.6, and at high effort it can out-cost Opus 4.8. It will not stop talking.”
“Terminal-Bench going 67 to 80 over Sonnet 4.6 matches what I see. My CI-fix agent went from constant babysitting to mostly hands-off overnight.”
“Matches Opus 4.8 on knowledge work at 60% of the price, and the intro $2/$10 window makes it silly value. My research agent runs on Sonnet 5 now, zero regrets.”
Continua a confrontare
Domande frequenti
Llama 4 (Scout / Maverick) è meglio di Claude Sonnet 5?
La folla oggi sta con Claude Sonnet 5: il 57% lo consiglia, contro il 50% per Llama 4 (Scout / Maverick) (3 voti). Su Ragionamento, Claude Sonnet 5 ottiene il voto più alto (4.5/5 contro 2.5/5). La scelta giusta dipende dal tuo caso d'uso. Il confronto riga per riga di questa pagina analizza prezzi, specifiche chiave e voti dell'arena.
Quale costa meno, Llama 4 (Scout / Maverick) o Claude Sonnet 5?
Llama 4 (Scout / Maverick) costa meno: parte da $0.60/1M out (Maverick, hosted), mentre Claude Sonnet 5 parte da $15/1M out ($10 intro until 2026-08-31).
Quanto costano Llama 4 (Scout / Maverick) e Claude Sonnet 5 per 1M di token?
Llama 4 (Scout / Maverick): $0.15/1M in (Maverick, hosted) per 1M di token in input, $0.60/1M out (Maverick, hosted) per 1M di token in output. Claude Sonnet 5: $3/1M in ($2 intro until 2026-08-31) per 1M di token in input, $15/1M out ($10 intro until 2026-08-31) per 1M di token in output.