L'arena · recensione di modello IA
Llama 4 (Scout / Maverick)
di Meta
Il duo MoE open weights di Meta: 17B di parametri attivi, input immagini nativo, contesto da 10M di tokens sulla carta
$0.60/1M out (Maverick, hosted)
Nessuna API a pagamento first-party di Meta; sono mostrate le tariffe hosted tipiche di terze parti per Maverick (Scout da ~$0.10/$0.30 per 1M su DeepInfra, $0.11/$0.34 su Groq). Il contesto di Scout in hosting è limitato ben sotto la specifica nominale di 10M (es. ~320K su DeepInfra).
Meta
10M tokens (Scout) / 1M (Maverick)
$0.15/1M in (Maverick, hosted)
$0.60/1M out (Maverick, hosted)
text, vision (image input)
Sì
Che cos'è Llama 4 (Scout / Maverick)?
I primi modelli open weights di Meta nativamente multimodali a mixture-of-experts, usciti il 5 aprile 2025. Scout (109B di parametri totali, 16 expert) punta al deployment su singola GPU con un contesto nominale da 10M di tokens; Maverick (400B totali, 128 expert) è il modello chat di punta con finestra da 1M di tokens.
Llama 4 (Scout / Maverick): pro e contro
Pro
- Efficienza MoE: solo 17B di parametri attivi per token (Scout 109B/16 expert, Maverick 400B/128 expert), per una chat quasi da GPT-4o a una frazione del compute
- Inferenza hosted molto economica: Maverick da circa $0.15/1M in input e $0.60/1M in output; Scout da circa $0.10/$0.30 su DeepInfra o $0.11/$0.34 su Groq
- Multimodalità nativa early-fusion (testo più immagini, testato fino a 8 immagini) in un modello open weights
- Il più grande contesto nominale di qualsiasi modello open weights alla release: 10M di tokens su Scout, 1M su Maverick
- Scout entra su una singola GPU H100 con quantizzazione Int4; pre-addestrato su 200 lingue
- Throughput elevato: i 17B di parametri attivi superano i 500 tokens/s sui provider veloci (Groq quota Scout a 594 TPS)
Contro
- Fiducia nei benchmark compromessa: Meta ha inviato a LMArena una variante Maverick chat-optimized mai rilasciata (ELO 1417), che gli sviluppatori hanno definito fuorviante visto che i pesi pubblici segnano meno
- Le promesse sul long-context crollano in pratica: Scout ha segnato ~15.6% a 128K su Fiction.LiveBench contro il 90.6% di Gemini 2.5 Pro, e i provider hosted limitano Scout ben sotto i 10M (es. ~320K su DeepInfra)
- Coding stroncato su r/LocalLlama e HN, perde contro DeepSeek V3 a parità di prezzo sui task reali di sviluppo
- Non è open source secondo OSI: la licenza esclude le aziende con sede nell'UE, richiede una licenza speciale oltre i 700M di MAU e impone il branding Llama
- 109B/400B di parametri totali sono troppi per le GPU consumer, e la linea si è fermata: nessuna variante di ragionamento è uscita e Behemoth non è mai stato rilasciato
Il verdetto dell'arena
Scegli Llama 4 se ti serve un modello multimodale economico, veloce e self-hostabile per chat ad alto volume, estrazione o carichi multilingue fuori dall'UE; Maverick arriva vicino alla qualità di GPT-4o a circa un decimo del prezzo. Evitalo per il coding, il ragionamento difficile o il vero retrieval da un milione di tokens, dove DeepSeek, Qwen 3 e Gemini lo superano nettamente. Rispetto a Llama 3.3 70B aggiunge visione nativa e una finestra più lunga, ma molti sviluppatori hanno trovato il vecchio modello denso o Qwen più affidabili per la pura qualità testuale, e il contesto da 10M è per lo più un numero sulla carta.
Pollice su o pollice verso
Emetti il tuo verdetto
Consiglieresti Llama 4 (Scout / Maverick), o metteresti in guardia la folla?
Migliori alternative a Llama 4 (Scout / Maverick)
Tutte le alternativeIl modello più veloce di Anthropic: circa il 90% delle capacità di coding di Sonnet 4.5 a $1/$5 per 1M di tokens, contesto 200K.
Il flagship di classe Mythos di Anthropic di giugno 2026: 80.3% su SWE-bench Pro, 11 punti sopra ogni altro modello di frontiera
L'Opus di Anthropic di aprile 2026: 87.6% su SWE-bench Verified, contesto 1M, visione ad alta risoluzione, ormai dietro a Opus 4.8
Confronta Llama 4 (Scout / Maverick) testa a testa
Llama 4 (Scout / Maverick): domande frequenti
Quanto costa Llama 4 (Scout / Maverick) per 1M di token?
Llama 4 (Scout / Maverick) costa $0.15/1M in (Maverick, hosted) per 1M di token in input e $0.60/1M out (Maverick, hosted) per 1M di token in output. Nessuna API a pagamento first-party di Meta; sono mostrate le tariffe hosted tipiche di terze parti per Maverick (Scout da ~$0.10/$0.30 per 1M su DeepInfra, $0.11/$0.34 su Groq). Il contesto di Scout in hosting è limitato ben sotto la specifica nominale di 10M (es. ~320K su DeepInfra).