L'arena · recensione di modello IA

Llama 4 (Scout / Maverick)

di Meta

Il duo MoE open weights di Meta: 17B di parametri attivi, input immagini nativo, contesto da 10M di tokens sulla carta

Punteggio dell'arena 3/5
Ragionamento2.5
Coding2.0
Scrittura2.5
Velocità4.5
Rapporto qualità-prezzo3.5
Visita Llama 4 (Scout / Maverick)inferenza economica ad alto volumeapp multimodali self-hostedchat multilingue su larga scalariassunto di documenti lunghi
Prezzo

$0.60/1M out (Maverick, hosted)

Nessuna API a pagamento first-party di Meta; sono mostrate le tariffe hosted tipiche di terze parti per Maverick (Scout da ~$0.10/$0.30 per 1M su DeepInfra, $0.11/$0.34 su Groq). Il contesto di Scout in hosting è limitato ben sotto la specifica nominale di 10M (es. ~320K su DeepInfra).

Fornitore

Meta

Finestra di contesto

10M tokens (Scout) / 1M (Maverick)

Prezzo in input

$0.15/1M in (Maverick, hosted)

Prezzo in output

$0.60/1M out (Maverick, hosted)

Modalità

text, vision (image input)

Open weights

Che cos'è Llama 4 (Scout / Maverick)?

I primi modelli open weights di Meta nativamente multimodali a mixture-of-experts, usciti il 5 aprile 2025. Scout (109B di parametri totali, 16 expert) punta al deployment su singola GPU con un contesto nominale da 10M di tokens; Maverick (400B totali, 128 expert) è il modello chat di punta con finestra da 1M di tokens.

Llama 4 (Scout / Maverick): pro e contro

Pro

  • Efficienza MoE: solo 17B di parametri attivi per token (Scout 109B/16 expert, Maverick 400B/128 expert), per una chat quasi da GPT-4o a una frazione del compute
  • Inferenza hosted molto economica: Maverick da circa $0.15/1M in input e $0.60/1M in output; Scout da circa $0.10/$0.30 su DeepInfra o $0.11/$0.34 su Groq
  • Multimodalità nativa early-fusion (testo più immagini, testato fino a 8 immagini) in un modello open weights
  • Il più grande contesto nominale di qualsiasi modello open weights alla release: 10M di tokens su Scout, 1M su Maverick
  • Scout entra su una singola GPU H100 con quantizzazione Int4; pre-addestrato su 200 lingue
  • Throughput elevato: i 17B di parametri attivi superano i 500 tokens/s sui provider veloci (Groq quota Scout a 594 TPS)

Contro

  • Fiducia nei benchmark compromessa: Meta ha inviato a LMArena una variante Maverick chat-optimized mai rilasciata (ELO 1417), che gli sviluppatori hanno definito fuorviante visto che i pesi pubblici segnano meno
  • Le promesse sul long-context crollano in pratica: Scout ha segnato ~15.6% a 128K su Fiction.LiveBench contro il 90.6% di Gemini 2.5 Pro, e i provider hosted limitano Scout ben sotto i 10M (es. ~320K su DeepInfra)
  • Coding stroncato su r/LocalLlama e HN, perde contro DeepSeek V3 a parità di prezzo sui task reali di sviluppo
  • Non è open source secondo OSI: la licenza esclude le aziende con sede nell'UE, richiede una licenza speciale oltre i 700M di MAU e impone il branding Llama
  • 109B/400B di parametri totali sono troppi per le GPU consumer, e la linea si è fermata: nessuna variante di ragionamento è uscita e Behemoth non è mai stato rilasciato

Il verdetto dell'arena

Scegli Llama 4 se ti serve un modello multimodale economico, veloce e self-hostabile per chat ad alto volume, estrazione o carichi multilingue fuori dall'UE; Maverick arriva vicino alla qualità di GPT-4o a circa un decimo del prezzo. Evitalo per il coding, il ragionamento difficile o il vero retrieval da un milione di tokens, dove DeepSeek, Qwen 3 e Gemini lo superano nettamente. Rispetto a Llama 3.3 70B aggiunge visione nativa e una finestra più lunga, ma molti sviluppatori hanno trovato il vecchio modello denso o Qwen più affidabili per la pura qualità testuale, e il contesto da 10M è per lo più un numero sulla carta.

Pollice su o pollice verso

Emetti il tuo verdetto

Consiglieresti Llama 4 (Scout / Maverick), o metteresti in guardia la folla?

50%punteggio della folla · 0

Migliori alternative a Llama 4 (Scout / Maverick)

Tutte le alternative
1
Claude Haiku 4.5

Il modello più veloce di Anthropic: circa il 90% delle capacità di coding di Sonnet 4.5 a $1/$5 per 1M di tokens, contesto 200K.

$5/1M out67%(2)
Visit
2
Claude Fable 5

Il flagship di classe Mythos di Anthropic di giugno 2026: 80.3% su SWE-bench Pro, 11 punti sopra ogni altro modello di frontiera

$50/1M out63%(4)
Visit
3
Claude Opus 4.7

L'Opus di Anthropic di aprile 2026: 87.6% su SWE-bench Verified, contesto 1M, visione ad alta risoluzione, ormai dietro a Opus 4.8

$25/1M out57%(3)
Visit

Confronta Llama 4 (Scout / Maverick) testa a testa

Llama 4 (Scout / Maverick): domande frequenti

Quanto costa Llama 4 (Scout / Maverick) per 1M di token?

Llama 4 (Scout / Maverick) costa $0.15/1M in (Maverick, hosted) per 1M di token in input e $0.60/1M out (Maverick, hosted) per 1M di token in output. Nessuna API a pagamento first-party di Meta; sono mostrate le tariffe hosted tipiche di terze parti per Maverick (Scout da ~$0.10/$0.30 per 1M su DeepInfra, $0.11/$0.34 su Groq). Il contesto di Scout in hosting è limitato ben sotto la specifica nominale di 10M (es. ~320K su DeepInfra).