De arena · AI-model review

Llama 4 (Scout / Maverick)

door Meta

Meta's open-weight MoE-duo: 17B actieve parameters, native beeldinput, op papier 10M tokens context

Arenascore 3/5
Redeneren2.5
Programmeren2.0
Schrijven2.5
Snelheid4.5
Prijs-kwaliteit3.5
Bezoek Llama 4 (Scout / Maverick)goedkope inferentie op hoog volumezelfgehoste multimodale appsmeertalige chat op schaalsamenvatten van lange documenten
Prijs

$0.60/1M out (Maverick, hosted)

Geen betaalde first-party API van Meta; getoond zijn typische tarieven van externe hosts voor Maverick (Scout vanaf ~$0.10/$0.30 per 1M op DeepInfra, $0.11/$0.34 op Groq). De gehoste context van Scout is gecapt ver onder de nominale 10M-spec (bijv. ~320K op DeepInfra).

Aanbieder

Meta

Context window

10M tokens (Scout) / 1M (Maverick)

Inputprijs

$0.15/1M in (Maverick, hosted)

Outputprijs

$0.60/1M out (Maverick, hosted)

Modaliteiten

text, vision (image input)

Open weights

Ja

Wat is Llama 4 (Scout / Maverick)?

Meta's eerste native multimodale mixture-of-experts-modellen met open weights, uitgebracht op 5 april 2025. Scout (109B totale parameters, 16 experts) mikt op deployment op één GPU met een nominale context van 10M tokens; Maverick (400B totaal, 128 experts) is het vlaggenschip-chatmodel met een window van 1M tokens.

Voor- en nadelen van Llama 4 (Scout / Maverick)

Pluspunten

  • MoE-efficiëntie: slechts 17B actieve parameters per token (Scout 109B/16 experts, Maverick 400B/128 experts), goed voor chat van bijna GPT-4o-klasse tegen een fractie van de rekenkracht
  • Zeer goedkope gehoste inferentie: Maverick vanaf ongeveer $0.15/1M in en $0.60/1M uit; Scout vanaf ongeveer $0.10/$0.30 op DeepInfra of $0.11/$0.34 op Groq
  • Native early-fusion-multimodaliteit (tekst plus afbeeldingen, getest tot 8 afbeeldingen) in een model met open weights
  • Grootste nominale context van alle open-weight-modellen bij release: 10M tokens op Scout, 1M op Maverick
  • Scout past op één H100-GPU met Int4-kwantisatie; voorgetraind op 200 talen
  • Hoge doorvoer: 17B actieve parameters halen 500+ tokens/s bij snelle providers (Groq noteert Scout op 594 TPS)

Minpunten

  • Vertrouwen in benchmarks beschadigd: Meta diende een niet-uitgebrachte, chat-geoptimaliseerde Maverick-variant in bij LMArena (ELO 1417), wat devs misleidend noemden omdat de publieke weights lager scoren
  • Long-context-claims storten in de praktijk in: Scout scoorde ~15.6% op 128K op Fiction.LiveBench tegenover 90.6% voor Gemini 2.5 Pro, en gehoste providers cappen Scout ver onder de 10M (bijv. ~320K op DeepInfra)
  • Programmeren breed afgekraakt op r/LocalLlama en HN, verliest van het vergelijkbaar geprijsde DeepSeek V3 op echte devtaken
  • Geen OSI open source: de licentie sluit in de EU gevestigde bedrijven uit, vereist een speciale licentie boven 700M MAU en verplicht Llama-branding
  • 109B/400B totale parameters zijn te groot voor consumenten-GPU's, en de lijn liep vast: er kwam geen redeneervariant en Behemoth is nooit uitgebracht

Het verdict van de arena

Kies Llama 4 als je buiten de EU een goedkoop, snel, zelf te hosten multimodaal model nodig hebt voor high-volume chat, extractie of meertalige workloads; Maverick komt in de buurt van GPT-4o-kwaliteit voor ruwweg een tiende van de prijs. Vermijd het voor programmeren, hard redeneren of echte miljoen-token-retrieval, waar DeepSeek, Qwen 3 en Gemini het duidelijk overtreffen. Ten opzichte van Llama 3.3 70B voegt het native vision en een langer window toe, maar veel developers vonden het oudere dense-model of Qwen betrouwbaarder voor pure tekstkwaliteit, en de 10M context is vooral een papieren getal.

Duim omhoog of duim omlaag

Vel je verdict

Zou je Llama 4 (Scout / Maverick) aanraden, of waarschuw je het publiek?

50%publieksscore · 0

Beste alternatieven voor Llama 4 (Scout / Maverick)

Alle alternatieven
1
Claude Haiku 4.5

Anthropics snelste model: ongeveer 90% van de programmeerkwaliteit van Sonnet 4.5 voor $1/$5 per 1M tokens, 200K context.

$5/1M out67%(2)
Visit
2
Claude Fable 5

Anthropics Mythos-klasse vlaggenschip van juni 2026: 80.3% op SWE-bench Pro, 11 punten voor op elk ander frontier-model

$50/1M out63%(4)
Visit
3
Claude Opus 4.7

Anthropics Opus van april 2026: 87.6% SWE-bench Verified, 1M context, high-res vision, inmiddels voorbijgestreefd door Opus 4.8

$25/1M out57%(3)
Visit

Vergelijk Llama 4 (Scout / Maverick) een-op-een

Llama 4 (Scout / Maverick): veelgestelde vragen

Hoeveel kost Llama 4 (Scout / Maverick) per 1M tokens?

Llama 4 (Scout / Maverick) kost $0.15/1M in (Maverick, hosted) per 1M input tokens en $0.60/1M out (Maverick, hosted) per 1M output tokens. Geen betaalde first-party API van Meta; getoond zijn typische tarieven van externe hosts voor Maverick (Scout vanaf ~$0.10/$0.30 per 1M op DeepInfra, $0.11/$0.34 op Groq). De gehoste context van Scout is gecapt ver onder de nominale 10M-spec (bijv. ~320K op DeepInfra).