Die Arena · KI-Modell im Test

Llama 4 (Scout / Maverick)

von Meta

Metas Open-Weight-MoE-Duo: 17B aktive Parameter, native Bildeingabe, 10M Token Kontext auf dem Papier

Arena-Score 3/5
Reasoning2.5
Coding2.0
Schreiben2.5
Tempo4.5
Preis-Leistung3.5
Llama 4 (Scout / Maverick) besuchengünstige Inferenz mit hohem Volumenselbst gehostete multimodale Appsmehrsprachiger Chat im großen MaßstabZusammenfassung langer Dokumente
Preis

$0.60/1M out (Maverick, hosted)

Keine kostenpflichtige First-Party-API von Meta; gezeigt werden typische Preise von Drittanbieter-Hosts für Maverick (Scout ab ~$0.10/$0.30 pro 1M auf DeepInfra, $0.11/$0.34 auf Groq). Der gehostete Scout-Kontext liegt weit unter den nominalen 10M (z. B. ~320K auf DeepInfra).

Anbieter

Meta

Kontextfenster

10M tokens (Scout) / 1M (Maverick)

Input-Preis

$0.15/1M in (Maverick, hosted)

Output-Preis

$0.60/1M out (Maverick, hosted)

Modalitäten

text, vision (image input)

Open Weights

Ja

Was ist Llama 4 (Scout / Maverick)?

Metas erste nativ multimodale Mixture-of-Experts-Modelle mit offenen Gewichten, veröffentlicht am 5. April 2025. Scout (109B Gesamtparameter, 16 Experten) zielt auf Single-GPU-Deployment mit nominal 10M Token Kontext; Maverick (400B gesamt, 128 Experten) ist das Flaggschiff-Chatmodell mit 1M-Token-Fenster.

Llama 4 (Scout / Maverick): Vor- und Nachteile

Vorteile

  • MoE-Effizienz: nur 17B aktive Parameter pro Token (Scout 109B/16 Experten, Maverick 400B/128 Experten), was Chat fast auf GPT-4o-Niveau zu einem Bruchteil der Rechenlast liefert
  • Sehr günstige gehostete Inferenz: Maverick ab etwa $0.15/1M Input und $0.60/1M Output; Scout ab etwa $0.10/$0.30 auf DeepInfra oder $0.11/$0.34 auf Groq
  • Native Early-Fusion-Multimodalität (Text plus Bilder, getestet mit bis zu 8 Bildern) in einem Open-Weight-Modell
  • Größter nominaler Kontext aller Open-Weight-Modelle zum Release: 10M Tokens bei Scout, 1M bei Maverick
  • Scout passt mit Int4-Quantisierung auf eine einzelne H100-GPU; vortrainiert auf 200 Sprachen
  • Hoher Durchsatz: 17B aktive Parameter erreichen 500+ Tokens/s bei schnellen Anbietern (Groq listet Scout mit 594 TPS)

Nachteile

  • Beschädigtes Benchmark-Vertrauen: Meta reichte eine unveröffentlichte, chat-optimierte Maverick-Variante bei LMArena ein (ELO 1417), was Entwickler als irreführend bezeichneten, da die öffentlichen Gewichte schlechter abschneiden
  • Long-Context-Versprechen brechen in der Praxis zusammen: Scout erreichte ~15.6% bei 128K auf Fiction.LiveBench gegenüber 90.6% bei Gemini 2.5 Pro, und Hosting-Anbieter deckeln Scout weit unter 10M (z. B. ~320K auf DeepInfra)
  • Coding auf r/LocalLlama und HN breit verrissen, unterliegt bei echten Dev-Aufgaben dem ähnlich bepreisten DeepSeek V3
  • Kein Open Source nach OSI: Die Lizenz schließt Unternehmen mit Sitz in der EU aus, verlangt oberhalb von 700M MAU eine Sonderlizenz und schreibt Llama-Branding vor
  • 109B/400B Gesamtparameter sind zu groß für Consumer-GPUs, und die Modellreihe kam ins Stocken: keine Reasoning-Variante erschien, und Behemoth wurde nie veröffentlicht

Das Urteil der Arena

Wählen Sie Llama 4, wenn Sie ein günstiges, schnelles, selbst hostbares multimodales Modell für Chat mit hohem Volumen, Extraktion oder mehrsprachige Workloads außerhalb der EU brauchen; Maverick landet nahe GPT-4o-Qualität zu ungefähr einem Zehntel des Preises. Meiden Sie es für Coding, hartes Reasoning oder echte Million-Token-Abfragen, wo DeepSeek, Qwen 3 und Gemini klar besser abschneiden. Gegenüber Llama 3.3 70B bringt es native Vision und ein längeres Fenster, doch viele Entwickler fanden das ältere dichte Modell oder Qwen bei reiner Textqualität verlässlicher, und der 10M-Kontext ist überwiegend ein Papierwert.

Daumen hoch oder Daumen runter

Fällen Sie Ihr Urteil

Würden Sie Llama 4 (Scout / Maverick) empfehlen oder die Menge davor warnen?

50%Crowd-Score · 0

Top-Alternativen zu Llama 4 (Scout / Maverick)

Alle Alternativen
1
Claude Haiku 4.5

Anthropics schnellstes Modell: etwa 90% der Coding-Stärke von Sonnet 4.5 für $1/$5 pro 1M Tokens, 200K Kontext.

$5/1M out67%(2)
Visit
2
Claude Fable 5

Anthropics Mythos-Klasse-Flaggschiff vom Juni 2026: 80.3% auf SWE-bench Pro, 11 Punkte vor jedem anderen Frontier-Modell

$50/1M out63%(4)
Visit
3
Claude Opus 4.7

Anthropics Opus vom April 2026: 87.6% SWE-bench Verified, 1M Kontext, hochauflösende Vision, inzwischen hinter Opus 4.8

$25/1M out57%(3)
Visit

Llama 4 (Scout / Maverick) im direkten Vergleich

Llama 4 (Scout / Maverick): häufige Fragen

Was kostet Llama 4 (Scout / Maverick) pro 1M Tokens?

Llama 4 (Scout / Maverick) kostet $0.15/1M in (Maverick, hosted) pro 1M Input-Tokens und $0.60/1M out (Maverick, hosted) pro 1M Output-Tokens. Keine kostenpflichtige First-Party-API von Meta; gezeigt werden typische Preise von Drittanbieter-Hosts für Maverick (Scout ab ~$0.10/$0.30 pro 1M auf DeepInfra, $0.11/$0.34 auf Groq). Der gehostete Scout-Kontext liegt weit unter den nominalen 10M (z. B. ~320K auf DeepInfra).