Direktvergleich

Llama 4 (Scout / Maverick) LogovsDeepSeek-V4 Logo

Llama 4 (Scout / Maverick) vs DeepSeek-V4: Wer gewinnt das KI-Modell-Duell 2026?

Llama 4 (Scout / Maverick) ($0.60/1M out (Maverick, hosted)) und DeepSeek-V4 ($0.87/1M out) sind 2026 zwei der meistgenutzten KI-Modelle. Bei 3 Stimmen der Community führt DeepSeek-V4 mit 57% Zustimmung.

Schnelles Urteil

Bei Reasoning wählen Sie DeepSeek-V4: Die Arena bewertet es mit 4.5/5 gegenüber 2.5/5 für Llama 4 (Scout / Maverick). Beide starten zum gleichen Preis: $0.60/1M out (Maverick, hosted).

Vergleich Zeile für Zeile

Ab
$0.60/1M out (Maverick, hosted)Keine kostenpflichtige First-Party-API von Meta; gezeigt werden typische Preise von Drittanbieter-Hosts für Maverick (Scout ab ~$0.10/$0.30 pro 1M auf DeepInfra, $0.11/$0.34 auf Groq). Der gehostete Scout-Kontext liegt weit unter den nominalen 10M (z. B. ~320K auf DeepInfra).
$0.87/1M outV4-Pro-Tarif: $0.435/1M Input ($0.003625 bei Cache-Treffer), $0.87/1M Output; günstigerer V4-Flash-Tarif für $0.14/$0.28 ($0.0028 bei Cache-Treffer); der Launch-Rabatt von 75% wurde am 2026-05-22 zum dauerhaften Preis. Das offizielle Release Mitte Juli 2026 führt Stoßzeiten-/Nebenzeiten-Preise ein, die gelisteten Tarife verdoppeln sich während der Pekinger Stoßzeiten.
Anbieter
Meta
DeepSeek
Kontextfenster
10M tokens (Scout) / 1M (Maverick)
1M tokens (384K max output)
Input-Preis
$0.15/1M in (Maverick, hosted)
$0.435/1M in (cache hit $0.003625)
Output-Preis
$0.60/1M out (Maverick, hosted)
$0.87/1M out
Modalitäten
text, vision (image input)
text only
Open Weights
Ja
Ja
Crowd-Score
50%(0)
57%(3)
Arena-Bewertungen (1-5)
Reasoning
2.5
4.5
Coding
2.0
4.5
Schreiben
2.5
3.5
Tempo
4.5
3.0
Preis-Leistung
3.5
5.0

Stärken und Schwächen

Llama 4 (Scout / Maverick)

  • MoE-Effizienz: nur 17B aktive Parameter pro Token (Scout 109B/16 Experten, Maverick 400B/128 Experten), was Chat fast auf GPT-4o-Niveau zu einem Bruchteil der Rechenlast liefert
  • Sehr günstige gehostete Inferenz: Maverick ab etwa $0.15/1M Input und $0.60/1M Output; Scout ab etwa $0.10/$0.30 auf DeepInfra oder $0.11/$0.34 auf Groq
  • Native Early-Fusion-Multimodalität (Text plus Bilder, getestet mit bis zu 8 Bildern) in einem Open-Weight-Modell
  • Größter nominaler Kontext aller Open-Weight-Modelle zum Release: 10M Tokens bei Scout, 1M bei Maverick
  • Scout passt mit Int4-Quantisierung auf eine einzelne H100-GPU; vortrainiert auf 200 Sprachen
  • Hoher Durchsatz: 17B aktive Parameter erreichen 500+ Tokens/s bei schnellen Anbietern (Groq listet Scout mit 594 TPS)
  • Beschädigtes Benchmark-Vertrauen: Meta reichte eine unveröffentlichte, chat-optimierte Maverick-Variante bei LMArena ein (ELO 1417), was Entwickler als irreführend bezeichneten, da die öffentlichen Gewichte schlechter abschneiden
  • Long-Context-Versprechen brechen in der Praxis zusammen: Scout erreichte ~15.6% bei 128K auf Fiction.LiveBench gegenüber 90.6% bei Gemini 2.5 Pro, und Hosting-Anbieter deckeln Scout weit unter 10M (z. B. ~320K auf DeepInfra)
  • Coding auf r/LocalLlama und HN breit verrissen, unterliegt bei echten Dev-Aufgaben dem ähnlich bepreisten DeepSeek V3
  • Kein Open Source nach OSI: Die Lizenz schließt Unternehmen mit Sitz in der EU aus, verlangt oberhalb von 700M MAU eine Sonderlizenz und schreibt Llama-Branding vor
  • 109B/400B Gesamtparameter sind zu groß für Consumer-GPUs, und die Modellreihe kam ins Stocken: keine Reasoning-Variante erschien, und Behemoth wurde nie veröffentlicht

DeepSeek-V4

  • 1M-Token-Kontextfenster (8x die 128K von V3.2) mit bis zu 384K Output-Tokens, Standard auf der offiziellen API
  • Aggressive Preise: $0.435/$0.87 pro 1M Tokens (V4-Pro), pro Output-Token rund 28.7x günstiger als Claude Opus 4.8; Input mit Cache-Treffer fällt auf $0.003625/1M (über 99% Rabatt)
  • MIT-lizenzierte offene Gewichte für V4-Pro und V4-Flash auf Hugging Face: kommerzielle Nutzung, Fine-Tuning und Weiterverbreitung erlaubt
  • Open-Source-SOTA beim agentischen Coding: 80.6 auf SWE-bench Verified (Konfiguration Think Max), gleichauf mit Gemini 3.1 Pro, dazu Codeforces-Rating 3206 (~Rang 23 gegenüber Menschen)
  • Platz #3 von 93 im Artificial Analysis Intelligence Index (Score 44), deutlich über dem Durchschnitt von 25
  • Der Sparse-Attention-Stack senkt die 1M-Kontext-Inferenz auf 27% der FLOPs von V3.2 und 10% von dessen KV-Cache
  • Zeitweise fehlerhafte Tool-Calls: Funktionsaufrufe landen manchmal als Klartext im Content statt im tool_calls-Feld (GitHub-Issue deepseek-ai #1244)
  • Der Thinking-Modus bricht lange Multi-Turn-Tool-Call-Ketten in Agent-Frameworks mit 400-Fehlern ab (OpenClaw-Issue #72044, Fix noch unvollständig)
  • Entwickler berichten, dass es in eigenen Codebasen nicht existierende APIs erfindet und in Agent-Schleifen auf halluzinierte Nutzereingaben reagiert
  • Sehr wortreich (180M Eval-Output-Tokens gegenüber 95M im Median) und Mittelfeld-Tempo mit 54.6 Tokens/s (#39/93), was den niedrigen Preis pro Token in der Praxis aufzehrt
  • Nur Text (keine Vision, kein Audio) und weiterhin eine Preview: Das für Mitte Juli 2026 geplante offizielle Release bringt Stoßzeiten-Preise, die die gelisteten API-Tarife während der Pekinger Geschäftszeiten verdoppeln

Fällen Sie Ihr Urteil

Eine Empfehlung pro Tool und Gladiator. Sie verändert den Crowd-Score, den alle sehen.

Llama 4 (Scout / Maverick)$0.60/1M out (Maverick, hosted)
50%Crowd-Score · 0
DeepSeek-V4$0.87/1M out
57%Crowd-Score · 3

Das Urteil der Arena zu Llama 4 (Scout / Maverick)

Wählen Sie Llama 4, wenn Sie ein günstiges, schnelles, selbst hostbares multimodales Modell für Chat mit hohem Volumen, Extraktion oder mehrsprachige Workloads außerhalb der EU brauchen; Maverick landet nahe GPT-4o-Qualität zu ungefähr einem Zehntel des Preises. Meiden Sie es für Coding, hartes Reasoning oder echte Million-Token-Abfragen, wo DeepSeek, Qwen 3 und Gemini klar besser abschneiden. Gegenüber Llama 3.3 70B bringt es native Vision und ein längeres Fenster, doch viele Entwickler fanden das ältere dichte Modell oder Qwen bei reiner Textqualität verlässlicher, und der 10M-Kontext ist überwiegend ein Papierwert.

Das Urteil der Arena zu DeepSeek-V4

Wählen Sie DeepSeek-V4, wenn Sie Reasoning und agentisches Coding fast auf Frontier-Niveau zum 3-fach bis knapp 30-fach niedrigeren Preis als Claude Opus oder GPT-5.5 wollen, oder wenn Ihnen MIT-lizenzierte Gewichte für Self-Hosting und Fine-Tuning wichtig sind. Es ist ein entschiedenes Upgrade gegenüber V3.2: 8x längerer Kontext, deutlich günstigere Long-Context-Inferenz und stärkeres Coding, und die alten deepseek-chat/reasoner-Endpunkte werden ohnehin am 24. Juli 2026 abgeschaltet. Meiden Sie es für Produktions-Agents, die auf absolut zuverlässiges Multi-Turn-Tool-Calling angewiesen sind, wo Nutzer weiterhin fehlerhafte Tool-Calls und erfundene APIs melden, sowie für jede Vision- oder Audio-Arbeit, da es reiner Text ist. Latenzsensible Apps sollten zuerst testen, denn seine Wortfülle und das Mittelfeld-Tempo von 54.6 Tokens/s fressen einen Teil des Kostenvorteils auf, und kalkulieren Sie die Verdopplung der Preise zu Stoßzeiten ein, die mit dem offiziellen Release Mitte Juli kommt.

Was die Menge sagt

Zu Llama 4 (Scout / Maverick)

Noch keine Urteile. Ergreifen Sie als Erster das Wort.

Zu DeepSeek-V4

Daumen Runtericus

Tool calling is flaky. Function calls sometimes land as plain text instead of the tool_calls field, and thinking mode 400s on long multi-turn chains. Not agent-ready yet.

Der Faire Richter

MIT license on both Pro and Flash weights is the real story. Fine-tune, redistribute, ship commercially, no lawyer needed. Plus 384K output tokens for long-doc generation.

Sir Shipt-Viel

MIT weights, 1M context, and output tokens roughly 29x cheaper than Opus 4.8. Cache hits make input basically free. Moved my bulk pipelines over and the bill collapsed.

Häufige Fragen

Ist Llama 4 (Scout / Maverick) besser als DeepSeek-V4?

Die Menge steht aktuell hinter DeepSeek-V4: 57% empfehlen es, gegenüber 50% für Llama 4 (Scout / Maverick) (3 Stimmen). Bei Reasoning schneidet DeepSeek-V4 besser ab (4.5/5 vs 2.5/5). Die richtige Wahl hängt von Ihrem Einsatzzweck ab. Der Vergleich Zeile für Zeile auf dieser Seite schlüsselt Preise, Kerndaten und Arena-Bewertungen auf.

Was ist günstiger, Llama 4 (Scout / Maverick) oder DeepSeek-V4?

Der Einstieg kostet dasselbe: Beide starten bei $0.60/1M out (Maverick, hosted).

Was kosten Llama 4 (Scout / Maverick) und DeepSeek-V4 pro 1M Tokens?

Llama 4 (Scout / Maverick): $0.15/1M in (Maverick, hosted) pro 1M Input-Tokens, $0.60/1M out (Maverick, hosted) pro 1M Output-Tokens. DeepSeek-V4: $0.435/1M in (cache hit $0.003625) pro 1M Input-Tokens, $0.87/1M out pro 1M Output-Tokens.