Head-to-head

Logo Llama 4 (Scout / Maverick)vsLogo DeepSeek-V4

Llama 4 (Scout / Maverick) vs DeepSeek-V4: model AI mana yang menang di 2026?

Llama 4 (Scout / Maverick) ($0.60/1M out (Maverick, hosted)) dan DeepSeek-V4 ($0.87/1M out) adalah dua model AI yang paling banyak dipakai di 2026. Dari 3 suara komunitas, DeepSeek-V4 memimpin dengan persetujuan 57%.

Vonis singkat

Soal Penalaran, pilih DeepSeek-V4: arena menilainya 4.5/5 berbanding 2.5/5 untuk Llama 4 (Scout / Maverick). Keduanya mulai dari harga yang sama: $0.60/1M out (Maverick, hosted).

Perbandingan baris demi baris

Mulai
$0.60/1M out (Maverick, hosted)Tidak ada API berbayar resmi dari Meta; tarif hosted pihak ketiga yang umum ditampilkan untuk Maverick (Scout mulai sekitar $0.10/$0.30 per 1M di DeepInfra, $0.11/$0.34 di Groq). Context Scout versi hosted dibatasi jauh di bawah spesifikasi nominal 10M (misalnya sekitar 320K di DeepInfra).
$0.87/1M outTingkat V4-Pro: $0.435/1M masuk ($0.003625 cache hit), $0.87/1M keluar; tingkat V4-Flash lebih murah di $0.14/$0.28 ($0.0028 cache hit); diskon peluncuran 75% menjadi harga permanen pada 2026-05-22. Rilis resmi pertengahan Juli 2026 memperkenalkan harga jam sibuk/sepi, dengan tarif tercantum berlipat dua selama jam sibuk Beijing.
Penyedia
Meta
DeepSeek
Context window
10M tokens (Scout) / 1M (Maverick)
1M tokens (384K max output)
Harga input
$0.15/1M in (Maverick, hosted)
$0.435/1M in (cache hit $0.003625)
Harga output
$0.60/1M out (Maverick, hosted)
$0.87/1M out
Modalitas
text, vision (image input)
text only
Open weights
Ya
Ya
Skor penonton
50%(0)
57%(3)
Penilaian arena (1-5)
Penalaran
2.5
4.5
Coding
2.0
4.5
Menulis
2.5
3.5
Kecepatan
4.5
3.0
Nilai
3.5
5.0

Kekuatan dan kelemahan

Llama 4 (Scout / Maverick)

  • Efisiensi MoE: hanya 17B parameter aktif per token (Scout 109B/16 expert, Maverick 400B/128 expert), memberi chat mendekati kelas GPT-4o dengan sebagian kecil compute
  • Inferensi hosted sangat murah: Maverick mulai sekitar $0.15/1M masuk dan $0.60/1M keluar; Scout mulai sekitar $0.10/$0.30 di DeepInfra atau $0.11/$0.34 di Groq
  • Multimodalitas early-fusion natif (teks plus gambar, teruji hingga 8 gambar) dalam model open weights
  • Context nominal terbesar di antara model open weights saat rilis: 10M tokens pada Scout, 1M pada Maverick
  • Scout muat di satu GPU H100 dengan kuantisasi Int4; dilatih awal pada 200 bahasa
  • Throughput tinggi: 17B parameter aktif mencapai 500+ tokens/detik di penyedia cepat (Groq mencantumkan Scout di 594 TPS)
  • Kepercayaan benchmark rusak: Meta mengirimkan varian Maverick teroptimasi chat yang tidak dirilis ke LMArena (ELO 1417), yang disebut developer menyesatkan karena bobot publiknya berskor lebih rendah
  • Klaim long-context runtuh di lapangan: Scout mencetak sekitar 15.6% pada 128K di Fiction.LiveBench vs 90.6% untuk Gemini 2.5 Pro, dan penyedia hosted membatasi Scout jauh di bawah 10M (misalnya sekitar 320K di DeepInfra)
  • Coding banyak dicela di r/LocalLlama dan HN, kalah dari DeepSeek V3 yang berharga serupa pada tugas dev nyata
  • Bukan open source versi OSI: lisensinya mengecualikan perusahaan berdomisili di Uni Eropa, mewajibkan lisensi khusus di atas 700M MAU, dan mengharuskan branding Llama
  • Total parameter 109B/400B terlalu besar untuk GPU konsumen, dan garis keturunannya mandek: tidak ada varian reasoning yang dirilis dan Behemoth tidak pernah diluncurkan

DeepSeek-V4

  • Context window 1M token (8x dari 128K milik V3.2) dengan output hingga 384K tokens, standar di API resmi
  • Harga agresif: $0.435/$0.87 per 1M tokens (V4-Pro), kira-kira 28.7x lebih murah per output token dibanding Claude Opus 4.8; input cache-hit turun ke $0.003625/1M (diskon lebih dari 99%)
  • Bobot terbuka berlisensi MIT untuk V4-Pro maupun V4-Flash di Hugging Face: penggunaan komersial, fine-tuning, dan redistribusi diizinkan
  • SOTA open source untuk coding agentik: 80.6 di SWE-bench Verified (konfigurasi Think Max), seri dengan Gemini 3.1 Pro, plus rating Codeforces 3206 (sekitar peringkat 23 vs manusia)
  • Peringkat #3 dari 93 di Artificial Analysis Intelligence Index (skor 44), jauh di atas rata-rata 25
  • Stack sparse-attention memangkas inferensi context 1M menjadi 27% FLOPs milik V3.2 dan 10% KV cache-nya
  • Tool call cacat yang muncul sesekali: function call kadang dikeluarkan sebagai teks biasa di content alih-alih field tool_calls (GitHub issue deepseek-ai #1244)
  • Mode thinking merusak rantai tool-call multi-giliran yang panjang dengan error 400 di framework agen (OpenClaw issue #72044, perbaikannya belum tuntas)
  • Developer melaporkan ia mengarang API yang tidak ada di codebase kustom dan bertindak atas input pengguna yang dihalusinasikan dalam loop agen
  • Sangat bertele-tele (180M output tokens evaluasi vs median 95M) dan kecepatan menengah di 54.6 tok/s (#39/93), yang menggerus harga per token murahnya di lapangan
  • Hanya teks (tanpa vision atau audio) dan masih preview: rilis resmi yang direncanakan pertengahan Juli 2026 menambah harga jam sibuk yang menggandakan tarif API tercantum selama jam kerja Beijing

Jatuhkan vonis Anda

Satu rekomendasi per tool per gladiator. Suara Anda mengubah skor penonton yang dilihat semua orang.

Llama 4 (Scout / Maverick)$0.60/1M out (Maverick, hosted)
50%skor penonton · 0
DeepSeek-V4$0.87/1M out
57%skor penonton · 3

Vonis arena atas Llama 4 (Scout / Maverick)

Pilih Llama 4 jika Anda butuh model multimodal murah, cepat, dan bisa di-self-host untuk chat bervolume tinggi, ekstraksi, atau beban kerja multibahasa di luar Uni Eropa; Maverick mendarat mendekati kualitas GPT-4o dengan kira-kira sepersepuluh harganya. Hindari untuk coding, penalaran berat, atau retrieval sejuta token sungguhan, area di mana DeepSeek, Qwen 3, dan Gemini jelas mengunggulinya. Dibanding Llama 3.3 70B ia menambah vision natif dan window lebih panjang, tetapi banyak developer merasa model dense lama itu atau Qwen lebih andal untuk kualitas teks murni, dan context 10M sebagian besar hanyalah angka di atas kertas.

Vonis arena atas DeepSeek-V4

Pilih DeepSeek-V4 jika Anda menginginkan penalaran dan coding agentik mendekati frontier dengan harga 3x hingga hampir 30x di bawah Claude Opus atau GPT-5.5, atau jika bobot berlisensi MIT untuk self-hosting dan fine-tuning penting bagi Anda. Ini upgrade telak dari V3.2: context 8x lebih panjang, inferensi long-context jauh lebih murah, dan coding lebih kuat, apalagi endpoint legacy deepseek-chat/reasoner toh dideprekasi pada 24 Juli 2026. Hindari untuk agen produksi yang bergantung pada tool calling multi-giliran yang benar-benar solid, di mana pengguna masih melaporkan tool call cacat dan API karangan, dan untuk pekerjaan vision atau audio apa pun karena ia hanya teks. Aplikasi yang sensitif latensi juga sebaiknya menguji dulu, karena sifat bertele-tele dan kecepatan output menengah 54.6 tok/s menggerus sebagian keunggulan biayanya, dan anggarkan penggandaan harga jam sibuk yang datang bersama rilis resmi pertengahan Juli.

Kata penonton

Tentang Llama 4 (Scout / Maverick)

Belum ada vonis. Jadilah yang pertama angkat suara.

Tentang DeepSeek-V4

Jempol Bawahicus

Tool calling is flaky. Function calls sometimes land as plain text instead of the tool_calls field, and thinking mode 400s on long multi-turn chains. Not agent-ready yet.

Sang Penilai Adil

MIT license on both Pro and Flash weights is the real story. Fine-tune, redistribute, ship commercially, no lawyer needed. Plus 384K output tokens for long-doc generation.

Tuan Rilis Melulu

MIT weights, 1M context, and output tokens roughly 29x cheaper than Opus 4.8. Cache hits make input basically free. Moved my bulk pipelines over and the bill collapsed.

Pertanyaan yang sering diajukan

Apakah Llama 4 (Scout / Maverick) lebih baik daripada DeepSeek-V4?

Saat ini penonton berpihak pada DeepSeek-V4: 57% merekomendasikannya, berbanding 50% untuk Llama 4 (Scout / Maverick) (3 suara). Soal Penalaran, DeepSeek-V4 dinilai lebih tinggi (4.5/5 vs 2.5/5). Pilihan yang tepat tergantung kebutuhan Anda. Perbandingan baris demi baris di halaman ini mengupas harga, spesifikasi utama, dan penilaian arena.

Mana yang lebih murah, Llama 4 (Scout / Maverick) atau DeepSeek-V4?

Harga awalnya sama: keduanya mulai dari $0.60/1M out (Maverick, hosted).

Berapa biaya Llama 4 (Scout / Maverick) dan DeepSeek-V4 per 1M token?

Llama 4 (Scout / Maverick): $0.15/1M in (Maverick, hosted) per 1M token input, $0.60/1M out (Maverick, hosted) per 1M token output. DeepSeek-V4: $0.435/1M in (cache hit $0.003625) per 1M token input, $0.87/1M out per 1M token output.