Arena ยท Review model AI
Llama 4 (Scout / Maverick)
oleh Meta
Duo MoE open weights dari Meta: 17B parameter aktif, input gambar natif, context 10M token di atas kertas
$0.60/1M out (Maverick, hosted)
Tidak ada API berbayar resmi dari Meta; tarif hosted pihak ketiga yang umum ditampilkan untuk Maverick (Scout mulai sekitar $0.10/$0.30 per 1M di DeepInfra, $0.11/$0.34 di Groq). Context Scout versi hosted dibatasi jauh di bawah spesifikasi nominal 10M (misalnya sekitar 320K di DeepInfra).
Meta
10M tokens (Scout) / 1M (Maverick)
$0.15/1M in (Maverick, hosted)
$0.60/1M out (Maverick, hosted)
text, vision (image input)
Ya
Apa itu Llama 4 (Scout / Maverick)?
Model open weights mixture-of-experts multimodal natif pertama dari Meta, dirilis 5 April 2025. Scout (total 109B parameter, 16 expert) menyasar deployment satu GPU dengan context nominal 10M token; Maverick (total 400B, 128 expert) adalah model chat unggulan dengan window 1M token.
Kelebihan & kekurangan Llama 4 (Scout / Maverick)
Kelebihan
- Efisiensi MoE: hanya 17B parameter aktif per token (Scout 109B/16 expert, Maverick 400B/128 expert), memberi chat mendekati kelas GPT-4o dengan sebagian kecil compute
- Inferensi hosted sangat murah: Maverick mulai sekitar $0.15/1M masuk dan $0.60/1M keluar; Scout mulai sekitar $0.10/$0.30 di DeepInfra atau $0.11/$0.34 di Groq
- Multimodalitas early-fusion natif (teks plus gambar, teruji hingga 8 gambar) dalam model open weights
- Context nominal terbesar di antara model open weights saat rilis: 10M tokens pada Scout, 1M pada Maverick
- Scout muat di satu GPU H100 dengan kuantisasi Int4; dilatih awal pada 200 bahasa
- Throughput tinggi: 17B parameter aktif mencapai 500+ tokens/detik di penyedia cepat (Groq mencantumkan Scout di 594 TPS)
Kekurangan
- Kepercayaan benchmark rusak: Meta mengirimkan varian Maverick teroptimasi chat yang tidak dirilis ke LMArena (ELO 1417), yang disebut developer menyesatkan karena bobot publiknya berskor lebih rendah
- Klaim long-context runtuh di lapangan: Scout mencetak sekitar 15.6% pada 128K di Fiction.LiveBench vs 90.6% untuk Gemini 2.5 Pro, dan penyedia hosted membatasi Scout jauh di bawah 10M (misalnya sekitar 320K di DeepInfra)
- Coding banyak dicela di r/LocalLlama dan HN, kalah dari DeepSeek V3 yang berharga serupa pada tugas dev nyata
- Bukan open source versi OSI: lisensinya mengecualikan perusahaan berdomisili di Uni Eropa, mewajibkan lisensi khusus di atas 700M MAU, dan mengharuskan branding Llama
- Total parameter 109B/400B terlalu besar untuk GPU konsumen, dan garis keturunannya mandek: tidak ada varian reasoning yang dirilis dan Behemoth tidak pernah diluncurkan
Vonis arena
Pilih Llama 4 jika Anda butuh model multimodal murah, cepat, dan bisa di-self-host untuk chat bervolume tinggi, ekstraksi, atau beban kerja multibahasa di luar Uni Eropa; Maverick mendarat mendekati kualitas GPT-4o dengan kira-kira sepersepuluh harganya. Hindari untuk coding, penalaran berat, atau retrieval sejuta token sungguhan, area di mana DeepSeek, Qwen 3, dan Gemini jelas mengunggulinya. Dibanding Llama 3.3 70B ia menambah vision natif dan window lebih panjang, tetapi banyak developer merasa model dense lama itu atau Qwen lebih andal untuk kualitas teks murni, dan context 10M sebagian besar hanyalah angka di atas kertas.
Jempol ke atas atau ke bawah
Jatuhkan vonis Anda
Apakah Anda akan merekomendasikan Llama 4 (Scout / Maverick), atau memperingatkan penonton agar menjauh?
Alternatif Llama 4 (Scout / Maverick) terbaik
Semua alternatifModel tercepat Anthropic: sekitar 90% kemampuan coding Sonnet 4.5 seharga $1/$5 per 1M tokens, context 200K.
Flagship kelas Mythos dari Anthropic edisi Juni 2026: 80.3% di SWE-bench Pro, unggul 11 poin dari semua model frontier lainnya
Opus Anthropic edisi April 2026: 87.6% SWE-bench Verified, context 1M, vision resolusi tinggi, kini tertinggal dari Opus 4.8
Bandingkan Llama 4 (Scout / Maverick) head-to-head
Llama 4 (Scout / Maverick): pertanyaan yang sering diajukan
Berapa biaya Llama 4 (Scout / Maverick) per 1M token?
Llama 4 (Scout / Maverick) berbiaya $0.15/1M in (Maverick, hosted) per 1M token input dan $0.60/1M out (Maverick, hosted) per 1M token output. Tidak ada API berbayar resmi dari Meta; tarif hosted pihak ketiga yang umum ditampilkan untuk Maverick (Scout mulai sekitar $0.10/$0.30 per 1M di DeepInfra, $0.11/$0.34 di Groq). Context Scout versi hosted dibatasi jauh di bawah spesifikasi nominal 10M (misalnya sekitar 320K di DeepInfra).