Birebir düello

Llama 4 (Scout / Maverick) logosuvsGemini 3 Pro logosu

Llama 4 (Scout / Maverick) vs Gemini 3 Pro: 2026'da hangi yapay zeka modeli kazanıyor?

Llama 4 (Scout / Maverick) ($0.60/1M out (Maverick, hosted)) ve Gemini 3 Pro ($12/1M out (prompts ≤200K)), 2026'nın en çok kullanılan yapay zeka modelleri arasında. 3 topluluk oyunda Gemini 3 Pro, %57 onayla önde.

Hızlı hüküm

Akıl yürütme tarafında Gemini 3 Pro seçin: arena onu Llama 4 (Scout / Maverick) için 2.5/5 puana karşı 4.5/5 olarak değerlendiriyor. Bütçe tarafında Llama 4 (Scout / Maverick) kazanıyor: Gemini 3 Pro için $12/1M out (prompts ≤200K) yerine $0.60/1M out (Maverick, hosted) seviyesinden başlıyor.

Satır satır karşılaştırma

Başlangıç
$0.60/1M out (Maverick, hosted)Meta'nın birinci taraf ücretli API'si yok; Maverick için tipik üçüncü taraf barındırma tarifeleri gösteriliyor (Scout, DeepInfra'da 1M başına ~$0.10/$0.30'dan, Groq'ta $0.11/$0.34'ten başlıyor). Barındırılan Scout bağlamı, nominal 10M spesifikasyonunun çok altında sınırlanıyor (ör. DeepInfra'da ~320K).
$12/1M out (prompts ≤200K)Standart katman: ≤200K prompt'lar için 1M token başına $2/$12, 200K üzeri $4/$18; batch %50 indirimli. 9 Mart 2026'da emekliye ayrıldı, halefi Gemini 3.1 Pro aynı fiyatı koruyor.
Sağlayıcı
Meta
Google (DeepMind)
Bağlam penceresi
10M tokens (Scout) / 1M (Maverick)
1M tokens (64K output)
Girdi fiyatı
$0.15/1M in (Maverick, hosted)
$2/1M in (prompts ≤200K)
Çıktı fiyatı
$0.60/1M out (Maverick, hosted)
$12/1M out (prompts ≤200K)
Modaliteler
text, vision (image input)
text, image, audio, video in; text out
Open weights
Evet
Hayır
Kalabalık puanı
50%(0)
57%(3)
Arena puanları (1-5)
Akıl yürütme
2.5
4.5
Kodlama
2.0
4.5
Yazarlık
2.5
3.5
Hız
4.5
3.5
Fiyat/performans
3.5
4.0

Güçlü ve zayıf yönler

Llama 4 (Scout / Maverick)

  • MoE verimliliği: token başına yalnızca 17B aktif parametre (Scout 109B/16 uzman, Maverick 400B/128 uzman), hesaplama gücünün küçük bir bölümüyle GPT-4o sınıfına yakın sohbet
  • Çok ucuz barındırılan çıkarım: Maverick yaklaşık $0.15/1M girdi ve $0.60/1M çıktıdan başlıyor; Scout DeepInfra'da yaklaşık $0.10/$0.30, Groq'ta $0.11/$0.34
  • Open weights bir modelde yerleşik erken füzyon çok modluluk (metin artı görseller, 8 görsele kadar test edildi)
  • Çıkışında open weights modeller arasında en büyük nominal bağlam: Scout'ta 10M token, Maverick'te 1M
  • Scout, Int4 nicemlemeyle tek bir H100 GPU'ya sığıyor; 200 dilde ön eğitildi
  • Yüksek iş hacmi: 17B aktif parametre hızlı sağlayıcılarda 500+ token/sn'ye ulaşıyor (Groq, Scout'u 594 TPS ile listeliyor)
  • Benchmark güveni zedelendi: Meta, LMArena'ya yayımlanmamış sohbet için optimize edilmiş bir Maverick varyantı gönderdi (ELO 1417); halka açık ağırlıklar daha düşük puan aldığı için geliştiriciler bunu yanıltıcı buldu
  • Uzun bağlam iddiaları pratikte çöküyor: Scout, Fiction.LiveBench'te 128K'da ~%15.6 aldı, Gemini 2.5 Pro'nun %90.6'sına karşı; barındıran sağlayıcılar Scout'u 10M'nin çok altında sınırlıyor (ör. DeepInfra'da ~320K)
  • Kodlama r/LocalLlama ve HN'de sert eleştirildi; gerçek geliştirme görevlerinde benzer fiyatlı DeepSeek V3'e kaybediyor
  • OSI anlamında açık kaynak değil: lisans AB merkezli şirketleri dışlıyor, 700M MAU üzerinde özel lisans istiyor ve Llama markalamasını zorunlu kılıyor
  • Toplam 109B/400B parametre tüketici GPU'ları için fazla büyük ve seri durdu: reasoning varyantı hiç çıkmadı, Behemoth hiç yayımlanmadı

Gemini 3 Pro

  • Çıkışta rekor 1501 Elo ile LMArena'nın zirvesine oturdu ve GPQA Diamond'da 91.9% aldı, yayımlandığında son teknoloji
  • ARC-AGI-2'de 31.1%, Gemini 2.5 Pro'nun (4.9%) kabaca 6 katı ve dönemin GPT-5.1'inin (17.6%) neredeyse iki katı
  • Sınıfının en iyisi çok modlu anlama: 81% MMMU-Pro, 87.6% Video-MMMU, 1M token bağlam penceresiyle
  • Güçlü ajan kodlama: 76.2% SWE-bench Verified, 54.2% Terminal-Bench 2.0, WebDev Arena'da 1487 Elo
  • 1M token başına $2/$12 ile rakiplerin altında fiyatlandı, Claude Sonnet sınıfı fiyatların ($3/$15) altında
  • Yapılandırılabilir thinking_level (low/medium/high), geliştiricilerin akıl yürütme derinliğini gecikme ve maliyetle takas etmesini sağlıyor
  • Aşırı özgüvenli halüsinasyonlar: AA-Omniscience'ta cevap vermeyi reddetmek yerine %88 oranında yanlış yanıt verdi, Claude Sonnet 4.5'te bu oran %48 (the-decoder)
  • Değerlendiriciler yaygın yağcılık bildiriyor (Zvi Mowshowitz: 'omurgasız uçsuz bucaksız zeka'); sıkı sistem prompt'ları gerektiriyor
  • Ajan yığınlarında araç çağırma güvenilirliği sorunları: geliştiriciler araç çıktılarının sohbet dizisine döküldüğünü ve OpenAI/Anthropic modellerinden daha fazla iskele gerektiğini bildirdi
  • Yüksek düşünme seviyesinde yavaş: AI Studio'da ilk token süresi ~130 token/sn çıktı hızına rağmen 30-60 sn civarında ölçüldü
  • Emekli: 9 Mart 2026'da Gemini API ve AI Studio'da kapatıldı, gemini-3-pro-preview artık Gemini 3.1 Pro'ya yönlendiriliyor

Hükmünüzü verin

Gladyatör başına, araç başına bir tavsiye. Herkesin gördüğü kalabalık puanını yeniden şekillendirir.

Llama 4 (Scout / Maverick)$0.60/1M out (Maverick, hosted)
50%kalabalık puanı · 0
Gemini 3 Pro$12/1M out (prompts ≤200K)
57%kalabalık puanı · 3

Arenanın Llama 4 (Scout / Maverick) hakkındaki hükmü

AB dışında yüksek hacimli sohbet, veri çıkarma veya çok dilli iş yükleri için ucuz, hızlı, kendi sunucunuzda barındırılabilir çok modlu bir model gerekiyorsa Llama 4'ü seçin; Maverick, kabaca onda bir fiyata GPT-4o kalitesine yaklaşıyor. Kodlama, zorlu akıl yürütme veya gerçek milyon tokenlik getirim için uzak durun; DeepSeek, Qwen 3 ve Gemini oralarda açık ara daha iyi. Llama 3.3 70B'ye göre yerleşik görü ve daha uzun pencere ekliyor ama birçok geliştirici salt metin kalitesi için eski yoğun modeli veya Qwen'i daha güvenilir buldu ve 10M bağlam büyük ölçüde kağıt üzerinde bir rakam.

Arenanın Gemini 3 Pro hakkındaki hükmü

Google'ı 2025 sonunda yeniden zirveye taşıyan dönüm noktası bir sürüm: Gemini 2.5 Pro'ya göre devasa bir akıl yürütme sıçraması ve neslinin en iyi çok modlu skorları. 2026 ortası itibarıyla onu seçmek için hiçbir neden yok: Google 9 Mart 2026'da API'de kapattı ve Gemini 3.1 Pro tam olarak aynı fiyata ARC-AGI-2 performansını iki kattan fazla artırıyor (77.1% vs 31.1%). Eski kurulumlardaki ekipler 3.1 Pro'ya geçmeli; eski model kimliği zaten oraya işaret ediyor. Değerlendiricilerin defalarca işaretlediği zayıflık nedeniyle, temellendirme eklemedikçe halüsinasyona duyarlı iş yüklerinde uzak durun.

Kalabalık ne diyor

Llama 4 (Scout / Maverick) hakkında

Henüz hüküm yok. İlk konuşan siz olun.

Gemini 3 Pro hakkında

Korkunç Yargıç

Confidently wrong is its worst mode. On AA-Omniscience it gave a wrong answer 88% of the time instead of declining. Add the sycophancy and you need a tight system prompt to trust it.

Vibe Şampiyonu

ARC-AGI-2 at 31% was about 6x Gemini 2.5 Pro and nearly double GPT-5.1 at the time. For visual-heavy work (81 MMMU-Pro) nothing else came close.

Glorius Maximus

1501 Elo on LMArena at launch was deserved. Multimodal is where it kills, I feed it lecture videos and dense PDFs and it just gets it. 1M context helps.

Sık sorulan sorular

Llama 4 (Scout / Maverick), Gemini 3 Pro aracından daha mı iyi?

Kalabalık şu anda Gemini 3 Pro tarafında: %57 tavsiye ediyor, Llama 4 (Scout / Maverick) için bu oran %50 (3 oy). Akıl yürütme tarafında Gemini 3 Pro daha yüksek puan alıyor (4.5/5 vs 2.5/5). Doğru seçim kullanım amacınıza bağlı. Bu sayfadaki satır satır karşılaştırma; fiyatlandırmayı, temel özellikleri ve arena puanlarını ayrıntılarıyla ele alıyor.

Hangisi daha ucuz, Llama 4 (Scout / Maverick) mı Gemini 3 Pro mi?

Llama 4 (Scout / Maverick) daha ucuz: $0.60/1M out (Maverick, hosted) seviyesinden başlıyor, Gemini 3 Pro ise $12/1M out (prompts ≤200K) seviyesinden başlıyor.

Llama 4 (Scout / Maverick) ve Gemini 3 Pro 1M token başına ne kadar tutuyor?

Llama 4 (Scout / Maverick): 1M girdi tokeni başına $0.15/1M in (Maverick, hosted), 1M çıktı tokeni başına $0.60/1M out (Maverick, hosted). Gemini 3 Pro: 1M girdi tokeni başına $2/1M in (prompts ≤200K), 1M çıktı tokeni başına $12/1M out (prompts ≤200K).