Birebir düello

Mistral Large 3 logosuvsClaude Sonnet 5 logosu

Mistral Large 3 vs Claude Sonnet 5: 2026'da hangi yapay zeka modeli kazanıyor?

Mistral Large 3 ($1.50/1M out) ve Claude Sonnet 5 ($15/1M out ($10 intro until 2026-08-31)), 2026'nın en çok kullanılan yapay zeka modelleri arasında. 3 topluluk oyunda Claude Sonnet 5, %57 onayla önde.

Hızlı hüküm

Akıl yürütme tarafında Claude Sonnet 5 seçin: arena onu Mistral Large 3 için 3/5 puana karşı 4.5/5 olarak değerlendiriyor. Bütçe tarafında Mistral Large 3 kazanıyor: Claude Sonnet 5 için $15/1M out ($10 intro until 2026-08-31) yerine $1.50/1M out seviyesinden başlıyor.

Satır satır karşılaştırma

Başlangıç
$1.50/1M outLa Plateforme'da tek API katmanı (1M token başına $0.50 girdi / $1.50 çıktı), batch API ile %50 indirim; Apache 2.0 ağırlıklar ücretsiz kendi sunucusunda barındırmaya izin veriyor, üçüncü taraf barındırma fiyatları farklı olabilir.
$15/1M out ($10 intro until 2026-08-31)Tek katman: standart 1M token başına $3/$15, 31 Ağustos 2026'ya kadar tanıtım fiyatı $2/$10; Batch API -%50; yeni tokenizer metin başına yaklaşık %30 daha fazla token üretiyor (Anthropic'e göre 1.0-1.35x), efektif maliyeti artırıyor.
Sağlayıcı
Mistral AI
Anthropic
Bağlam penceresi
256K tokens
1M tokens (128K max output)
Girdi fiyatı
$0.50/1M in
$3/1M in ($2 intro until 2026-08-31)
Çıktı fiyatı
$1.50/1M out
$15/1M out ($10 intro until 2026-08-31)
Modaliteler
text, vision (image input), text output
text, vision (image input, text output)
Open weights
Evet
Hayır
Kalabalık puanı
50%(0)
57%(3)
Arena puanları (1-5)
Akıl yürütme
3.0
4.5
Kodlama
3.0
4.5
Yazarlık
4.0
4.5
Hız
3.5
4.0
Fiyat/performans
4.0
4.5

Güçlü ve zayıf yönler

Mistral Large 3

  • Toplam 675B parametreye rağmen FP8/NVFP4 nicemlemeyle tek düğümde dağıtılabilen Apache 2.0 open weights
  • Open weights modeller için üst sınırda 256K bağlam penceresi, uzun belge RAG'ine çok uygun
  • 1M token başına $0.50 girdi / $1.50 çıktı ile agresif amiral gemisi fiyatı, Batılı tescilli amiral gemilerinden kabaca 3-4 kat ucuz
  • LMArena'da akıl yürütmesiz açık kaynak modeller arasında 2. sıradan giriş yaptı (Elo ~1418)
  • Yerleşik çok modluluk (2.5B parametreli görü kodlayıcı) ve 40'tan fazla yerleşik dil
  • HN'deki geliştiriciler katı biçimlendirmesini, talimat takibini ve üretim güvenilirliğini övüyor
  • Zayıf derin akıl yürütme: GPQA Diamond ~%44, DeepSeek V3.2 ve Kimi K2 Thinking'in 70'lerin üst yarısındaki skorlarına karşı; çıkışta reasoning varyantı yok
  • Modern kodlama benchmark'larında GLM-4.6, Kimi K2 ve DeepSeek'in gerisinde (vasat LiveCodeBench v6); HN geliştiricileri onu Gemini 3, GPT-5.1 ve Claude Opus 4.5'in 'farklı bir sıklet sınıfı' altına yerleştiriyor
  • Olgusal soru-cevapta halüsinasyona eğilimli (SimpleQA ~%24), cevap vermekten kaçınma ayarı zayıf
  • Artificial Analysis'te ölçülen çıktı hızı ~49 token/sn, benzer modellerin ~58 token/sn medyanının altında
  • HN'de mimarinin DeepSeek V3'ü yakından kopyaladığı eleştirisi, özgün Ar-Ge konusunda şüphe uyandırıyor

Claude Sonnet 5

  • Sonnet 4.6'ya göre büyük ajan kazanımları: Terminal-Bench 2.1'de 80.4% vs 67.0%, OSWorld-Verified'da 81.2% vs 78.5%, SWE-bench Pro'da 63.2% vs 58.1%
  • Bilgi işinde Opus 4.8 ile başa baş (GDPval-AA v2: 1,618 vs 1,615) ve araçlı Humanity's Last Exam'de neredeyse eşit (57.4% vs 57.9%), Opus 4.8 fiyatının %60'ına (tanıtım döneminde %40'ına)
  • 1M token bağlam penceresi ve 128K maks. çıktı; 31 Ağustos 2026'ya kadar 1M token başına $2/$10 tanıtım fiyatı
  • Kalıcı, kendini doğrulayan ajan davranışı: saha incelemeleri, Sonnet 4.6'nın aksine kendi kodunu test ettiğini ve zor problemlerde çözene kadar yinelediğini not ediyor
  • xhigh effort seviyesine ve yüksek çözünürlüklü görüye (2576px görseller) sahip ilk Sonnet; uyarlanabilir düşünme varsayılan olarak etkin
  • Sonnet 4.6'dan daha yüksek kod incelemesi isabeti (38-40% vs 29%), daha az yanlış pozitif bulgu üretiyor
  • Yeni tokenizer, aynı metin için token sayısını yaklaşık %30 şişiriyor (Anthropic'e göre 1.0-1.35x; Simon Willison'ın ölçümüyle İngilizcede ~1.4x, Python'da ~1.28x); etiket fiyatı değişmese de efektif maliyet artıyor
  • Uzun yazıyor ve token yiyor: bağımsız testlerde görev başına ~$2.29, Sonnet 4.6'da ~$1.20 (maliyet verimliliğinde 161 model içinde 101. sıra); yüksek effort'ta görev başına maliyet Opus 4.8'i aşabiliyor
  • Küçük rutin düzenlemelerde Sonnet 4.6'dan ölçülebilir şekilde daha yavaş ve basit görevleri aşırı mühendisliğe boğmaya eğilimli (CodeRabbit saha incelemesi)
  • Örnekleme parametreleri (temperature, top_p, top_k) kaldırıldı; varsayılan dışı değerler 400 hatası döndürüyor ve mevcut hatları bozuyor
  • HN/Reddit'teki çıkış tepkileri karışıktı: '5' etiketi abartılı bulundu, daha katı siber güvenlik korumaları zararsız güvenlik yakını işleri reddedebiliyor

Hükmünüzü verin

Gladyatör başına, araç başına bir tavsiye. Herkesin gördüğü kalabalık puanını yeniden şekillendirir.

Mistral Large 3$1.50/1M out
50%kalabalık puanı · 0
Claude Sonnet 5$15/1M out ($10 intro until 2026-08-31)
57%kalabalık puanı · 3

Arenanın Mistral Large 3 hakkındaki hükmü

Çok dilli RAG, uzun belge işleri veya kendi sunucunuzda barındırılan dağıtımlar için open weights, AB yönetişimli bir amiral gemisi istiyorsanız Mistral Large 3'ü seçin: Mistral Large 2'ye göre (yoğun 123B, kısıtlayıcı araştırma lisansı, $2/$6 API fiyatı) bağlam, çok modluluk, lisans ve maliyette net bir yükseltme. Birincil kodlama veya derin akıl yürütme motorunuz olarak kullanmaktan kaçının; DeepSeek V3.2, GLM-4.6 veya tescilli sınır modeller orada belirgin biçimde daha yüksek puan alıyor. Onu bir sınır performansçısı değil, ucuz ve güvenilir bir yük beygiri olarak görün.

Arenanın Claude Sonnet 5 hakkındaki hükmü

Kodlama, terminal veya bilgisayar kullanımı ajanları çalıştırıyor ve Sonnet fiyatına Opus 4.8'e yakın kalite istiyorsanız Sonnet 5'i seçin, özellikle $2/$10 tanıtım döneminde; düşük ve orta effort'ta Sonnet 4.6'ya göre kesin bir yükseltme. Yeni tokenizer'a ve uzun yazma eğilimine bütçe ayırın: görev başına gerçek maliyetler Sonnet 4.6'nın epey üzerinde ve en yüksek effort seviyelerinde çözülen görev başına Opus 4.8 daha iyi bir anlaşma olabilir. Gecikmeye duyarlı küçük düzenlemeler ya da artık hata veren temperature ve top_p'ye bağımlı hatlar için uzak durun. Yüksek hacimli, küçük diff'li iş yükleri için pragmatik seçim hala Sonnet 4.6.

Kalabalık ne diyor

Mistral Large 3 hakkında

Henüz hüküm yok. İlk konuşan siz olun.

Claude Sonnet 5 hakkında

Kaptan Churn

Cheap per token, pricey per task. Independent tests had it near $2.29 a task vs $1.20 on 4.6, and at high effort it can out-cost Opus 4.8. It will not stop talking.

Altın Başparmakus

Terminal-Bench going 67 to 80 over Sonnet 4.6 matches what I see. My CI-fix agent went from constant babysitting to mostly hands-off overnight.

Aziz Deployus

Matches Opus 4.8 on knowledge work at 60% of the price, and the intro $2/$10 window makes it silly value. My research agent runs on Sonnet 5 now, zero regrets.

Sık sorulan sorular

Mistral Large 3, Claude Sonnet 5 aracından daha mı iyi?

Kalabalık şu anda Claude Sonnet 5 tarafında: %57 tavsiye ediyor, Mistral Large 3 için bu oran %50 (3 oy). Akıl yürütme tarafında Claude Sonnet 5 daha yüksek puan alıyor (4.5/5 vs 3/5). Doğru seçim kullanım amacınıza bağlı. Bu sayfadaki satır satır karşılaştırma; fiyatlandırmayı, temel özellikleri ve arena puanlarını ayrıntılarıyla ele alıyor.

Hangisi daha ucuz, Mistral Large 3 mı Claude Sonnet 5 mi?

Mistral Large 3 daha ucuz: $1.50/1M out seviyesinden başlıyor, Claude Sonnet 5 ise $15/1M out ($10 intro until 2026-08-31) seviyesinden başlıyor.

Mistral Large 3 ve Claude Sonnet 5 1M token başına ne kadar tutuyor?

Mistral Large 3: 1M girdi tokeni başına $0.50/1M in, 1M çıktı tokeni başına $1.50/1M out. Claude Sonnet 5: 1M girdi tokeni başına $3/1M in ($2 intro until 2026-08-31), 1M çıktı tokeni başına $15/1M out ($10 intro until 2026-08-31).