Head-to-head
Grok 4.3 vs Claude Fable 5: model AI mana yang menang di 2026?
Grok 4.3 ($2.50/1M out) dan Claude Fable 5 ($50/1M out) adalah dua model AI yang paling banyak dipakai di 2026. Dari 4 suara komunitas, Claude Fable 5 memimpin dengan persetujuan 63%.
Vonis singkat
Soal Penalaran, pilih Claude Fable 5: arena menilainya 5/5 berbanding 4/5 untuk Grok 4.3. Soal budget, Grok 4.3 menang: harganya mulai dari $2.50/1M out berbanding $50/1M out untuk Claude Fable 5.
Perbandingan baris demi baris
Kekuatan dan kelemahan
Grok 4.3
- Harga agresif: $1.25/$2.50 per 1M tokens, input 58% lebih murah dan output 83% lebih murah dari Grok 4, memotong harga GPT-5.5 dan Gemini 3.1 Pro
- Lompatan agentik besar: +321 Elo di GDPval-AA dibanding Grok 4.20, dengan tool calling dan kepatuhan instruksi yang kuat
- Cached input di $0.20/1M (diskon 84%), penghemat besar untuk loop agen yang berulang
- Reasoning effort yang bisa dikonfigurasi (none/low/medium/high) dalam satu model dengan satu harga, tanpa routing antara varian cepat dan dalam
- Dipuji di HN untuk nada natural dan ringkas serta output padat token yang menurunkan biaya riil
- Throughput solid sekitar 130 output tokens/detik (Artificial Analysis)
- Penalaran coding dinilai 'tidak kompetitif dengan rilis besar April' oleh developer HN; batas kecerdasannya nyaris tidak bergerak sejak Grok 4
- Skor non-halusinasi turun 8 poin vs Grok 4.20 di AA-Omniscience; 4.20 tetap pilihan xAI yang lebih aman untuk domain yang menuntut presisi
- Time to first token tinggi (sekitar 13s pada reasoning effort tinggi menurut Artificial Analysis), menyakitkan untuk aplikasi interaktif
- Context window menyusut ke 1M dari 2M milik Grok 4.20
- Keluhan kepercayaan dan keamanan yang berulang (laporan konten berbahaya, perilaku tidak konsisten) dan tanpa dukungan MCP/connected-apps di aplikasi konsumen
Claude Fable 5
- 80.3% di SWE-bench Pro vs 69.2% untuk Opus 4.8, 58.6% untuk GPT-5.5, dan 54.2% untuk Gemini 3.1 Pro, kira-kira 11 poin di depan model frontier berikutnya
- 95.0% di SWE-bench Verified (Opus 4.8: 88.6%, GPT-5.5: 82.6%) dan 29.3% pada split FrontierCode Diamond milik Cognition, lebih dari dua kali lipat 13.4% milik Opus 4.8
- Otonomi jangka panjang adalah cerita sesungguhnya: Stripe melaporkan migrasi codebase Ruby 50 juta baris selesai dalam satu hari alih-alih 2+ bulan, dan CEO Cursor menyebutnya state of the art di CursorBench
- Laporan lapangan sesuai benchmark: engineer HN menggambarkannya bekerja 'seperti engineer sungguhan' (CRDT dengan pendampingan minimal, menulis fuzzer-nya sendiri, satu pengurangan alokasi 46x), Simon Willison mengukur 'pekerjaan senilai beberapa hari' dalam satu sesi
- Context window 1M token secara default plus output 128K, dan vision state-of-the-art pada dokumen padat (29.8% di GDP.pdf vs 24.9% untuk GPT-5.5 dan 22.5% untuk Opus 4.8)
- Permintaan yang ditolak sebelum ada output tidak ditagih, dan fallback sisi server ke Opus 4.8 dengan kredit fallback terpasang di API
- Dua kali harga Opus 4.8 ($10/$50 vs $5/$25) dan lambat: satu permintaan pada tugas sulit rutin memakan waktu bermenit-menit, Simon Willison menyebutnya blak-blakan 'lambat, mahal'
- Classifier keamanan dual-use salah sasaran pada pekerjaan sah: seorang fisikawan medis melaporkan soal dinamika fluida dan kode segmentasi MRI ditolak sebagai risiko biosekuriti, dengan permintaan yang dialihkan diam-diam ke Opus 4.8 (utas HN viral berjudul 'If Claude Fable stops helping you, you'll never know'; Anthropic mengklaim di bawah 5% sesi)
- Peluncuran yang berbatu: kontrol ekspor AS memaksa Anthropic menangguhkan akses di seluruh dunia dari 12 hingga 30 Juni 2026, tiga hari setelah rilis, dengan pemulihan penuh baru pada 1 Juli
- Mewajibkan retensi data 30 hari dan tidak tersedia di bawah zero data retention, penghalang keras bagi organisasi berkepatuhan ketat; juga tanpa mode thinking-off, chain of thought mentah tidak pernah dikembalikan, prefill assistant mengembalikan error 400
- Tidak state of the art di semua hal: GPT-5.5 masih memimpin ARC-AGI-2 (85.0% vs 77.1%), dan Andon Labs menemukan Mythos 5 tanpa blokir berkinerja di bawah Opus 4.7 maupun GPT-5.5 di Vending-Bench, dengan penalaran yang mengoptimalkan keterdeteksian alih-alih bahaya nyata
Jatuhkan vonis Anda
Satu rekomendasi per tool per gladiator. Suara Anda mengubah skor penonton yang dilihat semua orang.
Vonis arena atas Grok 4.3
Pilih Grok 4.3 jika Anda menjalankan pipeline agentik atau bervolume tinggi di mana biaya per panggilan mendominasi: ia memberi penalaran mendekati frontier dan lompatan tool-calling besar dari Grok 4.20 dengan sebagian kecil harga GPT-5.5 atau Gemini 3.1 Pro. Lewati jika presisi coding adalah prioritas Anda, karena developer masih menempatkan Claude dan rilis besar April di depannya. Tetap juga di Grok 4.20 jika Anda butuh context 2M-nya atau skor non-halusinasinya yang lebih baik untuk pekerjaan hukum, medis, atau kepatuhan. Aplikasi yang sensitif latensi sebaiknya menguji dulu time to first token sekitar 13s sebelum berkomitmen.
Vonis arena atas Claude Fable 5
Ambil Claude Fable 5 jika beban kerja Anda benar-benar jangka panjang: sesi agentik semalaman, migrasi raksasa, tugas di mana satu sesi berjam-jam menggantikan berhari-hari kerja tersupervisi. Di sana, premi 2x di atas Opus 4.8 terbayar lewat kompresi tugas, dan benchmark-nya (80.3% SWE-bench Pro, 11 poin di depan yang lain) didukung deployment nyata di Stripe dan Cursor. Untuk coding interaktif dan pekerjaan sehari-hari, tetaplah di Opus 4.8: 88.6% di SWE-bench Verified dengan separuh harga, tanpa salah sasaran classifier, giliran lebih cepat. Tim yang sensitif biaya bisa mendapat coding mendekati Opus dari Sonnet 5 seharga $3/$15 (harga perkenalan $2/$10 hingga Agustus 2026). Hindari Fable 5 sama sekali jika organisasi Anda mewajibkan zero data retention atau jika Anda bekerja di dekat biologi, pencitraan medis, atau tooling keamanan, area di mana classifier dual-use masih menghasilkan false positive dan diam-diam menukar ke Opus 4.8 di tengah sesi.
Kata penonton
Tentang Grok 4.3
Belum ada vonis. Jadilah yang pertama angkat suara.
Tentang Claude Fable 5
“I do medical imaging research and the bio classifier keeps flagging my MRI segmentation prompts, then it silently falls back to Opus 4.8 mid-session. At $50 per million output tokens I expect to at least know which model actually answered me.”
“Yes it's 2x the price of Opus and yes the turns are slow. But one overnight Fable run replaced what used to be a week of supervising shorter runs. On a per-task basis it's actually the cheapest model we use.”
“The 1M context is real, not marketing. I fed it our entire service mesh config plus six months of incident postmortems and it traced a flaky timeout to a retry policy nobody remembered writing. Opus 4.8 never connected those dots.”
“Gave it a monorepo migration that Opus 4.8 kept stalling on. It ran for about 40 minutes, came back with the whole thing done plus a test harness it wrote for itself. Felt like reviewing a senior engineer's PR, not babysitting a chatbot.”
Lanjut membandingkan
Pertanyaan yang sering diajukan
Apakah Grok 4.3 lebih baik daripada Claude Fable 5?
Saat ini penonton berpihak pada Claude Fable 5: 63% merekomendasikannya, berbanding 50% untuk Grok 4.3 (4 suara). Soal Penalaran, Claude Fable 5 dinilai lebih tinggi (5/5 vs 4/5). Pilihan yang tepat tergantung kebutuhan Anda. Perbandingan baris demi baris di halaman ini mengupas harga, spesifikasi utama, dan penilaian arena.
Mana yang lebih murah, Grok 4.3 atau Claude Fable 5?
Grok 4.3 lebih murah: harganya mulai dari $2.50/1M out, sementara Claude Fable 5 mulai dari $50/1M out.
Berapa biaya Grok 4.3 dan Claude Fable 5 per 1M token?
Grok 4.3: $1.25/1M in per 1M token input, $2.50/1M out per 1M token output. Claude Fable 5: $10/1M in per 1M token input, $50/1M out per 1M token output.