Frente a frente

Logo de Kimi K3vsLogo de Claude Opus 5

Kimi K3 vs Claude Opus 5: qual modelo de IA vence em 2026?

Kimi K3 ($15/1M out) e Claude Opus 5 ($25/1M out) estão entre os modelos de IA mais usados de 2026. Em 7 votos da comunidade, Claude Opus 5 lidera com 63% de aprovação.

Veredicto rápido

Em Raciocínio, escolha Claude Opus 5: a arena o avalia em 5/5 contra 4.5/5 de Kimi K3. No orçamento, Kimi K3 vence: começa em $15/1M out contra $25/1M out de Claude Opus 5.

Comparação linha por linha

A partir de
$15/1M outPreço oficial de tabela da API da Moonshot para kimi-k3: $3 por milhão de tokens de entrada (erro de cache), $0,30 por milhão em caso de acerto de cache, $15 por milhão de saída incluindo o rastro de raciocínio, preço fixo em toda a janela de 1M de tokens (sem níveis por tamanho). Mesmo preço de $3/$15 na OpenRouter (o preço de cache não é exibido lá). Um aumento de 3 vezes em relação aos $0,95/$4 do Kimi K2.6. Verificado em platform.kimi.ai/docs/pricing/chat-k3, em julho de 2026.
$25/1M outPreço oficial de tabela da API da Anthropic para claude-opus-5: $5 por milhão de tokens de entrada, $25 por milhão de saída, sem mudança em relação à Opus 4.8, um único nível com contexto de 1M de tokens tanto por padrão quanto no máximo, 128K tokens de saída máxima, cache de prompts a partir de 512 tokens. O modo rápido em pré-visualização de pesquisa, a $10/$50 (cerca de 2,5 vezes mais rápido), está disponível apenas na API da Claude. Verificado em platform.claude.com (What's new in Opus 5) em julho de 2026.
Provedor
Moonshot AI
Anthropic
Janela de contexto
1M tokens
1M tokens
Preço de entrada
$3/1M in
$5/1M in
Preço de saída
$15/1M out
$25/1M out
Modalidades
text, vision, video input
text, vision
Open weights
Não
Não
Pontuação da multidão
57%(3)
63%(4)
Notas da arena (1-5)
Raciocínio
4.5
5.0
Programação
4.5
5.0
Escrita
4.0
4.0
Velocidade
2.0
2.0
Custo-benefício
3.5
4.0

Pontos fortes e fracos

Kimi K3

  • 3º lugar no Artificial Analysis Intelligence Index (57) no lançamento, comparável à Claude Opus 4.8 e ao GPT-5.5: o laboratório chinês que mais se aproximou da fronteira fechada dos Estados Unidos
  • 93,4% no SWE-bench Verified no ambiente de teste independente da Vals AI (GPT-5.6 Sol: 96,2%, Claude Fable 5: 95,0%) e 1º lugar no Frontend Code Arena da Arena.ai, com 1679 pontos, à frente da Fable 5
  • 93,5% no GPQA Diamond (entre os 92,6% da Fable 5 e os 94,1% do GPT-5.6), 96,1% no AIME 2025, e Elo de 1668 no trabalho agêntico do GDPval-AA v2, atrás apenas da Fable 5
  • Perfil agêntico forte: 1º lugar nos fluxos de trabalho SaaS do AutomationBench-AA (53%), navegação autônoma de longo horizonte em terminal e repositório via Kimi Code, e cerca de 21% menos tokens de saída que o K2 para mais inteligência
  • $3/$15 por milhão de tokens (a entrada cai para $0,30 em caso de acerto de cache), preço fixo em toda a janela de 1M de tokens: ainda bem abaixo dos preços da fronteira fechada dos Estados Unidos, com API compatível com a OpenAI e disponibilidade na OpenRouter
  • Entrada multimodal nativa (texto, imagem, vídeo) e pesos abertos anunciados para 27/07/2026 sob uma licença esperada do tipo Modified-MIT, posicionando-o como o primeiro modelo de fronteira de pesos abertos da classe de 3 trilhões de parâmetros
  • Um salto de preço de 3 vezes em relação ao Kimi K2.6 ($0,95/$4 para $3/$15), tornando-o o modelo chinês mais caro já lançado, no preço de tabela do Claude Sonnet 5: a era do “10 vezes mais barato que os modelos americanos” acabou (alta documentada por Simon Willison)
  • Lento: 33 tokens de saída por segundo, na 145ª posição entre 190 modelos no Artificial Analysis, pouco adequado para uso interativo
  • A taxa de alucinação subiu de 39% (K2.6) para 51% no AA-Omniscience, já que o modelo agora tenta responder onde antes recusaria (a Fable 5 fica em um nível comparável de 54,9%)
  • Censura política em temas sensíveis em mandarim (evita responder sobre Xi, o PCC, Tiananmen) e jurisdição de Pequim para os dados da API, um obstáculo de conformidade para muitas implantações corporativas e da UE; o UK AISI/CAISI também constatou que suas salvaguardas de cibersegurança falharam em bloquear tentativas de desenvolvimento de exploits durante os testes
  • “Pesos abertos” que por ora são teóricos para a maioria: cerca de 594 GB em MXFP4 nativo, exigindo um datacenter multi-GPU para hospedagem própria, e os pesos (além da licença final) ainda não haviam sido publicados no momento desta análise

Claude Opus 5

  • Classificado em 1º lugar em inteligência composta entre 190 modelos no Artificial Analysis no lançamento, com 43,3% no Frontier-Bench v0.1 contra 34,4% do GPT-5.6 Sol e 33,7% da Claude Fable 5
  • 3,9 vezes melhor que o GPT-5.6 Sol em raciocínio inédito no ARC-AGI-3 (30,2% contra 7,8%), e Elo de 1861 no trabalho de conhecimento econômico do GDPval-AA v2, à frente da Fable 5 (1747)
  • 79,2% no SWE-bench Pro, a apenas um ponto da Fable 5 (80,0%) e 10 pontos acima da Opus 4.8 (69,2%), pela metade do preço da Fable 5; segundo o cofundador da Cursor, oferece “inteligência próxima da Fable 5, na velocidade e no custo da Opus”
  • O mesmo preço de $5/$25 da Opus 4.8, com uma janela maior: o contexto de 1M de tokens passa a ser o único nível padrão, com 128K tokens de saída máxima e cache de prompts a partir de 512 tokens
  • Os classificadores de segurança de uso duplo são acionados 85% menos vezes do que na Fable 5, e o novo modo de fallback padrão evita as recusas silenciosas no meio da sessão que prejudicaram o lançamento da Fable 5
  • Verifica o próprio trabalho sem que seja solicitado, lida com trocas de ferramentas no meio da conversa (beta) sem quebrar o cache de prompts, e já está disponível desde o primeiro dia no Claude.ai, na API, na Bedrock, na Vertex e no Microsoft Foundry
  • Notavelmente lento e muito verboso: 52,6 tokens de saída por segundo e 68 segundos até o primeiro token no Artificial Analysis, tendo consumido cerca de 100 milhões de tokens de saída durante a avaliação, contra uma mediana de 63 milhões
  • A verbosidade é um problema real de custo: a CodeRabbit mediu que ele lê cerca de 50% a mais e escreve cerca de 65% a mais do que os modelos de referência de fronteira em cada revisão de código
  • Nenhum corte real de preço apesar do discurso de “eficiência de custo”: idêntico à Opus 4.8 ($5/$25), quase no preço da GPT-5.6 ($5/$30), e mais do que o dobro dos níveis comparáveis do Gemini ou do Grok
  • Avaliadores descrevem uma personalidade “brilhante mas irritante”: excesso de verificação, cautela excessiva e recusas ocasionais de tarefas simples, como resolver um conflito de merge (avaliação de campo da Lenny's Newsletter)
  • Uma mudança de API que quebra a compatibilidade para quem migra da Opus 4.8: o modo de raciocínio vem ativado por padrão e não pode ser desativado nos níveis de esforço xhigh ou max (retorna erro 400); o modo rápido ($10/$50, cerca de 2,5 vezes mais rápido) só está disponível na API, não na Bedrock nem na Vertex

Dê seu veredicto

Uma recomendação por ferramenta por gladiador. Ela redefine a pontuação da multidão que todos veem.

Kimi K3$15/1M out
57%pontuação da multidão · 3
Claude Opus 5$25/1M out
63%pontuação da multidão · 4

O veredicto da arena sobre o Kimi K3

O Kimi K3 é o argumento mais forte até agora de que a fronteira deixou de ser exclusivamente americana: 3º lugar no Artificial Analysis, pontuações de alto nível em GPQA e SWE-bench Verified, e o melhor ranking do setor na arena de código frontend, tudo a cerca de metade ou um terço dos preços da fronteira fechada dos Estados Unidos. Vale escolhê-lo para codificação agêntica, trabalho de frontend e automação SaaS, onde seus benchmarks são mais fortes, ou se o roadmap prevê hospedar por conta própria um modelo de classe fronteira assim que os pesos forem publicados. Vale evitá-lo em produtos interativos (33 tokens por segundo é lento), em qualquer coisa que envolva conteúdo politicamente sensível ou exigências rígidas de residência de dados na UE (censura em mandarim, jurisdição de Pequim), e em buscas de alta precisão, nas quais sua taxa de alucinação de 51% no AA-Omniscience exige uma camada de verificação. Equipes obcecadas por custo devem notar que o DeepSeek V4 ainda entrega muito mais tokens por dólar: a proposta do K3 é o pico de capacidade por dólar, não o token mais barato.

O veredicto da arena sobre o Claude Opus 5

Claude Opus 5 é a opção padrão mais sensata da linha Series 5: a maior parte da inteligência da Fable 5 (e até mais no Frontier-Bench e no GDPval) por exatamente metade do preço por token, com classificadores que são acionados 85% menos vezes. Para quem migrou cargas de trabalho para a Fable 5 por causa da capacidade, mas incomoda-se com a conta ou com as recusas por falso positivo, vale a pena migrar para cá; para quem ainda está na Opus 4.8, o upgrade traz 10 pontos a mais no SWE-bench Pro de graça. Há dois motivos honestos para procurar outra opção: a latência e a verbosidade. Com 52,6 tokens por segundo e 68 segundos até o primeiro token, ele não se encaixa bem em experiências interativas, e seu apetite por tokens infla discretamente os custos reais além do preço de tabela, então pipelines de alto volume sensíveis a orçamento continuam mais bem atendidos por Sonnet 5, Gemini ou DeepSeek. Vale manter a Fable 5 apenas para as execuções autônomas mais longas, nas quais sua leve vantagem no SWE-bench Pro compensa.

O que a multidão diz

Sobre o Kimi K3

Capitão Churn

Tried it for our knowledge-base assistant and the hallucination rate is real: it confidently invented two API endpoints in one afternoon. 33 tokens per second on top of that. Back to waiting for the open weights to fine-tune.

Polegar Dourado

Our Zapier-style automation stack runs on it now. Tool orchestration that GPT-5.5 fumbled works reliably, and the cache-hit pricing makes repeated workflows genuinely cheap.

São Deployus

The Frontend Arena ranking is deserved. Gave it the same dashboard spec I gave Fable 5 and K3's React came out cleaner, with fewer invented props. At $3/$15 through OpenRouter it was a drop-in swap.

Sobre o Claude Opus 5

Polegar Abaixus

The sticker price is unchanged but my invoice is not: it writes essays where Opus 4.8 wrote answers. 68 seconds to first token killed it for our support chat, we went back to Sonnet 5.

O Avaliador Justo

Fed it a 40-tab financial model with cross-sheet formulas and asked for a scenario deck. It got the edge cases the analysts missed. For document-heavy enterprise work this is the best model I have used.

Sir Entrega Muito

We moved off Fable 5 because the bio classifier kept flagging our genomics tooling. Opus 5 does the same work at half the price and I have not seen a single silent reroute since.

Guardião do Repo

Migrated our agents from Opus 4.8 the day it dropped. Same bill, and tasks that used to stall at the planning stage now just finish. The 10-point SWE-bench jump is not marketing, our merge queue feels it.

Perguntas frequentes

O Kimi K3 é melhor que o Claude Opus 5?

A multidão está atualmente com o Claude Opus 5: 63% o recomendam, contra 57% para o Kimi K3 (7 votos). Em Raciocínio, o Claude Opus 5 pontua mais alto (5/5 vs 4.5/5). A escolha certa depende do seu caso de uso. A comparação linha por linha nesta página detalha preços, especificações principais e notas da arena.

Qual é mais barato, Kimi K3 ou Claude Opus 5?

O Kimi K3 é mais barato: começa em $15/1M out, enquanto o Claude Opus 5 começa em $25/1M out.

Quanto custam Kimi K3 e Claude Opus 5 por 1M de tokens?

Kimi K3: $3/1M in por 1M de tokens de entrada, $15/1M out por 1M de tokens de saída. Claude Opus 5: $5/1M in por 1M de tokens de entrada, $25/1M out por 1M de tokens de saída.