Frente a frente

Logo de Claude Opus 4.7vsLogo de Kimi K3

Claude Opus 4.7 vs Kimi K3: qual modelo de IA vence em 2026?

Claude Opus 4.7 ($25/1M out) e Kimi K3 ($15/1M out) estão entre os modelos de IA mais usados de 2026. Em 6 votos da comunidade, Claude Opus 4.7 lidera com 57% de aprovação.

Veredicto rápido

Em Raciocínio, Claude Opus 4.7 e Kimi K3 empatam em 4.5/5. No orçamento, Kimi K3 vence: começa em $15/1M out contra $25/1M out de Claude Opus 4.7.

Comparação linha por linha

A partir de
$25/1M out$5 de entrada / $25 de saída por 1M de tokens no nível padrão da API, tarifa fixa até o contexto completo de 1M (sem sobretaxa de contexto longo); Batch API com -50%; o novo tokenizer gera ~30% mais tokens que os modelos pré-4.7.
$15/1M outPreço oficial de tabela da API da Moonshot para kimi-k3: $3 por milhão de tokens de entrada (erro de cache), $0,30 por milhão em caso de acerto de cache, $15 por milhão de saída incluindo o rastro de raciocínio, preço fixo em toda a janela de 1M de tokens (sem níveis por tamanho). Mesmo preço de $3/$15 na OpenRouter (o preço de cache não é exibido lá). Um aumento de 3 vezes em relação aos $0,95/$4 do Kimi K2.6. Verificado em platform.kimi.ai/docs/pricing/chat-k3, em julho de 2026.
Provedor
Anthropic
Moonshot AI
Janela de contexto
1M tokens (128K max output)
1M tokens
Preço de entrada
$5/1M in
$3/1M in
Preço de saída
$25/1M out
$15/1M out
Modalidades
text + image input (up to 2576px), text output
text, vision, video input
Open weights
Não
Não
Pontuação da multidão
57%(3)
57%(3)
Notas da arena (1-5)
Raciocínio
4.5
4.5
Programação
4.5
4.5
Escrita
4.5
4.0
Velocidade
2.5
2.0
Custo-benefício
3.0
3.5

Pontos fortes e fracos

Claude Opus 4.7

  • 87.6% no SWE-bench Verified (contra 80.8% do Opus 4.6) e 64.3% no SWE-bench Pro no lançamento, à frente do GPT-5.4 (57.7%) e do Gemini 3.1 Pro (54.2%)
  • Janela de contexto de 1M de tokens e saída máxima de 128K a um preço fixo de $5/$25, sem sobretaxa de contexto longo (300K de saída via Batch API em beta)
  • Primeiro Claude com visão de alta resolução: aceita imagens de até 2576px no lado maior com coordenadas precisas ao pixel, ~3x mais detalhe que antes
  • Destaque em code review: encontra mais bugs reais com raciocínio entre arquivos mais forte que os rivais em testes independentes, e 21% menos erros de raciocínio sobre documentos que o Opus 4.6
  • Controle fino de custo via novo nível de effort xhigh e Task Budgets (beta): o 4.7 em effort baixo praticamente iguala a qualidade de saída do 4.6 em effort médio
  • Conhecimento recente: cutoff confiável de janeiro de 2026, o mais fresco de qualquer Claude no lançamento
  • O novo tokenizer infla a contagem de tokens em cerca de 30% para o mesmo texto em relação aos modelos pré-4.7 (segundo a própria documentação da Anthropic), elevando o custo efetivo por requisição apesar do preço de tabela inalterado
  • Muito verboso em uso agêntico: um benchmark constatou que o GPT-5.5 usou 72% menos tokens de saída em tarefas de código equivalentes, e avaliadores consideram sua narração comunicativa demais
  • Mudanças incompatíveis na API pegam quem migra: temperature/top_p/top_k e o budget_tokens do thinking agora retornam erros 400, e o texto do thinking fica oculto por padrão
  • Latência moderada, com turnos de vários minutos em effort alto; o fast mode é um preview de pesquisa premium já descontinuado no 4.7
  • Superado pelo Opus 4.8 pelos mesmos $5/$25 em cerca de 3 meses, e as salvaguardas de cibersegurança em tempo real podem gerar falsos positivos em trabalho legítimo de segurança

Kimi K3

  • 3º lugar no Artificial Analysis Intelligence Index (57) no lançamento, comparável à Claude Opus 4.8 e ao GPT-5.5: o laboratório chinês que mais se aproximou da fronteira fechada dos Estados Unidos
  • 93,4% no SWE-bench Verified no ambiente de teste independente da Vals AI (GPT-5.6 Sol: 96,2%, Claude Fable 5: 95,0%) e 1º lugar no Frontend Code Arena da Arena.ai, com 1679 pontos, à frente da Fable 5
  • 93,5% no GPQA Diamond (entre os 92,6% da Fable 5 e os 94,1% do GPT-5.6), 96,1% no AIME 2025, e Elo de 1668 no trabalho agêntico do GDPval-AA v2, atrás apenas da Fable 5
  • Perfil agêntico forte: 1º lugar nos fluxos de trabalho SaaS do AutomationBench-AA (53%), navegação autônoma de longo horizonte em terminal e repositório via Kimi Code, e cerca de 21% menos tokens de saída que o K2 para mais inteligência
  • $3/$15 por milhão de tokens (a entrada cai para $0,30 em caso de acerto de cache), preço fixo em toda a janela de 1M de tokens: ainda bem abaixo dos preços da fronteira fechada dos Estados Unidos, com API compatível com a OpenAI e disponibilidade na OpenRouter
  • Entrada multimodal nativa (texto, imagem, vídeo) e pesos abertos anunciados para 27/07/2026 sob uma licença esperada do tipo Modified-MIT, posicionando-o como o primeiro modelo de fronteira de pesos abertos da classe de 3 trilhões de parâmetros
  • Um salto de preço de 3 vezes em relação ao Kimi K2.6 ($0,95/$4 para $3/$15), tornando-o o modelo chinês mais caro já lançado, no preço de tabela do Claude Sonnet 5: a era do “10 vezes mais barato que os modelos americanos” acabou (alta documentada por Simon Willison)
  • Lento: 33 tokens de saída por segundo, na 145ª posição entre 190 modelos no Artificial Analysis, pouco adequado para uso interativo
  • A taxa de alucinação subiu de 39% (K2.6) para 51% no AA-Omniscience, já que o modelo agora tenta responder onde antes recusaria (a Fable 5 fica em um nível comparável de 54,9%)
  • Censura política em temas sensíveis em mandarim (evita responder sobre Xi, o PCC, Tiananmen) e jurisdição de Pequim para os dados da API, um obstáculo de conformidade para muitas implantações corporativas e da UE; o UK AISI/CAISI também constatou que suas salvaguardas de cibersegurança falharam em bloquear tentativas de desenvolvimento de exploits durante os testes
  • “Pesos abertos” que por ora são teóricos para a maioria: cerca de 594 GB em MXFP4 nativo, exigindo um datacenter multi-GPU para hospedagem própria, e os pesos (além da licença final) ainda não haviam sido publicados no momento desta análise

Dê seu veredicto

Uma recomendação por ferramenta por gladiador. Ela redefine a pontuação da multidão que todos veem.

Claude Opus 4.7$25/1M out
57%pontuação da multidão · 3
Kimi K3$15/1M out
57%pontuação da multidão · 3

O veredicto da arena sobre o Claude Opus 4.7

Escolha o Opus 4.7 apenas se você já está fixado nele por reprodutibilidade: o Opus 4.8 custa os mesmos $5/$25, mantém uma superfície de API idêntica e o supera, sendo o melhor padrão para projetos novos. Ele continua uma escolha muito forte para código agêntico, code review e trabalho documental com contexto de 1M, e é um upgrade claro sobre o Opus 4.6. Equipes migrando do 4.6 devem prever mudanças incompatíveis na API e um tokenizer que gera cerca de 30% mais tokens por prompt. Usuários sensíveis a custo devem olhar o Sonnet 5, que entrega qualidade quase nível Opus a $3/$15 (promocional $2/$10 até 31 de agosto de 2026).

O veredicto da arena sobre o Kimi K3

O Kimi K3 é o argumento mais forte até agora de que a fronteira deixou de ser exclusivamente americana: 3º lugar no Artificial Analysis, pontuações de alto nível em GPQA e SWE-bench Verified, e o melhor ranking do setor na arena de código frontend, tudo a cerca de metade ou um terço dos preços da fronteira fechada dos Estados Unidos. Vale escolhê-lo para codificação agêntica, trabalho de frontend e automação SaaS, onde seus benchmarks são mais fortes, ou se o roadmap prevê hospedar por conta própria um modelo de classe fronteira assim que os pesos forem publicados. Vale evitá-lo em produtos interativos (33 tokens por segundo é lento), em qualquer coisa que envolva conteúdo politicamente sensível ou exigências rígidas de residência de dados na UE (censura em mandarim, jurisdição de Pequim), e em buscas de alta precisão, nas quais sua taxa de alucinação de 51% no AA-Omniscience exige uma camada de verificação. Equipes obcecadas por custo devem notar que o DeepSeek V4 ainda entrega muito mais tokens por dólar: a proposta do K3 é o pico de capacidade por dólar, não o token mais barato.

O que a multidão diz

Sobre o Claude Opus 4.7

Polegar Abaixus

Watch your invoices. New tokenizer counts ~30% more tokens for the same text, and it narrates every tiny step. Sticker price unchanged, effective cost definitely not.

O Avaliador Justo

Came from 4.6 and stopped chunking repos entirely. 1M context, 128K output, flat $5/$25 with no long-context premium. That pricing decision alone won me over.

Sir Entrega Muito

87.6 SWE-bench Verified is not just marketing, it closes tickets GPT-5.4 fumbles. And the hi-res vision with pixel-accurate coords finally makes screenshot debugging useful.

Sobre o Kimi K3

Capitão Churn

Tried it for our knowledge-base assistant and the hallucination rate is real: it confidently invented two API endpoints in one afternoon. 33 tokens per second on top of that. Back to waiting for the open weights to fine-tune.

Polegar Dourado

Our Zapier-style automation stack runs on it now. Tool orchestration that GPT-5.5 fumbled works reliably, and the cache-hit pricing makes repeated workflows genuinely cheap.

São Deployus

The Frontend Arena ranking is deserved. Gave it the same dashboard spec I gave Fable 5 and K3's React came out cleaner, with fewer invented props. At $3/$15 through OpenRouter it was a drop-in swap.

Perguntas frequentes

O Claude Opus 4.7 é melhor que o Kimi K3?

A escolha certa depende do seu caso de uso. A comparação linha por linha nesta página detalha preços, especificações principais e notas da arena.

Qual é mais barato, Claude Opus 4.7 ou Kimi K3?

O Kimi K3 é mais barato: começa em $15/1M out, enquanto o Claude Opus 4.7 começa em $25/1M out.

Quanto custam Claude Opus 4.7 e Kimi K3 por 1M de tokens?

Claude Opus 4.7: $5/1M in por 1M de tokens de entrada, $25/1M out por 1M de tokens de saída. Kimi K3: $3/1M in por 1M de tokens de entrada, $15/1M out por 1M de tokens de saída.