Frente a frente
DeepSeek-V4 vs Claude Opus 5: qual modelo de IA vence em 2026?
DeepSeek-V4 ($0.87/1M out) e Claude Opus 5 ($25/1M out) estão entre os modelos de IA mais usados de 2026. Em 7 votos da comunidade, Claude Opus 5 lidera com 63% de aprovação.
Veredicto rápido
Em Raciocínio, escolha Claude Opus 5: a arena o avalia em 5/5 contra 4.5/5 de DeepSeek-V4. No orçamento, DeepSeek-V4 vence: começa em $0.87/1M out contra $25/1M out de Claude Opus 5.
Comparação linha por linha
Pontos fortes e fracos
DeepSeek-V4
- Janela de contexto de 1M de tokens (8x os 128K do V3.2) com até 384K tokens de saída, padrão na API oficial
- Preço agressivo: $0.435/$0.87 por 1M de tokens (V4-Pro), cerca de 28.7x mais barato por token de saída que o Claude Opus 4.8; a entrada com cache hit cai para $0.003625/1M (mais de 99% de desconto)
- Open weights sob licença MIT para o V4-Pro e o V4-Flash no Hugging Face: uso comercial, fine-tuning e redistribuição permitidos
- SOTA open source em código agêntico: 80.6 no SWE-bench Verified (configuração Think Max), empatado com o Gemini 3.1 Pro, mais rating de 3206 no Codeforces (~posição 23 contra humanos)
- Fica em #3 de 93 no Artificial Analysis Intelligence Index (nota 44), bem acima da média de 25
- O stack de sparse attention reduz a inferência de contexto de 1M para 27% dos FLOPs do V3.2 e 10% do seu KV cache
- Chamadas de ferramentas malformadas intermitentes: function calls às vezes emitidas como texto simples no content em vez do campo tool_calls (issue #1244 do GitHub deepseek-ai)
- O modo thinking quebra cadeias longas de tool calls multi-turno com erros 400 em frameworks de agentes (issue #72044 do OpenClaw, correção ainda incompleta)
- Desenvolvedores relatam que ele inventa APIs inexistentes em bases de código próprias e age sobre entradas de usuário alucinadas em loops de agentes
- Muito verboso (180M de tokens de saída na avaliação contra 95M da mediana) e velocidade mediana de 54.6 tok/s (#39/93), o que corrói o baixo preço por token na prática
- Somente texto (sem visão ou áudio) e ainda em preview: o lançamento oficial planejado para meados de julho de 2026 adiciona preços de horário de pico que dobram as tarifas de API listadas durante o horário comercial de Pequim
Claude Opus 5
- Classificado em 1º lugar em inteligência composta entre 190 modelos no Artificial Analysis no lançamento, com 43,3% no Frontier-Bench v0.1 contra 34,4% do GPT-5.6 Sol e 33,7% da Claude Fable 5
- 3,9 vezes melhor que o GPT-5.6 Sol em raciocínio inédito no ARC-AGI-3 (30,2% contra 7,8%), e Elo de 1861 no trabalho de conhecimento econômico do GDPval-AA v2, à frente da Fable 5 (1747)
- 79,2% no SWE-bench Pro, a apenas um ponto da Fable 5 (80,0%) e 10 pontos acima da Opus 4.8 (69,2%), pela metade do preço da Fable 5; segundo o cofundador da Cursor, oferece “inteligência próxima da Fable 5, na velocidade e no custo da Opus”
- O mesmo preço de $5/$25 da Opus 4.8, com uma janela maior: o contexto de 1M de tokens passa a ser o único nível padrão, com 128K tokens de saída máxima e cache de prompts a partir de 512 tokens
- Os classificadores de segurança de uso duplo são acionados 85% menos vezes do que na Fable 5, e o novo modo de fallback padrão evita as recusas silenciosas no meio da sessão que prejudicaram o lançamento da Fable 5
- Verifica o próprio trabalho sem que seja solicitado, lida com trocas de ferramentas no meio da conversa (beta) sem quebrar o cache de prompts, e já está disponível desde o primeiro dia no Claude.ai, na API, na Bedrock, na Vertex e no Microsoft Foundry
- Notavelmente lento e muito verboso: 52,6 tokens de saída por segundo e 68 segundos até o primeiro token no Artificial Analysis, tendo consumido cerca de 100 milhões de tokens de saída durante a avaliação, contra uma mediana de 63 milhões
- A verbosidade é um problema real de custo: a CodeRabbit mediu que ele lê cerca de 50% a mais e escreve cerca de 65% a mais do que os modelos de referência de fronteira em cada revisão de código
- Nenhum corte real de preço apesar do discurso de “eficiência de custo”: idêntico à Opus 4.8 ($5/$25), quase no preço da GPT-5.6 ($5/$30), e mais do que o dobro dos níveis comparáveis do Gemini ou do Grok
- Avaliadores descrevem uma personalidade “brilhante mas irritante”: excesso de verificação, cautela excessiva e recusas ocasionais de tarefas simples, como resolver um conflito de merge (avaliação de campo da Lenny's Newsletter)
- Uma mudança de API que quebra a compatibilidade para quem migra da Opus 4.8: o modo de raciocínio vem ativado por padrão e não pode ser desativado nos níveis de esforço xhigh ou max (retorna erro 400); o modo rápido ($10/$50, cerca de 2,5 vezes mais rápido) só está disponível na API, não na Bedrock nem na Vertex
Dê seu veredicto
Uma recomendação por ferramenta por gladiador. Ela redefine a pontuação da multidão que todos veem.
O veredicto da arena sobre o DeepSeek-V4
Escolha o DeepSeek-V4 se você quer raciocínio e código agêntico quase de fronteira a preços de 3x a quase 30x abaixo do Claude Opus ou do GPT-5.5, ou se pesos sob licença MIT para auto-hospedagem e fine-tuning importam para você. É um upgrade decisivo sobre o V3.2: contexto 8x maior, inferência de contexto longo muito mais barata e código mais forte, e os endpoints legados deepseek-chat/reasoner são descontinuados em 24 de julho de 2026 de qualquer forma. Evite-o para agentes de produção que dependem de tool calling multi-turno à prova de falhas, onde usuários ainda relatam chamadas malformadas e APIs inventadas, e para qualquer trabalho de visão ou áudio, já que ele é somente texto. Apps sensíveis a latência também devem testar antes, pois a verbosidade e a velocidade mediana de 54.6 tok/s de saída anulam parte da vantagem de custo, e reserve orçamento para a duplicação de preço em horário de pico que chega com o lançamento oficial de meados de julho.
O veredicto da arena sobre o Claude Opus 5
Claude Opus 5 é a opção padrão mais sensata da linha Series 5: a maior parte da inteligência da Fable 5 (e até mais no Frontier-Bench e no GDPval) por exatamente metade do preço por token, com classificadores que são acionados 85% menos vezes. Para quem migrou cargas de trabalho para a Fable 5 por causa da capacidade, mas incomoda-se com a conta ou com as recusas por falso positivo, vale a pena migrar para cá; para quem ainda está na Opus 4.8, o upgrade traz 10 pontos a mais no SWE-bench Pro de graça. Há dois motivos honestos para procurar outra opção: a latência e a verbosidade. Com 52,6 tokens por segundo e 68 segundos até o primeiro token, ele não se encaixa bem em experiências interativas, e seu apetite por tokens infla discretamente os custos reais além do preço de tabela, então pipelines de alto volume sensíveis a orçamento continuam mais bem atendidos por Sonnet 5, Gemini ou DeepSeek. Vale manter a Fable 5 apenas para as execuções autônomas mais longas, nas quais sua leve vantagem no SWE-bench Pro compensa.
O que a multidão diz
Sobre o DeepSeek-V4
“Tool calling is flaky. Function calls sometimes land as plain text instead of the tool_calls field, and thinking mode 400s on long multi-turn chains. Not agent-ready yet.”
“MIT license on both Pro and Flash weights is the real story. Fine-tune, redistribute, ship commercially, no lawyer needed. Plus 384K output tokens for long-doc generation.”
“MIT weights, 1M context, and output tokens roughly 29x cheaper than Opus 4.8. Cache hits make input basically free. Moved my bulk pipelines over and the bill collapsed.”
Sobre o Claude Opus 5
“The sticker price is unchanged but my invoice is not: it writes essays where Opus 4.8 wrote answers. 68 seconds to first token killed it for our support chat, we went back to Sonnet 5.”
“Fed it a 40-tab financial model with cross-sheet formulas and asked for a scenario deck. It got the edge cases the analysts missed. For document-heavy enterprise work this is the best model I have used.”
“We moved off Fable 5 because the bio classifier kept flagging our genomics tooling. Opus 5 does the same work at half the price and I have not seen a single silent reroute since.”
“Migrated our agents from Opus 4.8 the day it dropped. Same bill, and tasks that used to stall at the planning stage now just finish. The 10-point SWE-bench jump is not marketing, our merge queue feels it.”
Continue comparando
Perguntas frequentes
O DeepSeek-V4 é melhor que o Claude Opus 5?
A multidão está atualmente com o Claude Opus 5: 63% o recomendam, contra 57% para o DeepSeek-V4 (7 votos). Em Raciocínio, o Claude Opus 5 pontua mais alto (5/5 vs 4.5/5). A escolha certa depende do seu caso de uso. A comparação linha por linha nesta página detalha preços, especificações principais e notas da arena.
Qual é mais barato, DeepSeek-V4 ou Claude Opus 5?
O DeepSeek-V4 é mais barato: começa em $0.87/1M out, enquanto o Claude Opus 5 começa em $25/1M out.
Quanto custam DeepSeek-V4 e Claude Opus 5 por 1M de tokens?
DeepSeek-V4: $0.435/1M in (cache hit $0.003625) por 1M de tokens de entrada, $0.87/1M out por 1M de tokens de saída. Claude Opus 5: $5/1M in por 1M de tokens de entrada, $25/1M out por 1M de tokens de saída.