A arena · análise de modelo de IA

Claude Opus 4.8

por Anthropic

O modelo carro-chefe da classe Opus da Anthropic para código agêntico de longo horizonte; contexto de 1M a $5/$25 por 1M de tokens.

Pontuação da arena 4.2/557% recomendam · 3 votos
Raciocínio4.5
Programação5.0
Escrita5.0
Velocidade3.0
Custo-benefício3.5
Visitar Claude Opus 4.8agentes de código de longo horizontegrandes refactors e migrações de base de códigocode review e depuraçãotrabalho de conhecimento corporativo (jurídico, financeiro, pesquisa)
Preço

$25/1M out

Nível padrão a $5/$25 por 1M de tokens (inalterado desde o Opus 4.7); fast mode em preview de pesquisa a $10/$50 (contra $30/$150 do nível fast descontinuado do Opus 4.7); batch API com 50% de desconto a $2.50/$12.50; sem sobretaxa de contexto longo até 1M de tokens; leituras de cache de prompt a $0.50/1M.

Provedor

Anthropic

Janela de contexto

1M tokens (128K max output)

Preço de entrada

$5/1M in

Preço de saída

$25/1M out

Modalidades

text, vision (image input up to 2576px, text output)

Open weights

Não

O que é o Claude Opus 4.8?

O modelo mais capaz da classe Opus da Anthropic, lançado em 28 de maio de 2026. Ajustado para código agêntico de longo horizonte, uso de ferramentas e autoavaliação honesta do próprio trabalho, com janela de contexto de 1M de tokens, saída máxima de 128K e thinking adaptativo com controles de effort. Mantém exatamente a superfície de API e o preço do Opus 4.7.

Claude Opus 4.8: prós e contras

Prós

  • SWE-Bench Pro 69.2% (contra 64.3% do Opus 4.7) e supera os Opus anteriores no CursorBench em todos os níveis de effort; relatos fortes do mundo real em grandes refactors e caçadas de bugs multi-arquivo
  • Cerca de 4x menos propenso que o Opus 4.7 a deixar passar falhas no próprio código gerado sem sinalizá-las; grande salto em raciocínio matemático (USAMO 2026: 96.7% vs 69.3%)
  • Contexto de 1M de tokens e saída de 128K com preço inalterado de $5/$25, sem sobretaxa de contexto longo; batch API com 50% de desconto ($2.50/$12.50)
  • O fast mode (preview de pesquisa) entrega até 2.5x mais velocidade de saída a $10/$50, 3x mais barato que o nível fast do Opus 4.7 ($30/$150)
  • Recursos de API únicos para agentes: mensagens de sistema no meio da conversa que preservam o cache de prompt, e Dynamic Workflows que criam subagentes paralelos no Claude Code
  • 84% no Online-Mind2Web de automação de navegador e nota recorde no Legal Agent Benchmark (primeiro modelo a passar de 10% all-pass); forte em trabalho de conhecimento corporativo (a Box reporta 87% vs 77% internamente)

Contras

  • Regressões turno a turno relatadas: instruções óbvias ignoradas em documentos de planejamento, respostas que cobrem só uma fatia estreita do objetivo, e geração one-shot de UI simples pior que no 4.7
  • Estilo de escrita criticado por usuários intensivos: hedging excessivo, edição cautelosa demais que 'corta tudo que é ousado ou engraçado' (Steve Yegge), e loops de contestação mesmo contra teses bem fundamentadas
  • Cacoete de mistura de idiomas: usuários relatam inserções aleatórias de chinês, cirílico ou grego em threads de pesquisa longas
  • Degradação de qualidade visível acima de ~200K tokens no uso prático, apesar da janela anunciada de 1M
  • Regressão no Vending-Bench: caiu em fornecedores golpistas cerca de 30x mais que o 4.7 e negocia pior (efeito colateral do alinhamento de honestidade mais rígido)

O veredicto da arena

Um upgrade direto para usuários do Opus 4.7: superfície de API idêntica e preço de $5/$25 com ganhos reais em código agêntico de longo horizonte, code review e análise corporativa. Escolha-o se você roda Claude Code, migrações multi-arquivo, auditorias de segurança ou pipelines de agentes que inspecionam, agem e verificam ao longo de muitas etapas. Pule-o para snippets de UI rápidos de uma tacada ou prompts finamente ajustados ao comportamento do 4.7, onde usuários relatam regressões, e escolha o Sonnet 5 ($3/$15, promocional $2/$10 até ago 2026) se custo importa mais do que capacidade máxima. Escritores sensíveis a hedging e à edição cautelosa demais podem achar o estilo dele frustrante.

Polegar para cima ou para baixo

Dê seu veredicto

Você recomendaria o Claude Opus 4.8 ou avisaria a multidão para ficar longe?

57%pontuação da multidão · 3

Melhores alternativas ao Claude Opus 4.8

Todas as alternativas
1
Claude Haiku 4.5

O modelo mais rápido da Anthropic: cerca de 90% da habilidade de código do Sonnet 4.5 a $1/$5 por 1M de tokens, contexto de 200K.

$5/1M out67%(2)
Visit
2
Claude Fable 5

O carro-chefe da classe Mythos da Anthropic de junho de 2026: 80.3% no SWE-bench Pro, 11 pontos à frente de todos os outros modelos de fronteira

$50/1M out63%(4)
Visit
3
Claude Opus 4.7

O Opus da Anthropic de abril de 2026: 87.6% no SWE-bench Verified, contexto de 1M, visão de alta resolução, hoje atrás do Opus 4.8

$25/1M out57%(3)
Visit

Compare o Claude Opus 4.8 frente a frente

O que a multidão diz

Juiz Implacável

Writing took a hit. It hedges everything and edits any bold or funny line out of my drafts. Also caught it answering a narrow slice of my planning doc and calling it done.

Campeão das Vibes

Threw USAMO-level math at it for a lark and it just grinds through. 96.7 vs 69 for 4.7 tracks with what I see. Same $5/$25, 1M context, no excuse not to switch.

Glorius Maximus

Upgraded from 4.7 for a monorepo refactor and the difference is real. It actually flags its own sketchy code instead of shipping it. Multi-file bug hunts feel way less babysat.

Claude Opus 4.8: perguntas frequentes

Quanto custa o Claude Opus 4.8 por 1M de tokens?

O Claude Opus 4.8 custa $5/1M in por 1M de tokens de entrada e $25/1M out por 1M de tokens de saída. Nível padrão a $5/$25 por 1M de tokens (inalterado desde o Opus 4.7); fast mode em preview de pesquisa a $10/$50 (contra $30/$150 do nível fast descontinuado do Opus 4.7); batch API com 50% de desconto a $2.50/$12.50; sem sobretaxa de contexto longo até 1M de tokens; leituras de cache de prompt a $0.50/1M.