Frente a frente

Logo de Llama 4 (Scout / Maverick)vsLogo de Gemini 3 Pro

Llama 4 (Scout / Maverick) vs Gemini 3 Pro: qual modelo de IA vence em 2026?

Llama 4 (Scout / Maverick) ($0.60/1M out (Maverick, hosted)) e Gemini 3 Pro ($12/1M out (prompts ≤200K)) estão entre os modelos de IA mais usados de 2026. Em 3 votos da comunidade, Gemini 3 Pro lidera com 57% de aprovação.

Veredicto rápido

Em Raciocínio, escolha Gemini 3 Pro: a arena o avalia em 4.5/5 contra 2.5/5 de Llama 4 (Scout / Maverick). No orçamento, Llama 4 (Scout / Maverick) vence: começa em $0.60/1M out (Maverick, hosted) contra $12/1M out (prompts ≤200K) de Gemini 3 Pro.

Comparação linha por linha

A partir de
$0.60/1M out (Maverick, hosted)Sem API paga oficial da Meta; tarifas típicas de hospedagem de terceiros mostradas para o Maverick (Scout a partir de ~$0.10/$0.30 por 1M na DeepInfra, $0.11/$0.34 na Groq). O contexto do Scout hospedado é limitado bem abaixo da especificação nominal de 10M (por exemplo ~320K na DeepInfra).
$12/1M out (prompts ≤200K)Nível padrão: $2/$12 por 1M de tokens para prompts ≤200K, $4/$18 acima de 200K; batch com 50% de desconto. Aposentado em 9 de março de 2026, o sucessor Gemini 3.1 Pro mantém preço idêntico.
Provedor
Meta
Google (DeepMind)
Janela de contexto
10M tokens (Scout) / 1M (Maverick)
1M tokens (64K output)
Preço de entrada
$0.15/1M in (Maverick, hosted)
$2/1M in (prompts ≤200K)
Preço de saída
$0.60/1M out (Maverick, hosted)
$12/1M out (prompts ≤200K)
Modalidades
text, vision (image input)
text, image, audio, video in; text out
Open weights
Sim
Não
Pontuação da multidão
50%(0)
57%(3)
Notas da arena (1-5)
Raciocínio
2.5
4.5
Programação
2.0
4.5
Escrita
2.5
3.5
Velocidade
4.5
3.5
Custo-benefício
3.5
4.0

Pontos fortes e fracos

Llama 4 (Scout / Maverick)

  • Eficiência de MoE: apenas 17B de parâmetros ativos por token (Scout 109B/16 experts, Maverick 400B/128 experts), entregando chat quase classe GPT-4o por uma fração da computação
  • Inferência hospedada muito barata: Maverick a partir de cerca de $0.15/1M de entrada e $0.60/1M de saída; Scout a partir de cerca de $0.10/$0.30 na DeepInfra ou $0.11/$0.34 na Groq
  • Multimodalidade nativa por early fusion (texto mais imagens, testado com até 8 imagens) em um modelo de open weights
  • Maior contexto nominal de qualquer modelo de open weights no lançamento: 10M de tokens no Scout, 1M no Maverick
  • O Scout cabe em uma única GPU H100 com quantização Int4; pré-treinado em 200 idiomas
  • Alta vazão: 17B de parâmetros ativos alcançam 500+ tokens/s em provedores rápidos (a Groq lista o Scout a 594 TPS)
  • Confiança nos benchmarks abalada: a Meta submeteu ao LMArena uma variante do Maverick otimizada para chat e não lançada (ELO 1417), o que os devs chamaram de enganoso já que os pesos públicos pontuam menos
  • As promessas de contexto longo desmoronam na prática: o Scout marcou ~15.6% em 128K no Fiction.LiveBench contra 90.6% do Gemini 2.5 Pro, e os provedores hospedados limitam o Scout bem abaixo de 10M (por exemplo ~320K na DeepInfra)
  • Código amplamente criticado no r/LocalLlama e no HN, perdendo para o DeepSeek V3 de preço similar em tarefas reais de dev
  • Não é open source pela OSI: a licença exclui empresas domiciliadas na UE, exige licença especial acima de 700M de MAU e obriga o uso da marca Llama
  • Os 109B/400B de parâmetros totais são grandes demais para GPUs de consumo, e a linhagem estagnou: nenhuma variante de raciocínio foi lançada e o Behemoth nunca saiu

Gemini 3 Pro

  • Liderou o LMArena no lançamento com um recorde de 1501 de Elo e marcou 91.9% no GPQA Diamond, estado da arte na época
  • ARC-AGI-2 de 31.1%, cerca de 6x o Gemini 2.5 Pro (4.9%) e quase o dobro do GPT-5.1 (17.6%) na época
  • Compreensão multimodal de primeira classe: 81% no MMMU-Pro, 87.6% no Video-MMMU, com janela de contexto de 1M de tokens
  • Código agêntico forte: 76.2% no SWE-bench Verified, 54.2% no Terminal-Bench 2.0, 1487 de Elo no WebDev Arena
  • Ficou abaixo dos rivais em preço a $2/$12 por 1M de tokens, abaixo do preço da classe Claude Sonnet ($3/$15)
  • O thinking_level configurável (low/medium/high) permite aos desenvolvedores trocar profundidade de raciocínio por latência e custo
  • Alucinações confiantes demais: no AA-Omniscience ele deu uma resposta errada 88% das vezes em vez de se abster, contra 48% do Claude Sonnet 4.5 (the-decoder)
  • Bajulação amplamente relatada por avaliadores (Zvi Mowshowitz: 'inteligência vasta sem espinha dorsal'); exige system prompts rígidos
  • Problemas de confiabilidade no tool calling em stacks de agentes: devs relataram saídas de ferramentas despejadas na thread do chat e mais scaffolding necessário que nos modelos da OpenAI/Anthropic
  • Lento em thinking level alto: tempo até o primeiro token medido em torno de 30-60s no AI Studio, apesar de ~130 tok/s de velocidade de saída
  • Aposentado: desligado na Gemini API e no AI Studio em 9 de março de 2026, com o gemini-3-pro-preview agora apontando para o Gemini 3.1 Pro

Dê seu veredicto

Uma recomendação por ferramenta por gladiador. Ela redefine a pontuação da multidão que todos veem.

Llama 4 (Scout / Maverick)$0.60/1M out (Maverick, hosted)
50%pontuação da multidão · 0
Gemini 3 Pro$12/1M out (prompts ≤200K)
57%pontuação da multidão · 3

O veredicto da arena sobre o Llama 4 (Scout / Maverick)

Escolha o Llama 4 se você precisa de um modelo multimodal barato, rápido e auto-hospedável para chat de alto volume, extração ou cargas multilíngues fora da UE; o Maverick chega perto da qualidade do GPT-4o por cerca de um décimo do preço. Evite-o para código, raciocínio difícil ou recuperação genuína de um milhão de tokens, onde DeepSeek, Qwen 3 e Gemini claramente o superam. Em relação ao Llama 3.3 70B ele adiciona visão nativa e uma janela maior, mas muitos desenvolvedores acharam o modelo denso mais antigo ou o Qwen mais confiáveis em pura qualidade de texto, e o contexto de 10M é em grande parte um número de papel.

O veredicto da arena sobre o Gemini 3 Pro

Um lançamento histórico que recolocou o Google no topo no fim de 2025, com um salto enorme de raciocínio sobre o Gemini 2.5 Pro e as melhores notas multimodais da geração. Em meados de 2026 não há razão para escolhê-lo: o Google o desligou na API em 9 de março de 2026, e o Gemini 3.1 Pro custa exatamente o mesmo enquanto mais que dobra o desempenho no ARC-AGI-2 (77.1% vs 31.1%). Equipes em deploys legados devem migrar para o 3.1 Pro, para onde o ID do modelo antigo já aponta de qualquer forma. Evite-o para cargas sensíveis a alucinação sem adicionar grounding, uma fraqueza que os avaliadores apontaram repetidamente.

O que a multidão diz

Sobre o Llama 4 (Scout / Maverick)

Nenhum veredicto ainda. Seja o primeiro a falar.

Sobre o Gemini 3 Pro

Juiz Implacável

Confidently wrong is its worst mode. On AA-Omniscience it gave a wrong answer 88% of the time instead of declining. Add the sycophancy and you need a tight system prompt to trust it.

Campeão das Vibes

ARC-AGI-2 at 31% was about 6x Gemini 2.5 Pro and nearly double GPT-5.1 at the time. For visual-heavy work (81 MMMU-Pro) nothing else came close.

Glorius Maximus

1501 Elo on LMArena at launch was deserved. Multimodal is where it kills, I feed it lecture videos and dense PDFs and it just gets it. 1M context helps.

Perguntas frequentes

O Llama 4 (Scout / Maverick) é melhor que o Gemini 3 Pro?

A multidão está atualmente com o Gemini 3 Pro: 57% o recomendam, contra 50% para o Llama 4 (Scout / Maverick) (3 votos). Em Raciocínio, o Gemini 3 Pro pontua mais alto (4.5/5 vs 2.5/5). A escolha certa depende do seu caso de uso. A comparação linha por linha nesta página detalha preços, especificações principais e notas da arena.

Qual é mais barato, Llama 4 (Scout / Maverick) ou Gemini 3 Pro?

O Llama 4 (Scout / Maverick) é mais barato: começa em $0.60/1M out (Maverick, hosted), enquanto o Gemini 3 Pro começa em $12/1M out (prompts ≤200K).

Quanto custam Llama 4 (Scout / Maverick) e Gemini 3 Pro por 1M de tokens?

Llama 4 (Scout / Maverick): $0.15/1M in (Maverick, hosted) por 1M de tokens de entrada, $0.60/1M out (Maverick, hosted) por 1M de tokens de saída. Gemini 3 Pro: $2/1M in (prompts ≤200K) por 1M de tokens de entrada, $12/1M out (prompts ≤200K) por 1M de tokens de saída.