A arena · análise de modelo de IA

Llama 4 (Scout / Maverick)

por Meta

A dupla MoE de open weights da Meta: 17B de parâmetros ativos, entrada nativa de imagem, contexto de 10M de tokens no papel

Pontuação da arena 3/5
Raciocínio2.5
Programação2.0
Escrita2.5
Velocidade4.5
Custo-benefício3.5
Visitar Llama 4 (Scout / Maverick)inferência barata em alto volumeapps multimodais auto-hospedadoschat multilíngue em escalaresumo de documentos longos
Preço

$0.60/1M out (Maverick, hosted)

Sem API paga oficial da Meta; tarifas típicas de hospedagem de terceiros mostradas para o Maverick (Scout a partir de ~$0.10/$0.30 por 1M na DeepInfra, $0.11/$0.34 na Groq). O contexto do Scout hospedado é limitado bem abaixo da especificação nominal de 10M (por exemplo ~320K na DeepInfra).

Provedor

Meta

Janela de contexto

10M tokens (Scout) / 1M (Maverick)

Preço de entrada

$0.15/1M in (Maverick, hosted)

Preço de saída

$0.60/1M out (Maverick, hosted)

Modalidades

text, vision (image input)

Open weights

Sim

O que é o Llama 4 (Scout / Maverick)?

Primeiros modelos de open weights nativamente multimodais com mixture-of-experts da Meta, lançados em 5 de abril de 2025. O Scout (109B de parâmetros totais, 16 experts) mira deploy em uma única GPU com contexto nominal de 10M de tokens; o Maverick (400B totais, 128 experts) é o modelo de chat carro-chefe, com janela de 1M de tokens.

Llama 4 (Scout / Maverick): prós e contras

Prós

  • Eficiência de MoE: apenas 17B de parâmetros ativos por token (Scout 109B/16 experts, Maverick 400B/128 experts), entregando chat quase classe GPT-4o por uma fração da computação
  • Inferência hospedada muito barata: Maverick a partir de cerca de $0.15/1M de entrada e $0.60/1M de saída; Scout a partir de cerca de $0.10/$0.30 na DeepInfra ou $0.11/$0.34 na Groq
  • Multimodalidade nativa por early fusion (texto mais imagens, testado com até 8 imagens) em um modelo de open weights
  • Maior contexto nominal de qualquer modelo de open weights no lançamento: 10M de tokens no Scout, 1M no Maverick
  • O Scout cabe em uma única GPU H100 com quantização Int4; pré-treinado em 200 idiomas
  • Alta vazão: 17B de parâmetros ativos alcançam 500+ tokens/s em provedores rápidos (a Groq lista o Scout a 594 TPS)

Contras

  • Confiança nos benchmarks abalada: a Meta submeteu ao LMArena uma variante do Maverick otimizada para chat e não lançada (ELO 1417), o que os devs chamaram de enganoso já que os pesos públicos pontuam menos
  • As promessas de contexto longo desmoronam na prática: o Scout marcou ~15.6% em 128K no Fiction.LiveBench contra 90.6% do Gemini 2.5 Pro, e os provedores hospedados limitam o Scout bem abaixo de 10M (por exemplo ~320K na DeepInfra)
  • Código amplamente criticado no r/LocalLlama e no HN, perdendo para o DeepSeek V3 de preço similar em tarefas reais de dev
  • Não é open source pela OSI: a licença exclui empresas domiciliadas na UE, exige licença especial acima de 700M de MAU e obriga o uso da marca Llama
  • Os 109B/400B de parâmetros totais são grandes demais para GPUs de consumo, e a linhagem estagnou: nenhuma variante de raciocínio foi lançada e o Behemoth nunca saiu

O veredicto da arena

Escolha o Llama 4 se você precisa de um modelo multimodal barato, rápido e auto-hospedável para chat de alto volume, extração ou cargas multilíngues fora da UE; o Maverick chega perto da qualidade do GPT-4o por cerca de um décimo do preço. Evite-o para código, raciocínio difícil ou recuperação genuína de um milhão de tokens, onde DeepSeek, Qwen 3 e Gemini claramente o superam. Em relação ao Llama 3.3 70B ele adiciona visão nativa e uma janela maior, mas muitos desenvolvedores acharam o modelo denso mais antigo ou o Qwen mais confiáveis em pura qualidade de texto, e o contexto de 10M é em grande parte um número de papel.

Polegar para cima ou para baixo

Dê seu veredicto

Você recomendaria o Llama 4 (Scout / Maverick) ou avisaria a multidão para ficar longe?

50%pontuação da multidão · 0

Melhores alternativas ao Llama 4 (Scout / Maverick)

Todas as alternativas
1
Claude Haiku 4.5

O modelo mais rápido da Anthropic: cerca de 90% da habilidade de código do Sonnet 4.5 a $1/$5 por 1M de tokens, contexto de 200K.

$5/1M out67%(2)
Visit
2
Claude Fable 5

O carro-chefe da classe Mythos da Anthropic de junho de 2026: 80.3% no SWE-bench Pro, 11 pontos à frente de todos os outros modelos de fronteira

$50/1M out63%(4)
Visit
3
Claude Opus 4.7

O Opus da Anthropic de abril de 2026: 87.6% no SWE-bench Verified, contexto de 1M, visão de alta resolução, hoje atrás do Opus 4.8

$25/1M out57%(3)
Visit

Compare o Llama 4 (Scout / Maverick) frente a frente

Llama 4 (Scout / Maverick): perguntas frequentes

Quanto custa o Llama 4 (Scout / Maverick) por 1M de tokens?

O Llama 4 (Scout / Maverick) custa $0.15/1M in (Maverick, hosted) por 1M de tokens de entrada e $0.60/1M out (Maverick, hosted) por 1M de tokens de saída. Sem API paga oficial da Meta; tarifas típicas de hospedagem de terceiros mostradas para o Maverick (Scout a partir de ~$0.10/$0.30 por 1M na DeepInfra, $0.11/$0.34 na Groq). O contexto do Scout hospedado é limitado bem abaixo da especificação nominal de 10M (por exemplo ~320K na DeepInfra).