A arena · análise de modelo de IA
Llama 4 (Scout / Maverick)
por Meta
A dupla MoE de open weights da Meta: 17B de parâmetros ativos, entrada nativa de imagem, contexto de 10M de tokens no papel
$0.60/1M out (Maverick, hosted)
Sem API paga oficial da Meta; tarifas típicas de hospedagem de terceiros mostradas para o Maverick (Scout a partir de ~$0.10/$0.30 por 1M na DeepInfra, $0.11/$0.34 na Groq). O contexto do Scout hospedado é limitado bem abaixo da especificação nominal de 10M (por exemplo ~320K na DeepInfra).
Meta
10M tokens (Scout) / 1M (Maverick)
$0.15/1M in (Maverick, hosted)
$0.60/1M out (Maverick, hosted)
text, vision (image input)
Sim
O que é o Llama 4 (Scout / Maverick)?
Primeiros modelos de open weights nativamente multimodais com mixture-of-experts da Meta, lançados em 5 de abril de 2025. O Scout (109B de parâmetros totais, 16 experts) mira deploy em uma única GPU com contexto nominal de 10M de tokens; o Maverick (400B totais, 128 experts) é o modelo de chat carro-chefe, com janela de 1M de tokens.
Llama 4 (Scout / Maverick): prós e contras
Prós
- Eficiência de MoE: apenas 17B de parâmetros ativos por token (Scout 109B/16 experts, Maverick 400B/128 experts), entregando chat quase classe GPT-4o por uma fração da computação
- Inferência hospedada muito barata: Maverick a partir de cerca de $0.15/1M de entrada e $0.60/1M de saída; Scout a partir de cerca de $0.10/$0.30 na DeepInfra ou $0.11/$0.34 na Groq
- Multimodalidade nativa por early fusion (texto mais imagens, testado com até 8 imagens) em um modelo de open weights
- Maior contexto nominal de qualquer modelo de open weights no lançamento: 10M de tokens no Scout, 1M no Maverick
- O Scout cabe em uma única GPU H100 com quantização Int4; pré-treinado em 200 idiomas
- Alta vazão: 17B de parâmetros ativos alcançam 500+ tokens/s em provedores rápidos (a Groq lista o Scout a 594 TPS)
Contras
- Confiança nos benchmarks abalada: a Meta submeteu ao LMArena uma variante do Maverick otimizada para chat e não lançada (ELO 1417), o que os devs chamaram de enganoso já que os pesos públicos pontuam menos
- As promessas de contexto longo desmoronam na prática: o Scout marcou ~15.6% em 128K no Fiction.LiveBench contra 90.6% do Gemini 2.5 Pro, e os provedores hospedados limitam o Scout bem abaixo de 10M (por exemplo ~320K na DeepInfra)
- Código amplamente criticado no r/LocalLlama e no HN, perdendo para o DeepSeek V3 de preço similar em tarefas reais de dev
- Não é open source pela OSI: a licença exclui empresas domiciliadas na UE, exige licença especial acima de 700M de MAU e obriga o uso da marca Llama
- Os 109B/400B de parâmetros totais são grandes demais para GPUs de consumo, e a linhagem estagnou: nenhuma variante de raciocínio foi lançada e o Behemoth nunca saiu
O veredicto da arena
Escolha o Llama 4 se você precisa de um modelo multimodal barato, rápido e auto-hospedável para chat de alto volume, extração ou cargas multilíngues fora da UE; o Maverick chega perto da qualidade do GPT-4o por cerca de um décimo do preço. Evite-o para código, raciocínio difícil ou recuperação genuína de um milhão de tokens, onde DeepSeek, Qwen 3 e Gemini claramente o superam. Em relação ao Llama 3.3 70B ele adiciona visão nativa e uma janela maior, mas muitos desenvolvedores acharam o modelo denso mais antigo ou o Qwen mais confiáveis em pura qualidade de texto, e o contexto de 10M é em grande parte um número de papel.
Polegar para cima ou para baixo
Dê seu veredicto
Você recomendaria o Llama 4 (Scout / Maverick) ou avisaria a multidão para ficar longe?
Melhores alternativas ao Llama 4 (Scout / Maverick)
Todas as alternativasO modelo mais rápido da Anthropic: cerca de 90% da habilidade de código do Sonnet 4.5 a $1/$5 por 1M de tokens, contexto de 200K.
O carro-chefe da classe Mythos da Anthropic de junho de 2026: 80.3% no SWE-bench Pro, 11 pontos à frente de todos os outros modelos de fronteira
O Opus da Anthropic de abril de 2026: 87.6% no SWE-bench Verified, contexto de 1M, visão de alta resolução, hoje atrás do Opus 4.8
Compare o Llama 4 (Scout / Maverick) frente a frente
Llama 4 (Scout / Maverick): perguntas frequentes
Quanto custa o Llama 4 (Scout / Maverick) por 1M de tokens?
O Llama 4 (Scout / Maverick) custa $0.15/1M in (Maverick, hosted) por 1M de tokens de entrada e $0.60/1M out (Maverick, hosted) por 1M de tokens de saída. Sem API paga oficial da Meta; tarifas típicas de hospedagem de terceiros mostradas para o Maverick (Scout a partir de ~$0.10/$0.30 por 1M na DeepInfra, $0.11/$0.34 na Groq). O contexto do Scout hospedado é limitado bem abaixo da especificação nominal de 10M (por exemplo ~320K na DeepInfra).