A Meta lançou Llama 4 Scout e Llama 4 Maverick no mesmo dia — 5 de abril de 2025 — e é fácil interpretá-los como “o pequeno” e “o grande”. Essa interpretação está equivocada no aspecto que mais importa para sua conta. Ambos os modelos ativam exatamente 17 bilhões de parâmetros por token. O que difere é o tamanho do grupo de especialistas do qual esses 17 bilhões são selecionados: 16 especialistas no Scout e 128 no Maverick. Todo o restante — a diferença de preço, a diferença de hardware, a diferença nos benchmarks — decorre dessa única escolha arquitetural.
Isso também significa que a intuição habitual de que “modelo maior = respostas melhores” deixa de valer aqui. O Maverick tem 3,7× mais parâmetros no total, mas não apresenta desempenho 3,7× superior, e em alguns benchmarks sequer supera o Scout. Abaixo está a comparação completa lado a lado, fundamentada no cartão técnico publicado pela Meta e nos preços reais dos provedores — incluindo a especificação mais citada e, na prática, efetivamente indisponível.
Principais conclusões
- Mesmo número de parâmetros ativos, diferentes grupos de especialistas. Scout: 109 bilhões de parâmetros no total / 17 bilhões ativos distribuídos entre 16 especialistas. Maverick: 400 bilhões de parâmetros no total / 17 bilhões ativos distribuídos entre 128 especialistas. O custo computacional de inferência por token é quase idêntico; a pegada de memória não é.
- Os 10 milhões de tokens de contexto do Scout são reais, mas é quase certo que você não conseguirá alugá-los. A Meta treinou o Scout para 10 milhões de tokens. Provedores hospedados oferecem entre 128 mil e ~1,3 milhão. Os 10 milhões completos exigem hospedagem própria e um cache KV enorme.
- A vantagem do Maverick concentra-se em raciocínio e programação. GPQA Diamond +12,6 pontos, LiveCodeBench +10,6. Em compreensão de documentos, ambos têm desempenho equivalente — DocVQA é 94,4 para os dois.
- O Scout custa aproximadamente 2,3× menos em uma base mista (US$ 0,15 versus US$ 0,35 por 1 milhão de tokens mistos, numa proporção entrada:saída de 3:1).
- É no hardware local que eles realmente se diferenciam. O Scout cabe em um único H100 de 80 GB com quantização de 4 bits; o Maverick requer cerca de 240 GB com quantização de 4 bits e um host completo com 8 GPUs em FP8.
- Considere o famoso índice de 1417 no LMArena do Maverick como inválido. Esse valor foi obtido a partir de uma variante experimental de chat ainda não lançada, e não dos pesos disponíveis para download.
- Versão de 30 segundos
- Arquitetura: um único parâmetro ajustável, dois modelos muito distintos
- Janela de contexto: 10 milhões na teoria, muito menos na prática
- Benchmarks: onde os 291 bilhões adicionais de parâmetros se manifestam
- Hardware local: VRAM em FP16, FP8 e 4 bits
- Preços das APIs entre provedores
- Qual é o custo real disso
- Licenciamento: leia a cláusula relativa à UE antes de desenvolver seu produto
- Qual escolher?
- Perguntas frequentes
- Conclusão
- Artigos relacionados
Versão de 30 segundos
Escolha Scout se você estiver trabalhando com documentos longos, recuperação de informações, sumarização, OCR ou extração de gráficos e formulários — ou qualquer tarefa de alto volume em que o custo por token se acumule — e especialmente se desejar hospedar localmente em uma única GPU. Escolha Maverick se sua carga de trabalho for genuinamente limitada por raciocínio ou programação, onde sua liderança de dois dígitos nos benchmarks GPQA Diamond e LiveCodeBench justifica o hardware adicional e o custo extra. Para a maioria dos fluxos de trabalho envolvendo documentos e extração, pagar 2,3× mais pelo Maverick praticamente não traz ganhos mensuráveis.
Arquitetura: um único parâmetro ajustável, dois modelos muito distintos
Ambos os modelos são transformadores do tipo mixture-of-experts (mistura de especialistas) que utilizam o que a Meta chama de fusão precoce para multimodalidade nativa — tokens de imagem e texto entram no mesmo backbone, em vez de serem acoplados por um adaptador visual separado. Ambos aceitam texto e imagens e geram apenas texto. Ambos têm corte de conhecimento em agosto de 2024.
A divergência está no roteador. O Scout seleciona entre 16 especialistas, enquanto o Maverick seleciona entre 128. Como apenas 17 bilhões de parâmetros são ativados por token, em qualquer dos dois casos, os custos computacionais são aproximadamente iguais por token — contudo, cada especialista deve estar residente na memória, independentemente de ser ou não ativado em determinado token. É por isso que o Maverick consome 3,7× mais memória que o Scout, embora seja apenas marginalmente mais lento por token, e também é por isso que um modelo esparso de 400 bilhões pode ser disponibilizado a preços que seriam impossíveis para um modelo denso de 400 bilhões.
Uma diferença digna de nota: o Scout foi treinado com cerca de 40 trilhões de tokens, enquanto o Maverick foi treinado com cerca de 22 trilhões. O Scout viu mais dados distribuídos entre menos especialistas; o Maverick viu menos dados distribuídos entre muitos mais especialistas. Isso ajuda a explicar por que o Scout se mantém competitivo em tarefas que exigem amplitude de conhecimento e compreensão de documentos, mas fica atrás em raciocínio avançado.
Janela de contexto: 10 milhões na teoria, muito menos na prática
Este é o número mais citado — e mais enganoso — do lançamento do Llama 4. A Meta anuncia uma janela de contexto “liderança do setor de 10 milhões de tokens” para o Scout, alcançada por meio de um design de atenção entrelaçada sem embeddings posicionais. Já o Maverick é lançado com 1 milhão.
A ressalva: praticamente nenhum provedor hospedado oferece 10 milhões. Na prática, os limites são os seguintes: Groq em torno de 128 mil–131 mil, DeepInfra em torno de 320 mil, Together em torno de 328 mil, Fireworks aproximando-se de 1 milhão e OpenRouter listando o Scout com 1.310.720 tokens, mas com limite de conclusão de 16.384 tokens. Para usar efetivamente 10 milhões de tokens, é necessário hospedar localmente, e então você enfrenta a verdadeira restrição: o cache KV. Em profundidades de vários milhões de tokens, esse cache supera em tamanho os próprios pesos do modelo — justamente por isso os provedores impõem limites.
Portanto, a comparação honesta não é “10 milhões versus 1 milhão”. Ela é mais próxima de ~1,3 milhão versus ~1 milhão nas plataformas que a maioria das pessoas realmente utilizará — uma vantagem real do Scout, mas modesta, e não a diferença de dez vezes sugerida pela ficha técnica. Se você tiver uma demanda genuína de vários milhões de tokens, reserve orçamento para hospedagem local e teste o throughput em grandes profundidades antes de se comprometer.
Benchmarks: onde os 291 bilhões adicionais de parâmetros se manifestam
Todos os valores abaixo são resultados oficiais publicados pela Meta para as variantes Instruct. São números de primeira mão, portanto devem ser interpretados como indicativos, não definitivos.
| Benchmark | Llama 4 Scout | Llama 4 Maverick | Lacuna |
|---|---|---|---|
| MMLU Pro (raciocínio) | 74.3 | 80.5 | +6.2 |
| GPQA Diamond (ciências de pós-graduação) | 57.2 | 69.8 | +12.6 |
| LiveCodeBench (programação) | 32.8 | 43.4 | +10.6 |
| MMMU (raciocínio com imagens) | 69.4 | 73.4 | +4.0 |
| MMMU Pro | 52.2 | 59.6 | +7.4 |
| MathVista | 70.7 | 73.7 | +3.0 |
| ChartQA | 88.8 | 90.0 | +1.2 |
| DocVQA (teste) | 94.4 | 94.4 | 0.0 |
| MGSM (matemática multilíngue) | 90.6 | 92.3 | +1.7 |
| MTOB, metade do livro (inglês → kgv) | 42.2 | 54.0 | +11.8 |
A forma desta tabela é todo o argumento. A vantagem do Maverick é grande e consistente em raciocínio, ciência e programação — um ganho relativo de 22% no GPQA Diamond e de 32% no LiveCodeBench. Em compreensão de documentos e gráficos, ele desmorona completamente: 1,2 ponto no ChartQA e empate técnico no DocVQA.
Se seu fluxo de trabalho envolve extração de faturas, análise de formulários, OCR de recibos ou leitura de gráficos, os próprios números da Meta indicam que o Maverick não lerá seus documentos melhor do que o Scout — e você pagaria cerca de 2,3× por token para obter essa paridade. Esse é o achado mais acionável deste artigo.
Um benchmark que você deve ignorar totalmente: o valor amplamente divulgado de 1417 ELO na LMArena. A Meta submeteu uma "versão experimental de chat" que nunca foi disponibilizada para download nem para acesso geral via API, e pesquisadores descobriram que suas saídas não correspondiam aos pesos publicados no Hugging Face. A LMArena revisou sua política em 8 de abril de 2025, exigindo que submissões de modelos de código aberto correspondam exatamente aos pesos publicados, afirmando que a interpretação da Meta das regras não coincidia com o que espera dos provedores de modelos. Os pesos públicos não modificados obtiveram classificação muito inferior. Qualquer que seja a qualidade real do Maverick em conversação, 1417 não é evidência disso.
Hardware local: VRAM em FP16, FP8 e 4 bits
A memória necessária para os pesos corresponde simplesmente à contagem de parâmetros × bytes por parâmetro, somando-se aproximadamente 15–25% adicionais para o cache KV e sobrecarga de ativações em comprimentos de contexto moderados. Contextos longos elevam significativamente o consumo do cache.
| Precisão | Scout (109B) | Maverick (400B) |
|---|---|---|
| Pesos em BF16/FP16 | ~218 GB | ~800 GB |
| Pesos em FP8 | ~109 GB | ~400 GB |
| Pesos em INT4 | ~55 GB | ~200 GB |
| INT4 prático (com sobrecarga) | ~65 GB | ~240 GB |
| Hardware mínimo realista | 1× H100 80 GB ou um Mac com 128 GB | Servidor multi-GPU (4× H100 em 4 bits) |
A Meta afirma explicitamente que o Scout "cabe em uma única GPU NVIDIA H100" com quantização INT4, e que o Maverick "cabe em um único host H100" — observe a palavra host, que significa um nó com 8 GPUs, não uma única placa. Um nó com 8×H100 fornece 640 GB, o que comporta confortavelmente o Maverick em FP8, mas não em BF16, onde apenas os 800 GB dos pesos já superam a capacidade do nó. O Maverick em precisão total requer memória equivalente à da H200 ou dois nós.
Na prática: o Scout é um modelo para uso em GPU única ou estação de trabalho única, sendo um dos mais capazes que podem ser executados em um Mac Studio com 128 GB. Já o Maverick é exclusivo para data centers. Use a Calculadora de VRAM calculadora
| Especificações | Llama 4 Scout | Llama 4 Maverick |
|---|---|---|
| Desenvolvedor | Meta | Meta |
| Tipo | Multimodal (MoE) | Multimodal (MoE) |
| Parâmetros | 109B no total / 17B ativos (MoE) | 400 bilhões no total / 17 bilhões ativos (MoE) |
| Janela de contexto | 10 milhões | 1 milhão |
| Modalidade | Texto, Imagem → Texto | Texto, Imagem → Texto |
| Licença | Llama 4 Community (restrita à UE) | Llama 4 Community (restrita à UE) |
| Pesos abertos | ✅ Sim | ✅ Sim |
| Preço de entrada (US$/1 milhão) | $0.1 | $0.2 |
| Preço de saída (US$/1 milhão) | $0.3 | $0.8 |
| VRAM (4 bits) | ~65 GB | ~240 GB |
| GPU mínima (local) | H100 80 GB / Mac 128 GB | Servidor multi-GPU |
| Lançado | 2025 | 2025 |
Principais diferenças
- Custo: O Llama 4 Scout é 133% mais barato que o Llama 4 Maverick com base no custo médio por token.
- Contexto: O Llama 4 Scout supera o Maverick na janela de contexto (10 milhões vs 1 milhão) — ideal para documentos extensos, grandes bases de código e entradas grandes em RAG.
- Abertura: ambos possuem pesos abertos, portanto podem ser auto-hospedados ou ajustados. Compare suas necessidades de VRAM acima para saber qual GPU pode executá-los.
- Execute o Llama 4 Scout localmente: ~65 GB em 4 bits (GPU mínima: H100 80 GB / Mac 128 GB).
- Execute o Llama 4 Maverick localmente: ~~240 GB em 4 bits (servidor multi-GPU mínimo).
Qual você deve escolher?
Escolha o Llama 4 Scout se você deseja um custo menor por token para cargas de trabalho de alto volume ou precisa de uma janela de contexto maior.
Escolha o Llama 4 Maverick se ela se encaixar na sua pilha tecnológica atual ou se você preferir a Meta.
→ Estime custos reais no Calculadora de custos de API · verifique o hardware local no Calculadora de VRAM · navegue por todos os 30+ modelos.
Preços das APIs entre provedores
Nenhum dos dois modelos é caro segundo os padrões de ponta; ambos têm preços definidos como inferência aberta de baixo custo. As tarifas abaixo são por 1 milhão de tokens e mudam com frequência.
| Provedor | Scout, entrada/saída | Maverick, entrada/saída |
|---|---|---|
| DeepInfra | $0.10 / $0.30 | $0.20 / $0.80 |
| Groq | $0.11 / $0.34 | — |
| DigitalOcean | — | $0.20 / $0.696 |
| NovitaAI | $0.18 / $0.59 | $0.27 / $0.85 |
| Parasail | — | $0.35 / $1.00 |
| Google Vertex | $0.25 / $0.70 | $0.35 / $1.15 |
A Groq merece destaque no caso do Scout: é ligeiramente mais cara que a DeepInfra, mas oferece entrada em cache por US$ 0,055 por 1 milhão de tokens — o que faz grande diferença em loops de agentes que reenviam milhares de vezes o mesmo prompt do sistema. A Parasail oferece equivalente para o Maverick por US$ 0,17.
Qual é o custo real disso
Suponha uma carga de produção moderada de 100 milhões de tokens de entrada e 20 milhões de tokens de saída por mês, à menor tarifa disponível no mercado principal:
- Scout: (100 × US$ 0,10) + (20 × US$ 0,30) = US$ 16/mês
- Maverick: (100 × US$ 0,20) + (20 × US$ 0,80) = US$ 36/mês
Em um volume dez vezes maior, a diferença passa para US$ 160 vs. US$ 360 por mês. A proporção permanece em torno de 2,25–2,3× independentemente da escala, portanto a decisão não se baseia realmente em dólares absolutos em volumes pequenos — trata-se de avaliar se a superioridade do Maverick em raciocínio e programação justifica um aumento permanente de cerca de duas vezes no custo unitário. Faça seus próprios cálculos na Calculadora de custos de API.
Licenciamento: leia a cláusula relativa à UE antes de desenvolver seu produto
Ambos os modelos são distribuídos sob a Llama 4 Community License Agreement, licença de código aberto comercialmente utilizável, mas não aprovada pela OSI como software livre. Duas restrições têm relevância prática. Primeiro, produtos com mais de 700 milhões de usuários ativos mensais exigem licença específica negociada separadamente com a Meta. Segundo — e muito mais provável de afetar você — a licença restringe o uso multimodal para entidades e indivíduos com domicílio na União Europeia.
Se sua empresa está sediada na UE e planeja usar as capacidades visuais desses modelos, trata-se de uma questão jurídica que deve ser resolvida antes de escrever qualquer código, não depois. Equipes nessa situação frequentemente optam por um modelo alternativo de código aberto com licença mais clara, como versões do Qwen ou do GLM sob licença Apache-2.0 ou MIT.
Qual escolher?
Escolha o Llama 4 Scout se
- Sua carga de trabalho envolve documentos, OCR, formulários, gráficos ou recuperação — áreas em que os benchmarks mostram quase paridade
- Você deseja hospedá-lo localmente em uma única H100, em um Mac com 128 GB ou em um servidor com GPU modesto
- O custo por token se acumula conforme seu volume, e você deseja a economia de ~2,3×
- Você precisa da janela de contexto mais longa disponível e consegue trabalhar dentro dos limites impostos pelos provedores
- Você está em fase de prototipagem e quer o modelo multimodal de código aberto mais barato capaz de atender às suas necessidades
Escolha o Llama 4 Maverick se
- Sua carga de trabalho é genuinamente limitada pelo raciocínio — perguntas e respostas científicas, análise, lógica em múltiplas etapas
- Você está gerando ou revisando código, onde a diferença no LiveCodeBench é de 32% (relativa)
- Você já possui infraestrutura com múltiplas GPUs ou está utilizando-a via API de qualquer forma
- Você precisa do desempenho superior em multilinguismo e tradução demonstrado nos benchmarks MGSM e MTOB
- A precisão em problemas difíceis importa mais do que dobrar seu custo por token
O caminho pragmático para a maioria das equipes: comece com o Scout, meça os resultados e escalone apenas as consultas que falharem. Como ambos os modelos aceitam o mesmo formato de prompt e as mesmas entradas multimodais, rotear consultas difíceis para o Maverick enquanto atende a maior parte delas com o Scout exige pouca engenharia e normalmente supera a padronização em apenas um dos dois modelos.
Perguntas frequentes
O Llama 4 Maverick é melhor que o Llama 4 Scout?
Em raciocínio e programação, claramente sim — o Maverick lidera com uma vantagem de 12,6 pontos no GPQA Diamond e de 10,6 no LiveCodeBench. Em compreensão de documentos e gráficos, os dois modelos ficam praticamente empatados, com pontuações idênticas de 94,4 no DocVQA. O termo ‘melhor’ depende inteiramente de sua carga de trabalho ser limitada pelo raciocínio ou pela extração de informações.
Posso realmente usar a janela de contexto de 10 milhões de tokens do Llama 4 Scout?
Não por meio de uma API hospedada. A Meta treinou o Scout para suportar 10 milhões de tokens, mas os provedores oferecem entre 128 mil e cerca de 1,3 milhão — a Groq limita-se a aproximadamente 131 mil, a DeepInfra a cerca de 320 mil e a Together a cerca de 328 mil. Alcançar 10 milhões exige hospedagem própria, e o cache KV nessa profundidade torna-se maior que os próprios pesos do modelo.
Quanta VRAM preciso para executar o Llama 4 Scout localmente?
Aproximadamente 65 GB em quantização de 4 bits, incluindo sobrecarga, o que cabe em um único H100 de 80 GB — a Meta confirma essa configuração. Em FP8 são necessários cerca de 109 GB e em BF16, cerca de 218 GB. Um Mac Studio com memória unificada de 128 GB consegue executá-lo com quantização.
O Llama 4 Maverick pode ser executado em uma única GPU?
Não. Em 4 bits, ele requer aproximadamente 240 GB, o que equivale a cerca de quatro H100s. A afirmação da Meta de que ele ‘cabe em um único host H100’ refere-se a um nó com 8 GPUs operando em FP8, não a uma única placa. Em BF16, seus 800 GB de pesos ultrapassam até mesmo um nó de 8×H100 com 640 GB.
Quanto mais barato é o Scout em comparação com o Maverick?
Aproximadamente 2,3× mais barato em uma base mista de entrada-saída de 3:1 — cerca de US$ 0,15 por 1 milhão de tokens mistos versus US$ 0,35. Em uma carga de trabalho mensal de 100 milhões de tokens de entrada e 20 milhões de tokens de saída, isso representa US$ 16 contra US$ 36.
Os modelos Llama 4 podem ser usados gratuitamente para fins comerciais?
Em grande parte, sim. A Licença Comunitária Llama 4 permite uso comercial, mas produtos com mais de 700 milhões de usuários ativos mensais exigem um acordo separado com a Meta, e o uso multimodal é restrito para entidades sediadas na União Europeia. Trata-se de um modelo com pesos abertos, não de código aberto conforme definido pela OSI.
Por que a pontuação do Llama 4 Maverick na LMArena foi controversa?
A Meta submeteu uma ‘versão experimental de chat’ ainda não lançada, que obteve 1417 pontos ELO, mas cujas saídas não correspondiam aos pesos publicamente disponíveis para download. A LMArena alterou sua política em 8 de abril de 2025, exigindo que submissões de modelos de código aberto coincidissem exatamente com os pesos publicados; o modelo sem modificações obteve uma classificação substancialmente inferior.
Conclusão
Scout e Maverick são o mesmo mecanismo, com conjuntos de especialistas de tamanhos diferentes, e a decisão entre eles é incomumente clara porque os próprios benchmarks da Meta traçam essa linha para você. O Maverick justifica seu preço premium em raciocínio de nível de pós-graduação e geração de código, onde as diferenças de dois dígitos são demasiado expressivas para serem ignoradas. Já em compreensão de documentos, ele não oferece nenhuma vantagem sobre o Scout — empatam totalmente nessa tarefa, ao mesmo tempo em que custa 2,3× mais por token e exige um rack de data center, em vez de uma única GPU.
Duas ressalvas importantes: a janela de contexto de 10 milhões de tokens anunciada para o Scout não é algo que você possa alugar hoje — planeje com base em cerca de 1,3 milhão de tokens, a menos que você esteja hospedando o modelo localmente. E o valor de 1417 na LMArena para o Maverick deve ser totalmente descartado de sua avaliação; ele mediu um modelo que ninguém pode baixar. Avalie ambos os modelos com base nos benchmarks divulgados nas fichas técnicas e, melhor ainda, em seu próprio conjunto de testes — a lacuna entre o marketing dos fornecedores e os pesos efetivamente disponibilizados foi a lição mais marcante deste lançamento.
