Meta lanzó Llama 4 Scout y Llama 4 Maverick el mismo día —5 de abril de 2025— y resulta fácil interpretarlos como «el pequeño» y «el grande». Esa forma de verlos es incorrecta en el aspecto que más importa para su factura. Ambos modelos activan exactamente 17 000 millones de parámetros por token. Lo que difiere es el tamaño del grupo de expertos del que se extraen esos 17 000 millones: 16 expertos en Scout y 128 en Maverick. Todo lo demás —la brecha de precios, la brecha de hardware, la brecha en los resultados de benchmarks— deriva directamente de esa única decisión arquitectónica.
Esto también significa que la intuición habitual de «modelo más grande, respuestas mejores» deja de ser válida aquí. Maverick tiene 3,7 veces más parámetros en total, pero no funciona 3,7 veces mejor, y en algunos benchmarks ni siquiera funciona mejor. A continuación se presenta la comparación completa lado a lado, basada en la ficha técnica publicada por Meta y en los precios reales de los proveedores —incluida la especificación que se cita constantemente y que, en la práctica, es efectivamente inaccesible.
Conclusiones clave
- Mismo número de parámetros activos, distintos grupos de expertos. Scout tiene 109 000 millones de parámetros totales / 17 000 millones activos distribuidos entre 16 expertos. Maverick tiene 400 000 millones de parámetros totales / 17 000 millones activos distribuidos entre 128 expertos. El cómputo de inferencia por token es casi idéntico; la huella de memoria no lo es.
- Los 10 millones de tokens de contexto de Scout son reales, pero muy probablemente no podrá alquilarlos. Meta entrenó Scout para 10 millones de tokens. Los proveedores alojados ofrecen entre 128 K y ~1,3 M. Los 10 millones completos requieren autoalojamiento y una caché KV enormemente grande.
- La ventaja de Maverick se concentra en razonamiento y programación. GPQA Diamond +12,6 puntos, LiveCodeBench +10,6. En comprensión de documentos ambos están empatados: DocVQA es 94,4 para ambos.
- Scout cuesta aproximadamente 2,3 veces menos en una base combinada (0,15 USD frente a 0,35 USD por cada millón de tokens combinados, con una relación entrada:salida de 3:1).
- El hardware local es donde realmente se separan. Scout cabe en una sola GPU H100 de 80 GB con cuantización de 4 bits; Maverick necesita unos 240 GB con cuantización de 4 bits y un servidor completo de 8 GPUs en FP8.
- Considere nulo el famoso puntaje de 1417 en LMArena de Maverick. Ese valor proviene de una variante experimental de chat no lanzada, no de los pesos descargables.
- Versión de 30 segundos
- Arquitectura: un solo ajuste, dos modelos muy distintos
- Ventana de contexto: 10 millones en teoría, mucho menos en la práctica
- Benchmarks: dónde se manifiestan los 291 000 millones de parámetros adicionales
- Hardware local: VRAM en FP16, FP8 y 4 bits
- Precios de la API entre distintos proveedores
- Cuál es su costo real
- Licencias: lea la cláusula para la UE antes de desarrollar
- ¿Cuál debería elegir?
- Preguntas frecuentes
- Conclusión
- Artículos relacionados
Versión de 30 segundos
Elija Scout si trabaja con documentos largos, recuperación de información, resúmenes, OCR o extracción de gráficos o formularios, o cualquier tarea de alto volumen donde el costo por token se acumule —y especialmente si desea autoalojarlo en una sola GPU. Elija Maverick si su carga de trabajo depende genuinamente del razonamiento o de la programación, donde su ventaja de dos dígitos en GPQA Diamond y LiveCodeBench justifica el hardware adicional y el gasto extra. Para la mayoría de las canalizaciones de documentos y extracción, pagar 2,3 veces más por Maverick prácticamente no le aporta ningún beneficio medible.
Arquitectura: un solo ajuste, dos modelos muy distintos
Ambos modelos son transformadores de mezcla de expertos que emplean lo que Meta denomina fusión temprana para multimodalidad nativa: los tokens de imagen y texto ingresan al mismo esqueleto, en lugar de unirse mediante un adaptador visual independiente. Ambos aceptan texto e imágenes y generan texto. Ambos tienen una fecha de corte de conocimiento de agosto de 2024.
La diferencia radica en el enrutador. Scout selecciona entre 16 expertos, mientras que Maverick lo hace entre 128. Como únicamente se activan 17 000 millones de parámetros por token en cualquiera de los dos casos, ambos tienen costos de cómputo similares por token —pero cada experto debe residir en memoria, independientemente de si se activa o no en un token determinado. Por eso Maverick ocupa 3,7 veces más memoria que Scout, aunque sea solo marginalmente más lento por token, y también por eso un modelo disperso de 400 000 millones de parámetros puede ofrecerse a precios que serían imposibles para un modelo denso de 400 000 millones de parámetros.
Una diferencia digna de mención: Scout se entrenó con aproximadamente 40 billones de tokens, mientras que Maverick lo hizo con unos 22 billones. Scout vio más datos repartidos entre menos expertos; Maverick vio menos datos repartidos entre muchos más. Esto ayuda a explicar por qué Scout mantiene un buen desempeño en tareas que exigen amplitud de conocimientos y comprensión de documentos, mientras que queda atrás en razonamiento complejo.
Ventana de contexto: 10 millones en teoría, mucho menos en la práctica
Este es el número más citado y más engañoso del lanzamiento de Llama 4. Meta anuncia una ventana de contexto «líder en la industria de 10 millones de tokens» para Scout, lograda mediante un diseño de atención entrelazada sin incrustaciones posicionales. Maverick se lanza con 1 millón.
La trampa: prácticamente ningún proveedor alojado ofrece 10 millones. En la práctica, los límites son los siguientes: Groq alrededor de 128 K–131 K, DeepInfra alrededor de 320 K, Together alrededor de 328 K, Fireworks acercándose a 1 M y la lista de Scout en OpenRouter muestra 1 310 720 tokens con un límite de finalización de 16 384 tokens. Para usar realmente los 10 millones de tokens debe autoalojarlo, y entonces se encontrará con la verdadera limitación: la caché KV. A profundidades de varios millones de tokens, dicha caché supera ampliamente el tamaño de los propios pesos del modelo, precisamente por eso los proveedores la limitan.
Así que la comparación honesta no es «10 M frente a 1 M». Se acerca más bien a ~1,3 M frente a ~1 M en las plataformas que la mayoría de las personas usarán realmente: una ventaja real de Scout, pero estrecha, y no la brecha de diez a uno que sugiere la hoja de especificaciones. Si tiene una necesidad genuina de varios millones de tokens, presupueste el autoalojamiento y pruebe el rendimiento a gran profundidad antes de comprometerse.
Benchmarks: dónde se manifiestan los 291 000 millones de parámetros adicionales
Todos los valores que aparecen a continuación corresponden a los resultados publicados por Meta para las variantes Instruct. Son cifras de primera mano, así que interpréteselas como orientativas y no como definitivas.
| Benchmark | Llama 4 Scout | Llama 4 Maverick | Diferencia |
|---|---|---|---|
| MMLU Pro (razonamiento) | 74.3 | 80.5 | +6.2 |
| GPQA Diamond (ciencias graduadas) | 57.2 | 69.8 | +12.6 |
| LiveCodeBench (programación) | 32.8 | 43.4 | +10.6 |
| MMMU (razonamiento con imágenes) | 69.4 | 73.4 | +4.0 |
| MMMU Pro | 52.2 | 59.6 | +7.4 |
| MathVista | 70.7 | 73.7 | +3.0 |
| ChartQA | 88.8 | 90.0 | +1.2 |
| DocVQA (prueba) | 94.4 | 94.4 | 0.0 |
| MGSM (matemáticas multilingües) | 90.6 | 92.3 | +1.7 |
| MTOB, mitad de libro (inglés → kgv) | 42.2 | 54.0 | +11.8 |
La forma de esta tabla es todo el argumento. La ventaja de Maverick es grande y consistente en razonamiento, ciencia y programación —una mejora relativa del 22 % en GPQA Diamond y del 32 % en LiveCodeBench. En comprensión de documentos y gráficos, su rendimiento se desploma por completo: 1,2 puntos en ChartQA y empate técnico en DocVQA.
Si su flujo de trabajo implica extracción de facturas, análisis de formularios, OCR de recibos o lectura de gráficos, los propios datos de Meta indican que Maverick no leerá sus documentos mejor que Scout —y además pagaría aproximadamente 2,3 veces más por token para lograr esa paridad. Este es el hallazgo más práctico y directamente aplicable del análisis.
Un benchmark que debería ignorar por completo: el puntaje de 1417 ELO en LMArenaque Maverick ha difundido ampliamente. Meta presentó una «versión experimental de chat» que nunca se lanzó para descarga ni para acceso general mediante API, y los investigadores descubrieron que sus salidas no coincidían con los pesos publicados en Hugging Face. LMArena revisó su política el 8 de abril de 2025 para exigir que las presentaciones de modelos de código abierto coincidan con los pesos publicados, señalando que la interpretación de las reglas por parte de Meta no concordaba con lo que espera de los proveedores de modelos. Los pesos públicos sin modificar obtuvieron una puntuación mucho más baja. Cualquiera que sea la verdadera calidad conversacional de Maverick, el valor 1417 no constituye evidencia de ella.
Hardware local: VRAM en FP16, FP8 y 4 bits
La memoria requerida para los pesos equivale simplemente al número de parámetros multiplicado por los bytes por parámetro, a lo que hay que sumar aproximadamente un 15–25 % adicional para la caché KV y la sobrecarga de activaciones en longitudes de contexto moderadas. Contextos largos incrementan considerablemente dicha caché.
| Precisión | Scout (109 000 millones) | Maverick (400 000 millones) |
|---|---|---|
| Pesos en BF16/FP16 | ~218 GB | ~800 GB |
| Pesos en FP8 | ~109 GB | ~400 GB |
| Pesos en INT4 | ~55 GB | ~200 GB |
| INT4 práctico (con sobrecarga) | ~65 GB | ~240 GB |
| Hardware mínimo realista | 1× H100 de 80 GB o una Mac de 128 GB | Servidor multi-GPU (4× H100 a 4 bits) |
Meta afirma expresamente que Scout «cabe en una sola GPU NVIDIA H100» con cuantización INT4, y que Maverick «cabe en un solo host H100» —observe la palabra host, que significa un nodo de 8 GPU, no una sola tarjeta. Un nodo de 8×H100 ofrece 640 GB, suficiente para alojar cómodamente a Maverick en FP8, pero no en BF16, donde los 800 GB exclusivos de los pesos superan la capacidad del nodo. Maverick en precisión completa requiere memoria de clase H200 o dos nodos.
En la práctica: Scout es un modelo para una sola GPU o una estación de trabajo individual, y uno de los más capaces que puede ejecutarse en una Mac Studio de 128 GB. Maverick está reservado exclusivamente para centros de datos. Use la Calculadora de VRAM calculadora
| Especificaciones | Llama 4 Scout | Llama 4 Maverick |
|---|---|---|
| Desarrollador | Meta | Meta |
| Tipo | Multimodal (MoE) | Multimodal (MoE) |
| Parámetros | 109B totales / 17B activos (MoE) | 400 000 millones totales / 17 000 millones activos (MoE) |
| Ventana de contexto | 10M | 1 millón |
| Modalidad | Texto, imagen → texto | Texto, imagen → texto |
| Licencia | Llama 4 Community (restringido en la UE) | Llama 4 Community (restringido en la UE) |
| Pesos abiertos | ✅ Sí | ✅ Sí |
| Precio de entrada (USD/millón) | $0.1 | $0.2 |
| Precio de salida (USD/millón) | $0.3 | $0.8 |
| VRAM (4 bits) | ~65 GB | ~240 GB |
| GPU mínima (local) | H100 de 80 GB / Mac de 128 GB | Servidor multi-GPU |
| Lanzado | 2025 | 2025 |
Diferencias clave
- Coste: Llama 4 Scout es un 133 % más económico que Llama 4 Maverick en términos de coste promedio por token.
- Contexto: Llama 4 Scout destaca en la ventana de contexto (10M frente a 1M), lo que lo hace ideal para documentos extensos, grandes bases de código y entradas RAG de gran tamaño.
- Grado de apertura: ambos tienen pesos abiertos, por lo que cualquiera puede alojarse localmente o ajustarse finamente. Compara sus necesidades de VRAM arriba para ver qué GPU puedes utilizar.
- Ejecución local de Llama 4 Scout: ~65 GB a 4 bits (mínimo: H100 de 80 GB / Mac de 128 GB).
- Ejecute Llama 4 Maverick localmente: ~240 GB a 4 bits (servidor multi-GPU mínimo).
¿Cuál deberías elegir?
Selecciona Llama 4 Scout si buscas un menor coste por token para cargas de trabajo de alto volumen, o necesitas una ventana de contexto más amplia.
Elija Llama 4 Maverick si se integra bien en tu pila tecnológica existente o si prefieres Meta.
→ Estime los costes reales en la Calculadora de costos de API · verifique el hardware local en la Calculadora de VRAM · explore todos los 30+ modelos.
Precios de la API entre distintos proveedores
Ninguno de los dos modelos resulta caro según los estándares de vanguardia; ambos se comercializan como inferencia abierta de bajo costo. Las tarifas que figuran a continuación corresponden a cada millón de tokens y varían con frecuencia.
| Proveedor | Scout: entrada / salida | Maverick: entrada / salida |
|---|---|---|
| DeepInfra | $0.10 / $0.30 | $0.20 / $0.80 |
| Groq | $0.11 / $0.34 | — |
| DigitalOcean | — | $0.20 / $0.696 |
| NovitaAI | $0.18 / $0.59 | $0.27 / $0.85 |
| Parasail | — | $0.35 / $1.00 |
| Google Vertex | $0.25 / $0.70 | $0.35 / $1.15 |
Groq destaca especialmente para Scout: es ligeramente más costoso que DeepInfra, pero ofrece entrada en caché a 0,055 USD por millón de tokens, lo cual resulta muy relevante para bucles de agentes que reenvían miles de veces el mismo mensaje del sistema. Parasail ofrece una opción equivalente para Maverick a 0,17 USD.
Cuál es su costo real
Suponga una carga de producción moderada de 100 millones de tokens de entrada y 20 millones de tokens de salida mensuales, al precio más bajo disponible en los principales proveedores:
- Scout: (100 × 0,10 USD) + (20 × 0,30 USD) = 16 USD/mes
- Maverick: (100 × 0,20 USD) + (20 × 0,80 USD) = 36 USD/mes
A diez veces ese volumen, la diferencia pasa a ser de 160 USD frente a 360 USD mensuales. La relación se mantiene aproximadamente en 2,25–2,3× independientemente de la escala, por lo que la decisión no depende tanto de los dólares absolutos en volúmenes pequeños, sino de si la superioridad de Maverick en razonamiento y programación justifica duplicar permanentemente el costo unitario. Calcule sus propios números con la Calculadora de costos de API.
Licencias: lea la cláusula para la UE antes de desarrollar
Ambos modelos se distribuyen bajo el Acuerdo de Licencia Comunitaria Llama 4, que permite el uso de código abierto y es comercialmente viable, pero no está aprobado por la OSI como software de código abierto. Dos restricciones son relevantes en la práctica. Primero, los productos que superen los 700 millones de usuarios activos mensuales requieren una licencia específica negociada con Meta. Segundo —y mucho más probable que le afecte—, la licencia restringe el uso multimodal para entidades y particulares con domicilio en la Unión Europea.
Si usted es una empresa con sede en la UE y planea usar las capacidades visuales, esto constituye una cuestión jurídica que debe resolverse antes de escribir código, no después. Los equipos en esa situación suelen optar por un modelo alternativo de código abierto con una licencia más clara, como Qwen o GLM publicados bajo licencias Apache-2.0 o MIT.
¿Cuál debería elegir?
Elija Llama 4 Scout si
- Su carga de trabajo implica documentos, OCR, formularios, gráficos o recuperación de información —donde los benchmarks muestran una casi paridad
- Desea alojarlo usted mismo en una sola H100, una Mac de 128 GB o una configuración modesta de GPU
- El costo por token se acumula según su volumen, y usted desea el ahorro de aproximadamente 2,3×
- Necesita la ventana de contexto más larga disponible y puede trabajar dentro de los límites impuestos por los proveedores
- Está realizando prototipos y busca el modelo multimodal de código abierto más económico que sea capaz de cumplir con sus necesidades
Elija Llama 4 Maverick si
- Su carga de trabajo depende genuinamente del razonamiento: preguntas y respuestas científicas, análisis, lógica de múltiples pasos
- Está generando o revisando código, donde la brecha en LiveCodeBench es del 32 % relativo
- Ya dispone de infraestructura con múltiples GPU o bien la utiliza mediante una API de todos modos
- Necesita un mejor rendimiento multilingüe y de traducción, como se demuestra en MGSM y MTOB
- La precisión en problemas difíciles importa más que duplicar su costo por token
La ruta pragmática para la mayoría de los equipos es: comenzar con Scout, medir los resultados y escalar únicamente las consultas que fallen. Como ambos modelos aceptan el mismo formato de indicación (prompt) y las mismas entradas multimodales, enrutar las consultas difíciles a Maverick mientras se atiende la mayor parte con Scout requiere muy poca ingeniería y, por lo general, supera a la estrategia de estandarizar en uno u otro modelo.
Preguntas frecuentes
¿Es Llama 4 Maverick mejor que Llama 4 Scout?
En razonamiento y programación, claramente sí: Maverick lidera con una ventaja de 12,6 puntos en GPQA Diamond y de 10,6 en LiveCodeBench. En comprensión de documentos y gráficos, ambos modelos están prácticamente empatados, con idénticas puntuaciones de 94,4 en DocVQA. Lo que significa «mejor» depende enteramente de si su carga de trabajo exige principalmente razonamiento o extracción de información.
¿Puedo realmente usar el contexto de 10 millones de tokens de Llama 4 Scout?
No mediante una API alojada. Meta entrenó Scout para admitir 10 millones de tokens, pero los proveedores ofrecen entre 128 K y aproximadamente 1,3 M: Groq tiene un límite de unos 131 K, DeepInfra de unos 320 K y Together de unos 328 K. Alcanzar los 10 millones requiere autoalojamiento, y la caché KV a esa profundidad se vuelve mayor que los propios pesos del modelo.
¿Cuánta VRAM necesito para ejecutar Llama 4 Scout localmente?
Aproximadamente 65 GB en cuantización de 4 bits, incluidas las sobrecargas, lo que cabe en una sola GPU H100 de 80 GB; Meta confirma esta configuración. En FP8 se necesitan unos 109 GB y en BF16 unos 218 GB. Un Mac Studio con memoria unificada de 128 GB puede ejecutarlo con cuantización.
¿Puede Llama 4 Maverick ejecutarse en una sola GPU?
No. En cuantización de 4 bits necesita aproximadamente 240 GB, lo que equivale a unos cuatro H100. La afirmación de Meta de que «cabe en un único host H100» hace referencia a un nodo de 8 GPU en FP8, no a una sola tarjeta. En BF16, sus pesos de 800 GB superan incluso un nodo de 8×H100 de 640 GB.
¿Cuánto más barato es Scout que Maverick?
Aproximadamente 2,3 veces más económico en una base combinada entrada:salida de 3:1: unos 0,15 USD por cada millón de tokens combinados frente a 0,35 USD. En una carga de trabajo mensual de 100 millones de tokens de entrada y 20 millones de tokens de salida, eso representa 16 USD frente a 36 USD.
¿Los modelos Llama 4 son gratuitos para uso comercial?
En su mayor parte sí. La Licencia Comunitaria de Llama 4 permite el uso comercial, pero los productos con más de 700 millones de usuarios activos mensuales requieren un acuerdo separado con Meta, y el uso multimodal está restringido para entidades con domicilio en la UE. Es de pesos abiertos, pero no es código abierto según la definición de la OSI.
¿Por qué fue controvertida la puntuación de Llama 4 Maverick en LMArena?
Meta presentó una «versión experimental de chat» aún no lanzada, que obtuvo 1417 puntos ELO, pero cuyas salidas no coincidían con los pesos públicamente disponibles. El 8 de abril de 2025, LMArena modificó su política para exigir que las versiones de código abierto enviadas coincidan exactamente con los pesos publicados; bajo esta nueva regla, el modelo sin modificaciones obtuvo una puntuación sustancialmente menor.
Conclusión
Scout y Maverick son el mismo motor, pero con grupos de expertos de distinto tamaño, y la decisión entre ellos es inusualmente clara porque los propios benchmarks de Meta trazan la línea para usted. Maverick justifica su precio superior en tareas de razonamiento y generación de código a nivel de posgrado, donde las diferencias de dos dígitos son demasiado grandes como para discutirlas. En cambio, no aporta ninguna ventaja en comprensión de documentos, donde empata completamente con Scout al tiempo que cuesta 2,3× más por token y requiere un rack de centro de datos en lugar de una sola GPU.
Dos advertencias importantes: la cifra destacada de 10 millones de tokens para el contexto de Scout no es algo que pueda alquilar hoy en día; planifique su uso en torno a unos 1,3 millones, a menos que vaya a alojarlo usted mismo. Asimismo, debe descartar por completo de su evaluación la puntuación de 1417 en LMArena de Maverick, ya que corresponde a un modelo que nadie puede descargar. Evalúe ambos modelos exclusivamente según los benchmarks oficiales publicados en sus fichas técnicas y, aún mejor, según su propio conjunto de pruebas: la brecha entre el marketing de los proveedores y los pesos efectivamente distribuidos ha sido la lección clave de este lanzamiento.
