{"id":1277,"date":"2026-06-23T14:45:04","date_gmt":"2026-06-23T14:45:04","guid":{"rendered":"https:\/\/convly.ai\/?p=1277"},"modified":"2026-08-26T12:38:32","modified_gmt":"2026-08-26T12:38:32","slug":"llama-4-scout-vs-llama-4-maverick","status":"publish","type":"post","link":"https:\/\/convly.ai\/es\/llama-4-scout-vs-llama-4-maverick\/","title":{"rendered":"Llama 4 Scout frente a Llama 4 Maverick: especificaciones, precios y cu\u00e1l elegir (2026)"},"content":{"rendered":"<p>Meta lanz\u00f3 <strong>Llama 4 Scout<\/strong> y <strong>Llama 4 Maverick<\/strong> el mismo d\u00eda \u20145 de abril de 2025\u2014 y resulta f\u00e1cil interpretarlos como \u00abel peque\u00f1o\u00bb y \u00abel grande\u00bb. Esa forma de verlos es incorrecta en el aspecto que m\u00e1s importa para su factura. Ambos modelos activan <strong>exactamente 17 000 millones de par\u00e1metros por token<\/strong>. Lo que difiere es el tama\u00f1o del grupo de expertos del que se extraen esos 17 000 millones: 16 expertos en Scout y 128 en Maverick. Todo lo dem\u00e1s \u2014la brecha de precios, la brecha de hardware, la brecha en los resultados de benchmarks\u2014 deriva directamente de esa \u00fanica decisi\u00f3n arquitect\u00f3nica.<\/p>\n<p>Esto tambi\u00e9n significa que la intuici\u00f3n habitual de \u00abmodelo m\u00e1s grande, respuestas mejores\u00bb deja de ser v\u00e1lida aqu\u00ed. Maverick tiene 3,7 veces m\u00e1s par\u00e1metros en total, pero no funciona 3,7 veces mejor, y en algunos benchmarks ni siquiera funciona mejor. A continuaci\u00f3n se presenta la comparaci\u00f3n completa lado a lado, basada en la ficha t\u00e9cnica publicada por Meta y en los precios reales de los proveedores \u2014incluida la especificaci\u00f3n que se cita constantemente y que, en la pr\u00e1ctica, es efectivamente inaccesible.<\/p>\n<div class=\"convly-tldr\">\n<h3>Conclusiones clave<\/h3>\n<ul>\n<li><strong>Mismo n\u00famero de par\u00e1metros activos, distintos grupos de expertos.<\/strong> Scout tiene 109 000 millones de par\u00e1metros totales \/ 17 000 millones activos distribuidos entre 16 expertos. Maverick tiene 400 000 millones de par\u00e1metros totales \/ 17 000 millones activos distribuidos entre 128 expertos. El c\u00f3mputo de inferencia por token es casi id\u00e9ntico; la huella de memoria no lo es.<\/li>\n<li><strong>Los 10 millones de tokens de contexto de Scout son reales, pero muy probablemente no podr\u00e1 alquilarlos.<\/strong> Meta entren\u00f3 Scout para 10 millones de tokens. Los proveedores alojados ofrecen entre 128 K y ~1,3 M. Los 10 millones completos requieren autoalojamiento y una cach\u00e9 KV enormemente grande.<\/li>\n<li><strong>La ventaja de Maverick se concentra en razonamiento y programaci\u00f3n.<\/strong> GPQA Diamond +12,6 puntos, LiveCodeBench +10,6. En comprensi\u00f3n de documentos ambos est\u00e1n empatados: DocVQA es 94,4 para ambos.<\/li>\n<li><strong>Scout cuesta aproximadamente 2,3 veces menos en una base combinada<\/strong> (0,15 USD frente a 0,35 USD por cada mill\u00f3n de tokens combinados, con una relaci\u00f3n entrada:salida de 3:1).<\/li>\n<li><strong>El hardware local es donde realmente se separan.<\/strong> Scout cabe en una sola GPU H100 de 80 GB con cuantizaci\u00f3n de 4 bits; Maverick necesita unos 240 GB con cuantizaci\u00f3n de 4 bits y un servidor completo de 8 GPUs en FP8.<\/li>\n<li><strong>Considere nulo el famoso puntaje de 1417 en LMArena de Maverick.<\/strong> Ese valor proviene de una variante experimental de chat no lanzada, no de los pesos descargables.<\/li>\n<\/ul>\n<\/div>\n<div id=\"ez-toc-container\" class=\"ez-toc-v2_0_88 counter-flat ez-toc-counter ez-toc-container-direction\">\n<label for=\"ez-toc-cssicon-toggle-item-6ab5975f0fb78\" class=\"ez-toc-cssicon-toggle-label\"><span class=\"\"><span class=\"eztoc-hide\" style=\"display:none;\">Alternar<\/span><span class=\"ez-toc-icon-toggle-span\"><svg style=\"fill: #000000;color:#000000\" xmlns=\"http:\/\/www.w3.org\/2000\/svg\" class=\"list-377408\" width=\"20px\" height=\"20px\" viewbox=\"0 0 24 24\" fill=\"none\"><path d=\"M6 6H4v2h2V6zm14 0H8v2h12V6zM4 11h2v2H4v-2zm16 0H8v2h12v-2zM4 16h2v2H4v-2zm16 0H8v2h12v-2z\" fill=\"currentColor\"><\/path><\/svg><svg style=\"fill: #000000;color:#000000\" class=\"arrow-unsorted-368013\" xmlns=\"http:\/\/www.w3.org\/2000\/svg\" width=\"10px\" height=\"10px\" viewbox=\"0 0 24 24\" version=\"1.2\" baseprofile=\"tiny\"><path d=\"M18.2 9.3l-6.2-6.3-6.2 6.3c-.2.2-.3.4-.3.7s.1.5.3.7c.2.2.4.3.7.3h11c.3 0 .5-.1.7-.3.2-.2.3-.5.3-.7s-.1-.5-.3-.7zM5.8 14.7l6.2 6.3 6.2-6.3c.2-.2.3-.5.3-.7s-.1-.5-.3-.7c-.2-.2-.4-.3-.7-.3h-11c-.3 0-.5.1-.7.3-.2.2-.3.5-.3.7s.1.5.3.7z\"\/><\/svg><\/span><\/span><\/label><input type=\"checkbox\"  id=\"ez-toc-cssicon-toggle-item-6ab5975f0fb78\"  aria-label=\"Alternar\" \/><nav><ul class='ez-toc-list ez-toc-list-level-1' ><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-1\" href=\"https:\/\/convly.ai\/es\/llama-4-scout-vs-llama-4-maverick\/#The_30-second_version\" >Versi\u00f3n de 30 segundos<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-2\" href=\"https:\/\/convly.ai\/es\/llama-4-scout-vs-llama-4-maverick\/#Architecture_one_knob_two_very_different_models\" >Arquitectura: un solo ajuste, dos modelos muy distintos<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-3\" href=\"https:\/\/convly.ai\/es\/llama-4-scout-vs-llama-4-maverick\/#Context_window_10M_on_paper_far_less_in_practice\" >Ventana de contexto: 10 millones en teor\u00eda, mucho menos en la pr\u00e1ctica<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-4\" href=\"https:\/\/convly.ai\/es\/llama-4-scout-vs-llama-4-maverick\/#Benchmarks_where_the_extra_291B_parameters_show_up\" >Benchmarks: d\u00f3nde se manifiestan los 291 000 millones de par\u00e1metros adicionales<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-5\" href=\"https:\/\/convly.ai\/es\/llama-4-scout-vs-llama-4-maverick\/#Local_hardware_VRAM_at_FP16_FP8_and_4-bit\" >Hardware local: VRAM en FP16, FP8 y 4 bits<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-6\" href=\"https:\/\/convly.ai\/es\/llama-4-scout-vs-llama-4-maverick\/#API_pricing_across_providers\" >Precios de la API entre distintos proveedores<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-7\" href=\"https:\/\/convly.ai\/es\/llama-4-scout-vs-llama-4-maverick\/#What_this_actually_costs\" >Cu\u00e1l es su costo real<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-8\" href=\"https:\/\/convly.ai\/es\/llama-4-scout-vs-llama-4-maverick\/#Licensing_read_the_EU_clause_before_you_build\" >Licencias: lea la cl\u00e1usula para la UE antes de desarrollar<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-9\" href=\"https:\/\/convly.ai\/es\/llama-4-scout-vs-llama-4-maverick\/#Which_should_you_pick\" >\u00bfCu\u00e1l deber\u00eda elegir?<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-10\" href=\"https:\/\/convly.ai\/es\/llama-4-scout-vs-llama-4-maverick\/#Frequently_asked_questions\" >Preguntas frecuentes<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-11\" href=\"https:\/\/convly.ai\/es\/llama-4-scout-vs-llama-4-maverick\/#Bottom_line\" >Conclusi\u00f3n<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-12\" href=\"https:\/\/convly.ai\/es\/llama-4-scout-vs-llama-4-maverick\/#Related_articles\" >Art\u00edculos relacionados<\/a><\/li><\/ul><\/nav><\/div>\n<h2><span class=\"ez-toc-section\" id=\"The_30-second_version\"><\/span>Versi\u00f3n de 30 segundos<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Elija <strong>Scout<\/strong> si trabaja con documentos largos, recuperaci\u00f3n de informaci\u00f3n, res\u00famenes, OCR o extracci\u00f3n de gr\u00e1ficos o formularios, o cualquier tarea de alto volumen donde el costo por token se acumule \u2014y especialmente si desea autoalojarlo en una sola GPU. Elija <strong>Maverick<\/strong> si su carga de trabajo depende genuinamente del razonamiento o de la programaci\u00f3n, donde su ventaja de dos d\u00edgitos en GPQA Diamond y LiveCodeBench justifica el hardware adicional y el gasto extra. Para la mayor\u00eda de las canalizaciones de documentos y extracci\u00f3n, pagar 2,3 veces m\u00e1s por Maverick pr\u00e1cticamente no le aporta ning\u00fan beneficio medible.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Architecture_one_knob_two_very_different_models\"><\/span>Arquitectura: un solo ajuste, dos modelos muy distintos<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Ambos modelos son transformadores de mezcla de expertos que emplean lo que Meta denomina <em>fusi\u00f3n temprana<\/em> para multimodalidad nativa: los tokens de imagen y texto ingresan al mismo esqueleto, en lugar de unirse mediante un adaptador visual independiente. Ambos aceptan texto e im\u00e1genes y generan texto. Ambos tienen una fecha de corte de conocimiento de agosto de 2024.<\/p>\n<p>La diferencia radica en el enrutador. Scout selecciona entre 16 expertos, mientras que Maverick lo hace entre 128. Como \u00fanicamente se activan 17 000 millones de par\u00e1metros por token en cualquiera de los dos casos, ambos tienen costos de c\u00f3mputo similares <em>por token<\/em> \u2014pero cada experto debe residir en memoria, independientemente de si se activa o no en un token determinado. Por eso Maverick ocupa 3,7 veces m\u00e1s memoria que Scout, aunque sea solo marginalmente m\u00e1s lento por token, y tambi\u00e9n por eso un modelo disperso de 400 000 millones de par\u00e1metros puede ofrecerse a precios que ser\u00edan imposibles para un modelo denso de 400 000 millones de par\u00e1metros.<\/p>\n<p>Una diferencia digna de menci\u00f3n: Scout se entren\u00f3 con aproximadamente 40 billones de tokens, mientras que Maverick lo hizo con unos 22 billones. Scout vio m\u00e1s datos repartidos entre menos expertos; Maverick vio menos datos repartidos entre muchos m\u00e1s. Esto ayuda a explicar por qu\u00e9 Scout mantiene un buen desempe\u00f1o en tareas que exigen amplitud de conocimientos y comprensi\u00f3n de documentos, mientras que queda atr\u00e1s en razonamiento complejo.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Context_window_10M_on_paper_far_less_in_practice\"><\/span>Ventana de contexto: 10 millones en teor\u00eda, mucho menos en la pr\u00e1ctica<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Este es el n\u00famero m\u00e1s citado y m\u00e1s enga\u00f1oso del lanzamiento de Llama 4. Meta anuncia una ventana de contexto \u00abl\u00edder en la industria de 10 millones de tokens\u00bb para Scout, lograda mediante un dise\u00f1o de atenci\u00f3n entrelazada sin incrustaciones posicionales. Maverick se lanza con 1 mill\u00f3n.<\/p>\n<p>La trampa: <strong>pr\u00e1cticamente ning\u00fan proveedor alojado ofrece 10 millones.<\/strong> En la pr\u00e1ctica, los l\u00edmites son los siguientes: Groq alrededor de 128 K\u2013131 K, DeepInfra alrededor de 320 K, Together alrededor de 328 K, Fireworks acerc\u00e1ndose a 1 M y la lista de Scout en OpenRouter muestra 1 310 720 tokens con un l\u00edmite de finalizaci\u00f3n de 16 384 tokens. Para usar realmente los 10 millones de tokens debe autoalojarlo, y entonces se encontrar\u00e1 con la verdadera limitaci\u00f3n: la cach\u00e9 KV. A profundidades de varios millones de tokens, dicha cach\u00e9 supera ampliamente el tama\u00f1o de los propios pesos del modelo, precisamente por eso los proveedores la limitan.<\/p>\n<p>As\u00ed que la comparaci\u00f3n honesta no es \u00ab10 M frente a 1 M\u00bb. Se acerca m\u00e1s bien a <strong>~1,3 M frente a ~1 M<\/strong> en las plataformas que la mayor\u00eda de las personas usar\u00e1n realmente: una ventaja real de Scout, pero estrecha, y no la brecha de diez a uno que sugiere la hoja de especificaciones. Si tiene una necesidad genuina de varios millones de tokens, presupueste el autoalojamiento y pruebe el rendimiento a gran profundidad antes de comprometerse.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Benchmarks_where_the_extra_291B_parameters_show_up\"><\/span>Benchmarks: d\u00f3nde se manifiestan los 291 000 millones de par\u00e1metros adicionales<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Todos los valores que aparecen a continuaci\u00f3n corresponden a los resultados publicados por Meta para las variantes Instruct. Son cifras de primera mano, as\u00ed que interpr\u00e9teselas como orientativas y no como definitivas.<\/p>\n<table class=\"convly-vs\">\n<thead>\n<tr>\n<th>Benchmark<\/th>\n<th>Llama 4 Scout<\/th>\n<th>Llama 4 Maverick<\/th>\n<th>Diferencia<\/th>\n<\/tr>\n<\/thead>\n<tbody>\n<tr>\n<td>MMLU Pro (razonamiento)<\/td>\n<td>74.3<\/td>\n<td class=\"convly-vs-winner\">80.5<\/td>\n<td>+6.2<\/td>\n<\/tr>\n<tr>\n<td>GPQA Diamond (ciencias graduadas)<\/td>\n<td>57.2<\/td>\n<td class=\"convly-vs-winner\">69.8<\/td>\n<td>+12.6<\/td>\n<\/tr>\n<tr>\n<td>LiveCodeBench (programaci\u00f3n)<\/td>\n<td>32.8<\/td>\n<td class=\"convly-vs-winner\">43.4<\/td>\n<td>+10.6<\/td>\n<\/tr>\n<tr>\n<td>MMMU (razonamiento con im\u00e1genes)<\/td>\n<td>69.4<\/td>\n<td class=\"convly-vs-winner\">73.4<\/td>\n<td>+4.0<\/td>\n<\/tr>\n<tr>\n<td>MMMU Pro<\/td>\n<td>52.2<\/td>\n<td class=\"convly-vs-winner\">59.6<\/td>\n<td>+7.4<\/td>\n<\/tr>\n<tr>\n<td>MathVista<\/td>\n<td>70.7<\/td>\n<td class=\"convly-vs-winner\">73.7<\/td>\n<td>+3.0<\/td>\n<\/tr>\n<tr>\n<td>ChartQA<\/td>\n<td>88.8<\/td>\n<td class=\"convly-vs-winner\">90.0<\/td>\n<td>+1.2<\/td>\n<\/tr>\n<tr>\n<td>DocVQA (prueba)<\/td>\n<td>94.4<\/td>\n<td>94.4<\/td>\n<td>0.0<\/td>\n<\/tr>\n<tr>\n<td>MGSM (matem\u00e1ticas multiling\u00fces)<\/td>\n<td>90.6<\/td>\n<td class=\"convly-vs-winner\">92.3<\/td>\n<td>+1.7<\/td>\n<\/tr>\n<tr>\n<td>MTOB, mitad de libro (ingl\u00e9s \u2192 kgv)<\/td>\n<td>42.2<\/td>\n<td class=\"convly-vs-winner\">54.0<\/td>\n<td>+11.8<\/td>\n<\/tr>\n<\/tbody>\n<\/table>\n<p>La forma de esta tabla es todo el argumento. La ventaja de Maverick es <strong>grande y consistente en razonamiento, ciencia y programaci\u00f3n<\/strong> \u2014una mejora relativa del 22 % en GPQA Diamond y del 32 % en LiveCodeBench. En <strong>comprensi\u00f3n de documentos y gr\u00e1ficos, su rendimiento se desploma por completo<\/strong>: 1,2 puntos en ChartQA y empate t\u00e9cnico en DocVQA.<\/p>\n<p>Si su flujo de trabajo implica extracci\u00f3n de facturas, an\u00e1lisis de formularios, OCR de recibos o lectura de gr\u00e1ficos, los propios datos de Meta indican que Maverick no leer\u00e1 sus documentos mejor que Scout \u2014y adem\u00e1s pagar\u00eda aproximadamente 2,3 veces m\u00e1s por token para lograr esa paridad. Este es el hallazgo m\u00e1s pr\u00e1ctico y directamente aplicable del an\u00e1lisis.<\/p>\n<p>Un benchmark que deber\u00eda ignorar por completo: el puntaje de <strong>1417 ELO en LMArena<\/strong>que Maverick ha difundido ampliamente. Meta present\u00f3 una \u00abversi\u00f3n experimental de chat\u00bb que nunca se lanz\u00f3 para descarga ni para acceso general mediante API, y los investigadores descubrieron que sus salidas no coincid\u00edan con los pesos publicados en Hugging Face. LMArena revis\u00f3 su pol\u00edtica el 8 de abril de 2025 para exigir que las presentaciones de modelos de c\u00f3digo abierto coincidan con los pesos publicados, se\u00f1alando que la interpretaci\u00f3n de las reglas por parte de Meta no concordaba con lo que espera de los proveedores de modelos. Los pesos p\u00fablicos sin modificar obtuvieron una puntuaci\u00f3n mucho m\u00e1s baja. Cualquiera que sea la verdadera calidad conversacional de Maverick, el valor 1417 no constituye evidencia de ella.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Local_hardware_VRAM_at_FP16_FP8_and_4-bit\"><\/span>Hardware local: VRAM en FP16, FP8 y 4 bits<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>La memoria requerida para los pesos equivale simplemente al n\u00famero de par\u00e1metros multiplicado por los bytes por par\u00e1metro, a lo que hay que sumar aproximadamente un 15\u201325 % adicional para la cach\u00e9 KV y la sobrecarga de activaciones en longitudes de contexto moderadas. Contextos largos incrementan considerablemente dicha cach\u00e9.<\/p>\n<table class=\"convly-vs\">\n<thead>\n<tr>\n<th>Precisi\u00f3n<\/th>\n<th>Scout (109\u202f000 millones)<\/th>\n<th>Maverick (400\u202f000 millones)<\/th>\n<\/tr>\n<\/thead>\n<tbody>\n<tr>\n<td>Pesos en BF16\/FP16<\/td>\n<td class=\"convly-vs-winner\">~218 GB<\/td>\n<td>~800 GB<\/td>\n<\/tr>\n<tr>\n<td>Pesos en FP8<\/td>\n<td class=\"convly-vs-winner\">~109 GB<\/td>\n<td>~400 GB<\/td>\n<\/tr>\n<tr>\n<td>Pesos en INT4<\/td>\n<td class=\"convly-vs-winner\">~55 GB<\/td>\n<td>~200 GB<\/td>\n<\/tr>\n<tr>\n<td>INT4 pr\u00e1ctico (con sobrecarga)<\/td>\n<td class=\"convly-vs-winner\">~65 GB<\/td>\n<td>~240 GB<\/td>\n<\/tr>\n<tr>\n<td>Hardware m\u00ednimo realista<\/td>\n<td class=\"convly-vs-winner\">1\u00d7 H100 de 80 GB o una Mac de 128 GB<\/td>\n<td>Servidor multi-GPU (4\u00d7 H100 a 4 bits)<\/td>\n<\/tr>\n<\/tbody>\n<\/table>\n<p>Meta afirma expresamente que Scout \u00abcabe en una sola GPU NVIDIA H100\u00bb con cuantizaci\u00f3n INT4, y que Maverick \u00abcabe en un solo host H100\u00bb \u2014observe la palabra <em>host<\/em>, que significa un nodo de 8 GPU, no una sola tarjeta. Un nodo de 8\u00d7H100 ofrece 640 GB, suficiente para alojar c\u00f3modamente a Maverick en FP8, pero <em>no<\/em> en BF16, donde los 800 GB exclusivos de los pesos superan la capacidad del nodo. Maverick en precisi\u00f3n completa requiere memoria de clase H200 o dos nodos.<\/p>\n<p>En la pr\u00e1ctica: Scout es un modelo para una sola GPU o una estaci\u00f3n de trabajo individual, y uno de los m\u00e1s capaces que puede ejecutarse en una Mac Studio de 128 GB. Maverick est\u00e1 reservado exclusivamente para centros de datos. Use la <a href=\"\/es\/llm-vram-calculator\/\">Calculadora de VRAM<\/a> calculadora<\/p>\n<div class=\"cmp\">\n  <table class=\"cmp-table\">\n    <thead><tr><th>Especificaciones<\/th><th><a href=\"https:\/\/convly.ai\/es\/model\/llama-4-scout\/\">Llama 4 Scout<\/a><\/th><th><a href=\"https:\/\/convly.ai\/es\/model\/llama-4-maverick\/\">Llama 4 Maverick<\/a><\/th><\/tr><\/thead>\n    <tbody>\n          <tr><td class=\"cmp-spec\">Desarrollador<\/td><td class=\"\">Meta<\/td><td class=\"\">Meta<\/td><\/tr>\n          <tr><td class=\"cmp-spec\">Tipo<\/td><td class=\"\">Multimodal (MoE)<\/td><td class=\"\">Multimodal (MoE)<\/td><\/tr>\n          <tr><td class=\"cmp-spec\">Par\u00e1metros<\/td><td class=\"\">109B totales \/ 17B activos (MoE)<\/td><td class=\"\">400\u202f000 millones totales \/ 17\u202f000 millones activos (MoE)<\/td><\/tr>\n          <tr><td class=\"cmp-spec\">Ventana de contexto<\/td><td class=\"cmp-win\">10M<\/td><td class=\"\">1 mill\u00f3n<\/td><\/tr>\n          <tr><td class=\"cmp-spec\">Modalidad<\/td><td class=\"\">Texto, imagen \u2192 texto<\/td><td class=\"\">Texto, imagen \u2192 texto<\/td><\/tr>\n          <tr><td class=\"cmp-spec\">Licencia<\/td><td class=\"\">Llama 4 Community (restringido en la UE)<\/td><td class=\"\">Llama 4 Community (restringido en la UE)<\/td><\/tr>\n          <tr><td class=\"cmp-spec\">Pesos abiertos<\/td><td class=\"\">\u2705 S\u00ed<\/td><td class=\"\">\u2705 S\u00ed<\/td><\/tr>\n          <tr><td class=\"cmp-spec\">Precio de entrada (USD\/mill\u00f3n)<\/td><td class=\"cmp-win\">$0.1<\/td><td class=\"\">$0.2<\/td><\/tr>\n          <tr><td class=\"cmp-spec\">Precio de salida (USD\/mill\u00f3n)<\/td><td class=\"\">$0.3<\/td><td class=\"\">$0.8<\/td><\/tr>\n          <tr><td class=\"cmp-spec\">VRAM (4 bits)<\/td><td class=\"\">~65 GB<\/td><td class=\"\">~240 GB<\/td><\/tr>\n          <tr><td class=\"cmp-spec\">GPU m\u00ednima (local)<\/td><td class=\"\">H100 de 80 GB \/ Mac de 128 GB<\/td><td class=\"\">Servidor multi-GPU<\/td><\/tr>\n          <tr><td class=\"cmp-spec\">Lanzado<\/td><td class=\"\">2025<\/td><td class=\"\">2025<\/td><\/tr>\n        <\/tbody>\n  <\/table>\n\n    <div class=\"cmp-verdict\">\n    <h3>Diferencias clave<\/h3>\n    <ul><li><strong>Coste:<\/strong> Llama 4 Scout es <strong>un 133 % m\u00e1s econ\u00f3mico<\/strong> que Llama 4 Maverick en t\u00e9rminos de coste promedio por token.<\/li><li><strong>Contexto:<\/strong> Llama 4 Scout destaca en la ventana de contexto (10M frente a 1M), lo que lo hace ideal para documentos extensos, grandes bases de c\u00f3digo y entradas RAG de gran tama\u00f1o.<\/li><li><strong>Grado de apertura:<\/strong> ambos tienen pesos abiertos, por lo que cualquiera puede alojarse localmente o ajustarse finamente. Compara sus necesidades de VRAM arriba para ver qu\u00e9 GPU puedes utilizar.<\/li><li><strong>Ejecuci\u00f3n local de Llama 4 Scout:<\/strong> ~65 GB a 4 bits (m\u00ednimo: H100 de 80 GB \/ Mac de 128 GB).<\/li><li><strong>Ejecute Llama 4 Maverick localmente:<\/strong> ~240 GB a 4 bits (servidor multi-GPU m\u00ednimo).<\/li><\/ul>\n  <\/div>\n\n    <div class=\"cmp-rec\">\n    <h3>\u00bfCu\u00e1l deber\u00edas elegir?<\/h3>\n    <p><strong>Selecciona Llama 4 Scout<\/strong> si buscas un menor coste por token para cargas de trabajo de alto volumen, o necesitas una ventana de contexto m\u00e1s amplia.<\/p>\n    <p><strong>Elija Llama 4 Maverick<\/strong> si se integra bien en tu pila tecnol\u00f3gica existente o si prefieres Meta.<\/p>\n    <p class=\"cmp-tools\">\u2192 Estime los costes reales en la <a href=\"\/es\/ai-api-cost-calculator\/\">Calculadora de costos de API<\/a> \u00b7 verifique el hardware local en la <a href=\"\/es\/llm-vram-calculator\/\">Calculadora de VRAM<\/a> \u00b7 explore todos los <a href=\"\/es\/models\/\">30+ modelos<\/a>.<\/p>\n  <\/div>\n<\/div>\n\n<h2><span class=\"ez-toc-section\" id=\"API_pricing_across_providers\"><\/span>Precios de la API entre distintos proveedores<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Ninguno de los dos modelos resulta caro seg\u00fan los est\u00e1ndares de vanguardia; ambos se comercializan como inferencia abierta de bajo costo. Las tarifas que figuran a continuaci\u00f3n corresponden a cada mill\u00f3n de tokens y var\u00edan con frecuencia.<\/p>\n<table class=\"convly-vs\">\n<thead>\n<tr>\n<th>Proveedor<\/th>\n<th>Scout: entrada \/ salida<\/th>\n<th>Maverick: entrada \/ salida<\/th>\n<\/tr>\n<\/thead>\n<tbody>\n<tr>\n<td>DeepInfra<\/td>\n<td class=\"convly-vs-winner\">$0.10 \/ $0.30<\/td>\n<td>$0.20 \/ $0.80<\/td>\n<\/tr>\n<tr>\n<td>Groq<\/td>\n<td>$0.11 \/ $0.34<\/td>\n<td>\u2014<\/td>\n<\/tr>\n<tr>\n<td>DigitalOcean<\/td>\n<td>\u2014<\/td>\n<td>$0.20 \/ $0.696<\/td>\n<\/tr>\n<tr>\n<td>NovitaAI<\/td>\n<td>$0.18 \/ $0.59<\/td>\n<td>$0.27 \/ $0.85<\/td>\n<\/tr>\n<tr>\n<td>Parasail<\/td>\n<td>\u2014<\/td>\n<td>$0.35 \/ $1.00<\/td>\n<\/tr>\n<tr>\n<td>Google Vertex<\/td>\n<td>$0.25 \/ $0.70<\/td>\n<td>$0.35 \/ $1.15<\/td>\n<\/tr>\n<\/tbody>\n<\/table>\n<p>Groq destaca especialmente para Scout: es ligeramente m\u00e1s costoso que DeepInfra, pero ofrece entrada en cach\u00e9 a 0,055 USD por mill\u00f3n de tokens, lo cual resulta muy relevante para bucles de agentes que reenv\u00edan miles de veces el mismo mensaje del sistema. Parasail ofrece una opci\u00f3n equivalente para Maverick a 0,17 USD.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"What_this_actually_costs\"><\/span>Cu\u00e1l es su costo real<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Suponga una carga de producci\u00f3n moderada de 100 millones de tokens de entrada y 20 millones de tokens de salida mensuales, al precio m\u00e1s bajo disponible en los principales proveedores:<\/p>\n<ul>\n<li><strong>Scout:<\/strong> (100 \u00d7 0,10 USD) + (20 \u00d7 0,30 USD) = <strong>16 USD\/mes<\/strong><\/li>\n<li><strong>Maverick:<\/strong> (100 \u00d7 0,20 USD) + (20 \u00d7 0,80 USD) = <strong>36 USD\/mes<\/strong><\/li>\n<\/ul>\n<p>A diez veces ese volumen, la diferencia pasa a ser de 160 USD frente a 360 USD mensuales. La relaci\u00f3n se mantiene aproximadamente en 2,25\u20132,3\u00d7 independientemente de la escala, por lo que la decisi\u00f3n no depende tanto de los d\u00f3lares absolutos en vol\u00famenes peque\u00f1os, sino de si la superioridad de Maverick en razonamiento y programaci\u00f3n justifica duplicar permanentemente el costo unitario. Calcule sus propios n\u00fameros con la <a href=\"\/es\/ai-api-cost-calculator\/\">Calculadora de costos de API<\/a>.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Licensing_read_the_EU_clause_before_you_build\"><\/span>Licencias: lea la cl\u00e1usula para la UE antes de desarrollar<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Ambos modelos se distribuyen bajo el <strong>Acuerdo de Licencia Comunitaria Llama 4<\/strong>, que permite el uso de c\u00f3digo abierto y es comercialmente viable, pero no est\u00e1 aprobado por la OSI como software de c\u00f3digo abierto. Dos restricciones son relevantes en la pr\u00e1ctica. Primero, los productos que superen los 700 millones de usuarios activos mensuales requieren una licencia espec\u00edfica negociada con Meta. Segundo \u2014y mucho m\u00e1s probable que le afecte\u2014, la licencia restringe el uso multimodal para entidades y particulares con domicilio en la <strong>Uni\u00f3n Europea<\/strong>.<\/p>\n<p>Si usted es una empresa con sede en la UE y planea usar las capacidades visuales, esto constituye una cuesti\u00f3n jur\u00eddica que debe resolverse antes de escribir c\u00f3digo, no despu\u00e9s. Los equipos en esa situaci\u00f3n suelen optar por <a href=\"\/es\/models\/\">un modelo alternativo de c\u00f3digo abierto<\/a> con una licencia m\u00e1s clara, como Qwen o GLM publicados bajo licencias Apache-2.0 o MIT.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Which_should_you_pick\"><\/span>\u00bfCu\u00e1l deber\u00eda elegir?<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<div class=\"convly-procons\">\n<div class=\"pros\">\n<h4>Elija Llama 4 Scout si<\/h4>\n<ul>\n<li>Su carga de trabajo implica documentos, OCR, formularios, gr\u00e1ficos o recuperaci\u00f3n de informaci\u00f3n \u2014donde los benchmarks muestran una casi paridad<\/li>\n<li>Desea alojarlo usted mismo en una sola H100, una Mac de 128 GB o una configuraci\u00f3n modesta de GPU<\/li>\n<li>El costo por token se acumula seg\u00fan su volumen, y usted desea el ahorro de aproximadamente 2,3\u00d7<\/li>\n<li>Necesita la ventana de contexto m\u00e1s larga disponible y puede trabajar dentro de los l\u00edmites impuestos por los proveedores<\/li>\n<li>Est\u00e1 realizando prototipos y busca el modelo multimodal de c\u00f3digo abierto m\u00e1s econ\u00f3mico que sea capaz de cumplir con sus necesidades<\/li>\n<\/ul>\n<\/div>\n<div class=\"cons\">\n<h4>Elija Llama 4 Maverick si<\/h4>\n<ul>\n<li>Su carga de trabajo depende genuinamente del razonamiento: preguntas y respuestas cient\u00edficas, an\u00e1lisis, l\u00f3gica de m\u00faltiples pasos<\/li>\n<li>Est\u00e1 generando o revisando c\u00f3digo, donde la brecha en LiveCodeBench es del 32 % relativo<\/li>\n<li>Ya dispone de infraestructura con m\u00faltiples GPU o bien la utiliza mediante una API de todos modos<\/li>\n<li>Necesita un mejor rendimiento multiling\u00fce y de traducci\u00f3n, como se demuestra en MGSM y MTOB<\/li>\n<li>La precisi\u00f3n en problemas dif\u00edciles importa m\u00e1s que duplicar su costo por token<\/li>\n<\/ul>\n<\/div>\n<\/div>\n<p>La ruta pragm\u00e1tica para la mayor\u00eda de los equipos es: <strong>comenzar con Scout, medir los resultados y escalar \u00fanicamente las consultas que fallen.<\/strong> Como ambos modelos aceptan el mismo formato de indicaci\u00f3n (prompt) y las mismas entradas multimodales, enrutar las consultas dif\u00edciles a Maverick mientras se atiende la mayor parte con Scout requiere muy poca ingenier\u00eda y, por lo general, supera a la estrategia de estandarizar en uno u otro modelo.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Frequently_asked_questions\"><\/span>Preguntas frecuentes<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<h3>\u00bfEs Llama 4 Maverick mejor que Llama 4 Scout?<\/h3>\n<p>En razonamiento y programaci\u00f3n, claramente s\u00ed: Maverick lidera con una ventaja de 12,6 puntos en GPQA Diamond y de 10,6 en LiveCodeBench. En comprensi\u00f3n de documentos y gr\u00e1ficos, ambos modelos est\u00e1n pr\u00e1cticamente empatados, con id\u00e9nticas puntuaciones de 94,4 en DocVQA. Lo que significa \u00abmejor\u00bb depende enteramente de si su carga de trabajo exige principalmente razonamiento o extracci\u00f3n de informaci\u00f3n.<\/p>\n<h3>\u00bfPuedo realmente usar el contexto de 10 millones de tokens de Llama 4 Scout?<\/h3>\n<p>No mediante una API alojada. Meta entren\u00f3 Scout para admitir 10 millones de tokens, pero los proveedores ofrecen entre 128 K y aproximadamente 1,3 M: Groq tiene un l\u00edmite de unos 131 K, DeepInfra de unos 320 K y Together de unos 328 K. Alcanzar los 10 millones requiere autoalojamiento, y la cach\u00e9 KV a esa profundidad se vuelve mayor que los propios pesos del modelo.<\/p>\n<h3>\u00bfCu\u00e1nta VRAM necesito para ejecutar Llama 4 Scout localmente?<\/h3>\n<p>Aproximadamente 65 GB en cuantizaci\u00f3n de 4 bits, incluidas las sobrecargas, lo que cabe en una sola GPU H100 de 80 GB; Meta confirma esta configuraci\u00f3n. En FP8 se necesitan unos 109 GB y en BF16 unos 218 GB. Un Mac Studio con memoria unificada de 128 GB puede ejecutarlo con cuantizaci\u00f3n.<\/p>\n<h3>\u00bfPuede Llama 4 Maverick ejecutarse en una sola GPU?<\/h3>\n<p>No. En cuantizaci\u00f3n de 4 bits necesita aproximadamente 240 GB, lo que equivale a unos cuatro H100. La afirmaci\u00f3n de Meta de que \u00abcabe en un \u00fanico host H100\u00bb hace referencia a un nodo de 8 GPU en FP8, no a una sola tarjeta. En BF16, sus pesos de 800 GB superan incluso un nodo de 8\u00d7H100 de 640 GB.<\/p>\n<h3>\u00bfCu\u00e1nto m\u00e1s barato es Scout que Maverick?<\/h3>\n<p>Aproximadamente 2,3 veces m\u00e1s econ\u00f3mico en una base combinada entrada:salida de 3:1: unos 0,15 USD por cada mill\u00f3n de tokens combinados frente a 0,35 USD. En una carga de trabajo mensual de 100 millones de tokens de entrada y 20 millones de tokens de salida, eso representa 16 USD frente a 36 USD.<\/p>\n<h3>\u00bfLos modelos Llama 4 son gratuitos para uso comercial?<\/h3>\n<p>En su mayor parte s\u00ed. La Licencia Comunitaria de Llama 4 permite el uso comercial, pero los productos con m\u00e1s de 700 millones de usuarios activos mensuales requieren un acuerdo separado con Meta, y el uso multimodal est\u00e1 restringido para entidades con domicilio en la UE. Es de pesos abiertos, pero no es c\u00f3digo abierto seg\u00fan la definici\u00f3n de la OSI.<\/p>\n<h3>\u00bfPor qu\u00e9 fue controvertida la puntuaci\u00f3n de Llama 4 Maverick en LMArena?<\/h3>\n<p>Meta present\u00f3 una \u00abversi\u00f3n experimental de chat\u00bb a\u00fan no lanzada, que obtuvo 1417 puntos ELO, pero cuyas salidas no coincid\u00edan con los pesos p\u00fablicamente disponibles. El 8 de abril de 2025, LMArena modific\u00f3 su pol\u00edtica para exigir que las versiones de c\u00f3digo abierto enviadas coincidan exactamente con los pesos publicados; bajo esta nueva regla, el modelo sin modificaciones obtuvo una puntuaci\u00f3n sustancialmente menor.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Bottom_line\"><\/span>Conclusi\u00f3n<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Scout y Maverick son el mismo motor, pero con grupos de expertos de distinto tama\u00f1o, y la decisi\u00f3n entre ellos es inusualmente clara porque los propios benchmarks de Meta trazan la l\u00ednea para usted. Maverick justifica su precio superior en tareas de razonamiento y generaci\u00f3n de c\u00f3digo a nivel de posgrado, donde las diferencias de dos d\u00edgitos son demasiado grandes como para discutirlas. En cambio, no aporta ninguna ventaja en comprensi\u00f3n de documentos, donde empata completamente con Scout al tiempo que cuesta 2,3\u00d7 m\u00e1s por token y requiere un rack de centro de datos en lugar de una sola GPU.<\/p>\n<p>Dos advertencias importantes: la cifra destacada de 10 millones de tokens para el contexto de Scout no es algo que pueda alquilar hoy en d\u00eda; planifique su uso en torno a unos 1,3 millones, a menos que vaya a alojarlo usted mismo. Asimismo, debe descartar por completo de su evaluaci\u00f3n la puntuaci\u00f3n de 1417 en LMArena de Maverick, ya que corresponde a un modelo que nadie puede descargar. Eval\u00fae ambos modelos exclusivamente seg\u00fan los benchmarks oficiales publicados en sus fichas t\u00e9cnicas y, a\u00fan mejor, seg\u00fan su propio conjunto de pruebas: la brecha entre el marketing de los proveedores y los pesos efectivamente distribuidos ha sido la lecci\u00f3n clave de este lanzamiento.<\/p>\n<p><!--related-block--><\/p>\n<div class=\"convly-related\">\n<h2><span class=\"ez-toc-section\" id=\"Related_articles\"><\/span>Art\u00edculos relacionados<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<ul>\n<li><a href=\"https:\/\/convly.ai\/es\/models\/\">Base de datos de modelos de IA: especificaciones, precios y VRAM para m\u00e1s de 40 modelos<\/a><\/li>\n<li><a href=\"https:\/\/convly.ai\/es\/llm-vram-calculator\/\">Calculadora de VRAM para LLM: qu\u00e9 modelo cabr\u00e1 realmente en su GPU<\/a><\/li>\n<li><a href=\"https:\/\/convly.ai\/es\/ai-api-cost-calculator\/\">Calculadora de costos de API de IA: estime su gasto mensual<\/a><\/li>\n<li><a href=\"https:\/\/convly.ai\/es\/ai-price-performance-index-2026\/\">\u00cdndice de rendimiento-precio de IA 2026<\/a><\/li>\n<li><a href=\"https:\/\/convly.ai\/es\/self-hosting-vs-api-calculator\/\">Calculadora: autoalojamiento frente a API<\/a><\/li>\n<\/ul>\n<\/div>","protected":false},"excerpt":{"rendered":"<p>Llama 4 Scout vs Llama 4 Maverick compared: specs, API pricing, context window, VRAM and a clear verdict on which model to choose in 2026.<\/p>","protected":false},"author":1,"featured_media":1906,"comment_status":"closed","ping_status":"closed","sticky":false,"template":"","format":"standard","meta":{"site-sidebar-layout":"default","site-content-layout":"","ast-site-content-layout":"default","site-content-style":"default","site-sidebar-style":"default","ast-global-header-display":"","ast-banner-title-visibility":"","ast-main-header-display":"","ast-hfb-above-header-display":"","ast-hfb-below-header-display":"","ast-hfb-mobile-header-display":"","site-post-title":"","ast-breadcrumbs-content":"","ast-featured-img":"","footer-sml-layout":"","ast-disable-related-posts":"","theme-transparent-header-meta":"","adv-header-id-meta":"","stick-header-meta":"","header-above-stick-meta":"","header-main-stick-meta":"","header-below-stick-meta":"","astra-migrate-meta-layouts":"default","ast-page-background-enabled":"default","ast-page-background-meta":{"desktop":{"background-color":"var(--ast-global-color-5)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"tablet":{"background-color":"","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"mobile":{"background-color":"","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""}},"ast-content-background-meta":{"desktop":{"background-color":"var(--ast-global-color-4)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"tablet":{"background-color":"var(--ast-global-color-4)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"mobile":{"background-color":"var(--ast-global-color-4)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""}},"footnotes":""},"categories":[246],"tags":[395,795],"class_list":["post-1277","post","type-post","status-publish","format-standard","has-post-thumbnail","hentry","category-ai-comparisons","tag-ai-model-comparison","tag-llama-4-maverick"],"_links":{"self":[{"href":"https:\/\/convly.ai\/es\/wp-json\/wp\/v2\/posts\/1277","targetHints":{"allow":["GET"]}}],"collection":[{"href":"https:\/\/convly.ai\/es\/wp-json\/wp\/v2\/posts"}],"about":[{"href":"https:\/\/convly.ai\/es\/wp-json\/wp\/v2\/types\/post"}],"author":[{"embeddable":true,"href":"https:\/\/convly.ai\/es\/wp-json\/wp\/v2\/users\/1"}],"replies":[{"embeddable":true,"href":"https:\/\/convly.ai\/es\/wp-json\/wp\/v2\/comments?post=1277"}],"version-history":[{"count":1,"href":"https:\/\/convly.ai\/es\/wp-json\/wp\/v2\/posts\/1277\/revisions"}],"predecessor-version":[{"id":2404,"href":"https:\/\/convly.ai\/es\/wp-json\/wp\/v2\/posts\/1277\/revisions\/2404"}],"wp:featuredmedia":[{"embeddable":true,"href":"https:\/\/convly.ai\/es\/wp-json\/wp\/v2\/media\/1906"}],"wp:attachment":[{"href":"https:\/\/convly.ai\/es\/wp-json\/wp\/v2\/media?parent=1277"}],"wp:term":[{"taxonomy":"category","embeddable":true,"href":"https:\/\/convly.ai\/es\/wp-json\/wp\/v2\/categories?post=1277"},{"taxonomy":"post_tag","embeddable":true,"href":"https:\/\/convly.ai\/es\/wp-json\/wp\/v2\/tags?post=1277"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}