Tuesday, 18 August 2026 | Updating Daily AI insight, written for builders

Lista de modelos de Ollama (2026): todos los modelos populares, tamaños y requisitos de memoria RAM

Actualizado · Publicado originalmente el 3 de julio de 2026

Si ejecutas modelos localmente, la biblioteca de Ollama es la fuente principal de la mayoría de ellos; sin embargo, cambia constantemente y sus nombres son crípticos. Esta es una guía práctica Lista de modelos de Ollama para 2026: los modelos que realmente usan las personas, los requisitos de memoria de cada uno y sus principales ventajas, además de cómo enumerar los modelos que ya tienes e incorporar nuevos. Por defecto, Ollama descarga una versión cuantizada a 4 bits, razón por la cual un modelo de «70B» puede caber en una estación de trabajo potente y uno de «8B» puede ejecutarse en un portátil. Los tamaños indicados a continuación son aproximados y corresponden a las versiones predeterminadas; siempre verifica la Base de datos de modelos de IA o ejecuta ollama list para conocer los modelos disponibles actualmente en tu equipo.

Referencia rápida

  • Ejecutable en cualquier portátil (8 GB de RAM): Llama 3.2 3B, Phi-3 Mini, Gemma 3 4B — small, fast, offline.
  • Mejor equilibrio general (16 GB): Llama 3.1 8B, Qwen 2.5 7B, Mistral 7B — the sweet spot for most people.
  • Alta calidad (32 GB+ / GPU): Gemma 2 27B, Qwen 2.5 32B, Mixtral 8x7B.
  • Casi punta (estación de trabajo / 48 GB+): Llama 3.3 70B, DeepSeek-R1 70B.
  • Razonamiento: DeepSeek-R1 es una versión destilada. Programación: Qwen 2.5 Coder, Code Llama. Visión: LLaVA. Incrustaciones (embeddings): nomic-embed-text.
  • La regla: elige según la memoria disponible: comprueba cualquier modelo con nuestra herramienta gratuita Calculadora de VRAM.

Key Facts

  • Cualquier portátil (8 GB de RAM): Llama 3.2 3B, Phi-3 Mini, Gemma 3 4B
  • El punto óptimo de 16 GB: Llama 3.1 8B, Qwen 2.5 7B, Mistral 7B
  • 32 GB o más / GPU: Gemma 2 27B, Qwen 2.5 32B, Mixtral 8x7B — Estación de trabajo de 48 GB o más: Llama 3.3 70B, DeepSeek-R1 70B
  • Ollama descarga versiones cuantizadas a 4 bits de forma predeterminada —por eso un modelo «70B» cabe en una buena estación de trabajo
  • Modelos especializados: Qwen 2.5 Coder (programación) · LLaVA (visión) · nomic-embed-text (incrustaciones) · versiones distiladas de DeepSeek-R1 (razonamiento)

Los modelos de Ollama más populares a primera vista

Todos los modelos que aparecen a continuación están disponibles con un simple comando ollama pull . «Descargar» indica aproximadamente el tamaño predeterminado en cuantización de 4 bits (Q4); «Memoria mínima» representa la cantidad práctica mínima de RAM del sistema (CPU) o VRAM (GPU) necesaria para ejecutarlo cómodamente. Los recuentos de parámetros son exactos; los tamaños son aproximados y pueden variar con cada nueva versión.

ModeloParámetrosDescargar (Q4)Memoria mínimaIdeal para
Llama 3.21B / 3B~1,3 / 2 GB4–8 GBDispositivos perimetrales, teléfonos móviles, chat ultraligero
Llama 3.18B~4,7 GB8–16 GBMejor modelo pequeño versátil
Llama 3.370B~43 GB48 GB+Modelo abierto casi punta
Gemma 31B / 4B~0,8 / 3,3 GB4–8 GBPequeño y eficiente (Google)
Gemma 29B / 27B~5,4 / 16 GB12–32 GBExcelente relación calidad/tamaño
Qwen 2.50,5B–72B~0,4–47 GB4 GB+Multilingüe, amplio rango de tamaños
Qwen 2.5 Coder1,5B–32B~1–20 GB8 GB o másAsistente local de programación
Mistral7B~4,1 GB8 GBClásico rápido y fiable
Mistral Nemo12B~7 GB16 GBContexto largo de 128k
Mixtral8×7B~26 GB32 GB o másCalidad de mezcla de expertos (MoE)
Phi-414B~9 GB16 GBRazonamiento en un modelo pequeño
Phi-3 Mini3,8 mil millones de parámetros~2,3 GB8 GBPequeño pero capaz
DeepSeek-R1 (versión destilada)1,5 mil millones – 70 mil millones de parámetros~1,1–43 GB8 GB o másRazonamiento paso a paso
LLaVA7B–34B~4,7–20 GB8 GB o másVisión (comprensión de imágenes)
nomic-embed-text~0,3 GB2 GBIncrustaciones (embeddings) para recuperación aumentada (RAG) y búsquedas

¿Desea comparar estos modelos locales con los modelos en la nube en términos de precio y velocidad? La Base de datos de modelos de IA lista muestra modelos abiertos y cerrados uno al lado del otro, y la Calculadora de costos de API de IA muestra cuándo ejecutar localmente resulta más económico que pagar por token.

Cómo listar los modelos de Ollama que tienes instalados

Para ver todos los modelos ya instalados en su equipo, junto con su tamaño y la fecha de su último uso, ejecute:

ollama list

Esto muestra el nombre, la etiqueta, el identificador único y el tamaño de cada modelo. Para ver qué modelos están cargados actualmente en memoria, use ollama ps; para eliminar uno que ya no necesite y recuperar espacio en disco, use ollama rm . Estos tres comandos — list, ps y rm — son todo lo que necesita para gestionar una colección de modelos locales.

Cómo buscar y descargar nuevos modelos desde la biblioteca

El catálogo completo de Ollama se aloja en su biblioteca en línea, y descargar cualquier modelo es tan sencillo como ejecutar un solo comando:

ollama pull llama3.1  o ejecútelo directamente con  ollama run llama3.1

Los nombres de los modelos incluyen etiquetas que indican su tamaño y variante: llama3.1:8b, gemma2:27b, qwen2.5:14b. Si omite la etiqueta, Ollama descargará una versión predeterminada razonable (normalmente la más popular, cuantizada a 4 bits). Para una instalación inicial, nuestra step-by-step Ollama install guía cubre Mac, Windows y Linux.

Modelos pequeños: funcionan en prácticamente cualquier portátil

Los modelos de 1 mil millones a aproximadamente 4 mil millones de parámetros funcionan sin problemas en un portátil moderno con 8 GB de RAM, sin necesidad de GPU. Llama 3.2 3B, Gemma 3 4B y Phi-3 Mini son los destacados: rápidos, realmente útiles para resúmenes, redacción y preguntas sencillas, y lo suficientemente pequeños como para mantenerlos cargados en memoria. No igualarán la calidad de los modelos punteros en la nube, pero sí son excelentes para tareas cotidianas privadas y sin conexión, y constituyen el punto de partida ideal si es nuevo en la inteligencia artificial local.

Modelos de tamaño medio: el punto óptimo para 16 GB

La categoría de 7B a 14B es donde la mayoría de los usuarios deberían centrarse. Llama 3.1 8B, Qwen 2.5 7B y Mistral 7B ofrecen un salto significativo en coherencia respecto a los modelos pequeños, manteniéndose cómodamente dentro de los 16 GB de RAM o en una GPU convencional. Phi-4 y Mistral Nemo amplían aún más la calidad y la longitud del contexto. Si busca un único modelo para uso general, elija uno de esta fila: representa el mejor equilibrio entre capacidades y exigencias de hardware.

Modelos grandes: estaciones de trabajo y GPUs

A partir de los 27B, entra en el terreno del hardware potente. Gemma 2 27B y Qwen 2.5 32B requiere 32 GB o más; Mixtral 8x7B y los modelos de la clase 70B — Llama 3.3 70B y la DeepSeek-R1 70B (versión destilada) — necesitan 48 GB o más de memoria rápida, lo que en la práctica implica una GPU con mucha VRAM o una Mac con chip Apple Silicon de alta memoria. La recompensa es una calidad cercana a la de los grandes modelos en la nube, ejecutándose íntegramente en su propia máquina. Consulte nuestra mejores GPU para IA guía sobre qué hardware puede ejecutar efectivamente estos modelos.

Modelos especializados: programación, visión por computadora y embeddings

Más allá de las conversaciones generales, Ollama aloja modelos especializados en tareas específicas. Qwen 2.5 Coder y Code Llama están diseñados para programación y se combinan bien con herramientas locales de entornos de desarrollo integrados (IDE). LLaVA añade capacidad visual, de modo que un modelo pueda describir o razonar sobre imágenes. Y los modelos de incrustación (embedding), como nomic-embed-text y mxbai-embed-large no conversan en absoluto: convierten texto en vectores para búsquedas y generación aumentada mediante recuperación (RAG), el pilar fundamental de una configuración local RAG.

¿Qué modelo de Ollama deberías usar realmente?

La respuesta sincera es: el más grande que su memoria pueda alojar dentro de la categoría que necesita. Para uso general, comience con un modelo de 8B y suba solo si la calidad resulta insuficiente. Para razonamiento, pruebe una versión distilada de DeepSeek-R1; para programación, Qwen 2.5 Coder; para imágenes, LLaVA. Clasificamos las mejores opciones según su caso de uso en los mejores modelos de lenguaje local (LLM) para ejecutar en Ollama, y comparamos Ollama con sus alternativas en Ollama frente a LM Studio frente a vLLM frente a llama.cpp.

Verifica si un modelo cabe en tu sistema antes de descargarlo

El error más frecuente es descargar un modelo demasiado grande para su equipo: o bien se negará a cargarse o funcionará extremadamente lento al recurrir al intercambio con el disco. Antes de descargarlo, evalúe su tamaño: como regla aproximada, un modelo cuantizado a 4 bits requiere algo menos de 1 GB de memoria por cada mil millones de parámetros, además de margen adicional para el contexto. Nuestra herramienta gratuita Calculadora de VRAM proporciona la cifra exacta para cualquier modelo y tipo de cuantización, y Requisitos del sistema de Ollama explican detalladamente el compromiso entre RAM y VRAM.

Preguntas frecuentes

¿Cómo listo los modelos instalados en Ollama? Ejecutar ollama list para ver todos los modelos instalados junto con su tamaño, ollama ps para ver qué modelo está cargado actualmente y ollama rm para eliminar uno.

¿Cuál es el mejor modelo de Ollama? No existe un único «mejor» modelo: depende de su capacidad de memoria. Llama 3.1 8B es la opción más equilibrada para equipos con 16 GB de RAM; consulte nuestra lista clasificada para cada caso de uso.

¿Cuántos modelos ofrece Ollama? Cientos, distribuidos entre familias de modelos conversacionales, de programación, visuales y de incrustación (embedding), con múltiples tamaños en cada categoría. La tabla anterior incluye los que la mayoría de los usuarios realmente ejecutan.

¿Cuánta memoria RAM necesito para ejecutar modelos de Ollama? Con 8 GB se ejecutan modelos pequeños (1B–4B); con 16 GB, la popular categoría de 7B–8B; y para modelos de 27B o mayores se requieren 32 GB o más, o bien una GPU. Verifique cualquier modelo con nuestra Calculadora de VRAM.

¿Puedo ejecutar estos modelos sin conexión? Sí: una vez descargado, cada modelo de Ollama se ejecuta íntegramente en su equipo sin necesidad de conexión a Internet, lo cual constituye precisamente la razón principal para usar modelos locales.

En resumen

La lista de modelos de Ollama es extensa, pero su elección es sencilla: decida qué necesita —conversación general, razonamiento, programación, visión o incrustaciones— y luego seleccione el modelo más grande de esa categoría que su memoria pueda alojar. Comience con un modelo de 8B, use ollama list para llevar un registro de los que tiene instalados y confíe en Calculadora de VRAM antes de cada descarga, para evitar jamás instalar un modelo que su equipo no pueda ejecutar. A partir de ahí, ejecutar inteligencia artificial potente, local y privada requiere tan solo unos pocos comandos.

Los nombres, tamaños y disponibilidad de los modelos cambian con frecuencia; las cifras son valores aproximados basados en configuraciones predeterminadas vigentes a mediados de 2026 —verifíquelas siempre con ollama list y la biblioteca oficial antes de depender de ellas.

Escrito por Mustafa Ihsan

Mustafa Ihsan es el fundador y editor de Convly.ai. Creó y mantiene la base de datos en vivo de modelos de IA del sitio, su índice de relación precio-rendimiento y sus calculadoras gratuitas para los requisitos de VRAM, los costos de las API y la economía del autohospedaje. Escribe sobre precios de modelos, resultados de pruebas comparativas y el hardware necesario para ejecutar modelos de IA localmente, y prefiere sistemáticamente los datos medidos a las afirmaciones de los fabricantes.

Scroll to Top
Featured on There's An AI For That