Thursday, 27 August 2026 | Updating Daily AI insight, written for builders

Modelos locales de LLM: Guía completa para ejecutar modelos de IA en tu hardware

En resumen:

  • Los modelos locales de LLM se ejecutan en tu hardware sin realizar llamadas a API. Entre las opciones populares se incluyen Llama 3.1 (8B-405B), Mistral 7B, Phi-3 y Gemma 2.
  • Usa Ollama para la configuración más sencilla (ollama run llama3.1), LM Studio para una interfaz gráfica, o llama.cpp para el máximo control.
  • Un modelo de 8 mil millones de parámetros necesita entre 6 y 8 GB de VRAM con cuantización de 4 bits, o 16 GB para precisión completa. Los modelos de 70 mil millones de parámetros requieren 40 GB o más de VRAM, o bien descarga a la RAM del sistema.
  • La cuantización (GGUF, GPTQ, AWQ) reduce el tamaño del modelo entre un 50 % y un 75 % con pérdida mínima de calidad, lo que hace viable su despliegue local en hardware de consumo.

Los modelos locales de LLM son modelos de lenguaje de IA que se ejecutan íntegramente en tu hardware —escritorio, laptop o servidor— sin enviar datos a APIs externas. Descargas los pesos del modelo, los cargas en memoria y realizas la inferencia localmente. Esto te brinda privacidad total, ausencia de costos por token, funcionamiento sin conexión y control absoluto sobre el comportamiento del modelo. La contrapartida es la inversión inicial en hardware y una inferencia más lenta comparada con los proveedores en la nube que operan sobre infraestructura optimizada.

Populares LLM local Modelos

A partir de 2026, estos modelos ofrecen el mejor equilibrio entre calidad y accesibilidad hardware para despliegue local:

Modelo Parámetros VRAM (4 bits) VRAM (16 bits) Ideal para
Llama 3.1 8B / 70B / 405B 6 GB / 40 GB / 240 GB 16 GB / 140 GB / 810 GB Uso general, programación y razonamiento
Mistral 7B v0.3 7B 5 GB 14 GB Inferencia rápida, buena relación calidad/tamaño
Phi-3-medium 14B 9 GB 28 GB Razonamiento eficiente, compatible con GPUs de consumo
Gemma 2 9B / 27B 6 GB / 18 GB 18 GB / 54 GB Cumplimiento de instrucciones, ajustado para seguridad
Qwen 2.5 7B / 72B 5 GB / 42 GB 14 GB / 144 GB Multilingüe, fuerte en matemáticas y programación
DeepSeek-Coder-V2 16B / 236B 10 GB / 140 GB 32 GB / 472 GB Generación y comprensión de código

Las estimaciones de VRAM son aproximadas y varían según la longitud del contexto y el tamaño del lote. Usa el Calculadora de VRAM para requisitos precisos basados en tu configuración, o consulta Requisitos de VRAM por modelo para especificaciones detalladas de más de 37 modelos.

Requisitos de hardware

Los modelos locales de LLM se cargan íntegramente en memoria durante la inferencia. Puedes ejecutarlos en la VRAM de la GPU, en la RAM del sistema o en una combinación de ambas:

GPU (más rápido)

Las GPUs NVIDIA con soporte CUDA ofrecen el mejor rendimiento. Las GPUs AMD funcionan mediante ROCm, pero tienen menor soporte en herramientas. Apple Silicon (M1/M2/M3) utiliza memoria unificada y ejecuta modelos eficientemente mediante Metal.

  • Nivel de entrada: RTX 3060 de 12 GB o RTX 4060 Ti 16 GB ejecuta modelos de 7-8B con cuantización de 4 bits
  • Gama media: RTX 4090 de 24 GB maneja modelos de 30B cuantizados, o modelos de 13B con precisión completa
  • Gama alta: A6000 de 48 GB o dos GPUs de consumo ejecutan modelos de 70B con cuantización de 4 bits

Consulta el mejoras GPUs para modelos de lenguaje local guía para comparativas de rendimiento y relaciones precio/rendimiento.

CPU (Más lenta pero accesible)

Cualquier CPU moderna puede ejecutar modelos LLM locales utilizando la memoria RAM del sistema, aunque con una velocidad 10 a 50 veces menor que la inferencia en GPU. Esto es viable para modelos pequeños (7-8 mil millones de parámetros) o cuando la privacidad tiene más importancia que la velocidad.

  • Mínimo: 16 GB de RAM para modelos de 7B con cuantización de 4 bits
  • Recomendado: 32 GB o más de RAM para un funcionamiento cómodo con ventanas de contexto más amplias
  • Servidor: 128 GB o más de RAM permiten ejecutar modelos de 70B en sistemas exclusivamente basados en CPU

Híbrido (GPU + CPU)

La mayoría de los frameworks admiten la descarga parcial (offloading): cargar algunas capas en la GPU y el resto en la RAM. Un modelo de 70B podría usar 24 GB de VRAM + 32 GB de RAM, logrando una inferencia 3 a 5 veces más rápida que en CPU únicamente.

Ejecución de modelos locales de LLM

Ollama (El más sencillo)

Ollama envuelve llama.cpp con una CLI sencilla y un registro de modelos. Es la forma más rápida de comenzar:

# Instalación en macOS/Linux
curl -fsSL https://ollama.ai/install.sh | sh

# Windows: descargar el instalador desde ollama.ai

# Ejecutar un modelo (se descarga automáticamente)
ollama run llama3.1

# Listar los modelos disponibles
ollama list

# Descargar un modelo específico
ollama pull mistral:7b-instruct-q4_0

Ollama selecciona automáticamente la GPU o la CPU, gestiona la cuantización y se encarga de las descargas de modelos. Consulte la Guía completa de Ollama documentación oficial cómo instalar Ollama para configuración detallada y personalización, o vaya directamente a la

Explorar más de 100 modelos disponibles en el Lista de modelos de Ollamarepositorio oficial de Ollama mejores modelos locales para Ollama.

LM Studio (Interfaz gráfica)

LM Studio ofrece una aplicación de escritorio para Windows, macOS y Linux con una interfaz de chat y un explorador de modelos. Descárguela desde lmstudio.ai, iníciela, busque modelos en la pestaña «Descubrir» y haga clic en «Descargar». Los modelos usan el formato GGUF y se cargan con niveles ajustables de cuantización.

LM Studio muestra en tiempo real el uso de VRAM y la velocidad de inferencia, lo que facilita el ajuste de los parámetros. Además, ejecuta un servidor API local compatible con OpenAI en http://localhost:1234/v1 http://localhost:1234 Guía completa de LM Studio documentación de LM Studio

llama.cpp (Avanzado)

llama.cpp es el motor subyacente de Ollama y LM Studio, y ofrece el máximo control para desarrolladores:

# Clonar y compilar
git clone https://github.com/ggerganov/llama.cpp
cd llama.cpp
make

# Con soporte CUDA
make LLAMA_CUDA=1

# Ejecutar inferencia
./main -m models/llama-3.1-8b-instruct-q4_0.gguf -p "Explica la computación cuántica" -n 512 --gpu-layers 35

El --gpu-layers controla cuántas capas del transformador se cargan en la GPU frente a la RAM. Valores más altos consumen más VRAM, pero aceleran la ejecución. Comience con la mitad del número total de capas del modelo y ajuste según sea necesario.

Otras herramientas

  • text-generation-webui: Interfaz web con extensiones y soporte para múltiples motores de inferencia
  • vLLM: Servidor de inferencia optimizado para despliegues productivos de alto rendimiento
  • LocalAI: Sustituto directo de la API de OpenAI que admite múltiples formatos de modelo
  • Jan: Aplicación de escritorio similar a LM Studio, con énfasis especial en privacidad

Formatos de modelo y cuantización

La cuantización reduce la precisión del modelo, pasándola de números de coma flotante de 16 o 32 bits a 8 bits, 4 bits o precisión mixta, reduciendo así los requisitos de memoria entre un 50 % y un 75 %, con una pérdida de calidad del 2 al 5 %. Distintos formatos están optimizados para distintos tipos de hardware:

GGUF (Ollama, LM Studio, llama.cpp)

GGUF es el formato estándar para despliegues locales. Niveles comunes de cuantización:

  • Q4_0: 4 bits, tamaño más pequeño, pérdida de calidad del 5-10 %
  • Q4_K_M: 4 bits con precisión mixta, buen equilibrio entre tamaño y calidad
  • Q5_K_M: 5 bits, mejor calidad que Q4, aún compacto
  • Q8_0: 8 bits, pérdida mínima de calidad, archivos más grandes
  • F16: Precisión completa de 16 bits, sin cuantización

Para la mayoría de los casos de uso, Q4_K_M o Q5_K_M ofrecen la mejor relación calidad/tamaño. Use Q8_0 o F16 únicamente si dispone de VRAM sobrante y necesita la máxima precisión.

GPTQ (Inferencia en Python)

GPTQ realiza cuantización a 4 bits o 3 bits y está optimizada para inferencia en GPU mediante bibliotecas como AutoGPTQ o ExLlama. Es muy común en flujos de trabajo con Transformers de Hugging Face. Los modelos GPTQ se cargan más rápido que los GGUF, pero requieren entornos Python.

AWQ (Inferencia rápida en GPU)

AWQ (Activation-aware Weight Quantization) conserva mayor precisión que GPTQ a 4 bits, protegiendo los pesos más relevantes. Requiere motores de inferencia compatibles con AWQ, como vLLM o TGI.

Elección de un modelo local de LLM

Ajuste el tamaño del modelo a su hardware y caso de uso:

  • Modelos de 7-8B: Caben en GPUs de consumo (12-16 GB de VRAM), respuestas rápidas, adecuados para chat y tareas sencillas
  • Modelos de 13-14B: Requieren 20-24 GB de VRAM, ofrecen una mejora notable en razonamiento y seguimiento de instrucciones
  • Modelos de 30-34B: Necesitan 40 GB o más de VRAM, o una configuración híbrida GPU+RAM; su calidad se aproxima a la de GPT-3.5
  • Modelos de 70 mil millones o más: Requieren hardware de servidor o una cuantización agresiva, y compiten con GPT-4 en muchas tareas

Explore las especificaciones y las puntuaciones de referencia de 37 modelos en la Base de datos de modelos de IA, o compare los rankings en la Clasificación de modelos de lenguaje grande (LLM) ordenada por inteligencia, precio y longitud de contexto.

Para el análisis de costos, utilice la calculadora de autohospedaje frente a API para hallar el punto de equilibrio entre los costos del hardware local y los de las APIs en la nube. Los modelos locales tienen un costo inicial mayor, pero su costo marginal por token es cero, lo que los hace más económicos a alto volumen.

Preguntas frecuentes

¿Puedo ejecutar modelos locales de LLM en una laptop?

Sí, siempre que tengas 16 GB o más de memoria unificada (Apple Silicon) o 16 GB o más de RAM junto con una GPU dedicada con 8 GB o más de VRAM. Los MacBook Pro con M1 Max/Ultra, M2 Pro/Max o M3 Max ejecutan eficientemente modelos de 7 a 13 mil millones de parámetros. Las laptops con Windows o Linux equipadas con GPUs móviles RTX 4060-4090 manejan modelos de 7 a 30 mil millones de parámetros, dependiendo de la VRAM disponible. La inferencia exclusiva en CPU funciona en cualquier laptop con 16 GB o más de RAM, aunque es 10 a 50 veces más lenta.

¿Cuánto más lentos son los modelos locales de LLM comparados con los proveedores de API?

Depende del hardware. Un modelo de 7B en una RTX 4090 genera entre 80 y 120 tokens por segundo, lo cual es comparable a la latencia de las APIs. El mismo modelo en CPU genera entre 5 y 15 tokens por segundo. Modelos más grandes (70B+) en hardware de consumo generan solo 2 a 10 tokens por segundo incluso con aceleración GPU. Los proveedores en la nube utilizan clústeres H100 optimizados para el rendimiento, pero los modelos locales eliminan la latencia de red: obtienes la respuesta del primer token de forma inmediata.

¿Requieren conexión a Internet los modelos locales de LLM?

No, una vez descargados. Descargas los pesos del modelo una sola vez (de 1 a 150 GB, según el tamaño del modelo), y luego la inferencia se ejecuta completamente sin conexión. Ollama, LM Studio y llama.cpp almacenan en caché los modelos localmente. Esto hace que los LLM locales sean adecuados para entornos aislados (air-gapped), viajes o trabajos sensibles a la privacidad donde ningún dato puede salir de tu red.

¿Cuál es la diferencia de calidad entre los modelos cuantizados y los de precisión completa?

La cuantización de 4 bits (Q4_K_M) implica una pérdida de calidad del 2 al 5 % en la mayoría de las pruebas comparada con la precisión de 16 bits, afectando principalmente el razonamiento complejo y la recuperación de hechos. La cuantización de 8 bits implica una pérdida inferior al 1 %. Para conversaciones, asistencia en programación y procesamiento de documentos, la mayoría de los usuarios no perciben diferencias entre Q4_K_M y F16. Para aplicaciones críticas que exigen la máxima precisión (médicas, legales, científicas), use Q8_0 o F16 si dispone de suficiente VRAM.

¿Puedo ajustar finamente (fine-tune) modelos locales de LLM?

Sí, usando bibliotecas como Axolotl, Ludwig o Hugging Face TRL. El ajuste fino requiere más VRAM que la inferencia: espera al menos 24 GB para modelos de 7B con ajuste completo, o entre 12 y 16 GB con métodos eficientes en parámetros como LoRA. Los pesos ajustados reemplazan o complementan los pesos del modelo base, por lo que puedes desplegar el modelo ajustado usando las mismas herramientas (Ollama, LM Studio, llama.cpp) tras convertirlo al formato GGUF u otro formato compatible con inferencia.

¿Qué modelo local de LLM se acerca más a la calidad de ChatGPT?

Llama 3.1 70B se acerca a la calidad de GPT-4 en razonamiento y seguimiento de instrucciones, mientras que Llama 3.1 405B iguala o supera a GPT-4 en muchas pruebas. Para una calidad equivalente a la de GPT-3.5, Llama 3.1 8BPhi-3.5 14B, Mistral 7B o Qwen 2.5 14B son suficientes. Ningún modelo local replica completamente el comportamiento de ChatGPT, ya que este último emplea aumento por recuperación (retrieval augmentation), múltiples modelos y procesamiento posterior, pero las capacidades fundamentales de los modelos ya son comparables a escala de 70B o superior.

Escrito por Mustafa Ihsan

Mustafa Ihsan es el fundador y editor de Convly.ai. Creó y mantiene la base de datos en vivo de modelos de IA del sitio, su índice de relación precio-rendimiento y sus calculadoras gratuitas para los requisitos de VRAM, los costos de las API y la economía del autohospedaje. Escribe sobre precios de modelos, resultados de pruebas comparativas y el hardware necesario para ejecutar modelos de IA localmente, y prefiere sistemáticamente los datos medidos a las afirmaciones de los fabricantes.

Scroll to Top
Featured on There's An AI For That