Thursday, 20 August 2026 | Updating Daily AI insight, written for builders

LM Studio: Guía completa para ejecutar modelos de IA locales

En resumen:

  • LM Studio es una aplicación gratuita para escritorio que permite ejecutar modelos de lenguaje grandes localmente en tu ordenador, sin necesidad de programación ni de usar la línea de comandos
  • Descarga modelos directamente desde Hugging Face mediante el navegador integrado; admite el formato GGUF con selección automática de cuantización
  • Incluye una interfaz de chat, un servidor API local (compatible con OpenAI) y aceleración por hardware automática (CUDA, Metal, CPU)
  • Requiere suficiente VRAM/RAM según el tamaño del modelo: típicamente un mínimo de 8 GB para modelos de 7B parámetros y 24 GB o más para modelos de 13B parámetros

LM Studio es una aplicación de escritorio que te permite descargar, ejecutar e interactuar con modelos de lenguaje grandes directamente en tu propio equipo. Proporciona una interfaz gráfica para tareas que normalmente requerirían herramientas de línea de comandos, haciendo que la IA local sea accesible tanto para desarrolladores como para usuarios técnicos que desean tener control total sobre sus modelos, sin enviar datos a APIs externas. La aplicación gestiona automáticamente la búsqueda, descarga, selección de cuantización y aceleración por hardware.

A diferencia de los servicios de IA basados en la nube, LM Studio se ejecuta completamente sin conexión una vez que has descargado un modelo. Tus conversaciones, documentos y prompts nunca salen de tu equipo. Esto lo hace adecuado para trabajos sensibles, experimentación sin costes de API y entornos con conectividad a Internet limitada o inexistente.

Instalación

Windows

Descargue el instalador desde lmstudio.ai. El bloque .exe El instalador suele tener entre 200 y 400 MB. Ejecútalo y sigue el asistente de instalación. LM Studio se instalará, por defecto, en C:\Users\[TuNombreDeUsuario]\AppData\Local\LM-Studio Los modelos se descargan, por defecto, en C:\Users\[TuNombreDeUsuario]\.cache\lm-studio\models a menos que cambies esta ruta en la configuración.

Para aceleración GPU en Windows, necesitas controladores NVIDIA versión 522.06 o posterior para soporte CUDA. LM Studio detectará y usará automáticamente tu GPU si está disponible.

macOS

Descargue el .dmg archivo desde lmstudio.aiAbre el archivo y arrastra LM Studio a tu carpeta Aplicaciones. Los modelos se descargan, por defecto, en ~\/Library\/Application Support\/LMStudio\/models .

Las Macs con chips Apple Silicon (M1, M2, M3, M4) obtienen aceleración Metal automática. Las Macs con procesadores Intel usarán inferencia en CPU, lo cual es significativamente más lento pero funcional para modelos pequeños.

Linux

Descargue el .AppImage archivo. Hazlo ejecutable con chmod +x LM-Studio-*.AppImage, luego ejecútalo con .\/LM-Studio-*.AppImageLos modelos se descargan, por defecto, en ~\/\.cache\/lm-studio\/models.

Para aceleración GPU NVIDIA, instala el kit de herramientas CUDA 11.8 o posterior y asegúrate de que nvidia-smi muestre tu GPU. LM Studio detectará CUDA automáticamente.

Descargar y cargar modelos

LM Studio utiliza el formato GGUF, un formato de modelo cuantizado que reduce los requisitos de memoria manteniendo la calidad. Al abrir LM Studio, haz clic en el icono de búsqueda en la barra lateral izquierda para explorar modelos. La búsqueda integrada extrae resultados de Hugging Face y filtra archivos GGUF compatibles.

Busca un modelo por su nombre (por ejemplo, «llama 3.1», «mistral», «phi»). Cada resultado muestra varios niveles de cuantización, etiquetados como Q4_K_M, Q5_K_S, o Q8_0El número indica la profundidad de bits: Q4 usa 4 bits por peso, Q8 usa 8 bits. Valores más bajos implican menor tamaño de archivo y mayor velocidad de inferencia, aunque con una ligera reducción de calidad.

Para la mayoría de los casos de uso, Q4_K_M o Q5_K_M ofrece el mejor equilibrio. Usa nuestra Calculadora de VRAM para estimar cuánta memoria requerirá un modelo específico junto con su nivel de cuantización. Como orientación general:

Tamaño del modeloVRAM para Q4_K_MVRAM para Q5_K_MVRAM para Q8_0
7B parámetros~5 GB~6 GB~9 GB
13B parámetros~9 GB~11 GB~16 GB
34B parámetros~22 GB~27 GB~40 GB
70B parámetros~42 GB~51 GB~75 GB

Haz clic en el icono de descarga junto al nivel de cuantización elegido. El tamaño de los modelos varía entre 3 GB y más de 50 GB, dependiendo de su dimensión. Una vez descargado, haz clic en el nombre del modelo en tu biblioteca para cargarlo. LM Studio mostrará la asignación de GPU y RAM en la esquina inferior derecha. Si el modelo no cabe íntegramente en la VRAM, se trasladarán capas a la memoria RAM del sistema, lo que ralentiza considerablemente la inferencia.

Usar la interfaz de chat

Tras cargar un modelo, la interfaz de chat aparece en la ventana principal. Escribe tu prompt en el cuadro de texto situado en la parte inferior y pulsa Intro o haz clic en el icono de envío. El modelo genera una respuesta localmente: no se requiere conexión a Internet una vez cargado.

Controles principales:

  • Control deslizante de temperatura (barra lateral derecha): controla el grado de aleatoriedad. Valor entre 0,1 y 0,3 para tareas factuales; entre 0,7 y 1,0 para escritura creativa
  • Tokens máximos: limita la longitud de la respuesta. El valor predeterminado suele ser 2048; aumente este valor para obtener respuestas más largas
  • Indicación del sistema: define el comportamiento y la personalidad del modelo. Haga clic en «Editar» en la barra superior para modificarla
  • Secuencias de detención: tokens que interrumpen la generación de forma anticipada, útiles para formatos de salida estructurados

LM Studio admite conversaciones con múltiples turnos. Cada mensaje permanece en el contexto hasta que haga clic en «Nuevo chat» o se llene la ventana de contexto. La mayoría de los modelos cuentan con una ventana de contexto de 4k a 32k tokens; consulte la ficha del modelo para conocer los detalles específicos.

Ejecutar un servidor API local

LM Studio incluye un servidor API compatible con OpenAI, lo que le permite usar modelos locales como sustitutos directos de GPT-4 o GPT-3.5 en aplicaciones existentes. Haga clic en el icono de la barra lateral izquierda para abrir la pestaña «Servidor local».

Seleccione un modelo cargado desde el menú desplegable y haga clic en «Iniciar servidor». El servidor se ejecuta, por defecto, en http://localhost:1234 . La interfaz muestra un ejemplo de código:

curl http://localhost:1234/v1/chat/completions 
  -H "Content-Type: application/json" 
  -d '{
    "model": "local-model",
    "messages": [{"role": "user", "content": "Hola"}]
  }'

Cualquier herramienta que admita el formato de API de OpenAI funciona con el servidor de LM Studio. Establezca la URL base en http://localhost:1234/v1 y utilice cualquier cadena no vacía como clave API (LM Studio no la valida). Esto incluye:

  • LangChain (Python/JS): configure openai_api_base en localhost
  • SDK de Python de OpenAI: openai.api_base = "http://localhost:1234/v1"
  • Editores de texto con funciones de IA (Cursor, Continue, Cody): especifique localhost en la configuración
  • Scripts personalizados: reemplace https://api.openai.com/v1 con http://localhost:1234/v1

El servidor admite respuestas en streaming y llamadas a funciones (si el modelo está entrenado para ello). Consulte los registros en la pestaña «Servidor» para depurar las solicitudes.

Configuración y ajustes de hardware

Haga clic en el icono de engranaje (Ajustes) en la esquina inferior izquierda para configurar:

  • Ruta de la carpeta de modelos: cambie la ubicación donde se descargan y cargan los modelos
  • Capas de descarga en GPU: controla cuántas capas se ejecutan en GPU frente a CPU. La detección automática funciona bien, pero ajustarla manualmente puede ayudar si ejecuta varios programas simultáneamente
  • Anulación de la longitud del contexto: aumente este valor si el modelo lo soporta y necesita conversaciones más largas. Un contexto mayor consume más VRAM
  • Hilos de inferencia: número de hilos de CPU dedicados a la inferencia. Por defecto es automático, pero establecerlo igual al número de núcleos físicos (no los hilos lógicos o hyperthreading) puede mejorar la velocidad

Para obtener el mejor rendimiento, cierre otras aplicaciones intensivas en GPU (juegos, edición de vídeo, renderizado 3D) antes de cargar modelos grandes. En portátiles, conecte el adaptador de corriente y configure el modo de energía en «Alto rendimiento», ya que la reducción dinámica de frecuencia (throttling) de CPU y GPU afecta significativamente la velocidad de inferencia.

LM Studio frente a Ollama

LM Studio y Ollama ejecutan ambos modelos locales, pero difieren en su interfaz y flujo de trabajo:

FunciónLM StudioOllama
InterfazInterfaz gráfica de escritorioLínea de comandos + API
Descubrimiento de modelosNavegador integradoRegistro de modelos independiente
FormatoArchivos GGUFFormato personalizado (conversión desde GGUF)
Control de cuantizaciónElija una cuantización específicaAutomática
Interfaz de chatIntegradaNinguna (use herramientas externas)
Curva de aprendizajeMás baja (visual)Más pronunciada (línea de comandos)

Use LM Studio si prefiere una interfaz visual, control directo sobre los archivos de modelo y no desea usar la terminal. Use Ollama si prefiere flujos de trabajo basados en línea de comandos, busca un servidor ligero o planea integrarlo en una canalización automatizada. Ambas herramientas son gratuitas y gestionan la aceleración por GPU de forma similar. Consulte nuestra guía sobre modelos locales para recomendaciones compatibles con cualquiera de las dos herramientas.

Elegir modelos para LM Studio

El modelo que elija dependerá de su hardware y caso de uso. Consulte nuestra Base de datos de modelos de IA para conocer las especificaciones y los requisitos de VRAM de más de 37 modelos.

Para 8–16 GB de VRAM: Llama 3.1 8B, Mistral 7B, Phi-3 Medium (14B). Estos modelos manejan bien conversaciones generales, asistencia en programación y resúmenes.

Para 24 GB de VRAM: Llama 3.1 70B (cuantización Q3), Mixtral 8x7B, Command R+ 35B (cuantización Q4). Salto significativo en calidad para razonamiento e instrucciones complejas.

Para 48 GB o más de VRAM: Llama 3.1 405B (cuantización Q3), Qwen 2.5 72B (cuantización Q5). Rendimiento cercano al estado del arte en la mayoría de las tareas.

Si no está seguro de si un modelo es compatible con su hardware, use el Calculadora de VRAM antes de descargarlo. Un modelo que apenas cabe en la VRAM se descargará parcialmente a la RAM y funcionará de 5 a 10 veces más lento que uno cargado completamente en VRAM.

Preguntas frecuentes

¿Funciona LM Studio sin conexión?

Sí, por completo. Necesita conexión a Internet únicamente para descargar los modelos inicialmente; una vez descargados, LM Studio funciona sin conexión. Los modelos, la inferencia y el servidor de API local operan totalmente sin red. Esto lo hace adecuado para entornos aislados (air-gapped) o para trabajar sin conectividad.

¿Puedo usar los modelos de LM Studio en mis propias aplicaciones?

Sí. Inicie el servidor de API local en LM Studio y apunte su aplicación a http://localhost:1234/v1. Cualquier código que utilice el formato de API de OpenAI funcionará sin modificaciones. También puede cargar archivos GGUF directamente desde su código mediante bibliotecas como llama.cpp, llama-cpp-python, o ctransformers—las descargas de modelos de LM Studio son archivos GGUF estándar almacenados en su carpeta de caché.

¿Cuánto cuesta LM Studio?

LM Studio es gratuito. No hay tarifas de suscripción, cargos por API ni límites de uso. Los modelos también son gratuitos: la mayoría son de código abierto y cuentan con licencias permisivas (MIT, Apache 2.0, Licencia Comunitaria Llama 3.1). Sus únicos costos son el hardware y la electricidad. Utilice nuestra calculadora de autohospedaje frente a API para comparar los costos de inferencia local frente a los precios de las APIs en la nube.

¿Por qué es tan lenta la inferencia en mi equipo?

Tres causas comunes: (1) El modelo no cabe en la VRAM y se descarga parcialmente a la RAM: revise la visualización de memoria en LM Studio e intente usar una cuantización menor o un modelo más pequeño. (2) La GPU no se detecta: verifique los controladores (Windows/Linux) o asegúrese de estar utilizando Apple Silicon (macOS). (3) Regulación de frecuencia de la CPU en portátiles: conecte el equipo a la corriente y seleccione el modo de alto rendimiento. La velocidad de inferencia escala aproximadamente con el ancho de banda de la VRAM, por lo que las GPU antiguas o móviles serán más lentas que las tarjetas de escritorio, incluso si disponen de suficiente memoria.

¿Puedo ajustar finamente o entrenar modelos en LM Studio?

No. LM Studio está diseñado exclusivamente para inferencia: carga y ejecuta modelos preentrenados, pero no admite entrenamiento ni ajuste fino. Para ello, necesita frameworks especializados como Axolotl, Hugging Face Transformers o MLX (para Apple Silicon). Puede ajustar finamente un modelo en otro lugar, exportarlo al formato GGUF y luego cargar ese modelo ajustado en LM Studio.

¿Cuál es la diferencia entre etiquetas de cuantización como Q4_K_M, Q5_K_S y otras?

El número (Q4, Q5, Q8) indica la cantidad de bits por peso: cuanto menor sea, más pequeño y rápido será el modelo; cuanto mayor sea, mayor será su precisión. El sufijo indica el método de cuantización: K_M (medio, equilibrado), K_S (pequeño, compresión más agresiva), K_L (grande, conserva más precisión). Para la mayoría de los usuarios, Q4_K_M o Q5_K_M es el punto óptimo. Solo use Q2 o Q3 si la VRAM es extremadamente limitada; la calidad disminuye notablemente. Q8 se acerca mucho a la precisión completa, pero ofrece poca mejora de calidad respecto a Q5 en la mayoría de las tareas, mientras que duplica el requisito de VRAM.

Escrito por Mustafa Ihsan

Mustafa Ihsan es el fundador y editor de Convly.ai. Creó y mantiene la base de datos en vivo de modelos de IA del sitio, su índice de relación precio-rendimiento y sus calculadoras gratuitas para los requisitos de VRAM, los costos de las API y la economía del autohospedaje. Escribe sobre precios de modelos, resultados de pruebas comparativas y el hardware necesario para ejecutar modelos de IA localmente, y prefiere sistemáticamente los datos medidos a las afirmaciones de los fabricantes.

Scroll to Top
Featured on There's An AI For That