- LM Studio es una aplicación gratuita para escritorio para descubrir, descargar y ejecutar localmente modelos de lenguaje grandes en Windows, macOS y Linux.
- Incluye una interfaz gráfica de chat, un explorador de modelos (búsqueda integrada en Hugging Face) y un servidor HTTP local compatible con la API de OpenAI de modo que los SDK existentes apunten a
http://localhost:1234/v1sin necesidad de modificar el código. - Ejecuta modelos cuantizados modelos GGUF mediante llama.cpp en todas las plataformas y MLX modelos en Apple Silicon; junto con la interfaz gráfica se incluye una herramienta de línea de comandos denominada
lmslmstudio-cli - La viabilidad práctica depende de la VRAM: un modelo de 8B en cuantización de 4 bits requiere aproximadamente 5 GB, mientras que un modelo de 70B necesita unos 40 GB. Utilice la Calculadora de VRAM calculadora de requisitos de memoria
LM Studio es una aplicación gratuita para escritorio, de código cerrado, que le permite descargar y ejecutar modelos abiertos de lenguaje grande íntegramente en su propia máquina. Está disponible para Windows, macOS y Linux, incorpora motores de inferencia (llama.cpp en todas las plataformas y MLX en Apple Silicon), ofrece una interfaz gráfica similar a la de ChatGPT y expone un servidor REST local compatible con la API de OpenAI en localhost:1234 para que las aplicaciones desarrolladas con el SDK de OpenAI puedan comunicarse con un modelo local sin modificaciones.
La aplicación es desarrollada por el equipo detrás de lmstudio.ailmstudio.ai página sobre uso profesional, también es gratuita para uso laboral; la redistribución comercial está sujeta a sus propios términos.
Qué LM Studio realmente hace
LM Studio combina cuatro funcionalidades que normalmente requerirían herramientas independientes:
- Descubrimiento de modelos. Una interfaz de búsqueda integrada consulta Hugging Face para archivos GGUF y MLX. Elija una cuantización (Q4_K_M, Q5_K_M, Q6_K, Q8_0, etc.) y se descargará directamente en una carpeta local de modelos.
- Interfaz gráfica de chat. Una ventana de chat multipaso con indicaciones del sistema personalizables por conversación, controles deslizantes para temperatura y top-p, salidas estructuradas (esquema JSON) y soporte para adjuntar PDF o imágenes (este último únicamente con modelos compatibles con visión).
- Servidor local de inferencia. Un punto final HTTP en
http://localhost:1234/v1que implementa las interfaces de la API de OpenAI para Chat Completions, Completions y Embeddings. Consulte la documentación oficial del proveedor sobre compatibilidad con OpenAI. - CLI (
lms). Una herramienta de línea de comandos para automatizar la carga y descarga de modelos, así como el control del servidor. La instalación y los comandos se documentan en lmstudio.ai/docs/cli.
En segundo plano, la inferencia se ejecuta mediante llama.cpp llama.cpp Apple MLX para modelos en formato MLX en Apple Silicon. LM Studio incluye binarios precompilados de los motores e incluye opciones para cambiarlos o actualizarlos desde la configuración de tiempo de ejecución de la aplicación.
Plataformas compatibles
| Plataforma | Requisitos (según el proveedor) | Aceleración |
|---|---|---|
| Windows | x64 o ARM64; CPU compatible con AVX2 en x64 | CPU, CUDA de NVIDIA, Vulkan (GPU AMD/Intel) |
| macOS | Apple Silicon (M1 o posterior), macOS 13.4+ | Metal (llama.cpp) y MLX |
| Linux | x64, glibc 2.35+, distribuido como AppImage | CPU, NVIDIA CUDA, Vulkan |
Los requisitos publicados actualmente se encuentran en la página oficial de descarga; compruébelos antes de instalar, ya que los mínimos exactos varían entre versiones.
Windows
El instalador es un estándar .exe. Los modelos, por defecto, usan %USERPROFILE%\.lmstudiomodels. Las GPU de NVIDIA utilizan CUDA cuando se selecciona un entorno de ejecución compatible; las demás GPU recurren a Vulkan. Se requiere AVX2 en CPUs x64, por lo que se excluyen procesadores muy antiguos.
macOS
Se distribuye como un .dmg. En Apple Silicon, además de los formatos GGUF, también están disponibles modelos en formato MLX, que aprovechan eficientemente la memoria unificada. Los modelos, por defecto, usan ~/.lmstudio/models. Los Mac con procesadores Intel no son compatibles con las versiones actuales.
Linux
Se entrega como un .AppImage. Asígnale permisos de ejecución (chmod +x LM-Studio-*.AppImage) y ejecútalo directamente. Las GPU de NVIDIA usan CUDA; las de AMD e Intel usan Vulkan. No existe una versión oficial de .deb o .rpm en el momento de redactar este texto — consulte la página de descarga para conocer el empaquetado actual.
Qué puede ejecutar en LM Studio
LM Studio puede cargar cualquier modelo GGUF compatible con llama.cpp, además de modelos MLX en Apple Silicon. La verdadera limitación es qué tanto cabe en su hardware. Huellas aproximadas de uso de VRAM en cuantización de 4 bits, según la base de datos de modelos Convly:
| Modelo | Contexto | ~VRAM a 4 bits |
|---|---|---|
| Gemma 3 4B | 128 K | ~3 GB |
| Mistral 7B | 32K | ~4,5 GB |
| Llama 3.1 8B | 128 K | ~5 GB |
| Qwen3 8B | 128 K | ~5 GB |
| Phi-4 | 16K | ~9 GB |
| Gemma 3 12B | 128 K | ~8 GB |
| Qwen3 14B | 128 K | ~9 GB |
| Gemma 3 27B | 128 K | ~16 GB |
| Qwen3 32B | 128 K | ~20 GB |
| Llama 3.3 70B | 128 K | ~40 GB |
Cualquier modelo superior a unos 40 GB requiere múltiples GPU o tarjetas gráficas con mucha VRAM. Modelos muy grandes como DeepSeek R1 (~400 GB en cuantización de 4 bits) no son prácticos de ejecutar en una sola GPU de escritorio. Consulte la guía completa sobre tabla de requisitos de VRAM y la GPU para LLM locales antes de comprar hardware.
El servidor compatible con la API de OpenAI
La característica más útil para desarrolladores es el servidor local. Inícielo desde la pestaña Desarrollador del interfaz gráfico o mediante la CLI. Una vez en ejecución, acepta solicitudes estándar al estilo de OpenAI:
curl http://localhost:1234/v1/chat/completions
-H "Content-Type: application/json"
-d '{
"model": "loaded-model-identifier",
"messages": [{"role": "user", "content": "Hello"}]
}'
El SDK de Python funciona apuntando a base_url el servidor local:
from openai import OpenAI
client = OpenAI(base_url="http://localhost:1234/v1", api_key="lm-studio")
El api_key El valor del campo se ignora de forma predeterminada, pero el campo debe estar presente porque el SDK de OpenAI lo exige. Los puntos finales compatibles y cualquier desviación respecto al esquema de OpenAI se enumeran en la referencia de la API.
LM Studio frente a Ollama
Ambos son las formas más comunes de ejecutar LLM locales en una estación de trabajo. A grandes rasgos, la diferencia es la siguiente:
| LM Studio | Ollama | |
|---|---|---|
| Interfaz principal | Interfaz gráfica de escritorio (chat, explorador de modelos) | CLI y API HTTP |
| Licencia | Aplicación de código cerrado; gratuita para uso personal y profesional | Código abierto (licencia MIT) |
| Origen de los modelos | Hugging Face (GGUF, MLX) mediante búsqueda integrada en la aplicación | Registro de modelos de Ollama (con importación desde GGUF) |
| Servidor | Compatible con OpenAI en :1234 |
API nativa en :11434, capa compatible con OpenAI |
| MLX para Apple Silicon | Sí | No (solo llama.cpp) |
Si busca una interfaz gráfica intuitiva y soporte para MLX en Mac, LM Studio es el punto de partida más sencillo. Si prefiere una pila de código abierto automatizable y un servidor sin interfaz gráfica, consulte la Guía de Ollama y guía de instalación paso a paso.
Cuándo usar LM Studio en lugar de una API alojada
La inferencia local implica un verdadero compromiso. Sus ventajas son la privacidad (nada sale del equipo), un costo predecible tras amortizar el hardware y disponibilidad sin conexión. Sus desventajas son el costo inicial de capital, una velocidad menor en tokens/segundo comparada con un clúster de GPU alojado y la imposibilidad de acceder a los modelos propietarios de vanguardia.
Para hacernos una idea aproximada del umbral de coste: los modelos alojados en el ranking de LLM de Convly van desde unos 0,02 USD por millón de tokens de entrada para modelos abiertos pequeños en proveedores sin servidor, hasta 10 USD por millón de tokens de entrada y 50 USD por millón de tokens de salida para modelos propietarios de vanguardia. Si su carga de trabajo se sitúa en el extremo de los modelos pequeños y puede tolerar una calidad de 8B–30B, alojarlos usted mismo en una única GPU de consumo suele resultar más económico en términos de coste total. Calcule sus propios números con la calculadora de autohospedaje frente a API y la Calculadora de costos de API.
Lista de comprobación práctica de configuración
- Compruebe la VRAM. Cualquier modelo mayor que la memoria de su GPU se desbordará a la RAM del sistema y se ralentizará drásticamente. Use la Calculadora de VRAM.
- Descargue LM Studio desde lmstudio.ai/download. No lo instale desde espejos de terceros.
- En la pestaña Descubrir de la aplicación, seleccione un modelo que se ajuste a su hardware. Comience con una cuantización Q4_K_M, que ofrece el mejor equilibrio entre tamaño y calidad.
- Cargue el modelo. Observe el indicador de VRAM; si no puede descargarlo completamente a la GPU, elija una cuantización menor o un modelo más pequeño.
- Active el servidor desde la pestaña Desarrollador si planea acceder a él desde código. Confirme su funcionamiento con
curl http://localhost:1234/v1/models.
Para una guía paso a paso con capturas de pantalla, consulte la Guía completa de LM Studio. Para listas de modelos recomendados adaptados al hardware local, consulte mejores modelos locales (las recomendaciones son igualmente válidas para LM Studio, ya que ambos motores usan llama.cpp).
Preguntas frecuentes
¿Es gratuito LM Studio?
Sí. LM Studio es gratuito para descargarlo y usarlo con fines personales y, según la política del fabricante para uso profesional, también con fines profesionales. La aplicación en sí es de código cerrado, pero los modelos que ejecuta son modelos de pesos abiertos licenciados por sus respectivos editores (Meta, Google, Alibaba, Mistral, etc.).
¿Envía LM Studio datos a la nube?
La inferencia se ejecuta íntegramente en su equipo: ni los prompts ni las respuestas salen del dispositivo. La aplicación sí se conecta a Hugging Face al buscar o descargar modelos, y comprueba si hay actualizaciones. Según la página de privacidad del fabricanteno se recopila telemetría sobre el contenido de las conversaciones; revise dicha página directamente para conocer la política vigente.
¿Qué formatos de modelo admite LM Studio?
GGUF en todas las plataformas (mediante llama.cpp) y MLX en los chips Apple Silicon. Los puntos de control (checkpoints) sin procesar de Hugging Face safetensors y PyTorch no se admiten directamente: conviértalos primero a GGUF o descargue un GGUF ya cuantizado que la comunidad haya publicado previamente.
¿Puedo usar LM Studio como sustituto directo de la API de OpenAI?
Para finalizaciones de chat, finalizaciones y embeddings, en gran medida sí: basta con apuntar el SDK de OpenAI a base_url la dirección http://localhost:1234/v1 y el código existente funcionará. No se implementan funciones que dependan del comportamiento específico del servidor de OpenAI (asistentes, API de archivos, generación de imágenes, moderación). Consulte la lista actual de puntos de conexión.
¿Cuánta RAM o VRAM necesito?
Regla general para cuantización de 4 bits: el tamaño del modelo en miles de millones de parámetros multiplicado por ~0,6 da como resultado la cantidad de GB de VRAM necesarios para los pesos, más algunos GB adicionales para la caché KV en contextos largos. Un modelo de 7–8 mil millones de parámetros funciona cómodamente en una GPU de 8 GB; un modelo de 70 mil millones requiere aproximadamente 40 GB (véanse las cifras de Convly Base de datos de modelos anteriores). Para un desglose detallado por modelo, consulte requisitos de VRAM.
¿Admite LM Studio llamadas a herramientas y salidas estructuradas?
Sí, para salidas estructuradas mediante esquemas JSON; además, las llamadas a herramientas o funciones están disponibles para los modelos cuyas plantillas de chat lo indican explícitamente (en particular, versiones recientes de Llama, Qwen, Mistral y Gemma). La calidad de las llamadas a herramientas depende del modelo subyacente, no de LM Studio en sí. Pruebe con su modelo objetivo antes de implementarlo en producción.
