Wednesday, 26 August 2026 | Updating Daily AI insight, written for builders

LM Studio en Chicago: Qué significa esta búsqueda y cómo ejecutar modelos localmente

  • No existe un servidor, región ni edición de “LM Studio Chicago”. LM Studio es una aplicación de escritorio para Windows, macOS y Linux; la inferencia se ejecuta en tu propia CPU o GPU, por lo que su ubicación es simplemente donde esté tu equipo.
  • Para ejecutarla en Chicago, basta con hacerlo: instala la aplicación, descarga un modelo GGUF o MLX y luego inicia el servidor compatible con OpenAI en http://localhost:1234/v1.
  • Si “Chicago” hace referencia a la residencia de los datos (BIPA, HIPAA, contratos con clientes), la inferencia local es la respuesta más sólida posible: los prompts nunca llegan a un proveedor externo.
  • Si buscabas un estudio de diseño o fotografía de Chicago llamado “LM Studio,” se trata de un negocio local independiente, no de este software.

LM Studio es una aplicación de escritorio gratuita para ejecutar modelos de lenguaje grandes localmente en tu propio equipo: no tiene oficina en Chicago, ni región de servidores en esa ciudad, ni versión específica para ninguna localidad. Las búsquedas de “lm studio chicago” casi siempre hacen referencia a una de estas tres cosas: ejecutar LM Studio en una estación de trabajo ubicada en Chicago, mantener los datos dentro de Illinois por motivos de cumplimiento normativo, o bien una empresa local con nombre similar.

¿Qué “LM Studio Chicago” estás buscando?

Lo que probablemente querías decir Requisitos reales
Ejecutar LLMs localmente en una máquina ubicada en Chicago Instala LM Studio normalmente: nada en su configuración depende de la ciudad
Una región de servidor o punto final de baja latencia en Chicago No aplica. LM Studio no ofrece ningún servicio alojado. Usa una API en la nube con región US-Central, o coloca físicamente tu propio servidor
Residencia de datos en Illinois o cumplimiento normativo Inferencia local: los datos permanecen en el dispositivo bajo tu control
Compra una GPU o estación de trabajo en la zona de Chicago Venta minorista local (la tienda Westmont de Micro Center suele ser la opción habitual) o compra en línea; consulta la guía de GPUs más abajo
Un estudio de diseño, fotografía o arquitectura de Chicago llamado LM Studio Un negocio totalmente distinto: esta página trata sobre la aplicación de LLM

Por qué no existe una región de Chicago

LM Studio es una interfaz gráfica (GUI) que envuelve motores locales de inferencia: llama.cpp para modelos GGUF en todas las plataformas y el framework MLX de Apple en equipos con chip Apple Silicon. El único tráfico saliente hacia Internet corresponde a la búsqueda y descarga de modelos (los pesos se obtienen desde Hugging Face mediante HTTPS), comprobaciones de actualizaciones de la aplicación y descargas opcionales de tiempo de ejecución. Una vez que el archivo del modelo está almacenado en disco, puedes desconectar la red y seguir funcionando normalmente.

Esta arquitectura explica por qué hablar de “región” constituye aquí una categoría errónea: no existe plano de control, ni inquilino ni cuenta que crear. La latencia que te interesa es el ancho de banda de memoria de tu propia GPU, no un viaje de ida y vuelta hasta un centro de datos. Para conocer más detalles sobre la aplicación, consulta la Guía completa de LM Studio.

Instalación de LM Studio en Windows

Descargue el .exe documentación oficial de lmstudio.ai. Las versiones recientes incluyen instaladores tanto para x64 como para ARM64 (Snapdragon X); la versión x64 requiere una CPU compatible con AVX2.

  • El instalador, por defecto, se instala por usuario y se ubica en %LOCALAPPDATA%\Programs — en la mayoría de los casos no se requieren privilegios de administrador.
  • Los modelos se almacenan de forma predeterminada en %USERPROFILE%\.lmstudiomodels. Puedes cambiar este directorio desde la pestaña Mis modelos si deseas guardarlos en un segundo disco; unas pocas cuantizaciones de 30B ocuparán rápidamente 100 GB.
  • Las GPU de NVIDIA utilizan el entorno de tiempo de ejecución CUDA, que LM Studio descarga como un paquete independiente. Las GPU de AMD e Intel recurren a Vulkan como alternativa, y ROCm está disponible en algunas tarjetas AMD. Los entornos de tiempo de ejecución disponibles varían entre versiones, así que revisa el panel de hardware/tiempos de ejecución en tu versión concreta, en lugar de asumir qué está disponible.
  • Habilita la CLI una vez mediante cmd /c %USERPROFILE%\.lmstudiobin\lms.exe bootstrap, y luego usa lms desde cualquier terminal.

Instalación de LM Studio en macOS

Las versiones actuales requieren Apple Silicon (M1 o posterior) y una versión razonablemente reciente de macOS — generalmente se indica como mínimo macOS 13.4. Los Mac con procesador Intel solo fueron compatibles con versiones anteriores, por lo que si usas un iMac de 2019 deberás recurrir a una versión archivada, no a la más reciente.

  • Abre el archivo .dmg y arrastra LM Studio a /Applications.
  • Prefiere MLX los modelos en formato MLX frente a GGUF cuando ambos están disponibles. MLX es el propio framework de arrays de Apple y suele ofrecer mejor rendimiento en sistemas con memoria unificada, aunque la disponibilidad de modelos es más limitada.
  • macOS limita la cantidad de memoria unificada que la GPU puede asignar: aproximadamente dos tercios a tres cuartas partes de la RAM instalada. Existe un sysctl para elevar ese límite, pero la clave exacta ha cambiado entre versiones de macOS, así que búscala para tu versión específica en lugar de copiar un comando antiguo de un foro.
  • CLI: ~/\.lmstudio\/bin\/lms bootstrap.

Instalación de LM Studio en Linux

Linux se distribuye como una AppImage para x86-64. En el momento de redactar este artículo no existe una compilación oficial para ARM Linux, por lo que no es viable usar una Raspberry Pi ni un servidor Ampere.

chmod +x LM-Studio-*.AppImage
./LM-Studio-*.AppImage

En Ubuntu 22.04 y versiones posteriores quizás necesites libfuse2 para que las AppImage puedan montarse; como alternativa, puedes usar ./LM-Studio-*.AppImage --appimage-extract-and-run. Para NVIDIA, instala primero el controlador propietario y confirma su funcionamiento con nvidia-smi antes de iniciar la aplicación. Los modelos se almacenan en ~/.lmstudio/models en versiones recientes; las versiones anteriores usaban una ruta bajo ~/.cache, así que verifica directamente en la aplicación en lugar de adivinar.

Poner modelos a disposición del resto de tu oficina

Esta es la parte sobre la que realmente giran la mayoría de las preguntas del tipo «LLM local en Chicago»: una estación de trabajo potente a la que acceden varios desarrolladores. Activa el servidor desde la pestaña Desarrollador o desde la CLI.

lms server start --port 1234
lms ls          # modelos instalados
lms ps          # modelos actualmente cargados
lms load qwen2.5-coder-7b-instruct
lms unload --all
lms log stream  # observa las solicitudes en tiempo real

El servidor implementa el formato de comunicación de OpenAI, por lo que la mayoría de los SDK funcionan simplemente modificando la URL base y usando una clave ficticia.

Endpoint Finalidad
GET /v1/models Enumera los modelos cargados y disponibles
POST /v1/chat/completions Chat con soporte para transmisión (streaming)
POST /v1/completions Completado de texto sin formato
POST /v1/embeddings Incrustaciones (embeddings), cuando se ha cargado un modelo de incrustación
/api/v0/* API REST nativa de LM Studio, incorporada en versiones posteriores de la serie 0.3.x; expone información adicional sobre el estado de carga
curl http://localhost:1234/v1/chat/completions 
  -H "Content-Type: application/json" 
  -d '{"model": "qwen2.5-coder-7b-instruct", "messages": [{"role": "user", "content": "Resume este repositorio."}]}'
from openai import OpenAI

client = OpenAI(base_url="http://localhost:1234/v1", api_key="lm-studio")
resp = client.chat.completions.create(
    model="qwen2.5-coder-7b-instruct",
    messages=[{"role": "user", "content": "Hola"}],
)

Nota de seguridad: El servidor de LM Studio no incluye autenticación. Habilitar su acceso desde la red local es tan sencillo como activar una opción, pero no debes redirigir puertos ni vincularlo a una interfaz pública. Si un equipo necesita acceder a él, colócalo tras un proxy inverso que imponga autenticación, o accede mediante Tailscale o una VPN.

Evaluación del hardware antes de comprarlo

Aproximadamente la memoria que requiere una cuantización de 4 bits, antes de considerar el contexto. Trata estos valores como estimaciones orientativas, no como garantías: el método de cuantización, el tamaño de la caché KV y la longitud del contexto afectan al total final.

Tamaño del modelo Memoria aproximada con ~Q4 Objetivo práctico
7–8B 5–6 GB GPU de 8 GB o cualquier Mac con 16 GB
13–14 mil millones 9–10 GB GPU de 12 GB
24B 14–16 GB GPU de 16–24 GB
30–32B 19–22 GB GPU de 24 GB (clase RTX 3090 / 4090)
70B 40–45 GB 2× GPU de 24 GB o memoria unificada de 64 GB o más

Prueba tu configuración exacta con la Calculadora de VRAM antes de realizar ningún pedido, y compárala con la tabla de requisitos de VRAM por modelo. Si aún no has elegido una tarjeta gráfica, la mejoras GPUs para modelos de lenguaje local comparación detalla en qué puntos cambia la relación precio por GB útil. Chicago ofrece una ventaja digna de aprovechar: la tienda Micro Center de Westmont permite comprar una GPU en persona y devolverla también en persona si no cabe en tu chasis o no se ajusta a tu presupuesto de fuente de alimentación — verifica el stock disponible antes de desplazarte.

El ángulo de residencia de datos en Illinois

Illinois es una jurisdicción inusualmente exigente en materia de privacidad. La Ley de Protección de la Información Biométrica (BIPA, 740 ILCS 14) otorga derecho de acción individual y ha generado acuerdos indemnizatorios sustanciales; la Ley sobre Entrevistas en Video con Inteligencia Artificial impone obligaciones de notificación y consentimiento para el análisis con IA de entrevistas a candidatos; y las enmiendas a la Ley de Derechos Humanos de Illinois extienden la responsabilidad por discriminación a la IA utilizada en decisiones laborales. La inferencia local elimina por completo al procesador externo, razón por la cual muchas organizaciones reguladas de Chicago —sistemas hospitalarios, aseguradoras, bufetes de abogados y firmas de trading— suelen optar por LM Studio u Ollama para herramientas internas. Sin embargo, esto no exime de cumplir con las obligaciones de notificación, consentimiento o no discriminación. Confirma los detalles específicos con asesoría jurídica, no con un simple cambio de configuración.

Si realmente deseas un punto final alojado en Chicago

Hay dos opciones, ninguna de las cuales es LM Studio. Alquila un modelo alojado desde una API comercial y selecciona una región en el centro de EE. UU. — los costos están detallados en la Calculadora de costos de API. O bien instala tu propio servidor con GPU; Chicago es un mercado de interconexión de primer nivel, y el edificio 350 E. Cermak figura entre los centros de telecomunicaciones más reconocidos del país. Antes de comprometer capital, evalúa los costos con la calculadora de punto de equilibrio entre alojamiento local y uso de API — para uso interno de bajo volumen, los tokens de la API suelen ser más económicos que poseer hardware, y el punto de equilibrio llega más tarde de lo que la mayoría de los equipos esperan.

Preguntas frecuentes

¿Existe un servidor o centro de datos de LM Studio en Chicago?

No. LM Studio no ofrece ningún servicio de inferencia alojada en ninguna parte, por lo que no hay nada que ubicar en Chicago ni en ninguna otra región. Toda la generación ocurre en la máquina donde se ejecuta la aplicación. Los únicos servidores involucrados son los de Hugging Face para descargas de modelos y los puntos finales de actualización propios de LM Studio.

¿Funciona LM Studio completamente sin conexión?

Sí, una vez que los modelos se han descargado. Necesitas conexión a Internet para buscar y descargar los pesos del modelo y los paquetes de tiempo de ejecución, pero después de eso la aplicación se carga y ejecuta los modelos sin necesidad de acceso a la red. Esta es precisamente la razón habitual por la que supera las revisiones en entornos corporativos aislados (air-gapped) o altamente restringidos.

¿Es gratuito el uso comercial de LM Studio en una empresa de Chicago?

LM Studio eliminó su anterior restricción de uso exclusivo para particulares y ahora permite su uso en entornos laborales sin costo alguno; no obstante, los términos de licencia son del tipo que pueden cambiar entre versiones. Lee los términos vigentes en lmstudio.ai antes de desplegarla en todo un equipo. Ten en cuenta además que los pesos de los modelos tienen sus propias licencias: algunos modelos de código abierto restringen expresamente su uso comercial, independientemente de lo que permita el entorno de ejecución.

¿LM Studio u Ollama para un pequeño equipo?

LM Studio destaca en descubrimiento e iteración: cuenta con una verdadera interfaz gráfica, un explorador de modelos, ajuste de parámetros por modelo y una interfaz de chat accesible incluso para usuarios no técnicos. Ollama, por su parte, sobresale en despliegues sin interfaz gráfica y automatización mediante scripts, ofreciendo una integración más limpia con Docker y CI. Muchos equipos usan ambos: LM Studio en las laptops de los desarrolladores y Ollama en el servidor compartido. Consulta la Guía de Ollama para ese lado de la comparación.

¿Puede toda la oficina conectarse a una sola máquina con LM Studio?

Técnicamente sí: active el servicio en red y configure los clientes para que apunten a http://<host>:1234/v1. En la práctica, recuerde que no hay autenticación integrada ni una cola de solicitudes diseñada para muchos usuarios simultáneos. Para cualquier entorno que vaya más allá de unos pocos desarrolladores, coloque un proxy con autenticación delante o migre a una pila de servicio especializada, como vLLM.

¿Cómo sé qué modelo debo descargar primero?

Comience con un modelo instruct de 7–8B en Q4_K_M: cabe prácticamente en cualquier GPU moderna y le indicará rápidamente si su ruta de hardware (CUDA, Metal, Vulkan) funciona correctamente. A partir de ahí, escale progresivamente hasta alcanzar el límite de memoria disponible. Las Clasificación de modelos de lenguaje grande (LLM) y Base de datos de modelos son útiles para comparar la capacidad frente al tamaño antes de dedicar una hora a una descarga.

Escrito por Mustafa Ihsan

Mustafa Ihsan es el fundador y editor de Convly.ai. Creó y mantiene la base de datos en vivo de modelos de IA del sitio, su índice de relación precio-rendimiento y sus calculadoras gratuitas para los requisitos de VRAM, los costos de las API y la economía del autohospedaje. Escribe sobre precios de modelos, resultados de pruebas comparativas y el hardware necesario para ejecutar modelos de IA localmente, y prefiere sistemáticamente los datos medidos a las afirmaciones de los fabricantes.

Scroll to Top
Featured on There's An AI For That