- No existe un servidor, región ni edición de “LM Studio Chicago”. LM Studio es una aplicación de escritorio para Windows, macOS y Linux; la inferencia se ejecuta en tu propia CPU o GPU, por lo que su ubicación es simplemente donde esté tu equipo.
- Para ejecutarla en Chicago, basta con hacerlo: instala la aplicación, descarga un modelo GGUF o MLX y luego inicia el servidor compatible con OpenAI en
http://localhost:1234/v1. - Si “Chicago” hace referencia a la residencia de los datos (BIPA, HIPAA, contratos con clientes), la inferencia local es la respuesta más sólida posible: los prompts nunca llegan a un proveedor externo.
- Si buscabas un estudio de diseño o fotografía de Chicago llamado “LM Studio,” se trata de un negocio local independiente, no de este software.
LM Studio es una aplicación de escritorio gratuita para ejecutar modelos de lenguaje grandes localmente en tu propio equipo: no tiene oficina en Chicago, ni región de servidores en esa ciudad, ni versión específica para ninguna localidad. Las búsquedas de “lm studio chicago” casi siempre hacen referencia a una de estas tres cosas: ejecutar LM Studio en una estación de trabajo ubicada en Chicago, mantener los datos dentro de Illinois por motivos de cumplimiento normativo, o bien una empresa local con nombre similar.
- ¿Qué “LM Studio Chicago” estás buscando?
- Por qué no existe una región de Chicago
- Instalación de LM Studio en Windows
- Instalación de LM Studio en macOS
- Instalación de LM Studio en Linux
- Poner modelos a disposición del resto de tu oficina
- Evaluación del hardware antes de comprarlo
- El ángulo de residencia de datos en Illinois
- Si realmente deseas un punto final alojado en Chicago
- Preguntas frecuentes
¿Qué “LM Studio Chicago” estás buscando?
| Lo que probablemente querías decir | Requisitos reales |
|---|---|
| Ejecutar LLMs localmente en una máquina ubicada en Chicago | Instala LM Studio normalmente: nada en su configuración depende de la ciudad |
| Una región de servidor o punto final de baja latencia en Chicago | No aplica. LM Studio no ofrece ningún servicio alojado. Usa una API en la nube con región US-Central, o coloca físicamente tu propio servidor |
| Residencia de datos en Illinois o cumplimiento normativo | Inferencia local: los datos permanecen en el dispositivo bajo tu control |
| Compra una GPU o estación de trabajo en la zona de Chicago | Venta minorista local (la tienda Westmont de Micro Center suele ser la opción habitual) o compra en línea; consulta la guía de GPUs más abajo |
| Un estudio de diseño, fotografía o arquitectura de Chicago llamado LM Studio | Un negocio totalmente distinto: esta página trata sobre la aplicación de LLM |
Por qué no existe una región de Chicago
LM Studio es una interfaz gráfica (GUI) que envuelve motores locales de inferencia: llama.cpp para modelos GGUF en todas las plataformas y el framework MLX de Apple en equipos con chip Apple Silicon. El único tráfico saliente hacia Internet corresponde a la búsqueda y descarga de modelos (los pesos se obtienen desde Hugging Face mediante HTTPS), comprobaciones de actualizaciones de la aplicación y descargas opcionales de tiempo de ejecución. Una vez que el archivo del modelo está almacenado en disco, puedes desconectar la red y seguir funcionando normalmente.
Esta arquitectura explica por qué hablar de “región” constituye aquí una categoría errónea: no existe plano de control, ni inquilino ni cuenta que crear. La latencia que te interesa es el ancho de banda de memoria de tu propia GPU, no un viaje de ida y vuelta hasta un centro de datos. Para conocer más detalles sobre la aplicación, consulta la Guía completa de LM Studio.
Instalación de LM Studio en Windows
Descargue el .exe documentación oficial de lmstudio.ai. Las versiones recientes incluyen instaladores tanto para x64 como para ARM64 (Snapdragon X); la versión x64 requiere una CPU compatible con AVX2.
- El instalador, por defecto, se instala por usuario y se ubica en
%LOCALAPPDATA%\Programs— en la mayoría de los casos no se requieren privilegios de administrador. - Los modelos se almacenan de forma predeterminada en
%USERPROFILE%\.lmstudiomodels. Puedes cambiar este directorio desde la pestaña Mis modelos si deseas guardarlos en un segundo disco; unas pocas cuantizaciones de 30B ocuparán rápidamente 100 GB. - Las GPU de NVIDIA utilizan el entorno de tiempo de ejecución CUDA, que LM Studio descarga como un paquete independiente. Las GPU de AMD e Intel recurren a Vulkan como alternativa, y ROCm está disponible en algunas tarjetas AMD. Los entornos de tiempo de ejecución disponibles varían entre versiones, así que revisa el panel de hardware/tiempos de ejecución en tu versión concreta, en lugar de asumir qué está disponible.
- Habilita la CLI una vez mediante
cmd /c %USERPROFILE%\.lmstudiobin\lms.exe bootstrap, y luego usalmsdesde cualquier terminal.
Instalación de LM Studio en macOS
Las versiones actuales requieren Apple Silicon (M1 o posterior) y una versión razonablemente reciente de macOS — generalmente se indica como mínimo macOS 13.4. Los Mac con procesador Intel solo fueron compatibles con versiones anteriores, por lo que si usas un iMac de 2019 deberás recurrir a una versión archivada, no a la más reciente.
- Abre el archivo
.dmgy arrastra LM Studio a/Applications. - Prefiere MLX los modelos en formato MLX frente a GGUF cuando ambos están disponibles. MLX es el propio framework de arrays de Apple y suele ofrecer mejor rendimiento en sistemas con memoria unificada, aunque la disponibilidad de modelos es más limitada.
- macOS limita la cantidad de memoria unificada que la GPU puede asignar: aproximadamente dos tercios a tres cuartas partes de la RAM instalada. Existe un
sysctlpara elevar ese límite, pero la clave exacta ha cambiado entre versiones de macOS, así que búscala para tu versión específica en lugar de copiar un comando antiguo de un foro. - CLI:
~/\.lmstudio\/bin\/lms bootstrap.
Instalación de LM Studio en Linux
Linux se distribuye como una AppImage para x86-64. En el momento de redactar este artículo no existe una compilación oficial para ARM Linux, por lo que no es viable usar una Raspberry Pi ni un servidor Ampere.
chmod +x LM-Studio-*.AppImage
./LM-Studio-*.AppImage
En Ubuntu 22.04 y versiones posteriores quizás necesites libfuse2 para que las AppImage puedan montarse; como alternativa, puedes usar ./LM-Studio-*.AppImage --appimage-extract-and-run. Para NVIDIA, instala primero el controlador propietario y confirma su funcionamiento con nvidia-smi antes de iniciar la aplicación. Los modelos se almacenan en ~/.lmstudio/models en versiones recientes; las versiones anteriores usaban una ruta bajo ~/.cache, así que verifica directamente en la aplicación en lugar de adivinar.
Poner modelos a disposición del resto de tu oficina
Esta es la parte sobre la que realmente giran la mayoría de las preguntas del tipo «LLM local en Chicago»: una estación de trabajo potente a la que acceden varios desarrolladores. Activa el servidor desde la pestaña Desarrollador o desde la CLI.
lms server start --port 1234
lms ls # modelos instalados
lms ps # modelos actualmente cargados
lms load qwen2.5-coder-7b-instruct
lms unload --all
lms log stream # observa las solicitudes en tiempo real
El servidor implementa el formato de comunicación de OpenAI, por lo que la mayoría de los SDK funcionan simplemente modificando la URL base y usando una clave ficticia.
| Endpoint | Finalidad |
|---|---|
GET /v1/models |
Enumera los modelos cargados y disponibles |
POST /v1/chat/completions |
Chat con soporte para transmisión (streaming) |
POST /v1/completions |
Completado de texto sin formato |
POST /v1/embeddings |
Incrustaciones (embeddings), cuando se ha cargado un modelo de incrustación |
/api/v0/* |
API REST nativa de LM Studio, incorporada en versiones posteriores de la serie 0.3.x; expone información adicional sobre el estado de carga |
curl http://localhost:1234/v1/chat/completions
-H "Content-Type: application/json"
-d '{"model": "qwen2.5-coder-7b-instruct", "messages": [{"role": "user", "content": "Resume este repositorio."}]}'
from openai import OpenAI
client = OpenAI(base_url="http://localhost:1234/v1", api_key="lm-studio")
resp = client.chat.completions.create(
model="qwen2.5-coder-7b-instruct",
messages=[{"role": "user", "content": "Hola"}],
)
Nota de seguridad: El servidor de LM Studio no incluye autenticación. Habilitar su acceso desde la red local es tan sencillo como activar una opción, pero no debes redirigir puertos ni vincularlo a una interfaz pública. Si un equipo necesita acceder a él, colócalo tras un proxy inverso que imponga autenticación, o accede mediante Tailscale o una VPN.
Evaluación del hardware antes de comprarlo
Aproximadamente la memoria que requiere una cuantización de 4 bits, antes de considerar el contexto. Trata estos valores como estimaciones orientativas, no como garantías: el método de cuantización, el tamaño de la caché KV y la longitud del contexto afectan al total final.
| Tamaño del modelo | Memoria aproximada con ~Q4 | Objetivo práctico |
|---|---|---|
| 7–8B | 5–6 GB | GPU de 8 GB o cualquier Mac con 16 GB |
| 13–14 mil millones | 9–10 GB | GPU de 12 GB |
| 24B | 14–16 GB | GPU de 16–24 GB |
| 30–32B | 19–22 GB | GPU de 24 GB (clase RTX 3090 / 4090) |
| 70B | 40–45 GB | 2× GPU de 24 GB o memoria unificada de 64 GB o más |
Prueba tu configuración exacta con la Calculadora de VRAM antes de realizar ningún pedido, y compárala con la tabla de requisitos de VRAM por modelo. Si aún no has elegido una tarjeta gráfica, la mejoras GPUs para modelos de lenguaje local comparación detalla en qué puntos cambia la relación precio por GB útil. Chicago ofrece una ventaja digna de aprovechar: la tienda Micro Center de Westmont permite comprar una GPU en persona y devolverla también en persona si no cabe en tu chasis o no se ajusta a tu presupuesto de fuente de alimentación — verifica el stock disponible antes de desplazarte.
El ángulo de residencia de datos en Illinois
Illinois es una jurisdicción inusualmente exigente en materia de privacidad. La Ley de Protección de la Información Biométrica (BIPA, 740 ILCS 14) otorga derecho de acción individual y ha generado acuerdos indemnizatorios sustanciales; la Ley sobre Entrevistas en Video con Inteligencia Artificial impone obligaciones de notificación y consentimiento para el análisis con IA de entrevistas a candidatos; y las enmiendas a la Ley de Derechos Humanos de Illinois extienden la responsabilidad por discriminación a la IA utilizada en decisiones laborales. La inferencia local elimina por completo al procesador externo, razón por la cual muchas organizaciones reguladas de Chicago —sistemas hospitalarios, aseguradoras, bufetes de abogados y firmas de trading— suelen optar por LM Studio u Ollama para herramientas internas. Sin embargo, esto no exime de cumplir con las obligaciones de notificación, consentimiento o no discriminación. Confirma los detalles específicos con asesoría jurídica, no con un simple cambio de configuración.
Si realmente deseas un punto final alojado en Chicago
Hay dos opciones, ninguna de las cuales es LM Studio. Alquila un modelo alojado desde una API comercial y selecciona una región en el centro de EE. UU. — los costos están detallados en la Calculadora de costos de API. O bien instala tu propio servidor con GPU; Chicago es un mercado de interconexión de primer nivel, y el edificio 350 E. Cermak figura entre los centros de telecomunicaciones más reconocidos del país. Antes de comprometer capital, evalúa los costos con la calculadora de punto de equilibrio entre alojamiento local y uso de API — para uso interno de bajo volumen, los tokens de la API suelen ser más económicos que poseer hardware, y el punto de equilibrio llega más tarde de lo que la mayoría de los equipos esperan.
Preguntas frecuentes
¿Existe un servidor o centro de datos de LM Studio en Chicago?
No. LM Studio no ofrece ningún servicio de inferencia alojada en ninguna parte, por lo que no hay nada que ubicar en Chicago ni en ninguna otra región. Toda la generación ocurre en la máquina donde se ejecuta la aplicación. Los únicos servidores involucrados son los de Hugging Face para descargas de modelos y los puntos finales de actualización propios de LM Studio.
¿Funciona LM Studio completamente sin conexión?
Sí, una vez que los modelos se han descargado. Necesitas conexión a Internet para buscar y descargar los pesos del modelo y los paquetes de tiempo de ejecución, pero después de eso la aplicación se carga y ejecuta los modelos sin necesidad de acceso a la red. Esta es precisamente la razón habitual por la que supera las revisiones en entornos corporativos aislados (air-gapped) o altamente restringidos.
¿Es gratuito el uso comercial de LM Studio en una empresa de Chicago?
LM Studio eliminó su anterior restricción de uso exclusivo para particulares y ahora permite su uso en entornos laborales sin costo alguno; no obstante, los términos de licencia son del tipo que pueden cambiar entre versiones. Lee los términos vigentes en lmstudio.ai antes de desplegarla en todo un equipo. Ten en cuenta además que los pesos de los modelos tienen sus propias licencias: algunos modelos de código abierto restringen expresamente su uso comercial, independientemente de lo que permita el entorno de ejecución.
¿LM Studio u Ollama para un pequeño equipo?
LM Studio destaca en descubrimiento e iteración: cuenta con una verdadera interfaz gráfica, un explorador de modelos, ajuste de parámetros por modelo y una interfaz de chat accesible incluso para usuarios no técnicos. Ollama, por su parte, sobresale en despliegues sin interfaz gráfica y automatización mediante scripts, ofreciendo una integración más limpia con Docker y CI. Muchos equipos usan ambos: LM Studio en las laptops de los desarrolladores y Ollama en el servidor compartido. Consulta la Guía de Ollama para ese lado de la comparación.
¿Puede toda la oficina conectarse a una sola máquina con LM Studio?
Técnicamente sí: active el servicio en red y configure los clientes para que apunten a http://<host>:1234/v1. En la práctica, recuerde que no hay autenticación integrada ni una cola de solicitudes diseñada para muchos usuarios simultáneos. Para cualquier entorno que vaya más allá de unos pocos desarrolladores, coloque un proxy con autenticación delante o migre a una pila de servicio especializada, como vLLM.
¿Cómo sé qué modelo debo descargar primero?
Comience con un modelo instruct de 7–8B en Q4_K_M: cabe prácticamente en cualquier GPU moderna y le indicará rápidamente si su ruta de hardware (CUDA, Metal, Vulkan) funciona correctamente. A partir de ahí, escale progresivamente hasta alcanzar el límite de memoria disponible. Las Clasificación de modelos de lenguaje grande (LLM) y Base de datos de modelos son útiles para comparar la capacidad frente al tamaño antes de dedicar una hora a una descarga.

