- O LM Studio é um aplicativo gratuito para desktop para descobrir, baixar e executar modelos de linguagem de grande porte localmente no Windows, macOS e Linux.
- Ele inclui uma interface gráfica de chat, um navegador de modelos (busca integrada ao Hugging Face) e um servidor HTTP local compatível com a API da OpenAI de modo que os SDKs existentes apontem para
http://localhost:1234/v1sem alterações no código. - Ele executa modelos quantizados modelos GGUF por meio de llama.cpp em todas as plataformas e MLX modelos no Apple Silicon; uma ferramenta de linha de comando chamada
lmsé fornecida junto com a interface gráfica. - A viabilidade prática depende da VRAM: um modelo de 8B em 4 bits requer cerca de 5 GB, enquanto um modelo de 70B exige aproximadamente 40 GB. Use o Calculadora de VRAM antes de baixar.
O LM Studio é um aplicativo gratuito para desktop, com código fechado, que permite baixar e executar modelos de linguagem de grande porte de código aberto integralmente na sua própria máquina. Ele está disponível para Windows, macOS e Linux, inclui mecanismos de inferência (llama.cpp em todas as plataformas e MLX no Apple Silicon), oferece uma interface gráfica semelhante à do ChatGPT e expõe um servidor REST compatível com a API da OpenAI em localhost:1234 de modo que aplicações desenvolvidas com base no SDK da OpenAI possam se comunicar com um modelo local sem nenhuma modificação.
O aplicativo é desenvolvido pela equipe por trás da lmstudio.ai. É gratuito para uso pessoal e, conforme indicado na página sobre uso profissionaldo fornecedor, também é gratuito para uso no trabalho; a redistribuição comercial está sujeita a termos próprios.
O que LM Studio realmente faz
O LM Studio combina quatro funcionalidades que, de outra forma, seriam ferramentas separadas:
- Descoberta de modelos. Uma interface de busca integrada consulta o Hugging Face para arquivos GGUF e MLX. Você escolhe uma quantização (Q4_K_M, Q5_K_M, Q6_K, Q8_0, etc.) e o download é feito diretamente para uma pasta local de modelos.
- Interface gráfica de chat. Uma janela de chat com múltiplos turnos, com prompts de sistema específicos por conversa, controles deslizantes para temperatura/top-p, saídas estruturadas (esquema JSON) e suporte para anexar PDFs ou imagens (este último apenas com modelos compatíveis com visão).
- Servidor local de inferência. Um endpoint HTTP em
http://localhost:1234/v1que implementa as APIs OpenAI de Chat Completions, Completions e Embeddings. Consulte a documentação de compatibilidade com a API da OpenAI. - CLI (
lms). Uma ferramenta de linha de comando para automatizar o carregamento, descarregamento de modelos e o controle do servidor. A instalação e os comandos estão documentados em lmstudio.ai/docs/cli.
Por trás dos panos, a inferência é executada com llama.cpp para modelos GGUF e com Apple MLX para modelos no formato MLX no Apple Silicon. O LM Studio fornece binários pré-compilados dos mecanismos de inferência e permite alternar ou atualizá-los nas configurações de tempo de execução do aplicativo.
Plataformas compatíveis
| Plataforma | Requisitos (conforme especificado pelo fornecedor) | Aceleração |
|---|---|---|
| Windows | x64 ou ARM64; CPU com suporte a AVX2 em x64 | CPU, NVIDIA CUDA, Vulkan (GPUs AMD/Intel) |
| macOS | Apple Silicon (M1 ou posterior), macOS 13.4+ | Metal (llama.cpp) e MLX |
| Linux | x64, glibc 2.35+, distribuído como AppImage | CPU, NVIDIA CUDA, Vulkan |
Os requisitos publicados atualmente estão disponíveis na página oficial de download; verifique-a antes da instalação, pois os mínimos exatos variam entre versões.
Windows
O instalador é um padrão .exe. Os modelos usam por padrão %USERPROFILE%\.lmstudiomodels. GPUs NVIDIA utilizam CUDA quando um runtime compatível é selecionado; outras GPUs recorrem ao Vulkan. O suporte a AVX2 é obrigatório em CPUs x64, excluindo assim processadores muito antigos.
macOS
Distribuído como um .dmg. Em chips Apple Silicon, modelos no formato MLX estão disponíveis além dos formatos GGUF e geralmente aproveitam com eficiência a memória unificada. Os modelos usam por padrão ~/.lmstudio/models. Macs com processadores Intel não são suportados pelas versões atuais.
Linux
Distribuído como um .AppImage. Torne-o executável (chmod +x LM-Studio-*.AppImage) e execute-o diretamente. GPUs NVIDIA usam CUDA; GPUs AMD e Intel usam Vulkan. Não há um pacote oficial de .deb ou .rpm no momento desta redação — verifique a página de download para obter as opções atuais de empacotamento.
O que você pode executar no LM Studio
LM Studio pode carregar qualquer modelo GGUF suportado pelo llama.cpp, além de modelos MLX em Apple Silicon. A restrição real é o que efetivamente cabe no seu hardware. Estimativas aproximadas do consumo de VRAM em 4 bits constam da base de dados de modelos Convly:
| Modelo | Contexto | ~VRAM em 4 bits |
|---|---|---|
| Gemma 3 4B | 128K | ~3 GB |
| Mistral 7B | 32K | ~4,5 GB |
| Llama 3.1 8B | 128K | ~5 GB |
| Qwen3 8B | 128K | ~5 GB |
| Phi-4 | 16K | ~9 GB |
| Gemma 3 12B | 128K | ~8 GB |
| Qwen3 14B | 128K | ~9 GB |
| Gemma 3 27B | 128K | ~16 GB |
| Qwen3 32B | 128K | ~20 GB |
| Llama 3.3 70B | 128K | ~40 GB |
Qualquer modelo acima de cerca de 40 GB requer múltiplas GPUs ou placas com grande quantidade de VRAM. Modelos muito grandes, como o DeepSeek R1 (~400 GB em 4 bits), não são viáveis para execução em uma única GPU de desktop. Consulte o guia completo tabela de requisitos de VRAM e o de GPUs para LLMs locais antes de comprar hardware.
O servidor compatível com a API da OpenAI
O recurso mais útil para desenvolvedores é o servidor local. Inicie-o pela aba Desenvolvedor na interface gráfica ou via linha de comando. Uma vez em execução, ele aceita requisições no padrão OpenAI:
curl http://localhost:1234/v1/chat/completions
-H "Content-Type: application/json"
-d '{
"model": "identificador-do-modelo-carregado",
"messages": [{"role": "user", "content": "Olá"}]
}'
O SDK em Python funciona apontando o base_url para o servidor local:
from openai import OpenAI
client = OpenAI(base_url="http://localhost:1234/v1", api_key="lm-studio")
O api_key O valor desse campo é ignorado por padrão, mas o campo deve estar presente porque o SDK da OpenAI o exige. Os endpoints suportados e quaisquer divergências em relação ao esquema da OpenAI estão listados na referência da API.
LM Studio vs. Ollama
Essas duas abordagens são as mais comuns para executar LLMs locais em estações de trabalho. Um resumo simplificado das diferenças:
| LM Studio | Ollama | |
|---|---|---|
| Interface principal | Interface gráfica desktop (chat, navegador de modelos) | Linha de comando e API HTTP |
| Licença | Aplicativo de código fechado; gratuito para uso pessoal e profissional | Código aberto (licença MIT) |
| Fonte dos modelos | Hugging Face (GGUF, MLX) via busca integrada no aplicativo | Registro de modelos Ollama (com importação de modelos GGUF) |
| Servidor | Compatível com OpenAI em :1234 |
API nativa em :11434, camada compatível com OpenAI |
| MLX para Apple Silicon | Sim | Não (apenas llama.cpp) |
Se você deseja uma interface gráfica intuitiva e suporte a MLX em Mac, o LM Studio é o ponto de partida mais fácil. Se você prefere uma pilha de código aberto com capacidade de automação por scripts e um servidor sem interface gráfica, consulte o Guia do Ollama e guia passo a passo de instalação.
Quando usar o LM Studio em vez de uma API hospedada
A inferência local representa um verdadeiro compromisso. As vantagens incluem privacidade (nada sai da máquina), custo previsível após a amortização do hardware e disponibilidade offline. As desvantagens incluem o custo inicial de capital, menor taxa de tokens por segundo comparada a um cluster de GPUs hospedado e ausência de acesso a modelos proprietários de ponta.
Para ter uma ideia aproximada do limite de custo: modelos hospedados no leaderboard de LLMs da Convly variam de cerca de US$ 0,02 por milhão de tokens de entrada para pequenos modelos abertos em provedores serverless até US$ 10 por milhão de tokens de entrada e US$ 50 por milhão de tokens de saída para modelos proprietários de ponta. Se sua carga de trabalho se encaixa na faixa de modelos menores e você pode tolerar qualidade equivalente a modelos de 8B–30B, hospedar localmente em uma única GPU de consumo frequentemente representa economia total. Faça seus próprios cálculos com a calculadora de autohospedagem versus API e o Calculadora de custos de API.
Lista de verificação prática para configuração
- Verifique a VRAM. Qualquer modelo maior que a memória da sua GPU será parcialmente transferido para a memória do sistema, resultando em desempenho drasticamente reduzido. Use o Calculadora de VRAM.
- Baixe o LM Studio em lmstudio.ai/download. Não instale a partir de espelhos de terceiros.
- Na aba Descobrir do aplicativo, escolha um modelo compatível com seu hardware. Comece com uma quantização Q4_K_M, que oferece o melhor equilíbrio entre tamanho e qualidade.
- Carregue o modelo. Observe o indicador de VRAM; se ele não conseguir descarregar totalmente para a GPU, escolha uma quantização menor ou um modelo menor.
- Ative o servidor pela aba Desenvolvedor se você pretende acessá-lo por meio de código. Confirme com
curl http://localhost:1234/v1/models.
Para um guia passo a passo com capturas de tela, consulte o Guia completo do LM Studio. Para listas de modelos recomendados ajustados ao hardware local, consulte melhores modelos locais (as recomendações valem igualmente para o LM Studio, já que ambos os mecanismos utilizam o llama.cpp).
Perguntas frequentes
O LM Studio é gratuito?
Sim. O LM Studio é gratuito para baixar e usar para fins pessoais e, de acordo com a política do fornecedor para uso profissional, também para uso profissional. O aplicativo em si é de código fechado, mas os modelos executados nele são modelos de pesos abertos licenciados por seus respectivos editores (Meta, Google, Alibaba, Mistral etc.).
O LM Studio envia dados para a nuvem?
A inferência é executada inteiramente no seu computador — os prompts e as respostas não saem do dispositivo. O aplicativo se conecta à Hugging Face ao pesquisar ou baixar modelos e verifica atualizações. Não há coleta de telemetria dos conteúdos das conversas, segundo a página de privacidadedo fornecedor; consulte-a diretamente para conhecer a política vigente.
Quais formatos de modelo o LM Studio suporta?
GGUF em todas as plataformas (por meio do llama.cpp) e MLX em chips Apple Silicon. Checkpoints brutos da Hugging Face safetensors e do PyTorch não são suportados diretamente — converta-os primeiro para GGUF ou baixe um GGUF pré-quantizado já publicado pela comunidade.
Posso usar o LM Studio como substituto direto da API da OpenAI?
Para conclusões de chat, conclusões e incorporações (embeddings), em grande parte sim: basta apontar o SDK da OpenAI para base_url para http://localhost:1234/v1 e o código existente funcionará. Recursos que dependem de comportamentos específicos do servidor da OpenAI (assistants, API de arquivos, geração de imagens, moderação) não estão implementados. Consulte a lista atual de endpoints.
Quanta RAM ou VRAM preciso?
Regra prática para quantização de 4 bits: o tamanho do modelo em bilhões de parâmetros multiplicado por ~0,6 resulta na quantidade aproximada de VRAM (em GB) necessária para os pesos, além de alguns GB adicionais para o cache KV em contextos longos. Um modelo de 7–8B roda confortavelmente em uma GPU de 8 GB; um modelo de 70B requer cerca de 40 GB (veja as banco de dados de modelos figuras acima do Convly). Para uma análise detalhada por modelo, consulte requisitos de VRAM.
O LM Studio suporta chamadas de ferramentas e saídas estruturadas?
Sim, para saídas estruturadas via esquema JSON; já as chamadas de ferramentas/funções são suportadas por modelos cujos modelos de conversação (chat templates) as anunciam (em especial versões recentes de Llama, Qwen, Mistral e Gemma). A qualidade das chamadas de ferramentas depende do modelo subjacente, não do próprio LM Studio. Teste com seu modelo-alvo antes de adotá-lo em produção.
