- LM Studio é um aplicativo gratuito para desktop que permite executar modelos de linguagem grandes localmente no seu computador, sem necessidade de programação ou uso da linha de comando
- Baixe modelos diretamente do Hugging Face por meio do navegador integrado; suporta o formato GGUF com seleção automática de quantização
- Inclui interface de chat, servidor de API local (compatível com OpenAI) e aceleração de hardware automática (CUDA, Metal, CPU)
- Exige VRAM/RAM suficiente conforme o tamanho do modelo — tipicamente, no mínimo 8 GB para modelos de 7B parâmetros e 24 GB ou mais para modelos de 13B parâmetros
LM Studio é um aplicativo para desktop que permite baixar, executar e interagir com modelos de linguagem grandes diretamente no seu computador. Ele fornece uma interface gráfica para tarefas que, de outra forma, exigiriam ferramentas de linha de comando, tornando a IA local acessível a desenvolvedores e usuários técnicos que desejam controle total sobre seus modelos, sem enviar dados a APIs externas. O aplicativo lida automaticamente com a descoberta, o download, a seleção de quantização e a aceleração de hardware.
Diferentemente dos serviços de IA baseados em nuvem, LM Studio funciona inteiramente offline assim que você baixar um modelo. Suas conversas, documentos e prompts nunca saem do seu equipamento. Isso o torna adequado para trabalhos sensíveis, experimentação sem custos de API e ambientes com conectividade à internet limitada ou inexistente.
Instalação
Windows
Baixe o instalador em lmstudio.ai. O bloco .exe O instalador tem tipicamente entre 200 MB e 400 MB. Execute-o e siga o assistente de instalação. Por padrão, o LM Studio será instalado em C:\Users\[SeuNomeDeUsuário]\AppData\Local\LM-Studio Os modelos são baixados para C:\Users\[SeuNomeDeUsuário]\.cache\lm-studio\models a menos que você altere esse caminho nas configurações.
Para aceleração por GPU no Windows, você precisa ter drivers NVIDIA versão 522.06 ou posterior para suporte a CUDA. O LM Studio detectará e usará automaticamente sua GPU, se disponível.
macOS
Baixe o .dmg arquivo de lmstudio.ai. Abra-o e arraste o LM Studio para a pasta Aplicativos. Os modelos são baixados para ~/Library/Application Support/LMStudio/models por padrão.
Mac com Apple Silicon (M1, M2, M3, M4) recebem aceleração Metal automática. Macs com processadores Intel usarão inferência na CPU, que é significativamente mais lenta, mas funcional para modelos menores.
Linux
Baixe o .AppImage arquivo. Torne-o executável com chmod +x LM-Studio-*.AppImage, depois execute-o com ./LM-Studio-*.AppImageOs modelos são baixados para ~/.cache/lm-studio/models.
Para aceleração por GPU NVIDIA, instale o toolkit CUDA 11.8 ou posterior e certifique-se de que o comando nvidia-smi exiba sua GPU. O LM Studio detectará automaticamente o CUDA.
Baixando e carregando modelos
O LM Studio usa o formato GGUF, um formato de modelo quantizado que reduz os requisitos de memória mantendo a qualidade. Ao abrir o LM Studio, clique no ícone de pesquisa na barra lateral esquerda para navegar entre os modelos. A pesquisa integrada busca no Hugging Face e filtra arquivos GGUF compatíveis.
Pesquise um modelo pelo nome (por exemplo, "llama 3.1", "mistral", "phi"). Cada resultado exibe diversos níveis de quantização, rotulados como Q4_K_M, Q5_K_S, ou Q8_0. O número indica a profundidade de bits — Q4 usa 4 bits por peso, Q8 usa 8 bits. Números menores indicam tamanho de arquivo menor e inferência mais rápida, mas com ligeira redução na qualidade.
Na maioria dos casos, Q4_K_M ou Q5_K_M oferece o melhor equilíbrio. Use nossa Calculadora de VRAM para estimar quanta memória um modelo específico e uma quantização exigirão. Como orientação geral:
| Tamanho do modelo | VRAM Q4_K_M | VRAM Q5_K_M | VRAM Q8_0 |
|---|---|---|---|
| 7B parâmetros | ~5 GB | ~6 GB | ~9 GB |
| 13B parâmetros | ~9 GB | ~11 GB | ~16 GB |
| 34B parâmetros | ~22 GB | ~27 GB | ~40 GB |
| 70B parâmetros | ~42 GB | ~51 GB | ~75 GB |
Clique no ícone de download ao lado da quantização escolhida. Os modelos variam de 3 GB a mais de 50 GB, dependendo do tamanho. Após o download, clique no nome do modelo na sua biblioteca para carregá-lo. O LM Studio exibirá a alocação de GPU e RAM no canto inferior direito. Se o modelo não couber inteiramente na VRAM, camadas serão transferidas para a memória RAM do sistema, o que reduz significativamente a velocidade da inferência.
Usando a interface de chat
Após carregar um modelo, a interface de chat aparece na janela principal. Digite seu prompt na caixa de texto na parte inferior e pressione Enter ou clique no ícone de envio. O modelo gera a resposta localmente — nenhuma conexão com a internet é necessária após o carregamento.
Controles principais:
- Controle deslizante de temperatura (barra lateral direita): controla a aleatoriedade. Use 0,1–0,3 para tarefas factuais e 0,7–1,0 para escrita criativa
- Tokens máximos: limita o comprimento da resposta. O padrão geralmente é 2048; aumente esse valor para saídas mais longas
- Prompt do sistema: define o comportamento e a persona do modelo. Clique em "Editar" na barra superior para modificá-lo
- Sequências de parada: tokens que interrompem a geração antecipadamente, úteis para formatos estruturados de saída
O LM Studio suporta conversas com múltiplas rodadas. Cada mensagem permanece no contexto até que você clique em "Nova conversa" ou até que a janela de contexto fique cheia. A maioria dos modelos possui uma janela de contexto de 4k–32k tokens — verifique o cartão do modelo para obter detalhes específicos.
Executando um servidor de API local
O LM Studio inclui um servidor de API compatível com OpenAI, permitindo usar modelos locais como substitutos diretos do GPT-4 ou GPT-3.5 em aplicações existentes. Clique no ícone </> na barra lateral esquerda para abrir a guia Servidor Local.
Selecione um modelo carregado no menu suspenso e clique em "Iniciar Servidor". O servidor é executado, por padrão, em http://localhost:1234 . A interface exibe um exemplo de código:
curl http://localhost:1234/v1/chat/completions
-H "Content-Type: application/json"
-d '{
"model": "local-model",
"messages": [{"role": "user", "content": "Olá"}]
}'Qualquer ferramenta que suporte o formato de API da OpenAI funciona com o servidor do LM Studio. Defina a URL base como http://localhost:1234/v1 e use qualquer string não vazia como chave de API (o LM Studio não a valida). Isso inclui:
- LangChain (Python/JS): defina
openai_api_basecomo localhost - SDK Python da OpenAI:
openai.api_base = "http://localhost:1234/v1" - Editores de texto com recursos de IA (Cursor, Continue, Cody): configure-os para apontar para localhost nas configurações
- Scripts personalizados: substitua
https://api.openai.com/v1comhttp://localhost:1234/v1
O servidor suporta respostas em streaming e chamadas de função (se o modelo foi treinado para isso). Verifique os logs na guia Servidor para depurar solicitações.
Configuração e configurações de hardware
Clique no ícone de engrenagem (Configurações) no canto inferior esquerdo para ajustar:
- Caminho da pasta de modelos: altere onde os modelos são baixados e carregados
- Camadas de descarga para GPU: controla quantas camadas são executadas na GPU versus na CPU. A detecção automática funciona bem, mas o ajuste manual ajuda se você estiver executando vários programas simultaneamente
- Substituição do comprimento do contexto: aumente esse valor se o modelo o suportar e você precisar de conversas mais longas. Um contexto maior consome mais VRAM
- Threads de inferência: número de threads da CPU usadas na inferência. O padrão é automático, mas definir esse valor igual ao número de núcleos físicos (não hiperthreading) pode melhorar a velocidade
Para obter o melhor desempenho, feche outras aplicações intensivas de GPU (jogos, edição de vídeo, renderização 3D) antes de carregar modelos grandes. Em laptops, conecte o carregador e defina o modo de energia como alto desempenho — a redução dinâmica de frequência (throttling) da CPU/GPU impacta significativamente a velocidade de inferência.
LM Studio vs. Ollama
O LM Studio e o Ollama executam ambos modelos locais, mas diferem na interface e no fluxo de trabalho:
| Recurso | LM Studio | Ollama |
|---|---|---|
| Interface | Interface gráfica desktop | Linha de comando + API |
| Descoberta de modelos | Navegador integrado | Registro de modelos separado |
| Formato | Arquivos GGUF | Formato personalizado (converte de GGUF) |
| Controle de quantização | Escolha uma quantização específica | Automático |
| Interface de chat | Integrada | Nenhuma (use ferramentas externas) |
| Curva de aprendizado | Mais baixo (visual) | Mais acentuado (linha de comando) |
Use o LM Studio se você deseja uma interface visual, controle direto sobre os arquivos de modelo e não quer usar o terminal. Use o Ollama se você prefere fluxos de trabalho via linha de comando, deseja um servidor leve ou está integrando-o em um pipeline automatizado. Ambos são gratuitos e gerenciam aceleração por GPU de forma semelhante. Consulte nosso guia de modelos locais para recomendações compatíveis com qualquer uma dessas ferramentas.
Escolhendo modelos para o LM Studio
O modelo que você escolher depende do seu hardware e do caso de uso. Confira nosso Banco de dados de modelos de IA para especificações e requisitos de VRAM em mais de 37 modelos.
Para 8–16 GB de VRAM: Llama 3.1 8B, Mistral 7BQwen2.5, Phi-3 Medium (14B). Esses modelos lidam bem com conversas gerais, assistência em programação e sumarização.
Para 24 GB de VRAM: Llama 3.1 70B (quantização Q3), Mixtral 8x7B, Command R+ 35B (quantização Q4). Salto significativo na qualidade para raciocínio e instruções complexas.
Para 48 GB ou mais de VRAM: Llama 3.1 405B (quantização Q3), Qwen 2.5 72B (quantização Q5). Desempenho próximo ao estado da arte na maioria das tarefas.
Se você não tem certeza se um modelo cabe no seu hardware, use o Calculadora de VRAM antes de baixá-lo. Um modelo que mal cabe será parcialmente descarregado para a RAM e executado de 5 a 10 vezes mais devagar do que um modelo totalmente carregado na VRAM.
Perguntas frequentes
O LM Studio funciona offline?
Sim, completamente. Você precisa de conexão com a internet apenas para baixar os modelos inicialmente; uma vez baixados, o LM Studio opera sem qualquer conexão de rede. Os modelos, a inferência e o servidor de API local funcionam todos offline. Isso o torna adequado para ambientes isolados (air-gapped) ou para uso sem conectividade.
Posso usar os modelos do LM Studio em minhas próprias aplicações?
Sim. Inicie o servidor de API local no LM Studio e aponte sua aplicação para http://localhost:1234/v1. Qualquer código que utilize o formato da API OpenAI funcionará sem modificações. Você também pode carregar arquivos GGUF diretamente no seu código usando bibliotecas como llama.cpp, llama-cpp-python, ou ctransformers— os downloads de modelos do LM Studio são arquivos GGUF padrão armazenados na sua pasta de cache.
Quanto custa o LM Studio?
O LM Studio é gratuito. Não há taxas de assinatura, cobranças por API nem limites de uso. Os próprios modelos também são gratuitos — a maioria é de código aberto, com licenças permissivas (MIT, Apache 2.0, Licença Comunitária Llama 3.1). Seus únicos custos são com hardware e energia elétrica. Use nossa calculadora de autohospedagem versus API para comparar os custos de inferência local com os preços das APIs em nuvem.
Por que a inferência está lenta na minha máquina?
Três causas comuns: (1) O modelo não cabe inteiramente na VRAM e está sendo descarregado para a RAM — verifique a exibição de memória no LM Studio e experimente uma quantização menor ou um modelo menor. (2) A GPU não está sendo detectada — confirme se os drivers estão atualizados (Windows/Linux) ou se você está usando Apple Silicon (macOS). (3) Limitação de desempenho (throttling) da CPU em laptops — conecte o carregador e defina o modo de energia para alto desempenho. A velocidade de inferência escala aproximadamente com a largura de banda da VRAM, portanto GPUs mais antigas ou voltadas para dispositivos móveis serão mais lentas do que placas de desktop, mesmo que tenham memória suficiente.
Posso fazer fine-tuning ou treinar modelos no LM Studio?
Não. O LM Studio é voltado exclusivamente para inferência — ele carrega e executa modelos pré-treinados, mas não oferece suporte a treinamento ou fine-tuning. Para isso, você precisa de frameworks especializados, como Axolotl, Hugging Face Transformers ou MLX (para Apple Silicon). Você pode realizar o fine-tuning em outro lugar, exportar o modelo para o formato GGUF e, em seguida, carregar esse GGUF ajustado no LM Studio.
Qual é a diferença entre Q4_K_M, Q5_K_S e outros rótulos de quantização?
O número (Q4, Q5, Q8) indica a quantidade de bits por peso — quanto menor, menor o tamanho e maior a velocidade; quanto maior, maior a precisão. O sufixo indica o método de quantização: K_M (médio, equilibrado), K_S (pequeno, compressão mais agressiva), K_L (grande, preserva mais precisão). Para a maioria dos usuários, Q4_K_M ou Q5_K_M é o ponto ideal. Use apenas Q2 ou Q3 se a VRAM for extremamente limitada; nesses casos, a qualidade degrada de forma perceptível. Q8 aproxima-se da precisão total, mas oferece ganho mínimo de qualidade em relação ao Q5 para a maioria das tarefas, ao mesmo tempo em que duplica o requisito de VRAM.

