- LM Studio est une application gratuite pour ordinateur de bureau destinée à découvrir, télécharger et exécuter localement des grands modèles de langage sur Windows, macOS et Linux.
- Elle intègre une interface de discussion (chat UI), un navigateur de modèles (recherche Hugging Face) et un serveur HTTP local compatible avec l'API OpenAI de sorte que les SDK existants puissent pointer vers
http://localhost:1234/v1sans aucune modification du code. - Elle exécute des modèles quantifiés Modèles GGUF via llama.cpp sur toutes les plateformes et MLX des modèles sur Apple Silicon ; un outil en ligne de commande appelé
lmsest fourni en complément de l'interface graphique. - L'adéquation pratique dépend de la VRAM : un modèle de 8 milliards de paramètres (8B) en quantification 4 bits nécessite environ 5 Go, tandis qu'un modèle de 70 milliards de paramètres (70B) en nécessite environ 40 Go. Utilisez le Calculateur de VRAM avant de télécharger.
LM Studio est une application gratuite pour ordinateur de bureau, à code source fermé, qui vous permet de télécharger et d'exécuter entièrement sur votre propre machine des grands modèles de langage open-weight. Elle est disponible pour Windows, macOS et Linux, intègre des moteurs d'inférence (llama.cpp sur toutes les plateformes, MLX sur Apple Silicon), propose une interface graphique inspirée de ChatGPT et expose un serveur REST compatible avec l'API OpenAI à l'adresse localhost:1234 afin que les applications développées avec le SDK OpenAI puissent interroger un modèle local sans aucune modification.
L'application est développée par l'équipe derrière lmstudio.ai. Elle est gratuite pour un usage personnel et, selon la page du fournisseur consacrée à l'usage professionnel, également gratuite en milieu professionnel ; la redistribution commerciale est soumise à des conditions spécifiques.
Quoi LM Studio fait réellement
LM Studio regroupe quatre fonctionnalités qui, autrement, exigeraient des outils distincts :
- Découverte de modèles. Une interface de recherche intégrée interroge Hugging Face pour les fichiers GGUF et MLX. Vous choisissez une méthode de quantification (Q4_K_M, Q5_K_M, Q6_K, Q8_0, etc.) et le téléchargement s'effectue directement dans un dossier local de modèles.
- Interface de discussion (chat UI). Une fenêtre de discussion multipassage avec invites système personnalisables par conversation, curseurs de température/top-p, sortie structurée (schéma JSON), et prise en charge de pièces jointes PDF ou d'images (ces dernières uniquement avec les modèles compatibles avec la vision).
- Serveur d'inférence local. Un point de terminaison HTTP à l'adresse
http://localhost:1234/v1qui implémente les interfaces d'API OpenAI pour les complétions de discussion (Chat Completions), les complétions classiques (Completions) et les embeddings (Embeddings). Consultez la documentation du fournisseur sur la compatibilité avec l'API OpenAI. - CLI (
lms). Un outil en ligne de commande permettant de scripter le chargement, le déchargement des modèles et la gestion du serveur. L'installation et les commandes sont documentées à l'adresse lmstudio.ai/docs/cli.
En interne, l'inférence s'exécute sur llama.cpp pour les modèles GGUF et sur Apple MLX pour les modèles au format MLX sur Apple Silicon. LM Studio fournit des binaires précompilés des moteurs et permet de les remplacer ou de les mettre à jour depuis les paramètres d'exécution de l'application.
Plateformes prises en charge
| Plateforme | Exigences (selon le fournisseur) | Accélération |
|---|---|---|
| Windows | x64 ou ARM64 ; processeur compatible AVX2 sur x64 | CPU, NVIDIA CUDA, Vulkan (GPU AMD/Intel) |
| macOS | Apple Silicon (M1 ou version ultérieure), macOS 13.4+ | Metal (llama.cpp) et MLX |
| Linux | x64, glibc 2.35+, distribué sous forme d’AppImage | Processeur, NVIDIA CUDA, Vulkan |
Les exigences publiées actuelles figurent sur la page de téléchargement officielle; consultez-la avant d’installer, car les seuils minimaux exacts varient d’une version à l’autre.
Windows
L’installeur est un fichier standard .exe. Les modèles utilisent par défaut le format %USERPROFILE%\.lmstudiomodels. Les GPU NVIDIA utilisent CUDA lorsqu’un environnement d’exécution compatible est sélectionné ; les autres GPU se rabattent sur Vulkan. L’instruction AVX2 est requise sur les processeurs x64, ce qui exclut donc les processeurs très anciens.
macOS
Distribué sous forme d’un .dmg. Sur les Mac équipés de puces Apple Silicon, des modèles au format MLX sont disponibles en complément des modèles GGUF et exploitent généralement la mémoire unifiée de façon efficace. Les modèles utilisent par défaut le format ~/.lmstudio/models. Les Mac Intel ne sont pas pris en charge par les versions actuelles.
Linux
Fourni sous forme d’un .AppImage. Rendez-le exécutable (chmod +x LM-Studio-*.AppImage) puis lancez-le directement. Les GPU NVIDIA utilisent CUDA ; les GPU AMD et Intel utilisent Vulkan. Aucun package .deb ou .rpm officiel n’est disponible à l’heure où ces lignes sont rédigées — consultez la page de téléchargement pour connaître le format de distribution actuel.
Ce que vous pouvez exécuter dans LM Studio
LM Studio peut charger n’importe quel modèle GGUF pris en charge par llama.cpp, ainsi que les modèles MLX sur les Mac équipés de puces Apple Silicon. Ce qui détermine réellement la faisabilité est la capacité matérielle de votre système. Empreinte approximative en VRAM pour des modèles quantifiés en 4 bits, selon le base de données des modèles Convly:
| Modèle | Contexte | ~VRAM en 4 bits |
|---|---|---|
| Gemma 3 4B | 128 K | ~3 Go |
| Mistral 7B | 32 K | ~4,5 Go |
| Llama 3.1 8B | 128 K | ~5 Go |
| Qwen3 8B | 128 K | ~5 Go |
| Phi-4 | 16 K | ~9 Go |
| Gemma 3 12B | 128 K | ~8 Go |
| Qwen3 14B | 128 K | ~9 Go |
| Gemma 3 27B | 128 K | ~16 Go |
| Qwen3 32B | 128 K | ~20 Go |
| Llama 3.3 70B | 128 K | ~40 Go |
Tout modèle dépassant environ 40 Go nécessite plusieurs GPU ou des cartes graphiques dotées d’une grande quantité de VRAM. Des modèles très volumineux tels que DeepSeek R1 (environ 400 Go en 4 bits) ne sont pas réalistes à exécuter sur une seule carte graphique de bureau. Pour plus de détails, consultez le guide complet tableau des besoins en VRAM et le GPU pour les grands modèles linguistiques locaux avant d'acheter du matériel.
Le serveur compatible avec l'API OpenAI
La fonctionnalité la plus utile pour les développeurs est le serveur local. Lancez-le depuis l’onglet Développeur de l’interface graphique ou via l’interface en ligne de commande. Une fois démarré, il accepte des requêtes au format standard OpenAI :
curl http://localhost:1234/v1/chat/completions
-H "Content-Type: application/json"
-d '{
"model": "identifiant-du-modele-charge",
"messages": [{"role": "user", "content": "Bonjour"}]
}'
Le SDK Python fonctionne en redirigeant base_url vers ce serveur local :
from openai import OpenAI
client = OpenAI(base_url="http://localhost:1234/v1", api_key="lm-studio")
Le api_key La valeur du champ « api_key » est ignorée par défaut, mais ce champ doit être présent car le SDK OpenAI l’exige. La liste complète des points de terminaison pris en charge, ainsi que toute divergence éventuelle par rapport au schéma OpenAI, figure dans la référence de l’API.
LM Studio contre Ollama
Ces deux approches constituent les méthodes les plus courantes pour exécuter localement des grands modèles linguistiques sur une station de travail. Voici, de façon synthétique, la différence entre elles :
| LM Studio | Ollama | |
|---|---|---|
| Interface principale | Interface graphique bureautique (chat, navigateur de modèles) | Interface en ligne de commande et API HTTP |
| Licence | Application propriétaire, gratuite pour un usage personnel ou professionnel | Logiciel libre (licence MIT) |
| Source du modèle | Hugging Face (modèles GGUF, MLX) via la recherche intégrée à l’application | Registre de modèles Ollama (avec importation possible depuis des modèles GGUF) |
| Serveur | Compatible OpenAI au niveau de :1234 |
API native au niveau de :11434, couche compatible OpenAI |
| MLX pour Apple Silicon | Oui | Non (uniquement llama.cpp) |
Si vous privilégiez une interface graphique intuitive et le support de MLX sur Mac, LM Studio constitue le point de départ le plus simple. Si vous préférez une pile logicielle scriptable, libre et un serveur sans interface graphique, consultez le Guide Ollama et guide d’installation pas à pas.
Quand utiliser LM Studio plutôt qu'une API hébergée
L’inférence locale implique réellement des compromis. Ses avantages sont la confidentialité (aucune donnée ne quitte la machine), un coût prévisible après amortissement du matériel, et la disponibilité hors ligne. Ses inconvénients sont le coût initial, un débit de jetons inférieur à celui d’un cluster GPU hébergé, et l’absence d’accès aux modèles propriétaires les plus avancés.
Pour avoir une idée approximative du seuil de rentabilité : sur le classement Convly des grands modèles linguistiques , les coûts des modèles hébergés vont d’environ 0,02 $ par million de jetons d’entrée pour les petits modèles ouverts sur des fournisseurs serverless, jusqu’à 10 $ pour les jetons entrants et 50 $ pour les jetons sortants par million, pour les modèles propriétaires les plus avancés. Si votre charge de travail relève de la catégorie des petits modèles et que vous pouvez accepter une qualité de niveau 8B à 30B, l’auto-hébergement sur une seule carte graphique grand public est souvent plus économique globalement. Calculez vos propres coûts à l’aide du calculateur auto-hébergement vs API et le Calculateur de coûts d’API.
Liste de contrôle pratique pour la configuration
- Vérifiez la quantité de VRAM disponible. Tout modèle dont la taille dépasse celle de la mémoire vidéo de votre GPU sera partiellement transféré vers la mémoire système, ce qui ralentira fortement son exécution. Utilisez le Calculateur de VRAM.
- Téléchargez LM Studio depuis lmstudio.ai/download. N’installez pas le logiciel depuis des miroirs tiers.
- Dans l’onglet Découvrir de l’application, choisissez un modèle adapté à vos ressources. Commencez par une quantification Q4_K_M, qui offre le meilleur compromis entre taille et qualité.
- Chargez le modèle. Surveillez l’indicateur de VRAM ; si le modèle ne peut pas être entièrement déchargé sur le GPU, optez pour une quantification plus faible ou un modèle plus petit.
- Activez le serveur depuis l’onglet Développeur si vous comptez y accéder depuis un programme. Vérifiez son bon fonctionnement avec la commande
curl http://localhost:1234/v1/models.
Pour un guide pas à pas accompagné de captures d’écran, consultez le Guide complet de LM Studio. Pour des sélections de modèles optimisées en fonction des configurations matérielles locales, voir les meilleurs modèles locaux (ces recommandations s’appliquent également à LM Studio, puisque les deux moteurs reposent sur llama.cpp).
Questions fréquemment posées
LM Studio est-il gratuit ?
Oui. LM Studio est gratuit à télécharger et à utiliser à des fins personnelles et, conformément à la politique de l’éditeur concernant l’usage professionnel, l’usage professionnel.L’application elle-même est fermée (code source non disponible), mais les modèles que vous exécutez dans celle-ci sont des modèles open-weight, sous licence de leurs éditeurs respectifs (Meta, Google, Alibaba, Mistral, etc.).
LM Studio envoie-t-il des données vers le cloud ?
L’inférence s’exécute entièrement sur votre machine : les prompts et les réponses ne quittent jamais l’appareil. L’application établit toutefois une connexion vers Hugging Face lorsque vous recherchez ou téléchargez des modèles, et vérifie la disponibilité de mises à jour. Selon la page de confidentialité de l’éditeur, aucune télémétrie n’est effectuée sur le contenu des conversations.Consultez-la directement pour connaître la politique en vigueur.
Quels formats de modèles LM Studio prend-il en charge ?
GGUF sur toutes les plateformes (via llama.cpp) et MLX sur les puces Apple Silicon. Les checkpoints bruts de Hugging Face safetensors et PyTorch ne sont pas pris en charge directement : convertissez-les d’abord au format GGUF, ou téléchargez un GGUF pré-quantifié déjà publié par la communauté.
Puis-je utiliser LM Studio comme remplacement direct de l'API OpenAI ?
Pour les complétions conversationnelles, les complétions classiques et les embeddings, la réponse est globalement oui : pointez simplement le SDK OpenAI vers base_url vers http://localhost:1234/v1 et le code existant fonctionne. Les fonctionnalités reposant sur un comportement spécifique aux serveurs OpenAI (assistants, API de fichiers, génération d’images, modération) ne sont pas implémentées. Consultez la liste actuelle des points de terminaison..
De combien de RAM ou de VRAM ai-je besoin ?
Règle empirique pour la quantification 4 bits : la taille du modèle, exprimée en milliards de paramètres, multipliée par environ 0,6 donne la quantité de VRAM (en Go) nécessaire pour stocker les poids, auxquels s’ajoutent quelques Go supplémentaires pour le cache KV dans le cas de contextes longs. Un modèle de 7 à 8 milliards de paramètres fonctionne confortablement sur un GPU de 8 Go ; un modèle de 70 milliards nécessite environ 40 Go (voir les chiffres de Convly Base de données de modèles ci-dessus). Pour une analyse détaillée par modèle, reportez-vous à exigences en VRAM..
LM Studio prend-il en charge les appels d'outils et les sorties structurées ?
Oui pour les sorties structurées via un schéma JSON, et les appels d'outils/fonctions sont pris en charge pour les modèles dont les modèles de discussion (chat templates) l'indiquent explicitement (notamment les versions récentes de Llama, Qwen, Mistral et Gemma). La qualité des appels d'outils dépend du modèle sous-jacent, et non de LM Studio lui-même. Testez avec votre modèle cible avant de l'intégrer en production.
