- LM Studio est une application gratuite pour ordinateur de bureau permettant d’exécuter localement des grands modèles de langage sur votre ordinateur, sans nécessiter de programmation ni d’utilisation de la ligne de commande
- Téléchargez directement des modèles depuis Hugging Face via le navigateur intégré ; prend en charge le format GGUF avec sélection automatique de la quantification
- Inclut une interface de discussion (chat), un serveur d’API local (compatible OpenAI) et une accélération matérielle automatique (CUDA, Metal, CPU)
- Nécessite suffisamment de VRAM ou de RAM selon la taille du modèle — généralement au moins 8 Go pour les modèles de 7 milliards de paramètres, et 24 Go ou plus pour les modèles de 13 milliards de paramètres
LM Studio est une application de bureau qui vous permet de télécharger, d’exécuter et d’interagir avec des grands modèles de langage sur votre propre ordinateur. Elle fournit une interface graphique pour des tâches qui exigeraient autrement l’utilisation d’outils en ligne de commande, rendant ainsi l’IA locale accessible aux développeurs et aux utilisateurs techniques souhaitant un contrôle total sur leurs modèles, sans envoyer leurs données à des API externes. L’application gère automatiquement la découverte des modèles, leur téléchargement, la sélection de la quantification et l’accélération matérielle.
Contrairement aux services d’IA basés sur le cloud, LM Studio fonctionne entièrement hors ligne dès que vous avez téléchargé un modèle. Vos échanges, documents et invites ne quittent jamais votre machine. Cela en fait un outil adapté aux travaux sensibles, aux expérimentations sans frais liés aux API, ainsi qu’aux environnements disposant d’une connectivité Internet limitée ou inexistante.
Installation
Windows
Téléchargez l’installateur depuis lmstudio.ai. Le bloc .exe L’installateur pèse généralement entre 200 et 400 Mo. Exécutez-le et suivez l’assistant d’installation. LM Studio sera installé par défaut dans C:\Users\[VotreNomUtilisateur]\AppData\Local\LM-Studio Les modèles sont téléchargés par défaut dans C:\Users\[VotreNomUtilisateur]\.cache\lm-studio\models sauf si vous modifiez ce chemin dans les paramètres.
Pour l’accélération GPU sous Windows, vous devez disposer des pilotes NVIDIA version 522.06 ou ultérieure afin de bénéficier du support CUDA. LM Studio détectera et utilisera automatiquement votre GPU s’il est disponible.
macOS
Téléchargez l’ .dmg fichier depuis lmstudio.ai. Ouvrez-le puis faites glisser LM Studio vers le dossier Applications. Les modèles sont téléchargés par défaut dans ~/Library/Application Support/LMStudio/models .
Les Mac équipés de puces Apple Silicon (M1, M2, M3, M4) bénéficient d’une accélération Metal automatique. Sur les Mac Intel, l’inférence s’effectue sur le processeur (CPU), ce qui est nettement plus lent mais fonctionnel pour les modèles plus petits.
Linux
Téléchargez l’ .AppImage fichier. Rendez-le exécutable à l’aide de la commande chmod +x LM-Studio-*.AppImage, puis lancez-le avec ./LM-Studio-*.AppImageLes modèles sont téléchargés par défaut dans ~/.cache/lm-studio/models.
Pour l’accélération GPU NVIDIA, installez le kit CUDA 11.8 ou une version ultérieure, et assurez-vous que la commande nvidia-smi affiche bien votre GPU. LM Studio détectera automatiquement CUDA.
Téléchargement et chargement des modèles
LM Studio utilise le format GGUF, un format de modèle quantifié qui réduit les besoins en mémoire tout en conservant une bonne qualité. Lorsque vous ouvrez LM Studio, cliquez sur l’icône de recherche dans la barre latérale gauche pour parcourir les modèles. La recherche intégrée interroge Hugging Face et filtre les fichiers GGUF compatibles.
Recherchez un modèle par son nom (par exemple « llama 3.1 », « mistral », « phi »). Chaque résultat affiche plusieurs niveaux de quantification, étiquetés comme Q4_K_M, Q5_K_S, ou Q8_0. Le chiffre indique la profondeur en bits — Q4 utilise 4 bits par poids, Q8 utilise 8 bits. Des valeurs plus faibles signifient une taille de fichier réduite et une inférence plus rapide, mais une qualité légèrement moindre.
Dans la plupart des cas, Q4_K_M ou Q5_K_M offre le meilleur compromis. Utilisez notre Calculateur de VRAM pour estimer la quantité de mémoire nécessaire à un modèle et une quantification donnés. À titre indicatif :
| Taille du modèle | VRAM requise (Q4_K_M) | VRAM requise (Q5_K_M) | VRAM requise (Q8_0) |
|---|---|---|---|
| 7 milliards de paramètres | ~5 Go | ~6 Go | ~9 Go |
| 13 milliards de paramètres | ~9 Go | ~11 Go | ~16 Go |
| 34 milliards de paramètres | ~22 Go | ~27 Go | ~40 Go |
| 70 milliards de paramètres | ~42 Go | ~51 Go | ~75 Go |
Cliquez sur l’icône de téléchargement située à côté du niveau de quantification choisi. La taille des modèles varie de 3 Go à plus de 50 Go selon leur complexité. Une fois le téléchargement terminé, cliquez sur le nom du modèle dans votre bibliothèque pour le charger. LM Studio affichera l’allocation de la mémoire GPU et de la mémoire système dans le coin inférieur droit. Si le modèle ne peut pas tenir entièrement dans la VRAM, certaines couches seront déplacées vers la mémoire vive (RAM), ce qui ralentit considérablement l’inférence.
Utilisation de l’interface de discussion (chat)
Une fois qu’un modèle est chargé, l’interface de discussion apparaît dans la fenêtre principale. Saisissez votre invite dans la zone de texte située en bas, puis appuyez sur Entrée ou cliquez sur l’icône d’envoi. Le modèle génère une réponse localement — aucune connexion Internet n’est requise après le chargement.
Raccourcis clés :
- Curseur de température (barre latérale droite) : contrôle l’aléatoire. Valeurs comprises entre 0,1 et 0,3 pour les tâches factuelles, entre 0,7 et 1,0 pour l’écriture créative.
- Nombre maximal de jetons: limite la longueur de la réponse. La valeur par défaut est généralement 2048 ; augmentez-la pour obtenir des sorties plus longues.
- Invite système: définit le comportement et la personnalité du modèle. Cliquez sur « Modifier » dans la barre supérieure pour l’ajuster.
- Séquences d’arrêt: jetons qui interrompent prématurément la génération, utiles pour les formats de sortie structurés.
LM Studio prend en charge les conversations multi-tours. Chaque message reste dans le contexte jusqu’à ce que vous cliquiez sur « Nouvelle discussion » ou que la fenêtre de contexte soit saturée. La plupart des modèles disposent d’une fenêtre de contexte allant de 4 k à 32 k jetons — consultez la fiche technique du modèle pour plus de détails.
Exécution d’un serveur d’API local
LM Studio intègre un serveur API compatible OpenAI, vous permettant d’utiliser vos modèles locaux comme remplacements directs de GPT-4 ou GPT-3.5 dans des applications existantes. Cliquez sur l’icône dans la barre latérale gauche pour ouvrir l’onglet Serveur local.
Sélectionnez un modèle chargé dans la liste déroulante, puis cliquez sur « Démarrer le serveur ». Le serveur s’exécute par défaut sur http://localhost:1234 . L’interface affiche un exemple de code :
curl http://localhost:1234/v1/chat/completions
-H "Content-Type: application/json"
-d '{
"model": "local-model",
"messages": [{"role": "user", "content": "Bonjour"}]
}'Tout outil prenant en charge le format d’API OpenAI fonctionne avec le serveur de LM Studio. Définissez l’URL de base sur http://localhost:1234/v1 et utilisez n’importe quelle chaîne non vide comme clé API (LM Studio ne la valide pas). Cela inclut notamment :
- LangChain (Python/JS) : définissez
openai_api_basesur localhost - SDK Python OpenAI :
openai.api_base = "http://localhost:1234/v1" - Éditeurs de texte dotés de fonctions IA (Cursor, Continue, Cody) : configurez-les pour pointer vers localhost dans leurs paramètres
- Scripts personnalisés : remplacez
https://api.openai.com/v1avechttp://localhost:1234/v1
Le serveur prend en charge les réponses en continu (streaming) ainsi que l’appel de fonctions (si le modèle a été entraîné à cet effet). Consultez les journaux (logs) dans l’onglet Serveur pour déboguer les requêtes.
Configuration et paramètres matériels
Cliquez sur l’icône d’engrenage (Paramètres) dans le coin inférieur gauche pour ajuster les options suivantes :
- Chemin du dossier de modèles: modifiez l’emplacement où les modèles sont téléchargés et chargés.
- Couches déléguées au GPU: détermine combien de couches s’exécutent sur le GPU ou sur le CPU. La détection automatique fonctionne bien, mais un réglage manuel peut être utile si vous exécutez plusieurs programmes simultanément.
- Remplacement de la longueur de contexte: augmentez cette valeur si le modèle le permet et si vous avez besoin de conversations plus longues. Une longueur de contexte plus élevée consomme davantage de VRAM.
- Nombre de threads d’inférence: nombre de threads CPU dédiés à l’inférence. Par défaut, ce paramètre est réglé automatiquement, mais le fixer au nombre de cœurs physiques (et non logiques) peut améliorer les performances.
Pour de meilleures performances, fermez les autres applications gourmandes en ressources GPU (jeux vidéo, montage vidéo, rendu 3D) avant de charger des modèles volumineux. Sur les ordinateurs portables, branchez-les sur secteur et sélectionnez le mode d’alimentation « Hautes performances » — la limitation dynamique (throttling) du CPU et du GPU affecte fortement la vitesse d’inférence.
LM Studio contre Ollama
LM Studio et Ollama fonctionnent tous deux avec des modèles locaux, mais diffèrent par leur interface et leur flux de travail :
| Fonctionnalité | LM Studio | Ollama |
|---|---|---|
| Interface | Interface graphique de bureau | Ligne de commande + API |
| Découverte des modèles | Navigateur intégré | Registre de modèles séparé |
| Format | Fichiers GGUF | Format personnalisé (conversion depuis GGUF) |
| Contrôle de la quantification | Choix précis de la quantification | Automatique |
| Interface de discussion | Intégrée | Aucune (utilisation d’outils externes) |
| Courbe d’apprentissage | Moins abrupte (visuelle) | Plus abrupte (CLI) |
Préférez LM Studio si vous souhaitez une interface graphique, un contrôle direct des fichiers modèles et que vous ne voulez pas utiliser le terminal. Préférez Ollama si vous privilégiez les workflows en ligne de commande, recherchez un serveur léger ou souhaitez intégrer le modèle dans un pipeline automatisé. Les deux outils sont gratuits et gèrent l’accélération GPU de façon similaire. Consultez notre guide sur les modèles locaux pour des recommandations compatibles avec l’un ou l’autre outil.
Choix des modèles pour LM Studio
Le modèle que vous choisissez dépend de votre matériel et de votre cas d’usage. Consultez notre Base de données des modèles IA pour connaître les spécifications et les exigences en VRAM de plus de 37 modèles.
Pour 8 à 16 Go de VRAM : Llama 3.1 8B, Mistral 7B, Phi-3 Medium (14 milliards de paramètres). Ces modèles gèrent bien les conversations générales, l’assistance à la programmation et la synthèse de texte.
Pour 24 Go de VRAM : Llama 3.1 70B (quantifié en Q3), Mixtral 8x7B, Command R+ 35B (quantifié en Q4). Saut qualitatif important pour le raisonnement et les instructions complexes.
Pour 48 Go de VRAM ou plus : Llama 3.1 405B (quantifié en Q3), Qwen 2.5 72B (quantifié en Q5). Performances proches de l’état de l’art pour la plupart des tâches.
Si vous n’êtes pas sûr qu’un modèle soit compatible avec votre matériel, utilisez l’outil Calculateur de VRAM avant de télécharger. Un modèle qui occupe presque toute la VRAM disponible sera déchargé partiellement vers la RAM, ce qui ralentit l’inférence de 5 à 10 fois par rapport à un chargement complet en VRAM.
Questions fréquemment posées
LM Studio fonctionne-t-il hors ligne ?
Oui, entièrement. Une connexion Internet est nécessaire uniquement pour télécharger les modèles initialement, mais une fois téléchargés, LM Studio fonctionne sans aucune connexion réseau. Les modèles, l’inférence et le serveur d’API local fonctionnent tous hors ligne. Cela le rend adapté aux environnements isolés (« air-gapped ») ou aux travaux effectués sans connectivité.
Puis-je utiliser les modèles de LM Studio dans mes propres applications ?
Oui. Démarrez le serveur d’API local dans LM Studio et pointez votre application vers http://localhost:1234/v1. Tout code utilisant le format d’API OpenAI fonctionnera sans modification. Vous pouvez également charger directement des fichiers GGUF dans votre code à l’aide de bibliothèques telles que llama.cpp, llama-cpp-python, ou ctransformers— les modèles téléchargés via LM Studio sont des fichiers GGUF standard stockés dans votre dossier de cache.
Combien coûte LM Studio ?
LM Studio est gratuit. Il n’y a aucun abonnement, aucune redevance API ni aucune limite d’utilisation. Les modèles eux-mêmes sont également gratuits — la plupart sont open source et publiés sous des licences permissives (MIT, Apache 2.0, licence communautaire Llama 3.1). Vos seuls coûts sont liés au matériel et à l’électricité. Utilisez notre calculateur auto-hébergement vs API pour comparer les coûts d’inférence locale avec les tarifs des API cloud.
Pourquoi l’inférence est-elle lente sur ma machine ?
Trois causes fréquentes : (1) Le modèle ne tient pas entièrement dans la VRAM et est partiellement déchargé vers la RAM — vérifiez l’affichage mémoire dans LM Studio et essayez une quantification plus légère ou un modèle plus petit. (2) La carte graphique n’est pas détectée — assurez-vous que les pilotes sont à jour (Windows/Linux) ou que vous utilisez bien une puce Apple Silicon (macOS). (3) Limitation de la puissance du processeur (throttling) sur les ordinateurs portables — branchez l’alimentation et passez en mode haute performance. La vitesse d’inférence évolue approximativement en fonction de la bande passante de la VRAM, donc les GPU anciens ou destinés aux mobiles seront plus lents que les cartes de bureau, même s’ils disposent d’une capacité mémoire suffisante.
Puis-je affiner ou entraîner des modèles dans LM Studio ?
Non. LM Studio est conçu uniquement pour l’inférence — il charge et exécute des modèles pré-entraînés, mais ne prend pas en charge l’entraînement ni l’affinage. Pour cela, vous devez utiliser des frameworks spécialisés comme Axolotl, Hugging Face Transformers ou MLX (sur Apple Silicon). Vous pouvez affiner un modèle ailleurs, l’exporter au format GGUF, puis charger ce modèle affiné dans LM Studio.
Quelle est la différence entre les étiquettes de quantification Q4_K_M, Q5_K_S, etc. ?
Le chiffre (Q4, Q5, Q8) indique le nombre de bits par poids — plus faible signifie un modèle plus petit et plus rapide, plus élevé signifie une précision accrue. Le suffixe désigne la méthode de quantification : K_M (moyen, équilibre optimal), K_S (petit, compression plus agressive), K_L (grand, préservation accrue de la précision). Pour la plupart des utilisateurs, Q4_K_M ou Q5_K_M constitue le compromis idéal. N’utilisez Q2 ou Q3 que si la VRAM est extrêmement limitée ; la qualité s’en trouve nettement dégradée. Q8 approche la précision pleine, mais apporte peu de gain qualitatif supplémentaire par rapport à Q5 pour la plupart des tâches, tout en doublant la consommation de VRAM.

