Exécuter un grand modèle de langage sur votre propre ordinateur portable était autrefois un projet de recherche. En 2026, c'est une configuration de 15 minutes. Vous pouvez avoir un véritable assistant IA capable fonctionnant entièrement sur votre machine — pas d'abonnement, pas d'Internet requis, et aucune donnée ne quittant jamais votre ordinateur.
Ce guide vous explique l'ensemble du processus : le matériel dont vous avez besoin, quel outil utiliser, quel modèle télécharger et comment le mettre en marche.
Points clés
- Chemin le plus simple : installer Ollama ou LM Studio — les deux vous permettent de démarrer en quelques minutes.
- Matériel : 16 GB de RAM est le minimum confortable ; un Mac Apple Silicon ou un ordinateur portable avec un GPU discret est idéal.
- Taille du modèle : Les modèles 7–8B sont le bon compromis pour les ordinateurs portables — capables et rapides.
- Quantification réduit les modèles pour les adapter à votre matériel ; les versions « Q4 » sont le choix standard.
- Pourquoi le faire : c'est gratuit, entièrement privé et fonctionne hors ligne.
- Pourquoi exécuter un LLM localement ?
- Étape 1 : Vérifiez votre matériel
- Étape 2 : Choisissez votre outil
- Étape 3 : Installez et exécutez votre premier modèle
- Étape 4 : Choisissez le bon modèle et la bonne taille
- Étape 5 : Comprendre la quantification
- Aller plus loin
- Pourquoi c'est lent — et comment y remédier
- FAQ
- Conclusion
- Articles connexes
Pourquoi exécuter un LLM localement ?
L'IA en nuage est pratique, alors pourquoi exécuter un modèle vous-même ? Trois vraies raisons :
- Confidentialité. Rien de ce que vous tapez ne quitte votre machine. Pour le travail sensible, confidentiel ou personnel, c'est un véritable avantage.
- Coût. C'est gratuit. Pas d'abonnement, pas de facturation par jeton, pas de limites d'utilisation — générez autant que vous le souhaitez.
- Hors ligne et toujours disponible. Ça marche dans un avion, sans Internet, et il ne peut pas être limité en débit ou interrompu.
Le compromis : un modèle qui s'exécute sur un ordinateur portable est plus petit et moins capable qu'un modèle en nuage de pointe. Mais les petits modèles modernes sont suffisamment bons pour beaucoup de vrai travail — rédaction, résumé, aide à la programmation, brainstorming, Q&A.
Étape 1 : Vérifiez votre matériel
Les performances locales du LLM dépendent principalement de la mémoire. Voici le tableau réaliste :
| Votre ordinateur portable | Ce que vous pouvez exécuter |
|---|---|
| 8 GB RAM | Petits modèles uniquement (1–3B). Utilisable mais limité. |
| 16 GB RAM | Modèles 7–8B confortablement — le bon compromis. |
| 32 GB RAM | Jusqu'à environ 13–14B modèles avec une bonne vitesse. |
| Apple Silicon (M-series) | Excellent — la mémoire unifiée est idéale ; les modèles plus grands s'exécutent bien. |
| GPU NVIDIA discret | Option la plus rapide ; le VRAM est la limite pour la taille du modèle. |
Les deux choses qui comptent : la mémoire totale (RAM, ou VRAM sur un GPU) fixe le plus grand modèle que vous pouvez charger, et un GPU ou Apple Silicon définit sa vitesse. Un ordinateur portable moderne avec 16 GB de RAM est un excellent point de départ.
Étape 2 : Choisissez votre outil
Vous n'interagissez pas directement avec le modèle brut — vous utilisez un outil qui le télécharge, le gère et l'exécute. Les meilleures options en 2026 :
- Ollama — le choix le plus populaire. Un outil en ligne de commande propre (avec une application simple) qui télécharge et exécute les modèles avec une seule commande, et expose une API locale afin que d'autres applications puissent se connecter. Meilleur choix global.
- LM Studio — une application graphique soignée. Parcourez et téléchargez des modèles, discutez dans une interface intégrée, pas besoin de ligne de commande. Meilleur pour les débutants qui veulent une expérience visuelle.
- Jan — une application de bureau open-source et axée sur la confidentialité, une bonne alternative à LM Studio.
- llama.cpp — le moteur haute performance sur lequel nombre de ces outils sont construits. Utilisez-le directement si vous voulez un contrôle et une efficacité maximaux.
Pour la plupart des gens : Ollama si vous êtes à l'aise avec un terminal, LM Studio si vous préférez cliquer.
Étape 3 : Installez et exécutez votre premier modèle
La configuration avec Ollama est vraiment aussi courte :
- Téléchargez et installez Ollama depuis son site officiel.
- Ouvrez un terminal.
- Exécutez une commande :
ollama run llama3.1
Cette commande télécharge le modèle la première fois (quelques gigaoctets) puis vous amène à une invite de discussion. C'est tout — vous avez maintenant un assistant IA privé fonctionnant localement. La prochaine fois, il démarre instantanément.
Avec LM Studio, l'équivalent est : ouvrez l'application, recherchez un modèle, cliquez sur télécharger, puis cliquez pour commencer à discuter — entièrement via l'interface.
Étape 4 : Choisissez le bon modèle et la bonne taille
Deux choses à choisir : la famille de modèles et sa taille.
Famille de modèles — les modèles open puissants qui fonctionnent bien en local incluent la Llama série de Meta, la Qwend'Alibaba, la Gemma, les modèles de Mistral, et DeepSeekdes versions plus petites. Elles sont toutes bonnes ; essayez-en quelques-unes et voyez celle qui vous convient.
Taille — les modèles viennent avec des comptes de paramètres marqués comme 3B, 8B, 14B (B = milliard) :
- 1–3B — très rapide, léger en mémoire, parfait pour les tâches simples. Bon pour les machines 8 Go.
- 7–8B — le point doux des portables. Véritablement capable pour l'écriture, l'aide à la programmation et les Q&A, et fonctionne bien sur 16 Go.
- 13–14B et plus — nettement plus intelligent, mais nécessite 32 Go ou un GPU puissant.
Commencez avec un modèle 8B. C'est le meilleur équilibre entre capacité et vitesse pour la plupart des portables.
Étape 5 : Comprendre la quantification
Vous verrez des noms de modèles avec des tags comme Q4_K_M ou Q8. Ceci est la quantification — une technique de compression qui réduit la précision des nombres du modèle pour qu'il utilise beaucoup moins de mémoire, avec seulement une petite perte de qualité.
- Q8 — qualité la plus haute, taille la plus grande.
- Q4 — environ la moitié de la mémoire de Q8, avec une qualité très proche. C'est la recommandation standard.
- Q2/Q3 — la plus petite, mais la qualité se dégrade notablement ; utilisez-la seulement si la mémoire vous y oblige.
La règle pratique : choisissez une Q4 version du plus grand modèle que votre mémoire peut confortablement contenir. Des outils comme Ollama choisissent une quantification sensée par défaut, donc vous n'avez souvent pas à y penser.
Aller plus loin
Une fois que c'est lancé, vous pouvez faire plus que discuter dans un terminal :
- Connectez une interface plus élégante — des applications comme Open WebUI offrent une fenêtre de style ChatGPT sur votre modèle local.
- Utilisez l'API locale — Ollama sert une API sur votre machine, vous pouvez donc écrire des scripts et des applications contre votre modèle local exactement comme vous le feriez avec un modèle cloud.
- Essayez la récupération — pointez une configuration RAG sur vos propres documents pour un assistant « chat avec vos fichiers » entièrement privé.
Pourquoi c'est lent — et comment y remédier
La plainte la plus courante après une première installation n'est pas que le modèle ne fonctionnera pas — c'est qu'il traîne. Sur un portable, la lenteur de la sortie provient presque toujours du fait que le modèle n'utilise pas réellement votre GPU. Le moyen le plus rapide de vérifier est d'exécuter un modèle, puis dans un autre terminal d'exécuter ollama ps. La sortie indique comment le modèle est réparti : s'il rapporte 100 % GPU, tout va bien ; s'il affiche 100 % CPU ou une répartition CPU/GPU, vous avez trouvé votre problème.
Il y a trois coupables habituels, par ordre de fréquence :
- Le GPU n'a jamais été détecté. Sous Windows et Linux avec une carte NVIDIA, cela signifie généralement que les pilotes GPU ont été installés après le runtime, donc il n'a jamais détecté la prise en charge CUDA — Ollama vérifie le GPU au moment de l'installation, pas pendant l'exécution. Confirmez que nvidia-smi fonctionne, puis réinstallez le runtime pour qu'il détecte le GPU. Cette correction unique résout la majorité des rapports « il utilise mon CPU ».
- Le modèle est trop volumineux pour votre VRAM. Quand un modèle ne rentre pas, les couches en excédent basculent silencieusement vers la RAM système et le CPU — et ces quelques couches CPU ralentissent tout l'ensemble. La solution est de passer à un modèle plus petit ou à une quantification plus lourde (une version Q inférieure) pour que le modèle complet réside dans la VRAM.
- Votre fenêtre de contexte est trop grande. Un contexte long consomme aussi de la mémoire, car le cache KV augmente avec lui. Si vous le poussez trop haut, les couches débordent sur le CPU. Si vous n'avez pas besoin d'une invite énorme, réduisez la longueur du contexte (8K suffit pour la plupart des tâches) et le modèle s'adapte plus confortablement.
Deux problèmes sont spécifiques aux portables. D'abord, la politique d'alimentation par batterie: la plupart des portables Windows limitent fortement le GPU discret quand ils sont débanchés, et débrancher peut réduire la vitesse d'inférence de moitié ou plus. C'est un comportement du firmware, pas un bug — gardez le portable branché pour un travail sérieux. Deuxièmement, l' étranglement thermique: après environ 10–20 minutes de génération soutenue, un portable mince chauffe et réduit la fréquence d'horloge. Soulever le portable de quelques centimètres sur un support pour l'aérodynamique, et préférer une quantification plus légère qui chauffe moins, repoussent tous deux le moment où l'étranglement se déclenche. Rien de cela ne fait d'un portable une station de travail, mais c'est la différence entre quelques jetons par seconde et un assistant véritablement utilisable.
FAQ
Puis-je exécuter Llama sur un portable normal ?
Oui. Un portable avec 16 Go de RAM exécute confortablement des modèles 7–8B, qui sont véritablement utiles. Même les machines 8 Go peuvent exécuter des modèles plus petits 1–3B. Les Mac Apple Silicon et les portables avec une GPU dédiée exécutent les modèles locaux particulièrement bien.
L'exécution d'un LLM localement est-elle gratuite ?
Oui. Les modèles sont gratuits à télécharger et il n'y a pas de frais d'utilisation — vous pouvez générer autant que vous le souhaitez. Le seul « coût » est votre matériel et l'espace disque que les fichiers de modèle occupent (quelques gigaoctets chacun).
Quel est le meilleur outil pour exécuter des LLM localement ?
Ollama est le plus populaire et le meilleur choix global — une simple commande télécharge et exécute n'importe quel modèle, et il fournit une API locale. LM Studio est la meilleure option si vous préférez une application graphique sans ligne de commande.
Combien de RAM me faut-il pour exécuter un LLM local?
16 Go est le minimum confortable pour les modèles 7–8B véritablement capable. Avec 8 Go, vous êtes limité aux modèles plus petits 1–3B. Avec 32 Go, vous pouvez exécuter des modèles 13–14B. Plus de mémoire vous permet surtout d'exécuter des modèles plus grands et plus intelligents.
Les LLM locaux sont-ils aussi bons que ChatGPT ?
Pas aussi capables qu'un modèle cloud de pointe — les modèles de la taille d'un portable sont plus petits et moins puissants. Mais ils sont assez bons pour de nombreuses tâches quotidiennes : écriture, résumé, assistance à la programmation et Q&A. Vous sacrifiez une certaine capacité pour une confidentialité totale, aucun coût et un accès hors ligne.
Pourquoi mon LLM local est-il si lent ?
Neuf fois sur dix, le modèle n'utilise pas votre GPU. Exécutez ollama ps pendant qu'un modèle est chargé : s'il affiche 100 % CPU ou une répartition CPU/GPU, c'est votre réponse. Les causes habituelles sont les pilotes GPU installés après le runtime (réinstallez le runtime pour qu'il détecte CUDA), un modèle trop volumineux pour votre VRAM (utilisez un modèle plus petit ou une quantification plus lourde), ou une fenêtre de contexte si grande qu'elle pousse les couches sur le CPU (réduisez-la).
Dois-je garder mon portable branché lors de l'exécution d'un LLM local ?
Oui, pour tout ce qui dépasse une simple question. La plupart des portables Windows limitent agressivement le GPU discret sur batterie pour préserver l'autonomie, ce qui peut à peu près diviser par deux vos jetons par seconde. Ce ralentissement est dû à la politique d'alimentation du firmware, pas à une défaillance. Brancher le portable restaure les horloges GPU complètes ; un support de refroidissement pour l'aérodynamique aide à éviter l'étranglement thermique qui s'installe après des sessions prolongées.
Puis-je utiliser un LLM local complètement hors ligne ?
Oui. Seul le téléchargement initial du modèle nécessite Internet. Une fois le modèle sur le disque, il s'exécute complètement hors ligne — vous pouvez vous déconnecter entièrement et il répond toujours. C'est l'avantage fondamental en matière de confidentialité : vos invites ne quittent jamais la machine, ce qui rend un modèle local un choix judicieux pour les notes confidentielles, les brouillons ou tout ce que vous ne voudriez pas envoyer à un service cloud.
Conclusion
Exécuter un modèle IA sur votre propre portable n'est plus difficile. Installez Ollama ou LM Studio, téléchargez un modèle 8B en Q4 quantification, et en 15 minutes, vous avez un assistant capable qui est gratuit, entièrement privé et fonctionne hors ligne.
Il ne remplacera pas un modèle cloud de pointe pour les tâches les plus difficiles — mais pour l'écriture quotidienne, l'aide à la programmation et les Q&A privés, un modèle local est véritablement utile. Et une fois qu'il fonctionne, vous le possédez : pas d'abonnement, pas de limites, et aucune donnée ne quittant votre machine.
