{"id":2182,"date":"2026-08-12T20:06:35","date_gmt":"2026-08-12T20:06:35","guid":{"rendered":"https:\/\/convly.ai\/?p=2182"},"modified":"2026-08-12T20:06:35","modified_gmt":"2026-08-12T20:06:35","slug":"text-generation-webui-guide","status":"publish","type":"post","link":"https:\/\/convly.ai\/fr\/text-generation-webui-guide\/","title":{"rendered":"Text Generation WebUI (Oobabooga) : Guide d\u2019installation, chargeurs de mod\u00e8les et utilisation"},"content":{"rendered":"<div class=\"convly-tldr\">\n<ul>\n<li>text-generation-webui (souvent appel\u00e9 <em>oobabooga<\/em> d\u2019apr\u00e8s le nom de son auteur sur GitHub) est une interface web libre, gratuite et open source permettant d\u2019ex\u00e9cuter des mod\u00e8les de langage (LLM) localement sur votre propre mat\u00e9riel.<\/li>\n<li>Installation via des scripts \u00e0 un clic \u2014 <code>start_windows.bat<\/code>, <code>start_linux.sh<\/code>, ou <code>start_macos.sh<\/code> \u2014 aucune configuration manuelle de l\u2019environnement Python n\u2019est requise.<\/li>\n<li>Prend en charge plusieurs moteurs d\u2019inf\u00e9rence : llama.cpp pour les fichiers GGUF, ExLlamaV2 pour les mod\u00e8les EXL2\/GPTQ sur NVIDIA, et Transformers pour les mod\u00e8les Hugging Face.<\/li>\n<li>Int\u00e8gre une extension API compatible OpenAI (<code>--extensions openai<\/code>) afin que d\u2019autres applications puissent se connecter \u00e0 votre mod\u00e8le local sans modification de code.<\/li>\n<\/ul>\n<\/div>\n<p>text-generation-webui est une interface web open source, auto-h\u00e9berg\u00e9e, con\u00e7ue pour ex\u00e9cuter localement des mod\u00e8les de langage de grande taille. D\u00e9velopp\u00e9e et maintenue sur GitHub sous le nom de <strong>oobabooga\/text-generation-webui<\/strong>, elle s\u2019ex\u00e9cute dans votre navigateur \u00e0 l\u2019adresse <code>http:\/\/localhost:7860<\/code>, supports a wide range of model formats through swappable inference backends, and exposes an OpenAI-compatible REST API. It is the most feature-complete local LLM frontend available, at the cost of a steeper setup curve than desktop apps like LM Studio.<\/p>\n<div id=\"ez-toc-container\" class=\"ez-toc-v2_0_86 counter-flat ez-toc-counter ez-toc-container-direction\">\n<label for=\"ez-toc-cssicon-toggle-item-6a7d144054fca\" class=\"ez-toc-cssicon-toggle-label\"><span class=\"\"><span class=\"eztoc-hide\" style=\"display:none;\">Basculer<\/span><span class=\"ez-toc-icon-toggle-span\"><svg style=\"fill: #000000;color:#000000\" xmlns=\"http:\/\/www.w3.org\/2000\/svg\" class=\"list-377408\" width=\"20px\" height=\"20px\" viewbox=\"0 0 24 24\" fill=\"none\"><path d=\"M6 6H4v2h2V6zm14 0H8v2h12V6zM4 11h2v2H4v-2zm16 0H8v2h12v-2zM4 16h2v2H4v-2zm16 0H8v2h12v-2z\" fill=\"currentColor\"><\/path><\/svg><svg style=\"fill: #000000;color:#000000\" class=\"arrow-unsorted-368013\" xmlns=\"http:\/\/www.w3.org\/2000\/svg\" width=\"10px\" height=\"10px\" viewbox=\"0 0 24 24\" version=\"1.2\" baseprofile=\"tiny\"><path d=\"M18.2 9.3l-6.2-6.3-6.2 6.3c-.2.2-.3.4-.3.7s.1.5.3.7c.2.2.4.3.7.3h11c.3 0 .5-.1.7-.3.2-.2.3-.5.3-.7s-.1-.5-.3-.7zM5.8 14.7l6.2 6.3 6.2-6.3c.2-.2.3-.5.3-.7s-.1-.5-.3-.7c-.2-.2-.4-.3-.7-.3h-11c-.3 0-.5.1-.7.3-.2.2-.3.5-.3.7s.1.5.3.7z\"\/><\/svg><\/span><\/span><\/label><input type=\"checkbox\"  id=\"ez-toc-cssicon-toggle-item-6a7d144054fca\"  aria-label=\"Basculer\" \/><nav><ul class='ez-toc-list ez-toc-list-level-1' ><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-1\" href=\"https:\/\/convly.ai\/fr\/text-generation-webui-guide\/#What_text-generation-webui_Is_and_Why_People_Call_It_Oobabooga\" >Installation de text-generation-webui<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-2\" href=\"https:\/\/convly.ai\/fr\/text-generation-webui-guide\/#Installing_text-generation-webui\" >Chargeurs de mod\u00e8les : lequel choisir<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-3\" href=\"https:\/\/convly.ai\/fr\/text-generation-webui-guide\/#Model_Loaders_Which_One_to_Use\" >Chargement pas \u00e0 pas d\u2019un mod\u00e8le GGUF<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-4\" href=\"https:\/\/convly.ai\/fr\/text-generation-webui-guide\/#Loading_a_GGUF_Model_Step_by_Step\" >L\u2019extension API compatible OpenAI<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-5\" href=\"https:\/\/convly.ai\/fr\/text-generation-webui-guide\/#The_OpenAI-Compatible_API_Extension\" >text-generation-webui vs LM Studio vs Jan<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-6\" href=\"https:\/\/convly.ai\/fr\/text-generation-webui-guide\/#text-generation-webui_vs_LM_Studio_vs_Jan\" >Le nom d\u2019utilisateur GitHub du projet est<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-7\" href=\"https:\/\/convly.ai\/fr\/text-generation-webui-guide\/#Frequently_Asked_Questions\" >Questions fr\u00e9quemment pos\u00e9es<\/a><\/li><\/ul><\/nav><\/div>\n<h2><span class=\"ez-toc-section\" id=\"What_text-generation-webui_Is_and_Why_People_Call_It_Oobabooga\"><\/span>Installation de text-generation-webui<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>, qui est devenu le terme usuel utilis\u00e9 par la communaut\u00e9 pour d\u00e9signer l\u2019outil lui-m\u00eame. Les deux d\u00e9nominations renvoient au m\u00eame projet h\u00e9berg\u00e9 \u00e0 l\u2019adresse <em>oobabooga<\/em>github.com\/oobabooga\/text-generation-webui <a href=\"https:\/\/github.com\/oobabooga\/text-generation-webui\" rel=\"noopener noreferrer\" target=\"_blank\">L\u2019interface repose sur Gradio et fonctionne enti\u00e8rement sur votre machine locale \u2014 aucune donn\u00e9e ne quitte votre syst\u00e8me. Au-del\u00e0 de la discussion basique, elle prend en charge :<\/a>.<\/p>\n<p>Trois modes d\u2019entr\u00e9e : Discussion (mode instruction), Discussion (mode r\u00f4le avec cartes de personnages) et Carnet (g\u00e9n\u00e9ration brute de texte)<\/p>\n<ul>\n<li>Chargement de LoRA pour appliquer des poids adaptatifs affin\u00e9s par-dessus un mod\u00e8le de base<\/li>\n<li>Un syst\u00e8me d\u2019extensions avec des plugins communautaires pour la synth\u00e8se de r\u00e9sum\u00e9s, la synth\u00e8se vocale, la g\u00e9n\u00e9ration de l\u00e9gendes d\u2019images, etc.<\/li>\n<li>Un point de terminaison API compatible OpenAI permettant de connecter des clients tiers et des scripts d\u2019automatisation<\/li>\n<li>Avant de choisir un mod\u00e8le, utilisez le<\/li>\n<\/ul>\n<p>pour v\u00e9rifier que votre GPU peut l\u2019accueillir \u2014 les exigences varient fortement selon la taille du mod\u00e8le et son niveau de quantification. <a href=\"https:\/\/convly.ai\/fr\/llm-vram-calculator\/\">Calculateur de VRAM<\/a> La m\u00e9thode recommand\u00e9e sur toutes les plateformes est l\u2019installateur \u00e0 un clic. Celui-ci cr\u00e9e un environnement Conda isol\u00e9 et installe automatiquement toutes les d\u00e9pendances Python. N\u2019installez pas le logiciel dans votre environnement Python syst\u00e8me, sauf si vous avez une raison sp\u00e9cifique de le faire.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Installing_text-generation-webui\"><\/span>Chargeurs de mod\u00e8les : lequel choisir<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Clonez le d\u00e9p\u00f4t ou t\u00e9l\u00e9chargez une archive ZIP depuis la page GitHub :<\/p>\n<h3>Windows<\/h3>\n<ol>\n<li>git clone https:\/\/github.com\/oobabooga\/text-generation-webui<br \/><code>dans le dossier clon\u00e9.<\/code><\/li>\n<li>Double-cliquez sur <code>start_windows.bat<\/code> Le script d\u00e9tecte automatiquement le type de votre GPU (NVIDIA, AMD ou processeur uniquement) et installe les d\u00e9pendances correspondantes \u2014 s\u00e9lectionnez l\u2019option appropri\u00e9e lorsque vous y \u00eates invit\u00e9.<\/li>\n<li>Une fois l\u2019installation termin\u00e9e, le serveur d\u00e9marre automatiquement. Ouvrez<\/li>\n<li>dans votre navigateur. <code>http:\/\/localhost:7860<\/code> Pour les ex\u00e9cutions ult\u00e9rieures, double-cliquez simplement \u00e0 nouveau sur<\/li>\n<\/ol>\n<p>. L\u2019environnement Conda est d\u00e9j\u00e0 configur\u00e9 ; le d\u00e9marrage ne prend que quelques secondes. <code>start_windows.bat<\/code> Clonez le d\u00e9p\u00f4t et entrez dans le r\u00e9pertoire :<\/p>\n<h3>Linux<\/h3>\n<ol>\n<li>git clone https:\/\/github.com\/oobabooga\/text-generation-webui\ncd text-generation-webui\n<pre><code>Rendez le script ex\u00e9cutable puis lancez-le :<\/code><\/pre>\n<\/li>\n<li>chmod +x start_linux.sh\n.\/start_linux.sh\n<pre><code>S\u00e9lectionnez votre type de GPU lors de l\u2019invite : NVIDIA, AMD, processeur uniquement ou puce Apple Silicon (non applicable sous Linux, bien que l\u2019invite apparaisse tout de m\u00eame).<\/code><\/pre>\n<\/li>\n<li>Acc\u00e9dez \u00e0 l\u2019interface utilisateur \u00e0 l\u2019adresse<\/li>\n<li>d\u00e8s que le serveur est op\u00e9rationnel. <code>http:\/\/localhost:7860<\/code> Clonez le d\u00e9p\u00f4t puis ex\u00e9cutez le script de d\u00e9marrage :<\/li>\n<\/ol>\n<h3>macOS<\/h3>\n<ol>\n<li>git clone https:\/\/github.com\/oobabooga\/text-generation-webui\ncd text-generation-webui\n.\/start_macos.sh\n<pre><code>S\u00e9lectionnez l\u2019option D (puce Apple Silicon \/ Metal) ou C (processeur uniquement) lorsque vous y \u00eates invit\u00e9.<\/code><\/pre>\n<\/li>\n<li>Sur les puces M-series, le moteur d\u2019inf\u00e9rence llama.cpp exploite Metal pour l\u2019acc\u00e9l\u00e9ration GPU \u2014 aucune installation de CUDA n\u2019est n\u00e9cessaire.<\/li>\n<li>Les utilisateurs macOS sont limit\u00e9s aux chargeurs llama.cpp et Transformers. ExLlamaV2 n\u00e9cessite CUDA et n\u2019est pas compatible avec les puces Apple Silicon.<\/li>\n<\/ol>\n<p>text-generation-webui s\u00e9pare clairement le moteur d\u2019inf\u00e9rence de l\u2019interface utilisateur. Vous choisissez un chargeur par mod\u00e8le depuis l\u2019onglet<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Model_Loaders_Which_One_to_Use\"><\/span>Chargement pas \u00e0 pas d\u2019un mod\u00e8le GGUF<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>. Chaque chargeur accepte des formats de fichiers sp\u00e9cifiques et impose des exigences mat\u00e9rielles diff\u00e9rentes. <strong>Mod\u00e8le<\/strong> Chargeur<\/p>\n<table>\n<thead>\n<tr>\n<th>Format<\/th>\n<th>Format<\/th>\n<th>Mat\u00e9riel<\/th>\n<th>Quand utiliser<\/th>\n<\/tr>\n<\/thead>\n<tbody>\n<tr>\n<td>llama.cpp<\/td>\n<td>GGUF<\/td>\n<td>NVIDIA, AMD, Apple Silicon, CPU<\/td>\n<td>Par d\u00e9faut pour les fichiers GGUF ; le format le plus portable entre plates-formes<\/td>\n<\/tr>\n<tr>\n<td>ExLlamaV2<\/td>\n<td>EXL2, GPTQ<\/td>\n<td>Uniquement pour NVIDIA CUDA<\/td>\n<td>D\u00e9bit maximal sur NVIDIA ; privil\u00e9gi\u00e9 par rapport \u00e0 AutoGPTQ pour les mod\u00e8les r\u00e9cents<\/td>\n<\/tr>\n<tr>\n<td>Transformers<\/td>\n<td>HuggingFace (fp16, bf16, int8, int4)<\/td>\n<td>NVIDIA, CPU<\/td>\n<td>Mod\u00e8les HuggingFace dans leur format d\u2019origine ; plus lents mais offrant la compatibilit\u00e9 la plus large<\/td>\n<\/tr>\n<tr>\n<td>AutoAWQ<\/td>\n<td>AWQ<\/td>\n<td>NVIDIA CUDA<\/td>\n<td>Mod\u00e8les quantifi\u00e9s AWQ<\/td>\n<\/tr>\n<tr>\n<td>AutoGPTQ<\/td>\n<td>GPTQ<\/td>\n<td>NVIDIA CUDA<\/td>\n<td>Anciens mod\u00e8les GPTQ ; ExLlamaV2 est plus rapide pour le m\u00eame format<\/td>\n<\/tr>\n<\/tbody>\n<\/table>\n<p><strong>Choix pratique par d\u00e9faut :<\/strong> Si vous avez t\u00e9l\u00e9charg\u00e9 un fichier <code>.gguf<\/code> (le format le plus courant sur les pages de mod\u00e8les HuggingFace), utilisez <strong>llama.cpp<\/strong>. Si vous disposez d\u2019un GPU NVIDIA et souhaitez une vitesse maximale de g\u00e9n\u00e9ration, recherchez une variante EXL2 du m\u00eame mod\u00e8le et utilisez <strong>ExLlamaV2<\/strong>.<\/p>\n<p>Pour conna\u00eetre les mod\u00e8les compatibles avec chaque GPU, consultez <a href=\"https:\/\/convly.ai\/fr\/vram-requirements-every-major-llm-2026\/\">Exigences en VRAM des principaux mod\u00e8les de langage<\/a>.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Loading_a_GGUF_Model_Step_by_Step\"><\/span>L\u2019extension API compatible OpenAI<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<ol>\n<li><strong>Copiez le fichier<\/strong> dans le dossier <code>text-generation-webui\/models\/<\/code>. Les fichiers GGUF monoblocs (ex. : <code>mistral-7b-instruct.Q4_K_M.gguf<\/code>) sont plac\u00e9s directement dans ce dossier. Les fichiers d\u00e9coup\u00e9s en plusieurs parties doivent \u00eatre plac\u00e9s dans un sous-dossier nomm\u00e9.<\/li>\n<li><strong>Ouvrez l\u2019onglet Mod\u00e8le<\/strong> vers <code>http:\/\/localhost:7860<\/code>.<\/li>\n<li>S\u00e9lectionnez votre fichier dans la liste d\u00e9roulante (cliquez sur l\u2019ic\u00f4ne Actualiser si celui-ci n\u2019appara\u00eet pas).<\/li>\n<li>D\u00e9finissez <strong>Format<\/strong> sur <code>llama.cpp<\/code>.<\/li>\n<li>D\u00e9finissez <strong>n-gpu-layers<\/strong> pour contr\u00f4ler le d\u00e9chargement vers le GPU. Saisissez une valeur \u00e9lev\u00e9e (p. ex., <code>999<\/code>) afin de transf\u00e9rer autant de couches que possible dans la VRAM ; saisissez <code>0<\/code> pour une inf\u00e9rence exclusivement sur CPU.<\/li>\n<li>Cliquez <strong>Chargez<\/strong>. Un message de confirmation appara\u00eet dans la zone d\u2019\u00e9tat d\u00e8s que le mod\u00e8le est pr\u00eat.<\/li>\n<\/ol>\n<p>Passez \u00e0 l\u2019onglet <strong>Discussion<\/strong> pour entamer une conversation, ou \u00e0 l\u2019onglet <strong>Par d\u00e9faut<\/strong> G\u00e9n\u00e9ration brute <strong>Mod\u00e8le d\u2019instruction<\/strong> dans l\u2019onglet Param\u00e8tres.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"The_OpenAI-Compatible_API_Extension\"><\/span>text-generation-webui vs LM Studio vs Jan<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>L\u2019extension int\u00e9gr\u00e9e <code>openai<\/code> expose des points de terminaison REST conformes aux formats des API OpenAI Chat Completions et Completions. Tout client acceptant une URL de base personnalis\u00e9e \u2014 LangChain, Open WebUI, Continue.dev ou un simple script <code>curl<\/code> \u2014 peut se connecter \u00e0 votre mod\u00e8le local sans modification du code.<\/p>\n<p>Activez-la en passant un indicateur au d\u00e9marrage :<\/p>\n<pre><code># Linux \/ macOS\n.\/start_linux.sh --extensions openai\n\n# ou lancez directement server.py depuis l\u2019environnement Conda\npython server.py --extensions openai<\/code><\/pre>\n<p>Vous pouvez \u00e9galement l\u2019activer depuis l\u2019onglet <strong>Session<\/strong> de l\u2019interface utilisateur, puis cliquez sur <strong>Appliquer les indicateurs \/ Red\u00e9marrer<\/strong>.<\/p>\n<p>Par d\u00e9faut, l\u2019API \u00e9coute sur le port 5000, distinct de l\u2019interface Gradio qui utilise le port 7860. Configurez votre client pour qu\u2019il pointe vers :<\/p>\n<pre><code>base_url = \"http:\/\/localhost:5000\/v1\"\napi_key  = \"n'importe quelle valeur\"  # requis par la plupart des clients, mais non valid\u00e9 localement<\/code><\/pre>\n<p>Les points de terminaison pris en charge incluent <code>\/v1\/chat\/completions<\/code>, <code>\/v1\/completions<\/code>, et <code>\/v1\/models<\/code>. Le port est configurable via l\u2019indicateur de d\u00e9marrage <code>--api-port<\/code> .<\/p>\n<h2><span class=\"ez-toc-section\" id=\"text-generation-webui_vs_LM_Studio_vs_Jan\"><\/span>Le nom d\u2019utilisateur GitHub du projet est<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Ces trois outils ex\u00e9cutent les mod\u00e8les localement, sans d\u00e9pendance vis-\u00e0-vis du cloud. Ils ciblent des utilisateurs et des cas d\u2019usage diff\u00e9rents.<\/p>\n<table>\n<thead>\n<tr>\n<th><\/th>\n<th>text-generation-webui<\/th>\n<th>LM Studio<\/th>\n<th>Jan<\/th>\n<\/tr>\n<\/thead>\n<tbody>\n<tr>\n<td>Interface<\/td>\n<td>Navigateur (Gradio)<\/td>\n<td>Application native pour bureau<\/td>\n<td>Application native pour bureau<\/td>\n<\/tr>\n<tr>\n<td>Complexit\u00e9 de configuration<\/td>\n<td>Moyen (script \u00e0 un clic)<\/td>\n<td>Faible (installeur graphique)<\/td>\n<td>Faible (installeur graphique)<\/td>\n<\/tr>\n<tr>\n<td>Formats de mod\u00e8les<\/td>\n<td>GGUF, EXL2, GPTQ, AWQ, HF fp16<\/td>\n<td>Principalement GGUF<\/td>\n<td>Principalement GGUF<\/td>\n<\/tr>\n<tr>\n<td>Navigateur int\u00e9gr\u00e9 de mod\u00e8les<\/td>\n<td>Non<\/td>\n<td>Oui<\/td>\n<td>Oui<\/td>\n<\/tr>\n<tr>\n<td>API compatible OpenAI<\/td>\n<td>Oui (extension)<\/td>\n<td>Oui (int\u00e9gr\u00e9)<\/td>\n<td>Oui (int\u00e9gr\u00e9)<\/td>\n<\/tr>\n<tr>\n<td>Syst\u00e8me d\u2019extensions \/ plugins<\/td>\n<td>Oui<\/td>\n<td>Limit\u00e9<\/td>\n<td>Limit\u00e9<\/td>\n<\/tr>\n<tr>\n<td>Puces Apple Silicon (Metal)<\/td>\n<td>Oui (llama.cpp)<\/td>\n<td>Oui<\/td>\n<td>Oui<\/td>\n<\/tr>\n<tr>\n<td>Id\u00e9al pour<\/td>\n<td>Utilisateurs avanc\u00e9s, automatisation, recherche<\/td>\n<td>D\u00e9butants, usage quotidien en discussion<\/td>\n<td>Utilisateurs orient\u00e9s open source<\/td>\n<\/tr>\n<\/tbody>\n<\/table>\n<p><strong>Choisissez text-generation-webui<\/strong> lorsque vous avez besoin de plusieurs moteurs de chargement, des performances EXL2 sur NVIDIA, du chargement de LoRA, de l\u2019\u00e9cosyst\u00e8me d\u2019extensions ou d\u2019un acc\u00e8s script\u00e9 \u00e0 l\u2019API pour l\u2019automatisation et les flux de d\u00e9veloppement.<\/p>\n<p><strong>Choisissez LM Studio ou Jan<\/strong> lorsque vous souhaitez un installeur soign\u00e9, une recherche int\u00e9gr\u00e9e de mod\u00e8les avec t\u00e9l\u00e9chargement en un clic et une configuration minimale. Consultez le <a href=\"https:\/\/convly.ai\/fr\/lm-studio-complete-guide-2026\/\">Guide complet de LM Studio<\/a> pour un guide d\u00e9taill\u00e9 de cette option.<\/p>\n<p>Si vous h\u00e9sitez \u00e0 savoir si l\u2019inf\u00e9rence locale justifie r\u00e9ellement le co\u00fbt mat\u00e9riel, le <a href=\"https:\/\/convly.ai\/fr\/self-hosting-vs-api-calculator\/\">Calculateur de seuil de rentabilit\u00e9 entre h\u00e9bergement local et utilisation d\u2019une API<\/a> permet de quantifier le compromis par rapport au paiement d\u2019un acc\u00e8s via une API, selon votre volume d\u2019utilisation.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Frequently_Asked_Questions\"><\/span>Questions fr\u00e9quemment pos\u00e9es<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<h3>Pourquoi l\u2019installeur \u00e0 un clic prend-il autant de temps la premi\u00e8re fois ?<\/h3>\n<p>Il t\u00e9l\u00e9charge Miniconda et construit, \u00e0 partir de z\u00e9ro, un environnement Python isol\u00e9 comprenant PyTorch et toutes les biblioth\u00e8ques de chargement de mod\u00e8les. Sur une connexion rapide, cela prend g\u00e9n\u00e9ralement entre 5 et 15 minutes. Les lancements ult\u00e9rieurs ignorent cette \u00e9tape et d\u00e9marrent en quelques secondes.<\/p>\n<h3>Puis-je ex\u00e9cuter text-generation-webui sans GPU ?<\/h3>\n<p>Oui. S\u00e9lectionnez l\u2019option \u00ab uniquement CPU \u00bb lors de l\u2019installation, puis d\u00e9finissez <code>n-gpu-layers<\/code> sur <code>0<\/code> lors du chargement d\u2019un mod\u00e8le GGUF. Un mod\u00e8le de 7 milliards de param\u00e8tres peut produire 2 \u00e0 5 jetons par seconde sur un processeur de bureau moderne \u2014 suffisant pour des tests, mais trop lent pour une conversation fluide. Des quantifications plus l\u00e9g\u00e8res (Q4 et inf\u00e9rieures) am\u00e9liorent le d\u00e9bit. Consultez <a href=\"https:\/\/convly.ai\/fr\/best-gpus-for-local-llms-2026\/\">meilleures GPU pour les LLM locaux<\/a> si vous envisagez une mise \u00e0 niveau mat\u00e9rielle.<\/p>\n<h3>Comment mettre \u00e0 jour text-generation-webui ?<\/h3>\n<p>Ex\u00e9cuter <code>git pull<\/code> dans le r\u00e9pertoire du d\u00e9p\u00f4t pour r\u00e9cup\u00e9rer le code le plus r\u00e9cent, puis relancez le script de d\u00e9marrage. Ce dernier d\u00e9tecte automatiquement les modifications de l\u2019environnement et met \u00e0 jour les d\u00e9pendances. Vous pouvez \u00e9galement ex\u00e9cuter manuellement <code>pip install -r requirements.txt<\/code> dans l\u2019environnement Conda actif si vous pr\u00e9f\u00e9rez une mise \u00e0 jour cibl\u00e9e.<\/p>\n<h3>Quelle est la diff\u00e9rence entre GGUF et EXL2 ?<\/h3>\n<p>Ces deux formats sont quantifi\u00e9s afin de r\u00e9duire la taille des fichiers de mod\u00e8les et leurs besoins en VRAM. GGUF (via llama.cpp) fonctionne sur les GPU NVIDIA, AMD et les puces Apple Silicon : il s\u2019agit donc d\u2019un choix plus portable, avec la plus large disponibilit\u00e9 de mod\u00e8les. EXL2 (via ExLlamaV2) est r\u00e9serv\u00e9 aux GPU NVIDIA, mais g\u00e9n\u00e8re g\u00e9n\u00e9ralement des jetons plus rapidement \u00e0 qualit\u00e9 \u00e9quivalente. Si vous disposez d\u2019un GPU NVIDIA et que la vitesse est votre priorit\u00e9, EXL2 m\u00e9rite d\u2019\u00eatre privil\u00e9gi\u00e9.<\/p>\n<h3>O\u00f9 sont enregistr\u00e9s les journaux de conversation ?<\/h3>\n<p>Les journaux sont stock\u00e9s dans le dossier <code>text-generation-webui\/logs\/<\/code>. Chaque conversation est sauvegard\u00e9e sous forme de fichier JSON. Vous pouvez \u00e9galement l\u2019exporter directement depuis l\u2019interface de l\u2019onglet \u00ab Chat \u00bb, \u00e0 l\u2019aide du bouton de t\u00e9l\u00e9chargement situ\u00e9 sous la fen\u00eatre de discussion.<\/p>\n<h3>Plusieurs utilisateurs peuvent-ils se connecter \u00e0 une m\u00eame instance ?<\/h3>\n<p>Le <code>--listen<\/code> Le drapeau de d\u00e9marrage rend le serveur accessible sur votre r\u00e9seau local plut\u00f4t que sur localhost uniquement. Toutefois, text-generation-webui n\u2019est pas con\u00e7u pour des d\u00e9ploiements de production multi-utilisateurs : il ne comporte aucune authentification int\u00e9gr\u00e9e et l\u2019interface Gradio est mono-session. L\u2019extension API OpenAI g\u00e8re mieux les requ\u00eates API simultan\u00e9es que l\u2019interface web dans les sc\u00e9narios multi-clients, mais vous devriez ajouter un proxy inverse avec authentification devant celle-ci si vous l\u2019exposez au-del\u00e0 de localhost.<\/p>","protected":false},"excerpt":{"rendered":"<p>text-generation-webui (widely called oobabooga after its GitHub author) is a free, open-source, browser-based interface for running LLMs locally on your [&hellip;]<\/p>\n","protected":false},"author":1,"featured_media":2183,"comment_status":"closed","ping_status":"closed","sticky":false,"template":"","format":"standard","meta":{"site-sidebar-layout":"default","site-content-layout":"","ast-site-content-layout":"default","site-content-style":"default","site-sidebar-style":"default","ast-global-header-display":"","ast-banner-title-visibility":"","ast-main-header-display":"","ast-hfb-above-header-display":"","ast-hfb-below-header-display":"","ast-hfb-mobile-header-display":"","site-post-title":"","ast-breadcrumbs-content":"","ast-featured-img":"","footer-sml-layout":"","ast-disable-related-posts":"","theme-transparent-header-meta":"","adv-header-id-meta":"","stick-header-meta":"","header-above-stick-meta":"","header-main-stick-meta":"","header-below-stick-meta":"","astra-migrate-meta-layouts":"default","ast-page-background-enabled":"default","ast-page-background-meta":{"desktop":{"background-color":"var(--ast-global-color-5)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"tablet":{"background-color":"","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"mobile":{"background-color":"","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""}},"ast-content-background-meta":{"desktop":{"background-color":"var(--ast-global-color-4)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"tablet":{"background-color":"var(--ast-global-color-4)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"mobile":{"background-color":"var(--ast-global-color-4)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""}},"footnotes":""},"categories":[7],"tags":[],"class_list":["post-2182","post","type-post","status-publish","format-standard","has-post-thumbnail","hentry","category-ai-news"],"_links":{"self":[{"href":"https:\/\/convly.ai\/fr\/wp-json\/wp\/v2\/posts\/2182","targetHints":{"allow":["GET"]}}],"collection":[{"href":"https:\/\/convly.ai\/fr\/wp-json\/wp\/v2\/posts"}],"about":[{"href":"https:\/\/convly.ai\/fr\/wp-json\/wp\/v2\/types\/post"}],"author":[{"embeddable":true,"href":"https:\/\/convly.ai\/fr\/wp-json\/wp\/v2\/users\/1"}],"replies":[{"embeddable":true,"href":"https:\/\/convly.ai\/fr\/wp-json\/wp\/v2\/comments?post=2182"}],"version-history":[{"count":1,"href":"https:\/\/convly.ai\/fr\/wp-json\/wp\/v2\/posts\/2182\/revisions"}],"predecessor-version":[{"id":2184,"href":"https:\/\/convly.ai\/fr\/wp-json\/wp\/v2\/posts\/2182\/revisions\/2184"}],"wp:featuredmedia":[{"embeddable":true,"href":"https:\/\/convly.ai\/fr\/wp-json\/wp\/v2\/media\/2183"}],"wp:attachment":[{"href":"https:\/\/convly.ai\/fr\/wp-json\/wp\/v2\/media?parent=2182"}],"wp:term":[{"taxonomy":"category","embeddable":true,"href":"https:\/\/convly.ai\/fr\/wp-json\/wp\/v2\/categories?post=2182"},{"taxonomy":"post_tag","embeddable":true,"href":"https:\/\/convly.ai\/fr\/wp-json\/wp\/v2\/tags?post=2182"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}