{"id":2182,"date":"2026-08-12T20:06:35","date_gmt":"2026-08-12T20:06:35","guid":{"rendered":"https:\/\/convly.ai\/?p=2182"},"modified":"2026-08-12T20:06:35","modified_gmt":"2026-08-12T20:06:35","slug":"text-generation-webui-guide","status":"publish","type":"post","link":"https:\/\/convly.ai\/de\/text-generation-webui-guide\/","title":{"rendered":"Text-Generierungs-Webinterface (Oobabooga): Installations-, Lade- und Anwendungsanleitung"},"content":{"rendered":"<div class=\"convly-tldr\">\n<ul>\n<li>text-generation-webui (weit verbreitet als <em>oobabooga<\/em> benannt nach seinem GitHub-Autor) ist eine kostenlose, quelloffene, browserbasierte Schnittstelle zum lokalen Ausf\u00fchren von Sprachmodellen (LLMs) auf Ihrer eigenen Hardware.<\/li>\n<li>Installation \u00fcber Ein-Klick-Skripte \u2013 <code>start_windows.bat<\/code>, <code>start_linux.sh<\/code>, oder <code>start_macos.sh<\/code> \u2013 keine manuelle Einrichtung einer Python-Umgebung erforderlich.<\/li>\n<li>Unterst\u00fctzt mehrere Backends: llama.cpp f\u00fcr GGUF-Dateien, ExLlamaV2 f\u00fcr EXL2\/GPTQ auf NVIDIA-GPUs sowie Transformers f\u00fcr Hugging-Face-Modelle.<\/li>\n<li>Enth\u00e4lt eine OpenAI-kompatible API-Erweiterung (<code>--extensions openai<\/code>) \u2013 so k\u00f6nnen andere Anwendungen ohne Codeanpassungen mit Ihrem lokalen Modell kommunizieren.<\/li>\n<\/ul>\n<\/div>\n<p>text-generation-webui ist eine quelloffene, selbstgehostete Web-Oberfl\u00e4che zum lokalen Ausf\u00fchren gro\u00dfer Sprachmodelle. Auf GitHub unter dem Namen <strong>oobabooga\/text-generation-webui<\/strong>gepflegt, l\u00e4uft sie in Ihrem Browser unter <code>http:\/\/localhost:7860<\/code>, supports a wide range of model formats through swappable inference backends, and exposes an OpenAI-compatible REST API. It is the most feature-complete local LLM frontend available, at the cost of a steeper setup curve than desktop apps like LM Studio.<\/p>\n<div id=\"ez-toc-container\" class=\"ez-toc-v2_0_86 counter-flat ez-toc-counter ez-toc-container-direction\">\n<label for=\"ez-toc-cssicon-toggle-item-6a7d18d8964dc\" class=\"ez-toc-cssicon-toggle-label\"><span class=\"\"><span class=\"eztoc-hide\" style=\"display:none;\">Umschalten<\/span><span class=\"ez-toc-icon-toggle-span\"><svg style=\"fill: #000000;color:#000000\" xmlns=\"http:\/\/www.w3.org\/2000\/svg\" class=\"list-377408\" width=\"20px\" height=\"20px\" viewbox=\"0 0 24 24\" fill=\"none\"><path d=\"M6 6H4v2h2V6zm14 0H8v2h12V6zM4 11h2v2H4v-2zm16 0H8v2h12v-2zM4 16h2v2H4v-2zm16 0H8v2h12v-2z\" fill=\"currentColor\"><\/path><\/svg><svg style=\"fill: #000000;color:#000000\" class=\"arrow-unsorted-368013\" xmlns=\"http:\/\/www.w3.org\/2000\/svg\" width=\"10px\" height=\"10px\" viewbox=\"0 0 24 24\" version=\"1.2\" baseprofile=\"tiny\"><path d=\"M18.2 9.3l-6.2-6.3-6.2 6.3c-.2.2-.3.4-.3.7s.1.5.3.7c.2.2.4.3.7.3h11c.3 0 .5-.1.7-.3.2-.2.3-.5.3-.7s-.1-.5-.3-.7zM5.8 14.7l6.2 6.3 6.2-6.3c.2-.2.3-.5.3-.7s-.1-.5-.3-.7c-.2-.2-.4-.3-.7-.3h-11c-.3 0-.5.1-.7.3-.2.2-.3.5-.3.7s.1.5.3.7z\"\/><\/svg><\/span><\/span><\/label><input type=\"checkbox\"  id=\"ez-toc-cssicon-toggle-item-6a7d18d8964dc\"  aria-label=\"Umschalten\" \/><nav><ul class='ez-toc-list ez-toc-list-level-1' ><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-1\" href=\"https:\/\/convly.ai\/de\/text-generation-webui-guide\/#What_text-generation-webui_Is_and_Why_People_Call_It_Oobabooga\" >Was text-generation-webui ist (und warum es oft einfach \u201aOobabooga\u2018 genannt wird)<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-2\" href=\"https:\/\/convly.ai\/de\/text-generation-webui-guide\/#Installing_text-generation-webui\" >Installation von text-generation-webui<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-3\" href=\"https:\/\/convly.ai\/de\/text-generation-webui-guide\/#Model_Loaders_Which_One_to_Use\" >Modell-Loader: Welchen soll ich verwenden?<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-4\" href=\"https:\/\/convly.ai\/de\/text-generation-webui-guide\/#Loading_a_GGUF_Model_Step_by_Step\" >Schritt-f\u00fcr-Schritt-Anleitung zum Laden eines GGUF-Modells<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-5\" href=\"https:\/\/convly.ai\/de\/text-generation-webui-guide\/#The_OpenAI-Compatible_API_Extension\" >Die OpenAI-kompatible API-Erweiterung<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-6\" href=\"https:\/\/convly.ai\/de\/text-generation-webui-guide\/#text-generation-webui_vs_LM_Studio_vs_Jan\" >text-generation-webui im Vergleich zu LM Studio und Jan<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-7\" href=\"https:\/\/convly.ai\/de\/text-generation-webui-guide\/#Frequently_Asked_Questions\" >H\u00e4ufig gestellte Fragen<\/a><\/li><\/ul><\/nav><\/div>\n<h2><span class=\"ez-toc-section\" id=\"What_text-generation-webui_Is_and_Why_People_Call_It_Oobabooga\"><\/span>Was text-generation-webui ist (und warum es oft einfach \u201aOobabooga\u2018 genannt wird)<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Der GitHub-Benutzername des Projekts lautet <em>oobabooga<\/em>, der sich mittlerweile als g\u00e4ngige Kurzbezeichnung f\u00fcr das Tool etabliert hat. Beide Namen beziehen sich auf dasselbe Projekt unter <a href=\"https:\/\/github.com\/oobabooga\/text-generation-webui\" rel=\"noopener noreferrer\" target=\"_blank\">github.com\/oobabooga\/text-generation-webui<\/a>.<\/p>\n<p>Die Oberfl\u00e4che basiert auf Gradio und l\u00e4uft vollst\u00e4ndig lokal auf Ihrem Rechner \u2013 Ihre Daten verlassen niemals Ihr System. Neben der grundlegenden Chat-Funktion bietet sie Folgendes:<\/p>\n<ul>\n<li>Drei Eingabemodi: Chat (Instruct), Chat (Roleplay mit Charakterkarten) und Notebook (reine Texterg\u00e4nzung)<\/li>\n<li>Laden von LoRA-Adaptern zur Anwendung feinjustierter Gewichte auf einem Basis-Modell<\/li>\n<li>Ein Erweiterungssystem mit Community-Plugins f\u00fcr Zusammenfassungen, Sprachsynthese, Bildunterschriften und vieles mehr<\/li>\n<li>Einen OpenAI-kompatiblen API-Endpunkt zum Verbinden externer Clients und Automatisierungsskripte<\/li>\n<\/ul>\n<p>Bevor Sie ein Modell ausw\u00e4hlen, nutzen Sie bitte den <a href=\"https:\/\/convly.ai\/de\/llm-vram-calculator\/\">VRAM-Rechner<\/a> , um sicherzustellen, dass Ihr GPU-Speicher ausreicht \u2013 die Anforderungen variieren stark je nach Modellgr\u00f6\u00dfe und Quantisierungsstufe.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Installing_text-generation-webui\"><\/span>Installation von text-generation-webui<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Der empfohlene Installationsweg auf allen Plattformen ist das Ein-Klick-Installations-Skript. Es erstellt eine isolierte Conda-Umgebung und installiert automatisch s\u00e4mtliche Python-Abh\u00e4ngigkeiten. Installieren Sie nicht in Ihre System-Python-Umgebung, es sei denn, Sie haben einen speziellen Grund daf\u00fcr.<\/p>\n<h3>Windows<\/h3>\n<ol>\n<li>Klonen Sie das Repository oder laden Sie ein Release-ZIP von der GitHub-Seite herunter:<br \/><code>git clone https:\/\/github.com\/oobabooga\/text-generation-webui<\/code><\/li>\n<li>Doppelklicken Sie auf <code>start_windows.bat<\/code> im geklonten Ordner aus.<\/li>\n<li>Das Skript erkennt Ihren GPU-Typ (NVIDIA, AMD oder CPU-only) und installiert passende Abh\u00e4ngigkeiten \u2013 w\u00e4hlen Sie bei der Aufforderung die entsprechende Option.<\/li>\n<li>Nach Abschluss der Installation startet der Server automatisch. \u00d6ffnen Sie <code>http:\/\/localhost:7860<\/code> in Ihrem Browser.<\/li>\n<\/ol>\n<p>Bei zuk\u00fcnftigen Starts klicken Sie einfach erneut doppelt auf <code>start_windows.bat<\/code> . Die Conda-Umgebung ist bereits eingerichtet; der Start dauert nur wenige Sekunden.<\/p>\n<h3>Linux<\/h3>\n<ol>\n<li>Klonen Sie das Repository und wechseln Sie in das Verzeichnis:\n<pre><code>git clone https:\/\/github.com\/oobabooga\/text-generation-webui\ncd text-generation-webui<\/code><\/pre>\n<\/li>\n<li>Machen Sie das Skript ausf\u00fchrbar und f\u00fchren Sie es aus:\n<pre><code>chmod +x start_linux.sh\n.\/start_linux.sh<\/code><\/pre>\n<\/li>\n<li>W\u00e4hlen Sie bei der Aufforderung Ihren GPU-Typ: NVIDIA, AMD, CPU-only oder Apple Silicon (auf Linux nicht anwendbar, erscheint aber trotzdem in der Abfrage).<\/li>\n<li>Rufen Sie die Benutzeroberfl\u00e4che unter <code>http:\/\/localhost:7860<\/code> auf, sobald der Server l\u00e4uft.<\/li>\n<\/ol>\n<h3>macOS<\/h3>\n<ol>\n<li>Klonen Sie das Repository und f\u00fchren Sie das Startskript aus:\n<pre><code>git clone https:\/\/github.com\/oobabooga\/text-generation-webui\ncd text-generation-webui\n.\/start_macos.sh<\/code><\/pre>\n<\/li>\n<li>W\u00e4hlen Sie bei der Aufforderung Option D (Apple Silicon \/ Metal) oder C (CPU-only).<\/li>\n<li>Das llama.cpp-Backend nutzt Metal f\u00fcr GPU-Beschleunigung auf M-Serie-Chips \u2013 CUDA ist nicht erforderlich.<\/li>\n<\/ol>\n<p>macOS-Nutzer sind auf die Loader llama.cpp und Transformers beschr\u00e4nkt. ExLlamaV2 ben\u00f6tigt CUDA und l\u00e4uft nicht auf Apple Silicon.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Model_Loaders_Which_One_to_Use\"><\/span>Modell-Loader: Welchen soll ich verwenden?<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>text-generation-webui trennt die Inferenz-Engine von der Benutzeroberfl\u00e4che. Sie w\u00e4hlen pro Modell einen Loader \u00fcber den Reiter <strong>Modell<\/strong> aus. Jeder Loader akzeptiert bestimmte Dateiformate und stellt unterschiedliche Hardware-Anforderungen.<\/p>\n<table>\n<thead>\n<tr>\n<th>Loader<\/th>\n<th>Format<\/th>\n<th>Hardware<\/th>\n<th>Wann man verwendet<\/th>\n<\/tr>\n<\/thead>\n<tbody>\n<tr>\n<td>llama.cpp<\/td>\n<td>GGUF<\/td>\n<td>NVIDIA, AMD, Apple Silicon, CPU<\/td>\n<td>Standard f\u00fcr GGUF-Dateien; h\u00f6chste Portabilit\u00e4t \u00fcber Plattformen hinweg<\/td>\n<\/tr>\n<tr>\n<td>ExLlamaV2<\/td>\n<td>EXL2, GPTQ<\/td>\n<td>Nur f\u00fcr NVIDIA CUDA<\/td>\n<td>Schnellste NVIDIA-Durchsatzleistung; bevorzugt gegen\u00fcber AutoGPTQ f\u00fcr neue Modelle<\/td>\n<\/tr>\n<tr>\n<td>Transformer<\/td>\n<td>Hugging Face (fp16, bf16, int8, int4)<\/td>\n<td>NVIDIA, CPU<\/td>\n<td>Modelle im Originalformat von Hugging Face; langsamer, aber breiteste Kompatibilit\u00e4t<\/td>\n<\/tr>\n<tr>\n<td>AutoAWQ<\/td>\n<td>AWQ<\/td>\n<td>NVIDIA CUDA<\/td>\n<td>AWQ-quantisierte Modelle<\/td>\n<\/tr>\n<tr>\n<td>AutoGPTQ<\/td>\n<td>GPTQ<\/td>\n<td>NVIDIA CUDA<\/td>\n<td>\u00c4ltere GPTQ-Modelle; ExLlamaV2 ist f\u00fcr dasselbe Format schneller<\/td>\n<\/tr>\n<\/tbody>\n<\/table>\n<p><strong>Praktischer Standard:<\/strong> Wenn Sie eine <code>.gguf<\/code> -Datei heruntergeladen haben (das g\u00e4ngigste Format auf Hugging-Face-Modellseiten), verwenden Sie <strong>llama.cpp<\/strong>. Falls Sie eine NVIDIA-GPU besitzen und maximale Generierungsgeschwindigkeit w\u00fcnschen, suchen Sie nach einer EXL2-Variante desselben Modells und verwenden Sie <strong>ExLlamaV2<\/strong>.<\/p>\n<p>F\u00fcr eine \u00dcbersicht dar\u00fcber, welche Modelle realistisch auf welchen GPUs laufen, siehe <a href=\"https:\/\/convly.ai\/de\/vram-requirements-every-major-llm-2026\/\">VRAM-Anforderungen g\u00e4ngiger Sprachmodelle (LLMs)<\/a>.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Loading_a_GGUF_Model_Step_by_Step\"><\/span>Schritt-f\u00fcr-Schritt-Anleitung zum Laden eines GGUF-Modells<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<ol>\n<li><strong>Kopieren Sie die Datei<\/strong> in den Ordner <code>text-generation-webui\/models\/<\/code>. Einzel-Datei-GGUFs (z.\u202fB. <code>mistral-7b-instruct.Q4_K_M.gguf<\/code>) werden direkt in diesen Ordner platziert. Mehrteilige, aufgeteilte Dateien geh\u00f6ren in einen benannten Unterordner.<\/li>\n<li><strong>\u00d6ffnen Sie die Registerkarte \u201eModell\u201c<\/strong> auf <code>http:\/\/localhost:7860<\/code>.<\/li>\n<li>W\u00e4hlen Sie Ihre Datei aus der Modell-Auswahlliste (klicken Sie auf das Aktualisierungssymbol, falls sie nicht angezeigt wird).<\/li>\n<li>Legen Sie <strong>Loader<\/strong> auf <code>llama.cpp<\/code>.<\/li>\n<li>Legen Sie <strong>n-gpu-layers<\/strong> zur Steuerung des GPU-Offloadings. Geben Sie eine gro\u00dfe Zahl ein (z.\u202fB. <code>999<\/code>), um m\u00f6glichst viele Layer in den VRAM zu laden; geben Sie <code>0<\/code> f\u00fcr reine CPU-Inferenz an.<\/li>\n<li>Klicken <strong>Laden<\/strong>. Sobald das Modell bereit ist, erscheint eine Best\u00e4tigungsmeldung im Statusfeld.<\/li>\n<\/ol>\n<p>Wechseln Sie zur Registerkarte <strong>Chat<\/strong> um eine Unterhaltung zu beginnen, oder zur Registerkarte <strong>Standard<\/strong> Prompt <strong>Anleitungsvorlage<\/strong> in der Registerkarte \u201eParameter\u201c ausw\u00e4hlen.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"The_OpenAI-Compatible_API_Extension\"><\/span>Die OpenAI-kompatible API-Erweiterung<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Die integrierte <code>openai<\/code> Erweiterung stellt REST-Endpunkte bereit, die dem OpenAI-Chat-Completions- und Completions-API-Format entsprechen. Jeder Client, der eine benutzerdefinierte Basis-URL akzeptiert \u2013 etwa LangChain, Open WebUI, Continue.dev oder ein einfaches <code>curl<\/code> Skript \u2013 kann ohne Code\u00e4nderungen mit Ihrem lokalen Modell verbunden werden.<\/p>\n<p>Aktivieren Sie sie durch \u00dcbergabe eines Flags beim Start:<\/p>\n<pre><code># Linux \/ macOS\n.\/start_linux.sh --extensions openai\n\n# oder starten Sie server.py direkt innerhalb der Conda-Umgebung\npython server.py --extensions openai<\/code><\/pre>\n<p>Alternativ aktivieren Sie sie \u00fcber die Registerkarte <strong>Sitzung<\/strong> in der Benutzeroberfl\u00e4che und klicken dann auf <strong>Flags anwenden \/ Neustarten<\/strong>.<\/p>\n<p>Standardm\u00e4\u00dfig lauscht die API auf Port 5000, getrennt von der Gradio-Benutzeroberfl\u00e4che auf Port 7860. Richten Sie Ihren Client auf:<\/p>\n<pre><code>base_url = \"http:\/\/localhost:5000\/v1\"\napi_key  = \"beliebig\"  # von den meisten Clients erforderlich, aber lokal nicht validiert<\/code><\/pre>\n<p>Unterst\u00fctzte Endpunkte umfassen <code>\/v1\/chat\/completions<\/code>, <code>\/v1\/completions<\/code>, und <code>\/v1\/models<\/code>. Der Port ist \u00fcber das Startflag <code>--api-port<\/code> konfigurierbar.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"text-generation-webui_vs_LM_Studio_vs_Jan\"><\/span>text-generation-webui im Vergleich zu LM Studio und Jan<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Alle drei Tools f\u00fchren Modelle lokal ohne Cloud-Abh\u00e4ngigkeiten aus. Sie richten sich an unterschiedliche Nutzergruppen und Anwendungsf\u00e4lle.<\/p>\n<table>\n<thead>\n<tr>\n<th><\/th>\n<th>text-generation-webui<\/th>\n<th>LM Studio<\/th>\n<th>Jan<\/th>\n<\/tr>\n<\/thead>\n<tbody>\n<tr>\n<td>Benutzeroberfl\u00e4che<\/td>\n<td>Browser (Gradio)<\/td>\n<td>Native Desktop-Anwendung<\/td>\n<td>Native Desktop-Anwendung<\/td>\n<\/tr>\n<tr>\n<td>Einrichtungskomplexit\u00e4t<\/td>\n<td>Mittel (Ein-Klick-Skript)<\/td>\n<td>Niedrig (GUI-Installer)<\/td>\n<td>Niedrig (GUI-Installer)<\/td>\n<\/tr>\n<tr>\n<td>Modellformate<\/td>\n<td>GGUF, EXL2, GPTQ, AWQ, HF fp16<\/td>\n<td>Vorwiegend GGUF<\/td>\n<td>Vorwiegend GGUF<\/td>\n<\/tr>\n<tr>\n<td>Integrierter Modellbrowser<\/td>\n<td>Nein<\/td>\n<td>Ja<\/td>\n<td>Ja<\/td>\n<\/tr>\n<tr>\n<td>OpenAI-kompatible API<\/td>\n<td>Ja (Erweiterung)<\/td>\n<td>Ja (integriert)<\/td>\n<td>Ja (integriert)<\/td>\n<\/tr>\n<tr>\n<td>Erweiterungs-\/Plugin-System<\/td>\n<td>Ja<\/td>\n<td>Begrenzt<\/td>\n<td>Begrenzt<\/td>\n<\/tr>\n<tr>\n<td>Apple Silicon (Metal)<\/td>\n<td>Ja (llama.cpp)<\/td>\n<td>Ja<\/td>\n<td>Ja<\/td>\n<\/tr>\n<tr>\n<td>Am besten geeignet f\u00fcr<\/td>\n<td>Fortgeschrittene Nutzer, Automatisierung, Forschung<\/td>\n<td>Anf\u00e4nger, t\u00e4gliche Chat-Nutzung<\/td>\n<td>Open-Source-orientierte Nutzer<\/td>\n<\/tr>\n<\/tbody>\n<\/table>\n<p><strong>W\u00e4hlen Sie text-generation-webui<\/strong> wenn Sie mehrere Loader-Backends ben\u00f6tigen, EXL2-Leistung auf NVIDIA-GPUs, LoRA-Laden, das umfangreiche Erweiterungs\u00f6kosystem oder skriptbasierten API-Zugriff f\u00fcr Automatisierung und Entwicklungs-Workflows.<\/p>\n<p><strong>W\u00e4hlen Sie LM Studio oder Jan<\/strong> wenn Sie einen professionell gestalteten Installer, integrierte Modellsuche mit Ein-Klick-Downloads und eine m\u00f6glichst einfache Konfiguration bevorzugen. Weitere Details finden Sie im <a href=\"https:\/\/convly.ai\/de\/lm-studio-complete-guide-2026\/\">LM Studio \u2013 umfassende Anleitung<\/a> f\u00fcr eine schrittweise Anleitung zu dieser Option.<\/p>\n<p>Falls Sie abw\u00e4gen, ob lokale Inferenz die Hardwarekosten \u00fcberhaupt rechtfertigt, kann der <a href=\"https:\/\/convly.ai\/de\/self-hosting-vs-api-calculator\/\">Selbsthosting- versus-API-Kosten-Grenzwert-Rechner<\/a> die Kosten-Nutzen-Relation gegen\u00fcber einer API-Nutzung bei Ihrem erwarteten Nutzungsvolumen quantifizieren.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Frequently_Asked_Questions\"><\/span>H\u00e4ufig gestellte Fragen<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<h3>Warum dauert der Ein-Klick-Installer beim ersten Start so lange?<\/h3>\n<p>Er l\u00e4dt Miniconda herunter und erstellt eine isolierte Python-Umgebung mit PyTorch sowie s\u00e4mtlichen Bibliotheken zum Laden von Modellen \u2013 vollst\u00e4ndig neu. Bei einer schnellen Internetverbindung dauert dies typischerweise 5\u201315 Minuten. Bei nachfolgenden Starts wird dieser Schritt \u00fcbersprungen, und die Anwendung startet innerhalb weniger Sekunden.<\/p>\n<h3>Kann ich text-generation-webui ohne GPU ausf\u00fchren?<\/h3>\n<p>Ja. W\u00e4hlen Sie w\u00e4hrend der Installation die CPU-only-Option, und legen Sie dann <code>n-gpu-layers<\/code> auf <code>0<\/code> fest, wenn Sie ein GGUF-Modell laden. Ein 7B-Modell erzeugt auf einer modernen Desktop-CPU etwa 2\u20135 Tokens pro Sekunde \u2013 ausreichend f\u00fcr Tests, aber zu langsam f\u00fcr fl\u00fcssige Gespr\u00e4che. Kleinere Quantisierungen (Q4 und darunter) verbessern die Durchsatzrate. Weitere Informationen zur Hardware-Auswahl finden Sie unter <a href=\"https:\/\/convly.ai\/de\/best-gpus-for-local-llms-2026\/\">beste GPUs f\u00fcr lokale LLMs<\/a> .<\/p>\n<h3>Wie aktualisiere ich text-generation-webui?<\/h3>\n<p>Ausf\u00fchren <code>git pull<\/code> im Repository-Verzeichnis, um den neuesten Quellcode abzurufen, und f\u00fchren Sie anschlie\u00dfend das Startskript erneut aus. Das Skript erkennt Umgebungs\u00e4nderungen und aktualisiert Abh\u00e4ngigkeiten automatisch. Alternativ k\u00f6nnen Sie auch manuell <code>pip install -r requirements.txt<\/code> innerhalb der aktiven Conda-Umgebung ausf\u00fchren, falls Sie eine gezielte Aktualisierung bevorzugen.<\/p>\n<h3>Was ist der Unterschied zwischen GGUF und EXL2?<\/h3>\n<p>Beide sind quantisierte Formate, die die Modell-Dateigr\u00f6\u00dfe und den VRAM-Bedarf reduzieren. GGUF (\u00fcber llama.cpp) l\u00e4uft auf NVIDIA-, AMD- und Apple-Silicon-GPUs \u2013 es ist die portabelste Wahl mit der breitesten Modellverf\u00fcgbarkeit. EXL2 (\u00fcber ExLlamaV2) ist ausschlie\u00dflich f\u00fcr NVIDIA-GPUs optimiert, erzeugt jedoch bei vergleichbarer Qualit\u00e4t in der Regel schneller Tokens. Falls Sie \u00fcber eine NVIDIA-GPU verf\u00fcgen und Geschwindigkeit oberste Priorit\u00e4t hat, lohnt sich die Beschaffung eines EXL2-Modells.<\/p>\n<h3>Wo werden Gespr\u00e4chsprotokolle gespeichert?<\/h3>\n<p>Die Protokolle werden im Verzeichnis <code>text-generation-webui\/logs\/<\/code>gespeichert. Jedes Gespr\u00e4ch wird als JSON-Datei abgelegt. Au\u00dferdem k\u00f6nnen Sie Protokolle direkt \u00fcber die Download-Schaltfl\u00e4che unterhalb des Chat-Fensters im Chat-Tab exportieren.<\/p>\n<h3>K\u00f6nnen mehrere Benutzer gleichzeitig mit einer Instanz verbunden sein?<\/h3>\n<p>Der <code>--listen<\/code> Mit diesem Startflag wird der Server im lokalen Netzwerk statt nur auf localhost zug\u00e4nglich gemacht. text-generation-webui ist jedoch nicht f\u00fcr Multi-User-Produktionseins\u00e4tze konzipiert \u2013 es gibt keine integrierte Authentifizierung, und die Gradio-Oberfl\u00e4che unterst\u00fctzt nur eine Sitzung gleichzeitig. Die OpenAI-API-Erweiterung verarbeitet parallele API-Anfragen in Multi-Client-Szenarien besser als die Web-Oberfl\u00e4che; falls Sie den Zugriff jedoch \u00fcber localhost hinaus freigeben m\u00f6chten, sollten Sie unbedingt einen Reverse-Proxy mit Authentifizierung davor schalten.<\/p>","protected":false},"excerpt":{"rendered":"<p>text-generation-webui (widely called oobabooga after its GitHub author) is a free, open-source, browser-based interface for running LLMs locally on your [&hellip;]<\/p>\n","protected":false},"author":1,"featured_media":2183,"comment_status":"closed","ping_status":"closed","sticky":false,"template":"","format":"standard","meta":{"site-sidebar-layout":"default","site-content-layout":"","ast-site-content-layout":"default","site-content-style":"default","site-sidebar-style":"default","ast-global-header-display":"","ast-banner-title-visibility":"","ast-main-header-display":"","ast-hfb-above-header-display":"","ast-hfb-below-header-display":"","ast-hfb-mobile-header-display":"","site-post-title":"","ast-breadcrumbs-content":"","ast-featured-img":"","footer-sml-layout":"","ast-disable-related-posts":"","theme-transparent-header-meta":"","adv-header-id-meta":"","stick-header-meta":"","header-above-stick-meta":"","header-main-stick-meta":"","header-below-stick-meta":"","astra-migrate-meta-layouts":"default","ast-page-background-enabled":"default","ast-page-background-meta":{"desktop":{"background-color":"var(--ast-global-color-5)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"tablet":{"background-color":"","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"mobile":{"background-color":"","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""}},"ast-content-background-meta":{"desktop":{"background-color":"var(--ast-global-color-4)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"tablet":{"background-color":"var(--ast-global-color-4)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"mobile":{"background-color":"var(--ast-global-color-4)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""}},"footnotes":""},"categories":[7],"tags":[],"class_list":["post-2182","post","type-post","status-publish","format-standard","has-post-thumbnail","hentry","category-ai-news"],"_links":{"self":[{"href":"https:\/\/convly.ai\/de\/wp-json\/wp\/v2\/posts\/2182","targetHints":{"allow":["GET"]}}],"collection":[{"href":"https:\/\/convly.ai\/de\/wp-json\/wp\/v2\/posts"}],"about":[{"href":"https:\/\/convly.ai\/de\/wp-json\/wp\/v2\/types\/post"}],"author":[{"embeddable":true,"href":"https:\/\/convly.ai\/de\/wp-json\/wp\/v2\/users\/1"}],"replies":[{"embeddable":true,"href":"https:\/\/convly.ai\/de\/wp-json\/wp\/v2\/comments?post=2182"}],"version-history":[{"count":1,"href":"https:\/\/convly.ai\/de\/wp-json\/wp\/v2\/posts\/2182\/revisions"}],"predecessor-version":[{"id":2184,"href":"https:\/\/convly.ai\/de\/wp-json\/wp\/v2\/posts\/2182\/revisions\/2184"}],"wp:featuredmedia":[{"embeddable":true,"href":"https:\/\/convly.ai\/de\/wp-json\/wp\/v2\/media\/2183"}],"wp:attachment":[{"href":"https:\/\/convly.ai\/de\/wp-json\/wp\/v2\/media?parent=2182"}],"wp:term":[{"taxonomy":"category","embeddable":true,"href":"https:\/\/convly.ai\/de\/wp-json\/wp\/v2\/categories?post=2182"},{"taxonomy":"post_tag","embeddable":true,"href":"https:\/\/convly.ai\/de\/wp-json\/wp\/v2\/tags?post=2182"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}