{"id":2414,"date":"2026-08-27T20:02:45","date_gmt":"2026-08-27T20:02:45","guid":{"rendered":"https:\/\/convly.ai\/?p=2414"},"modified":"2026-08-27T20:02:45","modified_gmt":"2026-08-27T20:02:45","slug":"local-llm-models","status":"publish","type":"post","link":"https:\/\/convly.ai\/de\/local-llm-models\/","title":{"rendered":"Lokale LLM-Modelle: Vollst\u00e4ndiger Leitfaden zum Ausf\u00fchren von KI-Modellen auf Ihrer Hardware"},"content":{"rendered":"<div class=\"convly-tldr\"><strong>Zusammenfassung:<\/strong><\/p>\n<ul>\n<li>Local LLM models run on your hardware without API calls. Popular options include Llama 3.1 (8B-405B), Mistral 7B, Phi-3, and Gemma 2.<\/li>\n<li>Verwenden Sie Ollama f\u00fcr die einfachste Einrichtung (<code>ollama run llama3.1<\/code>), LM Studio for a GUI, or llama.cpp for maximum control.<\/li>\n<li>Ein Modell mit 8 Milliarden Parametern ben\u00f6tigt bei 4-Bit-Quantisierung 6\u20138 GB VRAM, bei voller Pr\u00e4zision 16 GB. F\u00fcr 70B-Modelle sind 40 GB oder mehr VRAM erforderlich \u2013 alternativ kann systemweiter Arbeitsspeicher zur Entlastung genutzt werden.<\/li>\n<li>Quantisierung (GGUF, GPTQ, AWQ) reduziert die Modellgr\u00f6\u00dfe um 50\u201375 % bei nur geringf\u00fcgigem Qualit\u00e4tsverlust und macht den lokalen Einsatz auf Consumer-Hardware praktikabel.<\/li>\n<\/ul>\n<\/div>\n<p>Lokale LLM-Modelle sind KI-Sprachmodelle, die vollst\u00e4ndig auf Ihrer Hardware \u2013 Desktop, Laptop oder Server \u2013 ausgef\u00fchrt werden, ohne Daten an externe APIs zu senden. Sie laden die Modellgewichte herunter, laden sie in den Arbeitsspeicher und f\u00fchren die Inferenz lokal durch. Damit erhalten Sie vollst\u00e4ndige Datenschutzgarantie, keine Kosten pro Token, Offline-Funktionalit\u00e4t und volle Kontrolle \u00fcber das Verhalten des Modells. Der Nachteil ist die anf\u00e4ngliche Hardware-Investition sowie die langsamere Inferenz im Vergleich zu Cloud-Anbietern, die auf optimierter Infrastruktur laufen.<\/p>\n<div id=\"ez-toc-container\" class=\"ez-toc-v2_0_86 counter-flat ez-toc-counter ez-toc-container-direction\">\n<label for=\"ez-toc-cssicon-toggle-item-6a90c73ab1eb6\" class=\"ez-toc-cssicon-toggle-label\"><span class=\"\"><span class=\"eztoc-hide\" style=\"display:none;\">Umschalten<\/span><span class=\"ez-toc-icon-toggle-span\"><svg style=\"fill: #000000;color:#000000\" xmlns=\"http:\/\/www.w3.org\/2000\/svg\" class=\"list-377408\" width=\"20px\" height=\"20px\" viewbox=\"0 0 24 24\" fill=\"none\"><path d=\"M6 6H4v2h2V6zm14 0H8v2h12V6zM4 11h2v2H4v-2zm16 0H8v2h12v-2zM4 16h2v2H4v-2zm16 0H8v2h12v-2z\" fill=\"currentColor\"><\/path><\/svg><svg style=\"fill: #000000;color:#000000\" class=\"arrow-unsorted-368013\" xmlns=\"http:\/\/www.w3.org\/2000\/svg\" width=\"10px\" height=\"10px\" viewbox=\"0 0 24 24\" version=\"1.2\" baseprofile=\"tiny\"><path d=\"M18.2 9.3l-6.2-6.3-6.2 6.3c-.2.2-.3.4-.3.7s.1.5.3.7c.2.2.4.3.7.3h11c.3 0 .5-.1.7-.3.2-.2.3-.5.3-.7s-.1-.5-.3-.7zM5.8 14.7l6.2 6.3 6.2-6.3c.2-.2.3-.5.3-.7s-.1-.5-.3-.7c-.2-.2-.4-.3-.7-.3h-11c-.3 0-.5.1-.7.3-.2.2-.3.5-.3.7s.1.5.3.7z\"\/><\/svg><\/span><\/span><\/label><input type=\"checkbox\"  id=\"ez-toc-cssicon-toggle-item-6a90c73ab1eb6\"  aria-label=\"Umschalten\" \/><nav><ul class='ez-toc-list ez-toc-list-level-1' ><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-1\" href=\"https:\/\/convly.ai\/de\/local-llm-models\/#Popular_Local_LLM_Models\" >Beliebte lokale LLM-Modelle<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-2\" href=\"https:\/\/convly.ai\/de\/local-llm-models\/#Hardware_Requirements\" >Hardware-Anforderungen<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-3\" href=\"https:\/\/convly.ai\/de\/local-llm-models\/#Running_Local_LLM_Models\" >Ausf\u00fchren lokaler LLM-Modelle<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-4\" href=\"https:\/\/convly.ai\/de\/local-llm-models\/#Model_Formats_and_Quantization\" >Modellformate und Quantisierung<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-5\" href=\"https:\/\/convly.ai\/de\/local-llm-models\/#Choosing_a_Local_LLM_Model\" >Auswahl eines lokalen LLM-Modells<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-6\" href=\"https:\/\/convly.ai\/de\/local-llm-models\/#Frequently_Asked_Questions\" >H\u00e4ufig gestellte Fragen<\/a><\/li><\/ul><\/nav><\/div>\n<h2><span class=\"ez-toc-section\" id=\"Popular_Local_LLM_Models\"><\/span>Beliebte lokale LLM-Modelle<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Stand 2026 bieten diese Modelle das beste Verh\u00e4ltnis aus Qualit\u00e4t und Hardware-Zug\u00e4nglichkeit f\u00fcr den lokalen Einsatz:<\/p>\n<table>\n<thead>\n<tr>\n<th>Modell<\/th>\n<th>Parameter<\/th>\n<th>VRAM (4-Bit)<\/th>\n<th>VRAM (16-Bit)<\/th>\n<th>Am besten geeignet f\u00fcr<\/th>\n<\/tr>\n<\/thead>\n<tbody>\n<tr>\n<td>Llama 3.1<\/td>\n<td>8B \/ 70B \/ 405B<\/td>\n<td>6 GB \/ 40 GB \/ 240 GB<\/td>\n<td>16 GB \/ 140 GB \/ 810 GB<\/td>\n<td>Allzweckanwendungen, Programmierung, Schlussfolgern<\/td>\n<\/tr>\n<tr>\n<td>Mistral 7B v0.3<\/td>\n<td>7B<\/td>\n<td>5 GB<\/td>\n<td>14 GB<\/td>\n<td>Schnelle Inferenz, gutes Verh\u00e4ltnis von Qualit\u00e4t zu Gr\u00f6\u00dfe<\/td>\n<\/tr>\n<tr>\n<td>Phi-3-medium<\/td>\n<td>14B<\/td>\n<td>9 GB<\/td>\n<td>28 GB<\/td>\n<td>Effizientes Schlussfolgern, passt auf Consumer-GPUs<\/td>\n<\/tr>\n<tr>\n<td>Gemma 2<\/td>\n<td>9B \/ 27B<\/td>\n<td>6 GB \/ 18 GB<\/td>\n<td>18 GB \/ 54 GB<\/td>\n<td>Anweisungsbefolgung, sicherheitsoptimiert<\/td>\n<\/tr>\n<tr>\n<td>Qwen 2.5<\/td>\n<td>7B \/ 72B<\/td>\n<td>5 GB \/ 42 GB<\/td>\n<td>14 GB \/ 144 GB<\/td>\n<td>Mehrsprachigkeit, starke Leistung in Mathematik\/Programmierung<\/td>\n<\/tr>\n<tr>\n<td>DeepSeek-Coder-V2<\/td>\n<td>16B \/ 236B<\/td>\n<td>10 GB \/ 140 GB<\/td>\n<td>32 GB \/ 472 GB<\/td>\n<td>Codegenerierung und -verst\u00e4ndnis<\/td>\n<\/tr>\n<\/tbody>\n<\/table>\n<p>Die VRAM-Sch\u00e4tzungen sind ungef\u00e4hr und variieren je nach Kontextl\u00e4nge und Batch-Gr\u00f6\u00dfe. Nutzen Sie den <a href=\"https:\/\/convly.ai\/de\/llm-vram-calculator\/\">VRAM-Rechner<\/a> f\u00fcr pr\u00e4zise Anforderungen basierend auf Ihrer Konfiguration oder schauen Sie bei <a href=\"https:\/\/convly.ai\/de\/vram-requirements-every-major-llm-2026\/\">VRAM-Anforderungen nach Modell<\/a> f\u00fcr detaillierte Spezifikationen zu \u00fcber 37 Modellen nach.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Hardware_Requirements\"><\/span>Hardware-Anforderungen<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Lokale LLM-Modelle werden w\u00e4hrend der Inferenz vollst\u00e4ndig in den Arbeitsspeicher geladen. Sie k\u00f6nnen sie entweder ausschlie\u00dflich auf der GPU (VRAM), ausschlie\u00dflich im System-RAM oder in einer Kombination aus beiden ausf\u00fchren:<\/p>\n<h3>GPU (schnellste Variante)<\/h3>\n<p>NVIDIA-GPUs mit CUDA-Unterst\u00fctzung bieten die beste Leistung. AMD-GPUs funktionieren \u00fcber ROCm, verf\u00fcgen aber \u00fcber weniger Tooling-Unterst\u00fctzung. Apple Silicon (M1\/M2\/M3) nutzt einen einheitlichen Speicher und f\u00fchrt Modelle effizient \u00fcber Metal aus.<\/p>\n<ul>\n<li><strong>Einsteigerklasse:<\/strong> RTX 3060 12GB or RTX 4060 Ti 16GB runs 7-8B models at 4-bit quantization<\/li>\n<li><strong>Mittelklasse:<\/strong> RTX 4090 mit 24 GB bew\u00e4ltigt quantisierte 30B-Modelle oder 13B-Modelle mit voller Pr\u00e4zision<\/li>\n<li><strong>High-End:<\/strong> A6000 mit 48 GB oder zwei Consumer-GPUs f\u00fchren 70B-Modelle mit 4-Bit-Quantisierung aus<\/li>\n<\/ul>\n<p>Weitere Details finden Sie im <a href=\"https:\/\/convly.ai\/de\/best-gpus-for-local-llms-2026\/\">beste GPUs f\u00fcr lokale LLMs<\/a> Leitfaden f\u00fcr Leistungsbenchmarks und Preis-Leistungs-Verh\u00e4ltnisse.<\/p>\n<h3>CPU (Langsamer, aber zug\u00e4nglich)<\/h3>\n<p>Jede moderne CPU kann lokale LLM-Modelle unter Verwendung des Systemspeichers ausf\u00fchren \u2013 allerdings 10- bis 50-mal langsamer als GPU-Inferenz. Dies ist praktikabel f\u00fcr kleine Modelle (7\u20138 Milliarden Parameter) oder wenn Datenschutz wichtiger ist als Geschwindigkeit.<\/p>\n<ul>\n<li><strong>Mindestanforderung:<\/strong> 16 GB RAM f\u00fcr 7B-Modelle mit 4-Bit-Quantisierung<\/li>\n<li><strong>Empfohlen:<\/strong> 32 GB+ RAM f\u00fcr komfortablen Betrieb mit gr\u00f6\u00dferen Kontextfenstern<\/li>\n<li><strong>Server:<\/strong> 128 GB+ RAM erm\u00f6glichen den Einsatz von 70B-Modellen auf rein CPU-basierten Systemen<\/li>\n<\/ul>\n<h3>Hybrid (GPU + CPU)<\/h3>\n<p>Die meisten Frameworks unterst\u00fctzen Offloading: Einige Schichten werden auf der GPU geladen, der Rest wird in den Arbeitsspeicher ausgelagert. Ein 70B-Modell k\u00f6nnte beispielsweise 24 GB VRAM und 32 GB RAM nutzen und damit eine 3- bis 5-mal schnellere Inferenz als bei reinem CPU-Betrieb erm\u00f6glichen.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Running_Local_LLM_Models\"><\/span>Ausf\u00fchren lokaler LLM-Modelle<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<h3>Ollama (Einfachste L\u00f6sung)<\/h3>\n<p>Ollama stellt llama.cpp \u00fcber eine einfache CLI und eine Modellregistrierung bereit. Es ist der schnellste Einstieg:<\/p>\n<pre><code># Installation unter macOS\/Linux\ncurl -fsSL https:\/\/ollama.ai\/install.sh | sh\n\n# Windows: Installer von ollama.ai herunterladen\n\n# Modell ausf\u00fchren (wird automatisch heruntergeladen)\nollama run llama3.1\n\n# Verf\u00fcgbare Modelle auflisten\nollama list\n\n# Ein bestimmtes Modell herunterladen\nollama pull mistral:7b-instruct-q4_0\n<\/code><\/pre>\n<p>Ollama w\u00e4hlt automatisch zwischen GPU und CPU, verwaltet die Quantisierung und \u00fcbernimmt das Herunterladen der Modelle. Weitere Details zur Einrichtung und Konfiguration finden Sie in der <a href=\"https:\/\/convly.ai\/de\/what-is-ollama-complete-guide-2026\/\">Kompletter Ollama-Leitfaden<\/a> Dokumentation <a href=\"https:\/\/convly.ai\/de\/how-to-install-ollama-2026\/\">So installieren Sie Ollama<\/a> oder wechseln Sie direkt zu den<\/p>\n<p>100+ verf\u00fcgbaren Modellen im <a href=\"https:\/\/convly.ai\/de\/ollama-models-list-2026\/\">Ollama-Modellliste<\/a>Modellkatalog <a href=\"https:\/\/convly.ai\/de\/best-local-llms-to-run-on-ollama-2026\/\">beste lokale Modelle f\u00fcr Ollama<\/a>.<\/p>\n<h3>LM Studio (GUI)<\/h3>\n<p>LM Studio bietet eine Desktop-Anwendung f\u00fcr Windows, macOS und Linux mit Chat-Oberfl\u00e4che und Modellbrowser. Laden Sie sie von lmstudio.ai herunter, starten Sie die Anwendung, suchen Sie im Reiter \u201eDiscover\u201c nach Modellen und klicken Sie auf \u201eDownload\u201c. Die Modelle verwenden das GGUF-Format und werden mit einstellbarer Quantisierung geladen.<\/p>\n<p>LM Studio zeigt die aktuelle VRAM-Auslastung und die Inferenzgeschwindigkeit in Echtzeit an, wodurch die Feinabstimmung der Einstellungen erleichtert wird. Au\u00dferdem startet es einen lokalen OpenAI-kompatiblen API-Server unter <code>http:\/\/localhost:1234\/v1<\/code> http:\/\/localhost:1234 <a href=\"https:\/\/convly.ai\/de\/lm-studio-complete-guide-2026\/\">LM Studio \u2013 umfassende Anleitung<\/a> f\u00fcr erweiterte Funktionen.<\/p>\n<h3>llama.cpp (Fortgeschritten)<\/h3>\n<p>llama.cpp ist die zugrundeliegende Engine f\u00fcr Ollama und LM Studio und bietet Entwicklern maximale Kontrolle:<\/p>\n<pre><code># Klonen und Kompilieren\ngit clone https:\/\/github.com\/ggerganov\/llama.cpp\ncd llama.cpp\nmake\n\n# Mit CUDA-Unterst\u00fctzung\nmake LLAMA_CUDA=1\n\n# Inferenz ausf\u00fchren\n.\/main -m models\/llama-3.1-8b-instruct-q4_0.gguf -p \"Erkl\u00e4re Quantencomputing\" -n 512 --gpu-layers 35\n<\/code><\/pre>\n<p>Der <code>--gpu-layers<\/code> steuert, wie viele Transformer-Schichten auf der GPU statt im Arbeitsspeicher geladen werden. H\u00f6here Werte beanspruchen mehr VRAM, f\u00fchren aber zu schnellerer Ausf\u00fchrung. Beginnen Sie mit der H\u00e4lfte der Gesamtanzahl der Schichten des Modells und passen Sie den Wert anschlie\u00dfend an.<\/p>\n<h3>Weitere Tools<\/h3>\n<ul>\n<li><strong>text-generation-webui:<\/strong> Web-Oberfl\u00e4che mit Erweiterungen und Unterst\u00fctzung verschiedener Backends<\/li>\n<li><strong>vLLM:<\/strong> Optimierter Inferenzserver f\u00fcr hochdurchsatzf\u00e4hige Produktionsumgebungen<\/li>\n<li><strong>LocalAI:<\/strong> Direkter Ersatz f\u00fcr die OpenAI-API mit Unterst\u00fctzung mehrerer Modellformate<\/li>\n<li><strong>Jan:<\/strong> Desktop-Anwendung \u00e4hnlich LM Studio mit Fokus auf Datenschutz<\/li>\n<\/ul>\n<h2><span class=\"ez-toc-section\" id=\"Model_Formats_and_Quantization\"><\/span>Modellformate und Quantisierung<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Quantisierung reduziert die numerische Genauigkeit eines Modells von 16-Bit- oder 32-Bit-Gleitkommazahlen auf 8-Bit-, 4-Bit- oder Mischpr\u00e4zision und senkt so den Speicherbedarf um 50\u201375 % bei einem Qualit\u00e4tsverlust von nur 2\u20135 %. Verschiedene Formate sind jeweils f\u00fcr unterschiedliche Hardware optimiert:<\/p>\n<h3>GGUF (Ollama, LM Studio, llama.cpp)<\/h3>\n<p>GGUF ist das Standardformat f\u00fcr lokale Bereitstellung. G\u00e4ngige Quantisierungsstufen:<\/p>\n<ul>\n<li><strong>Q4_0:<\/strong> 4-Bit, kleinste Dateigr\u00f6\u00dfe, 5\u201310 % Qualit\u00e4tsverlust<\/li>\n<li><strong>Q4_K_M:<\/strong> 4-Bit mit Mischpr\u00e4zision, gutes Verh\u00e4ltnis aus Gr\u00f6\u00dfe und Qualit\u00e4t<\/li>\n<li><strong>Q5_K_M:<\/strong> 5-Bit, bessere Qualit\u00e4t als Q4, immer noch kompakt<\/li>\n<li><strong>Q8_0:<\/strong> 8-Bit, minimaler Qualit\u00e4tsverlust, gr\u00f6\u00dfere Dateien<\/li>\n<li><strong>F16:<\/strong> Vollst\u00e4ndige 16-Bit-Pr\u00e4zision, keine Quantisierung<\/li>\n<\/ul>\n<p>F\u00fcr die meisten Anwendungsf\u00e4lle bieten Q4_K_M oder Q5_K_M das beste Verh\u00e4ltnis aus Qualit\u00e4t und Dateigr\u00f6\u00dfe. Nutzen Sie Q8_0 oder F16 nur dann, wenn Sie \u00fcber ausreichend VRAM verf\u00fcgen und h\u00f6chste Genauigkeit ben\u00f6tigen.<\/p>\n<h3>GPTQ (Python-Inferenz)<\/h3>\n<p>GPTQ quantisiert auf 4-Bit oder 3-Bit und ist speziell f\u00fcr GPU-Inferenz optimiert \u2013 z. B. mithilfe von Bibliotheken wie AutoGPTQ oder ExLlama. GPTQ wird h\u00e4ufig in Hugging Face Transformers-Workflows eingesetzt. GPTQ-Modelle laden schneller als GGUF-Modelle, erfordern jedoch eine Python-Umgebung.<\/p>\n<h3>AWQ (Schnelle GPU-Inferenz)<\/h3>\n<p>AWQ (Activation-aware Weight Quantization) bewahrt bei 4-Bit-Quantisierung mehr Genauigkeit als GPTQ, indem besonders wichtige Gewichte gesch\u00fctzt werden. AWQ erfordert kompatible Inferenz-Engines wie vLLM oder TGI.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Choosing_a_Local_LLM_Model\"><\/span>Auswahl eines lokalen LLM-Modells<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>W\u00e4hlen Sie die Modellgr\u00f6\u00dfe entsprechend Ihrer Hardware und Ihrem Anwendungsfall:<\/p>\n<ul>\n<li><strong>7\u20138B-Modelle:<\/strong> Passen auf Consumer-GPUs (12\u201316 GB VRAM), schnelle Antworten, gut geeignet f\u00fcr Chats und einfache Aufgaben<\/li>\n<li><strong>13\u201314B-Modelle:<\/strong> Ben\u00f6tigen 20\u201324 GB VRAM, deutlich besseres Schlussfolgern und Befolgen von Anweisungen<\/li>\n<li><strong>30\u201334B-Modelle:<\/strong> Erfordern 40 GB+ VRAM oder hybriden GPU+RAM-Betrieb und n\u00e4hern sich der Qualit\u00e4t von GPT-3.5<\/li>\n<li><strong>Modelle mit 70 Milliarden oder mehr Parametern:<\/strong> Erfordern Server-Hardware oder aggressive Quantisierung, konkurrieren auf vielen Aufgaben mit GPT-4<\/li>\n<\/ul>\n<p>Durchsuchen Sie die Spezifikationen und Benchmark-Werte f\u00fcr 37 Modelle im <a href=\"https:\/\/convly.ai\/de\/models\/\">Datenbank f\u00fcr KI-Modelle<\/a>, oder vergleichen Sie die Platzierungen im <a href=\"https:\/\/convly.ai\/de\/llm-leaderboard\/\">LLM-Leaderboard<\/a> sortiert nach Intelligenz, Preis und Kontextl\u00e4nge.<\/p>\n<p>Verwenden Sie f\u00fcr die Kostenanalyse den <a href=\"https:\/\/convly.ai\/de\/self-hosting-vs-api-calculator\/\">Selbsthosting vs. API-Rechner<\/a> um den Break-even-Point zwischen lokaler Hardware und Cloud-API-Kosten zu ermitteln. Lokale Modelle verursachen h\u00f6here Anschaffungskosten, aber keine zus\u00e4tzlichen Kosten pro Token \u2013 bei hohem Volumen sind sie daher g\u00fcnstiger.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Frequently_Asked_Questions\"><\/span>H\u00e4ufig gestellte Fragen<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<h3>Kann ich lokale LLM-Modelle auf einem Laptop ausf\u00fchren?<\/h3>\n<p>Ja, sofern Sie \u00fcber 16 GB oder mehr einheitlichen Arbeitsspeicher (Apple Silicon) oder 16 GB oder mehr RAM sowie eine dedizierte GPU mit mindestens 8 GB VRAM verf\u00fcgen. MacBook Pros mit M1 Max\/Ultra, M2 Pro\/Max oder M3 Max f\u00fchren 7\u201313B-Modelle effizient aus. Windows-\/Linux-Laptops mit mobilen RTX 4060\u20134090-GPUs bew\u00e4ltigen je nach VRAM 7\u201330B-Modelle. Die Inferenz allein auf der CPU funktioniert auf jedem Laptop mit 16 GB oder mehr RAM, ist jedoch 10\u201350-mal langsamer.<\/p>\n<h3>Wie viel langsamer sind lokale LLM-Modelle im Vergleich zu API-Anbietern?<\/h3>\n<p>Das h\u00e4ngt von der Hardware ab. Ein 7B-Modell auf einer RTX 4090 generiert 80\u2013120 Tokens pro Sekunde \u2013 vergleichbar mit der Latenz \u00fcber APIs. Dasselbe Modell auf der CPU erzeugt nur 5\u201315 Tokens pro Sekunde. Gr\u00f6\u00dfere Modelle (70B+) erzeugen selbst mit GPU-Beschleunigung auf Consumer-Hardware lediglich 2\u201310 Tokens pro Sekunde. Cloud-Anbieter nutzen optimierte H100-Cluster f\u00fcr hohe Durchsatzraten; lokale Modelle hingegen eliminieren die Netzwerklatenz \u2013 das erste Token erhalten Sie sofort.<\/p>\n<h3>Ben\u00f6tigen lokale LLM-Modelle Internetzugang?<\/h3>\n<p>Nein, sobald sie einmal heruntergeladen sind. Sie laden die Modellgewichte einmalig herunter (1\u2013150 GB, je nach Modellgr\u00f6\u00dfe); danach l\u00e4uft die Inferenz vollst\u00e4ndig offline. Ollama, LM Studio und llama.cpp speichern Modelle lokal im Cache. Dadurch eignen sich lokale LLMs besonders f\u00fcr air-gapped-Umgebungen, unterwegs oder f\u00fcr datenschutzkritische Anwendungen, bei denen keinerlei Daten Ihr Netzwerk verlassen d\u00fcrfen.<\/p>\n<h3>Wie gro\u00df ist der Qualit\u00e4tsunterschied zwischen quantisierten und vollpr\u00e4zisen Modellen?<\/h3>\n<p>Eine 4-Bit-Quantisierung (Q4_K_M) f\u00fchrt bei den meisten Benchmarks zu einem Qualit\u00e4tseinbu\u00dfe von 2\u20135 % gegen\u00fcber 16-Bit-Pr\u00e4zision, wobei vor allem komplexe Schlussfolgerungen und faktisches Abrufen beeintr\u00e4chtigt werden. Bei 8-Bit-Quantisierung liegt der Verlust unter 1 %. F\u00fcr Chat-Anwendungen, Programmierhilfe und Dokumentverarbeitung k\u00f6nnen die meisten Nutzer Q4_K_M nicht von F16 unterscheiden. F\u00fcr kritische Anwendungen mit h\u00f6chsten Genauigkeitsanforderungen (Medizin, Rechtswesen, Wissenschaft) empfehlen wir Q8_0 oder F16 \u2013 sofern ausreichend VRAM zur Verf\u00fcgung steht.<\/p>\n<h3>Kann ich lokale LLM-Modelle feinjustieren?<\/h3>\n<p>Ja, mithilfe von Bibliotheken wie Axolotl, Ludwig oder Hugging Face TRL. F\u00fcr das Fine-Tuning ist deutlich mehr VRAM erforderlich als f\u00fcr die reine Inferenz: Bei vollst\u00e4ndigem Fine-Tuning eines 7B-Modells sollten Sie mindestens 24 GB VRAM einplanen; bei parameter-effizienten Methoden wie LoRA gen\u00fcgen 12\u201316 GB. Die feinjustierten Gewichte ersetzen oder erg\u00e4nzen die Basis-Modellgewichte, sodass Sie das angepasste Modell nach Konvertierung in das GGUF- oder ein anderes Inferenzformat mit denselben Tools (Ollama, LM Studio, llama.cpp) bereitstellen k\u00f6nnen.<\/p>\n<h3>Welches lokale LLM-Modell kommt der Qualit\u00e4t von ChatGPT am n\u00e4chsten?<\/h3>\n<p>Llama 3.1 70B approaches GPT-4&#8217;s quality on reasoning and instruction following, while Llama 3.1 405B matches or exceeds it on many benchmarks. For GPT-3.5-level quality, Llama 3.1 8B, Mistral 7B, or Qwen 2.5 14B are sufficient. No local model fully replicates ChatGPT&#8217;s behavior since ChatGPT uses retrieval augmentation, multiple models, and post-processing, but raw model capabilities are now comparable at the 70B+ scale.<\/p>","protected":false},"excerpt":{"rendered":"<p>TL;DR:Local LLM models run on your hardware without API calls. Popular options include Llama 3.1 (8B-405B), Mistral 7B, Phi-3, and [\u2026]<\/p>\n","protected":false},"author":1,"featured_media":2415,"comment_status":"closed","ping_status":"closed","sticky":false,"template":"","format":"standard","meta":{"site-sidebar-layout":"default","site-content-layout":"","ast-site-content-layout":"default","site-content-style":"default","site-sidebar-style":"default","ast-global-header-display":"","ast-banner-title-visibility":"","ast-main-header-display":"","ast-hfb-above-header-display":"","ast-hfb-below-header-display":"","ast-hfb-mobile-header-display":"","site-post-title":"","ast-breadcrumbs-content":"","ast-featured-img":"","footer-sml-layout":"","ast-disable-related-posts":"","theme-transparent-header-meta":"","adv-header-id-meta":"","stick-header-meta":"","header-above-stick-meta":"","header-main-stick-meta":"","header-below-stick-meta":"","astra-migrate-meta-layouts":"default","ast-page-background-enabled":"default","ast-page-background-meta":{"desktop":{"background-color":"var(--ast-global-color-5)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"tablet":{"background-color":"","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"mobile":{"background-color":"","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""}},"ast-content-background-meta":{"desktop":{"background-color":"var(--ast-global-color-4)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"tablet":{"background-color":"var(--ast-global-color-4)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"mobile":{"background-color":"var(--ast-global-color-4)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""}},"footnotes":""},"categories":[7],"tags":[],"class_list":["post-2414","post","type-post","status-publish","format-standard","has-post-thumbnail","hentry","category-ai-news"],"_links":{"self":[{"href":"https:\/\/convly.ai\/de\/wp-json\/wp\/v2\/posts\/2414","targetHints":{"allow":["GET"]}}],"collection":[{"href":"https:\/\/convly.ai\/de\/wp-json\/wp\/v2\/posts"}],"about":[{"href":"https:\/\/convly.ai\/de\/wp-json\/wp\/v2\/types\/post"}],"author":[{"embeddable":true,"href":"https:\/\/convly.ai\/de\/wp-json\/wp\/v2\/users\/1"}],"replies":[{"embeddable":true,"href":"https:\/\/convly.ai\/de\/wp-json\/wp\/v2\/comments?post=2414"}],"version-history":[{"count":1,"href":"https:\/\/convly.ai\/de\/wp-json\/wp\/v2\/posts\/2414\/revisions"}],"predecessor-version":[{"id":2416,"href":"https:\/\/convly.ai\/de\/wp-json\/wp\/v2\/posts\/2414\/revisions\/2416"}],"wp:featuredmedia":[{"embeddable":true,"href":"https:\/\/convly.ai\/de\/wp-json\/wp\/v2\/media\/2415"}],"wp:attachment":[{"href":"https:\/\/convly.ai\/de\/wp-json\/wp\/v2\/media?parent=2414"}],"wp:term":[{"taxonomy":"category","embeddable":true,"href":"https:\/\/convly.ai\/de\/wp-json\/wp\/v2\/categories?post=2414"},{"taxonomy":"post_tag","embeddable":true,"href":"https:\/\/convly.ai\/de\/wp-json\/wp\/v2\/tags?post=2414"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}