{"id":2605,"date":"2026-09-09T20:14:45","date_gmt":"2026-09-09T20:14:45","guid":{"rendered":"https:\/\/convly.ai\/?p=2605"},"modified":"2026-09-09T20:14:45","modified_gmt":"2026-09-09T20:14:45","slug":"gguf-models","status":"publish","type":"post","link":"https:\/\/convly.ai\/de\/gguf-models\/","title":{"rendered":"GGUF-Modelle: Was sie sind und wie man sie ausf\u00fchrt"},"content":{"rendered":"<div class=\"convly-tldr\">\n<ul>\n<li><strong>GGUF ist ein Single-File-Containerformat f\u00fcr quantisierte Modelle<\/strong>, das entwickelt wurde f\u00fcr <a href=\"https:\/\/github.com\/ggml-org\/llama.cpp\" rel=\"noopener\" target=\"_blank\">llama.cpp<\/a>Ein <code>.gguf<\/code> Datei enth\u00e4lt die Gewichte, den Tokenizer, die Chat-Vorlage und die Metadaten \u2013 kein Konfigurationsordner, keine separaten Tokenizer-Dateien.<\/li>\n<li><strong>GGUF models are what Ollama, LM Studio, KoboldCpp, Jan and llama.cpp actually load.<\/strong> Wenn Sie ein Modell lokal auf Consumer-Hardware ausf\u00fchren, f\u00fchren Sie mit gro\u00dfer Wahrscheinlichkeit GGUF aus.<\/li>\n<li><strong>Standardwahl: <code>Q4_K_M<\/code>.<\/strong> Ungef\u00e4hr 0,6 GB Dateigr\u00f6\u00dfe pro Milliarde Parameter \u2013 ein 8B-Modell liegt bei knapp 5 GB, was der Angabe von ca. 5 GB f\u00fcr die 4-Bit-Variante des Llama 3.1 8B bei <a href=\"https:\/\/convly.ai\/de\/models\/\">Convly-Modell-Datenbank<\/a> entspricht.<\/li>\n<li><strong>GGUF ist f\u00fcr die lokale Inferenz durch einen einzelnen Benutzer gedacht.<\/strong> For concurrent serving use safetensors with vLLM or an API instead.<\/li>\n<\/ul>\n<\/div>\n<p>GGUF (GPT-Generated Unified Format) ist das Dateiformat, das das llama.cpp\/ggml-\u00d6kosystem verwendet, um ein Modell bereitzustellen, das sofort f\u00fcr Inferenz genutzt werden kann. Eine einzige <code>.gguf<\/code> Datei enth\u00e4lt die quantisierten Tensoren sowie alle daf\u00fcr erforderlichen Komponenten: Vokabular, Tokenizer-Einstellungen, Chat-Vorlage und Architektur-Metadaten. Es ersetzte das \u00e4ltere GGML-Format im August 2023 und ist heute der de-facto-Standard f\u00fcr den Betrieb von Modellen auf Laptops, Desktops und CPUs.<\/p>\n<div id=\"ez-toc-container\" class=\"ez-toc-v2_0_87_1 counter-flat ez-toc-counter ez-toc-container-direction\">\n<label for=\"ez-toc-cssicon-toggle-item-6aa1d07eaaafe\" class=\"ez-toc-cssicon-toggle-label\"><span class=\"\"><span class=\"eztoc-hide\" style=\"display:none;\">Umschalten<\/span><span class=\"ez-toc-icon-toggle-span\"><svg style=\"fill: #000000;color:#000000\" xmlns=\"http:\/\/www.w3.org\/2000\/svg\" class=\"list-377408\" width=\"20px\" height=\"20px\" viewbox=\"0 0 24 24\" fill=\"none\"><path d=\"M6 6H4v2h2V6zm14 0H8v2h12V6zM4 11h2v2H4v-2zm16 0H8v2h12v-2zM4 16h2v2H4v-2zm16 0H8v2h12v-2z\" fill=\"currentColor\"><\/path><\/svg><svg style=\"fill: #000000;color:#000000\" class=\"arrow-unsorted-368013\" xmlns=\"http:\/\/www.w3.org\/2000\/svg\" width=\"10px\" height=\"10px\" viewbox=\"0 0 24 24\" version=\"1.2\" baseprofile=\"tiny\"><path d=\"M18.2 9.3l-6.2-6.3-6.2 6.3c-.2.2-.3.4-.3.7s.1.5.3.7c.2.2.4.3.7.3h11c.3 0 .5-.1.7-.3.2-.2.3-.5.3-.7s-.1-.5-.3-.7zM5.8 14.7l6.2 6.3 6.2-6.3c.2-.2.3-.5.3-.7s-.1-.5-.3-.7c-.2-.2-.4-.3-.7-.3h-11c-.3 0-.5.1-.7.3-.2.2-.3.5-.3.7s.1.5.3.7z\"\/><\/svg><\/span><\/span><\/label><input type=\"checkbox\"  id=\"ez-toc-cssicon-toggle-item-6aa1d07eaaafe\"  aria-label=\"Umschalten\" \/><nav><ul class='ez-toc-list ez-toc-list-level-1' ><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-1\" href=\"https:\/\/convly.ai\/de\/gguf-models\/#What_is_actually_inside_a_gguf_file\" >Was tats\u00e4chlich in einer .gguf-Datei steckt<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-2\" href=\"https:\/\/convly.ai\/de\/gguf-models\/#How_to_read_a_GGUF_filename\" >Wie man einen GGUF-Dateinamen liest<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-3\" href=\"https:\/\/convly.ai\/de\/gguf-models\/#Sizing_which_GGUF_models_fit_your_GPU\" >Gr\u00f6\u00dfenabsch\u00e4tzung: Welche GGUF-Modelle passen auf Ihre GPU?<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-4\" href=\"https:\/\/convly.ai\/de\/gguf-models\/#Where_to_download_GGUF_models\" >Wo man GGUF-Modelle herunterl\u00e4dt<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-5\" href=\"https:\/\/convly.ai\/de\/gguf-models\/#Running_GGUF_models_on_Linux\" >GGUF-Modelle unter Linux ausf\u00fchren<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-6\" href=\"https:\/\/convly.ai\/de\/gguf-models\/#Running_GGUF_models_on_macOS\" >GGUF-Modelle unter macOS ausf\u00fchren<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-7\" href=\"https:\/\/convly.ai\/de\/gguf-models\/#Running_GGUF_models_on_Windows\" >GGUF-Modelle unter Windows ausf\u00fchren<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-8\" href=\"https:\/\/convly.ai\/de\/gguf-models\/#Loading_an_arbitrary_GGUF_into_Ollama\" >Ein beliebiges GGUF-Modell in Ollama laden<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-9\" href=\"https:\/\/convly.ai\/de\/gguf-models\/#When_GGUF_is_the_wrong_answer\" >Wann GGUF die falsche Wahl ist<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-10\" href=\"https:\/\/convly.ai\/de\/gguf-models\/#Frequently_asked_questions\" >H\u00e4ufig gestellte Fragen<\/a><\/li><\/ul><\/nav><\/div>\n<h2><span class=\"ez-toc-section\" id=\"What_is_actually_inside_a_gguf_file\"><\/span>Was tats\u00e4chlich in einer .gguf-Datei steckt<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Eine GGUF-Datei besteht aus einem Header, einem Key-Value-Metadatenblock und anschlie\u00dfend den Tensordaten. Der Metadatenblock ist praktisch der entscheidende Teil \u2013 er ist der Grund daf\u00fcr, dass ein GGUF-Modell keine zus\u00e4tzlichen Begleitdateien ben\u00f6tigt. Die <a href=\"https:\/\/huggingface.co\/docs\/hub\/en\/gguf\" rel=\"noopener\" target=\"_blank\">GGUF-Dokumentation von Hugging Face<\/a> beschreibt den Aufbau sowie den integrierten GGUF-Metadaten-Viewer des Hugging Face Hub, mit dem Sie vor dem Download mehrerer Gigabyte bereits die Quantisierungsart, die Kontextl\u00e4nge und die Chat-Vorlage einer Datei einsehen k\u00f6nnen.<\/p>\n<p>Typische Metadatenschl\u00fcssel umfassen die Architektur (<code>llama<\/code>, <code>qwen3<\/code>, <code>gemma3<\/code>, <code>phi3<\/code>), die trainierte Kontextl\u00e4nge, RoPE-Einstellungen, das vollst\u00e4ndige Vokabular sowie die Jinja-Chat-Vorlage. Ein Loader liest diesen Block und konfiguriert sich selbst \u2013 Sie m\u00fcssen weder einen Tokenizer noch ein Prompt-Format manuell \u00fcbergeben.<\/p>\n<h3>GGUF im Vergleich zu safetensors<\/h3>\n<table>\n<thead>\n<tr>\n<th><\/th>\n<th>GGUF<\/th>\n<th>safetensors<\/th>\n<\/tr>\n<\/thead>\n<tbody>\n<tr>\n<td>Hauptlaufzeitumgebung<\/td>\n<td>llama.cpp, Ollama, LM Studio<\/td>\n<td>PyTorch, vLLM, Transformers, TGI<\/td>\n<\/tr>\n<tr>\n<td>Dateien pro Modell<\/td>\n<td>Eine (oder nummerierte Shards)<\/td>\n<td>Gewichte plus Konfigurations-\/Tokenizer-Ordner<\/td>\n<\/tr>\n<tr>\n<td>Quantisierung<\/td>\n<td>Eingebettet (Q4_K_M, Q8_0, IQ\u2026)<\/td>\n<td>\u00dcblicherweise FP16\/BF16 oder Varianten wie GPTQ\/AWQ<\/td>\n<\/tr>\n<tr>\n<td>CPU + teilweiser GPU-Offload<\/td>\n<td>Ja, dies ist ein zentrales Designziel<\/td>\n<td>Eingeschr\u00e4nkt und langsam<\/td>\n<\/tr>\n<tr>\n<td>Gleichzeitige, batch-basierte Bereitstellung<\/td>\n<td>Schwach<\/td>\n<td>Stark<\/td>\n<\/tr>\n<tr>\n<td>Feinabstimmung<\/td>\n<td>Nein (zuvor zur\u00fcckkonvertieren)<\/td>\n<td>Ja<\/td>\n<\/tr>\n<\/tbody>\n<\/table>\n<h2><span class=\"ez-toc-section\" id=\"How_to_read_a_GGUF_filename\"><\/span>Wie man einen GGUF-Dateinamen liest<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Dateien werden \u00fcblicherweise benannt als <code>Model-Name-8B-Instruct-Q4_K_M.gguf<\/code>Der Suffix gibt die Quantisierungsmischung an. Die Zahl steht f\u00fcr die nominelle Bitbreite; <code>_K<\/code> bedeutet k-Quantisierung, bei der Attention- und Embedding-Tensoren mit h\u00f6herer Genauigkeit gehalten werden als die Haupt-Gewichte der Feed-Forward-Schichten; <code>S<\/code>\/<code>M<\/code>\/<code>L<\/code> stehen f\u00fcr kleine, mittlere bzw. gro\u00dfe Varianten dieser Mischung.<\/p>\n<table>\n<thead>\n<tr>\n<th>Quantisierung<\/th>\n<th>Ca. Bits pro Gewicht<\/th>\n<th>Ca. Gr\u00f6\u00dfe, 8-B-Modell<\/th>\n<th>Wann Sie es verwenden sollten<\/th>\n<\/tr>\n<\/thead>\n<tbody>\n<tr>\n<td>Q8_0<\/td>\n<td>~8.5<\/td>\n<td>~8,5 GB<\/td>\n<td>Referenz mit nahezu verlustfreier Qualit\u00e4t; nur f\u00fcr kleine Modelle<\/td>\n<\/tr>\n<tr>\n<td>Q6_K<\/td>\n<td>~6.6<\/td>\n<td>~6,6 GB<\/td>\n<td>Sie haben VRAM im \u00dcberfluss<\/td>\n<\/tr>\n<tr>\n<td>Q5_K_M<\/td>\n<td>~5.7<\/td>\n<td>~5,7 GB<\/td>\n<td>Standard mit Schwerpunkt auf Qualit\u00e4t<\/td>\n<\/tr>\n<tr>\n<td>Q4_K_M<\/td>\n<td>~4.9<\/td>\n<td>~4,9 GB<\/td>\n<td><strong>Der \u00fcbliche Standard<\/strong><\/td>\n<\/tr>\n<tr>\n<td>Q4_0<\/td>\n<td>~4.5<\/td>\n<td>~4,5 GB<\/td>\n<td>Veraltet; einige Beschleuniger bevorzugen dieses Format<\/td>\n<\/tr>\n<tr>\n<td>Q3_K_M<\/td>\n<td>~3.9<\/td>\n<td>~4,0 GB<\/td>\n<td>Ein gr\u00f6\u00dferes Modell in wenig VRAM unterbringen<\/td>\n<\/tr>\n<tr>\n<td>Q2_K \/ IQ2<\/td>\n<td>~2,5\u20133,4<\/td>\n<td>~2,5\u20133,4 GB<\/td>\n<td>Letztes Mittel; sp\u00fcrbare Qualit\u00e4tsminderung<\/td>\n<\/tr>\n<\/tbody>\n<\/table>\n<p>Behandeln Sie die Spalte \u201eBits pro Gewicht\u201c als ungef\u00e4hre Angabe. Die tats\u00e4chlichen Gr\u00f6\u00dfen variieren je nach Modellarchitektur (ein gro\u00dfer Vokabularumfang vergr\u00f6\u00dfert die Embedding-Tensoren) und je nach llama.cpp-Version, da die Quantisierungsmischungen im Laufe der Zeit optimiert werden. Die <code>IQ<\/code> Familie (von IQ2_XXS bis IQ4_NL) nutzt eine Kalibrierung anhand einer Wichtigkeitsmatrix, um bei sehr niedrigen Bitbreiten besser zu halten; zudem ver\u00f6ffentlichen Entwickler wie Bartowski und Unsloth neben den Standard-K-Quanten auch eigene IQ-Varianten.<\/p>\n<p>Die Community-Konsensmeinung \u2013 nicht eine Messung durch Convly \u2013 besagt, dass Q4_K_M der optimale Kompromiss ist und dass die Qualit\u00e4t unterhalb von etwa 3 Bits pro Gewicht stark abf\u00e4llt: Kleinere Modelle verschlechtern sich bei gleicher Quantisierung schneller als gr\u00f6\u00dfere.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Sizing_which_GGUF_models_fit_your_GPU\"><\/span>Gr\u00f6\u00dfenabsch\u00e4tzung: Welche GGUF-Modelle passen auf Ihre GPU?<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Die angegebene Dateigr\u00f6\u00dfe stellt lediglich die Untergrenze dar, nicht den Gesamtspeicherbedarf. Hinzu kommen der KV-Cache f\u00fcr Ihre Kontextl\u00e4nge sowie ein Overhead von ca. 500 MB bis 1 GB. Diese 4-Bit-Angaben stammen aus dem <a href=\"https:\/\/convly.ai\/de\/models\/\">Convly-Modell-Datenbank<\/a>:<\/p>\n<table>\n<thead>\n<tr>\n<th>Modell<\/th>\n<th>VRAM bei 4-Bit<\/th>\n<th>Kontext<\/th>\n<th>realistischen GPU-<\/th>\n<\/tr>\n<\/thead>\n<tbody>\n<tr>\n<td>Gemma 3 4B<\/td>\n<td>ca. 3 GB<\/td>\n<td>128 K<\/td>\n<td>Jede 6-GB-Karte, integrierte GPU<\/td>\n<\/tr>\n<tr>\n<td>Mistral 7B<\/td>\n<td>~4,5 GB<\/td>\n<td>32K<\/td>\n<td>8-GB-Karte<\/td>\n<\/tr>\n<tr>\n<td>Llama 3.1 8B<\/td>\n<td>~5 GB<\/td>\n<td>128 K<\/td>\n<td>8-GB-Karte<\/td>\n<\/tr>\n<tr>\n<td>Qwen3 14B<\/td>\n<td>~9 GB<\/td>\n<td>128 K<\/td>\n<td>12-GB-Karte<\/td>\n<\/tr>\n<tr>\n<td>Phi-4<\/td>\n<td>~9 GB<\/td>\n<td>16K<\/td>\n<td>12-GB-Karte<\/td>\n<\/tr>\n<tr>\n<td>Gemma 3 27B<\/td>\n<td>~16 GB<\/td>\n<td>128 K<\/td>\n<td>24-GB-Karte<\/td>\n<\/tr>\n<tr>\n<td>Qwen3 32B<\/td>\n<td>~20 GB<\/td>\n<td>128 K<\/td>\n<td>24-GB-Karte<\/td>\n<\/tr>\n<tr>\n<td>Llama 3.3 70B<\/td>\n<td>~40 GB<\/td>\n<td>128 K<\/td>\n<td>2\u00d724 GB oder 48 GB einheitlicher Arbeitsspeicher<\/td>\n<\/tr>\n<tr>\n<td>DeepSeek R1 (vollst\u00e4ndig)<\/td>\n<td>~400 GB<\/td>\n<td>128 K<\/td>\n<td>Nur f\u00fcr Multi-GPU-Server<\/td>\n<\/tr>\n<\/tbody>\n<\/table>\n<p>Mixture-of-experts models are the trap here. Qwen3 30B-A3B activates only ~3B parameters per token but still needs all ~18 GB resident. At the extreme, the database puts Kimi K3 at ~1.4 TB at 4-bit \u2014 a GGUF exists in principle, but no single machine you own will hold it. For an exact figure at your context length, use the <a href=\"https:\/\/convly.ai\/de\/llm-vram-calculator\/\">VRAM-Rechner<\/a> oder die modellspezifische Aufschl\u00fcsselung in <a href=\"https:\/\/convly.ai\/de\/vram-requirements-every-major-llm-2026\/\">VRAM-Anforderungen f\u00fcr alle wichtigen Sprachmodelle<\/a>. Falls Sie noch Hardware ausw\u00e4hlen, behandelt <a href=\"https:\/\/convly.ai\/de\/best-gpus-for-local-llms-2026\/\">beste GPUs f\u00fcr lokale LLMs<\/a> den Kompromiss zwischen VRAM und Preis pro Dollar.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Where_to_download_GGUF_models\"><\/span>Wo man GGUF-Modelle herunterl\u00e4dt<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<ul>\n<li><strong>Hugging Face<\/strong> \u2013 filtern Sie die Modellliste mit <a href=\"https:\/\/huggingface.co\/models?library=gguf\" rel=\"noopener\" target=\"_blank\">library=gguf<\/a>. Die meisten Repositories stellen s\u00e4mtliche Quantisierungen in einem einzigen Repository bereit; laden Sie daher ausschlie\u00dflich die ben\u00f6tigte Datei herunter, nicht das gesamte Repository.<\/li>\n<li><strong>Ollama-Bibliothek<\/strong> \u2014 <a href=\"https:\/\/ollama.com\/library\" rel=\"noopener\" target=\"_blank\">ollama.com\/library<\/a> bietet vorkonfigurierte GGUF-Dateien mit bereits eingebauter Chatvorlage. Weitere Informationen finden Sie im <a href=\"https:\/\/convly.ai\/de\/ollama-models-list-2026\/\">Ollama-Modellliste<\/a>.<\/li>\n<li><strong>LM Studio<\/strong> \u2013 die interne Registerkarte \u201eDiscover\u201c durchsucht Hugging Face GGUF-Repos und kennzeichnet, welche Quantisierungen in Ihr erkanntes RAM\/VRAM passen. Anleitung: <a href=\"https:\/\/convly.ai\/de\/lm-studio-complete-guide-2026\/\">LM Studio \u2013 umfassende Anleitung<\/a>.<\/li>\n<\/ul>\n<p>Gro\u00dfe Modelle werden fragmentiert als <code>model-00001-of-00003.gguf<\/code> usw. bereitgestellt. Laden Sie alle Fragmente in denselben Ordner herunter und geben Sie beim Laden die Datei \u201e00001\u201c an \u2013 der Loader findet automatisch die restlichen Fragmente.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Running_GGUF_models_on_Linux\"><\/span>GGUF-Modelle unter Linux ausf\u00fchren<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Bauen Sie llama.cpp mit CUDA-Unterst\u00fctzung:<\/p>\n<pre><code>git clone https:\/\/github.com\/ggml-org\/llama.cpp\ncd llama.cpp\ncmake -B build -DGGML_CUDA=ON\ncmake --build build --config Release -j<\/code><\/pre>\n<p>Die Bin\u00e4rdateien befinden sich in <code>build\/bin\/<\/code>. Starten Sie einen OpenAI-kompatiblen Server:<\/p>\n<pre><code>.\/build\/bin\/llama-server -m ~\/models\/model-Q4_K_M.gguf -c 8192 -ngl 99 --port 8080<\/code><\/pre>\n<p><code>-ngl<\/code> (<code>--n-gpu-layers<\/code>) ist der Offload-Regler: <code>99<\/code> bedeutet \u201ealle Layer auf der GPU\u201c <code>0<\/code> bedeutet rein CPU-betrieb, und Zwischenwerte teilen das Modell, wenn es nicht vollst\u00e4ndig in die GPU passt. <code>-c<\/code> legt den Kontext fest; die Verwendung des vollst\u00e4ndigen, vom Modell trainierten Kontexts kann mehr VRAM beanspruchen als die Gewichte selbst. Der Endpunkt lautet dann <code>http:\/\/localhost:8080\/v1\/chat\/completions<\/code>.<\/p>\n<p>Zwei Versionshinweise: Der CMake-Flag hie\u00df in \u00e4lteren Versionen <code>LLAMA_CUBLAS<\/code> und die Bin\u00e4rdateien wurden 2024 umbenannt (von<code>main<\/code> \u2192 <code>llama-cli<\/code>, <code>server<\/code> \u2192 <code>llama-server<\/code>). Pr\u00fcfen Sie die README-Datei des von Ihnen geklonten Repositories. F\u00fcr AMD- oder Intel-GPUs verwenden Sie stattdessen das dort dokumentierte ROCm-\/Vulkan-\/SYCL-Backend statt zu raten.<\/p>\n<p>Wenn Sie stattdessen Ollama nutzen, befinden sich die Modelle in <code>\/usr\/share\/ollama\/.ollama\/models<\/code> bei Systemdienst-Betrieb oder <code>~\/.ollama\/models<\/code> f\u00fcr eine Benutzerinstallation. Siehe <a href=\"https:\/\/convly.ai\/de\/how-to-install-ollama-2026\/\">So installieren Sie Ollama<\/a>.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Running_GGUF_models_on_macOS\"><\/span>GGUF-Modelle unter macOS ausf\u00fchren<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Apple Silicon ist bei GGUF ungew\u00f6hnlich leistungsf\u00e4hig, da der Unified Memory es der GPU erm\u00f6glicht, auf den Gro\u00dfteil des Systemspeichers zuzugreifen \u2013 ein Mac mit 64 GB RAM kann beispielsweise ein rund 40 GB gro\u00dfes 4-Bit-70B-Modell laden, das auf einem PC zwei 24-GB-GPU-Karten erfordern w\u00fcrde.<\/p>\n<pre><code>brew install llama.cpp\nllama-server -m ~\/models\/model-Q4_K_M.gguf -c 8192 --port 8080<\/code><\/pre>\n<p>Die Metal-Offload-Funktion ist in der Homebrew-Version aktiviert, sodass Sie in der Regel nicht <code>-ngl<\/code>. macOS begrenzt, wie viel Arbeitsspeicher die GPU beanspruchen darf (einstellbar \u00fcber einen <code>iogpu<\/code> sysctl-Parameter, dessen Name je nach macOS-Version variiert); lassen Sie daher ausreichend Speicher f\u00fcr das Betriebssystem frei. Ollama speichert Modelle in <code>~\/.ollama\/models<\/code>; LM Studio verwendet hingegen <code>~\/.lmstudio\/models<\/code> in aktuellen Versionen und <code>~\/.cache\/lm-studio\/models<\/code> in \u00e4lteren Versionen \u2013 die Registerkarte \u201eMeine Modelle\u201c zeigt den tats\u00e4chlichen Pfad an und erm\u00f6glicht dessen \u00c4nderung.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Running_GGUF_models_on_Windows\"><\/span>GGUF-Modelle unter Windows ausf\u00fchren<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Drei Wege \u2013 vom einfachsten zum anspruchsvollsten:<\/p>\n<ol>\n<li><strong>LM Studio<\/strong> \u2013 GUI-Installer, integrierte Modellsuche innerhalb der Anwendung sowie ein Umschalter f\u00fcr den lokalen Server. Beste Standardl\u00f6sung f\u00fcr Nichtentwickler.<\/li>\n<li><strong>Ollama<\/strong> \u2013 nativer Windows-Installer; Modelle werden standardm\u00e4\u00dfig in <code>C:\\Users&lt;Sie&gt;\\.ollama\\models<\/code>gespeichert. Legen Sie die Umgebungsvariable <code>OLLAMA_MODELS<\/code> fest, um sie von dem Systemlaufwerk zu verschieben. Hintergrundinformation: <a href=\"https:\/\/convly.ai\/de\/what-is-ollama-complete-guide-2026\/\">Was ist Ollama?<\/a>.<\/li>\n<li><strong>Vorkompilierte llama.cpp-Bin\u00e4rdateien<\/strong> \u2013 die GitHub-Releases-Seite stellt pro Backend (CUDA, Vulkan, CPU) komprimierte Windows-Builds bereit. Entpacken Sie die ZIP-Datei und f\u00fchren Sie in PowerShell <code>llama-server.exe -m model.gguf -ngl 99<\/code> aus. W\u00e4hlen Sie den CUDA-Build f\u00fcr NVIDIA-GPUs; Vulkan ist die sichere, plattform\u00fcbergreifende Alternative f\u00fcr AMD- und Intel-Arc-GPUs.<\/li>\n<\/ol>\n<p>Windows-spezifische Fallstricke: Die Echtzeit-\u00dcberwachung durch Windows Defender verlangsamt das erste Laden einer mehrere Gigabyte gro\u00dfen Datei deutlich; zudem kostet der Betrieb von llama.cpp innerhalb von WSL2 einen Teil des Arbeitsspeichers f\u00fcr die virtuelle Maschine. Native Windows-Builds sind daher meist der einfachere Weg.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Loading_an_arbitrary_GGUF_into_Ollama\"><\/span>Ein beliebiges GGUF-Modell in Ollama laden<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Aktuelle Ollama-Versionen k\u00f6nnen Modelle direkt von Hugging Face ziehen:<\/p>\n<pre><code>ollama run hf.co\/\/:Q4_K_M<\/code><\/pre>\n<p>F\u00fcr eine lokale Datei erstellen Sie eine Modelfile im selben Verzeichnis:<\/p>\n<pre><code>FROM .\/model-Q4_K_M.gguf<\/code><\/pre>\n<p>dann <code>ollama create my-model -f Modelfile<\/code> und <code>ollama run my-model<\/code>. Falls die GGUF-Datei keine verwendbare Chatvorlage enth\u00e4lt, f\u00fcgen Sie eine <code>TEMPLATE<\/code> und <code>PARAMETER stop<\/code> -Zeile hinzu \u2013 die genauen Modelfile-Direktiven haben sich im Laufe der Versionen weiterentwickelt; pr\u00fcfen Sie daher bitte <code>ollama help create<\/code> f\u00fcr Ihre konkrete Version. Empfohlene Auswahl: <a href=\"https:\/\/convly.ai\/de\/best-local-llms-to-run-on-ollama-2026\/\">beste lokale LLMs f\u00fcr Ollama<\/a>.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"When_GGUF_is_the_wrong_answer\"><\/span>Wann GGUF die falsche Wahl ist<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>GGUF optimizes one user at a time. Serving many concurrent requests, or needing tensor parallelism across GPUs, points to safetensors with vLLM or SGLang. And running locally is not automatically cheaper: hosted Llama 3.3 70B is $0.10 in \/ $0.32 out per 1M tokens, while frontier hosted models like Claude Sonnet 5 sit at $2.00 in \/ $10.00 out per 1M tokens for 1M context. Run your own volume through the <a href=\"https:\/\/convly.ai\/de\/ai-api-cost-calculator\/\">API-Kostenrechner<\/a> und das <a href=\"https:\/\/convly.ai\/de\/self-hosting-vs-api-calculator\/\">Selbsthosting- versus-API-Kosten-Grenzwert-Rechner<\/a> durch.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Frequently_asked_questions\"><\/span>H\u00e4ufig gestellte Fragen<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<h3>Was bedeutet GGUF, und worin unterscheidet es sich von GGML?<\/h3>\n<p>GGUF steht f\u00fcr GPT-Generated Unified Format. GGML war das fr\u00fchere Format desselben Projekts; es brach stets dann die Kompatibilit\u00e4t, wenn neue Metadaten ben\u00f6tigt wurden. GGUF f\u00fchrte einen erweiterbaren Schl\u00fcssel-Wert-Metadatenblock ein, sodass neue Architekturen und Optionen hinzugef\u00fcgt werden k\u00f6nnen, ohne bestehende Dateien ung\u00fcltig zu machen. Vor-GGUF- <code>.bin<\/code> GGML-Dateien werden von aktuellem llama.cpp nicht mehr geladen.<\/p>\n<h3>Welche Quantisierung soll ich herunterladen?<\/h3>\n<p>Beginnen Sie mit Q4_K_M. Wenn das Modell noch mehrere GB VRAM frei l\u00e4sst, steigen Sie auf Q5_K_M oder Q6_K auf. Passt es nicht hinein, bevorzugen Sie ein kleineres Modell in Q4_K_M gegen\u00fcber demselben Modell in Q2_K \u2013 ein 14B-Modell im 4-Bit-Format schneidet in der Regel besser ab als ein 32B-Modell, das auf 2 Bit herunterkomprimiert wurde. Pr\u00fcfen Sie die Passgenauigkeit mit dem <a href=\"https:\/\/convly.ai\/de\/llm-vram-calculator\/\">VRAM-Rechner<\/a> bei Ihrer geplanten Kontextl\u00e4nge.<\/p>\n<h3>Kann ich GGUF-Modelle ohne GPU ausf\u00fchren?<\/h3>\n<p>Yes \u2014 CPU-only inference is what GGUF was built for. Speed is bound by memory bandwidth, so expect single-digit tokens per second for a 7B\u20138B model at Q4_K_M on typical dual-channel desktop RAM, and slower for anything larger. Small models like Gemma 3 4B (~3 GB at 4-bit) are the practical CPU-only choice.<\/p>\n<h3>Kann ich ein Hugging Face-Modell selbst in das GGUF-Format konvertieren?<\/h3>\n<p>Ja. llama.cpp liefert ein Konvertierungsskript mit (<code>convert_hf_to_gguf.py<\/code> in aktuellen Versionen; der Dateiname verwendete in \u00e4lteren Versionen Bindestriche), das zun\u00e4chst eine F16-GGUF-Datei erzeugt, die anschlie\u00dfend vom <code>llama-quantize<\/code> Binary auf eine Zielquantisierung komprimiert wird. Pr\u00fcfen Sie die <code>--help<\/code> -Option des Skripts in Ihrer geklonten Version und vergewissern Sie sich vorab, dass Ihre Architektur unterst\u00fctzt wird \u2013 nicht unterst\u00fctzte Architekturen scheitern bereits bei der Konvertierung.<\/p>\n<h3>Unterst\u00fctzen GGUF-Modelle Multimodalit\u00e4t (z.\u202fB. Vision) oder Tool Calling?<\/h3>\n<p>Tool Calling funktioniert dort, wo die Chatvorlage des Modells dies definiert und Ihr Loader die Vorlage respektiert. Multimodale Modelle ben\u00f6tigen zus\u00e4tzlich eine zweite Datei \u2013 eine <code>mmproj<\/code> -GGUF-Datei mit dem Vision-Projector, die gemeinsam mit den Text-Gewichten geladen wird. Die multimodalen Werkzeuge in llama.cpp wurden bereits mehrfach umbenannt und neu strukturiert; orientieren Sie sich daher an der aktuellen Repository-Dokumentation statt an veralteten Tutorials.<\/p>\n<h3>\u00c4ndert die Quantisierung das Kontextfenster?<\/h3>\n<p>Nein. Der Kontext ist eine Eigenschaft des Modells, nicht der Quantisierung: Llama 3.3 70B hat 128K Kontextl\u00e4nge und Llama 4 Scout 10M \u2013 unabh\u00e4ngig davon, ob Sie im F16- oder Q4_K_M-Format arbeiten. Was sich \u00e4ndert, ist lediglich, ob Sie den KV-Cache f\u00fcr diesen Kontext im verf\u00fcgbaren Speicher unterbringen k\u00f6nnen. Vergleichen Sie Kontextl\u00e4nge und Preise verschiedener Modelle auf der <a href=\"https:\/\/convly.ai\/de\/llm-leaderboard\/\">LLM-Leaderboard<\/a>.<\/p>","protected":false},"excerpt":{"rendered":"<p>GGUF is a single-file container format for quantized models, created for llama.cpp. One .gguf file holds the weights, the tokenizer, [\u2026]<\/p>\n","protected":false},"author":1,"featured_media":2606,"comment_status":"closed","ping_status":"closed","sticky":false,"template":"","format":"standard","meta":{"site-sidebar-layout":"default","site-content-layout":"","ast-site-content-layout":"default","site-content-style":"default","site-sidebar-style":"default","ast-global-header-display":"","ast-banner-title-visibility":"","ast-main-header-display":"","ast-hfb-above-header-display":"","ast-hfb-below-header-display":"","ast-hfb-mobile-header-display":"","site-post-title":"","ast-breadcrumbs-content":"","ast-featured-img":"","footer-sml-layout":"","ast-disable-related-posts":"","theme-transparent-header-meta":"","adv-header-id-meta":"","stick-header-meta":"","header-above-stick-meta":"","header-main-stick-meta":"","header-below-stick-meta":"","astra-migrate-meta-layouts":"default","ast-page-background-enabled":"default","ast-page-background-meta":{"desktop":{"background-color":"var(--ast-global-color-5)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"tablet":{"background-color":"","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"mobile":{"background-color":"","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""}},"ast-content-background-meta":{"desktop":{"background-color":"var(--ast-global-color-4)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"tablet":{"background-color":"var(--ast-global-color-4)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"mobile":{"background-color":"var(--ast-global-color-4)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""}},"footnotes":""},"categories":[7],"tags":[],"class_list":["post-2605","post","type-post","status-publish","format-standard","has-post-thumbnail","hentry","category-ai-news"],"_links":{"self":[{"href":"https:\/\/convly.ai\/de\/wp-json\/wp\/v2\/posts\/2605","targetHints":{"allow":["GET"]}}],"collection":[{"href":"https:\/\/convly.ai\/de\/wp-json\/wp\/v2\/posts"}],"about":[{"href":"https:\/\/convly.ai\/de\/wp-json\/wp\/v2\/types\/post"}],"author":[{"embeddable":true,"href":"https:\/\/convly.ai\/de\/wp-json\/wp\/v2\/users\/1"}],"replies":[{"embeddable":true,"href":"https:\/\/convly.ai\/de\/wp-json\/wp\/v2\/comments?post=2605"}],"version-history":[{"count":1,"href":"https:\/\/convly.ai\/de\/wp-json\/wp\/v2\/posts\/2605\/revisions"}],"predecessor-version":[{"id":2607,"href":"https:\/\/convly.ai\/de\/wp-json\/wp\/v2\/posts\/2605\/revisions\/2607"}],"wp:featuredmedia":[{"embeddable":true,"href":"https:\/\/convly.ai\/de\/wp-json\/wp\/v2\/media\/2606"}],"wp:attachment":[{"href":"https:\/\/convly.ai\/de\/wp-json\/wp\/v2\/media?parent=2605"}],"wp:term":[{"taxonomy":"category","embeddable":true,"href":"https:\/\/convly.ai\/de\/wp-json\/wp\/v2\/categories?post=2605"},{"taxonomy":"post_tag","embeddable":true,"href":"https:\/\/convly.ai\/de\/wp-json\/wp\/v2\/tags?post=2605"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}