{"id":2103,"date":"2026-08-03T20:03:24","date_gmt":"2026-08-03T20:03:24","guid":{"rendered":"https:\/\/convly.ai\/?p=2103"},"modified":"2026-08-03T20:03:24","modified_gmt":"2026-08-03T20:03:24","slug":"what-is-gguf-format-explained","status":"publish","type":"post","link":"https:\/\/convly.ai\/de\/what-is-gguf-format-explained\/","title":{"rendered":"Was ist GGUF? Das LLM-Dateiformat hinter Ollama und llama.cpp im \u00dcberblick"},"content":{"rendered":"<div class=\"convly-tldr\">\n<ul>\n<li><strong>GGUF ist das Dateiformat zum lokalen Ausf\u00fchren von Sprachmodellen.<\/strong> It packs a model&#8217;s weights, tokenizer and configuration into a single binary file that llama.cpp, Ollama, LM Studio and most other local-LLM tools load directly.<\/li>\n<li><strong>Es ersetzte GGML im August 2023,<\/strong> da GGML-Dateien bei jeder Format\u00e4nderung besch\u00e4digt wurden. GGUF hingegen ist versioniert und erweiterbar, sodass \u00e4ltere Dateien weiterhin funktionieren.<\/li>\n<li><strong>Die Dateierweiterung gibt die Quantisierung an.<\/strong> Q4_K_M (~4,9 GB f\u00fcr ein 8B-Modell) ist die Standard-Qualit\u00e4ts-\/Gr\u00f6\u00dfeneinstellung; Q8_0 ist nahezu verlustfrei mit ~8,5 GB; F16 ist nicht quantisiert.<\/li>\n<li><strong>Faustregel:<\/strong> W\u00e4hlen Sie die gr\u00f6\u00dftm\u00f6gliche Quantisierung, deren Dateigr\u00f6\u00dfe mit 1\u20132 GB Reserve f\u00fcr den Kontext in Ihre VRAM passt.<\/li>\n<\/ul>\n<\/div>\n<p>GGUF (\u00fcblicherweise als \u201aGPT-Generated Unified Format\u2018 ausgef\u00fchrt) ist ein bin\u00e4res Dateiformat zur Speicherung gro\u00dfer Sprachmodelle: Es enth\u00e4lt Gewichte, Tokenizer und s\u00e4mtliche Konfigurationsmetadaten in einer einzigen, eigenst\u00e4ndigen Datei. Es ist das native Format von <strong>llama.cpp<\/strong>, und es ist das Format, das <strong>Ollama<\/strong>, <strong>LM Studio<\/strong>, KoboldCpp, Jan und die meisten anderen lokalen LLM-Anwendungen tats\u00e4chlich ausf\u00fchren. Wenn Sie jemals eine Datei mit der Endung <code>.gguf<\/code>heruntergeladen oder ein Modell mittels <code>ollama run<\/code>abgerufen haben, haben Sie dieses Format verwendet.<\/p>\n<div id=\"ez-toc-container\" class=\"ez-toc-v2_0_85 counter-flat ez-toc-counter ez-toc-container-direction\">\n<label for=\"ez-toc-cssicon-toggle-item-6a71292e89047\" class=\"ez-toc-cssicon-toggle-label\"><span class=\"\"><span class=\"eztoc-hide\" style=\"display:none;\">Umschalten<\/span><span class=\"ez-toc-icon-toggle-span\"><svg style=\"fill: #000000;color:#000000\" xmlns=\"http:\/\/www.w3.org\/2000\/svg\" class=\"list-377408\" width=\"20px\" height=\"20px\" viewbox=\"0 0 24 24\" fill=\"none\"><path d=\"M6 6H4v2h2V6zm14 0H8v2h12V6zM4 11h2v2H4v-2zm16 0H8v2h12v-2zM4 16h2v2H4v-2zm16 0H8v2h12v-2z\" fill=\"currentColor\"><\/path><\/svg><svg style=\"fill: #000000;color:#000000\" class=\"arrow-unsorted-368013\" xmlns=\"http:\/\/www.w3.org\/2000\/svg\" width=\"10px\" height=\"10px\" viewbox=\"0 0 24 24\" version=\"1.2\" baseprofile=\"tiny\"><path d=\"M18.2 9.3l-6.2-6.3-6.2 6.3c-.2.2-.3.4-.3.7s.1.5.3.7c.2.2.4.3.7.3h11c.3 0 .5-.1.7-.3.2-.2.3-.5.3-.7s-.1-.5-.3-.7zM5.8 14.7l6.2 6.3 6.2-6.3c.2-.2.3-.5.3-.7s-.1-.5-.3-.7c-.2-.2-.4-.3-.7-.3h-11c-.3 0-.5.1-.7.3-.2.2-.3.5-.3.7s.1.5.3.7z\"\/><\/svg><\/span><\/span><\/label><input type=\"checkbox\"  id=\"ez-toc-cssicon-toggle-item-6a71292e89047\"  aria-label=\"Umschalten\" \/><nav><ul class='ez-toc-list ez-toc-list-level-1' ><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-1\" href=\"https:\/\/convly.ai\/de\/what-is-gguf-format-explained\/#What_a_GGUF_file_actually_contains\" >Was eine GGUF-Datei tats\u00e4chlich enth\u00e4lt<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-2\" href=\"https:\/\/convly.ai\/de\/what-is-gguf-format-explained\/#Why_GGUF_replaced_GGML\" >Warum GGUF GGML ersetzt hat<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-3\" href=\"https:\/\/convly.ai\/de\/what-is-gguf-format-explained\/#How_to_read_the_quantisation_suffixes\" >Wie man die Quantisierungserweiterungen liest<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-4\" href=\"https:\/\/convly.ai\/de\/what-is-gguf-format-explained\/#Picking_a_quantisation_for_your_VRAM\" >Auswahl einer geeigneten Quantisierung f\u00fcr Ihre VRAM<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-5\" href=\"https:\/\/convly.ai\/de\/what-is-gguf-format-explained\/#GGUF_vs_safetensors\" >GGUF im Vergleich zu safetensors<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-6\" href=\"https:\/\/convly.ai\/de\/what-is-gguf-format-explained\/#Where_GGUF_files_come_from\" >Woher GGUF-Dateien stammen<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-7\" href=\"https:\/\/convly.ai\/de\/what-is-gguf-format-explained\/#Frequently_asked_questions\" >H\u00e4ufig gestellte Fragen<\/a><\/li><\/ul><\/nav><\/div>\n<h2><span class=\"ez-toc-section\" id=\"What_a_GGUF_file_actually_contains\"><\/span>Was eine GGUF-Datei tats\u00e4chlich enth\u00e4lt<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Eine GGUF-Datei beginnt mit den vier ASCII-Bytes <code>GGUF<\/code>, gefolgt von einer Versionsnummer, einem Schl\u00fcssel-Wert-Metadatenabschnitt und anschlie\u00dfend den Tensoren selbst. Die Metadaten stellen die entscheidende Designentscheidung dar: Sie speichern Architektur, Kontextl\u00e4nge, Tokenizer-Vokabular, Chat-Vorlage und Quantisierungsdetails als benannte Schl\u00fcssel, sodass eine Laufzeitumgebung jede GGUF-Datei laden kann, ohne separate <code>config.json<\/code> oder Tokenizer-Dateien daneben.<\/p>\n<p>Daraus ergeben sich drei praktische Konsequenzen:<\/p>\n<ul>\n<li><strong>Eine Datei ist das gesamte Modell.<\/strong> Sie k\u00f6nnen eine <code>.gguf<\/code> Datei zwischen Rechnern kopieren, und sie funktioniert sofort. (Sehr gro\u00dfe Modelle werden manchmal in nummerierte Teile wie <code>-00001-of-00002.gguf<\/code>aufgeteilt, doch handelt es sich dabei immer noch um ein logisches Modell.)<\/li>\n<li><strong>Die Datei ist speicherabbildbar (memory-mappable).<\/strong> Laufzeitumgebungen k\u00f6nnen die Datei mittels <code>mmap<\/code> abbilden und Gewichte bei Bedarf seitenweise laden \u2013 dadurch erfolgt das Laden schnell, und selbst Modelle, die gr\u00f6\u00dfer als der verf\u00fcgbare Arbeitsspeicher sind, k\u00f6nnen gestartet werden.<\/li>\n<li><strong>Quantisierung ist fest in das Format integriert.<\/strong> Eine GGUF-Datei speichert bereits komprimierte Gewichte mit 2 bis 8 Bit pro Gewicht; daher kann ein Modell mit acht Milliarden Parametern beispielsweise eine 4,9-GB-Datei statt einer 16-GB-Datei sein.<\/li>\n<\/ul>\n<h2><span class=\"ez-toc-section\" id=\"Why_GGUF_replaced_GGML\"><\/span>Warum GGUF GGML ersetzt hat<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Vor August 2023 verwendete llama.cpp ein Format namens GGML (benannt nach der zugrundeliegenden Tensor-Bibliothek). GGML funktionierte zwar, wies aber einen strukturellen Nachteil auf: Die Dateistruktur war starr und nicht versioniert. Jedes Mal, wenn llama.cpp eine neue Funktion hinzuf\u00fcgte \u2013 etwa neue Architekturen, verbesserte Quantisierungsmethoden oder RoPE-Skalierungsparameter \u2013 musste das Format angepasst werden, wodurch s\u00e4mtliche bestehenden Modell-Dateien auf jedem Datentr\u00e4ger unbrauchbar wurden. Nutzer mussten ihre gesamten Modellsammlungen innerhalb weniger Monate mehrfach neu herunterladen oder konvertieren.<\/p>\n<p>GGUF, das im August 2023 vom llama.cpp-Projekt eingef\u00fchrt wurde, l\u00f6ste dieses Problem mit zwei \u00c4nderungen:<\/p>\n<ul>\n<li><strong>Versionierung.<\/strong> Die Datei deklariert ihre Formatversion, sodass Leseprogramme genau wissen, wie sie sie parsen m\u00fcssen.<\/li>\n<li><strong>Erweiterbare Schl\u00fcssel-Wert-Metadaten.<\/strong> Neue Informationen (z.\u202fB. ein neues Architekturfeld, eine Chat-Vorlage oder ein zus\u00e4tzlicher Hyperparameter) werden einfach als neuer Schl\u00fcssel hinzugef\u00fcgt. Alte Dateien ohne diesen Schl\u00fcssel lassen sich weiterhin laden; neue Dateien mit dem Schl\u00fcssel funktionieren in aktualisierten Laufzeitumgebungen. Es kommt zu keiner r\u00fcckwirkenden Inkompatibilit\u00e4t.<\/li>\n<\/ul>\n<p>llama.cpp stellte die Unterst\u00fctzung f\u00fcr GGML kurz danach ein, und das gesamte \u00d6kosystem folgte diesem Schritt. Heute lebt GGML lediglich noch als Name der zugrundeliegenden Tensor-Bibliothek fort; sollten Sie eine <code>.ggml<\/code> oder <code>.bin<\/code> Modell-Datei aus dem Jahr 2023 finden, wird sie von keinem aktuellen Tool geladen \u2013 laden Sie stattdessen besser eine GGUF-Version herunter.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"How_to_read_the_quantisation_suffixes\"><\/span>Wie man die Quantisierungserweiterungen liest<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Jeder GGUF-Dateiname enth\u00e4lt ein Suffix wie <code>Q4_K_M<\/code> , das angibt, wie stark die Gewichte komprimiert wurden. Das Muster lautet:<\/p>\n<ul>\n<li><strong>Die Zahl nach Q<\/strong> gibt die ungef\u00e4hre Bitanzahl pro Gewicht an: Q4 \u2248 4 Bit, Q8 \u2248 8 Bit. Weniger Bits bedeuten eine kleinere Datei und geringere Qualit\u00e4t.<\/li>\n<li><strong>_K<\/strong> markiert die neueren \u201ek-quant\u201c-Methoden, die zus\u00e4tzliche Bits auf die Tensoren verwenden, die f\u00fcr die Ausgabequalit\u00e4t am wichtigsten sind. Bei gleicher Dateigr\u00f6\u00dfe \u00fcbertrifft eine K-Quantisierung die \u00e4ltere Variante.<\/li>\n<li><strong>_S \/ _M \/ _L<\/strong> (small\/medium\/large) sind Varianten innerhalb einer K-Familie \u2013 <code>_M<\/code> beh\u00e4lt einige besonders empfindliche Tensoren mit h\u00f6herer Genauigkeit als <code>_S<\/code>.<\/li>\n<li><strong>_0<\/strong> (wie in <code>Q8_0<\/code>, <code>Q4_0<\/code>) kennzeichnet die \u00e4ltere, einfachere Block-Quantisierung. <code>Q8_0<\/code> wird nach wie vor h\u00e4ufig verwendet, da die einfache Methode bei 8 Bit bereits nahezu verlustfrei ist; <code>Q4_0<\/code> ist weitgehend veraltet \u2013 bevorzugen Sie stattdessen <code>Q4_K_M<\/code>.<\/li>\n<li><strong>IQ<\/strong> -Pr\u00e4fixe (<code>IQ2_M<\/code>, <code>IQ3_XS<\/code>\u2026) sind sogenannte \u201ei-quants\u201c, die mithilfe einer Wichtigkeitsmatrix erstellt werden und es erm\u00f6glichen, Modelle unter 4 Bit zu komprimieren, wobei die Qualit\u00e4t weniger stark leidet als bei Alternativen.<\/li>\n<li><strong>F16 \/ BF16 \/ F32<\/strong> bedeutet nicht quantisierte 16- oder 32-Bit-Gewichte \u2013 die Referenzqualit\u00e4t bei maximaler Dateigr\u00f6\u00dfe.<\/li>\n<\/ul>\n<p>Im Folgenden sehen Sie die praktischen Kosten der g\u00e4ngigen Optionen am Beispiel von Llama-\u00e4hnlichen 8-Milliarden-Parameter-Instruct-Modellen (Gr\u00f6\u00dfenangaben sind ann\u00e4hernd und variieren je nach Modell leicht):<\/p>\n<table>\n<thead>\n<tr>\n<th>Quantisierung<\/th>\n<th>Dateigr\u00f6\u00dfe (8B-Modell)<\/th>\n<th>Qualit\u00e4t im Vergleich zu F16<\/th>\n<th>Wann einzusetzen<\/th>\n<\/tr>\n<\/thead>\n<tbody>\n<tr>\n<td>F16<\/td>\n<td>~16,1 GB<\/td>\n<td>Referenz<\/td>\n<td>Benchmarking, weitere Quantisierung; selten lohnenswert im Betrieb<\/td>\n<\/tr>\n<tr>\n<td>Q8_0<\/td>\n<td>~8,5 GB<\/td>\n<td>Praktisch nicht unterscheidbar<\/td>\n<td>Sie verf\u00fcgen \u00fcber ausreichend VRAM und m\u00f6chten maximale Qualit\u00e4t erreichen<\/td>\n<\/tr>\n<tr>\n<td>Q6_K<\/td>\n<td>~6,6 GB<\/td>\n<td>Verlust vernachl\u00e4ssigbar<\/td>\n<td>Ausgezeichnete Qualit\u00e4t mit einer signifikanten Gr\u00f6\u00dfenreduzierung<\/td>\n<\/tr>\n<tr>\n<td>Q5_K_M<\/td>\n<td>~5,7 GB<\/td>\n<td>Sehr geringer Qualit\u00e4tsverlust<\/td>\n<td>Gutes Mittelma\u00df<\/td>\n<\/tr>\n<tr>\n<td>Q4_K_M<\/td>\n<td>~4,9 GB<\/td>\n<td>Kleiner Verlust, in der Regel akzeptabel<\/td>\n<td><strong>Die Standardvorgabe.<\/strong> Bestes Verh\u00e4ltnis von Qualit\u00e4t zu Speicherplatz f\u00fcr die meisten Nutzer<\/td>\n<\/tr>\n<tr>\n<td>Q3_K_M<\/td>\n<td>~4,0 GB<\/td>\n<td>Wahrnehmbare Qualit\u00e4tsminderung<\/td>\n<td>Nur dann, wenn Q4 tats\u00e4chlich nicht passt<\/td>\n<\/tr>\n<tr>\n<td>Q2_K \/ IQ2<\/td>\n<td>~3,2 GB<\/td>\n<td>Deutliche Qualit\u00e4tsminderung<\/td>\n<td>Letztes Mittel; ein kleineres Modell in Q4 ist oft besser<\/td>\n<\/tr>\n<\/tbody>\n<\/table>\n<p>Zwei n\u00fctzliche Regeln: Quantisierung beeintr\u00e4chtigt kleinere Modelle st\u00e4rker als gr\u00f6\u00dfere (ein 70B-Modell in Q3 beh\u00e4lt seine Qualit\u00e4t deutlich besser bei als ein 8B-Modell in Q3), und unterhalb von Q4 f\u00e4llt die Qualit\u00e4tskurve steil ab. Bei Unsicherheit gilt: <code>Q4_K_M<\/code> ist aus gutem Grund die Community-Standardvorgabe.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Picking_a_quantisation_for_your_VRAM\"><\/span>Auswahl einer geeigneten Quantisierung f\u00fcr Ihre VRAM<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Der gesamte ben\u00f6tigte Arbeitsspeicher betr\u00e4gt ungef\u00e4hr <em>Dateigr\u00f6\u00dfe + Kontext-Cache + Overhead<\/em>. Planen Sie zus\u00e4tzlich zur Dateigr\u00f6\u00dfe 1\u20132 GB f\u00fcr einige tausend Kontext-Token ein; bei sehr langen Kontexten ben\u00f6tigen Sie mehr. Das Modell l\u00e4uft am schnellsten, wenn der gesamte Speicherbedarf in den GPU-VRAM passt; Tools auf Basis von llama.cpp k\u00f6nnen den verbleibenden Teil in den System-Arbeitsspeicher auslagern \u2013 dies funktioniert zwar noch, wird aber umso langsamer, je mehr Schichten ausgelagert werden m\u00fcssen.<\/p>\n<table>\n<thead>\n<tr>\n<th>VRAM<\/th>\n<th>Was problemlos passt<\/th>\n<\/tr>\n<\/thead>\n<tbody>\n<tr>\n<td>8 GB<\/td>\n<td>7\u20138B-Modelle in Q4_K_M oder Q5_K_M<\/td>\n<\/tr>\n<tr>\n<td>12 GB<\/td>\n<td>8B in Q8_0 oder 12\u201314B in Q4_K_M<\/td>\n<\/tr>\n<tr>\n<td>16 GB<\/td>\n<td>14B in Q5_K_M\/Q6_K<\/td>\n<\/tr>\n<tr>\n<td>24 GB<\/td>\n<td>~32B in Q4_K_M oder 14B in Q8_0 mit langem Kontext<\/td>\n<\/tr>\n<\/tbody>\n<\/table>\n<p>F\u00fcr exakte Zahlen zu einem bestimmten Modell und einer bestimmten Kontextl\u00e4nge berechnet Ihnen der <a href=\"https:\/\/convly.ai\/de\/llm-vram-calculator\/\">VRAM-Rechner<\/a> die Werte automatisch, und eine modellspezifische Aufschl\u00fcsselung finden Sie in <a href=\"https:\/\/convly.ai\/de\/vram-requirements-every-major-llm-2026\/\">VRAM-Anforderungen f\u00fcr alle wichtigen Sprachmodelle<\/a>. Wenn Sie Hardware und nicht die Quantisierung ausw\u00e4hlen, beginnen Sie am besten mit <a href=\"https:\/\/convly.ai\/de\/best-gpus-for-local-llms-2026\/\">den besten GPUs f\u00fcr lokale LLMs<\/a>.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"GGUF_vs_safetensors\"><\/span>GGUF im Vergleich zu safetensors<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Diese beiden Formate koexistieren, weil sie unterschiedliche Laufzeitumgebungen bedienen \u2013 nicht etwa, weil eines das andere \u00fcbertrifft.<\/p>\n<table>\n<thead>\n<tr>\n<th><\/th>\n<th>GGUF<\/th>\n<th>safetensors<\/th>\n<\/tr>\n<\/thead>\n<tbody>\n<tr>\n<td>Entwickelt f\u00fcr<\/td>\n<td>llama.cpp und sein \u00d6kosystem<\/td>\n<td>Das Hugging Face \/ PyTorch-\u00d6kosystem<\/td>\n<\/tr>\n<tr>\n<td>Inhalt<\/td>\n<td>Gewichte + Tokenizer + Konfiguration in einer einzigen Datei<\/td>\n<td>Nur Tensoren; Konfiguration und Tokenizer sind separate JSON-Dateien<\/td>\n<\/tr>\n<tr>\n<td>Quantisierung<\/td>\n<td>Direkt im Format integriert (z. B. Q4_K_M)<\/td>\n<td>\u00dcblicherweise FP16\/BF16; Quantisierung erfolgt separat (z. B. mittels GPTQ oder AWQ)<\/td>\n<\/tr>\n<tr>\n<td>Typische Laufzeitumgebungen<\/td>\n<td>Ollama, LM Studio, llama.cpp, KoboldCpp, Jan<\/td>\n<td>transformers, vLLM, TGI, SGLang<\/td>\n<\/tr>\n<tr>\n<td>Optimaler Einsatzbereich<\/td>\n<td>Consumer-Hardware, CPU+GPU-Hybrid, Einzelbenutzer<\/td>\n<td>Datacenter-GPUs, Hochdurchsatz-Bereitstellung, Training<\/td>\n<\/tr>\n<\/tbody>\n<\/table>\n<p>Die Entscheidung h\u00e4ngt letztlich davon ab, welche Software Sie verwenden: Desktop-Tools und Ollama ben\u00f6tigen GGUF; GPU-basierte Bereitstellungsstacks sowie alle Anwendungen, die Feinabstimmung erfordern, nutzen safetensors. Modellanbieter ver\u00f6ffentlichen typischerweise zun\u00e4chst safetensors; die Community konvertiert diese innerhalb weniger Tage in das GGUF-Format.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Where_GGUF_files_come_from\"><\/span>Woher GGUF-Dateien stammen<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Fast alle GGUF-Dateien befinden sich auf Hugging Face. Labs ver\u00f6ffentlichen gelegentlich offizielle GGUF-Versionen, doch die Mehrzahl stammt von Community-Quantisierern \u2013 Konten wie <code>bartowski<\/code>, <code>unsloth<\/code>, <code>lmstudio-community<\/code> und <code>ggml-org<\/code> \u2013 die jede neue Ver\u00f6ffentlichung in s\u00e4mtliche Quantisierungsstufen konvertieren. Ein Repository mit einem Namen wie <code>Meta-Llama-3.1-8B-Instruct-GGUF<\/code> enth\u00e4lt jeweils eine Datei pro Quantisierungsstufe.<\/p>\n<p>Sie k\u00f6nnen ein Modell auch selbst mit den Tools von llama.cpp konvertieren: <code>convert_hf_to_gguf.py<\/code> wandelt ein Hugging-Face-Modell in ein F16-GGUF-Format um, und das Binary <code>llama-quantize<\/code> (das beim Kompilieren von llama.cpp erstellt wird) komprimiert es in die gew\u00fcnschte Quantisierungsstufe, z. B. <code>llama-quantize model-f16.gguf model-Q4_K_M.gguf Q4_K_M<\/code>.<\/p>\n<h3>Ein GGUF-Modell in Ollama laden<\/h3>\n<p>Ollama kann GGUF-Repositories direkt von Hugging Face herunterladen; die Quantisierungsstufe wird nach dem Doppelpunkt angegeben:<\/p>\n<pre><code>ollama run hf.co\/bartowski\/Meta-Llama-3.1-8B-Instruct-GGUF:Q4_K_M<\/code><\/pre>\n<p>F\u00fcr eine bereits auf der Festplatte vorhandene Datei erstellen Sie eine reine Textdatei mit dem Namen <code>Modelfile<\/code> mit folgendem Inhalt:<\/p>\n<pre><code>FROM .\/my-model.gguf<\/code><\/pre>\n<p>und registrieren sowie starten Sie sie anschlie\u00dfend wie folgt:<\/p>\n<pre><code>ollama create my-model -f Modelfile\nollama run my-model<\/code><\/pre>\n<p>Aktuelle Ollama-Versionen lesen die im GGUF-Metadaten eingebettete Chatvorlage automatisch ein; falls ein importiertes Modell fehlerhafte Ausgaben erzeugt, hilft die L\u00f6sung meistens, eine explizite <code>TEMPLATE<\/code> -Zeile in die Modelfile einzuf\u00fcgen. Der <a href=\"https:\/\/convly.ai\/de\/what-is-ollama-complete-guide-2026\/\">umfassende Ollama-Leitfaden<\/a> behandelt Modelfiles ausf\u00fchrlich.<\/p>\n<h3>Ein GGUF-Modell in LM Studio laden<\/h3>\n<p>Der \u00fcbliche Weg ist der integrierte Downloader: \u00d6ffnen Sie den Reiter \u201eDiscover\u201c, suchen Sie nach einem Modell, und LM Studio listet die verf\u00fcgbaren GGUF-Quantisierungen auf und kennzeichnet, welche Modelle auf Ihrer Hardware lauff\u00e4hig sind. Um eine bereits vorhandene Datei zu importieren, verwenden Sie die Befehlszeilenschnittstelle (<code>lms import path\/to\/model.gguf<\/code>) oder kopieren Sie die Datei in das Modellverzeichnis von LM Studio \u2013 der genaue Standardpfad variiert je nach Version und Betriebssystem, doch der Reiter \u201eMy Models\u201c zeigt ihn an und erm\u00f6glicht dessen \u00c4nderung. Damit die Dateien erkannt werden, m\u00fcssen sie in einer Unterverzeichnisstruktur der Form <code>publisher\/model-name\/<\/code> gespeichert sein. Den vollst\u00e4ndigen Ablauf finden Sie im <a href=\"https:\/\/convly.ai\/de\/lm-studio-complete-guide-2026\/\">umfassenden LM Studio-Leitfaden<\/a> .<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Frequently_asked_questions\"><\/span>H\u00e4ufig gestellte Fragen<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<h3>Ist GGUF ausschlie\u00dflich CPU-basiert oder nutzt es auch die GPU?<\/h3>\n<p>Beides. llama.cpp entstand urspr\u00fcnglich als CPU-Inferenz-Projekt, doch es entlastet Modellschichten auf die GPU (CUDA, Metal, Vulkan, ROCm) und f\u00fchrt die gesamte Berechnung vollst\u00e4ndig auf der GPU durch, sobald das Modell komplett in den VRAM passt. Ollama und LM Studio regeln die Aufteilung zwischen CPU und GPU automatisch; bei direkter Nutzung von llama.cpp steuern Sie diese mittels des Flags <code>-ngl<\/code> (Anzahl der GPU-Schichten).<\/p>\n<h3>Was ist der Unterschied zwischen Q4_K_M und Q4_K_S?<\/h3>\n<p>Beide sind ~4-Bit-k-Quantisierungen; der Buchstabe kennzeichnet die Variantengr\u00f6\u00dfe. <code>_M<\/code> \u201eM\u201c (medium) beh\u00e4lt mehr qualit\u00e4tsempfindliche Tensoren in h\u00f6herer Genauigkeit als <code>_S<\/code> \u201eS\u201c (small), weshalb Q4_K_M geringf\u00fcgig gr\u00f6\u00dfer und leistungsf\u00e4higer ist. Der Unterschied ist jedoch gering \u2013 w\u00e4hlen Sie Q4_K_M, <code>_M<\/code> es sei denn, die letzten paar hundert Megabyte entscheiden dar\u00fcber, ob das Modell auf Ihre Hardware passt.<\/p>\n<h3>Wie viel Qualit\u00e4t geht durch Quantisierung tats\u00e4chlich verloren?<\/h3>\n<p>Bei Q8_0 und Q6_K ist der Verlust praktisch vernachl\u00e4ssigbar \u2013 in Blindtests f\u00e4llt es schwer, diese von F16 zu unterscheiden. Q4_K_M weist einen geringf\u00fcgigen, messbaren Qualit\u00e4tsverlust auf, den die meisten Nutzer im Chatbetrieb nicht bemerken; bei pr\u00e4zisen Aufgaben wie Codegenerierung oder mathematischen Berechnungen kann er jedoch relevant werden. Unterhalb von Q4 wird der Qualit\u00e4tsverlust deutlich sp\u00fcrbar, wobei kleinere Modelle st\u00e4rker betroffen sind als gr\u00f6\u00dfere.<\/p>\n<h3>Kann ich GGUF mit transformers oder vLLM verwenden?<\/h3>\n<p>Es existiert zwar eine begrenzte Unterst\u00fctzung, doch ist dies nicht der native Weg \u2013 transformers kann einige GGUF-Dateien beim Laden dequantisieren, und vLLM bietet experimentelle GGUF-Unterst\u00fctzung, deren Funktionalit\u00e4t je nach Architektur variiert. Falls Sie auf diesen Frameworks aufbauen, verwenden Sie stattdessen safetensors; GGUF ist prim\u00e4r als Format f\u00fcr Laufzeiten der llama.cpp-Familie gedacht.<\/p>\n<h3>Warum ist mein Modell in mehrere .gguf-Dateien aufgeteilt?<\/h3>\n<p>Sehr gro\u00dfe Modelle werden in Teile (\u201eshards\u201c) mit Namen wie <code>model-00001-of-00002.gguf<\/code>aufgeteilt, haupts\u00e4chlich um Dateigr\u00f6\u00dfenbeschr\u00e4nkungen auf Hosting-Plattformen einzuhalten. Speichern Sie alle Teile im selben Ordner und verweisen Sie Ihre Laufzeit auf die erste Datei \u2013 llama.cpp und darauf basierende Tools laden die restlichen Teile automatisch.<\/p>\n<p>Sobald Sie wissen, welche Quantisierung auf Ihrer Hardware l\u00e4uft, stellt sich die praktische n\u00e4chste Frage: Welches Modell soll darin eingesetzt werden? Die <a href=\"https:\/\/convly.ai\/de\/models\/\">Modell-Datenbank<\/a> Liste enth\u00e4lt Spezifikationen, VRAM-Anforderungen und Preise f\u00fcr 37 aktuelle Modelle; <a href=\"https:\/\/convly.ai\/de\/best-local-llms-to-run-on-ollama-2026\/\">die besten lokalen Modelle f\u00fcr Ollama<\/a> bietet eine gute Kurzliste, um zu beginnen.<\/p>","protected":false},"excerpt":{"rendered":"<p>GGUF is the file format for running LLMs locally. It packs a model&#8217;s weights, tokenizer and configuration into a single [&hellip;]<\/p>\n","protected":false},"author":1,"featured_media":2104,"comment_status":"closed","ping_status":"closed","sticky":false,"template":"","format":"standard","meta":{"site-sidebar-layout":"default","site-content-layout":"","ast-site-content-layout":"default","site-content-style":"default","site-sidebar-style":"default","ast-global-header-display":"","ast-banner-title-visibility":"","ast-main-header-display":"","ast-hfb-above-header-display":"","ast-hfb-below-header-display":"","ast-hfb-mobile-header-display":"","site-post-title":"","ast-breadcrumbs-content":"","ast-featured-img":"","footer-sml-layout":"","ast-disable-related-posts":"","theme-transparent-header-meta":"","adv-header-id-meta":"","stick-header-meta":"","header-above-stick-meta":"","header-main-stick-meta":"","header-below-stick-meta":"","astra-migrate-meta-layouts":"default","ast-page-background-enabled":"default","ast-page-background-meta":{"desktop":{"background-color":"var(--ast-global-color-5)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"tablet":{"background-color":"","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"mobile":{"background-color":"","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""}},"ast-content-background-meta":{"desktop":{"background-color":"var(--ast-global-color-4)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"tablet":{"background-color":"var(--ast-global-color-4)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"mobile":{"background-color":"var(--ast-global-color-4)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""}},"footnotes":""},"categories":[7],"tags":[],"class_list":["post-2103","post","type-post","status-publish","format-standard","has-post-thumbnail","hentry","category-ai-news"],"_links":{"self":[{"href":"https:\/\/convly.ai\/de\/wp-json\/wp\/v2\/posts\/2103","targetHints":{"allow":["GET"]}}],"collection":[{"href":"https:\/\/convly.ai\/de\/wp-json\/wp\/v2\/posts"}],"about":[{"href":"https:\/\/convly.ai\/de\/wp-json\/wp\/v2\/types\/post"}],"author":[{"embeddable":true,"href":"https:\/\/convly.ai\/de\/wp-json\/wp\/v2\/users\/1"}],"replies":[{"embeddable":true,"href":"https:\/\/convly.ai\/de\/wp-json\/wp\/v2\/comments?post=2103"}],"version-history":[{"count":1,"href":"https:\/\/convly.ai\/de\/wp-json\/wp\/v2\/posts\/2103\/revisions"}],"predecessor-version":[{"id":2105,"href":"https:\/\/convly.ai\/de\/wp-json\/wp\/v2\/posts\/2103\/revisions\/2105"}],"wp:featuredmedia":[{"embeddable":true,"href":"https:\/\/convly.ai\/de\/wp-json\/wp\/v2\/media\/2104"}],"wp:attachment":[{"href":"https:\/\/convly.ai\/de\/wp-json\/wp\/v2\/media?parent=2103"}],"wp:term":[{"taxonomy":"category","embeddable":true,"href":"https:\/\/convly.ai\/de\/wp-json\/wp\/v2\/categories?post=2103"},{"taxonomy":"post_tag","embeddable":true,"href":"https:\/\/convly.ai\/de\/wp-json\/wp\/v2\/tags?post=2103"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}