{"id":2608,"date":"2026-09-10T20:40:34","date_gmt":"2026-09-10T20:40:34","guid":{"rendered":"https:\/\/convly.ai\/?p=2608"},"modified":"2026-09-10T20:40:34","modified_gmt":"2026-09-10T20:40:34","slug":"gguf-model","status":"publish","type":"post","link":"https:\/\/convly.ai\/de\/gguf-model\/","title":{"rendered":"GGUF-Modellformat: Was es ist und wie man ein Modell ausf\u00fchrt"},"content":{"rendered":"<div class=\"convly-tldr\">\n<ul>\n<li><strong>GGUF<\/strong> (GPT-Generated Unified Format) ist ein Bin\u00e4rformat f\u00fcr quantisierte Large Language Models in einer einzigen Datei. Es wurde im August 2023 vom llama.cpp-Projekt als Nachfolger von GGML eingef\u00fchrt.<\/li>\n<li>Es b\u00fcndelt Gewichte, Tokenizer, Chat-Vorlage und Metadaten in einer einzigen <code>.gguf<\/code> Datei, die auf CPU, GPU oder einer Kombination aus beiden l\u00e4uft \u00fcber <strong>llama.cpp<\/strong>, <strong>Ollama<\/strong>, <strong>LM Studio<\/strong>, <strong>KoboldCpp<\/strong> und <strong>text-generation-webui<\/strong>.<\/li>\n<li>Quantisierungsstufen wie <code>Q4_K_M<\/code>, <code>Q5_K_M<\/code> und <code>Q8_0<\/code> opfern Qualit\u00e4t zugunsten geringerer Gr\u00f6\u00dfe \u2013 eine 4-Bit-Quantisierung eines 8B-Modells ben\u00f6tigt etwa 5 GB RAM oder VRAM.<\/li>\n<li>Laden Sie Dateien von Hugging Face herunter (Suche nach \u201eGGUF\u201c) und laden Sie sie mit <code>llama-cli -m model.gguf<\/code> oder <code>ollama run<\/code>ein; w\u00e4hlen Sie dann eine Quantisierung aus, die zu Ihrer Hardware passt, mithilfe der <a href=\"https:\/\/convly.ai\/de\/llm-vram-calculator\/\">VRAM-Rechner<\/a>.<\/li>\n<\/ul>\n<\/div>\n<p>A <strong>GGUF-Modell<\/strong> ist ein Large Language Model, das im GGUF-Dateiformat verpackt ist \u2013 einem Einzel-Datei-Container, der die quantisierten Gewichte, den Tokenizer, Hyperparameter und die Prompt-Vorlage eines Modells enth\u00e4lt. Es wurde von Georgi Gerganov und dem <a href=\"https:\/\/github.com\/ggml-org\/llama.cpp\" rel=\"noopener\" target=\"_blank\">llama.cpp<\/a> project in August 2023 to replace the older GGML format. GGUF is what makes it possible to download one file, point a runtime at it, and get a working local LLM on a laptop or workstation.<\/p>\n<div id=\"ez-toc-container\" class=\"ez-toc-v2_0_87_1 counter-flat ez-toc-counter ez-toc-container-direction\">\n<label for=\"ez-toc-cssicon-toggle-item-6aa323f84bc1a\" class=\"ez-toc-cssicon-toggle-label\"><span class=\"\"><span class=\"eztoc-hide\" style=\"display:none;\">Umschalten<\/span><span class=\"ez-toc-icon-toggle-span\"><svg style=\"fill: #000000;color:#000000\" xmlns=\"http:\/\/www.w3.org\/2000\/svg\" class=\"list-377408\" width=\"20px\" height=\"20px\" viewbox=\"0 0 24 24\" fill=\"none\"><path d=\"M6 6H4v2h2V6zm14 0H8v2h12V6zM4 11h2v2H4v-2zm16 0H8v2h12v-2zM4 16h2v2H4v-2zm16 0H8v2h12v-2z\" fill=\"currentColor\"><\/path><\/svg><svg style=\"fill: #000000;color:#000000\" class=\"arrow-unsorted-368013\" xmlns=\"http:\/\/www.w3.org\/2000\/svg\" width=\"10px\" height=\"10px\" viewbox=\"0 0 24 24\" version=\"1.2\" baseprofile=\"tiny\"><path d=\"M18.2 9.3l-6.2-6.3-6.2 6.3c-.2.2-.3.4-.3.7s.1.5.3.7c.2.2.4.3.7.3h11c.3 0 .5-.1.7-.3.2-.2.3-.5.3-.7s-.1-.5-.3-.7zM5.8 14.7l6.2 6.3 6.2-6.3c.2-.2.3-.5.3-.7s-.1-.5-.3-.7c-.2-.2-.4-.3-.7-.3h-11c-.3 0-.5.1-.7.3-.2.2-.3.5-.3.7s.1.5.3.7z\"\/><\/svg><\/span><\/span><\/label><input type=\"checkbox\"  id=\"ez-toc-cssicon-toggle-item-6aa323f84bc1a\"  aria-label=\"Umschalten\" \/><nav><ul class='ez-toc-list ez-toc-list-level-1' ><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-1\" href=\"https:\/\/convly.ai\/de\/gguf-model\/#What_GGUF_Actually_Is\" >Was GGUF tats\u00e4chlich ist<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-2\" href=\"https:\/\/convly.ai\/de\/gguf-model\/#Quantization_The_Naming_Scheme\" >Quantisierung: Das Namensschema<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-3\" href=\"https:\/\/convly.ai\/de\/gguf-model\/#Where_to_Get_GGUF_Files\" >Wo man GGUF-Dateien bekommt<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-4\" href=\"https:\/\/convly.ai\/de\/gguf-model\/#Running_a_GGUF_Model\" >Ausf\u00fchrung eines GGUF-Modells<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-5\" href=\"https:\/\/convly.ai\/de\/gguf-model\/#GGUF_vs_Safetensors_vs_AWQ_vs_GPTQ\" >GGUF im Vergleich zu Safetensors, AWQ und GPTQ<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-6\" href=\"https:\/\/convly.ai\/de\/gguf-model\/#When_GGUF_Is_Not_the_Right_Answer\" >Wann GGUF nicht die richtige Wahl ist<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-7\" href=\"https:\/\/convly.ai\/de\/gguf-model\/#Converting_a_Model_to_GGUF\" >Konvertierung eines Modells nach GGUF<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-8\" href=\"https:\/\/convly.ai\/de\/gguf-model\/#Frequently_Asked_Questions\" >H\u00e4ufig gestellte Fragen<\/a><\/li><\/ul><\/nav><\/div>\n<h2><span class=\"ez-toc-section\" id=\"What_GGUF_Actually_Is\"><\/span>Was GGUF tats\u00e4chlich ist<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>GGUF steht f\u00fcr <em>GPT-Generated Unified Format<\/em>. Strukturell handelt es sich um eine Bin\u00e4rdatei mit einem Header, einem Schl\u00fcssel-Wert-Metadatenblock, einem Tensorindex und den eigentlichen Tensordaten. Die <a href=\"https:\/\/github.com\/ggml-org\/ggml\/blob\/master\/docs\/gguf.md\" rel=\"noopener\" target=\"_blank\">offizielle GGUF-Spezifikation<\/a> im ggml-Repository definiert das Layout.<\/p>\n<p>F\u00fcr Nutzer sind zwei Eigenschaften entscheidend:<\/p>\n<ul>\n<li><strong>Selbstst\u00e4ndig (self-contained).<\/strong> Die Datei enth\u00e4lt den Tokenizer, spezielle Tokens, EOS-\/BOS-IDs, die Chat-Vorlage sowie Architektur-Metadaten. Sie ben\u00f6tigen keine separate <code>tokenizer.json<\/code> oder <code>config.json<\/code> Datei daneben.<\/li>\n<li><strong>Speicherabbildbar (memory-mappable).<\/strong> Laufzeitumgebungen verwenden <code>mmap()<\/code> , um die Datei abzubilden, sodass der Start nahezu sofort erfolgt und das Betriebssystem die Gewichte bei Bedarf seitenweise nachl\u00e4dt. Daher \u00f6ffnet sich eine 40-GB-GGUF-Datei selbst auf einer langsamen SSD innerhalb weniger Sekunden.<\/li>\n<\/ul>\n<p>GGUF ersetzte GGML, weil GGML keine Versionsverwaltung besa\u00df, Metadaten mit den Gewichten vermischte und bei jeder neuen Architektur brach. GGUF hingegen ist versioniert und erweiterbar.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Quantization_The_Naming_Scheme\"><\/span>Quantisierung: Das Namensschema<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Die meisten GGUF-Dateien, die Sie herunterladen, sind <em>quantisiert<\/em> \u2013 die Gewichte werden mit weniger Bits als im urspr\u00fcnglichen FP16-Format gespeichert. Der Suffix in der Dateinamenerweiterung verr\u00e4t Ihnen, welches Quantisierungsschema verwendet wurde. Die aktuellen Varianten sind in der <a href=\"https:\/\/github.com\/ggml-org\/llama.cpp\/blob\/master\/tools\/quantize\/README.md\" rel=\"noopener\" target=\"_blank\">llama.cpp-quantize-README<\/a>.<\/p>\n<table>\n<thead>\n<tr>\n<th>Quantisierung<\/th>\n<th>Bits pro Gewicht (ca.)<\/th>\n<th>Typischer Einsatz<\/th>\n<\/tr>\n<\/thead>\n<tbody>\n<tr>\n<td>Q2_K<\/td>\n<td>~2.6<\/td>\n<td>Kleinste Variante mit sp\u00fcrbarem Qualit\u00e4tsverlust<\/td>\n<\/tr>\n<tr>\n<td>Q3_K_M<\/td>\n<td>~3.9<\/td>\n<td>Aggressive Komprimierung<\/td>\n<\/tr>\n<tr>\n<td>Q4_K_M<\/td>\n<td>~4.8<\/td>\n<td>H\u00e4ufigste Standardvariante \u2013 gutes Verh\u00e4ltnis von Gr\u00f6\u00dfe zu Qualit\u00e4t<\/td>\n<\/tr>\n<tr>\n<td>Q5_K_M<\/td>\n<td>~5.7<\/td>\n<td>H\u00f6here Qualit\u00e4t, gr\u00f6\u00dfere Dateigr\u00f6\u00dfe<\/td>\n<\/tr>\n<tr>\n<td>Q6_K<\/td>\n<td>~6.6<\/td>\n<td>Nahezu verlustfrei im Vergleich zu FP16<\/td>\n<\/tr>\n<tr>\n<td>Q8_0<\/td>\n<td>~8.5<\/td>\n<td>Effektiv verlustfrei, etwa doppelt so gro\u00df wie Q4<\/td>\n<\/tr>\n<tr>\n<td>F16 \/ BF16<\/td>\n<td>16<\/td>\n<td>Unquantisierter Referenzwert<\/td>\n<\/tr>\n<\/tbody>\n<\/table>\n<p>Der <code>_K<\/code> Varianten sind sogenannte k-quants, die pro Tensorblock variable Genauigkeit nutzen. Die Suffixe <code>_M<\/code> \/ <code>_S<\/code> \/ <code>_L<\/code> deuten mittlere, kleine oder gro\u00dfe Block-Mix-Voreinstellungen an. Neuere <code>IQ<\/code> Varianten (z.\u202fB. <code>IQ4_XS<\/code>) nutzen Importance-Matrix-Kalibrierung, um bei gleicher Bit-Budget-Auslastung eine bessere Qualit\u00e4t zu erreichen.<\/p>\n<p>Als Faustregel f\u00fcr die ben\u00f6tigte VRAM: Nehmen Sie die Dateigr\u00f6\u00dfe auf der Festplatte und addieren Sie grob 1\u20133 GB f\u00fcr den KV-Cache bei kurzen Kontexten \u2013 bei langen Kontexten entsprechend mehr. Aus der <a href=\"https:\/\/convly.ai\/de\/models\/\">Convly-Modell-Datenbank<\/a>: Llama 3.1 8B needs around 5&nbsp;GB at 4-bit, Llama 3.3 70B around 40&nbsp;GB, and Mistral 7B around 4.5&nbsp;GB. For anything larger, the <a href=\"https:\/\/convly.ai\/de\/vram-requirements-every-major-llm-2026\/\">VRAM-Anforderungstabelle<\/a> schnellste Lookup-Methode.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Where_to_Get_GGUF_Files\"><\/span>Wo man GGUF-Dateien bekommt<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Nahezu alle GGUF-Ver\u00f6ffentlichungen erfolgen auf Hugging Face. Suchen Sie nach dem Modellnamen zusammen mit \u201eGGUF\u201c. Zuverl\u00e4ssige Re-Quantisierer umfassen <strong>bartowski<\/strong>, <strong>Qwen<\/strong> (offiziell f\u00fcr Qwen3), <strong>lmstudio-community<\/strong>, <strong>unsloth<\/strong> und <strong>MaziyarPanahi<\/strong>. Meta, Google, Mistral and Microsoft publish some official GGUF builds; for others the community quantizes from the released safetensors.<\/p>\n<p>Ein Repository enth\u00e4lt typischerweise eine Datei pro Quantisierungsstufe, z.\u202fB. <code>Meta-Llama-3.1-8B-Instruct-Q4_K_M.gguf<\/code>. Bei Modellen \u00fcber ~50&nbsp;GB wird die Datei in Shards mit Namen wie <code>-00001-of-00003.gguf<\/code>aufgeteilt; Laufzeitumgebungen laden sie automatisch vom ersten Shard aus.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Running_a_GGUF_Model\"><\/span>Ausf\u00fchrung eines GGUF-Modells<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<h3>Linux<\/h3>\n<p>Bauen Sie llama.cpp aus dem Quellcode oder installieren Sie das vorgefertigte Bin\u00e4rpaket. Mit CUDA:<\/p>\n<pre><code>git clone https:\/\/github.com\/ggml-org\/llama.cpp\ncd llama.cpp\ncmake -B build -DGGML_CUDA=ON\ncmake --build build --config Release -j\n.\/build\/bin\/llama-cli -m ~\/models\/llama-3.1-8b-instruct-Q4_K_M.gguf \n    -p \"Erkl\u00e4ren Sie GGUF in einem Absatz.\" -n 256 -ngl 99<\/code><\/pre>\n<p>Der <code>-ngl<\/code> Mit der Option \u201e-ngl\u201c (n-gpu-layers) legen Sie fest, wie viele Transformer-Schichten auf die GPU verlagert werden. W\u00e4hlen Sie einen Wert hoch genug, damit das gesamte Modell in den VRAM passt; falls Sie Speicher knapp werden, senken Sie diesen Wert \u2013 der Rest bleibt dann auf der CPU. Um eine OpenAI-kompatible HTTP-API bereitzustellen, verwenden Sie <code>llama-server<\/code> standardm\u00e4\u00dfig auf Port 8080.<\/p>\n<h3>macOS<\/h3>\n<p>Auf Apple Silicon nutzt llama.cpp automatisch den Metal-Backend. Installieren Sie es \u00fcber Homebrew:<\/p>\n<pre><code>brew install llama.cpp\nllama-cli -m ~\/models\/qwen3-8b-Q5_K_M.gguf -p \"Hallo\" -ngl 99<\/code><\/pre>\n<p>Bei vereinheitlichtem Arbeitsspeicher entspricht die Obergrenze Ihrem gesamten RAM abz\u00fcglich des Betriebssystem-Overheads. Ein 32&nbsp;GB M-Serie-Mac f\u00fchrt problemlos Qwen3 14B oder <code>-ngl<\/code> ceiling is your total RAM minus the OS overhead. A 32&nbsp;GB M-series Mac comfortably runs Qwen3 14B or Gemma 3 12B at Q4_K_M &mdash; the database lists those at ~9&nbsp;GB and ~8&nbsp;GB of VRAM respectively.<\/p>\n<p>F\u00fcr eine grafische Benutzeroberfl\u00e4che ist <a href=\"https:\/\/convly.ai\/de\/lm-studio-complete-guide-2026\/\">LM Studio<\/a> die \u00fcbliche Wahl unter macOS. Es l\u00e4dt GGUF-Dateien direkt von Hugging Face herunter und stellt einen lokalen, OpenAI-kompatiblen Server bereit.<\/p>\n<h3>Windows<\/h3>\n<p>Drei praktikable Wege:<\/p>\n<ul>\n<li><strong>Ollama.<\/strong> Installieren Sie es von <a href=\"https:\/\/ollama.com\/download\" rel=\"noopener\" target=\"_blank\">ollama.com\/download<\/a>, dann <code>ollama run llama3.1:8b<\/code>. Ollama zieht seine eigenen kuratierten GGUF-Modelle. Um eine beliebige Datei zu laden, schreiben Sie eine Modelfile mit einer Zeile <code>FROM .\/mymodel.gguf<\/code> und f\u00fchren Sie dann aus <code>ollama create mymodel -f Modelfile<\/code>. Siehe unsere <a href=\"https:\/\/convly.ai\/de\/how-to-install-ollama-2026\/\">Ollama-Installationsanleitung<\/a>.<\/li>\n<li><strong>LM Studio.<\/strong> Ein-Klick-Installation, Durchsuchen und Herunterladen von GGUF \u00fcber eine grafische Oberfl\u00e4che sowie ein Schieberegler zur GPU-Offload-Steuerung.<\/li>\n<li><strong>llama.cpp-Release-Bin\u00e4rdateien.<\/strong> Das Projekt stellt vorgefertigte Windows-Zip-Archive f\u00fcr CPU, CUDA und Vulkan auf der <a href=\"https:\/\/github.com\/ggml-org\/llama.cpp\/releases\" rel=\"noopener\" target=\"_blank\">GitHub-Releases-Seite<\/a>zur Verf\u00fcgung. Entpacken Sie sie und f\u00fchren Sie <code>llama-cli.exe<\/code> auf dieselbe Weise aus wie unter Linux.<\/li>\n<\/ul>\n<p>Zur Auswahl der GPU empfehlen wir den <a href=\"https:\/\/convly.ai\/de\/best-gpus-for-local-llms-2026\/\">lokale-LLM-GPU-Leitfaden<\/a> , der aktuelle Preis-\/VRAM-Optionen abdeckt.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"GGUF_vs_Safetensors_vs_AWQ_vs_GPTQ\"><\/span>GGUF im Vergleich zu Safetensors, AWQ und GPTQ<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<table>\n<thead>\n<tr>\n<th>Format<\/th>\n<th>Hauptlaufzeitumgebung<\/th>\n<th>Pr\u00e4zision<\/th>\n<th>Am besten geeignet f\u00fcr<\/th>\n<\/tr>\n<\/thead>\n<tbody>\n<tr>\n<td>GGUF<\/td>\n<td>llama.cpp, Ollama, LM Studio<\/td>\n<td>2\u20138 Bit + F16<\/td>\n<td>CPU, gemischte CPU\/GPU, Apple Silicon, Einzelbenutzer<\/td>\n<\/tr>\n<tr>\n<td>Safetensors (FP16\/BF16)<\/td>\n<td>Transformers, vLLM<\/td>\n<td>16-Bit<\/td>\n<td>Training, Forschung, Inferenz mit voller Genauigkeit<\/td>\n<\/tr>\n<tr>\n<td>AWQ<\/td>\n<td>vLLM, AutoAWQ<\/td>\n<td>4-Bit<\/td>\n<td>GPU-basierte Hochdurchsatz-Serveranwendung<\/td>\n<\/tr>\n<tr>\n<td>GPTQ<\/td>\n<td>vLLM, ExLlamaV2<\/td>\n<td>3\u20138 Bit<\/td>\n<td>GPU-only-Inferenz mit Batch-Verarbeitung<\/td>\n<\/tr>\n<tr>\n<td>MLX<\/td>\n<td>MLX (Apple)<\/td>\n<td>4\u201316 Bit<\/td>\n<td>Nur f\u00fcr Apple Silicon<\/td>\n<\/tr>\n<\/tbody>\n<\/table>\n<p>W\u00e4hlen Sie GGUF, wenn das Ziel ein einzelner Nutzer auf heterogener Hardware ist oder wenn Sie sicherstellen m\u00f6chten, dass das Modell \u00fcberhaupt auf der CPU l\u00e4uft. W\u00e4hlen Sie vLLM mit AWQ-\/GPTQ-Safetensors, wenn Sie viele gleichzeitige Nutzer auf einer Rechenzentrums-GPU bedienen.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"When_GGUF_Is_Not_the_Right_Answer\"><\/span>Wann GGUF nicht die richtige Wahl ist<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>GGUF setzt Single-Stream-, Batch-Gr\u00f6\u00dfe-1-Inferenz voraus. Der Durchsatz ist bei gleichzeitiger Last deutlich geringer als bei vLLM oder TensorRT-LLM, und es gibt keine paged attention. Wenn Sie eine API f\u00fcr echten Produktivbetrieb bereitstellen, schl\u00e4gt eine FP16- oder AWQ-basierte Bereitstellung mit vLLM bei Tokens\/Sekunde\/Dollar selbst dann noch GGUF \u2013 ganz zu schweigen von der eingesparten Entwicklerzeit.<\/p>\n<p>It also breaks down at the top end of model size. Kimi K3 needs ~1.4&nbsp;TB of VRAM at 4-bit and DeepSeek V4-Pro around 800&nbsp;GB &mdash; those are multi-node deployments, not desktop GGUF workloads. And for frontier hosted models like <a href=\"https:\/\/convly.ai\/de\/models\/\">Claude Sonnet 4.6<\/a> zu 3&nbsp;$ pro Million Tokens Eingabe und 15&nbsp;$ pro Million Tokens Ausgabe oder Gemini 3.6 Flash zu 1,50&nbsp;$ pro Million Tokens Eingabe und 7,50&nbsp;$ pro Million Tokens Ausgabe existieren keine lokalen Gewichte, die konvertiert werden k\u00f6nnten. Rechnen Sie die Zahlen f\u00fcr die <a href=\"https:\/\/convly.ai\/de\/self-hosting-vs-api-calculator\/\">Selbsthosting vs. API-Rechner<\/a> durch, bevor Sie sich f\u00fcr einen GPU-Kauf entscheiden.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Converting_a_Model_to_GGUF\"><\/span>Konvertierung eines Modells nach GGUF<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Falls ein Modell auf Hugging Face als safetensors-Datei vorliegt, aber noch niemand es quantisiert hat, lautet der Workflow:<\/p>\n<pre><code># im llama.cpp-Repository\npip install -r requirements.txt\npython convert_hf_to_gguf.py \/pfad\/zu\/hf-modell --outfile modell-f16.gguf\n.\/build\/bin\/llama-quantize modell-f16.gguf modell-Q4_K_M.gguf Q4_K_M<\/code><\/pre>\n<p>Das Konversionsskript unterst\u00fctzt nur Architekturen, die llama.cpp bereits kennt \u2013 darunter llama, mistral, qwen2\/3, gemma, phi sowie eine wachsende Liste weiterer. F\u00fcr neuartige Architekturen ist zun\u00e4chst eine Anpassung des Codes erforderlich. Dateinamen und Flags im Skript haben sich zwischen verschiedenen llama.cpp-Versionen ge\u00e4ndert; pr\u00fcfen Sie daher <code>python convert_hf_to_gguf.py --help<\/code> gegen\u00fcber dem Commit, aus dem Sie gebaut haben.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Frequently_Asked_Questions\"><\/span>H\u00e4ufig gestellte Fragen<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<h3>Ist GGUF dasselbe wie GGML?<\/h3>\n<p>Nein. GGML war das fr\u00fchere Format, das llama.cpp bis Mitte 2023 verwendete. GGUF ersetzte es im August 2023 mit einem versionierten Header, eingebetteten Metadaten und einem stabilen Tensor-Layout. Alte <code>.bin<\/code> GGML-Dateien werden von aktuellen llama.cpp-Versionen nicht mehr geladen; Sie m\u00fcssen stattdessen eine neu quantisierte GGUF-Version finden.<\/p>\n<h3>Welche Quantisierung soll ich herunterladen?<\/h3>\n<p>Beginnen Sie mit <code>Q4_K_M<\/code>Es eignet sich f\u00fcr die breiteste Palette an Hardware, und der Qualit\u00e4tsverlust gegen\u00fcber FP16 ist bei den meisten Modellen mit \u00fcber 7&nbsp;Milliarden Parametern gering. Steigen Sie auf <code>Q5_K_M<\/code> oder <code>Q6_K<\/code> hoch, wenn Sie zus\u00e4tzliche VRAM-Kapazit\u00e4t haben und Wert auf Codierungs- oder Schlussfolgerungsgenauigkeit legen. Reduzieren Sie auf <code>Q3_K_M<\/code> oder eine <code>IQ3<\/code> -Variante nur dann, wenn das Modell andernfalls nicht passt.<\/p>\n<h3>Can GGUF models use my GPU?<\/h3>\n<p>Ja. llama.cpp unterst\u00fctzt CUDA (NVIDIA), ROCm (AMD), Metal (Apple), Vulkan (plattform\u00fcbergreifend) und SYCL (Intel). Die <code>-ngl<\/code> -Option entlastet Layer auf die GPU. Passt das gesamte Modell in die VRAM, liegt der Durchsatz nahe dem von dedizierten GPU-Laufzeiten; bei teilweiser Entlastung richtet sich die Geschwindigkeit nach dem langsamsten Layer, unabh\u00e4ngig davon, ob dieser auf GPU oder CPU l\u00e4uft.<\/p>\n<h3>Funktioniert GGUF mit Vision- oder Audio-Modellen?<\/h3>\n<p>Teilweise. llama.cpp unterst\u00fctzt multimodale LLaVA-\u00e4hnliche Vision-Modelle \u00fcber eine zugeh\u00f6rige <code>mmproj<\/code> GGUF-Datei, die den Vision-Projector enth\u00e4lt. Die Unterst\u00fctzung f\u00fcr Qwen-VL, Gemma-3-Vision und \u00e4hnliche Modelle wurde im Laufe der Zeit hinzugef\u00fcgt, bleibt jedoch hinter den rein textbasierten Releases zur\u00fcck. Audio-Modelle wie Whisper verwenden ihr eigenes, verwandtes Format, das von <code>whisper.cpp<\/code>\u2013 nicht vom Hauptbinary llama.cpp \u2013 verarbeitet wird.<\/p>\n<h3>Wie w\u00e4hle ich ein GGUF-Modell aus, das zu meiner Hardware passt?<\/h3>\n<p>Suchen Sie das Modell im <a href=\"https:\/\/convly.ai\/de\/models\/\">Convly-Modell-Datenbank<\/a> nach seiner 4-Bit-VRAM-Angabe, ziehen Sie dann 1\u20133&nbsp;GB Puffer f\u00fcr Kontext und Betriebssystem-Overhead ab. F\u00fcr eine 24-GB-Karte sind Qwen3 32B (~20&nbsp;GB) oder Gemma 3 27B (~16&nbsp;GB) im Q4-Format komfortabel. Der <a href=\"https:\/\/convly.ai\/de\/llm-vram-calculator\/\">VRAM-Rechner<\/a> verarbeitet l\u00e4ngere Kontexte, wodurch der KV-Cache deutlich anw\u00e4chst.<\/p>\n<h3>Sind GGUF-Dateien sicher ausf\u00fchrbar?<\/h3>\n<p>The weights themselves are just numbers &mdash; unlike Python pickle-based checkpoints, GGUF does not execute code on load. The risk is a maliciously crafted file triggering a parser bug in the runtime. Stick to known Hugging Face uploaders (bartowski, unsloth, lmstudio-community, official vendor accounts) and keep llama.cpp, Ollama or LM Studio updated.<\/p>","protected":false},"excerpt":{"rendered":"<p>GGUF (GPT-Generated Unified Format) is a single-file binary format for quantized large language models, introduced by the llama.cpp project in [\u2026]<\/p>\n","protected":false},"author":1,"featured_media":2609,"comment_status":"closed","ping_status":"closed","sticky":false,"template":"","format":"standard","meta":{"site-sidebar-layout":"default","site-content-layout":"","ast-site-content-layout":"default","site-content-style":"default","site-sidebar-style":"default","ast-global-header-display":"","ast-banner-title-visibility":"","ast-main-header-display":"","ast-hfb-above-header-display":"","ast-hfb-below-header-display":"","ast-hfb-mobile-header-display":"","site-post-title":"","ast-breadcrumbs-content":"","ast-featured-img":"","footer-sml-layout":"","ast-disable-related-posts":"","theme-transparent-header-meta":"","adv-header-id-meta":"","stick-header-meta":"","header-above-stick-meta":"","header-main-stick-meta":"","header-below-stick-meta":"","astra-migrate-meta-layouts":"default","ast-page-background-enabled":"default","ast-page-background-meta":{"desktop":{"background-color":"var(--ast-global-color-5)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"tablet":{"background-color":"","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"mobile":{"background-color":"","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""}},"ast-content-background-meta":{"desktop":{"background-color":"var(--ast-global-color-4)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"tablet":{"background-color":"var(--ast-global-color-4)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"mobile":{"background-color":"var(--ast-global-color-4)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""}},"footnotes":""},"categories":[7],"tags":[],"class_list":["post-2608","post","type-post","status-publish","format-standard","has-post-thumbnail","hentry","category-ai-news"],"_links":{"self":[{"href":"https:\/\/convly.ai\/de\/wp-json\/wp\/v2\/posts\/2608","targetHints":{"allow":["GET"]}}],"collection":[{"href":"https:\/\/convly.ai\/de\/wp-json\/wp\/v2\/posts"}],"about":[{"href":"https:\/\/convly.ai\/de\/wp-json\/wp\/v2\/types\/post"}],"author":[{"embeddable":true,"href":"https:\/\/convly.ai\/de\/wp-json\/wp\/v2\/users\/1"}],"replies":[{"embeddable":true,"href":"https:\/\/convly.ai\/de\/wp-json\/wp\/v2\/comments?post=2608"}],"version-history":[{"count":1,"href":"https:\/\/convly.ai\/de\/wp-json\/wp\/v2\/posts\/2608\/revisions"}],"predecessor-version":[{"id":2610,"href":"https:\/\/convly.ai\/de\/wp-json\/wp\/v2\/posts\/2608\/revisions\/2610"}],"wp:featuredmedia":[{"embeddable":true,"href":"https:\/\/convly.ai\/de\/wp-json\/wp\/v2\/media\/2609"}],"wp:attachment":[{"href":"https:\/\/convly.ai\/de\/wp-json\/wp\/v2\/media?parent=2608"}],"wp:term":[{"taxonomy":"category","embeddable":true,"href":"https:\/\/convly.ai\/de\/wp-json\/wp\/v2\/categories?post=2608"},{"taxonomy":"post_tag","embeddable":true,"href":"https:\/\/convly.ai\/de\/wp-json\/wp\/v2\/tags?post=2608"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}