Thursday, 10 September 2026 | Updating Daily AI insight, written for builders

GGUF-Modellformat: Was es ist und wie man ein Modell ausführt

  • GGUF (GPT-Generated Unified Format) ist ein Binärformat für quantisierte Large Language Models in einer einzigen Datei. Es wurde im August 2023 vom llama.cpp-Projekt als Nachfolger von GGML eingeführt.
  • Es bündelt Gewichte, Tokenizer, Chat-Vorlage und Metadaten in einer einzigen .gguf Datei, die auf CPU, GPU oder einer Kombination aus beiden läuft über llama.cpp, Ollama, LM Studio, KoboldCpp und text-generation-webui.
  • Quantisierungsstufen wie Q4_K_M, Q5_K_M und Q8_0 opfern Qualität zugunsten geringerer Größe – eine 4-Bit-Quantisierung eines 8B-Modells benötigt etwa 5 GB RAM oder VRAM.
  • Laden Sie Dateien von Hugging Face herunter (Suche nach „GGUF“) und laden Sie sie mit llama-cli -m model.gguf oder ollama runein; wählen Sie dann eine Quantisierung aus, die zu Ihrer Hardware passt, mithilfe der VRAM-Rechner.

A GGUF-Modell ist ein Large Language Model, das im GGUF-Dateiformat verpackt ist – einem Einzel-Datei-Container, der die quantisierten Gewichte, den Tokenizer, Hyperparameter und die Prompt-Vorlage eines Modells enthält. Es wurde von Georgi Gerganov und dem llama.cpp Projekt im August 2023 entwickelt, um das ältere GGML-Format zu ersetzen. GGUF ermöglicht es, eine einzige Datei herunterzuladen, einen Laufzeitprozess darauf auszurichten und sofort ein funktionierendes lokales LLM Modell auf einem Laptop oder Workstation auszuführen.

Was GGUF tatsächlich ist

GGUF steht für GPT-Generated Unified Format. Strukturell handelt es sich um eine Binärdatei mit einem Header, einem Schlüssel-Wert-Metadatenblock, einem Tensorindex und den eigentlichen Tensordaten. Die offizielle GGUF-Spezifikation im ggml-Repository definiert das Layout.

Für Nutzer sind zwei Eigenschaften entscheidend:

  • Selbstständig (self-contained). Die Datei enthält den Tokenizer, spezielle Tokens, EOS-/BOS-IDs, die Chat-Vorlage sowie Architektur-Metadaten. Sie benötigen keine separate tokenizer.json oder config.json Datei daneben.
  • Speicherabbildbar (memory-mappable). Laufzeitumgebungen verwenden mmap() , um die Datei abzubilden, sodass der Start nahezu sofort erfolgt und das Betriebssystem die Gewichte bei Bedarf seitenweise nachlädt. Daher öffnet sich eine 40-GB-GGUF-Datei selbst auf einer langsamen SSD innerhalb weniger Sekunden.

GGUF ersetzte GGML, weil GGML keine Versionsverwaltung besaß, Metadaten mit den Gewichten vermischte und bei jeder neuen Architektur brach. GGUF hingegen ist versioniert und erweiterbar.

Quantisierung: Das Namensschema

Die meisten GGUF-Dateien, die Sie herunterladen, sind quantisiert – die Gewichte werden mit weniger Bits als im ursprünglichen FP16-Format gespeichert. Der Suffix in der Dateinamenerweiterung verrät Ihnen, welches Quantisierungsschema verwendet wurde. Die aktuellen Varianten sind in der llama.cpp-quantize-README.

Quantisierung Bits pro Gewicht (ca.) Typischer Einsatz
Q2_K ~2.6 Kleinste Variante mit spürbarem Qualitätsverlust
Q3_K_M ~3.9 Aggressive Komprimierung
Q4_K_M ~4.8 Häufigste Standardvariante – gutes Verhältnis von Größe zu Qualität
Q5_K_M ~5.7 Höhere Qualität, größere Dateigröße
Q6_K ~6.6 Nahezu verlustfrei im Vergleich zu FP16
Q8_0 ~8.5 Effektiv verlustfrei, etwa doppelt so groß wie Q4
F16 / BF16 16 Unquantisierter Referenzwert

Der _K Varianten sind sogenannte k-quants, die pro Tensorblock variable Genauigkeit nutzen. Die Suffixe _M / _S / _L deuten mittlere, kleine oder große Block-Mix-Voreinstellungen an. Neuere IQ Varianten (z. B. IQ4_XS) nutzen Importance-Matrix-Kalibrierung, um bei gleicher Bit-Budget-Auslastung eine bessere Qualität zu erreichen.

Als Faustregel für die benötigte VRAM: Nehmen Sie die Dateigröße auf der Festplatte und addieren Sie grob 1–3 GB für den KV-Cache bei kurzen Kontexten – bei langen Kontexten entsprechend mehr. Aus der Convly-Modell-Datenbank: Llama 3.1 8B benötigt etwa 5 GB bei 4-Bit-Quantisierung, Llama 3.3 70B etwa 40 GB und Mistral 7B etwa 4,5 GB. Für größere Modelle ist die VRAM-Anforderungstabelle schnellste Lookup-Methode.

Wo man GGUF-Dateien bekommt

Nahezu alle GGUF-Veröffentlichungen erfolgen auf Hugging Face. Suchen Sie nach dem Modellnamen zusammen mit „GGUF“. Zuverlässige Re-Quantisierer umfassen bartowski, Qwen (offiziell für Qwen3), lmstudio-community, unsloth und MaziyarPanahi. Meta, Google, Mistral und Microsoft veröffentlichen einige offizielle GGUF-Builds; für andere quantisiert die Community aus den veröffentlichten safetensors.

Ein Repository enthält typischerweise eine Datei pro Quantisierungsstufe, z. B. Meta-Llama-3.1-8B-Instruct-Q4_K_M.gguf. Bei Modellen über ~50 GB wird die Datei in Shards mit Namen wie -00001-of-00003.ggufaufgeteilt; Laufzeitumgebungen laden sie automatisch vom ersten Shard aus.

Ausführung eines GGUF-Modells

Linux

Bauen Sie llama.cpp aus dem Quellcode oder installieren Sie das vorgefertigte Binärpaket. Mit CUDA:

git clone https://github.com/ggml-org/llama.cpp
cd llama.cpp
cmake -B build -DGGML_CUDA=ON
cmake --build build --config Release -j
./build/bin/llama-cli -m ~/models/llama-3.1-8b-instruct-Q4_K_M.gguf 
    -p "Erklären Sie GGUF in einem Absatz." -n 256 -ngl 99

Der -ngl Mit der Option „-ngl“ (n-gpu-layers) legen Sie fest, wie viele Transformer-Schichten auf die GPU verlagert werden. Wählen Sie einen Wert hoch genug, damit das gesamte Modell in den VRAM passt; falls Sie Speicher knapp werden, senken Sie diesen Wert – der Rest bleibt dann auf der CPU. Um eine OpenAI-kompatible HTTP-API bereitzustellen, verwenden Sie llama-server standardmäßig auf Port 8080.

macOS

Auf Apple Silicon nutzt llama.cpp automatisch den Metal-Backend. Installieren Sie es über Homebrew:

brew install llama.cpp
llama-cli -m ~/models/qwen3-8b-Q5_K_M.gguf -p "Hallo" -ngl 99

Bei vereinheitlichtem Arbeitsspeicher entspricht die Obergrenze Ihrem gesamten RAM abzüglich des Betriebssystem-Overheads. Ein 32 GB M-Serie-Mac führt problemlos Qwen3 14B oder -ngl Die Obergrenze ist Ihr gesamter Arbeitsspeicher abzüglich des Betriebssystem-Overheads. Ein 32-GB-M-Serie-Mac führt problemlos Qwen3 14B oder Gemma 3 12B im Format Q4_K_M aus – die Datenbank listet diese Modelle mit jeweils ca. 9 GB und ca. 8 GB VRAM auf.

Für eine grafische Benutzeroberfläche ist LM Studio die übliche Wahl unter macOS. Es lädt GGUF-Dateien direkt von Hugging Face herunter und stellt einen lokalen, OpenAI-kompatiblen Server bereit.

Windows

Drei praktikable Wege:

  • Ollama. Installieren Sie es von ollama.com/download, dann ollama run llama3.1:8b. Ollama zieht seine eigenen kuratierten GGUF-Modelle. Um eine beliebige Datei zu laden, schreiben Sie eine Modelfile mit einer Zeile FROM ./mymodel.gguf und führen Sie dann aus ollama create mymodel -f Modelfile. Siehe unsere Ollama-Installationsanleitung.
  • LM Studio. Ein-Klick-Installation, Durchsuchen und Herunterladen von GGUF über eine grafische Oberfläche sowie ein Schieberegler zur GPU-Offload-Steuerung.
  • llama.cpp-Release-Binärdateien. Das Projekt stellt vorgefertigte Windows-Zip-Archive für CPU, CUDA und Vulkan auf der GitHub-Releases-Seitezur Verfügung. Entpacken Sie sie und führen Sie llama-cli.exe auf dieselbe Weise aus wie unter Linux.

Zur Auswahl der GPU empfehlen wir den lokale-LLM-GPU-Leitfaden , der aktuelle Preis-/VRAM-Optionen abdeckt.

GGUF im Vergleich zu Safetensors, AWQ und GPTQ

Format Hauptlaufzeitumgebung Präzision Am besten geeignet für
GGUF llama.cpp, Ollama, LM Studio 2–8 Bit + F16 CPU, gemischte CPU/GPU, Apple Silicon, Einzelbenutzer
Safetensors (FP16/BF16) Transformers, vLLM 16-Bit Training, Forschung, Inferenz mit voller Genauigkeit
AWQ vLLM, AutoAWQ 4-Bit GPU-basierte Hochdurchsatz-Serveranwendung
GPTQ vLLM, ExLlamaV2 3–8 Bit GPU-only-Inferenz mit Batch-Verarbeitung
MLX MLX (Apple) 4–16 Bit Nur für Apple Silicon

Wählen Sie GGUF, wenn das Ziel ein einzelner Nutzer auf heterogener Hardware ist oder wenn Sie sicherstellen möchten, dass das Modell überhaupt auf der CPU läuft. Wählen Sie vLLM mit AWQ-/GPTQ-Safetensors, wenn Sie viele gleichzeitige Nutzer auf einer Rechenzentrums-GPU bedienen.

Wann GGUF nicht die richtige Wahl ist

GGUF setzt Single-Stream-, Batch-Größe-1-Inferenz voraus. Der Durchsatz ist bei gleichzeitiger Last deutlich geringer als bei vLLM oder TensorRT-LLM, und es gibt keine paged attention. Wenn Sie eine API für echten Produktivbetrieb bereitstellen, schlägt eine FP16- oder AWQ-basierte Bereitstellung mit vLLM bei Tokens/Sekunde/Dollar selbst dann noch GGUF – ganz zu schweigen von der eingesparten Entwicklerzeit.

Außerdem stößt es bei den größten Modellgrößen an seine Grenzen. Kimi K3 benötigt etwa 1,4 TB VRAM bei 4-Bit-Quantisierung und DeepSeek V4-Pro rund 800 GB – das sind Mehrknoten-Deployments, keine Desktop-GGUF-Workloads. Und für führende gehostete Modelle wie Claude Sonnet 4.6 zu 3 $ pro Million Tokens Eingabe und 15 $ pro Million Tokens Ausgabe oder Gemini 3.6 Flash zu 1,50 $ pro Million Tokens Eingabe und 7,50 $ pro Million Tokens Ausgabe existieren keine lokalen Gewichte, die konvertiert werden könnten. Rechnen Sie die Zahlen für die Selbsthosting vs. API-Rechner durch, bevor Sie sich für einen GPU-Kauf entscheiden.

Konvertierung eines Modells nach GGUF

Falls ein Modell auf Hugging Face als safetensors-Datei vorliegt, aber noch niemand es quantisiert hat, lautet der Workflow:

# im llama.cpp-Repository
pip install -r requirements.txt
python convert_hf_to_gguf.py /pfad/zu/hf-modell --outfile modell-f16.gguf
./build/bin/llama-quantize modell-f16.gguf modell-Q4_K_M.gguf Q4_K_M

Das Konversionsskript unterstützt nur Architekturen, die llama.cpp bereits kennt – darunter llama, mistral, qwen2/3, gemma, phi sowie eine wachsende Liste weiterer. Für neuartige Architekturen ist zunächst eine Anpassung des Codes erforderlich. Dateinamen und Flags im Skript haben sich zwischen verschiedenen llama.cpp-Versionen geändert; prüfen Sie daher python convert_hf_to_gguf.py --help gegenüber dem Commit, aus dem Sie gebaut haben.

Häufig gestellte Fragen

Ist GGUF dasselbe wie GGML?

Nein. GGML war das frühere Format, das llama.cpp bis Mitte 2023 verwendete. GGUF ersetzte es im August 2023 mit einem versionierten Header, eingebetteten Metadaten und einem stabilen Tensor-Layout. Alte .bin GGML-Dateien werden von aktuellen llama.cpp-Versionen nicht mehr geladen; Sie müssen stattdessen eine neu quantisierte GGUF-Version finden.

Welche Quantisierung soll ich herunterladen?

Beginnen Sie mit Q4_K_MEs eignet sich für die breiteste Palette an Hardware, und der Qualitätsverlust gegenüber FP16 ist bei den meisten Modellen mit über 7 Milliarden Parametern gering. Steigen Sie auf Q5_K_M oder Q6_K hoch, wenn Sie zusätzliche VRAM-Kapazität haben und Wert auf Codierungs- oder Schlussfolgerungsgenauigkeit legen. Reduzieren Sie auf Q3_K_M oder eine IQ3 -Variante nur dann, wenn das Modell andernfalls nicht passt.

Kann GGUF-Modelle meine GPU nutzen?

Ja. llama.cpp unterstützt CUDA (NVIDIA), ROCm (AMD), Metal (Apple), Vulkan (plattformübergreifend) und SYCL (Intel). Die -ngl -Option entlastet Layer auf die GPU. Passt das gesamte Modell in die VRAM, liegt der Durchsatz nahe dem von dedizierten GPU-Laufzeiten; bei teilweiser Entlastung richtet sich die Geschwindigkeit nach dem langsamsten Layer, unabhängig davon, ob dieser auf GPU oder CPU läuft.

Funktioniert GGUF mit Vision- oder Audio-Modellen?

Teilweise. llama.cpp unterstützt multimodale LLaVA-ähnliche Vision-Modelle über eine zugehörige mmproj GGUF-Datei, die den Vision-Projector enthält. Die Unterstützung für Qwen-VL, Gemma-3-Vision und ähnliche Modelle wurde im Laufe der Zeit hinzugefügt, bleibt jedoch hinter den rein textbasierten Releases zurück. Audio-Modelle wie Whisper verwenden ihr eigenes, verwandtes Format, das von whisper.cpp– nicht vom Hauptbinary llama.cpp – verarbeitet wird.

Wie wähle ich ein GGUF-Modell aus, das zu meiner Hardware passt?

Suchen Sie das Modell im Convly-Modell-Datenbank nach seiner 4-Bit-VRAM-Angabe, ziehen Sie dann 1–3 GB Puffer für Kontext und Betriebssystem-Overhead ab. Für eine 24-GB-Karte sind Qwen3 32B (~20 GB) oder Gemma 3 27B (~16 GB) im Q4-Format komfortabel. Der VRAM-Rechner verarbeitet längere Kontexte, wodurch der KV-Cache deutlich anwächst.

Sind GGUF-Dateien sicher ausführbar?

Die Gewichte selbst sind lediglich Zahlen – im Gegensatz zu Python-Pickle-basierten Checkpoints führt GGUF beim Laden keinen Code aus. Das Risiko besteht darin, dass eine bösartig gestaltete Datei einen Parser-Fehler in der Laufzeit auslöst. Bleiben Sie bei bekannten Hugging-Face-Uploadern (bartowski, unsloth, lmstudio-community, offizielle Vendor-Accounts) und halten Sie llama.cpp, Ollama oder LM Studio aktuell.

Verfasst von Mustafa Ihsan

Mustafa Ihsan ist Gründer und Chefredakteur von Convly.ai. Er entwickelte und pflegt die Live-Datenbank für KI-Modelle der Website, ihren Preis-Leistungs-Index sowie kostenlose Rechner für VRAM-Anforderungen, API-Kosten und Wirtschaftlichkeit des Self-Hostings. Er schreibt über Modellpreise, Benchmark-Ergebnisse und die Hardware, die zum lokalen Betrieb von KI-Modellen erforderlich ist, und bevorzugt stets messbare Zahlen gegenüber Herstellerangaben.

Scroll to Top