Wednesday, 9 September 2026 | Updating Daily AI insight, written for builders

GGUF-Modelle: Was sie sind und wie man sie ausführt

  • GGUF ist ein Single-File-Containerformat für quantisierte Modelle, das entwickelt wurde für llama.cppEin .gguf Datei enthält die Gewichte, den Tokenizer, die Chat-Vorlage und die Metadaten – kein Konfigurationsordner, keine separaten Tokenizer-Dateien.
  • GGUF-Modelle sind diejenigen, die Ollama, LM Studio, KoboldCpp, Jan und llama.cpp tatsächlich laden. Wenn Sie ein Modell lokal auf Consumer-Hardware ausführen, führen Sie mit großer Wahrscheinlichkeit GGUF aus.
  • Standardwahl: Q4_K_M. Ungefähr 0,6 GB Dateigröße pro Milliarde Parameter – ein 8B-Modell liegt bei knapp 5 GB, was der Angabe von ca. 5 GB für die 4-Bit-Variante des Llama 3.1 8B bei Convly-Modell-Datenbank entspricht.
  • GGUF ist für die lokale Inferenz durch einen einzelnen Benutzer gedacht. Für gleichzeitige Bereitstellung (concurrent serving) verwenden Sie stattdessen safetensors mit vLLM oder über eine API.

GGUF (GPT-Generated Unified Format) ist das Dateiformat, das das llama.cpp/ggml-Ökosystem verwendet, um ein Modell bereitzustellen, das sofort für Inferenz genutzt werden kann. Eine einzige .gguf Datei enthält die quantisierten Tensoren sowie alle dafür erforderlichen Komponenten: Vokabular, Tokenizer-Einstellungen, Chat-Vorlage und Architektur-Metadaten. Es ersetzte das ältere GGML-Format im August 2023 und ist heute der de-facto-Standard für den Betrieb von Modellen auf Laptops, Desktops und CPUs.

Was tatsächlich in einer .gguf-Datei steckt

Eine GGUF-Datei besteht aus einem Header, einem Key-Value-Metadatenblock und anschließend den Tensordaten. Der Metadatenblock ist praktisch der entscheidende Teil – er ist der Grund dafür, dass ein GGUF-Modell keine zusätzlichen Begleitdateien benötigt. Die GGUF-Dokumentation von Hugging Face beschreibt den Aufbau sowie den integrierten GGUF-Metadaten-Viewer des Hugging Face Hub, mit dem Sie vor dem Download mehrerer Gigabyte bereits die Quantisierungsart, die Kontextlänge und die Chat-Vorlage einer Datei einsehen können.

Typische Metadatenschlüssel umfassen die Architektur (llama, qwen3, gemma3, phi3), die trainierte Kontextlänge, RoPE-Einstellungen, das vollständige Vokabular sowie die Jinja-Chat-Vorlage. Ein Loader liest diesen Block und konfiguriert sich selbst – Sie müssen weder einen Tokenizer noch ein Prompt-Format manuell übergeben.

GGUF im Vergleich zu safetensors

GGUF safetensors
Hauptlaufzeitumgebung llama.cpp, Ollama, LM Studio PyTorch, vLLM, Transformers, TGI
Dateien pro Modell Eine (oder nummerierte Shards) Gewichte plus Konfigurations-/Tokenizer-Ordner
Quantisierung Eingebettet (Q4_K_M, Q8_0, IQ…) Üblicherweise FP16/BF16 oder Varianten wie GPTQ/AWQ
CPU + teilweiser GPU-Offload Ja, dies ist ein zentrales Designziel Eingeschränkt und langsam
Gleichzeitige, batch-basierte Bereitstellung Schwach Stark
Feinabstimmung Nein (zuvor zurückkonvertieren) Ja

Wie man einen GGUF-Dateinamen liest

Dateien werden üblicherweise benannt als Model-Name-8B-Instruct-Q4_K_M.ggufDer Suffix gibt die Quantisierungsmischung an. Die Zahl steht für die nominelle Bitbreite; _K bedeutet k-Quantisierung, bei der Attention- und Embedding-Tensoren mit höherer Genauigkeit gehalten werden als die Haupt-Gewichte der Feed-Forward-Schichten; S/M/L stehen für kleine, mittlere bzw. große Varianten dieser Mischung.

Quantisierung Ca. Bits pro Gewicht Ca. Größe, 8-B-Modell Wann Sie es verwenden sollten
Q8_0 ~8.5 ~8,5 GB Referenz mit nahezu verlustfreier Qualität; nur für kleine Modelle
Q6_K ~6.6 ~6,6 GB Sie haben VRAM im Überfluss
Q5_K_M ~5.7 ~5,7 GB Standard mit Schwerpunkt auf Qualität
Q4_K_M ~4.9 ~4,9 GB Der übliche Standard
Q4_0 ~4.5 ~4,5 GB Veraltet; einige Beschleuniger bevorzugen dieses Format
Q3_K_M ~3.9 ~4,0 GB Ein größeres Modell in wenig VRAM unterbringen
Q2_K / IQ2 ~2,5–3,4 ~2,5–3,4 GB Letztes Mittel; spürbare Qualitätsminderung

Behandeln Sie die Spalte „Bits pro Gewicht“ als ungefähre Angabe. Die tatsächlichen Größen variieren je nach Modellarchitektur (ein großer Vokabularumfang vergrößert die Embedding-Tensoren) und je nach llama.cpp-Version, da die Quantisierungsmischungen im Laufe der Zeit optimiert werden. Die IQ Familie (von IQ2_XXS bis IQ4_NL) nutzt eine Kalibrierung anhand einer Wichtigkeitsmatrix, um bei sehr niedrigen Bitbreiten besser zu halten; zudem veröffentlichen Entwickler wie Bartowski und Unsloth neben den Standard-K-Quanten auch eigene IQ-Varianten.

Die Community-Konsensmeinung – nicht eine Messung durch Convly – besagt, dass Q4_K_M der optimale Kompromiss ist und dass die Qualität unterhalb von etwa 3 Bits pro Gewicht stark abfällt: Kleinere Modelle verschlechtern sich bei gleicher Quantisierung schneller als größere.

Größenabschätzung: Welche GGUF-Modelle passen auf Ihre GPU?

Die angegebene Dateigröße stellt lediglich die Untergrenze dar, nicht den Gesamtspeicherbedarf. Hinzu kommen der KV-Cache für Ihre Kontextlänge sowie ein Overhead von ca. 500 MB bis 1 GB. Diese 4-Bit-Angaben stammen aus dem Convly-Modell-Datenbank:

Modell VRAM bei 4-Bit Kontext realistischen GPU-
Gemma 3 4B ca. 3 GB 128 K Jede 6-GB-Karte, integrierte GPU
Mistral 7B ~4,5 GB 32K 8-GB-Karte
Llama 3.1 8B ~5 GB 128 K 8-GB-Karte
Qwen3 14B ~9 GB 128 K 12-GB-Karte
Phi-4 ~9 GB 16K 12-GB-Karte
Gemma 3 27B ~16 GB 128 K 24-GB-Karte
Qwen3 32B ~20 GB 128 K 24-GB-Karte
Llama 3.3 70B ~40 GB 128 K 2×24 GB oder 48 GB einheitlicher Arbeitsspeicher
DeepSeek R1 (vollständig) ~400 GB 128 K Nur für Multi-GPU-Server

Mixture-of-Experts-Modelle sind hier die Fallgrube. Qwen3 30B-A3B aktiviert pro Token nur ca. 3 Mrd. Parameter, benötigt aber dennoch alle ca. 18 GB im Arbeitsspeicher. Im Extremfall gibt die Datenbank Kimi K3 mit ca. 1,4 TB bei 4-Bit-Quantisierung an – ein GGUF existiert prinzipiell, doch kein einzelner Rechner, den Sie besitzen, verfügt über genügend Speicher dafür. Für eine exakte Berechnung Ihres konkreten Kontexts nutzen Sie bitte das VRAM-Rechner oder die modellspezifische Aufschlüsselung in VRAM-Anforderungen für alle wichtigen Sprachmodelle. Falls Sie noch Hardware auswählen, behandelt beste GPUs für lokale LLMs den Kompromiss zwischen VRAM und Preis pro Dollar.

Wo man GGUF-Modelle herunterlädt

  • Hugging Face – filtern Sie die Modellliste mit library=gguf. Die meisten Repositories stellen sämtliche Quantisierungen in einem einzigen Repository bereit; laden Sie daher ausschließlich die benötigte Datei herunter, nicht das gesamte Repository.
  • Ollama-Bibliothekollama.com/library bietet vorkonfigurierte GGUF-Dateien mit bereits eingebauter Chatvorlage. Weitere Informationen finden Sie im Ollama-Modellliste.
  • LM Studio – die interne Registerkarte „Discover“ durchsucht Hugging Face GGUF-Repos und kennzeichnet, welche Quantisierungen in Ihr erkanntes RAM/VRAM passen. Anleitung: LM Studio – umfassende Anleitung.

Große Modelle werden fragmentiert als model-00001-of-00003.gguf usw. bereitgestellt. Laden Sie alle Fragmente in denselben Ordner herunter und geben Sie beim Laden die Datei „00001“ an – der Loader findet automatisch die restlichen Fragmente.

GGUF-Modelle unter Linux ausführen

Bauen Sie llama.cpp mit CUDA-Unterstützung:

git clone https://github.com/ggml-org/llama.cpp
cd llama.cpp
cmake -B build -DGGML_CUDA=ON
cmake --build build --config Release -j

Die Binärdateien befinden sich in build/bin/. Starten Sie einen OpenAI-kompatiblen Server:

./build/bin/llama-server -m ~/models/model-Q4_K_M.gguf -c 8192 -ngl 99 --port 8080

-ngl (--n-gpu-layers) ist der Offload-Regler: 99 bedeutet „alle Layer auf der GPU“ 0 bedeutet rein CPU-betrieb, und Zwischenwerte teilen das Modell, wenn es nicht vollständig in die GPU passt. -c legt den Kontext fest; die Verwendung des vollständigen, vom Modell trainierten Kontexts kann mehr VRAM beanspruchen als die Gewichte selbst. Der Endpunkt lautet dann http://localhost:8080/v1/chat/completions.

Zwei Versionshinweise: Der CMake-Flag hieß in älteren Versionen LLAMA_CUBLAS und die Binärdateien wurden 2024 umbenannt (vonmainllama-cli, serverllama-server). Prüfen Sie die README-Datei des von Ihnen geklonten Repositories. Für AMD- oder Intel-GPUs verwenden Sie stattdessen das dort dokumentierte ROCm-/Vulkan-/SYCL-Backend statt zu raten.

Wenn Sie stattdessen Ollama nutzen, befinden sich die Modelle in /usr/share/ollama/.ollama/models bei Systemdienst-Betrieb oder ~/.ollama/models für eine Benutzerinstallation. Siehe So installieren Sie Ollama.

GGUF-Modelle unter macOS ausführen

Apple Silicon ist bei GGUF ungewöhnlich leistungsfähig, da der Unified Memory es der GPU ermöglicht, auf den Großteil des Systemspeichers zuzugreifen – ein Mac mit 64 GB RAM kann beispielsweise ein rund 40 GB großes 4-Bit-70B-Modell laden, das auf einem PC zwei 24-GB-GPU-Karten erfordern würde.

brew install llama.cpp
llama-server -m ~/models/model-Q4_K_M.gguf -c 8192 --port 8080

Die Metal-Offload-Funktion ist in der Homebrew-Version aktiviert, sodass Sie in der Regel nicht -ngl. macOS begrenzt, wie viel Arbeitsspeicher die GPU beanspruchen darf (einstellbar über einen iogpu sysctl-Parameter, dessen Name je nach macOS-Version variiert); lassen Sie daher ausreichend Speicher für das Betriebssystem frei. Ollama speichert Modelle in ~/.ollama/models; LM Studio verwendet hingegen ~/.lmstudio/models in aktuellen Versionen und ~/.cache/lm-studio/models in älteren Versionen – die Registerkarte „Meine Modelle“ zeigt den tatsächlichen Pfad an und ermöglicht dessen Änderung.

GGUF-Modelle unter Windows ausführen

Drei Wege – vom einfachsten zum anspruchsvollsten:

  1. LM Studio – GUI-Installer, integrierte Modellsuche innerhalb der Anwendung sowie ein Umschalter für den lokalen Server. Beste Standardlösung für Nichtentwickler.
  2. Ollama – nativer Windows-Installer; Modelle werden standardmäßig in C:\Users<Sie>\.ollama\modelsgespeichert. Legen Sie die Umgebungsvariable OLLAMA_MODELS fest, um sie von dem Systemlaufwerk zu verschieben. Hintergrundinformation: Was ist Ollama?.
  3. Vorkompilierte llama.cpp-Binärdateien – die GitHub-Releases-Seite stellt pro Backend (CUDA, Vulkan, CPU) komprimierte Windows-Builds bereit. Entpacken Sie die ZIP-Datei und führen Sie in PowerShell llama-server.exe -m model.gguf -ngl 99 aus. Wählen Sie den CUDA-Build für NVIDIA-GPUs; Vulkan ist die sichere, plattformübergreifende Alternative für AMD- und Intel-Arc-GPUs.

Windows-spezifische Fallstricke: Die Echtzeit-Überwachung durch Windows Defender verlangsamt das erste Laden einer mehrere Gigabyte großen Datei deutlich; zudem kostet der Betrieb von llama.cpp innerhalb von WSL2 einen Teil des Arbeitsspeichers für die virtuelle Maschine. Native Windows-Builds sind daher meist der einfachere Weg.

Ein beliebiges GGUF-Modell in Ollama laden

Aktuelle Ollama-Versionen können Modelle direkt von Hugging Face ziehen:

ollama run hf.co//:Q4_K_M

Für eine lokale Datei erstellen Sie eine Modelfile im selben Verzeichnis:

FROM ./model-Q4_K_M.gguf

dann ollama create my-model -f Modelfile und ollama run my-model. Falls die GGUF-Datei keine verwendbare Chatvorlage enthält, fügen Sie eine TEMPLATE und PARAMETER stop -Zeile hinzu – die genauen Modelfile-Direktiven haben sich im Laufe der Versionen weiterentwickelt; prüfen Sie daher bitte ollama help create für Ihre konkrete Version. Empfohlene Auswahl: beste lokale LLMs für Ollama.

Wann GGUF die falsche Wahl ist

GGUF ist auf die Optimierung für jeweils einen einzelnen Benutzer ausgelegt. Für viele gleichzeitige Anfragen oder bei Bedarf an Tensor-Parallelität über mehrere GPUs hinweg empfehlen sich stattdessen safetensors zusammen mit vLLM oder SGLang. Und lokaler Betrieb ist nicht automatisch günstiger: Gehostete Llama 3.3 70B kosten $0,10 Ein- / $0,32 Ausgaben pro 1 Mio. Tokens, während gehostete Spitzenmodelle wie Claude Sonnet 5 bei 1 Mio. Kontextlänge $2,00 Ein- / $10,00 Ausgaben pro 1 Mio. Tokens kosten. Rechnen Sie Ihr eigenes Volumen vor dem Kauf einer GPU im API-Kostenrechner und das Selbsthosting- versus-API-Kosten-Grenzwert-Rechner durch.

Häufig gestellte Fragen

Was bedeutet GGUF, und worin unterscheidet es sich von GGML?

GGUF steht für GPT-Generated Unified Format. GGML war das frühere Format desselben Projekts; es brach stets dann die Kompatibilität, wenn neue Metadaten benötigt wurden. GGUF führte einen erweiterbaren Schlüssel-Wert-Metadatenblock ein, sodass neue Architekturen und Optionen hinzugefügt werden können, ohne bestehende Dateien ungültig zu machen. Vor-GGUF- .bin GGML-Dateien werden von aktuellem llama.cpp nicht mehr geladen.

Welche Quantisierung soll ich herunterladen?

Beginnen Sie mit Q4_K_M. Wenn das Modell noch mehrere GB VRAM frei lässt, steigen Sie auf Q5_K_M oder Q6_K auf. Passt es nicht hinein, bevorzugen Sie ein kleineres Modell in Q4_K_M gegenüber demselben Modell in Q2_K – ein 14B-Modell im 4-Bit-Format schneidet in der Regel besser ab als ein 32B-Modell, das auf 2 Bit herunterkomprimiert wurde. Prüfen Sie die Passgenauigkeit mit dem VRAM-Rechner bei Ihrer geplanten Kontextlänge.

Kann ich GGUF-Modelle ohne GPU ausführen?

Ja – Inferenz allein auf der CPU ist genau das, wofür GGUF entwickelt wurde. Die Geschwindigkeit ist durch die Speicherbandbreite begrenzt: Erwarten Sie bei typischem Dual-Channel-Desktop-Arbeitsspeicher einstellige Token/Sekunde für ein 7B–8B-Modell im Q4_K_M-Format und noch langsamere Werte für größere Modelle. Kleine Modelle wie Gemma 3 4B (ca. 3 GB im 4-Bit-Format) sind die praktikable Wahl für reinen CPU-Betrieb.

Kann ich ein Hugging Face-Modell selbst in das GGUF-Format konvertieren?

Ja. llama.cpp liefert ein Konvertierungsskript mit (convert_hf_to_gguf.py in aktuellen Versionen; der Dateiname verwendete in älteren Versionen Bindestriche), das zunächst eine F16-GGUF-Datei erzeugt, die anschließend vom llama-quantize Binary auf eine Zielquantisierung komprimiert wird. Prüfen Sie die --help -Option des Skripts in Ihrer geklonten Version und vergewissern Sie sich vorab, dass Ihre Architektur unterstützt wird – nicht unterstützte Architekturen scheitern bereits bei der Konvertierung.

Unterstützen GGUF-Modelle Multimodalität (z. B. Vision) oder Tool Calling?

Tool Calling funktioniert dort, wo die Chatvorlage des Modells dies definiert und Ihr Loader die Vorlage respektiert. Multimodale Modelle benötigen zusätzlich eine zweite Datei – eine mmproj -GGUF-Datei mit dem Vision-Projector, die gemeinsam mit den Text-Gewichten geladen wird. Die multimodalen Werkzeuge in llama.cpp wurden bereits mehrfach umbenannt und neu strukturiert; orientieren Sie sich daher an der aktuellen Repository-Dokumentation statt an veralteten Tutorials.

Ändert die Quantisierung das Kontextfenster?

Nein. Der Kontext ist eine Eigenschaft des Modells, nicht der Quantisierung: Llama 3.3 70B hat 128K Kontextlänge und Llama 4 Scout 10M – unabhängig davon, ob Sie im F16- oder Q4_K_M-Format arbeiten. Was sich ändert, ist lediglich, ob Sie den KV-Cache für diesen Kontext im verfügbaren Speicher unterbringen können. Vergleichen Sie Kontextlänge und Preise verschiedener Modelle auf der LLM-Leaderboard.

Verfasst von Mustafa Ihsan

Mustafa Ihsan ist Gründer und Chefredakteur von Convly.ai. Er entwickelte und pflegt die Live-Datenbank für KI-Modelle der Website, ihren Preis-Leistungs-Index sowie kostenlose Rechner für VRAM-Anforderungen, API-Kosten und Wirtschaftlichkeit des Self-Hostings. Er schreibt über Modellpreise, Benchmark-Ergebnisse und die Hardware, die zum lokalen Betrieb von KI-Modellen erforderlich ist, und bevorzugt stets messbare Zahlen gegenüber Herstellerangaben.

Scroll to Top