- llamafile verpackt ein GGUF-Modell und die llama.cpp-Inferenz-Engine in eine einzige ausführbare Datei, die unter Linux, macOS, Windows, FreeBSD und weiteren Betriebssystemen läuft – ohne Installation erforderlich.
- Ausführen
./model.llamafileund eine Browser-Chat-Oberfläche öffnet sich automatisch; eine OpenAI-kompatible API ist unterhttp://localhost:8080/v1. - Dateien größer als 4 GB können unter Windows nicht direkt ausgeführt werden – verwenden Sie eine geringere Quantisierung oder führen Sie Laufzeitumgebung und GGUF-Datei separat aus.
- Ideal für luftgekoppelte Systeme, USB-Bereitstellung und den Austausch als Einzeldatei. Ollama eignet sich besser für das langfristige Management mehrerer Modelle.
llamafile ist eine einzelne ausführbare Datei, die sowohl ein Sprachmodell als auch die zugehörige Inferenz-Laufzeitumgebung enthält. Basierend auf llama.cpp und Cosmopolitan Libc läuft dieselbe Datei nativ unter Linux, macOS, Windows, FreeBSD und anderen Betriebssystemen – ohne Container, ohne Python-Umgebung und ohne Paketmanager.
- Wie eine einzelne Datei auf jedem Betriebssystem läuft
- Herunterladen und Ausführen einer llamafile
- Die integrierte Web-Oberfläche
- Die OpenAI-kompatible API
- Erstellen einer llamafile aus einer bestehenden GGUF-Datei
- llamafile im Vergleich zu Ollama: Wann welches Werkzeug einzusetzen ist
- Hardware-Anforderungen
- Häufig gestellte Fragen
Wie eine einzelne Datei auf jedem Betriebssystem läuft
llamafile stützt sich auf zwei Technologien. llama.cpp stellt die C++-Inferenz-Engine für Modelle im GGUF-Format bereit. Cosmopolitan Libc erzeugt eine Polyglot-Binärdatei: einen einzigen Byte-Stream, der gleichzeitig dem PE/COFF-Format entspricht, das Windows erwartet, dem ELF-Format für Linux und dem Mach-O-Header für macOS. Beim Ausführen findet jeder Betriebssystem-Loader seinen eigenen gültigen Header und führt die Binärdatei nativ aus – ohne Emulation oder Übersetzungsschicht.
Die Modellgewichte werden mithilfe eines ZIP-kompatiblen Containers an diese Binärdatei angehängt. ZIP erlaubt beliebige Daten vor dem zentralen Verzeichniseintrag, sodass die GGUF-Datei am Ende der Datei platziert werden kann, ohne die Ausführbarkeit zu beeinträchtigen. Die Laufzeitumgebung lokalisiert die Gewichte beim Start durch eine Suche vom Dateiende her. Ein praktischer Nebeneffekt: Sie können die Gewichte aus jeder llamafile mit einem Standard-ZIP-Tool untersuchen oder extrahieren.
Herunterladen und Ausführen einer llamafile
Vorgefertigte llamafiles werden von Modellautoren auf Hugging Face veröffentlicht und im Mozilla-Ocho/llamafile-GitHub-Repositoryverlinkt. Die Dateien verwenden die Endung .llamafile .
Linux und macOS
# Ausführbar machen – heruntergeladene Dateien haben standardmäßig keine Ausführungsberechtigung
chmod +x mistral-7b-instruct.llamafile
# Server und Web-Oberfläche starten (Browser öffnet sich automatisch)
./mistral-7b-instruct.llamafile
# Einmalige CLI-Inferenz ohne Serverstart
./mistral-7b-instruct.llamafile -p "Erkläre llamafile in einem Absatz"Der Server bindet standardmäßig an 127.0.0.1:8080 . Übergeben Sie --port 9000 , um den Port zu ändern, oder --host 0.0.0.0 --host 0.0.0.0, um auf allen Netzwerkschnittstellen zu lauschen – nützlich, wenn Sie von einer headless-Maschine aus im lokalen Netzwerk bereitstellen. Führen Sie ./model.llamafile --help
Windows
aus, um alle verfügbaren Flags anzuzeigen, darunter Optionen zum Unterdrücken des automatischen Browser-Tabs bei headless-Betrieb. .exe. Benennen Sie die Datei vor dem Ausführen um:
ren mistral-7b-instruct.llamafile mistral-7b-instruct.llamafile.exeDoppelklicken Sie dann darauf im Explorer oder führen Sie sie über die Eingabeaufforderung aus. Ein Browser-Tab öffnet sich automatisch.
Die 4-GB-Grenze. Der Windows-PE-Loader kann ausführbare Dateien größer als 4 GB nicht verarbeiten. Die meisten 7B-Modelle in Q8- oder höherer Quantisierung sowie sämtliche 13B+-Modelle überschreiten diese Schwelle. Ist die Datei größer als 4 GB, lehnt Windows deren Ausführung ab. Ihre Optionen: Laden Sie eine Q4_K_M stärker quantisierte Variante herunter (typischerweise 4–5 GB für ein 7B-Modell, oft knapp unter der Grenze) oder laden Sie die eigenständige llamafile-Laufzeitbinärdatei herunter und übergeben Sie die GGUF-Datei als separaten Parameter. Bevor Sie ein Modell und dessen Quantisierung wählen, prüfen Sie die VRAM- und Dateigrößenanforderungen gängiger Sprachmodelle , um die für Ihre Hardware geeignete Quantisierung auszuwählen.
Die integrierte Web-Oberfläche
Das Ausführen einer llamafile ohne die Option -p startet einen HTTP-Server und öffnet Ihren Standardbrowser unter http://localhost:8080. Die Oberfläche ist eine vollständig eigenständige Single-Page-Anwendung ohne externe CDN-Abhängigkeiten – sie funktioniert komplett offline. Sie bietet Folgendes:
- Konfiguration der System-Prompt
- Sampling-Parameter: Temperatur, Top-p, Top-k, Wiederholungsstrafe
- Anzeige der Tokenanzahl
- Dauerhafte Gesprächsverläufe innerhalb der Sitzung
Jedes Gerät im lokalen Netzwerk kann auf die Oberfläche zugreifen, sofern Sie den Server mit --host 0.0.0.0.
Die OpenAI-kompatible API
--host 0.0.0.0 http://localhost:8080/v1gestartet haben. Solange der Server läuft, stellt llamafile eine OpenAI-kompatible REST-API unter
curl http://localhost:8080/v1/chat/completions
-H "Content-Type: application/json"
-d '{
"model": "local",
"messages": [{"role": "user", "content": "Hallo"}]
}'In Python setzen Sie base_url="http://localhost:8080/v1" und einen beliebigen nicht-leeren String als API-Schlüssel beim Erstellen des openai.OpenAI -Clients. Modell Das Feld »requests« wird ignoriert – das geladene Modell wird stets verwendet.
Erstellen einer llamafile aus einer bestehenden GGUF-Datei
Falls Sie bereits ein GGUF-Modell besitzen – aus dem llama.cpp-Ökosystem, dem lokalen Cache von Ollama oder einem Download von Hugging Face – können Sie es in eine eigenständige llamafile verpacken. Der Vorgang nutzt das llamafile-zipalign -Hilfsprogramm, das im llamafile-Toolset enthalten ist:
- Laden Sie das llamafile-Release-Archiv für Ihre Plattform von der GitHub-Releases-Seite.
- herunter.
Extrahieren Sie die eigenständigellamafile - Nutzen Sie
llamafile-zipalign-Binärdatei (lediglich die Laufzeitumgebung, ohne integriertes Modell). - Markieren Sie das Ergebnis als ausführbar und führen Sie es aus.
Die genaue Syntax der Befehlszeilenoptionen hat sich zwischen den Versionen geändert. Beachten Sie daher bitte den Abschnitt »Creating llamafiles« im offiziellen README für die aktuelle Syntax. Die Ausgabe ist eine einzige portable Datei, die Sie wie jede andere Binärdatei verteilen können.
llamafile im Vergleich zu Ollama: Wann welches Werkzeug einzusetzen ist
Beide Tools führen GGUF-Modelle lokal aus und stellen OpenAI-kompatible APIs bereit. Sie lösen unterschiedliche Probleme. Für einen tieferen Vergleich der beiden Ansätze siehe die Kompletter Ollama-Leitfaden Vergleichstabelle
| Kriterium | Extrahieren Sie die eigenständige | Ollama |
|---|---|---|
| Installation | Keine erforderlich – einfach herunterladen und ausführen | Installer oder Paketmanager erforderlich |
| Modellverwaltung | Manuell – je Modell eine Datei | Eingebaute Bibliothek, ollama pull |
| Tragbarkeit | Einzelne Datei – USB-Stick, E-Mail, NFS-Freigabe | Erfordert den Ollama-Daemon auf dem Zielrechner |
| GPU-Beschleunigung | CUDA, Metal, ROCm (automatische Erkennung) | CUDA, Metal, ROCm |
| Mehrmodell-Serverbetrieb | Ein Modell pro Prozess | Mehrere Modelle mit automatischem Hot-Swap |
| Große Modelle unter Windows | Eingeschränkt: nur ausführbare Dateien < 4 GB | Vollständige Unterstützung beliebiger Größe |
| Betrieb in abgeschotteten Netzwerken (Air-gapped) | Ausgezeichnet – keine Laufzeitabhängigkeiten | Erfordert die Installation eines Daemons |
| Integrierte Web-Oberfläche | Ja, ohne zusätzliche Installation | Erfordert eine separate Frontend-Anwendung |
Wählen Sie llamafile wenn Sie auf Rechnern ohne Ihre Kontrolle verteilen, in abgeschotteten Umgebungen arbeiten oder ein Modell in ein Projekt einbetten möchten, das ohne systemweite Abhängigkeiten funktionieren muss. Wählen Sie Ollama wenn Sie eine Modellbibliothek verwalten, automatische Updates wünschen oder innerhalb einer Sitzung häufig zwischen verschiedenen Modellen wechseln.
Falls Sie prüfen möchten, ob lokale Inferenz für Ihre Workload wirtschaftlich sinnvoll ist, kann der Selbsthosting- versus-API-Kosten-Grenzwert-Rechner Kostenvergleichsrechner
Hardware-Anforderungen
llamafile fügt gegenüber llama.cpp nur vernachlässigbare Overhead-Kosten hinzu. Der Engpass liegt stets in der Modellgröße und der Quantisierung. llamafile erkennt beim Start verfügbare Beschleuniger – CUDA für NVIDIA-GPUs, Metal für Apple Silicon und ROCm für AMD – und nutzt diese automatisch. Falls keine GPU gefunden wird, erfolgt ein Fallback auf CPU-Inferenz mittels AVX2- oder AVX-512-Befehlen, sofern verfügbar.
Ein Modell mit 7 Milliarden Parametern in Q4_K_M-Quantisierung benötigt etwa 4–5 GB VRAM, um vollständig auf der GPU ausgeführt zu werden. Nutzen Sie den VRAM-Rechner VRAM-Anforderungsrechner bestes GPUs für lokale LLMs Anleitung Hardware-Kaufleitfaden
Häufig gestellte Fragen
Kann ich llamafile auf Apple Silicon ausführen?
Ja. llamafile erzeugt auf Apple Silicon eine native Mach-O-Binärdatei und nutzt automatisch die Metal-GPU-Beschleunigung. Die Leistung ist solide für 7B- und 13B-Modelle; größere Modelle sind durch den verfügbaren Unified Memory begrenzt. Ein M2 Max oder M3 Pro mit 36 GB Unified Memory kann problemlos Modelle der 30B-Klasse ausführen.
Unterstützt llamafile multimodale (Visions-)Modelle?
llamafile basiert auf llama.cpp, das LLaVA-artige Visionsmodelle unterstützt. Ob eine bestimmte llamafile Eingabebilder verarbeiten kann, hängt davon ab, ob das eingebettete Modell tatsächlich multimodal ist. Prüfen Sie dazu die Modellbeschreibung (Model Card) der heruntergeladenen Datei – die Funktionalität liegt in den Gewichten, nicht in der Laufzeitumgebung.
Wie beende ich den Server?
Presse Strg+C im Terminal, in dem llamafile läuft. Falls Sie es unter Windows oder macOS per Doppelklick gestartet haben, schließen Sie das erschienene Terminalfenster oder beenden Sie den Prozess über den Task-Manager bzw. Activity Monitor.
Kann ich llamafile als Hintergrunddienst ausführen?
Ja. Unter Linux können Sie es in eine systemd-Unit-Datei einbinden. Unter macOS erstellen Sie eine launchd-plist-Datei. llamafile akzeptiert Standard-Unix-Signale und funktioniert mit jedem Prozessüberwachungssystem. Führen Sie , um auf allen Netzwerkschnittstellen zu lauschen – nützlich, wenn Sie von einer headless-Maschine aus im lokalen Netzwerk bereitstellen. Führen Sie llamafile --help
Ist llamafile dasselbe wie eine GGUF-Datei?
Nein. Eine GGUF-Datei enthält ausschließlich die Modellgewichte und erfordert eine separate Laufzeitumgebung – etwa llama.cpp oder Ollama, LM Studio, oder Ähnliches, zum Ausführen benötigt. Eine llamafile fasst Gewichte und und Laufzeitumgebung in einer einzigen Datei zusammen. Da die Gewichte im ZIP-Format angehängt sind, können Sie mit jedem gängigen ZIP-Tool das rohe GGUF aus einer beliebigen llamafile extrahieren und an anderer Stelle verwenden.
Wie schneidet llamafile im Vergleich zu LM Studio ab?
LM Studio ist eine GUI-basierte Desktop-Anwendung zur Modellentdeckung und -ausführung – sie erfordert eine Installation und verwaltet eine Bibliothek von Modellen; dadurch ähnelt sie eher Ollama als llamafile. llamafile hingegen ist ein Bereitstellungsformat: ohne grafische Benutzeroberfläche, ohne Modellbibliothek – lediglich eine ausführbare Datei. LM Studio eignet sich für Nutzer, die eine visuelle Oberfläche bevorzugen; llamafile dagegen für automatisierte, headless oder portable Bereitstellungen. Weitere Details finden Sie im LM Studio – umfassende Anleitung für eine umfassende Gegenüberstellung.

