Thursday, 13 August 2026 | Updating Daily AI insight, written for builders

llamafile: Führen Sie beliebige Sprachmodelle als einzelne portable ausführbare Datei aus

  • llamafile verpackt ein GGUF-Modell und die llama.cpp-Inferenz-Engine in eine einzige ausführbare Datei, die unter Linux, macOS, Windows, FreeBSD und weiteren Betriebssystemen läuft – ohne Installation erforderlich.
  • Ausführen ./model.llamafile und eine Browser-Chat-Oberfläche öffnet sich automatisch; eine OpenAI-kompatible API ist unter http://localhost:8080/v1.
  • Dateien größer als 4 GB können unter Windows nicht direkt ausgeführt werden – verwenden Sie eine geringere Quantisierung oder führen Sie Laufzeitumgebung und GGUF-Datei separat aus.
  • Ideal für luftgekoppelte Systeme, USB-Bereitstellung und den Austausch als Einzeldatei. Ollama eignet sich besser für das langfristige Management mehrerer Modelle.

llamafile ist eine einzelne ausführbare Datei, die sowohl ein Sprachmodell als auch die zugehörige Inferenz-Laufzeitumgebung enthält. Basierend auf llama.cpp und Cosmopolitan Libc läuft dieselbe Datei nativ unter Linux, macOS, Windows, FreeBSD und anderen Betriebssystemen – ohne Container, ohne Python-Umgebung und ohne Paketmanager.

Wie eine einzelne Datei auf jedem Betriebssystem läuft

llamafile stützt sich auf zwei Technologien. llama.cpp stellt die C++-Inferenz-Engine für Modelle im GGUF-Format bereit. Cosmopolitan Libc erzeugt eine Polyglot-Binärdatei: einen einzigen Byte-Stream, der gleichzeitig dem PE/COFF-Format entspricht, das Windows erwartet, dem ELF-Format für Linux und dem Mach-O-Header für macOS. Beim Ausführen findet jeder Betriebssystem-Loader seinen eigenen gültigen Header und führt die Binärdatei nativ aus – ohne Emulation oder Übersetzungsschicht.

Die Modellgewichte werden mithilfe eines ZIP-kompatiblen Containers an diese Binärdatei angehängt. ZIP erlaubt beliebige Daten vor dem zentralen Verzeichniseintrag, sodass die GGUF-Datei am Ende der Datei platziert werden kann, ohne die Ausführbarkeit zu beeinträchtigen. Die Laufzeitumgebung lokalisiert die Gewichte beim Start durch eine Suche vom Dateiende her. Ein praktischer Nebeneffekt: Sie können die Gewichte aus jeder llamafile mit einem Standard-ZIP-Tool untersuchen oder extrahieren.

Herunterladen und Ausführen einer llamafile

Vorgefertigte llamafiles werden von Modellautoren auf Hugging Face veröffentlicht und im Mozilla-Ocho/llamafile-GitHub-Repositoryverlinkt. Die Dateien verwenden die Endung .llamafile .

Linux und macOS

# Ausführbar machen – heruntergeladene Dateien haben standardmäßig keine Ausführungsberechtigung
chmod +x mistral-7b-instruct.llamafile

# Server und Web-Oberfläche starten (Browser öffnet sich automatisch)
./mistral-7b-instruct.llamafile

# Einmalige CLI-Inferenz ohne Serverstart
./mistral-7b-instruct.llamafile -p "Erkläre llamafile in einem Absatz"

Der Server bindet standardmäßig an 127.0.0.1:8080 . Übergeben Sie --port 9000 , um den Port zu ändern, oder --host 0.0.0.0 --host 0.0.0.0, um auf allen Netzwerkschnittstellen zu lauschen – nützlich, wenn Sie von einer headless-Maschine aus im lokalen Netzwerk bereitstellen. Führen Sie ./model.llamafile --help

Windows

aus, um alle verfügbaren Flags anzuzeigen, darunter Optionen zum Unterdrücken des automatischen Browser-Tabs bei headless-Betrieb. .exe. Benennen Sie die Datei vor dem Ausführen um:

ren mistral-7b-instruct.llamafile mistral-7b-instruct.llamafile.exe

Doppelklicken Sie dann darauf im Explorer oder führen Sie sie über die Eingabeaufforderung aus. Ein Browser-Tab öffnet sich automatisch.

Die 4-GB-Grenze. Der Windows-PE-Loader kann ausführbare Dateien größer als 4 GB nicht verarbeiten. Die meisten 7B-Modelle in Q8- oder höherer Quantisierung sowie sämtliche 13B+-Modelle überschreiten diese Schwelle. Ist die Datei größer als 4 GB, lehnt Windows deren Ausführung ab. Ihre Optionen: Laden Sie eine Q4_K_M stärker quantisierte Variante herunter (typischerweise 4–5 GB für ein 7B-Modell, oft knapp unter der Grenze) oder laden Sie die eigenständige llamafile-Laufzeitbinärdatei herunter und übergeben Sie die GGUF-Datei als separaten Parameter. Bevor Sie ein Modell und dessen Quantisierung wählen, prüfen Sie die VRAM- und Dateigrößenanforderungen gängiger Sprachmodelle , um die für Ihre Hardware geeignete Quantisierung auszuwählen.

Die integrierte Web-Oberfläche

Das Ausführen einer llamafile ohne die Option -p startet einen HTTP-Server und öffnet Ihren Standardbrowser unter http://localhost:8080. Die Oberfläche ist eine vollständig eigenständige Single-Page-Anwendung ohne externe CDN-Abhängigkeiten – sie funktioniert komplett offline. Sie bietet Folgendes:

  • Konfiguration der System-Prompt
  • Sampling-Parameter: Temperatur, Top-p, Top-k, Wiederholungsstrafe
  • Anzeige der Tokenanzahl
  • Dauerhafte Gesprächsverläufe innerhalb der Sitzung

Jedes Gerät im lokalen Netzwerk kann auf die Oberfläche zugreifen, sofern Sie den Server mit --host 0.0.0.0.

Die OpenAI-kompatible API

--host 0.0.0.0 http://localhost:8080/v1gestartet haben. Solange der Server läuft, stellt llamafile eine OpenAI-kompatible REST-API unter

curl http://localhost:8080/v1/chat/completions 
  -H "Content-Type: application/json" 
  -d '{
    "model": "local",
    "messages": [{"role": "user", "content": "Hallo"}]
  }'

In Python setzen Sie base_url="http://localhost:8080/v1" und einen beliebigen nicht-leeren String als API-Schlüssel beim Erstellen des openai.OpenAI -Clients. Modell Das Feld »requests« wird ignoriert – das geladene Modell wird stets verwendet.

Erstellen einer llamafile aus einer bestehenden GGUF-Datei

Falls Sie bereits ein GGUF-Modell besitzen – aus dem llama.cpp-Ökosystem, dem lokalen Cache von Ollama oder einem Download von Hugging Face – können Sie es in eine eigenständige llamafile verpacken. Der Vorgang nutzt das llamafile-zipalign -Hilfsprogramm, das im llamafile-Toolset enthalten ist:

  1. Laden Sie das llamafile-Release-Archiv für Ihre Plattform von der GitHub-Releases-Seite.
  2. herunter.Extrahieren Sie die eigenständige llamafile
  3. Nutzen Sie llamafile-zipalign -Binärdatei (lediglich die Laufzeitumgebung, ohne integriertes Modell).
  4. Markieren Sie das Ergebnis als ausführbar und führen Sie es aus.

Die genaue Syntax der Befehlszeilenoptionen hat sich zwischen den Versionen geändert. Beachten Sie daher bitte den Abschnitt »Creating llamafiles« im offiziellen README für die aktuelle Syntax. Die Ausgabe ist eine einzige portable Datei, die Sie wie jede andere Binärdatei verteilen können.

llamafile im Vergleich zu Ollama: Wann welches Werkzeug einzusetzen ist

Beide Tools führen GGUF-Modelle lokal aus und stellen OpenAI-kompatible APIs bereit. Sie lösen unterschiedliche Probleme. Für einen tieferen Vergleich der beiden Ansätze siehe die Kompletter Ollama-Leitfaden Vergleichstabelle

KriteriumExtrahieren Sie die eigenständigeOllama
InstallationKeine erforderlich – einfach herunterladen und ausführenInstaller oder Paketmanager erforderlich
ModellverwaltungManuell – je Modell eine DateiEingebaute Bibliothek, ollama pull
TragbarkeitEinzelne Datei – USB-Stick, E-Mail, NFS-FreigabeErfordert den Ollama-Daemon auf dem Zielrechner
GPU-BeschleunigungCUDA, Metal, ROCm (automatische Erkennung)CUDA, Metal, ROCm
Mehrmodell-ServerbetriebEin Modell pro ProzessMehrere Modelle mit automatischem Hot-Swap
Große Modelle unter WindowsEingeschränkt: nur ausführbare Dateien < 4 GBVollständige Unterstützung beliebiger Größe
Betrieb in abgeschotteten Netzwerken (Air-gapped)Ausgezeichnet – keine LaufzeitabhängigkeitenErfordert die Installation eines Daemons
Integrierte Web-OberflächeJa, ohne zusätzliche InstallationErfordert eine separate Frontend-Anwendung

Wählen Sie llamafile wenn Sie auf Rechnern ohne Ihre Kontrolle verteilen, in abgeschotteten Umgebungen arbeiten oder ein Modell in ein Projekt einbetten möchten, das ohne systemweite Abhängigkeiten funktionieren muss. Wählen Sie Ollama wenn Sie eine Modellbibliothek verwalten, automatische Updates wünschen oder innerhalb einer Sitzung häufig zwischen verschiedenen Modellen wechseln.

Falls Sie prüfen möchten, ob lokale Inferenz für Ihre Workload wirtschaftlich sinnvoll ist, kann der Selbsthosting- versus-API-Kosten-Grenzwert-Rechner Kostenvergleichsrechner

Hardware-Anforderungen

llamafile fügt gegenüber llama.cpp nur vernachlässigbare Overhead-Kosten hinzu. Der Engpass liegt stets in der Modellgröße und der Quantisierung. llamafile erkennt beim Start verfügbare Beschleuniger – CUDA für NVIDIA-GPUs, Metal für Apple Silicon und ROCm für AMD – und nutzt diese automatisch. Falls keine GPU gefunden wird, erfolgt ein Fallback auf CPU-Inferenz mittels AVX2- oder AVX-512-Befehlen, sofern verfügbar.

Ein Modell mit 7 Milliarden Parametern in Q4_K_M-Quantisierung benötigt etwa 4–5 GB VRAM, um vollständig auf der GPU ausgeführt zu werden. Nutzen Sie den VRAM-Rechner VRAM-Anforderungsrechner bestes GPUs für lokale LLMs Anleitung Hardware-Kaufleitfaden

Häufig gestellte Fragen

Kann ich llamafile auf Apple Silicon ausführen?

Ja. llamafile erzeugt auf Apple Silicon eine native Mach-O-Binärdatei und nutzt automatisch die Metal-GPU-Beschleunigung. Die Leistung ist solide für 7B- und 13B-Modelle; größere Modelle sind durch den verfügbaren Unified Memory begrenzt. Ein M2 Max oder M3 Pro mit 36 GB Unified Memory kann problemlos Modelle der 30B-Klasse ausführen.

Unterstützt llamafile multimodale (Visions-)Modelle?

llamafile basiert auf llama.cpp, das LLaVA-artige Visionsmodelle unterstützt. Ob eine bestimmte llamafile Eingabebilder verarbeiten kann, hängt davon ab, ob das eingebettete Modell tatsächlich multimodal ist. Prüfen Sie dazu die Modellbeschreibung (Model Card) der heruntergeladenen Datei – die Funktionalität liegt in den Gewichten, nicht in der Laufzeitumgebung.

Wie beende ich den Server?

Presse Strg+C im Terminal, in dem llamafile läuft. Falls Sie es unter Windows oder macOS per Doppelklick gestartet haben, schließen Sie das erschienene Terminalfenster oder beenden Sie den Prozess über den Task-Manager bzw. Activity Monitor.

Kann ich llamafile als Hintergrunddienst ausführen?

Ja. Unter Linux können Sie es in eine systemd-Unit-Datei einbinden. Unter macOS erstellen Sie eine launchd-plist-Datei. llamafile akzeptiert Standard-Unix-Signale und funktioniert mit jedem Prozessüberwachungssystem. Führen Sie , um auf allen Netzwerkschnittstellen zu lauschen – nützlich, wenn Sie von einer headless-Maschine aus im lokalen Netzwerk bereitstellen. Führen Sie llamafile --help

Ist llamafile dasselbe wie eine GGUF-Datei?

Nein. Eine GGUF-Datei enthält ausschließlich die Modellgewichte und erfordert eine separate Laufzeitumgebung – etwa llama.cpp oder Ollama, LM Studio, oder Ähnliches, zum Ausführen benötigt. Eine llamafile fasst Gewichte und und Laufzeitumgebung in einer einzigen Datei zusammen. Da die Gewichte im ZIP-Format angehängt sind, können Sie mit jedem gängigen ZIP-Tool das rohe GGUF aus einer beliebigen llamafile extrahieren und an anderer Stelle verwenden.

Wie schneidet llamafile im Vergleich zu LM Studio ab?

LM Studio ist eine GUI-basierte Desktop-Anwendung zur Modellentdeckung und -ausführung – sie erfordert eine Installation und verwaltet eine Bibliothek von Modellen; dadurch ähnelt sie eher Ollama als llamafile. llamafile hingegen ist ein Bereitstellungsformat: ohne grafische Benutzeroberfläche, ohne Modellbibliothek – lediglich eine ausführbare Datei. LM Studio eignet sich für Nutzer, die eine visuelle Oberfläche bevorzugen; llamafile dagegen für automatisierte, headless oder portable Bereitstellungen. Weitere Details finden Sie im LM Studio – umfassende Anleitung für eine umfassende Gegenüberstellung.

Verfasst von Mustafa Ihsan

Mustafa Ihsan ist Gründer und Chefredakteur von Convly.ai. Er entwickelte und pflegt die Live-Datenbank für KI-Modelle der Website, ihren Preis-Leistungs-Index sowie kostenlose Rechner für VRAM-Anforderungen, API-Kosten und Wirtschaftlichkeit des Self-Hostings. Er schreibt über Modellpreise, Benchmark-Ergebnisse und die Hardware, die zum lokalen Betrieb von KI-Modellen erforderlich ist, und bevorzugt stets messbare Zahlen gegenüber Herstellerangaben.

Scroll to Top
Featured on There's An AI For That