Monday, 10 August 2026 | Updating Daily AI insight, written for builders

Jan AI: Open-Source-Desktopanwendung zum lokalen Ausführen von LLMs

  • Jan ist eine kostenlose, quelloffene Desktopanwendung (AGPL-Lizenz), die LLMs vollständig auf Ihrer eigenen Hardware ausführt – ohne Konto, ohne Cloud und ohne dass Daten Ihr Gerät verlassen.
  • Sie enthält eine Chat-Oberfläche, einen Modell-Hub zum Herunterladen von GGUF-Modellen sowie einen lokal betriebenen, mit der OpenAI-API kompatiblen API-Server (Standardport 1337).
  • Herunterladen von jan.ai oder das GitHub-Releases-Seite — unterstützt Windows, macOS (Apple Silicon und Intel) sowie Linux.
  • Ideal für nutzerorientierte Anwender mit Fokus auf Datenschutz, die eine vollständige grafische Benutzeroberfläche wünschen; Entwickler, die einen headless, API-zentrierten Workflow bevorzugen, könnten stattdessen Ollama wählen.

Jan ist eine quelloffene Desktop-Anwendung zum lokalen Ausführen großer Sprachmodelle, entwickelt von Homebrew Research (janhq). Sie bündelt eine Chat-Oberfläche, eine Modell-Hub-Schnittstelle und eine Inferenz-Engine in einer einzigen installierbaren Anwendung. Alles läuft offline: Es ist kein Benutzerkonto erforderlich, keine Daten werden an externe Server gesendet, und nach dem Herunterladen der Modelle ist überhaupt keine Internetverbindung mehr nötig. Der Quellcode befindet sich unter github.com/janhq/jan unter der Lizenz AGPL-3.0.

Hardware-Anforderungen

Jan kann ausschließlich auf der CPU laufen, doch ein GPU beschleunigt die Antwortgeschwindigkeit deutlich. Die entscheidende Engpass-Ressource ist der VRAM – wie viel GPU-Speicher Ihre Grafikkarte besitzt, bestimmt, welche Modelle Sie mit brauchbarer Geschwindigkeit laden können.

KomponenteMindestanforderungEmpfohlen
System-Arbeitsspeicher (RAM)8 GB16 GB oder mehr
GPU-VRAMKeine erforderlich8 GB oder mehr für 7B-Modelle
Speicher10 GB freier Speicherplatz50 GB oder mehr (Modelle sind große Dateien)
BetriebssystemWindows 10, macOS 12, Ubuntu 20.04Aktuelle stabile Versionen

Ein 7B-Parameter-Modell in 4-Bit-Quantisierung (Q4_K_M) benötigt etwa 4–5 GB VRAM; ein 13B-Modell benötigt rund 8–9 GB. Nutzen Sie den Convly-VRAM-Rechner zur Abschätzung des Speicherbedarfs Ihres konkreten Modells und der gewählten Quantisierung vor dem Download. Falls Sie neue Hardware erwerben möchten, bietet der beste GPUs für lokale LLMs Anleitung einen Überblick über aktuelle Optionen in verschiedenen Preisklassen.

Auf Apple-Silicon-Macs aktiviert Jan Metal-Beschleunigung automatisch. Unter Windows und Linux mit einer NVIDIA-Grafikkarte wird CUDA genutzt. AMD-GPU-Unterstützung ist unter Linux über Vulkan verfügbar.

Jan installieren

Laden Sie das Installationsprogramm von jan.ai oder das GitHub-Releases-Seiteherunter. Jan enthält bereits seine eigene llama.cpp-Inferenz-Engine – es sind keine zusätzlichen Abhängigkeiten erforderlich.

Windows

Führen Sie aus .exe Installationsprogramm. Jan wird standardmäßig nach %LOCALAPPDATA%\Programs\Jan installiert. Administratorrechte sind nicht erforderlich.

macOS

Laden Sie das .dmgherunter. Für Macs gibt es separate Versionen für Apple Silicon und Intel – wählen Sie die passende Variante für Ihren Mac aus. Ziehen Sie Jan in den /ApplicationsOrdner. Öffnen Beim ersten Start klicken Sie mit der rechten Maustaste auf das Symbol und wählen

Linux

Jan stellt eine .AppImage-, eine .deb- und eine .rpm -Datei auf der Releases-Seite bereit.

# AppImage
chmod +x jan-linux-x86_64-*.AppImage
./jan-linux-x86_64-*.AppImage

# Debian/Ubuntu
sudo dpkg -i jan-linux-amd64-*.deb

Ihr erstes Modell herunterladen

Wenn Jan gestartet wird, zeigt die Registerkarte Hub einen kuratierten Browser für GGUF-Modelle von Hugging Face: Llama, Mistral, Qwen, Gemma, Phi und weitere – jeweils in unterschiedlichen Quantisierungen.

  1. Klicken Hub in der linken Seitenleiste.
  2. Suchen Sie nach einem Modell – „Llama 3.2“ ist für die meisten Systeme ein guter Einstiegspunkt.
  3. Wählen Sie eine Quantisierung. Q4_K_M ist die Standardempfehlung: kleiner als Q6/Q8 bei akzeptablem Qualitätsverlust.
  4. Klicken Herunterladen und warten Sie, bis der Dateitransfer abgeschlossen ist.

Jan speichert heruntergeladene Modelle standardmäßig unter ~/jan/models/ auf macOS und Linux sowie unter C:\Users\\jan\models unter Windows. Jedes Modell befindet sich in einem eigenen benannten Unterordner, der die .gguf -Datei und eine model.json -Metadatendatei enthält. Sie können auch beliebige Modelle von Drittanbietern .gguf Datei in einen neuen Ordner dort ab — Jan erkennt sie beim nächsten Start. GGUF-Dateien von LM Studio sind direkt kompatibel.

Der lokale API-Server

Jan enthält einen OpenAI-kompatiblen REST-API-Server, sodass jedes Tool, das die OpenAI-Client-Bibliothek unterstützt – das Python- openai -SDK, LangChain, Continue.dev und andere – Jan als lokales Backend nutzen kann.

Um ihn zu starten: Öffnen Sie Einstellungen → Lokaler API-Server, und aktivieren Sie den Server mit dem Schalter. Er lauscht standardmäßig auf Port 1337 ; dieser Wert ist im selben Bereich konfigurierbar.

from openai import OpenAI

client = OpenAI(
    base_url="http://localhost:1337/v1",
    api_key="jan"  # beliebiger nicht-leerer String
)

response = client.chat.completions.create(
    model="llama3.2-3b-instruct",  # entspricht dem Ordnernamen unter ~/jan/models/
    messages=[{"role": "user", "content": "Hallo"}]
)
print(response.choices[0].message.content)

Der Modellname in API-Aufrufen muss genau mit dem intern von Jan verwendeten Ordnernamen übereinstimmen – sichtbar im Hub oder in der Modellauswahl im Chat-Fenster.

Jan im Vergleich zu LM Studio und Ollama

Alle drei Tools führen GGUF-Modelle lokal aus. Die Unterschiede liegen in Philosophie und Arbeitsablauf.

JanLM StudioOllama
BenutzeroberflächeVollständige GUI, chat-zentriertVollständige GUI, chat-zentriertNur CLI (Drittanbieter-GUIs verfügbar)
LizenzAGPL-3.0 (Open Source)Proprietäre FreewareMIT (Open Source)
Lokale APIJa, OpenAI-kompatibel (Port 1337)Ja, OpenAI-kompatibel (Port 1234)Ja, eigene API sowie OpenAI-kompatibler Endpunkt
ModellverwaltungIntegrierter Hub (Hugging Face)Integrierte Suche (Hugging Face)CLI-Download aus dem Ollama-Registry
ModellformatGGUFGGUFOllama-Format (umhüllt GGUF intern)
Headless-/Server-NutzungBegrenztBegrenztAusgezeichnet – speziell dafür konzipiert
System-Prompt / PersonaJa, pro AssistentJa, pro Modell-VoreinstellungÜber Modelfile
PlattformWindows, macOS, LinuxWindows, macOS, LinuxWindows, macOS, Linux

Wählen Sie Jan , wenn Sie ein vollständig quelloffenes GUI-Tool wünschen und Wert auf die AGPL-Garantie legen, dass niemand ein geschlossenes Produkt auf Basis des von Ihnen genutzten Codes entwickelt. Jan’s Chat-Oberfläche ist übersichtlich, und das Erweiterungssystem ermöglicht es Ihnen, Funktionen hinzuzufügen, ohne Konfigurationsdateien bearbeiten zu müssen.

Wählen Sie LM Studio , wenn Design und Benutzerfreundlichkeit wichtiger sind als Open-Source-Lizenzierung. LM Studio bietet eine anspruchsvollere Benutzeroberfläche und etwas umfassendere Dokumentation zur Hardwarekompatibilität. Siehe die LM Studio – umfassende Anleitung für eine Schritt-für-Schritt-Anleitung.

Wählen Sie Ollama , wenn Sie Entwickler sind und ein schnelles, skriptfähiges Backend ohne GUI-Overhead benötigen. Ollama lässt sich einfacher in CI-Pipelines, Shell-Skripte oder Docker-Container integrieren. Der Ollama – umfassende Anleitung beschreibt diesen Weg detailliert.

Wenn Sie die Betriebskosten einer lokalen Inferenz mit denen einer Cloud-API vergleichen, hilft die Self-Hosting- vs. API-Kalkulator zur Break-even-Berechnung dabei, den Kompromiss anhand Ihres tatsächlichen Nutzungsvolumens und Ihrer Hardwarekosten quantitativ abzuschätzen.

Datenschutz und Offline-Nutzung

Jans zentrale Datenschutzgarantie ist architektonisch bedingt: Die Inferenz erfolgt innerhalb von llama.cpp auf Ihrem lokalen Rechner. Während der Inferenz werden keinerlei Telemetriedaten übertragen, keine Modellanfragen auf einem entfernten Server protokolliert und kein Benutzerkonto benötigt. Sobald eine Modell-Datei heruntergeladen ist, können Sie Jan unbegrenzt auch ohne Netzwerkverbindung betreiben.

Dies macht Jan besonders geeignet für die Arbeit mit Dokumenten, die Ihren Rechner nicht verlassen dürfen – etwa juristische, medizinische oder geschäftlich sensible Texte – und zwar auf eine Weise, die Cloud-API-Tools unabhängig von ihren Datenschutzrichtlinien nicht erreichen können.

Jan prüft zwar automatisch auf App-Aktualisierungen und lädt bei verfügbarer Internetverbindung die Hub-Modellliste vom Netz herunter. Beides lässt sich deaktivieren: Gehen Sie dazu zu Einstellungen → Erweitert , um die Aktualisierungsprüfung abzuschalten; der Hub zeigt einfach keine neuen Modelle an, wenn keine Verbindung besteht, ohne dabei den Rest der Anwendung zu beeinträchtigen.

Häufig gestellte Fragen

Ist Jan AI völlig kostenlos?

Ja. Jan ist kostenlos zum Herunterladen und Nutzen – ohne Abonnement, ohne Nutzungseinschränkungen und ohne kostenpflichtige Funktionen. Der Quellcode ist unter der AGPL-3.0-Lizenz auf GitHub veröffentlicht. Die einzigen Kosten entstehen durch Ihre eigene Hardware und den Stromverbrauch.

Welche Modelle kann Jan ausführen?

Jan führt alle Modelle im GGUF-Format aus. Dazu gehören die meisten gängigen Open-Weight-Modelle: die Llama-Familie, Mistral, Mixtral, Qwen, Gemma, Phi, DeepSeekund viele weitere. Der integrierte Hub stellt eine kuratierte Auswahl bereit; Sie können jedoch jede beliebige GGUF-Datei manuell hinzufügen, indem Sie sie in das Modelle-Verzeichnis kopieren.

Wie viel VRAM benötige ich?

Das hängt von der Modellgröße und der Quantisierung ab. Ein 7B-Modell im Q4_K_M-Format benötigt etwa 4–5 GB VRAM; ein 13B-Modell benötigt 8–9 GB. Die Inferenz allein auf der CPU funktioniert zwar, ist aber langsam – erwarten Sie ca. 2–5 Tokens pro Sekunde auf einer modernen CPU gegenüber 30–80+ Tokens pro Sekunde auf einer mittelklasse GPU. Die VRAM-Anforderungsleitfaden listet konkrete Werte für wichtige Modelle auf.

Kann ich Jan mit VS Code oder anderen Programmier-Tools verwenden?

Ja. Aktivieren Sie Jans lokalen API-Server und richten Sie jedes OpenAI-kompatible Tool auf http://localhost:1337/v1aus. Continue.dev, Aider und ähnliche Programmier-Assistenten unterstützen benutzerdefinierte Basis-URLs. Geben Sie als Modellnamen den Ordnernamen an, den Jan für Ihr heruntergeladenes Modell verwendet.

Was unterscheidet Jan von Ollama?

Jan ist eine Desktop-GUI-Anwendung – Sie interagieren über eine Chat-Oberfläche und verwalten Modelle über einen visuellen Hub. Ollama ist ein CLI-Tool und ein Hintergrunddienst, der für Entwickler konzipiert ist, die Modelle aus Skripten heraus aufrufen oder in Anwendungen integrieren möchten. Beide stellen eine OpenAI-kompatible API bereit. Jan eignet sich für nicht-technische Nutzer und GUI-zentrierte Arbeitsabläufe; Ollama für Automatisierung und Server-Deployments.

Unterstützt Jan multimodale Modelle (Bilder)?

Jan hat in jüngsten Versionen experimentelle Unterstützung für Vision-Modelle hinzugefügt, wobei die Verfügbarkeit von der installierten Version abhängt. Prüfen Sie den Hub nach Modellen mit der Kennzeichnung „Vision“ oder „multimodal“. Die Unterstützung und die verfügbaren Modelle variieren je nach Release – konsultieren Sie daher die GitHub-Release-Hinweise zu Ihrer installierten Version, anstatt vorauszusetzen, dass ein bestimmtes Modell funktioniert.

Verfasst von Mustafa Ihsan

Mustafa Ihsan ist Gründer und Chefredakteur von Convly.ai. Er hat die Live-Datenbank für KI-Modelle der Website, ihren Preis-Leistungs-Index sowie kostenlose Rechner für VRAM-Anforderungen, API-Kosten und Wirtschaftlichkeit des Self-Hosting aufgebaut und pflegt sie. Er schreibt über Modellpreise, Benchmark-Ergebnisse und die Hardware, die zum lokalen Betrieb von KI-Modellen erforderlich ist, und bevorzugt stets messbare Zahlen gegenüber Herstellerangaben.

Scroll to Top
Featured on There's An AI For That