- Jan ist eine kostenlose, quelloffene Desktopanwendung (AGPL-Lizenz), die LLMs vollständig auf Ihrer eigenen Hardware ausführt – ohne Konto, ohne Cloud und ohne dass Daten Ihr Gerät verlassen.
- Sie enthält eine Chat-Oberfläche, einen Modell-Hub zum Herunterladen von GGUF-Modellen sowie einen lokal betriebenen, mit der OpenAI-API kompatiblen API-Server (Standardport 1337).
- Herunterladen von jan.ai oder das GitHub-Releases-Seite — unterstützt Windows, macOS (Apple Silicon und Intel) sowie Linux.
- Ideal für nutzerorientierte Anwender mit Fokus auf Datenschutz, die eine vollständige grafische Benutzeroberfläche wünschen; Entwickler, die einen headless, API-zentrierten Workflow bevorzugen, könnten stattdessen Ollama wählen.
Jan ist eine quelloffene Desktop-Anwendung zum lokalen Ausführen großer Sprachmodelle, entwickelt von Homebrew Research (janhq). Sie bündelt eine Chat-Oberfläche, eine Modell-Hub-Schnittstelle und eine Inferenz-Engine in einer einzigen installierbaren Anwendung. Alles läuft offline: Es ist kein Benutzerkonto erforderlich, keine Daten werden an externe Server gesendet, und nach dem Herunterladen der Modelle ist überhaupt keine Internetverbindung mehr nötig. Der Quellcode befindet sich unter github.com/janhq/jan unter der Lizenz AGPL-3.0.
Hardware-Anforderungen
Jan kann ausschließlich auf der CPU laufen, doch ein GPU beschleunigt die Antwortgeschwindigkeit deutlich. Die entscheidende Engpass-Ressource ist der VRAM – wie viel GPU-Speicher Ihre Grafikkarte besitzt, bestimmt, welche Modelle Sie mit brauchbarer Geschwindigkeit laden können.
| Komponente | Mindestanforderung | Empfohlen |
|---|---|---|
| System-Arbeitsspeicher (RAM) | 8 GB | 16 GB oder mehr |
| GPU-VRAM | Keine erforderlich | 8 GB oder mehr für 7B-Modelle |
| Speicher | 10 GB freier Speicherplatz | 50 GB oder mehr (Modelle sind große Dateien) |
| Betriebssystem | Windows 10, macOS 12, Ubuntu 20.04 | Aktuelle stabile Versionen |
Ein 7B-Parameter-Modell in 4-Bit-Quantisierung (Q4_K_M) benötigt etwa 4–5 GB VRAM; ein 13B-Modell benötigt rund 8–9 GB. Nutzen Sie den Convly-VRAM-Rechner zur Abschätzung des Speicherbedarfs Ihres konkreten Modells und der gewählten Quantisierung vor dem Download. Falls Sie neue Hardware erwerben möchten, bietet der beste GPUs für lokale LLMs Anleitung einen Überblick über aktuelle Optionen in verschiedenen Preisklassen.
Auf Apple-Silicon-Macs aktiviert Jan Metal-Beschleunigung automatisch. Unter Windows und Linux mit einer NVIDIA-Grafikkarte wird CUDA genutzt. AMD-GPU-Unterstützung ist unter Linux über Vulkan verfügbar.
Jan installieren
Laden Sie das Installationsprogramm von jan.ai oder das GitHub-Releases-Seiteherunter. Jan enthält bereits seine eigene llama.cpp-Inferenz-Engine – es sind keine zusätzlichen Abhängigkeiten erforderlich.
Windows
Führen Sie aus .exe Installationsprogramm. Jan wird standardmäßig nach %LOCALAPPDATA%\Programs\Jan installiert. Administratorrechte sind nicht erforderlich.
macOS
Laden Sie das .dmgherunter. Für Macs gibt es separate Versionen für Apple Silicon und Intel – wählen Sie die passende Variante für Ihren Mac aus. Ziehen Sie Jan in den /ApplicationsOrdner. Öffnen Beim ersten Start klicken Sie mit der rechten Maustaste auf das Symbol und wählen
Linux
Jan stellt eine .AppImage-, eine .deb- und eine .rpm -Datei auf der Releases-Seite bereit.
# AppImage
chmod +x jan-linux-x86_64-*.AppImage
./jan-linux-x86_64-*.AppImage
# Debian/Ubuntu
sudo dpkg -i jan-linux-amd64-*.debIhr erstes Modell herunterladen
Wenn Jan gestartet wird, zeigt die Registerkarte Hub einen kuratierten Browser für GGUF-Modelle von Hugging Face: Llama, Mistral, Qwen, Gemma, Phi und weitere – jeweils in unterschiedlichen Quantisierungen.
- Klicken Hub in der linken Seitenleiste.
- Suchen Sie nach einem Modell – „Llama 3.2“ ist für die meisten Systeme ein guter Einstiegspunkt.
- Wählen Sie eine Quantisierung. Q4_K_M ist die Standardempfehlung: kleiner als Q6/Q8 bei akzeptablem Qualitätsverlust.
- Klicken Herunterladen und warten Sie, bis der Dateitransfer abgeschlossen ist.
Jan speichert heruntergeladene Modelle standardmäßig unter ~/jan/models/ auf macOS und Linux sowie unter C:\Users\\jan\models unter Windows. Jedes Modell befindet sich in einem eigenen benannten Unterordner, der die .gguf -Datei und eine model.json -Metadatendatei enthält. Sie können auch beliebige Modelle von Drittanbietern .gguf Datei in einen neuen Ordner dort ab — Jan erkennt sie beim nächsten Start. GGUF-Dateien von LM Studio sind direkt kompatibel.
Der lokale API-Server
Jan enthält einen OpenAI-kompatiblen REST-API-Server, sodass jedes Tool, das die OpenAI-Client-Bibliothek unterstützt – das Python- openai -SDK, LangChain, Continue.dev und andere – Jan als lokales Backend nutzen kann.
Um ihn zu starten: Öffnen Sie Einstellungen → Lokaler API-Server, und aktivieren Sie den Server mit dem Schalter. Er lauscht standardmäßig auf Port 1337 ; dieser Wert ist im selben Bereich konfigurierbar.
from openai import OpenAI
client = OpenAI(
base_url="http://localhost:1337/v1",
api_key="jan" # beliebiger nicht-leerer String
)
response = client.chat.completions.create(
model="llama3.2-3b-instruct", # entspricht dem Ordnernamen unter ~/jan/models/
messages=[{"role": "user", "content": "Hallo"}]
)
print(response.choices[0].message.content)Der Modellname in API-Aufrufen muss genau mit dem intern von Jan verwendeten Ordnernamen übereinstimmen – sichtbar im Hub oder in der Modellauswahl im Chat-Fenster.
Jan im Vergleich zu LM Studio und Ollama
Alle drei Tools führen GGUF-Modelle lokal aus. Die Unterschiede liegen in Philosophie und Arbeitsablauf.
| Jan | LM Studio | Ollama | |
|---|---|---|---|
| Benutzeroberfläche | Vollständige GUI, chat-zentriert | Vollständige GUI, chat-zentriert | Nur CLI (Drittanbieter-GUIs verfügbar) |
| Lizenz | AGPL-3.0 (Open Source) | Proprietäre Freeware | MIT (Open Source) |
| Lokale API | Ja, OpenAI-kompatibel (Port 1337) | Ja, OpenAI-kompatibel (Port 1234) | Ja, eigene API sowie OpenAI-kompatibler Endpunkt |
| Modellverwaltung | Integrierter Hub (Hugging Face) | Integrierte Suche (Hugging Face) | CLI-Download aus dem Ollama-Registry |
| Modellformat | GGUF | GGUF | Ollama-Format (umhüllt GGUF intern) |
| Headless-/Server-Nutzung | Begrenzt | Begrenzt | Ausgezeichnet – speziell dafür konzipiert |
| System-Prompt / Persona | Ja, pro Assistent | Ja, pro Modell-Voreinstellung | Über Modelfile |
| Plattform | Windows, macOS, Linux | Windows, macOS, Linux | Windows, macOS, Linux |
Wählen Sie Jan , wenn Sie ein vollständig quelloffenes GUI-Tool wünschen und Wert auf die AGPL-Garantie legen, dass niemand ein geschlossenes Produkt auf Basis des von Ihnen genutzten Codes entwickelt. Jan’s Chat-Oberfläche ist übersichtlich, und das Erweiterungssystem ermöglicht es Ihnen, Funktionen hinzuzufügen, ohne Konfigurationsdateien bearbeiten zu müssen.
Wählen Sie LM Studio , wenn Design und Benutzerfreundlichkeit wichtiger sind als Open-Source-Lizenzierung. LM Studio bietet eine anspruchsvollere Benutzeroberfläche und etwas umfassendere Dokumentation zur Hardwarekompatibilität. Siehe die LM Studio – umfassende Anleitung für eine Schritt-für-Schritt-Anleitung.
Wählen Sie Ollama , wenn Sie Entwickler sind und ein schnelles, skriptfähiges Backend ohne GUI-Overhead benötigen. Ollama lässt sich einfacher in CI-Pipelines, Shell-Skripte oder Docker-Container integrieren. Der Ollama – umfassende Anleitung beschreibt diesen Weg detailliert.
Wenn Sie die Betriebskosten einer lokalen Inferenz mit denen einer Cloud-API vergleichen, hilft die Self-Hosting- vs. API-Kalkulator zur Break-even-Berechnung dabei, den Kompromiss anhand Ihres tatsächlichen Nutzungsvolumens und Ihrer Hardwarekosten quantitativ abzuschätzen.
Datenschutz und Offline-Nutzung
Jans zentrale Datenschutzgarantie ist architektonisch bedingt: Die Inferenz erfolgt innerhalb von llama.cpp auf Ihrem lokalen Rechner. Während der Inferenz werden keinerlei Telemetriedaten übertragen, keine Modellanfragen auf einem entfernten Server protokolliert und kein Benutzerkonto benötigt. Sobald eine Modell-Datei heruntergeladen ist, können Sie Jan unbegrenzt auch ohne Netzwerkverbindung betreiben.
Dies macht Jan besonders geeignet für die Arbeit mit Dokumenten, die Ihren Rechner nicht verlassen dürfen – etwa juristische, medizinische oder geschäftlich sensible Texte – und zwar auf eine Weise, die Cloud-API-Tools unabhängig von ihren Datenschutzrichtlinien nicht erreichen können.
Jan prüft zwar automatisch auf App-Aktualisierungen und lädt bei verfügbarer Internetverbindung die Hub-Modellliste vom Netz herunter. Beides lässt sich deaktivieren: Gehen Sie dazu zu Einstellungen → Erweitert , um die Aktualisierungsprüfung abzuschalten; der Hub zeigt einfach keine neuen Modelle an, wenn keine Verbindung besteht, ohne dabei den Rest der Anwendung zu beeinträchtigen.
Häufig gestellte Fragen
Ist Jan AI völlig kostenlos?
Ja. Jan ist kostenlos zum Herunterladen und Nutzen – ohne Abonnement, ohne Nutzungseinschränkungen und ohne kostenpflichtige Funktionen. Der Quellcode ist unter der AGPL-3.0-Lizenz auf GitHub veröffentlicht. Die einzigen Kosten entstehen durch Ihre eigene Hardware und den Stromverbrauch.
Welche Modelle kann Jan ausführen?
Jan führt alle Modelle im GGUF-Format aus. Dazu gehören die meisten gängigen Open-Weight-Modelle: die Llama-Familie, Mistral, Mixtral, Qwen, Gemma, Phi, DeepSeekund viele weitere. Der integrierte Hub stellt eine kuratierte Auswahl bereit; Sie können jedoch jede beliebige GGUF-Datei manuell hinzufügen, indem Sie sie in das Modelle-Verzeichnis kopieren.
Wie viel VRAM benötige ich?
Das hängt von der Modellgröße und der Quantisierung ab. Ein 7B-Modell im Q4_K_M-Format benötigt etwa 4–5 GB VRAM; ein 13B-Modell benötigt 8–9 GB. Die Inferenz allein auf der CPU funktioniert zwar, ist aber langsam – erwarten Sie ca. 2–5 Tokens pro Sekunde auf einer modernen CPU gegenüber 30–80+ Tokens pro Sekunde auf einer mittelklasse GPU. Die VRAM-Anforderungsleitfaden listet konkrete Werte für wichtige Modelle auf.
Kann ich Jan mit VS Code oder anderen Programmier-Tools verwenden?
Ja. Aktivieren Sie Jans lokalen API-Server und richten Sie jedes OpenAI-kompatible Tool auf http://localhost:1337/v1aus. Continue.dev, Aider und ähnliche Programmier-Assistenten unterstützen benutzerdefinierte Basis-URLs. Geben Sie als Modellnamen den Ordnernamen an, den Jan für Ihr heruntergeladenes Modell verwendet.
Was unterscheidet Jan von Ollama?
Jan ist eine Desktop-GUI-Anwendung – Sie interagieren über eine Chat-Oberfläche und verwalten Modelle über einen visuellen Hub. Ollama ist ein CLI-Tool und ein Hintergrunddienst, der für Entwickler konzipiert ist, die Modelle aus Skripten heraus aufrufen oder in Anwendungen integrieren möchten. Beide stellen eine OpenAI-kompatible API bereit. Jan eignet sich für nicht-technische Nutzer und GUI-zentrierte Arbeitsabläufe; Ollama für Automatisierung und Server-Deployments.
Unterstützt Jan multimodale Modelle (Bilder)?
Jan hat in jüngsten Versionen experimentelle Unterstützung für Vision-Modelle hinzugefügt, wobei die Verfügbarkeit von der installierten Version abhängt. Prüfen Sie den Hub nach Modellen mit der Kennzeichnung „Vision“ oder „multimodal“. Die Unterstützung und die verfügbaren Modelle variieren je nach Release – konsultieren Sie daher die GitHub-Release-Hinweise zu Ihrer installierten Version, anstatt vorauszusetzen, dass ein bestimmtes Modell funktioniert.

