- Jan est une application de bureau gratuite et open source (sous licence AGPL) qui exécute entièrement les grands modèles linguistiques sur votre propre matériel — sans compte, sans nuage, sans que vos données ne quittent votre machine.
- Elle intègre une interface de discussion, un centre de modèles pour télécharger des modèles GGUF, ainsi qu’un serveur d’API local compatible OpenAI (port par défaut : 1337).
- Téléchargez depuis jan.ai ou le la page des versions GitHub — versions compatibles avec Windows, macOS (puces Apple Silicon et Intel) et Linux.
- Idéal pour les utilisateurs soucieux de leur vie privée qui souhaitent une interface graphique complète ; les développeurs privilégiant un flux de travail API-first sans interface graphique peuvent préférer Ollama.
Jan est une application open source pour ordinateur de bureau permettant d’exécuter localement des grands modèles linguistiques, développée par Homebrew Research (janhq). Elle intègre une interface de discussion, un référentiel de modèles et un moteur d’inférence dans une seule application installable. Tout fonctionne hors ligne : aucun compte n’est requis, aucune donnée n’est envoyée à des serveurs externes, et une fois vos modèles téléchargés, aucune connexion Internet n’est nécessaire. Le code source est disponible sur github.com/janhq/jan sous licence AGPL-3.0.
Exigences matérielles
Jan peut fonctionner uniquement sur processeur (CPU), mais l’utilisation d’un GPU améliore sensiblement la rapidité des réponses. La ressource limitante est la mémoire vidéo (VRAM) : la quantité de mémoire GPU dont dispose votre carte détermine quels modèles vous pouvez charger à des vitesses exploitables.
| Composant | Minimum | Recommandé |
|---|---|---|
| Mémoire vive système | 8 Go | 16 Go ou plus |
| VRAM GPU | Aucune exigence | 8 Go ou plus pour les modèles de 7 milliards de paramètres (7B) |
| Stockage | 10 Go libres | 50 Go ou plus (les modèles sont des fichiers volumineux) |
| Système d'exploitation | Windows 10, macOS 12, Ubuntu 20.04 | Dernières versions stables |
Un modèle de 7 milliards de paramètres (7B) en quantification 4 bits (Q4_K_M) nécessite environ 4 à 5 Go de VRAM ; un modèle de 13 milliards de paramètres (13B) requiert environ 8 à 9 Go. Utilisez le calculateur de VRAM Convly pour estimer les besoins en mémoire de votre modèle spécifique et de sa quantification avant téléchargement. Si vous choisissez du matériel, le meilleur Cartes graphiques pour les grands modèles linguistiques locaux guide récapitule les options actuelles disponibles selon les tranches de prix.
Sur les Mac équipés de puces Apple Silicon, Jan active automatiquement l’accélération Metal. Sur Windows et Linux avec une carte NVIDIA, il utilise CUDA. Le support des GPU AMD est assuré via Vulkan sous Linux.
Installation de Jan
Téléchargez l’installateur depuis jan.ai ou le la page des versions GitHub. Jan intègre son propre moteur d’inférence llama.cpp — aucune dépendance externe n’est requise.
Windows
Exécutez le .exe l’installateur. Jan s’installe par défaut dans le dossier %LOCALAPPDATA%\Programs\Jan . Aucun droit d’administrateur n’est nécessaire.
macOS
Téléchargez l’ .dmg. Séparément, des versions sont disponibles pour les Mac dotés de puces Apple Silicon et pour ceux équipés de processeurs Intel — veuillez choisir celle correspondant à votre Mac. Glissez-déposez l’application Jan dans le dossier /Applications. Lors du premier lancement, cliquez avec le bouton droit sur l’icône et sélectionnez Ouvrir pour contourner l’avertissement de Gatekeeper.
Linux
Jan fournit un fichier .AppImage, un paquet .debet un paquet .rpm sur la page des versions publiées.
# AppImage
chmod +x jan-linux-x86_64-*.AppImage
./jan-linux-x86_64-*.AppImage
# Debian/Ubuntu
sudo dpkg -i jan-linux-amd64-*.debTéléchargement de votre premier modèle
Lorsque Jan s’ouvre, l’onglet Référentiel affiche un navigateur soigneusement sélectionné de modèles GGUF provenant de Hugging Face : Llama, Mistral, Qwen, Gemma, Phi, et d’autres, disponibles dans plusieurs niveaux de quantification.
- Cliquez Référentiel dans la barre latérale gauche.
- Recherchez un modèle — « Llama 3.2 » constitue un bon point de départ pour la plupart des configurations matérielles.
- Sélectionnez un niveau de quantification. Q4_K_M est la recommandation par défaut : plus léger que Q6/Q8 tout en conservant une qualité acceptable.
- Cliquez Télécharger et attendez la fin du transfert du fichier.
Jan stocke les modèles téléchargés dans le dossier ~/jan/models/ sous macOS et Linux, et dans le dossier C:\Users\\jan\models sous Windows. Chaque modèle est placé dans un sous-dossier nommé contenant le fichier .gguf et un fichier de métadonnées model.json . Vous pouvez également déposer manuellement tout modèle tiers .gguf dans un nouveau dossier à cet endroit — Jan le détecte au lancement suivant. Les fichiers GGUF provenant de LM Studio sont directement compatibles.
Le serveur d’API local
Jan intègre un serveur d’API REST compatible OpenAI, permettant à tout outil prenant en charge la bibliothèque cliente OpenAI — notamment le SDK Python openai , LangChain, Continue.dev et d’autres — d’utiliser Jan comme backend local.
Pour le démarrer : ouvrez Paramètres → Serveur d’API local, puis activez le serveur. Celui-ci écoute par défaut sur le port 1337 ; ce paramètre est personnalisable depuis le même panneau.
from openai import OpenAI
client = OpenAI(
base_url="http://localhost:1337/v1",
api_key="jan" # n'importe quelle chaîne non vide
)
response = client.chat.completions.create(
model="llama3.2-3b-instruct", # correspond au nom du dossier sous ~/jan/models/
messages=[{"role": "user", "content": "Bonjour"}]
)
print(response.choices[0].message.content)Le nom du modèle utilisé dans les appels API doit correspondre exactement au nom du dossier que Jan utilise en interne — visible dans le Hub ou dans la liste déroulante des modèles de la vue Discussion.
Comparaison entre Jan, LM Studio et Ollama
Les trois outils exécutent localement des modèles GGUF. Leurs différences résident dans leur philosophie et leur flux de travail.
| Jan | LM Studio | Ollama | |
|---|---|---|---|
| Interface | Interface graphique complète, centrée sur la discussion | Interface graphique complète, centrée sur la discussion | Interface en ligne de commande uniquement (interfaces graphiques tierces disponibles) |
| Licence | AGPL-3.0 (open source) | Freeware propriétaire | MIT (open source) |
| API locale | Oui, compatible avec OpenAI (port 1337) | Oui, compatible avec OpenAI (port 1234) | Oui, API propre + point de terminaison compatible OpenAI |
| Gestion des modèles | Hub intégré (Hugging Face) | Moteur de recherche intégré (Hugging Face) | Téléchargement en ligne de commande depuis le registre Ollama |
| Format du modèle | GGUF | GGUF | Format Ollama (enveloppe GGUF en interne) |
| Utilisation sans interface graphique / en mode serveur | Limité | Limité | Excellente — conçue à cet effet |
| Invite système / personnalité | Oui, définissable par assistant | Oui, préréglage spécifique par modèle | Via Modelfile |
| Plateforme | Windows, macOS, Linux | Windows, macOS, Linux | Windows, macOS, Linux |
Choisissez Jan si vous souhaitez un outil graphique entièrement open source et accordez de l’importance à la garantie offerte par la licence AGPL selon laquelle personne ne peut construire un produit fermé à partir du code que vous utilisez. L’interface de discussion de Jan est épurée, et son système d’extensions vous permet d’ajouter des fonctionnalités sans modifier les fichiers de configuration.
Choisissez LM Studio si la qualité d’exécution prime sur la licence open source. LM Studio propose une interface utilisateur plus raffinée et une documentation légèrement plus complète concernant la compatibilité matérielle. Consultez le Guide complet de LM Studio pour un tutoriel détaillé.
Choisissez Ollama si vous êtes développeur et souhaitez un backend rapide et scriptable, sans surcharge liée à une interface graphique. Ollama s’intègre plus facilement aux pipelines CI, aux scripts shell ou aux conteneurs Docker. Le Guide complet d’Ollama détaille précisément cette approche.
Si vous comparez les coûts d’inférence locale à ceux d’une API cloud, le Calculateur d’auto-hébergement vs seuil de rentabilité d’API permet de chiffrer ce compromis en fonction de votre volume réel d’utilisation et de vos coûts matériels.
Confidentialité et utilisation hors ligne
La garantie fondamentale de Jan en matière de confidentialité est architecturale : l’inférence s’effectue localement, au sein de llama.cpp, sur votre machine. Aucune télémétrie n’est envoyée pendant l’inférence, aucune requête de modèle n’est enregistrée sur un serveur distant, et aucun compte n’est requis. Une fois qu’un fichier modèle est téléchargé, vous pouvez utiliser Jan indéfiniment hors ligne.
Cela rend Jan adapté au traitement de documents qui ne doivent pas quitter votre machine — textes juridiques, médicaux ou commercialement sensibles — de façon que les outils basés sur une API cloud ne sauraient égaler, quelles que soient leurs politiques de confidentialité.
Jan vérifie toutefois la disponibilité de mises à jour de l’application et récupère la liste des modèles du Hub depuis Internet lorsqu’une connexion est disponible. Ces deux fonctionnalités peuvent être désactivées : rendez-vous dans Paramètres → Avancé pour désactiver les vérifications de mises à jour ; quant au Hub, il affiche simplement aucune nouvelle version lorsqu’il est hors ligne, sans perturber le reste de l’application.
Questions fréquemment posées
Jan AI est-il entièrement gratuit ?
Oui. Jan est gratuit à télécharger et à utiliser, sans abonnement, sans limitation d’utilisation ni fonctionnalité verrouillée derrière un paywall. Son code source est publié sous licence AGPL-3.0 sur GitHub. Le seul coût à supporter est celui de votre propre matériel et de votre consommation électrique.
Quels modèles Jan peut-il exécuter ?
Jan exécute tous les modèles au format GGUF. Cela inclut la plupart des modèles open-weight populaires : la famille Llama, Mistral, Mixtral, Qwen, Gemma, Phi, DeepSeeket bien d’autres encore. Le Hub intégré met en avant une sélection restreinte et soigneusement choisie ; vous pouvez ajouter manuellement n’importe quel fichier GGUF en le plaçant dans le répertoire des modèles.
De combien de VRAM ai-je besoin ?
Cela dépend de la taille du modèle et de sa quantification. Un modèle de 7 milliards de paramètres (7B) en quantification Q4_K_M nécessite environ 4 à 5 Go de VRAM ; un modèle de 13 milliards de paramètres (13B) en nécessite 8 à 9 Go. L’inférence CPU seule est possible, mais lente : comptez 2 à 5 jetons par seconde sur un processeur moderne, contre 30 à 80+ sur un GPU milieu de gamme. Le Guide des exigences en VRAM fournit des chiffres détaillés pour les principaux modèles.
Puis-je utiliser Jan avec VS Code ou d’autres outils de développement ?
Oui. Activez le serveur d’API local de Jan et configurez tout outil compatible OpenAI pour qu’il pointe vers http://localhost:1337/v1. Continue.dev, Aider et d’autres assistants de programmation prennent tous en charge les URL de base personnalisées. Définissez le nom du modèle pour qu’il corresponde au nom du dossier utilisé par Jan pour votre modèle téléchargé.
Quelle est la différence entre Jan et Ollama ?
Jan est une application bureau dotée d’une interface graphique — vous interagissez via une interface de discussion et gérez les modèles à travers un Hub visuel. Ollama est un outil en ligne de commande et un service en arrière-plan conçu pour les développeurs souhaitant appeler des modèles depuis des scripts ou les intégrer à des applications. Les deux exposent une API compatible OpenAI. Jan convient aux utilisateurs non techniques et aux workflows centrés sur l’interface graphique ; Ollama convient à l’automatisation et aux déploiements serveur.
Jan prend-il en charge les modèles multimodaux (images) ?
Jan a ajouté un support expérimental pour les modèles vision dans les versions récentes, selon la version installée. Consultez le Hub pour identifier les modèles étiquetés comme « vision » ou « multimodaux ». La prise en charge et la disponibilité des modèles varient selon la version publiée ; référez-vous donc aux notes de publication GitHub correspondant à votre version installée, plutôt que de supposer qu’un modèle donné fonctionnera.

