Monday, 10 August 2026 | Mise à jour quotidienne L'intelligence artificielle au service des constructeurs

Jan AI : application de bureau open source pour exécuter localement des grands modèles linguistiques

  • Jan est une application de bureau gratuite et open source (sous licence AGPL) qui exécute entièrement les grands modèles linguistiques sur votre propre matériel — sans compte, sans nuage, sans que vos données ne quittent votre machine.
  • Elle intègre une interface de discussion, un centre de modèles pour télécharger des modèles GGUF, ainsi qu’un serveur d’API local compatible OpenAI (port par défaut : 1337).
  • Téléchargez depuis jan.ai ou le la page des versions GitHub — versions compatibles avec Windows, macOS (puces Apple Silicon et Intel) et Linux.
  • Idéal pour les utilisateurs soucieux de leur vie privée qui souhaitent une interface graphique complète ; les développeurs privilégiant un flux de travail API-first sans interface graphique peuvent préférer Ollama.

Jan est une application open source pour ordinateur de bureau permettant d’exécuter localement des grands modèles linguistiques, développée par Homebrew Research (janhq). Elle intègre une interface de discussion, un référentiel de modèles et un moteur d’inférence dans une seule application installable. Tout fonctionne hors ligne : aucun compte n’est requis, aucune donnée n’est envoyée à des serveurs externes, et une fois vos modèles téléchargés, aucune connexion Internet n’est nécessaire. Le code source est disponible sur github.com/janhq/jan sous licence AGPL-3.0.

Exigences matérielles

Jan peut fonctionner uniquement sur processeur (CPU), mais l’utilisation d’un GPU améliore sensiblement la rapidité des réponses. La ressource limitante est la mémoire vidéo (VRAM) : la quantité de mémoire GPU dont dispose votre carte détermine quels modèles vous pouvez charger à des vitesses exploitables.

ComposantMinimumRecommandé
Mémoire vive système8 Go16 Go ou plus
VRAM GPUAucune exigence8 Go ou plus pour les modèles de 7 milliards de paramètres (7B)
Stockage10 Go libres50 Go ou plus (les modèles sont des fichiers volumineux)
Système d'exploitationWindows 10, macOS 12, Ubuntu 20.04Dernières versions stables

Un modèle de 7 milliards de paramètres (7B) en quantification 4 bits (Q4_K_M) nécessite environ 4 à 5 Go de VRAM ; un modèle de 13 milliards de paramètres (13B) requiert environ 8 à 9 Go. Utilisez le calculateur de VRAM Convly pour estimer les besoins en mémoire de votre modèle spécifique et de sa quantification avant téléchargement. Si vous choisissez du matériel, le meilleur Cartes graphiques pour les grands modèles linguistiques locaux guide récapitule les options actuelles disponibles selon les tranches de prix.

Sur les Mac équipés de puces Apple Silicon, Jan active automatiquement l’accélération Metal. Sur Windows et Linux avec une carte NVIDIA, il utilise CUDA. Le support des GPU AMD est assuré via Vulkan sous Linux.

Installation de Jan

Téléchargez l’installateur depuis jan.ai ou le la page des versions GitHub. Jan intègre son propre moteur d’inférence llama.cpp — aucune dépendance externe n’est requise.

Windows

Exécutez le .exe l’installateur. Jan s’installe par défaut dans le dossier %LOCALAPPDATA%\Programs\Jan . Aucun droit d’administrateur n’est nécessaire.

macOS

Téléchargez l’ .dmg. Séparément, des versions sont disponibles pour les Mac dotés de puces Apple Silicon et pour ceux équipés de processeurs Intel — veuillez choisir celle correspondant à votre Mac. Glissez-déposez l’application Jan dans le dossier /Applications. Lors du premier lancement, cliquez avec le bouton droit sur l’icône et sélectionnez Ouvrir pour contourner l’avertissement de Gatekeeper.

Linux

Jan fournit un fichier .AppImage, un paquet .debet un paquet .rpm sur la page des versions publiées.

# AppImage
chmod +x jan-linux-x86_64-*.AppImage
./jan-linux-x86_64-*.AppImage

# Debian/Ubuntu
sudo dpkg -i jan-linux-amd64-*.deb

Téléchargement de votre premier modèle

Lorsque Jan s’ouvre, l’onglet Référentiel affiche un navigateur soigneusement sélectionné de modèles GGUF provenant de Hugging Face : Llama, Mistral, Qwen, Gemma, Phi, et d’autres, disponibles dans plusieurs niveaux de quantification.

  1. Cliquez Référentiel dans la barre latérale gauche.
  2. Recherchez un modèle — « Llama 3.2 » constitue un bon point de départ pour la plupart des configurations matérielles.
  3. Sélectionnez un niveau de quantification. Q4_K_M est la recommandation par défaut : plus léger que Q6/Q8 tout en conservant une qualité acceptable.
  4. Cliquez Télécharger et attendez la fin du transfert du fichier.

Jan stocke les modèles téléchargés dans le dossier ~/jan/models/ sous macOS et Linux, et dans le dossier C:\Users\\jan\models sous Windows. Chaque modèle est placé dans un sous-dossier nommé contenant le fichier .gguf et un fichier de métadonnées model.json . Vous pouvez également déposer manuellement tout modèle tiers .gguf dans un nouveau dossier à cet endroit — Jan le détecte au lancement suivant. Les fichiers GGUF provenant de LM Studio sont directement compatibles.

Le serveur d’API local

Jan intègre un serveur d’API REST compatible OpenAI, permettant à tout outil prenant en charge la bibliothèque cliente OpenAI — notamment le SDK Python openai , LangChain, Continue.dev et d’autres — d’utiliser Jan comme backend local.

Pour le démarrer : ouvrez Paramètres → Serveur d’API local, puis activez le serveur. Celui-ci écoute par défaut sur le port 1337 ; ce paramètre est personnalisable depuis le même panneau.

from openai import OpenAI

client = OpenAI(
    base_url="http://localhost:1337/v1",
    api_key="jan"  # n'importe quelle chaîne non vide
)

response = client.chat.completions.create(
    model="llama3.2-3b-instruct",  # correspond au nom du dossier sous ~/jan/models/
    messages=[{"role": "user", "content": "Bonjour"}]
)
print(response.choices[0].message.content)

Le nom du modèle utilisé dans les appels API doit correspondre exactement au nom du dossier que Jan utilise en interne — visible dans le Hub ou dans la liste déroulante des modèles de la vue Discussion.

Comparaison entre Jan, LM Studio et Ollama

Les trois outils exécutent localement des modèles GGUF. Leurs différences résident dans leur philosophie et leur flux de travail.

JanLM StudioOllama
InterfaceInterface graphique complète, centrée sur la discussionInterface graphique complète, centrée sur la discussionInterface en ligne de commande uniquement (interfaces graphiques tierces disponibles)
LicenceAGPL-3.0 (open source)Freeware propriétaireMIT (open source)
API localeOui, compatible avec OpenAI (port 1337)Oui, compatible avec OpenAI (port 1234)Oui, API propre + point de terminaison compatible OpenAI
Gestion des modèlesHub intégré (Hugging Face)Moteur de recherche intégré (Hugging Face)Téléchargement en ligne de commande depuis le registre Ollama
Format du modèleGGUFGGUFFormat Ollama (enveloppe GGUF en interne)
Utilisation sans interface graphique / en mode serveurLimitéLimitéExcellente — conçue à cet effet
Invite système / personnalitéOui, définissable par assistantOui, préréglage spécifique par modèleVia Modelfile
PlateformeWindows, macOS, LinuxWindows, macOS, LinuxWindows, macOS, Linux

Choisissez Jan si vous souhaitez un outil graphique entièrement open source et accordez de l’importance à la garantie offerte par la licence AGPL selon laquelle personne ne peut construire un produit fermé à partir du code que vous utilisez. L’interface de discussion de Jan est épurée, et son système d’extensions vous permet d’ajouter des fonctionnalités sans modifier les fichiers de configuration.

Choisissez LM Studio si la qualité d’exécution prime sur la licence open source. LM Studio propose une interface utilisateur plus raffinée et une documentation légèrement plus complète concernant la compatibilité matérielle. Consultez le Guide complet de LM Studio pour un tutoriel détaillé.

Choisissez Ollama si vous êtes développeur et souhaitez un backend rapide et scriptable, sans surcharge liée à une interface graphique. Ollama s’intègre plus facilement aux pipelines CI, aux scripts shell ou aux conteneurs Docker. Le Guide complet d’Ollama détaille précisément cette approche.

Si vous comparez les coûts d’inférence locale à ceux d’une API cloud, le Calculateur d’auto-hébergement vs seuil de rentabilité d’API permet de chiffrer ce compromis en fonction de votre volume réel d’utilisation et de vos coûts matériels.

Confidentialité et utilisation hors ligne

La garantie fondamentale de Jan en matière de confidentialité est architecturale : l’inférence s’effectue localement, au sein de llama.cpp, sur votre machine. Aucune télémétrie n’est envoyée pendant l’inférence, aucune requête de modèle n’est enregistrée sur un serveur distant, et aucun compte n’est requis. Une fois qu’un fichier modèle est téléchargé, vous pouvez utiliser Jan indéfiniment hors ligne.

Cela rend Jan adapté au traitement de documents qui ne doivent pas quitter votre machine — textes juridiques, médicaux ou commercialement sensibles — de façon que les outils basés sur une API cloud ne sauraient égaler, quelles que soient leurs politiques de confidentialité.

Jan vérifie toutefois la disponibilité de mises à jour de l’application et récupère la liste des modèles du Hub depuis Internet lorsqu’une connexion est disponible. Ces deux fonctionnalités peuvent être désactivées : rendez-vous dans Paramètres → Avancé pour désactiver les vérifications de mises à jour ; quant au Hub, il affiche simplement aucune nouvelle version lorsqu’il est hors ligne, sans perturber le reste de l’application.

Questions fréquemment posées

Jan AI est-il entièrement gratuit ?

Oui. Jan est gratuit à télécharger et à utiliser, sans abonnement, sans limitation d’utilisation ni fonctionnalité verrouillée derrière un paywall. Son code source est publié sous licence AGPL-3.0 sur GitHub. Le seul coût à supporter est celui de votre propre matériel et de votre consommation électrique.

Quels modèles Jan peut-il exécuter ?

Jan exécute tous les modèles au format GGUF. Cela inclut la plupart des modèles open-weight populaires : la famille Llama, Mistral, Mixtral, Qwen, Gemma, Phi, DeepSeeket bien d’autres encore. Le Hub intégré met en avant une sélection restreinte et soigneusement choisie ; vous pouvez ajouter manuellement n’importe quel fichier GGUF en le plaçant dans le répertoire des modèles.

De combien de VRAM ai-je besoin ?

Cela dépend de la taille du modèle et de sa quantification. Un modèle de 7 milliards de paramètres (7B) en quantification Q4_K_M nécessite environ 4 à 5 Go de VRAM ; un modèle de 13 milliards de paramètres (13B) en nécessite 8 à 9 Go. L’inférence CPU seule est possible, mais lente : comptez 2 à 5 jetons par seconde sur un processeur moderne, contre 30 à 80+ sur un GPU milieu de gamme. Le Guide des exigences en VRAM fournit des chiffres détaillés pour les principaux modèles.

Puis-je utiliser Jan avec VS Code ou d’autres outils de développement ?

Oui. Activez le serveur d’API local de Jan et configurez tout outil compatible OpenAI pour qu’il pointe vers http://localhost:1337/v1. Continue.dev, Aider et d’autres assistants de programmation prennent tous en charge les URL de base personnalisées. Définissez le nom du modèle pour qu’il corresponde au nom du dossier utilisé par Jan pour votre modèle téléchargé.

Quelle est la différence entre Jan et Ollama ?

Jan est une application bureau dotée d’une interface graphique — vous interagissez via une interface de discussion et gérez les modèles à travers un Hub visuel. Ollama est un outil en ligne de commande et un service en arrière-plan conçu pour les développeurs souhaitant appeler des modèles depuis des scripts ou les intégrer à des applications. Les deux exposent une API compatible OpenAI. Jan convient aux utilisateurs non techniques et aux workflows centrés sur l’interface graphique ; Ollama convient à l’automatisation et aux déploiements serveur.

Jan prend-il en charge les modèles multimodaux (images) ?

Jan a ajouté un support expérimental pour les modèles vision dans les versions récentes, selon la version installée. Consultez le Hub pour identifier les modèles étiquetés comme « vision » ou « multimodaux ». La prise en charge et la disponibilité des modèles varient selon la version publiée ; référez-vous donc aux notes de publication GitHub correspondant à votre version installée, plutôt que de supposer qu’un modèle donné fonctionnera.

Rédigé par Mustafa Ihsan

Mustafa Ihsan est le fondateur et rédacteur en chef de Convly.ai. Il a conçu et maintient la base de données en direct des modèles IA du site, son indice de rapport prix-performance, ainsi que ses calculateurs gratuits pour les besoins en VRAM, les coûts d’API et l’économie de l’auto-hébergement. Il écrit notamment sur les prix des modèles, les résultats des benchmarks et le matériel requis pour exécuter localement des modèles d’intelligence artificielle, privilégiant systématiquement les chiffres mesurés aux allégations des fournisseurs.

Défiler vers le haut
Featured on There's An AI For That