- Jan è un’app desktop gratuita e open-source (licenza AGPL) che esegue i modelli LLM interamente sull’hardware locale — senza account, senza cloud e senza inviare alcun dato al di fuori del tuo computer.
- Include un’interfaccia chat, un hub modelli per scaricare modelli GGUF e un server API locale compatibile con OpenAI (porta predefinita 1337).
- Scarica da jan.ai o il pagina delle release su GitHub — versioni per Windows, macOS (Apple Silicon e Intel) e Linux.
- Ideale per utenti attenti alla privacy che desiderano un’esperienza completa con interfaccia grafica; gli sviluppatori che preferiscono un flusso di lavoro headless basato su API potrebbero invece optare per Ollama.
Jan è un’applicazione desktop open source per l’esecuzione locale di modelli linguistici di grandi dimensioni, sviluppata da Homebrew Research (janhq). Integra un’interfaccia chat, un hub di modelli e un motore di inferenza in un’unica applicazione installabile. Tutto funziona offline: non è richiesto alcun account, nessun dato viene inviato a server esterni e, una volta scaricati i modelli, non è necessaria alcuna connessione Internet. Il codice sorgente è disponibile su github.com/janhq/jan sotto licenza AGPL-3.0.
Requisiti hardware
Jan può essere eseguito esclusivamente sulla CPU, ma l’uso di una GPU migliora sensibilmente la velocità delle risposte. La risorsa limitante è la VRAM — la quantità di memoria GPU disponibile determina quali modelli è possibile caricare a velocità accettabili.
| Componente | Minimo | Consigliato |
|---|---|---|
| RAM di sistema | 8 GB | 16 GB o più |
| VRAM GPU | Nessun requisito obbligatorio | 8 GB o più per modelli da 7 miliardi di parametri |
| Archiviazione | 10 GB liberi | 50 GB o più (i modelli sono file di grandi dimensioni) |
| Sistema operativo | Windows 10, macOS 12, Ubuntu 20.04 | Ultime versioni stabili |
Un modello da 7 miliardi di parametri quantizzato in 4 bit (Q4_K_M) richiede circa 4–5 GB di VRAM; un modello da 13 miliardi di parametri ne richiede circa 8–9 GB. Utilizza il calcolatore VRAM di Convly per stimare le esigenze di memoria del tuo modello specifico e della relativa quantizzazione prima del download. Se stai valutando l’acquisto di hardware, la migliore GPU per LLM locali guida guida alle GPU attualmente disponibili suddivisa per fasce di prezzo
su Mac con Apple Silicon, Jan abilita automaticamente l’accelerazione Metal. Su Windows e Linux con schede NVIDIA, utilizza CUDA. Il supporto per GPU AMD è disponibile tramite Vulkan su Linux.
Installazione di Jan
Scarica l’installer da jan.ai o il pagina delle release su GitHub. Jan include già integrato il proprio motore di inferenza llama.cpp — non sono richieste dipendenze aggiuntive.
Windows
Esegui il .exe installer. Jan viene installato di default nella cartella %LOCALAPPDATA%\Programs\Jan . Non sono necessari diritti amministrativi.
macOS
Scarica l’ .dmg. Sono disponibili versioni distinte per Apple Silicon e Intel — scegli quella compatibile con il tuo Mac. Trascina Jan nella cartella /Applications. Al primo avvio, fai clic destro sull’icona e seleziona Apri per aggirare l’avviso di Gatekeeper.
Linux
Jan fornisce un .AppImage, un pacchetto .debe uno .rpm nella pagina delle release.
# AppImage
chmod +x jan-linux-x86_64-*.AppImage
./jan-linux-x86_64-*.AppImage
# Debian/Ubuntu
sudo dpkg -i jan-linux-amd64-*.debDownload del primo modello
Quando Jan viene avviato, la scheda Hub mostra un browser curato di modelli GGUF provenienti da Hugging Face: Llama, Mistral, Qwen, Gemma, Phi e altri, disponibili in diverse quantizzazioni.
- Clicca Hub nella barra laterale sinistra.
- Cerca un modello — «Llama 3.2» è un buon punto di partenza per la maggior parte dei sistemi.
- Seleziona una quantizzazione. Q4_K_M è la scelta consigliata di default: più leggera rispetto a Q6/Q8, con una perdita di qualità accettabile.
- Clicca Scarica e attendi il completamento del trasferimento del file.
Jan memorizza i modelli scaricati nella cartella ~/jan/models/ su macOS e Linux, e nella cartella C:\Users\\jan\models su Windows. Ogni modello risiede in una propria sottocartella denominata, contenente il file .gguf e un file di metadati chiamato model.json . È inoltre possibile inserire manualmente qualsiasi modello di terze parti .gguf in una nuova cartella lì — Jan lo rileva al lancio successivo. I file GGUF provenienti da LM Studio sono direttamente compatibili.
Server API locale
Jan include un server API REST compatibile con OpenAI, consentendo a qualsiasi strumento che supporti la libreria client OpenAI — come l’SDK Python, openai LangChain, Continue.dev e altri — di utilizzare Jan come backend locale.
Per avviarlo: aprire Impostazioni → Server API locale, quindi attivare il server. Per impostazione predefinita, ascolta sulla porta 1337 ; tale porta è configurabile nel medesimo pannello.
from openai import OpenAI
client = OpenAI(
base_url="http://localhost:1337/v1",
api_key="jan" # qualsiasi stringa non vuota
)
response = client.chat.completions.create(
model="llama3.2-3b-instruct", # corrisponde al nome della cartella in ~\/jan\/models\/
messages=[{"role": "user", "content": "Ciao"}]
)
print(response.choices[0].message.content)Il nome del modello nelle chiamate API deve corrispondere esattamente al nome della cartella utilizzato internamente da Jan — visibile nell’Hub o nel menu a discesa dei modelli nella vista Chat.
Confronto tra Jan, LM Studio e Ollama
Tutti e tre gli strumenti eseguono modelli GGUF in locale. Le differenze riguardano filosofia e flusso di lavoro.
| Jan | LM Studio | Ollama | |
|---|---|---|---|
| Interfaccia | Interfaccia grafica completa, orientata alla chat | Interfaccia grafica completa, orientata alla chat | Solo interfaccia a riga di comando (GUI di terze parti disponibili) |
| Licenza | AGPL-3.0 (open source) | Freeware proprietario | MIT (open source) |
| API locale | Sì, compatibile con OpenAI (porta 1337) | Sì, compatibile con OpenAI (porta 1234) | Sì, API propria + endpoint compatibile con OpenAI |
| Gestione dei modelli | Hub integrato (Hugging Face) | Ricerca integrata (Hugging Face) | Download CLI dal registro Ollama |
| Formato del modello | GGUF | GGUF | Formato Ollama (incapsula internamente GGUF) |
| Utilizzo headless/server | Limitato | Limitato | Eccellente — progettato appositamente per questo scopo |
| Prompt di sistema / personalità | Sì, specifico per ogni assistente | Sì, specifico per ogni preset del modello | Tramite Modelfile |
| Piattaforma | Windows, macOS, Linux | Windows, macOS, Linux | Windows, macOS, Linux |
Scegli Jan se desideri uno strumento GUI completamente open source e ti interessa la garanzia offerta dalla licenza AGPL secondo cui nessuno può costruire un prodotto chiuso basandosi sul codice che utilizzi. L’interfaccia chat di Jan è pulita e il sistema di estensioni consente di aggiungere funzionalità senza modificare i file di configurazione.
Scegli LM Studio se l’eleganza dell’interfaccia conta più della licenza open source. LM Studio offre un’interfaccia utente più raffinata e una documentazione sulla compatibilità hardware leggermente più esaustiva. Consulta la Guida completa a LM Studio per una guida dettagliata.
Scegli Ollama se sei uno sviluppatore che desidera un backend veloce e scriptabile, privo di sovraccarico legato all’interfaccia grafica. Ollama risulta più semplice da integrare in pipeline CI, script shell o contenitori Docker. La Guida completa a Ollama tratta dettagliatamente questo approccio.
Se stai confrontando i costi operativi dell’inferenza locale con quelli di un’API cloud, la Calcolatore del punto di pareggio tra auto-hosting e utilizzo di API aiuta a quantificare il compromesso in base al tuo effettivo volume d’uso e ai costi hardware.
Privacy e utilizzo offline
La garanzia fondamentale di Jan in termini di privacy è architetturale: l’inferenza avviene all’interno di llama.cpp, direttamente sul tuo computer locale. Durante l’inferenza non vengono inviati dati di telemetria, nessuna query relativa al modello viene registrata su un server remoto e non è richiesto alcun account. Una volta scaricato un file modello, puoi eseguire Jan indefinitamente anche senza connessione internet.
Ciò rende Jan adatto all’elaborazione di documenti che non possono lasciare il tuo dispositivo — testi legali, medici o commercialmente sensibili — in un modo che nessuno strumento basato su API cloud può eguagliare, indipendentemente dalle sue politiche sulla privacy.
Jan verifica comunque la disponibilità di aggiornamenti dell’applicazione e recupera l’elenco dei modelli dall’Hub tramite internet quando è presente una connessione. Entrambe le funzioni possono essere disabilitate: vai a Impostazioni → Avanzate per disattivare i controlli degli aggiornamenti; l’Hub, invece, mostrerà semplicemente nessun nuovo modello quando sei offline, senza compromettere il resto dell’applicazione.
Domande frequenti
Jan AI è completamente gratuito?
Sì. Jan è gratuito da scaricare e utilizzare, senza abbonamenti, limiti d’uso né funzionalità a pagamento. Il codice sorgente è pubblicato su GitHub sotto licenza AGPL-3.0. L’unico costo è rappresentato dall’hardware e dall’energia elettrica da te forniti.
Quali modelli può eseguire Jan?
Jan esegue qualsiasi modello nel formato GGUF. Ciò include la maggior parte dei modelli open-weight più diffusi: la famiglia Llama, Mistral, Mixtral, Qwen, Gemma, Phi, DeepSeeke molti altri. L’Hub integrato mostra una selezione curata di tali modelli; puoi tuttavia aggiungere manualmente qualsiasi file GGUF posizionandolo nella cartella dei modelli.
Di quanta VRAM ho bisogno?
Dipende dalle dimensioni del modello e dal tipo di quantizzazione. Un modello da 7B in formato Q4_K_M richiede circa 4–5 GB di VRAM; un modello da 13B ne richiede 8–9 GB. L’inferenza esclusivamente su CPU è possibile, ma lenta: ci si può attendere 2–5 token al secondo su una CPU moderna, contro i 30–80+ token al secondo ottenibili con una GPU di fascia media. La Guida ai requisiti di VRAM riporta i valori specifici per i principali modelli.
Posso usare Jan con VS Code o altri strumenti per la programmazione?
Sì. Attiva il server API locale di Jan e configura qualsiasi strumento compatibile con OpenAI in modo che punti a http://localhost:1337/v1. Continue.dev, Aider e simili assistenti per la programmazione supportano tutti URL di base personalizzabili. Imposta il nome del modello in modo che corrisponda al nome della cartella utilizzato da Jan per il modello scaricato.
Qual è la differenza tra Jan e Ollama?
Jan è un’applicazione desktop con interfaccia grafica: interagisci tramite un’interfaccia chat e gestisci i modelli attraverso un hub visuale. Ollama è invece uno strumento a riga di comando e un servizio in background progettato per sviluppatori che vogliono richiamare modelli da script o integrarli in applicazioni. Entrambi espongono un’API compatibile con OpenAI. Jan è ideale per utenti non tecnici e flussi di lavoro orientati all’interfaccia grafica; Ollama è invece più adatto all’automazione e ai deployment su server.
Jan supporta modelli multimodali (immagini)?
Jan ha aggiunto supporto sperimentale per i modelli di visione nelle versioni più recenti, a seconda della versione installata. Controlla l’Hub per i modelli contrassegnati come dotati di capacità di visione o multimodali. Il supporto e la disponibilità dei modelli variano in base alla versione rilasciata, quindi consulta le note di rilascio su GitHub relative alla versione installata, anziché presupporre che un determinato modello funzionerà.

