Monday, 10 August 2026 | Updating Daily AI insight, written for builders

Jan AI: aplicativo desktop de código aberto para executar LLMs localmente

  • Jan é um aplicativo desktop gratuito e de código aberto (licença AGPL) que executa LLMs inteiramente no seu próprio hardware — sem necessidade de conta, sem nuvem e sem que seus dados deixem sua máquina.
  • Inclui uma interface de chat, um hub de modelos para baixar modelos GGUF e um servidor de API local compatível com OpenAI (porta padrão 1337).
  • Baixe em jan.ai ou o página de lançamentos no GitHub — versões para Windows, macOS (Apple Silicon e Intel) e Linux.
  • Ideal para usuários preocupados com privacidade que desejam uma experiência completa com interface gráfica; desenvolvedores que preferem um fluxo de trabalho baseado em API sem interface visual podem preferir o Ollama.

Jan é um aplicativo de desktop de código aberto para executar modelos de linguagem grandes localmente, desenvolvido pela Homebrew Research (janhq). Ele reúne uma interface de chat, um hub de modelos e um mecanismo de inferência em um único aplicativo instalável. Tudo é executado offline: nenhuma conta é necessária, nenhum dado é enviado a servidores externos e, após o download dos modelos, nenhuma conexão com a internet é necessária. O código-fonte está disponível em github.com/janhq/jan sob a licença AGPL-3.0.

Requisitos de hardware

O Jan pode ser executado apenas na CPU, mas uma GPU faz uma diferença significativa na velocidade de resposta. O recurso limitante é a VRAM — a quantidade de memória da GPU determina quais modelos você pode carregar com velocidades utilizáveis.

ComponenteMínimoRecomendado
RAM do sistema8 GB16 GB ou mais
VRAM da GPUNenhum requisito8 GB ou mais para modelos de 7B
Armazenamento10 GB livres50 GB ou mais (os modelos são arquivos grandes)
SOWindows 10, macOS 12, Ubuntu 20.04Versões estáveis mais recentes

Um modelo de 7 bilhões de parâmetros com quantização de 4 bits (Q4_K_M) requer aproximadamente 4–5 GB de VRAM; um modelo de 13B precisa de cerca de 8–9 GB. Use a calculadora de VRAM da Convly para estimar os requisitos de memória do seu modelo específico e nível de quantização antes do download. Se você estiver escolhendo hardware, o melhor Placas de vídeo para LLMs locais guia guia abrange as opções atuais em diferentes faixas de preço.

Em Macs com Apple Silicon, o Jan ativa automaticamente a aceleração Metal. Em Windows e Linux com placa NVIDIA, ele usa CUDA. O suporte a GPUs AMD está disponível via Vulkan no Linux.

Instalação do Jan

Baixe o instalador em jan.ai ou o página de lançamentos no GitHub. O Jan inclui embutido seu próprio mecanismo de inferência llama.cpp — não há dependências adicionais necessárias.

Windows

Execute o .exe instalador. Por padrão, o Jan é instalado em %LOCALAPPDATA%\Programs\Jan . Não são necessários direitos de administrador.

macOS

Baixe o .dmg. Existem versões separadas para Apple Silicon e Intel — escolha aquela compatível com seu Mac. Arraste o aplicativo Jan para a pasta /Applications. Na primeira execução, clique com o botão direito no ícone e selecione Abra para ignorar o aviso do Gatekeeper.

Linux

O Jan fornece um .AppImage, um .deb, e um .rpm na página de lançamentos.

# AppImage
chmod +x jan-linux-x86_64-*.AppImage
./jan-linux-x86_64-*.AppImage

# Debian/Ubuntu
sudo dpkg -i jan-linux-amd64-*.deb

Download do seu primeiro modelo

Quando o Jan for aberto, a guia Hub exibe um navegador curado de modelos GGUF do Hugging Face: Llama, Mistral, Qwen, Gemma, Phi e outros, em múltiplas quantizações.

  1. Clique Hub na barra lateral esquerda.
  2. Pesquise por um modelo — "Llama 3.2" é um bom ponto de partida para a maioria dos hardwares.
  3. Selecione uma quantização. Q4_K_M é a recomendação padrão: menor que Q6/Q8, com perda de qualidade aceitável.
  4. Clique Baixar e aguarde a conclusão da transferência do arquivo.

O Jan armazena os modelos baixados em ~/jan/models/ no macOS e Linux, e em C:\Users\\jan\models no Windows. Cada modelo reside em sua própria subpasta nomeada, contendo o arquivo .gguf e um arquivo de metadados chamado model.json . Você também pode adicionar manualmente qualquer modelo de terceiros .gguf um novo diretório lá — o Jan o detecta na próxima inicialização. Arquivos GGUF de LM Studio são diretamente compatíveis.

Servidor de API local

O Jan inclui um servidor REST API compatível com a OpenAI, permitindo que qualquer ferramenta que suporte a biblioteca cliente OpenAI — o SDK em Python, openai LangChain, Continue.dev e outras — use o Jan como backend local.

Para iniciá-lo: abra Configurações → Servidor de API Local, ative o servidor. Ele escuta, por padrão, na porta 1337 ; esse valor pode ser configurado no mesmo painel.

from openai import OpenAI

client = OpenAI(
    base_url="http://localhost:1337/v1",
    api_key="jan"  # qualquer string não vazia
)

response = client.chat.completions.create(
    model="llama3.2-3b-instruct",  # corresponde ao nome da pasta em ~/jan/models/
    messages=[{"role": "user", "content": "Olá"}]
)
print(response.choices[0].message.content)

O nome do modelo nas chamadas à API deve corresponder exatamente ao nome da pasta usado internamente pelo Jan — visível no Hub ou na lista suspensa de modelos na visualização de chat.

Jan versus LM Studio versus Ollama

As três ferramentas executam modelos GGUF localmente. As diferenças residem na filosofia e no fluxo de trabalho.

JanLM StudioOllama
InterfaceInterface gráfica completa, focada em chatInterface gráfica completa, focada em chatApenas linha de comando (GUIs de terceiros disponíveis)
LicençaAGPL-3.0 (código aberto)Freeware proprietárioMIT (código aberto)
API localSim, compatível com OpenAI (porta 1337)Sim, compatível com OpenAI (porta 1234)Sim, própria API + endpoint compatível com OpenAI
Gerenciamento de modelosHub integrado (Hugging Face)Busca integrada (Hugging Face)Download via CLI do registro Ollama
Formato do modeloGGUFGGUFFormato Ollama (empacota GGUF internamente)
Uso sem interface gráfica / servidorLimitadoLimitadoExcelente — projetado especificamente para isso
Prompt do sistema / personalidadeSim, por assistenteSim, por predefinição de modeloVia Modelfile
PlataformaWindows, macOS, LinuxWindows, macOS, LinuxWindows, macOS, Linux

Escolha o Jan se você deseja uma ferramenta GUI totalmente de código aberto e valoriza a garantia da licença AGPL de que ninguém está construindo um produto fechado com base no código que você utiliza. A interface de chat do Jan é limpa e seu sistema de extensões permite adicionar funcionalidades sem editar arquivos de configuração.

Escolha o LM Studio se a sofisticação da interface for mais importante do que a licença de código aberto. O LM Studio possui uma interface de usuário mais refinada e documentação ligeiramente mais abrangente sobre compatibilidade com hardware. Consulte o Guia completo do LM Studio para um passo a passo completo.

Escolha o Ollama se você for um desenvolvedor que deseja um backend rápido e scriptável, sem sobrecarga de interface gráfica. O Ollama é mais fácil de integrar em pipelines CI, scripts em shell ou contêineres Docker. O Guia completo do Ollama aborda esse caminho em detalhes.

Se você estiver comparando os custos operacionais da inferência local com o uso de uma API em nuvem, o Calculadora de ponto de equilíbrio entre autohospedagem e uso de API ajuda a quantificar essa troca com base no seu volume real de uso e nos custos com hardware.

Privacidade e uso offline

A principal garantia de privacidade do Jan é arquitetural: a inferência ocorre dentro do llama.cpp, diretamente na sua máquina local. Não há telemetria enviada durante a inferência, nenhuma consulta ao modelo é registrada em um servidor remoto e nenhuma conta é exigida. Uma vez baixado um arquivo de modelo, você pode executar o Jan indefinidamente sem conexão à internet.

Isso torna o Jan adequado para trabalhar com documentos que não podem sair da sua máquina — textos jurídicos, médicos ou comercialmente sensíveis — de uma forma que ferramentas baseadas em API em nuvem simplesmente não conseguem igualar, independentemente de suas políticas de privacidade.

O Jan verifica atualizações do aplicativo e busca a lista de modelos do Hub na internet quando há conexão disponível. Ambas as funcionalidades podem ser desativadas: vá até Configurações → Avançado para desabilitar as verificações de atualização, e o Hub simplesmente não exibirá novos modelos quando estiver offline, sem afetar o restante do aplicativo.

Perguntas frequentes

O Jan AI é totalmente gratuito?

Sim. O Jan é gratuito para download e uso, sem assinatura, sem limites de uso e sem recursos bloqueados por pagamento. O código-fonte é publicado sob licença AGPL-3.0 no GitHub. O único custo envolvido é o seu próprio hardware e consumo de energia elétrica.

Quais modelos o Jan pode executar?

O Jan executa qualquer modelo no formato GGUF. Isso inclui a maioria dos modelos de código aberto mais populares: família Llama, Mistral, Mixtral, Qwen, Gemma, Phi, DeepSeek, e muitos outros. O Hub integrado apresenta um subconjunto curado desses modelos; você pode adicionar manualmente qualquer arquivo GGUF colocando-o no diretório de modelos.

Quanta VRAM eu preciso?

Depende do tamanho do modelo e da quantização utilizada. Um modelo de 7B na quantização Q4_K_M requer aproximadamente 4–5 GB de VRAM; um modelo de 13B necessita de 8–9 GB. A inferência apenas na CPU é possível, mas lenta — espere 2–5 tokens por segundo em uma CPU moderna, contra 30–80+ tokens por segundo em uma GPU de faixa intermediária. A Guia de requisitos de VRAM lista valores específicos para os principais modelos.

Posso usar o Jan com o VS Code ou outras ferramentas de programação?

Sim. Ative o servidor de API local do Jan e configure qualquer ferramenta compatível com a OpenAI para apontar para http://localhost:1337/v1. Ferramentas de assistência para programação como Continue.dev, Aider e similares suportam URLs base personalizáveis. Defina o nome do modelo para corresponder exatamente ao nome da pasta que o Jan usa para o modelo baixado.

Qual é a diferença entre o Jan e o Ollama?

O Jan é uma aplicação desktop com interface gráfica — você interage por meio de uma interface de chat e gerencia modelos através de um hub visual. O Ollama é uma ferramenta de linha de comando e serviço em segundo plano, projetada para desenvolvedores que desejam chamar modelos a partir de scripts ou integrá-los em aplicações. Ambos expõem uma API compatível com a OpenAI. O Jan é ideal para usuários não técnicos e fluxos de trabalho centrados na interface gráfica; o Ollama é ideal para automação e implantações em servidores.

O Jan suporta modelos multimodais (imagens)?

Jan adicionou suporte experimental para modelos de visão nas versões mais recentes, dependendo da versão instalada. Verifique o Hub em busca de modelos rotulados como 'visão' ou com capacidade multimodal. O suporte e a disponibilidade de modelos variam conforme a versão lançada; portanto, consulte as notas de versão no GitHub correspondentes à sua versão instalada, em vez de presumir que um modelo específico funcionará.

Escrito por Mustafa Ihsan

Mustafa Ihsan é fundador e editor da Convly.ai. Ele criou e mantém o banco de dados em tempo real de modelos de IA do site, seu índice de relação custo-desempenho, bem como suas calculadoras gratuitas para requisitos de VRAM, custos de API e economia de autohospedagem. Escreve sobre preços de modelos, resultados de benchmarks e o hardware necessário para executar modelos de IA localmente, preferindo sempre dados mensuráveis às declarações dos fabricantes.

Scroll to Top
Featured on There's An AI For That