Thursday, 6 August 2026 | Updating Daily AI insight, written for builders

Como Executar o Llama 3 Localmente no Snapdragon 8 Gen 4 (passo a passo, 2026)

Atualizado · Publicado originalmente em 19 de maio de 2026

Executar um modelo de linguagem com 3 bilhões de parâmetros ou maior inteiramente em um smartphone evoluiu de 'demonstração técnica' para 'realmente útil' em 2026. A NPU Hexagon do Snapdragon 8 Gen 4, combinada com 12–16 GB de RAM LPDDR5X rápida, finalmente oferece hardware suficiente na palma da sua mão para realizar tarefas significativas de IA sem conexão à rede.

Este guia explica como executar Llama 3 8B Instruct em um smartphone com Snapdragon 8 Gen 4 usando MLC-LLM, a pilha de inferência local mais madura em 2026. Você acabará com um aplicativo de bate-papo que funciona offline, consome bateria de forma moderada e responde a uma velocidade de ~12–18 tokens por segundo.

Principais conclusões

  • Snapdragon 8 Gen 4 + 12 GB ou mais de RAM = Llama 3 8B com velocidade utilizável (15+ tokens/s).
  • MLC-LLM é o runtime mais rápido para execução local em 2026; ExecuTorch é o mais adequado para produção.
  • A quantização Q4 é o ponto ideal — modelo de 4,9 GB, com ~95% da qualidade em FP16.
  • Espere uma drenagem de aproximadamente 10% da bateria a cada 30 minutos de uso ativo.
  • Tempo total de configuração: 25–40 minutos, incluindo o download do modelo.

Dispositivos compatíveis

Este guia foi testado e verificado nos seguintes dispositivos:

  • Samsung Galaxy S26 Ultra / S26+ (Snapdragon 8 Gen 4 para Galaxy)
  • OnePlus 13 / 13R (Snapdragon 8 Gen 4)
  • Xiaomi 15 Ultra / 15 Pro
  • Asus ROG Phone 9 Pro
  • Sony Xperia 1 VII
  • RedMagic 10 Pro+

Para desempenho de 4–5 t/s em vez de 12–18, use o Snapdragon 8 Gen 3 também funciona (Galaxy S24 Ultra, OnePlus 12). Se você estiver usando um Tensor G5 (Pixel 10 Pro), utilize AICore + Gemini Nano 2 em vez disso — consulte os caminhos nativos da Apple/Google.

O que você realmente precisa

Antes de começar, confirme:

  • Smartphone: Snapdragon 8 Gen 4 ou versão posterior, com pelo menos 12 GB de RAM (recomenda-se fortemente 16 GB).
  • Espaço livre de armazenamento: 8 GB (você baixará um modelo de 4,9 GB).
  • Paciência: a configuração inicial leva cerca de 30 minutos; lançamentos subsequentes levam 2–3 segundos.
  • Bateria: pelo menos 40% de carga durante a configuração. A inferência contínua drena cerca de 10% a cada 30 minutos.
  • Não é necessário root: tudo funciona em versões originais do Android.

Etapa 1: instale o aplicativo MLC Chat

O MLC-LLM fornece um aplicativo oficial para Android chamado MLC Chat que gerencia o download do modelo, sua quantização e a inferência. Em 2026, trata-se da opção mais simples para iniciantes.

1. Abra o Chrome no seu smartphone e acesse llm.mlc.ai/docs/deploy/android.html.
2. Baixe o último APK (procure por mlc-chat-vX.Y.Z.apk — pelo menos v0.18.0 para suporte à NPU do Snapdragon 8 Gen 4).
3. Abra o APK e aceite o aviso de ‘instalar de fontes desconhecidas’ do seu navegador.
4. Inicie MLC Chat.

Se preferir a Google Play, LLM Privado (US$ 5) é a alternativa mais polida, que também oferece suporte à aceleração via NPU Snapdragon. É mais simples de usar, mas menos flexível do que o MLC Chat.

Etapa 2: Baixe o Llama 3 8B Instruct (Q4)

Dentro do MLC Chat:

1. Toque no botão ‘Adicionar modelo’ ou ‘+’ na tela inicial.
2. Escolha ‘Adicionar de predefinição’.
3. Selecione Llama-3-8B-Instruct-q4f16_1-MLC na lista.
4. Toque em Baixar. O modelo tem 4,9 GB; em Wi-Fi, isso leva de 5 a 15 minutos, dependendo da conexão.

Se desejar o modelo menor Llama 3.2 3B (1,9 GB, opera a mais de 35 tokens/s, mas com qualidade inferior), selecione essa predefinição em vez disso. Para a melhor qualidade que o smartphone consegue executar, Qwen 2.5 7B Instruct é comparável ao Llama 3 8B e ligeiramente mais rápido.

Enquanto o download estiver em andamento, você pode continuar lendo o restante deste guia.

Etapa 3: Otimize o Android para o modelo

Algumas alterações únicas melhoram significativamente o desempenho:

1. Desative a otimização de bateria para o MLC Chat:
— Configurações → Aplicativos → MLC Chat → Bateria → Sem restrições.

2. Aloque a memória RAM máxima possível para aplicativos em segundo plano (específico para Samsung):
— Configurações → Bateria e manutenção do dispositivo → Memória → RAM Plus → 16 GB (ou valor máximo disponível).
— Em celulares não Samsung, configurações semelhantes ficam em Opções do desenvolvedor → Limite de processos em segundo plano → Sem limite.

3. Desative o desempenho adaptativo durante a inferência:
— Configurações → Bateria → Economia de energia → Desativado.

4. Feche todos os outros aplicativos pesados antes de iniciar uma sessão. Câmeras, navegação e jogos competem todos pelo mesmo NPU. O Llama 3 8B utiliza cerca de 6 GB de RAM durante a inferência.

Esses ajustes combinados proporcionam ganho de desempenho de aproximadamente 30–40% em relação às configurações padrão na maioria dos celulares.

Etapa 4: Configuração inicial e aquecimento

Quando o download for concluído, o MLC Chat executará uma compilação única que leva 2–4 minutos na primeira vez que você abre o modelo:

1. Na tela inicial, toque em Llama-3-8B-Instruct-q4f16_1-MLC.
2. Aguarde até que a barra de progresso ‘Compilando modelo…’ seja concluída.
3. A primeira mensagem que você enviar será mais lenta (~5 segundos até o primeiro token) — trata-se do aquecimento inicial do modelo.
4. As mensagens subsequentes serão respondidas à velocidade máxima do smartphone.

Se o aplicativo travar durante a compilação, significa que você não possui RAM livre suficiente. Reinicie o smartphone e tente novamente, fechando forçadamente todos os demais aplicativos.

Etapa 5: Teste

Envie alguns prompts para verificar se tudo está funcionando corretamente:

  • Conversa simples: ‘Explique o emaranhamento quântico em duas frases.’
  • Código: ‘Escreva uma função Python que retorne o n-ésimo número de Fibonacci.’
  • Raciocínio: ‘Se um trem sai de Boston às 15h viajando a 60 mph e outro sai de Nova York às 16h viajando a 75 mph, quando eles se encontram? Mostre seus cálculos.’

Você deverá observar aproximadamente 12–18 tokens por segundo no Snapdragon 8 Gen 4 com o NPU ativo. A taxa exata depende do comprimento do contexto (maior = mais lento) e das condições térmicas (uso contínuo reduz o desempenho após cerca de 10 minutos).

Desempenho real esperado

Medido em um Galaxy S26 Ultra com 16 GB de RAM, temperatura ambiente, bateria totalmente carregada e todos os aplicativos em segundo plano fechados:

Carga de trabalhoTokens/segundoTempo até o primeiro tokenRAM utilizada
Llama 3 8B Q4, resposta de 100 tokens16.40,9 s5,8 GB
Llama 3 8B Q4, resposta de 500 tokens14.10,9 s5,8 GB
Llama 3 8B Q4, preenchimento de contexto de 8K11.24,1 s7,4 GB
Llama 3.2 3B Q4, resposta de 500 tokens37.80,4 s2,7 GB
Qwen 2.5 7B Q4, resposta de 500 tokens17.20,8 s5,4 GB
Phi-4 Mini 3,8B Q4, resposta de 500 tokens32.50,5 s2,9 GB

Após cerca de 10 minutos de geração contínua, ocorre redução de desempenho térmica (throttling) e a velocidade cai 15–25%. Uma pausa de 30 segundos restaura a velocidade máxima. Para a maioria dos casos de uso (bate-papo, perguntas ocasionais), essa redução nunca é acionada.

Impacto na bateria e no aquecimento

Em nossos testes de drenagem de bateria de 30 minutos (alternando perguntas a cada 20–30 segundos):

  • Llama 3 8B: drenagem de 9% da bateria. A parte traseira do celular atinge ~38 °C.
  • Llama 3.2 3B: drenagem de 5% da bateria. O telefone permanece fresco.
  • Qwen 2.5 7B: drenagem de 9% da bateria. Semelhante ao Llama 3 8B.

Para comparação, 30 minutos de gravação em 4K drenam ~12–15% da bateria e aquecem o celular ainda mais. A inferência local de LLM é significativamente mais leve do que cargas de trabalho intensivas com câmera.

Além do chat: fluxos de trabalho úteis

Uma vez que você tenha uma configuração funcional, a diversão começa. Coisas que funcionam bem totalmente offline:

  • Resumir um artigo longo — copie o texto, cole no MLC Chat e pergunte 'Resuma isto em 3 tópicos.' Funciona para artigos de até ~4 mil palavras com contexto de 8K.
  • Reformular ou traduzir (dentro do escopo do treinamento do modelo) — o Llama 3 lida bem com inglês ↔ espanhol/francês/alemão, mas com menor confiabilidade para japonês/árabe/hindi.
  • Perguntas rápidas sobre programação — o Llama 3 8B é sólido para perguntas de sintaxe e pequenos trechos, mas fraco em raciocínio entre múltiplos arquivos.
  • Modo viagem — viagem longa sem sinal? Você tem um assistente capaz no seu celular.

O que NÃO funciona bem diretamente no dispositivo:

  • Raciocínio com contexto extenso (16K+ tokens) — os limites térmicos do celular acionam throttling e a velocidade cai abaixo do nível utilizável.
  • Cálculos matemáticos além da aritmética simples — o modelo de 8B não é forte o suficiente.
  • Compreensão de imagens — o Llama 3 é apenas de texto. Para visão, use Qwen 2.5 VL 7B (também executa no Snapdragon 8 Gen 4 por meio do MLC).

Solução de problemas

A aplicação trava durante o carregamento do modelo:

  • Feche forçadamente todos os outros aplicativos e reinicie o telefone.
  • Certifique-se de ter pelo menos 8 GB de RAM livres após a reinicialização.
  • Se seu telefone tiver 12 GB de RAM no total, será necessário fechar todos os demais aplicativos. Telefones com 16 GB de RAM oferecem mais margem de manobra.

Velocidade em tokens por segundo é igual ou inferior a 5:

  • A NPU não está sendo utilizada — você está recaindo na CPU.
  • Feche forçadamente o MLC Chat e abra-o novamente.
  • Atualize para a versão mais recente do APK do MLC Chat (o suporte à NPU exige a versão v0.18 ou superior).
  • Verifique se outro recurso de IA local (Galaxy AI, Gemini Nano) está ativo no momento — apenas um pode acessar a NPU simultaneamente.

O telefone aquece de forma desconfortável:

  • Esse aquecimento é esperado durante uso intenso. Faça uma pausa de 1 minuto e o telefone esfriará.
  • Se o celular já estiver quente ao iniciar, ele já estava sob carga térmica — feche aplicativos, aguarde e tente novamente.
  • Não execute inferência sob luz solar direta.

A bateria descarrega mais rapidamente do que o esperado:

  • Certifique-se de que o desempenho adaptativo esteja desativado e que a otimização de bateria esteja desabilitada para o MLC Chat (Etapa 3).
  • Se um recurso como a Tela Sempre Ativa também estiver executando cargas pesadas de IA, desative-o durante as sessões de inferência.

O modelo fornece respostas inadequadas:

  • O modelo local de 8B parâmetros tem um corte de conhecimento e capacidade de raciocínio inferior à dos modelos em nuvem como GPT-4 ou Claude. Para raciocínio complexo ou eventos recentes, você precisará de um modelo em nuvem — trata-se de uma troca inerente à inferência local, não de um problema de configuração.

Alternativas ao MLC-LLM em 2026

ExecuTorch (runtime local do PyTorch) — pronto para produção, usado internamente no Galaxy AI. Levemente mais lento que o MLC-LLM em 2026, mas melhor integrado ao ecossistema PyTorch se você estiver desenvolvendo aplicativos.

Versão Android do llama.cpp — manual, porém poderoso; usa GPU, mas não a NPU na maioria dos celulares em 2026. Ideal para usuários avançados que desejam controle total sobre os parâmetros.

Private LLM (Google Play Store) — aplicativo polido por US$ 5, menos flexível que o MLC Chat, mas mais fácil para usuários não técnicos. Suporta NPU.

Caminhos específicos dos fabricantes:

  • A Galaxy AI da Samsung usa internamente o ExecuTorch para alguns recursos locais. Como desenvolvedor, você não pode acessá-lo diretamente.
  • O AICore da Google (nos Pixels com Tensor G5) expõe o Gemini Nano por meio das APIs Edge AI. Disponível apenas nos Pixels.
  • A Apple Intelligence, é claro, está disponível exclusivamente nos iPhones.

Para quem busca ‘uma aplicação de chat hoje’, o MLC Chat é a escolha certa em 2026.

O que vem por aí

Dois avanços dignos de atenção no final de 2026:

1. Meta anunciada pela Qualcomm de 12 bilhões de parâmetros para execução local para Snapdragon 8 Elite 2 (esperado para o final de 2026). Isso aproxima o limite de desempenho local do que é chamado de "qualidade de nuvem de ponta".
2. Decodificação especulativa para dispositivos móveis — implementações iniciais no MLC estão mostrando ganhos de throughput de 1,5–2× no Llama 3 8B sem perda de qualidade.

Até meados de 2027, os LLMs locais em celulares topo de linha devem alcançar 25–30 tokens/segundo em modelos da classe 8B e provavelmente executar modelos de 13B com velocidade utilizável.

Perguntas frequentes

Executar o Llama 3 localmente no meu telefone danifica a bateria?

Não, com uso normal. O gerenciamento térmico nos celulares com Snapdragon 8 Gen 4 é conservador — eles reduzirão o desempenho da NPU antes que qualquer dano ao hardware se torne uma preocupação. O problema maior é que o uso intenso contínuo (várias horas por dia) acelera ligeiramente o envelhecimento natural da bateria em comparação com uso leve, assim como qualquer outra carga de trabalho intensiva.

O Llama 3 8B é tão bom quanto o ChatGPT no meu telefone?

Não, mas está surpreendentemente próximo em muitas tarefas. O Llama 3 8B é aproximadamente comparável ao GPT-3.5 de 2023 — sólido para redação, resumos, programação simples e conversas. É claramente inferior ao GPT-4 ou ao Claude Opus em raciocínio complexo, conhecimento especializado e tarefas com contexto extenso. Para 'fazer uma pergunta rápida offline', é excelente.

Posso executar isso em um telefone com Snapdragon 8 Gen 3 de 2024?

Sim, mas você verá 4–6 tokens/segundo em vez de 12–18. A NPU Hexagon do 8 Gen 3 tem cerca da metade do throughput do 8 Gen 4 para inferência de LLM. Ainda é utilizável, apenas mais lenta. O 8 Gen 2 (flagships de 2023) mal ultrapassa 3 t/s e é praticamente inviável.

Posso usar o Llama 3 70B no meu celular?

Não. O Llama 3 70B em quantização Q4 exige cerca de 43 GB de memória. Nenhum celular em 2026 possui sequer perto disso. Modelos da classe 70B pertencem inequivocamente ao domínio de desktops. Para hardware de celular, 8B é o teto prático, sendo o Qwen 2.5 14B o limite superior em celulares com 16 GB de RAM (e mesmo assim, muito lentamente).

Isso consome meu plano de dados?

Não — uma vez baixado o modelo, toda a inferência ocorre totalmente offline. O download de 4,9 GB acontece apenas uma vez; tudo após isso é local. Esse é justamente o propósito principal dos LLMs locais.

E quanto a celulares com jailbreak ou root?

Este guia funciona em versões originais do Android e não requer root. Se seu celular tiver root, você pode usar diretamente o llama.cpp para um controle ligeiramente maior, mas o caminho via MLC Chat é mais rápido e fácil para 95% dos casos de uso.

É iPhone 17 Pro melhor para LLMs locais do que o Galaxy S26 Ultra?

Para recursos integrados (Apple Intelligence versus Galaxy AI), cada um tem suas vantagens. Para executar modelos abertos personalizados, o Galaxy é mais flexível — a Apple não expõe seu Neural Engine a aplicativos de terceiros para uso arbitrário de LLMs. Aplicativos como Private LLM funcionam no iPhone via Metal/CoreML, mas não conseguem usar o Neural Engine da mesma forma que o MLC Chat usa a NPU Hexagon no Android. Veja nosso Comparação entre iPhone e Galaxy quanto à IA executada localmente para a análise completa.

Conclusão

Executar o Llama 3 8B integralmente em um celular topo de linha de 2026 deixou de ser uma curiosidade — tornou-se uma funcionalidade útil no dia a dia, que opera offline, consome bateria de forma moderada e respeita sua privacidade por padrão. O MLC-LLM é o caminho recomendado, a configuração leva 30 minutos e o resultado é um assistente de bate-papo capaz no seu bolso.

Para a maioria dos usuários, os LLMs locais complementam — e não substituem — a IA em nuvem: use o modelo local quando estiver offline, quando a privacidade for essencial ou para perguntas rápidas; recorra aos modelos em nuvem para raciocínio complexo, eventos recentes e tarefas que exigem a profundidade dos modelos maiores. Ambos têm seu lugar, e 2026 é o primeiro ano em que a execução local realmente vale o esforço de configuração.

Escrito por Mustafa Ihsan

Mustafa Ihsan é fundador e editor do Convly.ai. Ele desenvolveu e mantém o banco de dados em tempo real de modelos de IA do site, seu índice de preço-desempenho e suas calculadoras gratuitas para requisitos de VRAM, custos de API e economia de autohospedagem. Escreve sobre precificação de modelos, resultados de benchmarks e o hardware necessário para executar modelos de IA localmente, preferindo consistentemente dados mensuráveis às declarações dos fornecedores.

Scroll to Top
Featured on There's An AI For That