Você se pergunta se sua GPU consegue executar determinado modelo de linguagem grande localmente? Esta calculadora gratuita estima a quantidade de VRAM necessária para cada modelo em todos os níveis de quantização — e indica exatamente quais modelos cabem na sua placa.
| Quantização | Qualidade | VRAM estimada | Cabe na sua GPU? |
|---|
Estimativa com base nos pesos do modelo em cada quantização + sobrecarga de tempo de execução de ~1,5 GB. Contextos longos adicionam memória de cache KV (KV-cache) adicional (essa memória cresce conforme o comprimento do contexto escolhido). Em modelos do tipo mixture-of-experts (mistura de especialistas), todos os parâmetros devem ser carregados na VRAM, mesmo que apenas um subconjunto participe do cálculo por token.
Escolha um modelo da nossa Banco de dados de modelos de IA (ou insira uma contagem personalizada de parâmetros), selecione sua GPU, defina seu comprimento de contexto e veja instantaneamente se ele será executado — e com que qualidade. As estimativas são baseadas nos pesos do modelo; contextos longos acrescentam memória de cache KV adicional.
Resposta rápida: quanto VRAM é necessário para executar um LLM localmente?
Para executar um modelo de linguagem grande localmente com quantização de 4 bits, estime cerca de 0,5–0,6 GB de VRAM da GPU por bilhão de parâmetros, além de 1–3 GB para o cache KV em comprimentos típicos de contexto. Na prática, um modelo de 8B cabe em aproximadamente 5–6 GB (funciona confortavelmente em uma RTX 3060 de 12 GB; também roda em uma RTX 4060 de 8 GB), um modelo de 13B precisa de ~8–10 GB, um modelo de 32B exige uma placa de 24 GB, como a RTX 4090 (~20 GB para os pesos), e um modelo de 70B requer cerca de 40–48 GB — uma única placa de 48 GB ou duas GPUs de 24 GB.
Regras práticas rápidas para os pesos do modelo, antes de adicionar o contexto:
- 4 bits (Q4): ~0,5–0,6 GB por bilhão de parâmetros
- 8 bits (Q8): ~1–1,2 GB por bilhão de parâmetros
- fp16 / bf16: ~2 GB por bilhão de parâmetros
- Cache KV (contexto): adicione ~1–4 GB para contextos de 8K–32K tokens; mais para contextos muito longos ou modelos maiores
Perguntas frequentes
Quanto VRAM preciso para executar um modelo de 70B?
Um modelo de 70B requer aproximadamente 40–48 GB de VRAM com quantização de 4 bits — cerca de 0,5–0,6 GB por bilhão de parâmetros para os pesos, além do cache KV. Isso cabe em uma única placa de 48 GB ou em duas GPUs de 24 GB, como um par de RTX 4090. Em 8 bits, esse valor duplica para ~80 GB, e em fp16 você precisa de cerca de 140 GB.
Minha RTX 4060 ou uma GPU de 12 GB consegue executar um modelo de 8B ou 7B?
Sim. Um modelo de 7B–8B em 4 bits usa apenas cerca de 4–5 GB de VRAM, portanto roda confortavelmente em uma placa de 12 GB, como a RTX 3060, com bastante margem para o contexto. A RTX 4060 tem 8 GB e ainda lida bem com um modelo de 7–8B — você simplesmente terá menos espaço disponível para janelas de contexto longas.
Quanto VRAM um modelo de 13B precisa?
Um modelo de 13B precisa de cerca de 8–10 GB de VRAM com quantização de 4 bits. Ele cabe em uma GPU de 12 GB para contextos curtos a moderados, mas uma placa de 16 GB é mais segura ao adicionar uma janela de contexto maior e sobrecarga do framework.
Uma GPU de 24 GB, como a RTX 4090, consegue executar um modelo de 32B ou 70B?
Uma GPU de 24 GB executa bem um modelo de 32B em 4 bits: os pesos ocupam cerca de 20 GB, deixando alguns GB para o cache KV. Ela não consegue acomodar um modelo de 70B em 4 bits — que necessita de ~40–48 GB — portanto seria necessário uma segunda GPU, descarga para a CPU ou uma quantização de menor qualidade (2–3 bits).
Quanta memória da GPU um LLM consome por bilhão de parâmetros?
Como regra geral, estime ~0,5–0,6 GB por bilhão de parâmetros em 4 bits, ~1–1,2 GB em 8 bits e ~2 GB em fp16/bf16. Assim, um modelo de 30B ocupa aproximadamente 16–18 GB em 4 bits, ~32 GB em 8 bits e ~60 GB em fp16, antes de adicionar o cache KV.
Quanto VRAM extra o comprimento do contexto (cache KV) consome?
O cache KV cresce linearmente com o comprimento do contexto e adiciona cerca de 3 GB em um modelo de 8B ao passar de 8K para 32K tokens (aproximadamente 1 GB em 8K subindo para cerca de 4 GB em 32K), com modelos maiores e contextos mais longos consumindo ainda mais. A quantização do cache KV para 8 bits reduz essa penalidade pela metade; portanto, reserve sempre 1–4 GB de margem adicional além dos pesos do modelo.
Qual tamanho de modelo posso executar com 8 GB ou 16 GB de VRAM?
Com 8 GB de VRAM, você pode executar confortavelmente modelos de 7–8B em 4 bits; com 16 GB, consegue rodar até ~13B com facilidade e até forçar um modelo de 20–24B com um contexto modesto. Para um modelo de 32B, recomenda-se 24 GB, e para um modelo de 70B, cerca de 48 GB.
Mais ferramentas gratuitas da Convly
VRAM necessária para executar modelos abertos da OpenAI localmente (4 bits)
1,4 GB
3 GB
4,5 GB
5 GB
5 GB
7,5 GB
8 GB
9 GB
9 GB
16 GB
18 GB
20 GB
21 GB
40 GB
40 GB
65 GB
140 GB
140 GB
240 GB
370 GB
400 GB
400 GB
500 GB
800 GB
GB of VRAM at 4-bit quantization · open-weight models in the Convly database · Green = best value, orange = highest. Updated Sep 14, 2026.
🔍 Incorpore este gráfico no seu site (gratuito, com atribuição)
Obtenha os números antes de todos os outros
Um e-mail por semana: quais modelos de IA mudaram de preço, o que os novos benchmarks realmente mediram e qual GPU vale a pena comprar. Sem exageros, sem conteúdo supérfluo.
Grátis. Cancelamento em um clique. Nunca vendemos nem compartilhamos seu endereço.
