Monday, 3 August 2026 | Updating Daily AI insight, written for builders

Como verificar a VRAM no Windows, macOS e Linux

  • Windows: pressione Ctrl+Shift+EscDesempenhoGPU e leia Memória GPU dedicada. Em placas NVIDIA, execute nvidia-smi em um terminal para obter o valor exato, além do uso em tempo real.
  • macOS: Menu Apple → Informações sobre este Mac. Em chips Apple Silicon, o valor indicado como “Memória” corresponde à memória unificada compartilhada entre CPU e GPU — não há VRAM separada.
  • Linux: nvidia-smi (NVIDIA), rocm-smi --showmeminfo vram (AMD) ou glxinfo -B em drivers Mesa.
  • Apenas dedicada a VRAM determina qual modelo pode ser executado. Insira seu valor na calculadora de VRAM para descobrir quais modelos você consegue rodar.

Como verificar a VRAM, em uma linha por plataforma: no Windows, pressione Ctrl+Shift+Esc, abra a guia Desempenho , selecione sua GPU e leia Memória GPU dedicada; no macOS, abra o menu Apple → Informações sobre este Mac; no Linux, execute nvidia-smi para NVIDIA ou rocm-smi para AMD. Abaixo, cada método é explicado em detalhes — além do significado real desses números ao avaliar se uma LLM local caberá no seu sistema.

Como verificar a VRAM no Windows

Gerenciador de Tarefas — o método mais rápido

  1. Pressione Ctrl+Shift+Esc para abrir o Gerenciador de Tarefas.
  2. Vá para a guia Desempenho Desempenho Mais detalhes primeiro, caso esteja na visualização compacta do Windows 10).
  3. Clique em GPU 0 na barra lateral esquerda. Em laptops com GPU integrada e dedicada, também aparecerá GPU 1 — normalmente, a placa dedicada corresponde à GPU 1.
  4. Ler Memória GPU dedicada na área inferior direita. Esse valor representa sua VRAM física, exibida como usada / total (por exemplo, 2,1/24,0 GB).

Ignore a linha Memória da GPU : ela soma à memória dedicada a Memória compartilhada da GPU (memória RAM do sistema que a GPU pode usar temporariamente), fazendo com que uma placa de 8 GB pareça ter 24 GB. Mais detalhes sobre essa distinção abaixo.

dxdiag

Pressione Win+R, digite dxdiag, pressione Enter e, em seguida, abra a guia Exibição Tela Memória de exibição (VRAM) mostra o valor relatado pelo DirectX. Uma ressalva: dependendo do driver, o dxdiag às vezes inclui na leitura a memória compartilhada do sistema, resultando em um valor superior à VRAM real da placa. Considere o valor dedicado mostrado no Gerenciador de Tarefas ou o resultado de nvidia-smi como referência confiável.

Configurações → Tela → Exibição avançada

Abrir Configurações → Sistema → Tela → Exibição avançada, depois clique em Propriedades do adaptador de exibição para a tela 1. Na guia Adaptador, será listada a Memória de vídeo dedicada em MB. A redação exata varia ligeiramente entre o Windows 10 e o Windows 11, mas o caminho é o mesmo.

nvidia-smi — o valor exato

Se você possui uma GPU NVIDIA, o driver instala uma ferramenta de linha de comando que relata a memória em mebibytes. Abra o PowerShell ou o Prompt de Comando e execute:

nvidia-smi

A coluna Memória mostra o uso atual em relação ao total real — por exemplo, 3216 MiB / 24564 MiB em uma RTX 4090 — e a lista de processos na parte inferior indica quais programas estão utilizando memória. Para uma saída limpa e legível por máquina, use:

nvidia-smi --query-gpu=memory.total,memory.used,memory.free --format=csv

Se o comando não for encontrado, versões recentes dos drivers o colocam em C:\Windows\System32\nvidia-smi.exe; versões mais antigas dos drivers o instalavam em C:\Program Files\NVIDIA Corporation\NVSMI.

Como verificar a VRAM no macOS

Clique no menu Apple → Informações sobre este Mac.

  • Apple Silicon (M1 e posteriores): você verá o nome do chip e um valor como 16 GB, 36 GB ou 128 GB. Trata-se de Memória memória unificada memória unificada — um único pool compartilhado entre CPU e GPU. Não há um valor separado para VRAM porque não existe VRAM distinta.
  • Mac com processador Intel: placas de vídeo dedicadas são listadas com uma figura específica de VRAM, por exemplo, "Radeon Pro 5500M 8 GB".

Para mais detalhes, abra Sobre Este Mac → Mais Informações → Relatório do Sistema e selecione Gráficos/Displays, ou execute o seguinte no Terminal:

system_profiler SPDisplaysDataType

Em máquinas Intel, isso imprime uma linha chamada VRAM (Total) ; em equipamentos com Apple Silicon, é exibido o chip e a contagem de núcleos da GPU, em vez disso.

Por que a memória unificada altera os cálculos

No Apple Silicon, a GPU pode acessar a maior parte — mas não toda — a memória do sistema. O macOS reserva uma fatia para si mesmo, e, por padrão, o limite do conjunto de trabalho da GPU situa-se aproximadamente entre dois terços e três quartos da RAM total; o teto exato varia conforme a capacidade de RAM e a versão do macOS. Na prática, um MacBook Pro com 36 GB consegue carregar modelos que exigiriam uma GPU dedicada de 24 GB em um PC. As ferramentas de LLMs locais mostram diretamente esse limite utilizável — consulte o guia do LM Studio e o Guia do Ollama para saber como cada uma o exibe. A contrapartida é a largura de banda de memória, que varia amplamente entre os chips base, Pro, Max e Ultra, afetando diretamente a taxa de tokens por segundo.

Como verificar a VRAM no Linux

NVIDIA: nvidia-smi

Instalado com o driver proprietário. Execute nvidia-smi para obter um instantâneo, ou atualize a cada segundo enquanto um modelo é carregado:

nvidia-smi -l 1

AMD: rocm-smi ou sysfs

Com a pilha ROCm instalada:

rocm-smi --showmeminfo vram

Sem ROCm, o driver de kernel amdgpu expõe diretamente o valor total (em bytes; sua placa pode ser card1 — verifique com ls /sys/class/drm/):

cat /sys/class/drm/card0/device/mem_info_vram_total

Qualquer GPU: glxinfo

Instalar mesa-utils (Debian/Ubuntu) ou glx-utils (Fedora), depois execute:

glxinfo -B | grep -i memory

Os drivers Mesa imprimem uma linha semelhante a Memória de vídeo: 8192 MB; o rótulo exato varia conforme o driver.

lspci — identifica a placa, mas não a VRAM

lspci | grep -iE 'vga|3d'

sudo lspci -v -s <slot> mostra então as janelas de memória da placa, mas tenha cuidado: esses valores correspondem aos tamanhos das BARs PCI, que só coincidem com a VRAM total quando o recurso Resizable BAR está ativado. Use lspci para identificar exatamente o modelo da GPU e obtenha a capacidade de memória nas ferramentas acima ou na ficha técnica da placa.

Total vs. Livre vs. Compartilhada: o que esses números significam

NúmeroOnde você o vêO que ele significa para LLMs
VRAM dedicada (total)"Memória da GPU dedicada" no Gerenciador de Tarefas; nvidia-smi totalMemória física presente na placa. Trata-se do orçamento fixo para os pesos do modelo.
VRAM livrenvidia-smi memory.freeO que está disponível no momento. O ambiente de desktop, abas do navegador e outros aplicativos normalmente ocupam de 0,5 a 2 GB.
Memória compartilhada da GPU"Memória da GPU compartilhada" no Gerenciador de TarefasRAM do sistema (até cerca de metade dela) para a qual a GPU pode descarregar dados via PCIe. Muito mais lenta que a VRAM — não deve ser considerada ao dimensionar um modelo.
Memória unificada (Apple Silicon)"Memória" em Sobre Este MacUm único pool compartilhado entre CPU e GPU. A GPU pode utilizar a maior parte dele, comportando-se assim como um grande pool de VRAM com largura de banda dependente do chip.

Ao carregar um modelo, o que importa é a VRAM livre , não a total. Uma placa de 12 GB com 1,5 GB já consumidos pelo compositor e por um navegador dispõe de apenas cerca de 10,5 GB para operar — o suficiente para fazer com que um modelo que "deveria caber" falhe ao carregar. Na NVIDIA, a lista por processo na parte inferior da saída de nvidia-smi nvidia-smi informa exatamente quais processos devem ser encerrados.

Quanta VRAM você realmente precisa?

A pergunta por trás da pergunta. Na quantização de 4 bits — padrão para inferência local — os pesos do modelo ocupam aproximadamente 0,5–0,6 GB por bilhão de parâmetros, além de um cache KV que cresce com o comprimento do contexto. Orientação geral:

Tamanho do modeloPesos de 4 bits (aproximadamente)VRAM necessária para executar confortavelmente
7–8B4–5 GB6–8 GB
12–14B7–9 GB10–12 GB
24–32B13–19 GB16–24 GB
70B36–42 GB48 GB, ou dividido entre duas GPUs

A coluna ‘confortável’ assume um contexto moderado (4 mil–8 mil tokens); contextos muito longos acrescentam vários gigabytes ao cache KV. Para valores específicos por modelo, consulte a tabela de requisitos de VRAM para todos os principais LLMs ou navegue pelo banco de dados de modelos. Para sua combinação exata de modelo, quantização e comprimento de contexto, utilize a calculadora de VRAM. Se sua placa gráfica não for suficiente, o melhores GPUs para LLMs locais guia de atualizações classifica as opções por VRAM por dólar — e, se uma nova GPU não for economicamente viável, a calculadora de ponto de equilíbrio entre autohospedagem e API mostra quando pagar por token é mais barato.

Perguntas frequentes

Posso aumentar a VRAM na minha placa gráfica?

Não em uma GPU dedicada — os chips de memória estão soldados à placa, portanto a única forma de atualização é substituir a placa inteira. GPUs integradas são a exceção: algumas configurações de BIOS/UEFI permitem alterar a alocação de RAM (geralmente rotulada como ‘Tamanho do Buffer de Quadro UMA’ ou similar). A memória compartilhada da GPU no Windows não é VRAM adicional e não afeta a quantidade de modelo que pode ser executada em velocidade máxima.

Por que o Windows relata mais memória de GPU do que minha placa possui?

A linha ‘Memória da GPU’ no Gerenciador de Tarefas inclui tanto a VRAM dedicada quanto a memória do sistema compartilhada, e o dxdiag pode inflacionar esse valor da mesma forma. A VRAM física corresponde ao valor ‘Memória da GPU dedicada’, ou ao total exibido pelo comando nvidia-smi . Uma placa de 8 GB em um PC com 32 GB de RAM frequentemente mostra 24 GB de ‘Memória da GPU’ — mas apenas 8 GB correspondem à VRAM real.

A memória compartilhada da GPU ajuda a executar LLMs maiores?

Não de forma significativa. Ambientes de execução como llama.cpp e Ollama podem deliberadamente descarregar camadas para a memória do sistema, permitindo que um modelo excessivamente grande seja executado — porém a velocidade de geração normalmente cai de dezenas para apenas alguns poucos tokens por segundo. Dimensione seu modelo conforme a VRAM dedicada e trate o descarregamento para RAM como uma alternativa de contingência, não como estratégia principal.

Quanta VRAM um modelo de 7B ou 8B precisa?

Cerca de 4–5 GB para os pesos em 4 bits; assim, uma placa de 6–8 GB executa um desses modelos confortavelmente, com espaço para o contexto. Uma GPU de 8 GB lida bem com modelos de 7–8B; 12 GB permite acessar modelos de 12–14B. O guia melhores modelos locais para Ollama relaciona modelos populares às faixas de VRAM correspondentes.

A memória unificada em um Mac equivale à VRAM?

Para executar LLMs, é praticamente equivalente: a GPU acessa um único pool compartilhado, limitado pelo sistema a cerca de dois terços a três quartos da RAM total. Isso significa que um Mac com 32 GB consegue executar modelos que uma GPU de PC com 12 GB não suportaria. A diferença aparece na largura de banda de memória, que varia várias vezes entre os chips base e os modelos Max/Ultra, definindo seu limite máximo de tokens por segundo.

Como monitoro o uso de VRAM enquanto um modelo está em execução?

Em GPUs NVIDIA (qualquer sistema operacional), execute nvidia-smi -l 1 para atualizações a cada segundo. No Windows, o painel GPU do Gerenciador de Tarefas é atualizado em tempo real. Em Linux AMD, use watch -n 1 rocm-smi --showmeminfo vram; em um Mac, os pesos do modelo aparecem como memória de processo comum na guia Memória do Monitor de Atividade, já que o pool é unificado.

Escrito por Mustafa Ihsan

Mustafa Ihsan é fundador e editor da Convly.ai. Ele desenvolveu e mantém o banco de dados ao vivo de modelos de IA do site, seu índice de preço-desempenho e suas calculadoras gratuitas para requisitos de VRAM, custos de API e economia de autohospedagem. Escreve sobre precificação de modelos, resultados de benchmarks e o hardware necessário para executar modelos de IA localmente, preferindo consistentemente dados mensuráveis às declarações dos fornecedores.

Scroll to Top
Featured on There's An AI For That