{"id":2083,"date":"2026-08-03T02:45:07","date_gmt":"2026-08-03T02:45:07","guid":{"rendered":"https:\/\/convly.ai\/?p=2083"},"modified":"2026-08-03T02:45:07","modified_gmt":"2026-08-03T02:45:07","slug":"how-to-check-vram-2026","status":"publish","type":"post","link":"https:\/\/convly.ai\/pt\/how-to-check-vram-2026\/","title":{"rendered":"Como verificar a VRAM no Windows, macOS e Linux"},"content":{"rendered":"<div class=\"convly-tldr\">\n<ul>\n<li><strong>Windows:<\/strong> pressione <strong>Ctrl+Shift+Esc<\/strong> \u2192 <strong>Desempenho<\/strong> \u2192 <strong>GPU<\/strong> e leia <em>Mem\u00f3ria GPU dedicada<\/em>. Em placas NVIDIA, execute <code>nvidia-smi<\/code> em um terminal para obter o valor exato, al\u00e9m do uso em tempo real.<\/li>\n<li><strong>macOS:<\/strong> Menu Apple \u2192 <strong>Informa\u00e7\u00f5es sobre este Mac<\/strong>. Em chips Apple Silicon, o valor indicado como &#8220;Mem\u00f3ria&#8221; corresponde \u00e0 mem\u00f3ria unificada compartilhada entre CPU e GPU \u2014 n\u00e3o h\u00e1 VRAM separada.<\/li>\n<li><strong>Linux:<\/strong> <code>nvidia-smi<\/code> (NVIDIA), <code>rocm-smi --showmeminfo vram<\/code> (AMD) ou <code>glxinfo -B<\/code> em drivers Mesa.<\/li>\n<li>Apenas <em>dedicada<\/em> a VRAM determina qual modelo pode ser executado. Insira seu valor na <a href=\"https:\/\/convly.ai\/pt\/llm-vram-calculator\/\">calculadora de VRAM<\/a> para descobrir quais modelos voc\u00ea consegue rodar.<\/li>\n<\/ul>\n<\/div>\n<p>Como verificar a VRAM, em uma linha por plataforma: no Windows, pressione <strong>Ctrl+Shift+Esc<\/strong>, abra a guia <strong>Desempenho<\/strong> , selecione sua GPU e leia <em>Mem\u00f3ria GPU dedicada<\/em>; no macOS, abra o menu Apple \u2192 <strong>Informa\u00e7\u00f5es sobre este Mac<\/strong>; no Linux, execute <code>nvidia-smi<\/code> para NVIDIA ou <code>rocm-smi<\/code> for AMD. Below is each method in detail \u2014 plus what the numbers actually mean when you are deciding whether a local LLM will fit.<\/p>\n<div id=\"ez-toc-container\" class=\"ez-toc-v2_0_85 counter-flat ez-toc-counter ez-toc-container-direction\">\n<label for=\"ez-toc-cssicon-toggle-item-6a704db9da8fb\" class=\"ez-toc-cssicon-toggle-label\"><span class=\"\"><span class=\"eztoc-hide\" style=\"display:none;\">Alternar<\/span><span class=\"ez-toc-icon-toggle-span\"><svg style=\"fill: #000000;color:#000000\" xmlns=\"http:\/\/www.w3.org\/2000\/svg\" class=\"list-377408\" width=\"20px\" height=\"20px\" viewbox=\"0 0 24 24\" fill=\"none\"><path d=\"M6 6H4v2h2V6zm14 0H8v2h12V6zM4 11h2v2H4v-2zm16 0H8v2h12v-2zM4 16h2v2H4v-2zm16 0H8v2h12v-2z\" fill=\"currentColor\"><\/path><\/svg><svg style=\"fill: #000000;color:#000000\" class=\"arrow-unsorted-368013\" xmlns=\"http:\/\/www.w3.org\/2000\/svg\" width=\"10px\" height=\"10px\" viewbox=\"0 0 24 24\" version=\"1.2\" baseprofile=\"tiny\"><path d=\"M18.2 9.3l-6.2-6.3-6.2 6.3c-.2.2-.3.4-.3.7s.1.5.3.7c.2.2.4.3.7.3h11c.3 0 .5-.1.7-.3.2-.2.3-.5.3-.7s-.1-.5-.3-.7zM5.8 14.7l6.2 6.3 6.2-6.3c.2-.2.3-.5.3-.7s-.1-.5-.3-.7c-.2-.2-.4-.3-.7-.3h-11c-.3 0-.5.1-.7.3-.2.2-.3.5-.3.7s.1.5.3.7z\"\/><\/svg><\/span><\/span><\/label><input type=\"checkbox\"  id=\"ez-toc-cssicon-toggle-item-6a704db9da8fb\"  aria-label=\"Alternar\" \/><nav><ul class='ez-toc-list ez-toc-list-level-1' ><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-1\" href=\"https:\/\/convly.ai\/pt\/how-to-check-vram-2026\/#How_to_Check_VRAM_on_Windows\" >Como verificar a VRAM no Windows<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-2\" href=\"https:\/\/convly.ai\/pt\/how-to-check-vram-2026\/#How_to_Check_VRAM_on_macOS\" >Como verificar a VRAM no macOS<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-3\" href=\"https:\/\/convly.ai\/pt\/how-to-check-vram-2026\/#How_to_Check_VRAM_on_Linux\" >Como verificar a VRAM no Linux<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-4\" href=\"https:\/\/convly.ai\/pt\/how-to-check-vram-2026\/#Total_vs_Free_vs_Shared_What_the_Numbers_Mean\" >Total vs. Livre vs. Compartilhada: o que esses n\u00fameros significam<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-5\" href=\"https:\/\/convly.ai\/pt\/how-to-check-vram-2026\/#How_Much_VRAM_Do_You_Actually_Need\" >Quanta VRAM voc\u00ea realmente precisa?<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-6\" href=\"https:\/\/convly.ai\/pt\/how-to-check-vram-2026\/#Frequently_Asked_Questions\" >Perguntas frequentes<\/a><\/li><\/ul><\/nav><\/div>\n<h2><span class=\"ez-toc-section\" id=\"How_to_Check_VRAM_on_Windows\"><\/span>Como verificar a VRAM no Windows<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<h3>Gerenciador de Tarefas \u2014 o m\u00e9todo mais r\u00e1pido<\/h3>\n<ol>\n<li>Pressione <strong>Ctrl+Shift+Esc<\/strong> para abrir o Gerenciador de Tarefas.<\/li>\n<li>V\u00e1 para a guia <strong>Desempenho<\/strong> Desempenho <em>Mais detalhes<\/em> primeiro, caso esteja na visualiza\u00e7\u00e3o compacta do Windows 10).<\/li>\n<li>Clique em <strong>GPU 0<\/strong> na barra lateral esquerda. Em laptops com GPU integrada e dedicada, tamb\u00e9m aparecer\u00e1 <strong>GPU 1<\/strong> \u2014 normalmente, a placa dedicada corresponde \u00e0 GPU 1.<\/li>\n<li>Ler <strong>Mem\u00f3ria GPU dedicada<\/strong> na \u00e1rea inferior direita. Esse valor representa sua VRAM f\u00edsica, exibida como usada \/ total (por exemplo, 2,1\/24,0 GB).<\/li>\n<\/ol>\n<p>Ignore a linha <em>Mem\u00f3ria da GPU<\/em> : ela soma \u00e0 mem\u00f3ria dedicada a <em>Mem\u00f3ria compartilhada da GPU<\/em> (mem\u00f3ria RAM do sistema que a GPU pode usar temporariamente), fazendo com que uma placa de 8 GB pare\u00e7a ter 24 GB. Mais detalhes sobre essa distin\u00e7\u00e3o abaixo.<\/p>\n<h3>dxdiag<\/h3>\n<p>Pressione <strong>Win+R<\/strong>, digite <code>dxdiag<\/code>, pressione Enter e, em seguida, abra a guia <strong>Exibi\u00e7\u00e3o<\/strong> Tela <em>Mem\u00f3ria de exibi\u00e7\u00e3o (VRAM)<\/em> mostra o valor relatado pelo DirectX. Uma ressalva: dependendo do driver, o dxdiag \u00e0s vezes inclui na leitura a mem\u00f3ria compartilhada do sistema, resultando em um valor superior \u00e0 VRAM real da placa. Considere o valor dedicado mostrado no Gerenciador de Tarefas ou o resultado de <code>nvidia-smi<\/code> como refer\u00eancia confi\u00e1vel.<\/p>\n<h3>Configura\u00e7\u00f5es \u2192 Tela \u2192 Exibi\u00e7\u00e3o avan\u00e7ada<\/h3>\n<p>Abrir <strong>Configura\u00e7\u00f5es \u2192 Sistema \u2192 Tela \u2192 Exibi\u00e7\u00e3o avan\u00e7ada<\/strong>, depois clique em <strong>Propriedades do adaptador de exibi\u00e7\u00e3o para a tela 1<\/strong>. Na guia Adaptador, ser\u00e1 listada a <em>Mem\u00f3ria de v\u00eddeo dedicada<\/em> em MB. A reda\u00e7\u00e3o exata varia ligeiramente entre o Windows 10 e o Windows 11, mas o caminho \u00e9 o mesmo.<\/p>\n<h3>nvidia-smi \u2014 o valor exato<\/h3>\n<p>Se voc\u00ea possui uma GPU NVIDIA, o driver instala uma ferramenta de linha de comando que relata a mem\u00f3ria em mebibytes. Abra o PowerShell ou o Prompt de Comando e execute:<\/p>\n<pre><code>nvidia-smi<\/code><\/pre>\n<p>A coluna Mem\u00f3ria mostra o uso atual em rela\u00e7\u00e3o ao total real \u2014 por exemplo, <code>3216 MiB \/ 24564 MiB<\/code> em uma RTX 4090 \u2014 e a lista de processos na parte inferior indica quais programas est\u00e3o utilizando mem\u00f3ria. Para uma sa\u00edda limpa e leg\u00edvel por m\u00e1quina, use:<\/p>\n<pre><code>nvidia-smi --query-gpu=memory.total,memory.used,memory.free --format=csv<\/code><\/pre>\n<p>Se o comando n\u00e3o for encontrado, vers\u00f5es recentes dos drivers o colocam em <code>C:\\Windows\\System32\\nvidia-smi.exe<\/code>; vers\u00f5es mais antigas dos drivers o instalavam em <code>C:\\Program Files\\NVIDIA Corporation\\NVSMI<\/code>.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"How_to_Check_VRAM_on_macOS\"><\/span>Como verificar a VRAM no macOS<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Clique no menu Apple \u2192 <strong>Informa\u00e7\u00f5es sobre este Mac<\/strong>.<\/p>\n<ul>\n<li><strong>Apple Silicon (M1 e posteriores):<\/strong> voc\u00ea ver\u00e1 o nome do chip e um valor como 16 GB, 36 GB ou 128 GB. Trata-se de <em>Mem\u00f3ria<\/em> mem\u00f3ria unificada <strong>mem\u00f3ria unificada<\/strong> \u2014 um \u00fanico pool compartilhado entre CPU e GPU. N\u00e3o h\u00e1 um valor separado para VRAM porque n\u00e3o existe VRAM distinta.<\/li>\n<li><strong>Mac com processador Intel:<\/strong> placas de v\u00eddeo dedicadas s\u00e3o listadas com uma figura espec\u00edfica de VRAM, por exemplo, \"Radeon Pro 5500M 8 GB\".<\/li>\n<\/ul>\n<p>Para mais detalhes, abra <strong>Sobre Este Mac \u2192 Mais Informa\u00e7\u00f5es \u2192 Relat\u00f3rio do Sistema<\/strong> e selecione <strong>Gr\u00e1ficos\/Displays<\/strong>, ou execute o seguinte no Terminal:<\/p>\n<pre><code>system_profiler SPDisplaysDataType<\/code><\/pre>\n<p>Em m\u00e1quinas Intel, isso imprime uma linha chamada <code>VRAM (Total)<\/code> ; em equipamentos com Apple Silicon, \u00e9 exibido o chip e a contagem de n\u00facleos da GPU, em vez disso.<\/p>\n<h3>Por que a mem\u00f3ria unificada altera os c\u00e1lculos<\/h3>\n<p>No Apple Silicon, a GPU pode acessar a maior parte \u2014 mas n\u00e3o toda \u2014 a mem\u00f3ria do sistema. O macOS reserva uma fatia para si mesmo, e, por padr\u00e3o, o limite do conjunto de trabalho da GPU situa-se aproximadamente entre dois ter\u00e7os e tr\u00eas quartos da RAM total; o teto exato varia conforme a capacidade de RAM e a vers\u00e3o do macOS. Na pr\u00e1tica, um MacBook Pro com 36 GB consegue carregar modelos que exigiriam uma GPU dedicada de 24 GB em um PC. As ferramentas de LLMs locais mostram diretamente esse limite utiliz\u00e1vel \u2014 consulte o <a href=\"https:\/\/convly.ai\/pt\/lm-studio-complete-guide-2026\/\">guia do LM Studio<\/a> e o <a href=\"https:\/\/convly.ai\/pt\/what-is-ollama-complete-guide-2026\/\">Guia do Ollama<\/a> para saber como cada uma o exibe. A contrapartida \u00e9 a largura de banda de mem\u00f3ria, que varia amplamente entre os chips base, Pro, Max e Ultra, afetando diretamente a taxa de tokens por segundo.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"How_to_Check_VRAM_on_Linux\"><\/span>Como verificar a VRAM no Linux<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<h3>NVIDIA: nvidia-smi<\/h3>\n<p>Instalado com o driver propriet\u00e1rio. Execute <code>nvidia-smi<\/code> para obter um instant\u00e2neo, ou atualize a cada segundo enquanto um modelo \u00e9 carregado:<\/p>\n<pre><code>nvidia-smi -l 1<\/code><\/pre>\n<h3>AMD: rocm-smi ou sysfs<\/h3>\n<p>Com a pilha ROCm instalada:<\/p>\n<pre><code>rocm-smi --showmeminfo vram<\/code><\/pre>\n<p>Sem ROCm, o driver de kernel <code>amdgpu<\/code> exp\u00f5e diretamente o valor total (em bytes; sua placa pode ser <code>card1<\/code> \u2014 verifique com <code>ls \/sys\/class\/drm\/<\/code>):<\/p>\n<pre><code>cat \/sys\/class\/drm\/card0\/device\/mem_info_vram_total<\/code><\/pre>\n<h3>Qualquer GPU: glxinfo<\/h3>\n<p>Instalar <code>mesa-utils<\/code> (Debian\/Ubuntu) ou <code>glx-utils<\/code> (Fedora), depois execute:<\/p>\n<pre><code>glxinfo -B | grep -i memory<\/code><\/pre>\n<p>Os drivers Mesa imprimem uma linha semelhante a <code>Mem\u00f3ria de v\u00eddeo: 8192 MB<\/code>; o r\u00f3tulo exato varia conforme o driver.<\/p>\n<h3>lspci \u2014 identifica a placa, mas n\u00e3o a VRAM<\/h3>\n<pre><code>lspci | grep -iE 'vga|3d'<\/code><\/pre>\n<p><code>sudo lspci -v -s &lt;slot&gt;<\/code> mostra ent\u00e3o as janelas de mem\u00f3ria da placa, mas tenha cuidado: esses valores correspondem aos tamanhos das BARs PCI, que s\u00f3 coincidem com a VRAM total quando o recurso Resizable BAR est\u00e1 ativado. Use <code>lspci<\/code> para identificar exatamente o modelo da GPU e obtenha a capacidade de mem\u00f3ria nas ferramentas acima ou na ficha t\u00e9cnica da placa.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Total_vs_Free_vs_Shared_What_the_Numbers_Mean\"><\/span>Total vs. Livre vs. Compartilhada: o que esses n\u00fameros significam<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<table>\n<thead>\n<tr>\n<th>N\u00famero<\/th>\n<th>Onde voc\u00ea o v\u00ea<\/th>\n<th>O que ele significa para LLMs<\/th>\n<\/tr>\n<\/thead>\n<tbody>\n<tr>\n<td>VRAM dedicada (total)<\/td>\n<td>\"Mem\u00f3ria da GPU dedicada\" no Gerenciador de Tarefas; <code>nvidia-smi<\/code> total<\/td>\n<td>Mem\u00f3ria f\u00edsica presente na placa. Trata-se do or\u00e7amento fixo para os pesos do modelo.<\/td>\n<\/tr>\n<tr>\n<td>VRAM livre<\/td>\n<td><code>nvidia-smi<\/code> <code>memory.free<\/code><\/td>\n<td>O que est\u00e1 dispon\u00edvel no momento. O ambiente de desktop, abas do navegador e outros aplicativos normalmente ocupam de 0,5 a 2 GB.<\/td>\n<\/tr>\n<tr>\n<td>Mem\u00f3ria compartilhada da GPU<\/td>\n<td>\"Mem\u00f3ria da GPU compartilhada\" no Gerenciador de Tarefas<\/td>\n<td>RAM do sistema (at\u00e9 cerca de metade dela) para a qual a GPU pode descarregar dados via PCIe. Muito mais lenta que a VRAM \u2014 n\u00e3o deve ser considerada ao dimensionar um modelo.<\/td>\n<\/tr>\n<tr>\n<td>Mem\u00f3ria unificada (Apple Silicon)<\/td>\n<td>\"Mem\u00f3ria\" em Sobre Este Mac<\/td>\n<td>Um \u00fanico pool compartilhado entre CPU e GPU. A GPU pode utilizar a maior parte dele, comportando-se assim como um grande pool de VRAM com largura de banda dependente do chip.<\/td>\n<\/tr>\n<\/tbody>\n<\/table>\n<p>Ao carregar um modelo, o que importa \u00e9 a VRAM <em>livre<\/em> , n\u00e3o a total. Uma placa de 12 GB com 1,5 GB j\u00e1 consumidos pelo compositor e por um navegador disp\u00f5e de apenas cerca de 10,5 GB para operar \u2014 o suficiente para fazer com que um modelo que \"deveria caber\" falhe ao carregar. Na NVIDIA, a lista por processo na parte inferior da sa\u00edda de <code>nvidia-smi<\/code> nvidia-smi informa exatamente quais processos devem ser encerrados.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"How_Much_VRAM_Do_You_Actually_Need\"><\/span>Quanta VRAM voc\u00ea realmente precisa?<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>A pergunta por tr\u00e1s da pergunta. Na quantiza\u00e7\u00e3o de 4 bits \u2014 padr\u00e3o para infer\u00eancia local \u2014 os pesos do modelo ocupam aproximadamente 0,5\u20130,6 GB por bilh\u00e3o de par\u00e2metros, al\u00e9m de um cache KV que cresce com o comprimento do contexto. Orienta\u00e7\u00e3o geral:<\/p>\n<table>\n<thead>\n<tr>\n<th>Tamanho do modelo<\/th>\n<th>Pesos de 4 bits (aproximadamente)<\/th>\n<th>VRAM necess\u00e1ria para executar confortavelmente<\/th>\n<\/tr>\n<\/thead>\n<tbody>\n<tr>\n<td>7\u20138B<\/td>\n<td>4\u20135 GB<\/td>\n<td>6\u20138 GB<\/td>\n<\/tr>\n<tr>\n<td>12\u201314B<\/td>\n<td>7\u20139 GB<\/td>\n<td>10\u201312 GB<\/td>\n<\/tr>\n<tr>\n<td>24\u201332B<\/td>\n<td>13\u201319 GB<\/td>\n<td>16\u201324 GB<\/td>\n<\/tr>\n<tr>\n<td>70B<\/td>\n<td>36\u201342 GB<\/td>\n<td>48 GB, ou dividido entre duas GPUs<\/td>\n<\/tr>\n<\/tbody>\n<\/table>\n<p>A coluna \u2018confort\u00e1vel\u2019 assume um contexto moderado (4 mil\u20138 mil tokens); contextos muito longos acrescentam v\u00e1rios gigabytes ao cache KV. Para valores espec\u00edficos por modelo, consulte a <a href=\"https:\/\/convly.ai\/pt\/vram-requirements-every-major-llm-2026\/\">tabela de requisitos de VRAM para todos os principais LLMs<\/a> ou navegue pelo <a href=\"https:\/\/convly.ai\/pt\/models\/\">banco de dados de modelos<\/a>. Para sua combina\u00e7\u00e3o exata de modelo, quantiza\u00e7\u00e3o e comprimento de contexto, utilize a <a href=\"https:\/\/convly.ai\/pt\/llm-vram-calculator\/\">calculadora de VRAM<\/a>. Se sua placa gr\u00e1fica n\u00e3o for suficiente, o <a href=\"https:\/\/convly.ai\/pt\/best-gpus-for-local-llms-2026\/\">melhores GPUs para LLMs locais<\/a> guia de atualiza\u00e7\u00f5es classifica as op\u00e7\u00f5es por VRAM por d\u00f3lar \u2014 e, se uma nova GPU n\u00e3o for economicamente vi\u00e1vel, a <a href=\"https:\/\/convly.ai\/pt\/self-hosting-vs-api-calculator\/\">calculadora de ponto de equil\u00edbrio entre autohospedagem e API<\/a> mostra quando pagar por token \u00e9 mais barato.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Frequently_Asked_Questions\"><\/span>Perguntas frequentes<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<h3>Posso aumentar a VRAM na minha placa gr\u00e1fica?<\/h3>\n<p>N\u00e3o em uma GPU dedicada \u2014 os chips de mem\u00f3ria est\u00e3o soldados \u00e0 placa, portanto a \u00fanica forma de atualiza\u00e7\u00e3o \u00e9 substituir a placa inteira. GPUs integradas s\u00e3o a exce\u00e7\u00e3o: algumas configura\u00e7\u00f5es de BIOS\/UEFI permitem alterar a aloca\u00e7\u00e3o de RAM (geralmente rotulada como \u2018Tamanho do Buffer de Quadro UMA\u2019 ou similar). A mem\u00f3ria compartilhada da GPU no Windows n\u00e3o \u00e9 VRAM adicional e n\u00e3o afeta a quantidade de modelo que pode ser executada em velocidade m\u00e1xima.<\/p>\n<h3>Por que o Windows relata mais mem\u00f3ria de GPU do que minha placa possui?<\/h3>\n<p>A linha \u2018Mem\u00f3ria da GPU\u2019 no Gerenciador de Tarefas inclui tanto a VRAM dedicada quanto a mem\u00f3ria do sistema compartilhada, e o dxdiag pode inflacionar esse valor da mesma forma. A VRAM f\u00edsica corresponde ao valor \u2018Mem\u00f3ria da GPU dedicada\u2019, ou ao total exibido pelo comando <code>nvidia-smi<\/code> . Uma placa de 8 GB em um PC com 32 GB de RAM frequentemente mostra 24 GB de \u2018Mem\u00f3ria da GPU\u2019 \u2014 mas apenas 8 GB correspondem \u00e0 VRAM real.<\/p>\n<h3>A mem\u00f3ria compartilhada da GPU ajuda a executar LLMs maiores?<\/h3>\n<p>N\u00e3o de forma significativa. Ambientes de execu\u00e7\u00e3o como llama.cpp e Ollama podem deliberadamente descarregar camadas para a mem\u00f3ria do sistema, permitindo que um modelo excessivamente grande seja executado \u2014 por\u00e9m a velocidade de gera\u00e7\u00e3o normalmente cai de dezenas para apenas alguns poucos tokens por segundo. Dimensione seu modelo conforme a VRAM dedicada e trate o descarregamento para RAM como uma alternativa de conting\u00eancia, n\u00e3o como estrat\u00e9gia principal.<\/p>\n<h3>Quanta VRAM um modelo de 7B ou 8B precisa?<\/h3>\n<p>Cerca de 4\u20135 GB para os pesos em 4 bits; assim, uma placa de 6\u20138 GB executa um desses modelos confortavelmente, com espa\u00e7o para o contexto. Uma GPU de 8 GB lida bem com modelos de 7\u20138B; 12 GB permite acessar modelos de 12\u201314B. O guia <a href=\"https:\/\/convly.ai\/pt\/best-local-llms-to-run-on-ollama-2026\/\">melhores modelos locais para Ollama<\/a> relaciona modelos populares \u00e0s faixas de VRAM correspondentes.<\/p>\n<h3>A mem\u00f3ria unificada em um Mac equivale \u00e0 VRAM?<\/h3>\n<p>Para executar LLMs, \u00e9 praticamente equivalente: a GPU acessa um \u00fanico pool compartilhado, limitado pelo sistema a cerca de dois ter\u00e7os a tr\u00eas quartos da RAM total. Isso significa que um Mac com 32 GB consegue executar modelos que uma GPU de PC com 12 GB n\u00e3o suportaria. A diferen\u00e7a aparece na largura de banda de mem\u00f3ria, que varia v\u00e1rias vezes entre os chips base e os modelos Max\/Ultra, definindo seu limite m\u00e1ximo de tokens por segundo.<\/p>\n<h3>Como monitoro o uso de VRAM enquanto um modelo est\u00e1 em execu\u00e7\u00e3o?<\/h3>\n<p>Em GPUs NVIDIA (qualquer sistema operacional), execute <code>nvidia-smi -l 1<\/code> para atualiza\u00e7\u00f5es a cada segundo. No Windows, o painel GPU do Gerenciador de Tarefas \u00e9 atualizado em tempo real. Em Linux AMD, use <code>watch -n 1 rocm-smi --showmeminfo vram<\/code>; em um Mac, os pesos do modelo aparecem como mem\u00f3ria de processo comum na guia Mem\u00f3ria do Monitor de Atividade, j\u00e1 que o pool \u00e9 unificado.<\/p>","protected":false},"excerpt":{"rendered":"<p>Windows: press Ctrl+Shift+Esc \u2192 Performance \u2192 GPU and read Dedicated GPU memory. On NVIDIA cards, run nvidia-smi in a terminal [&hellip;]<\/p>\n","protected":false},"author":1,"featured_media":2084,"comment_status":"closed","ping_status":"closed","sticky":false,"template":"","format":"standard","meta":{"site-sidebar-layout":"default","site-content-layout":"","ast-site-content-layout":"default","site-content-style":"default","site-sidebar-style":"default","ast-global-header-display":"","ast-banner-title-visibility":"","ast-main-header-display":"","ast-hfb-above-header-display":"","ast-hfb-below-header-display":"","ast-hfb-mobile-header-display":"","site-post-title":"","ast-breadcrumbs-content":"","ast-featured-img":"","footer-sml-layout":"","ast-disable-related-posts":"","theme-transparent-header-meta":"","adv-header-id-meta":"","stick-header-meta":"","header-above-stick-meta":"","header-main-stick-meta":"","header-below-stick-meta":"","astra-migrate-meta-layouts":"default","ast-page-background-enabled":"default","ast-page-background-meta":{"desktop":{"background-color":"var(--ast-global-color-5)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"tablet":{"background-color":"","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"mobile":{"background-color":"","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""}},"ast-content-background-meta":{"desktop":{"background-color":"var(--ast-global-color-4)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"tablet":{"background-color":"var(--ast-global-color-4)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"mobile":{"background-color":"var(--ast-global-color-4)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""}},"footnotes":""},"categories":[7],"tags":[],"class_list":["post-2083","post","type-post","status-publish","format-standard","has-post-thumbnail","hentry","category-ai-news"],"_links":{"self":[{"href":"https:\/\/convly.ai\/pt\/wp-json\/wp\/v2\/posts\/2083","targetHints":{"allow":["GET"]}}],"collection":[{"href":"https:\/\/convly.ai\/pt\/wp-json\/wp\/v2\/posts"}],"about":[{"href":"https:\/\/convly.ai\/pt\/wp-json\/wp\/v2\/types\/post"}],"author":[{"embeddable":true,"href":"https:\/\/convly.ai\/pt\/wp-json\/wp\/v2\/users\/1"}],"replies":[{"embeddable":true,"href":"https:\/\/convly.ai\/pt\/wp-json\/wp\/v2\/comments?post=2083"}],"version-history":[{"count":1,"href":"https:\/\/convly.ai\/pt\/wp-json\/wp\/v2\/posts\/2083\/revisions"}],"predecessor-version":[{"id":2085,"href":"https:\/\/convly.ai\/pt\/wp-json\/wp\/v2\/posts\/2083\/revisions\/2085"}],"wp:featuredmedia":[{"embeddable":true,"href":"https:\/\/convly.ai\/pt\/wp-json\/wp\/v2\/media\/2084"}],"wp:attachment":[{"href":"https:\/\/convly.ai\/pt\/wp-json\/wp\/v2\/media?parent=2083"}],"wp:term":[{"taxonomy":"category","embeddable":true,"href":"https:\/\/convly.ai\/pt\/wp-json\/wp\/v2\/categories?post=2083"},{"taxonomy":"post_tag","embeddable":true,"href":"https:\/\/convly.ai\/pt\/wp-json\/wp\/v2\/tags?post=2083"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}