- Windows: premi Ctrl+Shift+Esc → Prestazioni → GPU e leggi Memoria GPU dedicata. Sulle schede NVIDIA, esegui
nvidia-smiin un terminale per ottenere il valore esatto più l’utilizzo in tempo reale. - macOS: Menu Apple → Informazioni su questo Mac. Su Apple Silicon, il valore indicato come «Memoria» corrisponde alla memoria unificata condivisa tra CPU e GPU: non esiste una VRAM separata.
- Linux:
nvidia-smi(NVIDIA),rocm-smi --showmeminfo vram(AMD) oppureglxinfo -Bcon i driver Mesa. - Solo dedicata la VRAM determina quali modelli possono essere eseguiti. Inserisci il tuo valore nel Calcolatore VRAM per scoprire quali modelli puoi far girare.
Come verificare la VRAM, in una riga per piattaforma: su Windows, premi Ctrl+Shift+Esc, apri la scheda Prestazioni Seleziona la tua GPU e leggi Memoria GPU dedicata; su macOS, apri il menu Apple → Informazioni su questo Mac; su Linux, esegui nvidia-smi per NVIDIA o rocm-smi per AMD. Di seguito sono descritti nel dettaglio ciascun metodo — oltre al significato effettivo dei numeri quando devi decidere se una LLM locale rientrerà nei tuoi requisiti.
Come verificare la VRAM su Windows
Gestione attività — il metodo più rapido
- Premi Ctrl+Shift+Esc per aprire la Gestione attività.
- Vai alla scheda Prestazioni Prestazioni (su Windows 10, fai prima clic su Altri dettagli se visualizzi la vista compatta).
- Fai clic su GPU 0 nella barra laterale sinistra. I laptop dotati sia di GPU integrata che discreta mostreranno inoltre GPU 1 — la scheda discreta è solitamente GPU 1.
- Leggi Memoria GPU dedicata nell’angolo in basso a destra. Questo valore rappresenta la VRAM fisica, indicata come utilizzata/totale (ad esempio, 2,1/24,0 GB).
Ignora la voce Memoria GPU : essa somma alla memoria dedicata la Memoria GPU condivisa (RAM di sistema che la GPU può utilizzare temporaneamente), facendo apparire una scheda da 8 GB come se fosse da 24 GB. Approfondiremo questa distinzione più avanti.
dxdiag
Premi Win+R, digita dxdiag, premi Invio, quindi apri la scheda Visualizzazione Schermo. Il campo Memoria video (VRAM) mostra il valore riportato da DirectX. Attenzione: a seconda del driver, dxdiag talvolta include nella cifra anche la memoria di sistema condivisa, rendendo il valore superiore alla VRAM reale della scheda. Considera pertanto la cifra dedicata fornita dalla Gestione attività o nvidia-smi come fonte attendibile.
Impostazioni → Visualizzazione → Visualizzazione avanzata
Apri Impostazioni → Sistema → Visualizzazione → Visualizzazione avanzata, quindi fai clic su Proprietà adattatore video per Display 1. Nella scheda Adattatore viene indicata la Memoria video dedicata in MB. La formulazione esatta varia leggermente tra Windows 10 e Windows 11, ma il percorso rimane identico.
nvidia-smi — il valore esatto
Se disponi di una GPU NVIDIA, il driver installa uno strumento da riga di comando che riporta la memoria in mebibyte. Apri PowerShell o Prompt dei comandi ed esegui:
nvidia-smiLa colonna Memoria mostra l’utilizzo corrente rispetto al totale effettivo — ad esempio 3216 MiB / 24564 MiB su una RTX 4090 — mentre l’elenco dei processi in fondo indica quali programmi stanno occupando memoria. Per un output pulito e leggibile automaticamente:
nvidia-smi --query-gpu=memory.total,memory.used,memory.free --format=csvSe il comando non viene trovato, nelle versioni recenti dei driver è ubicato in C:\Windows\System32\nvidia-smi.exe; nelle versioni precedenti era invece in C:\Program Files\NVIDIA Corporation\NVSMI.
Come verificare la VRAM su macOS
Fai clic sul menu Apple → Informazioni su questo Mac.
- Apple Silicon (M1 e successivi): vedrai un nome del chip e un valore come 16 GB, 36 GB o 128 GB. Si tratta di Memoria memoria unificata memoria unificata — un singolo pool condiviso tra CPU e GPU. Non esiste un valore separato per la VRAM perché non esiste una VRAM fisicamente distinta.
- Mac Intel: Le GPU discrete sono elencate con una cifra specifica di VRAM dedicata, ad esempio «Radeon Pro 5500M 8 GB».
Per maggiori dettagli, apri Informazioni su questo Mac → Ulteriori informazioni → Rapporto sistema e seleziona Grafica/Display, oppure esegui questo comando nel Terminale:
system_profiler SPDisplaysDataTypeSui Mac Intel viene visualizzata una riga VRAM (Totale) ; sui Mac Apple Silicon viene invece indicato il chip e il numero di core della GPU.
Perché la memoria unificata modifica i calcoli
Su Apple Silicon la GPU può accedere alla maggior parte — ma non a tutta — la memoria di sistema. macOS ne riserva una porzione per sé stessa e, per impostazione predefinita, il limite del working-set della GPU corrisponde approssimativamente ai due terzi–tre quarti della RAM totale; il valore esatto varia in base alla capacità della RAM e alla versione di macOS. In pratica, un MacBook Pro da 36 GB può caricare modelli che su un PC richiederebbero una GPU discreta da 24 GB. Gli strumenti per LLM locali mostrano direttamente il limite utilizzabile — consulta la guida a LM Studio e il Guida a Ollama per sapere come ciascuno di essi lo riporta. Il compromesso è rappresentato dalla larghezza di banda della memoria, che varia notevolmente tra i chip base, Pro, Max e Ultra e influisce direttamente sui token al secondo.
Come verificare la VRAM su Linux
NVIDIA: nvidia-smi
Installato insieme al driver proprietario. Esegui nvidia-smi per ottenere un'istantanea, oppure aggiorna ogni secondo durante il caricamento di un modello:
nvidia-smi -l 1AMD: rocm-smi o sysfs
Con lo stack ROCm installato:
rocm-smi --showmeminfo vramSenza ROCm, il driver kernel amdgpu espone direttamente la memoria totale (in byte; la tua scheda potrebbe essere denominata card1 — verifica con ls /sys/class/drm/):
cat /sys/class/drm/card0/device/mem_info_vram_totalQualsiasi GPU: glxinfo
Installa mesa-utils (Debian/Ubuntu) o glx-utils (Fedora), quindi esegui:
glxinfo -B | grep -i memoryI driver Mesa stampano una riga simile a Memoria video: 8192 MB; l’etichetta esatta varia in base al driver.
lspci — identifica la scheda, non la VRAM
lspci | grep -iE 'vga|3d'sudo lspci -v -s <slot> mostra quindi le aperture di memoria della scheda, ma fai attenzione: si tratta delle dimensioni delle BAR PCI, che corrispondono alla VRAM totale solo se è abilitata la funzione Resizable BAR. Usa lspci per identificare esattamente il modello della GPU, quindi ottieni la cifra relativa alla memoria dagli strumenti sopra indicati o dal foglio tecnico della scheda.
Totale vs. Libera vs. Condivisa: cosa significano questi valori
| Valore | Dove lo trovi | Cosa significa per gli LLM |
|---|---|---|
| VRAM dedicata (totale) | Memoria GPU dedicata nel Task Manager; nvidia-smi totale | Memoria fisica presente sulla scheda. Costituisce il budget massimo fisso per i pesi del modello. |
| VRAM libera | nvidia-smi memory.free | Quanto è disponibile in questo momento. Desktop, schede del browser e altre applicazioni occupano tipicamente da 0,5 a 2 GB. |
| Memoria GPU condivisa | Memoria GPU condivisa nel Task Manager | RAM di sistema (fino a circa metà) nella quale la GPU può spillare dati tramite PCIe. È molto più lenta della VRAM — non considerarla mai nel calcolo della dimensione di un modello. |
| Memoria unificata (Apple Silicon) | «Memoria» nelle Informazioni su questo Mac | Un unico pool condiviso tra CPU e GPU. La GPU può utilizzarne la maggior parte, comportandosi quindi come un ampio pool di VRAM con larghezza di banda dipendente dal chip. |
Durante il caricamento di un modello, ciò che conta è la VRAM libera e non quella totale. Una scheda da 12 GB con già 1,5 GB occupati dal compositor e da un browser dispone di circa 10,5 GB utilizzabili — quantità insufficiente per caricare un modello che «dovrebbe entrare». Su NVIDIA, l’elenco per processo in fondo all’output di nvidia-smi indica esattamente quali processi chiudere.
Di quanta VRAM hai realmente bisogno?
La domanda dietro la domanda. Con la quantizzazione a 4 bit — lo standard per l'inferenza locale — i pesi del modello occupano circa 0,5–0,6 GB per miliardo di parametri, più una cache KV che cresce con la lunghezza del contesto. Guida approssimativa:
| Dimensione del modello | Pesi a 4 bit (approssimativi) | VRAM necessaria per un funzionamento agevole |
|---|---|---|
| 7–8 miliardi | 4–5 GB | 6–8 GB |
| 12–14 miliardi | 7–9 GB | 10–12 GB |
| 24–32 miliardi | 13–19 GB | 16–24 GB |
| 70 miliardi | 36–42 GB | 48 GB, oppure suddivisi su due GPU |
La colonna «agevole» presuppone un contesto moderato (4k–8k token); contesti molto lunghi aggiungono diversi gigabyte di cache KV in aggiunta. Per valori specifici per ciascun modello, consulta la tabella dei requisiti di VRAM per ogni LLM principale oppure esplora la database di modelli. Per calcolare con precisione i requisiti di VRAM in base al tuo modello specifico, alla quantizzazione e alla lunghezza del contesto, utilizza il Calcolatore VRAM. Se la tua scheda grafica non dispone di sufficiente VRAM, la le migliori GPU per LLM locali guida alle opzioni di aggiornamento ordinate per VRAM ottenuta a dollaro speso — e, qualora un nuovo GPU non risulti economicamente conveniente, la calcolatrice del punto di pareggio tra self-hosting e API indica quando pagare per token risulta più economico.
Domande frequenti
Posso aumentare la VRAM della mia scheda grafica?
No, sulle GPU discrete — i chip di memoria sono saldati direttamente sulla scheda, quindi l’unico modo per aggiornare la VRAM è sostituire l’intera scheda. Le GPU integrate fanno eccezione: alcune configurazioni BIOS/UEFI consentono di modificare l’allocazione della RAM (spesso indicata come «UMA Frame Buffer Size» o simile). La memoria GPU condivisa di Windows non costituisce VRAM aggiuntiva e non influenza la quantità di dati che possono essere elaborati alla massima velocità.
Perché Windows riporta più memoria GPU di quanta ne abbia effettivamente la mia scheda?
La voce «Memoria GPU» nel Task Manager indica la VRAM dedicata più la memoria di sistema condivisa; anche dxdiag può sovrastimare tale valore nello stesso modo. La VRAM fisica corrisponde invece al valore indicato come «Memoria GPU dedicata», oppure al totale visualizzato dal comando nvidia-smi . Una scheda da 8 GB su un PC con 32 GB di RAM mostrerà spesso 24 GB di «Memoria GPU» — ma solo 8 GB di questi sono veramente VRAM.
La memoria GPU condivisa aiuta a eseguire modelli LLM più grandi?
Non in modo significativo. Ambienti di esecuzione come llama.cpp e Ollama possono deliberatamente scaricare strati del modello nella RAM di sistema, permettendo così l’esecuzione di modelli troppo grandi — ma la velocità di generazione scende tipicamente da decine di token al secondo a pochi token al secondo. Dimensiona sempre il modello in base alla VRAM dedicata disponibile e considera lo scaricamento nella RAM come soluzione di emergenza, non come strategia principale.
Quanta VRAM serve per un modello da 7B o 8B?
Circa 4–5 GB per i pesi a 4 bit, quindi una scheda da 6–8 GB consente di eseguirne uno comodamente, lasciando spazio per il contesto. Una GPU da 8 GB gestisce bene i modelli da 7–8 miliardi; con 12 GB si possono affrontare modelli da 12–14 miliardi. La guida ai migliori modelli locali per Ollama associa i modelli più diffusi alle fasce di VRAM richieste.
La memoria unificata su Mac equivale alla VRAM?
Per l’esecuzione di LLM, sì, in pratica: la GPU accede a un unico pool di memoria, limitato dal sistema a circa due terzi o tre quarti della RAM totale. Ciò significa che un Mac da 32 GB può eseguire modelli che una GPU da 12 GB su PC non riuscirebbe a gestire. La differenza emerge nella larghezza di banda della memoria, che varia di diversi ordini di grandezza tra le versioni base e Max/Ultra dei chip, determinando il limite massimo di token al secondo.
Come monitoro l’utilizzo della VRAM mentre un modello è in esecuzione?
Su NVIDIA (su qualsiasi sistema operativo), esegui nvidia-smi -l 1 per un aggiornamento ogni secondo. Su Windows, il pannello GPU del Task Manager si aggiorna in tempo reale. Su AMD Linux, usa watch -n 1 rocm-smi --showmeminfo vram; su Mac, i pesi del modello compaiono come memoria di processo ordinaria nella scheda «Memoria» di Activity Monitor, dato che il pool è unificato.

