{"id":2103,"date":"2026-08-03T20:03:24","date_gmt":"2026-08-03T20:03:24","guid":{"rendered":"https:\/\/convly.ai\/?p=2103"},"modified":"2026-08-03T20:03:24","modified_gmt":"2026-08-03T20:03:24","slug":"what-is-gguf-format-explained","status":"publish","type":"post","link":"https:\/\/convly.ai\/it\/what-is-gguf-format-explained\/","title":{"rendered":"Cos'\u00e8 GGUF? Il formato di file per modelli LLM alla base di Ollama e llama.cpp, spiegato"},"content":{"rendered":"<div class=\"convly-tldr\">\n<ul>\n<li><strong>GGUF \u00e8 il formato di file utilizzato per eseguire modelli LLM in locale.<\/strong> It packs a model&#8217;s weights, tokenizer and configuration into a single binary file that llama.cpp, Ollama, LM Studio and most other local-LLM tools load directly.<\/li>\n<li><strong>Ha sostituito GGML nell'agosto 2023<\/strong> perch\u00e9 i file GGML si rompevano ogni volta che il formato veniva modificato. GGUF \u00e8 versionato ed estensibile, quindi i vecchi file continuano a funzionare.<\/li>\n<li><strong>Il suffisso indica il livello di quantizzazione.<\/strong> Q4_K_M (~4,9 GB per un modello da 8 miliardi di parametri) \u00e8 il valore predefinito standard per qualit\u00e0\/dimensione; Q8_0 \u00e8 quasi senza perdite a ~8,5 GB; F16 \u00e8 non quantizzato.<\/li>\n<li><strong>Regola empirica:<\/strong> scegli la quantizzazione pi\u00f9 grande il cui file rientri nella tua VRAM lasciando 1\u20132 GB liberi per il contesto.<\/li>\n<\/ul>\n<\/div>\n<p>GGUF (generalmente espanso come GPT-Generated Unified Format) \u00e8 un formato di file binario per memorizzare modelli linguistici di grandi dimensioni: i pesi, il tokenizer e tutti i metadati di configurazione in un unico file autosufficiente. \u00c8 il formato nativo di <strong>llama.cpp<\/strong>, ed \u00e8 ci\u00f2 che <strong>Ollama<\/strong>, <strong>LM Studio<\/strong>, KoboldCpp, Jan e la maggior parte delle altre applicazioni per LLM locali eseguono effettivamente. Se hai mai scaricato un file con estensione <code>.gguf<\/code>, oppure scaricato un modello con <code>ollama run<\/code>, stavi utilizzando questo formato.<\/p>\n<div id=\"ez-toc-container\" class=\"ez-toc-v2_0_85 counter-flat ez-toc-counter ez-toc-container-direction\">\n<label for=\"ez-toc-cssicon-toggle-item-6a712c26f26d5\" class=\"ez-toc-cssicon-toggle-label\"><span class=\"\"><span class=\"eztoc-hide\" style=\"display:none;\">Attiva\/Disattiva<\/span><span class=\"ez-toc-icon-toggle-span\"><svg style=\"fill: #000000;color:#000000\" xmlns=\"http:\/\/www.w3.org\/2000\/svg\" class=\"list-377408\" width=\"20px\" height=\"20px\" viewbox=\"0 0 24 24\" fill=\"none\"><path d=\"M6 6H4v2h2V6zm14 0H8v2h12V6zM4 11h2v2H4v-2zm16 0H8v2h12v-2zM4 16h2v2H4v-2zm16 0H8v2h12v-2z\" fill=\"currentColor\"><\/path><\/svg><svg style=\"fill: #000000;color:#000000\" class=\"arrow-unsorted-368013\" xmlns=\"http:\/\/www.w3.org\/2000\/svg\" width=\"10px\" height=\"10px\" viewbox=\"0 0 24 24\" version=\"1.2\" baseprofile=\"tiny\"><path d=\"M18.2 9.3l-6.2-6.3-6.2 6.3c-.2.2-.3.4-.3.7s.1.5.3.7c.2.2.4.3.7.3h11c.3 0 .5-.1.7-.3.2-.2.3-.5.3-.7s-.1-.5-.3-.7zM5.8 14.7l6.2 6.3 6.2-6.3c.2-.2.3-.5.3-.7s-.1-.5-.3-.7c-.2-.2-.4-.3-.7-.3h-11c-.3 0-.5.1-.7.3-.2.2-.3.5-.3.7s.1.5.3.7z\"\/><\/svg><\/span><\/span><\/label><input type=\"checkbox\"  id=\"ez-toc-cssicon-toggle-item-6a712c26f26d5\"  aria-label=\"Attiva\/Disattiva\" \/><nav><ul class='ez-toc-list ez-toc-list-level-1' ><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-1\" href=\"https:\/\/convly.ai\/it\/what-is-gguf-format-explained\/#What_a_GGUF_file_actually_contains\" >Cosa contiene effettivamente un file GGUF<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-2\" href=\"https:\/\/convly.ai\/it\/what-is-gguf-format-explained\/#Why_GGUF_replaced_GGML\" >Perch\u00e9 GGUF ha sostituito GGML<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-3\" href=\"https:\/\/convly.ai\/it\/what-is-gguf-format-explained\/#How_to_read_the_quantisation_suffixes\" >Come interpretare i suffissi della quantizzazione<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-4\" href=\"https:\/\/convly.ai\/it\/what-is-gguf-format-explained\/#Picking_a_quantisation_for_your_VRAM\" >Scelta della quantizzazione in base alla tua VRAM<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-5\" href=\"https:\/\/convly.ai\/it\/what-is-gguf-format-explained\/#GGUF_vs_safetensors\" >GGUF vs safetensors<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-6\" href=\"https:\/\/convly.ai\/it\/what-is-gguf-format-explained\/#Where_GGUF_files_come_from\" >Origine dei file GGUF<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-7\" href=\"https:\/\/convly.ai\/it\/what-is-gguf-format-explained\/#Frequently_asked_questions\" >Domande frequenti<\/a><\/li><\/ul><\/nav><\/div>\n<h2><span class=\"ez-toc-section\" id=\"What_a_GGUF_file_actually_contains\"><\/span>Cosa contiene effettivamente un file GGUF<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Un file GGUF inizia con quattro byte ASCII <code>GGUF<\/code>, seguiti da un numero di versione, da una sezione di metadati chiave-valore e quindi dai tensori stessi. I metadati rappresentano la decisione progettuale fondamentale: memorizzano l'architettura del modello, la lunghezza massima del contesto, il vocabolario del tokenizer, il template per le conversazioni e i dettagli della quantizzazione sotto forma di chiavi denominate, in modo che un runtime possa caricare qualsiasi file GGUF senza aver bisogno di un file separato <code>config.json<\/code> o i file del tokenizer accanto ad esso.<\/p>\n<p>Da questa progettazione derivano tre conseguenze pratiche:<\/p>\n<ul>\n<li><strong>Un singolo file rappresenta l\u2019intero modello.<\/strong> \u00c8 possibile copiare un file <code>.gguf<\/code> tra macchine diverse e funzioner\u00e0 immediatamente. (I modelli molto grandi vengono talvolta suddivisi in parti numerate, ad esempio <code>-00001-of-00002.gguf<\/code>, ma si tratta comunque di un unico modello logico.)<\/li>\n<li><strong>Il file \u00e8 mappabile in memoria.<\/strong> I runtime possono utilizzare la funzione <code>mmap<\/code> per caricare il file e caricare i pesi su richiesta (on demand), rendendo cos\u00ec il caricamento rapido e consentendo l\u2019avvio di modelli pi\u00f9 grandi della RAM disponibile.<\/li>\n<li><strong>La quantizzazione \u00e8 integrata nel formato.<\/strong> Un file GGUF memorizza gi\u00e0 i pesi compressi con una precisione compresa tra 2 e 8 bit per peso, motivo per cui un modello da 8 miliardi di parametri pu\u00f2 occupare solo 4,9 GB invece che 16 GB.<\/li>\n<\/ul>\n<h2><span class=\"ez-toc-section\" id=\"Why_GGUF_replaced_GGML\"><\/span>Perch\u00e9 GGUF ha sostituito GGML<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Prima di agosto 2023, llama.cpp utilizzava un formato chiamato GGML (dal nome della libreria tensoriale sottostante). GGML funzionava, ma presentava un difetto strutturale: la disposizione dei dati nel file era rigida e non prevedeva alcuna gestione delle versioni. Ogni volta che llama.cpp introduceva una nuova funzionalit\u00e0 \u2014 nuove architetture, metodi di quantizzazione migliorati, parametri per la scalatura RoPE \u2014 il formato doveva essere modificato, e ogni file di modello esistente su ogni disco rigido diventava inutilizzabile. Gli utenti erano costretti a riscaricare o riconvertire intere collezioni di modelli pi\u00f9 volte nell\u2019arco di pochi mesi.<\/p>\n<p>GGUF, introdotto dal progetto llama.cpp ad agosto 2023, ha risolto questo problema con due modifiche:<\/p>\n<ul>\n<li><strong>Gestione delle versioni.<\/strong> Il file dichiara esplicitamente la propria versione del formato, permettendo ai lettori di sapere esattamente come analizzarlo.<\/li>\n<li><strong>Metadati chiave-valore estensibili.<\/strong> Nuove informazioni (ad esempio un nuovo campo per l\u2019architettura, un template per le conversazioni, un iperparametro aggiuntivo) corrispondono semplicemente a nuove chiavi. I vecchi file privi di tali chiavi continuano a caricarsi regolarmente; i nuovi file che le contengono funzionano correttamente nei runtime aggiornati. Nulla viene invalidato retroattivamente.<\/li>\n<\/ul>\n<p>llama.cpp ha abbandonato il supporto per GGML poco dopo, e l\u2019intero ecosistema lo ha seguito. Oggi GGML sopravvive unicamente come nome della libreria tensoriale sottostante; se trovate un file di modello <code>.ggml<\/code> o <code>.bin<\/code> del 2023, non verr\u00e0 caricato da nessuno strumento attuale e dovrete invece scaricare una versione in formato GGUF.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"How_to_read_the_quantisation_suffixes\"><\/span>Come interpretare i suffissi della quantizzazione<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Ogni nome di file GGUF include un suffisso come <code>Q4_K_M<\/code> che indica il grado di compressione applicato ai pesi. Il criterio \u00e8 il seguente:<\/p>\n<ul>\n<li><strong>Il numero che segue la lettera Q<\/strong> rappresenta approssimativamente il numero di bit per peso: Q4 \u2248 4 bit, Q8 \u2248 8 bit. Minori bit equivalgono a un file pi\u00f9 piccolo e a una qualit\u00e0 inferiore.<\/li>\n<li><strong>_K<\/strong> indica i pi\u00f9 recenti metodi di \"k-quant\" (quantizzazione k), che allocano bit aggiuntivi ai tensori pi\u00f9 influenti sulla qualit\u00e0 dell\u2019output. A parit\u00e0 di dimensione, una quantizzazione K offre prestazioni migliori rispetto allo stile precedente.<\/li>\n<li><strong>_S \/ _M \/ _L<\/strong> (small\/medium\/large) sono varianti all\u2019interno della famiglia K \u2014 <code>_M<\/code> mantiene alcuni tensori particolarmente sensibili a una precisione superiore rispetto a <code>_S<\/code>.<\/li>\n<li><strong>_0<\/strong> (come in <code>Q8_0<\/code>, <code>Q4_0<\/code>) indica la pi\u00f9 vecchia e semplice quantizzazione a blocchi. <code>Q8_0<\/code> \u00e8 ancora ampiamente utilizzato perch\u00e9, a 8 bit, il metodo semplice \u00e8 gi\u00e0 quasi privo di perdite; <code>Q4_0<\/code> \u00e8 ormai obsoleto \u2014 si consiglia di preferire i prefissi <code>Q4_K_M<\/code>.<\/li>\n<li><strong>IQ<\/strong> (ad esempio<code>IQ2_M<\/code>, <code>IQ3_XS<\/code>) che indicano le \"i-quants\", basate su una matrice di importanza e progettate per comprimere i modelli sotto i 4 bit con minori danni rispetto alle alternative.<\/li>\n<li><strong>F16 \/ BF16 \/ F32<\/strong> indicano pesi non quantizzati a 16 o 32 bit \u2014 la qualit\u00e0 di riferimento, ma con dimensioni massime.<\/li>\n<\/ul>\n<p>Ecco quanto costano effettivamente le opzioni pi\u00f9 comuni, utilizzando come esempio modelli istruzionali da 8 miliardi di parametri della famiglia Llama (le dimensioni sono approssimative e variano leggermente da modello a modello):<\/p>\n<table>\n<thead>\n<tr>\n<th>Quant<\/th>\n<th>Dimensione file (modello 8B)<\/th>\n<th>Qualit\u00e0 rispetto a F16<\/th>\n<th>Quando usarlo<\/th>\n<\/tr>\n<\/thead>\n<tbody>\n<tr>\n<td>F16<\/td>\n<td>~16,1 GB<\/td>\n<td>Riferimento<\/td>\n<td>Per benchmarking o per ulteriori quantizzazioni; raramente vale la pena eseguirlo<\/td>\n<\/tr>\n<tr>\n<td>Q8_0<\/td>\n<td>~8,5 GB<\/td>\n<td>Praticamente indistinguibile<\/td>\n<td>Se si dispone di VRAM sufficiente e si desidera la massima qualit\u00e0<\/td>\n<\/tr>\n<tr>\n<td>Q6_K<\/td>\n<td>~6,6 GB<\/td>\n<td>Perdita trascurabile<\/td>\n<td>Ottima qualit\u00e0 con un risparmio significativo di dimensioni<\/td>\n<\/tr>\n<tr>\n<td>Q5_K_M<\/td>\n<td>~5,7 GB<\/td>\n<td>Perdita molto lieve<\/td>\n<td>Buon compromesso<\/td>\n<\/tr>\n<tr>\n<td>Q4_K_M<\/td>\n<td>~4,9 GB<\/td>\n<td>Perdita contenuta, generalmente accettabile<\/td>\n<td><strong>L'impostazione predefinita standard.<\/strong> La migliore qualit\u00e0 per gigabyte per la maggior parte degli utenti<\/td>\n<\/tr>\n<tr>\n<td>Q3_K_M<\/td>\n<td>~4,0 GB<\/td>\n<td>Degrado percettibile<\/td>\n<td>Solo quando Q4 non entra effettivamente nella memoria disponibile<\/td>\n<\/tr>\n<tr>\n<td>Q2_K \/ IQ2<\/td>\n<td>~3,2 GB<\/td>\n<td>Degrado significativo<\/td>\n<td>Ultima risorsa; spesso \u00e8 preferibile un modello pi\u00f9 piccolo a Q4<\/td>\n<\/tr>\n<\/tbody>\n<\/table>\n<p>Due regole utili: la quantizzazione danneggia i modelli piccoli pi\u00f9 di quelli grandi (un modello da 70B a Q3 si comporta molto meglio di uno da 8B a Q3) e al di sotto di Q4 la curva della qualit\u00e0 cala bruscamente. In caso di dubbio, <code>Q4_K_M<\/code> \u00e8 l'impostazione predefinita della comunit\u00e0 per una ragione ben precisa.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Picking_a_quantisation_for_your_VRAM\"><\/span>Scelta della quantizzazione in base alla tua VRAM<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>La memoria totale necessaria \u00e8 approssimativamente pari a <em>dimensione del file + cache del contesto + overhead<\/em>. Prevedere un margine aggiuntivo di 1\u20132 GB rispetto alla dimensione del file per alcuni migliaia di token di contesto; tale margine va aumentato ulteriormente se si utilizzano contesti molto lunghi. Il modello funziona alla massima velocit\u00e0 quando l'intero carico rientra nella VRAM della GPU; gli strumenti basati su llama.cpp possono scaricare le parti eccedenti nella RAM di sistema, soluzione comunque funzionante ma progressivamente pi\u00f9 lenta man mano che aumenta il numero di livelli spostati.<\/p>\n<table>\n<thead>\n<tr>\n<th>VRAM<\/th>\n<th>Ci\u00f2 che trova comodamente spazio<\/th>\n<\/tr>\n<\/thead>\n<tbody>\n<tr>\n<td>8 GB<\/td>\n<td>modelli da 7\u20138B a Q4_K_M o Q5_K_M<\/td>\n<\/tr>\n<tr>\n<td>12 GB<\/td>\n<td>8B a Q8_0, oppure 12\u201314B a Q4_K_M<\/td>\n<\/tr>\n<tr>\n<td>16 GB<\/td>\n<td>14B a Q5_K_M\/Q6_K<\/td>\n<\/tr>\n<tr>\n<td>24 GB<\/td>\n<td>~32B a Q4_K_M, oppure 14B a Q8_0 con contesto lungo<\/td>\n<\/tr>\n<\/tbody>\n<\/table>\n<p>Per valori esatti relativi a un modello specifico e a una determinata lunghezza di contesto, lo strumento <a href=\"https:\/\/convly.ai\/it\/llm-vram-calculator\/\">Calcolatore VRAM<\/a> esegue automaticamente i calcoli necessari, mentre una suddivisione dettagliata per singolo modello \u00e8 disponibile in <a href=\"https:\/\/convly.ai\/it\/vram-requirements-every-major-llm-2026\/\">Requisiti di VRAM per ogni principale modello linguistico di grandi dimensioni (LLM)<\/a>. Se stai scegliendo l'hardware piuttosto che una specifica quantizzazione, inizia da <a href=\"https:\/\/convly.ai\/it\/best-gpus-for-local-llms-2026\/\">le migliori GPU per LLM locali<\/a>.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"GGUF_vs_safetensors\"><\/span>GGUF vs safetensors<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Questi due formati coesistono perch\u00e9 servono runtime diversi, non perch\u00e9 uno stia prevalendo sull'altro.<\/p>\n<table>\n<thead>\n<tr>\n<th><\/th>\n<th>GGUF<\/th>\n<th>safetensors<\/th>\n<\/tr>\n<\/thead>\n<tbody>\n<tr>\n<td>Progettato per<\/td>\n<td>llama.cpp e il suo ecosistema<\/td>\n<td>L'ecosistema Hugging Face \/ PyTorch<\/td>\n<\/tr>\n<tr>\n<td>Contenuto<\/td>\n<td>Pesi + tokenizer + configurazione in un unico file<\/td>\n<td>Solo tensori; configurazione e tokenizer sono file JSON separati<\/td>\n<\/tr>\n<tr>\n<td>Quantizzazione<\/td>\n<td>Integrata nel formato (Q4_K_M, ecc.)<\/td>\n<td>Generalmente FP16\/BF16; quantizzati tramite metodi esterni (GPTQ, AWQ)<\/td>\n<\/tr>\n<tr>\n<td>Runtime tipici<\/td>\n<td>Ollama, LM Studio, llama.cpp, KoboldCpp, Jan<\/td>\n<td>transformers, vLLM, TGI, SGLang<\/td>\n<\/tr>\n<tr>\n<td>Punto ottimale<\/td>\n<td>Hardware consumer, ibrido CPU+GPU, utilizzo singolo<\/td>\n<td>GPU per datacenter, erogazione ad alto throughput, addestramento<\/td>\n<\/tr>\n<\/tbody>\n<\/table>\n<p>La scelta dipende in realt\u00e0 dal software che intendi utilizzare: gli strumenti desktop e Ollama richiedono GGUF, mentre gli stack per l'erogazione su GPU e qualsiasi attivit\u00e0 che coinvolga il fine-tuning richiedono safetensors. I publisher di modelli rilasciano tipicamente prima i formati safetensors, e la comunit\u00e0 converte in GGUF entro pochi giorni.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Where_GGUF_files_come_from\"><\/span>Origine dei file GGUF<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Quasi tutti i file GGUF sono ospitati su Hugging Face. Labs pubblica occasionalmente GGUF ufficiali, ma la maggior parte proviene da quantizzatori della comunit\u00e0 \u2014 account come <code>bartowski<\/code>, <code>unsloth<\/code>, <code>lmstudio-community<\/code> e <code>ggml-org<\/code> \u2014 che convertono ogni nuovo rilascio nell'intera gamma di quantizzazioni disponibili. Un repository chiamato, ad esempio, <code>Meta-Llama-3.1-8B-Instruct-GGUF<\/code> conterr\u00e0 un file per ciascun livello di quantizzazione.<\/p>\n<p>Puoi anche convertire autonomamente un modello usando gli strumenti di llama.cpp: <code>convert_hf_to_gguf.py<\/code> trasforma un modello Hugging Face in un GGUF in F16, mentre il binario <code>llama-quantize<\/code> (compilato insieme a llama.cpp) lo comprime nella quantizzazione prescelta, ad esempio. <code>modello llama-quantize model-f16.gguf model-Q4_K_M.gguf Q4_K_M<\/code>.<\/p>\n<h3>Caricamento di un file GGUF in Ollama<\/h3>\n<p>Ollama pu\u00f2 scaricare direttamente repository GGUF da Hugging Face, specificando la quantizzazione dopo i due punti:<\/p>\n<pre><code>ollama run hf.co\/bartowski\/Meta-Llama-3.1-8B-Instruct-GGUF:Q4_K_M<\/code><\/pre>\n<p>Per un file gi\u00e0 presente sul disco, crea un file di testo semplice denominato <code>Modelfile<\/code> contenente:<\/p>\n<pre><code>FROM .\/my-model.gguf<\/code><\/pre>\n<p>quindi registrarlo ed eseguirlo:<\/p>\n<pre><code>ollama create my-model -f Modelfile\nollama run my-model<\/code><\/pre>\n<p>Le versioni attuali di Ollama leggono automaticamente il template di chat incorporato nei metadati GGUF; se un modello importato produce output illeggibile, la soluzione consiste generalmente nell\u2019aggiungere esplicitamente una riga <code>TEMPLATE<\/code> al file Modelfile. La <a href=\"https:\/\/convly.ai\/it\/what-is-ollama-complete-guide-2026\/\">guida completa a Ollama<\/a> tratta in modo approfondito i Modelfile.<\/p>\n<h3>Caricamento di un file GGUF in LM Studio<\/h3>\n<p>Il metodo standard \u00e8 il downloader integrato: apri la scheda Discover, cerca un modello e LM Studio elenca le quantizzazioni GGUF disponibili, indicando quali sono compatibili con il tuo hardware. Per importare un file gi\u00e0 presente sul disco, usa l\u2019interfaccia a riga di comando (<code>lms import path\/to\/model.gguf<\/code>) oppure copialo nella cartella dei modelli di LM Studio \u2014 il percorso predefinito esatto varia in base alla versione e al sistema operativo, ma la scheda My Models lo mostra e consente di modificarlo. I file devono risiedere in una struttura di sottocartelle del tipo <code>publisher\/model-name\/<\/code> per essere riconosciuti. Consulta la <a href=\"https:\/\/convly.ai\/it\/lm-studio-complete-guide-2026\/\">guida completa a LM Studio<\/a> per la procedura dettagliata.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Frequently_asked_questions\"><\/span>Domande frequenti<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<h3>GGUF \u00e8 supportato solo su CPU o utilizza anche la GPU?<\/h3>\n<p>Entrambe le opzioni. llama.cpp \u00e8 nato come progetto di inferenza su CPU, ma trasferisce i layer del modello sulla GPU (CUDA, Metal, Vulkan, ROCm) ed esegue l\u2019intero modello sulla GPU quando questo entra interamente nella VRAM. Ollama e LM Studio gestiscono automaticamente la suddivisione tra CPU e GPU; usando direttamente llama.cpp, puoi controllarla tramite il flag <code>-ngl<\/code> (numero di layer da assegnare alla GPU).<\/p>\n<h3>Qual \u00e8 la differenza tra Q4_K_M e Q4_K_S?<\/h3>\n<p>Entrambe sono quantizzazioni k-quants da ~4 bit; la lettera indica la variante dimensionale. <code>_M<\/code> (medium) mantiene una maggiore precisione per i tensori pi\u00f9 sensibili alla qualit\u00e0 rispetto a <code>_S<\/code> (small), risultando quindi leggermente pi\u00f9 grande e leggermente pi\u00f9 performante. La differenza \u00e8 minima: scegli <code>_M<\/code> a meno che gli ultimi centinaia di megabyte non facciano la differenza per far entrare il modello nella memoria disponibile.<\/p>\n<h3>Quanta qualit\u00e0 si perde effettivamente con la quantizzazione?<\/h3>\n<p>Con Q8_0 e Q6_K la perdita \u00e8 praticamente nulla \u2014 test ciechi faticano a distinguerli dall\u2019originale in formato F16. Q4_K_M comporta una lieve perdita misurabile, che la maggior parte degli utenti non nota mai durante una conversazione, sebbene possa influire su compiti particolarmente precisi come la generazione di codice o calcoli matematici. Al di sotto di Q4 la degradazione diventa evidente, e i modelli pi\u00f9 piccoli ne risentono di pi\u00f9 rispetto a quelli pi\u00f9 grandi.<\/p>\n<h3>Posso usare GGUF con transformers o vLLM?<\/h3>\n<p>Esiste un supporto limitato, ma non \u00e8 il percorso nativo: transformers pu\u00f2 dequantizzare alcuni file GGUF al momento del caricamento, mentre vLLM dispone di un supporto sperimentale per GGUF, la cui compatibilit\u00e0 varia in base all\u2019architettura. Se stai sviluppando su questi stack, preferisci il formato safetensors; GGUF va considerato piuttosto come il formato nativo per i runtime della famiglia llama.cpp.<\/p>\n<h3>Perch\u00e9 il mio modello \u00e8 suddiviso in pi\u00f9 file .gguf?<\/h3>\n<p>I modelli molto grandi vengono partizionati in parti denominate ad esempio <code>model-00001-of-00002.gguf<\/code>, principalmente per rimanere al di sotto dei limiti di dimensione imposti dalle piattaforme di hosting. Conserva tutti i file nella stessa cartella e punta il tuo runtime sul primo \u2014 llama.cpp e gli strumenti basati su di esso caricheranno automaticamente le parti rimanenti.<\/p>\n<p>Una volta individuata la quantizzazione compatibile con il tuo hardware, la domanda pratica successiva \u00e8 quale modello utilizzare: la <a href=\"https:\/\/convly.ai\/it\/models\/\">database di modelli<\/a> tabella comparativa <a href=\"https:\/\/convly.ai\/it\/best-local-llms-to-run-on-ollama-2026\/\">elenca specifiche tecniche, requisiti di VRAM e prezzi per 37 modelli attuali, mentre<\/a> i migliori modelli locali per Ollama<\/p>","protected":false},"excerpt":{"rendered":"<p>GGUF is the file format for running LLMs locally. It packs a model&#8217;s weights, tokenizer and configuration into a single [&hellip;]<\/p>\n","protected":false},"author":1,"featured_media":2104,"comment_status":"closed","ping_status":"closed","sticky":false,"template":"","format":"standard","meta":{"site-sidebar-layout":"default","site-content-layout":"","ast-site-content-layout":"default","site-content-style":"default","site-sidebar-style":"default","ast-global-header-display":"","ast-banner-title-visibility":"","ast-main-header-display":"","ast-hfb-above-header-display":"","ast-hfb-below-header-display":"","ast-hfb-mobile-header-display":"","site-post-title":"","ast-breadcrumbs-content":"","ast-featured-img":"","footer-sml-layout":"","ast-disable-related-posts":"","theme-transparent-header-meta":"","adv-header-id-meta":"","stick-header-meta":"","header-above-stick-meta":"","header-main-stick-meta":"","header-below-stick-meta":"","astra-migrate-meta-layouts":"default","ast-page-background-enabled":"default","ast-page-background-meta":{"desktop":{"background-color":"var(--ast-global-color-5)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"tablet":{"background-color":"","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"mobile":{"background-color":"","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""}},"ast-content-background-meta":{"desktop":{"background-color":"var(--ast-global-color-4)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"tablet":{"background-color":"var(--ast-global-color-4)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"mobile":{"background-color":"var(--ast-global-color-4)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""}},"footnotes":""},"categories":[7],"tags":[],"class_list":["post-2103","post","type-post","status-publish","format-standard","has-post-thumbnail","hentry","category-ai-news"],"_links":{"self":[{"href":"https:\/\/convly.ai\/it\/wp-json\/wp\/v2\/posts\/2103","targetHints":{"allow":["GET"]}}],"collection":[{"href":"https:\/\/convly.ai\/it\/wp-json\/wp\/v2\/posts"}],"about":[{"href":"https:\/\/convly.ai\/it\/wp-json\/wp\/v2\/types\/post"}],"author":[{"embeddable":true,"href":"https:\/\/convly.ai\/it\/wp-json\/wp\/v2\/users\/1"}],"replies":[{"embeddable":true,"href":"https:\/\/convly.ai\/it\/wp-json\/wp\/v2\/comments?post=2103"}],"version-history":[{"count":1,"href":"https:\/\/convly.ai\/it\/wp-json\/wp\/v2\/posts\/2103\/revisions"}],"predecessor-version":[{"id":2105,"href":"https:\/\/convly.ai\/it\/wp-json\/wp\/v2\/posts\/2103\/revisions\/2105"}],"wp:featuredmedia":[{"embeddable":true,"href":"https:\/\/convly.ai\/it\/wp-json\/wp\/v2\/media\/2104"}],"wp:attachment":[{"href":"https:\/\/convly.ai\/it\/wp-json\/wp\/v2\/media?parent=2103"}],"wp:term":[{"taxonomy":"category","embeddable":true,"href":"https:\/\/convly.ai\/it\/wp-json\/wp\/v2\/categories?post=2103"},{"taxonomy":"post_tag","embeddable":true,"href":"https:\/\/convly.ai\/it\/wp-json\/wp\/v2\/tags?post=2103"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}