{"id":2605,"date":"2026-09-09T20:14:45","date_gmt":"2026-09-09T20:14:45","guid":{"rendered":"https:\/\/convly.ai\/?p=2605"},"modified":"2026-09-09T20:14:45","modified_gmt":"2026-09-09T20:14:45","slug":"gguf-models","status":"publish","type":"post","link":"https:\/\/convly.ai\/it\/gguf-models\/","title":{"rendered":"Modelli GGUF: cos'\u00e8 e come eseguirli"},"content":{"rendered":"<div class=\"convly-tldr\">\n<ul>\n<li><strong>GGUF \u00e8 un formato container monofile per modelli quantizzati<\/strong>, creato per <a href=\"https:\/\/github.com\/ggml-org\/llama.cpp\" rel=\"noopener\" target=\"_blank\">llama.cpp<\/a>. Un <code>.gguf<\/code> singolo file contiene i pesi, il tokenizer, il template di chat e i metadati \u2014 niente cartella di configurazione, niente file separati per il tokenizer.<\/li>\n<li><strong>GGUF models are what Ollama, LM Studio, KoboldCpp, Jan and llama.cpp actually load.<\/strong> Se esegui un modello localmente su hardware consumer, quasi certamente stai eseguendo un modello GGUF.<\/li>\n<li><strong>Scelta predefinita: <code>Q4_K_M<\/code>.<\/strong> Circa 0,6 GB di dimensione file per miliardo di parametri \u2014 un modello da 8 miliardi di parametri raggiunge circa 5 GB, valore coerente con la cifra di ~5 GB a 4 bit indicata da <a href=\"https:\/\/convly.ai\/it\/models\/\">database dei modelli Convly<\/a> per Llama 3.1 8B.<\/li>\n<li><strong>GGUF \u00e8 progettato per l'inferenza locale su singolo utente.<\/strong> For concurrent serving use safetensors with vLLM or an API instead.<\/li>\n<\/ul>\n<\/div>\n<p>GGUF (GPT-Generated Unified Format) \u00e8 il formato file utilizzato dall'ecosistema llama.cpp\/ggml per memorizzare un modello pronto per l'inferenza. Un singolo <code>.gguf<\/code> file contiene i tensori quantizzati pi\u00f9 tutti gli elementi necessari per utilizzarli: vocabolario, impostazioni del tokenizer, template di chat e metadati sull'architettura. Ha sostituito il precedente formato GGML nell'agosto 2023 ed \u00e8 oggi lo standard di fatto per l'esecuzione di modelli su laptop, desktop e CPU.<\/p>\n<div id=\"ez-toc-container\" class=\"ez-toc-v2_0_87_1 counter-flat ez-toc-counter ez-toc-container-direction\">\n<label for=\"ez-toc-cssicon-toggle-item-6aa1d079867bc\" class=\"ez-toc-cssicon-toggle-label\"><span class=\"\"><span class=\"eztoc-hide\" style=\"display:none;\">Attiva\/Disattiva<\/span><span class=\"ez-toc-icon-toggle-span\"><svg style=\"fill: #000000;color:#000000\" xmlns=\"http:\/\/www.w3.org\/2000\/svg\" class=\"list-377408\" width=\"20px\" height=\"20px\" viewbox=\"0 0 24 24\" fill=\"none\"><path d=\"M6 6H4v2h2V6zm14 0H8v2h12V6zM4 11h2v2H4v-2zm16 0H8v2h12v-2zM4 16h2v2H4v-2zm16 0H8v2h12v-2z\" fill=\"currentColor\"><\/path><\/svg><svg style=\"fill: #000000;color:#000000\" class=\"arrow-unsorted-368013\" xmlns=\"http:\/\/www.w3.org\/2000\/svg\" width=\"10px\" height=\"10px\" viewbox=\"0 0 24 24\" version=\"1.2\" baseprofile=\"tiny\"><path d=\"M18.2 9.3l-6.2-6.3-6.2 6.3c-.2.2-.3.4-.3.7s.1.5.3.7c.2.2.4.3.7.3h11c.3 0 .5-.1.7-.3.2-.2.3-.5.3-.7s-.1-.5-.3-.7zM5.8 14.7l6.2 6.3 6.2-6.3c.2-.2.3-.5.3-.7s-.1-.5-.3-.7c-.2-.2-.4-.3-.7-.3h-11c-.3 0-.5.1-.7.3-.2.2-.3.5-.3.7s.1.5.3.7z\"\/><\/svg><\/span><\/span><\/label><input type=\"checkbox\"  id=\"ez-toc-cssicon-toggle-item-6aa1d079867bc\"  aria-label=\"Attiva\/Disattiva\" \/><nav><ul class='ez-toc-list ez-toc-list-level-1' ><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-1\" href=\"https:\/\/convly.ai\/it\/gguf-models\/#What_is_actually_inside_a_gguf_file\" >Cosa contiene effettivamente un file .gguf<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-2\" href=\"https:\/\/convly.ai\/it\/gguf-models\/#How_to_read_a_GGUF_filename\" >Come leggere il nome di un file GGUF<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-3\" href=\"https:\/\/convly.ai\/it\/gguf-models\/#Sizing_which_GGUF_models_fit_your_GPU\" >Dimensionamento: quali modelli GGUF sono compatibili con la tua GPU<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-4\" href=\"https:\/\/convly.ai\/it\/gguf-models\/#Where_to_download_GGUF_models\" >Dove scaricare modelli GGUF<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-5\" href=\"https:\/\/convly.ai\/it\/gguf-models\/#Running_GGUF_models_on_Linux\" >Eseguire modelli GGUF su Linux<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-6\" href=\"https:\/\/convly.ai\/it\/gguf-models\/#Running_GGUF_models_on_macOS\" >Eseguire modelli GGUF su macOS<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-7\" href=\"https:\/\/convly.ai\/it\/gguf-models\/#Running_GGUF_models_on_Windows\" >Eseguire modelli GGUF su Windows<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-8\" href=\"https:\/\/convly.ai\/it\/gguf-models\/#Loading_an_arbitrary_GGUF_into_Ollama\" >Caricare un qualsiasi modello GGUF in Ollama<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-9\" href=\"https:\/\/convly.ai\/it\/gguf-models\/#When_GGUF_is_the_wrong_answer\" >Quando GGUF non \u00e8 la soluzione adatta<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-10\" href=\"https:\/\/convly.ai\/it\/gguf-models\/#Frequently_asked_questions\" >Domande frequenti<\/a><\/li><\/ul><\/nav><\/div>\n<h2><span class=\"ez-toc-section\" id=\"What_is_actually_inside_a_gguf_file\"><\/span>Cosa contiene effettivamente un file .gguf<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Un file GGUF \u00e8 composto da un header, un blocco di metadati chiave-valore e infine i dati dei tensori. I metadati sono la parte praticamente pi\u00f9 rilevante \u2014 \u00e8 proprio grazie a essi che un modello GGUF non richiede file ausiliari. La <a href=\"https:\/\/huggingface.co\/docs\/hub\/en\/gguf\" rel=\"noopener\" target=\"_blank\">documentazione GGUF<\/a> di Hugging Face descrive la struttura del formato e il visualizzatore integrato di metadati del Hub, che ti permette di ispezionare il tipo di quantizzazione, la lunghezza del contesto e il template di chat di un file prima di scaricarne diversi gigabyte.<\/p>\n<p>Tra le chiavi di metadati pi\u00f9 comuni figurano l'architettura (<code>llama<\/code>, <code>qwen3<\/code>, <code>gemma3<\/code>, <code>phi3<\/code>), la lunghezza massima del contesto di addestramento, le impostazioni RoPE, l'intero vocabolario e il template di chat Jinja. Un loader legge questo blocco e si configura autonomamente; non devi specificare manualmente n\u00e9 il tokenizer n\u00e9 il formato dei prompt.<\/p>\n<h3>GGUF vs safetensors<\/h3>\n<table>\n<thead>\n<tr>\n<th><\/th>\n<th>GGUF<\/th>\n<th>safetensors<\/th>\n<\/tr>\n<\/thead>\n<tbody>\n<tr>\n<td>Runtime principale<\/td>\n<td>llama.cpp, Ollama, LM Studio<\/td>\n<td>PyTorch, vLLM, Transformers, TGI<\/td>\n<\/tr>\n<tr>\n<td>File per modello<\/td>\n<td>Uno (o frammenti numerati)<\/td>\n<td>Pesi pi\u00f9 cartella di configurazione\/tokenizer<\/td>\n<\/tr>\n<tr>\n<td>Quantizzazione<\/td>\n<td>Integrata (Q4_K_M, Q8_0, IQ\u2026)<\/td>\n<td>Solitamente FP16\/BF16, oppure varianti GPTQ\/AWQ<\/td>\n<\/tr>\n<tr>\n<td>CPU + offload parziale sulla GPU<\/td>\n<td>S\u00ec, obiettivo fondamentale della progettazione<\/td>\n<td>Limitata e lenta<\/td>\n<\/tr>\n<tr>\n<td>Servizio batch concorrente<\/td>\n<td>Scarsa<\/td>\n<td>Eccellente<\/td>\n<\/tr>\n<tr>\n<td>Affinamento (fine-tuning)<\/td>\n<td>No (convertire prima in altro formato)<\/td>\n<td>S\u00ec<\/td>\n<\/tr>\n<\/tbody>\n<\/table>\n<h2><span class=\"ez-toc-section\" id=\"How_to_read_a_GGUF_filename\"><\/span>Come leggere il nome di un file GGUF<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>I file sono generalmente denominati <code>Model-Name-8B-Instruct-Q4_K_M.gguf<\/code>. Il suffisso indica la combinazione di quantizzazione. Il numero rappresenta la larghezza di bit nominale; <code>_K<\/code> indica k-quants, che mantengono i tensori di attenzione e di embedding a precisione superiore rispetto ai pesi principali della feed-forward; <code>S<\/code>\/<code>M<\/code>\/<code>L<\/code> sono varianti piccole\/medie\/grandi di tale combinazione.<\/p>\n<table>\n<thead>\n<tr>\n<th>Quant<\/th>\n<th>Bits\/approssimativi per peso<\/th>\n<th>Dimensione approssimativa, modello da 8 miliardi di parametri<\/th>\n<th>Quando utilizzarlo<\/th>\n<\/tr>\n<\/thead>\n<tbody>\n<tr>\n<td>Q8_0<\/td>\n<td>~8.5<\/td>\n<td>~8,5 GB<\/td>\n<td>Riferimento quasi senza perdita di qualit\u00e0; solo per modelli piccoli<\/td>\n<\/tr>\n<tr>\n<td>Q6_K<\/td>\n<td>~6.6<\/td>\n<td>~6,6 GB<\/td>\n<td>Hai VRAM in eccesso<\/td>\n<\/tr>\n<tr>\n<td>Q5_K_M<\/td>\n<td>~5.7<\/td>\n<td>~5,7 GB<\/td>\n<td>Predefinito orientato alla qualit\u00e0<\/td>\n<\/tr>\n<tr>\n<td>Q4_K_M<\/td>\n<td>~4.9<\/td>\n<td>~4,9 GB<\/td>\n<td><strong>Predefinito usuale<\/strong><\/td>\n<\/tr>\n<tr>\n<td>Q4_0<\/td>\n<td>~4.5<\/td>\n<td>~4,5 GB<\/td>\n<td>Obsoleto; alcuni acceleratori lo preferiscono<\/td>\n<\/tr>\n<tr>\n<td>Q3_K_M<\/td>\n<td>~3.9<\/td>\n<td>~4,0 GB<\/td>\n<td>Per far rientrare un modello pi\u00f9 grande in una quantit\u00e0 limitata di VRAM<\/td>\n<\/tr>\n<tr>\n<td>Q2_K \/ IQ2<\/td>\n<td>~2,5\u20133,4<\/td>\n<td>~2,5\u20133,4 GB<\/td>\n<td>Ultima risorsa; degrado evidente<\/td>\n<\/tr>\n<\/tbody>\n<\/table>\n<p>Considera la colonna \u00abbits per peso\u00bb come indicativa. Le dimensioni effettive variano in base all\u2019architettura del modello (un vocabolario ampio aumenta le dimensioni dei tensori di embedding) e alla versione di llama.cpp, poich\u00e9 i mix di quantizzazione vengono ottimizzati nel tempo. La famiglia <code>IQ<\/code> (da IQ2_XXS a IQ4_NL) utilizza una calibrazione basata su matrice di importanza per mantenere prestazioni migliori a larghezze di bit molto ridotte, e quantizzatori come quelli di Bartowski e Unsloth pubblicano varianti IQ insieme ai classici K-quants.<\/p>\n<p>Il consenso della comunit\u00e0 \u2014 non una misurazione di Convly \u2014 \u00e8 che Q4_K_M rappresenti il punto ottimale, e che la qualit\u00e0 diminuisca drasticamente al di sotto di circa 3 bit per peso: i modelli piccoli subiscono un degrado pi\u00f9 rapido rispetto ai modelli grandi alla stessa quantizzazione.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Sizing_which_GGUF_models_fit_your_GPU\"><\/span>Dimensionamento: quali modelli GGUF sono compatibili con la tua GPU<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>La dimensione del file costituisce il minimo, non il totale. Aggiungi la cache KV relativa alla tua lunghezza di contesto, pi\u00f9 circa 500 MB\u20131 GB di overhead. Queste cifre a 4 bit provengono da <a href=\"https:\/\/convly.ai\/it\/models\/\">database dei modelli Convly<\/a>:<\/p>\n<table>\n<thead>\n<tr>\n<th>Modello<\/th>\n<th>VRAM a 4 bit<\/th>\n<th>Contesto<\/th>\n<th>GPU realistico<\/th>\n<\/tr>\n<\/thead>\n<tbody>\n<tr>\n<td>Gemma 3 4B<\/td>\n<td>~3 GB<\/td>\n<td>128K<\/td>\n<td>Qualsiasi scheda da 6 GB, GPU integrata<\/td>\n<\/tr>\n<tr>\n<td>Mistral 7B<\/td>\n<td>~4,5 GB<\/td>\n<td>32K<\/td>\n<td>Scheda da 8 GB<\/td>\n<\/tr>\n<tr>\n<td>Llama 3.1 8B<\/td>\n<td>~5 GB<\/td>\n<td>128K<\/td>\n<td>Scheda da 8 GB<\/td>\n<\/tr>\n<tr>\n<td>Qwen3 14B<\/td>\n<td>~9 GB<\/td>\n<td>128K<\/td>\n<td>Scheda da 12 GB<\/td>\n<\/tr>\n<tr>\n<td>Phi-4<\/td>\n<td>~9 GB<\/td>\n<td>16K<\/td>\n<td>Scheda da 12 GB<\/td>\n<\/tr>\n<tr>\n<td>Gemma 3 27B<\/td>\n<td>~16 GB<\/td>\n<td>128K<\/td>\n<td>Scheda da 24 GB<\/td>\n<\/tr>\n<tr>\n<td>Qwen3 32B<\/td>\n<td>~20 GB<\/td>\n<td>128K<\/td>\n<td>Scheda da 24 GB<\/td>\n<\/tr>\n<tr>\n<td>Llama 3.3 70B<\/td>\n<td>~40 GB<\/td>\n<td>128K<\/td>\n<td>2\u00d724 GB oppure 48 GB di memoria unificata<\/td>\n<\/tr>\n<tr>\n<td>DeepSeek R1 (completo)<\/td>\n<td>~400 GB<\/td>\n<td>128K<\/td>\n<td>Solo su server multi-GPU<\/td>\n<\/tr>\n<\/tbody>\n<\/table>\n<p>Mixture-of-experts models are the trap here. Qwen3 30B-A3B activates only ~3B parameters per token but still needs all ~18 GB resident. At the extreme, the database puts Kimi K3 at ~1.4 TB at 4-bit \u2014 a GGUF exists in principle, but no single machine you own will hold it. For an exact figure at your context length, use the <a href=\"https:\/\/convly.ai\/it\/llm-vram-calculator\/\">Calcolatore VRAM<\/a> oppure la suddivisione per modello presente in <a href=\"https:\/\/convly.ai\/it\/vram-requirements-every-major-llm-2026\/\">Requisiti di VRAM per ogni principale modello linguistico di grandi dimensioni (LLM)<\/a>. Se stai ancora scegliendo l\u2019hardware, <a href=\"https:\/\/convly.ai\/it\/best-gpus-for-local-llms-2026\/\">le migliori GPU per LLM locali<\/a> analizza il rapporto VRAM\/dollaro.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Where_to_download_GGUF_models\"><\/span>Dove scaricare modelli GGUF<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<ul>\n<li><strong>Hugging Face<\/strong> \u2014 filtra l\u2019elenco dei modelli con <a href=\"https:\/\/huggingface.co\/models?library=gguf\" rel=\"noopener\" target=\"_blank\">library=gguf<\/a>. La maggior parte dei repository include tutte le quantizzazioni in un unico repository; scarica solo il file di cui hai bisogno, non l\u2019intero repository.<\/li>\n<li><strong>libreria Ollama<\/strong> \u2014 <a href=\"https:\/\/ollama.com\/library\" rel=\"noopener\" target=\"_blank\">ollama.com\/library<\/a> fornisce file GGUF preconfezionati con il template di chat gi\u00e0 configurato. Consulta <a href=\"https:\/\/convly.ai\/it\/ollama-models-list-2026\/\">Elenco modelli Ollama<\/a>.<\/li>\n<li><strong>LM Studio<\/strong> \u2014 la scheda \u00abScopri\u00bb integrata nell\u2019app ricerca i repository GGUF su Hugging Face e segnala quali quantizzazioni sono compatibili con la RAM\/VRAM rilevata sul tuo sistema. Guida passo passo: <a href=\"https:\/\/convly.ai\/it\/lm-studio-complete-guide-2026\/\">Guida completa a LM Studio<\/a>.<\/li>\n<\/ul>\n<p>I modelli di grandi dimensioni vengono forniti suddivisi in parti (shard) <code>model-00001-of-00003.gguf<\/code> e cos\u00ec via. Scarica tutti gli shard nella stessa cartella e punta il loader sullo shard 00001 \u2014 esso individuer\u00e0 automaticamente gli altri.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Running_GGUF_models_on_Linux\"><\/span>Eseguire modelli GGUF su Linux<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Compila llama.cpp con il supporto CUDA:<\/p>\n<pre><code>git clone https:\/\/github.com\/ggml-org\/llama.cpp\ncd llama.cpp\ncmake -B build -DGGML_CUDA=ON\ncmake --build build --config Release -j<\/code><\/pre>\n<p>I binari vengono generati in <code>build\/bin\/<\/code>. Avvia un server compatibile con l\u2019API OpenAI:<\/p>\n<pre><code>.\/build\/bin\/llama-server -m ~\/models\/model-Q4_K_M.gguf -c 8192 -ngl 99 --port 8080<\/code><\/pre>\n<p><code>-ngl<\/code> (<code>--n-gpu-layers<\/code>) \u00e8 il parametro di offload: <code>99<\/code> significa \u00abtutti i layer sulla GPU\u00bb; <code>0<\/code> indica l\u2019utilizzo esclusivo della CPU, mentre valori intermedi suddividono il modello quando quest\u2019ultimo non entra interamente nella GPU. <code>-c<\/code> imposta la lunghezza massima del contesto; lasciarla al valore massimo addestrato dal modello pu\u00f2 richiedere pi\u00f9 VRAM rispetto a quella occupata dai pesi stessi. L\u2019endpoint risultante \u00e8 <code>http:\/\/localhost:8080\/v1\/chat\/completions<\/code>.<\/p>\n<p>Due precisazioni sulle versioni: nella versione precedente la flag CMake era <code>LLAMA_CUBLAS<\/code> e i binari erano stati rinominati (<code>main<\/code> \u2192 <code>llama-cli<\/code>, <code>server<\/code> \u2192 <code>llama-server<\/code>) nel 2024. Controlla il file README del repository che hai clonato per verificare i dettagli della build. Per GPU AMD o Intel, sostituisci la flag CUDA con quella corrispondente per ROCm\/Vulkan\/SYCL documentata nel repository, invece di procedere per tentativi.<\/p>\n<p>Se utilizzi Ollama, i modelli risiedono in <code>\/usr\/share\/ollama\/.ollama\/models<\/code> quando viene eseguito come servizio di sistema, oppure <code>~\/.ollama\/models<\/code> per un'installazione utente. Vedere <a href=\"https:\/\/convly.ai\/it\/how-to-install-ollama-2026\/\">come installare Ollama<\/a>.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Running_GGUF_models_on_macOS\"><\/span>Eseguire modelli GGUF su macOS<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Apple Silicon \u00e8 insolitamente performante con GGUF perch\u00e9 la memoria unificata consente alla GPU di accedere alla maggior parte della RAM di sistema: su un Mac da 64 GB \u00e8 possibile caricare un modello da ~40 GB a 4 bit da 70 miliardi di parametri, che su PC richiederebbe due schede da 24 GB.<\/p>\n<pre><code>brew install llama.cpp\nllama-server -m ~\/models\/model-Q4_K_M.gguf -c 8192 --port 8080<\/code><\/pre>\n<p>L'offload su Metal \u00e8 abilitato nella build Homebrew, quindi in genere non \u00e8 necessario <code>-ngl<\/code>. macOS limita la quantit\u00e0 di RAM che la GPU pu\u00f2 allocare (regolabile tramite un <code>iogpu<\/code> sysctl, il cui valore varia a seconda della versione di macOS), quindi lasciare una certa quantit\u00e0 di RAM disponibile per il sistema operativo. Ollama memorizza i modelli in <code>~\/.ollama\/models<\/code>; LM Studio utilizza <code>~\/.lmstudio\/models<\/code> nelle versioni attuali e <code>~\\\/\\.cache\\\/lm-studio\\\/models<\/code> in quelle pi\u00f9 vecchie \u2014 la scheda \"I miei modelli\" mostra e permette di modificare il percorso effettivo.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Running_GGUF_models_on_Windows\"><\/span>Eseguire modelli GGUF su Windows<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Tre possibili vie, dalla pi\u00f9 semplice alla pi\u00f9 complessa:<\/p>\n<ol>\n<li><strong>LM Studio<\/strong> \u2014 Installatore grafico, ricerca integrata dei modelli all'interno dell'applicazione e interruttore per avviare un server locale. La scelta migliore per chi non \u00e8 sviluppatore.<\/li>\n<li><strong>Ollama<\/strong> \u2014 Installatore nativo per Windows; i modelli vengono salvati in <code>C:\\Users\\&lt;tuo-utente&gt;\\.ollama\\models<\/code>. Impostare la variabile d'ambiente <code>OLLAMA_MODELS<\/code> per spostarli da unit\u00e0 di sistema. Contesto: <a href=\"https:\/\/convly.ai\/it\/what-is-ollama-complete-guide-2026\/\">che cos'\u00e8 Ollama<\/a>.<\/li>\n<li><strong>Binari precompilati di llama.cpp<\/strong> \u2014 La pagina delle Release su GitHub pubblica build Windows zippate per ogni backend (CUDA, Vulkan, CPU). Estrai l'archivio ed esegui <code>llama-server.exe -m model.gguf -ngl 99<\/code> da PowerShell. Scegli la build CUDA per le GPU NVIDIA; Vulkan \u00e8 la soluzione sicura e compatibile con tutti i vendor (AMD e Intel Arc).<\/li>\n<\/ol>\n<p>Avvertenze specifiche per Windows: la scansione in tempo reale di Windows Defender rallenta il primo caricamento di file multi-gigabyte, mentre eseguire llama.cpp all'interno di WSL2 comporta un consumo aggiuntivo di RAM per la macchina virtuale. Le build native per Windows sono generalmente la via pi\u00f9 semplice.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Loading_an_arbitrary_GGUF_into_Ollama\"><\/span>Caricare un qualsiasi modello GGUF in Ollama<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Le versioni recenti di Ollama possono scaricare direttamente da Hugging Face:<\/p>\n<pre><code>ollama run hf.co\/\/:Q4_K_M<\/code><\/pre>\n<p>Per un file locale, crea un file Modelfile nella stessa directory:<\/p>\n<pre><code>FROM .\/model-Q4_K_M.gguf<\/code><\/pre>\n<p>poi <code>ollama create my-model -f Modelfile<\/code> e <code>ollama run my-model<\/code>. Se il file GGUF non include un template di chat utilizzabile, aggiungi una riga <code>TEMPLATE<\/code> e <code>PARAMETER stop<\/code> \u2014 le direttive supportate nel file Modelfile sono cambiate nel tempo, quindi controlla <code>ollama help create<\/code> per la tua versione. Scelte selezionate: <a href=\"https:\/\/convly.ai\/it\/best-local-llms-to-run-on-ollama-2026\/\">i migliori modelli linguistici locali per Ollama<\/a>.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"When_GGUF_is_the_wrong_answer\"><\/span>Quando GGUF non \u00e8 la soluzione adatta<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>GGUF optimizes one user at a time. Serving many concurrent requests, or needing tensor parallelism across GPUs, points to safetensors with vLLM or SGLang. And running locally is not automatically cheaper: hosted Llama 3.3 70B is $0.10 in \/ $0.32 out per 1M tokens, while frontier hosted models like Claude Sonnet 5 sit at $2.00 in \/ $10.00 out per 1M tokens for 1M context. Run your own volume through the <a href=\"https:\/\/convly.ai\/it\/ai-api-cost-calculator\/\">Calcolatore dei costi API<\/a> e il <a href=\"https:\/\/convly.ai\/it\/self-hosting-vs-api-calculator\/\">Calcolatore del punto di pareggio tra auto-hosting e utilizzo di API<\/a> prima di acquistare una GPU.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Frequently_asked_questions\"><\/span>Domande frequenti<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<h3>Cosa significa GGUF e in che cosa differisce da GGML?<\/h3>\n<p>GGUF sta per GPT-Generated Unified Format. GGML era il formato precedente dello stesso progetto; rompeva la compatibilit\u00e0 ogni volta che venivano introdotti nuovi metadati. GGUF ha aggiunto un blocco estensibile di metadati chiave-valore, consentendo di integrare nuove architetture e opzioni senza invalidare i file esistenti. I file GGML precedenti a GGUF <code>.bin<\/code> non vengono pi\u00f9 caricati nelle versioni attuali di llama.cpp.<\/p>\n<h3>Quale quantizzazione devo scaricare?<\/h3>\n<p>Inizia con Q4_K_M. Se il modello lascia ancora liberi diversi GB di VRAM, passa a Q5_K_M o Q6_K. Se non entra in memoria, preferisci un modello pi\u00f9 piccolo in Q4_K_M piuttosto che lo stesso modello in Q2_K \u2014 un modello da 14 miliardi di parametri a 4 bit offre generalmente prestazioni migliori rispetto a uno da 32 miliardi di parametri forzato a 2 bit. Verifica l'adattamento con la <a href=\"https:\/\/convly.ai\/it\/llm-vram-calculator\/\">Calcolatore VRAM<\/a> alla lunghezza di contesto prevista.<\/p>\n<h3>Posso eseguire modelli GGUF senza una GPU?<\/h3>\n<p>Yes \u2014 CPU-only inference is what GGUF was built for. Speed is bound by memory bandwidth, so expect single-digit tokens per second for a 7B\u20138B model at Q4_K_M on typical dual-channel desktop RAM, and slower for anything larger. Small models like Gemma 3 4B (~3 GB at 4-bit) are the practical CPU-only choice.<\/p>\n<h3>Posso convertire autonomamente un modello di Hugging Face in GGUF?<\/h3>\n<p>S\u00ec. llama.cpp include uno script di conversione (<code>convert_hf_to_gguf.py<\/code> nelle versioni attuali; il nome del file usava trattini nelle versioni precedenti) che genera un file GGUF in F16, dopodich\u00e9 il binario <code>llama-quantize<\/code> lo comprime in una quantizzazione target. Controlla l'opzione <code>--help<\/code> nella copia clonata dello script e verifica che la tua architettura sia supportata prima di avviare la conversione \u2014 le architetture non supportate falliscono durante la fase di conversione.<\/p>\n<h3>I modelli GGUF supportano la visione o le chiamate a strumenti (tool calling)?<\/h3>\n<p>La chiamata agli strumenti (tool calling) funziona quando il template di chat del modello lo definisce esplicitamente e il loader utilizzato rispetta tale template. Per i modelli multimodali \u00e8 necessario un secondo file \u2014 un file GGUF <code>mmproj<\/code> che contiene il proiettore visivo, da caricare insieme ai pesi testuali. Lo strumento multimodale di llama.cpp \u00e8 stato rinominato e riorganizzato pi\u00f9 volte, quindi segui sempre la documentazione corrente del repository anzich\u00e9 tutorial obsoleti.<\/p>\n<h3>La quantizzazione modifica la finestra contestuale?<\/h3>\n<p>No. Il contesto \u00e8 una propriet\u00e0 del modello, non della quantizzazione: Llama 3.3 70B ha un contesto di 128K e Llama 4 Scout di 10M, indipendentemente dal fatto che tu utilizzi F16 o Q4_K_M. Ci\u00f2 che cambia \u00e8 se puoi permetterti la cache KV necessaria per quel contesto nella memoria disponibile. Confronta contesto e costi tra modelli sulla <a href=\"https:\/\/convly.ai\/it\/llm-leaderboard\/\">Classifica LLM<\/a>.<\/p>","protected":false},"excerpt":{"rendered":"<p>GGUF is a single-file container format for quantized models, created for llama.cpp. One .gguf file holds the weights, the tokenizer, [\u2026]<\/p>\n","protected":false},"author":1,"featured_media":2606,"comment_status":"closed","ping_status":"closed","sticky":false,"template":"","format":"standard","meta":{"site-sidebar-layout":"default","site-content-layout":"","ast-site-content-layout":"default","site-content-style":"default","site-sidebar-style":"default","ast-global-header-display":"","ast-banner-title-visibility":"","ast-main-header-display":"","ast-hfb-above-header-display":"","ast-hfb-below-header-display":"","ast-hfb-mobile-header-display":"","site-post-title":"","ast-breadcrumbs-content":"","ast-featured-img":"","footer-sml-layout":"","ast-disable-related-posts":"","theme-transparent-header-meta":"","adv-header-id-meta":"","stick-header-meta":"","header-above-stick-meta":"","header-main-stick-meta":"","header-below-stick-meta":"","astra-migrate-meta-layouts":"default","ast-page-background-enabled":"default","ast-page-background-meta":{"desktop":{"background-color":"var(--ast-global-color-5)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"tablet":{"background-color":"","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"mobile":{"background-color":"","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""}},"ast-content-background-meta":{"desktop":{"background-color":"var(--ast-global-color-4)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"tablet":{"background-color":"var(--ast-global-color-4)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"mobile":{"background-color":"var(--ast-global-color-4)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""}},"footnotes":""},"categories":[7],"tags":[],"class_list":["post-2605","post","type-post","status-publish","format-standard","has-post-thumbnail","hentry","category-ai-news"],"_links":{"self":[{"href":"https:\/\/convly.ai\/it\/wp-json\/wp\/v2\/posts\/2605","targetHints":{"allow":["GET"]}}],"collection":[{"href":"https:\/\/convly.ai\/it\/wp-json\/wp\/v2\/posts"}],"about":[{"href":"https:\/\/convly.ai\/it\/wp-json\/wp\/v2\/types\/post"}],"author":[{"embeddable":true,"href":"https:\/\/convly.ai\/it\/wp-json\/wp\/v2\/users\/1"}],"replies":[{"embeddable":true,"href":"https:\/\/convly.ai\/it\/wp-json\/wp\/v2\/comments?post=2605"}],"version-history":[{"count":1,"href":"https:\/\/convly.ai\/it\/wp-json\/wp\/v2\/posts\/2605\/revisions"}],"predecessor-version":[{"id":2607,"href":"https:\/\/convly.ai\/it\/wp-json\/wp\/v2\/posts\/2605\/revisions\/2607"}],"wp:featuredmedia":[{"embeddable":true,"href":"https:\/\/convly.ai\/it\/wp-json\/wp\/v2\/media\/2606"}],"wp:attachment":[{"href":"https:\/\/convly.ai\/it\/wp-json\/wp\/v2\/media?parent=2605"}],"wp:term":[{"taxonomy":"category","embeddable":true,"href":"https:\/\/convly.ai\/it\/wp-json\/wp\/v2\/categories?post=2605"},{"taxonomy":"post_tag","embeddable":true,"href":"https:\/\/convly.ai\/it\/wp-json\/wp\/v2\/tags?post=2605"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}