{"id":2608,"date":"2026-09-10T20:40:34","date_gmt":"2026-09-10T20:40:34","guid":{"rendered":"https:\/\/convly.ai\/?p=2608"},"modified":"2026-09-10T20:40:34","modified_gmt":"2026-09-10T20:40:34","slug":"gguf-model","status":"publish","type":"post","link":"https:\/\/convly.ai\/it\/gguf-model\/","title":{"rendered":"Formato GGUF: cos\u2019\u00e8 e come eseguirne uno"},"content":{"rendered":"<div class=\"convly-tldr\">\n<ul>\n<li><strong>GGUF<\/strong> (GPT-Generated Unified Format) \u00e8 un formato binario monofile per modelli linguistici di grandi dimensioni quantizzati, introdotto dal progetto llama.cpp nell\u2019agosto 2023 come successore di GGML.<\/li>\n<li>Raggruppa pesi, tokenizer, template di chat e metadati in un unico <code>.gguf<\/code> file eseguibile su CPU, GPU o su una combinazione delle due tramite <strong>llama.cpp<\/strong>, <strong>Ollama<\/strong>, <strong>LM Studio<\/strong>, <strong>KoboldCpp<\/strong> e <strong>text-generation-webui<\/strong>.<\/li>\n<li>Livelli di quantizzazione come <code>Q4_K_M<\/code>, <code>Q5_K_M<\/code> e <code>Q8_0<\/code> sacrificano qualit\u00e0 in cambio di minori dimensioni: una quantizzazione a 4 bit di un modello da 8 miliardi di parametri richiede circa 5 GB di RAM o VRAM.<\/li>\n<li>Scarica i file da Hugging Face (cerca \u00abGGUF\u00bb), caricali con <code>llama-cli -m model.gguf<\/code> o <code>ollama run<\/code>, e scegli una quantizzazione compatibile con il tuo hardware utilizzando la <a href=\"https:\/\/convly.ai\/it\/llm-vram-calculator\/\">Calcolatore VRAM<\/a>.<\/li>\n<\/ul>\n<\/div>\n<p>A <strong>versione GGUF del modello<\/strong> \u00e8 un modello linguistico di grandi dimensioni impacchettato nel formato di file GGUF \u2014 un contenitore monofile che include i pesi quantizzati, il tokenizer, gli iperparametri e il template per i prompt. \u00c8 stato creato da Georgi Gerganov e dal progetto <a href=\"https:\/\/github.com\/ggml-org\/llama.cpp\" rel=\"noopener\" target=\"_blank\">llama.cpp<\/a> project in August 2023 to replace the older GGML format. GGUF is what makes it possible to download one file, point a runtime at it, and get a working local LLM on a laptop or workstation.<\/p>\n<div id=\"ez-toc-container\" class=\"ez-toc-v2_0_87_1 counter-flat ez-toc-counter ez-toc-container-direction\">\n<label for=\"ez-toc-cssicon-toggle-item-6aa323f4364a4\" class=\"ez-toc-cssicon-toggle-label\"><span class=\"\"><span class=\"eztoc-hide\" style=\"display:none;\">Attiva\/Disattiva<\/span><span class=\"ez-toc-icon-toggle-span\"><svg style=\"fill: #000000;color:#000000\" xmlns=\"http:\/\/www.w3.org\/2000\/svg\" class=\"list-377408\" width=\"20px\" height=\"20px\" viewbox=\"0 0 24 24\" fill=\"none\"><path d=\"M6 6H4v2h2V6zm14 0H8v2h12V6zM4 11h2v2H4v-2zm16 0H8v2h12v-2zM4 16h2v2H4v-2zm16 0H8v2h12v-2z\" fill=\"currentColor\"><\/path><\/svg><svg style=\"fill: #000000;color:#000000\" class=\"arrow-unsorted-368013\" xmlns=\"http:\/\/www.w3.org\/2000\/svg\" width=\"10px\" height=\"10px\" viewbox=\"0 0 24 24\" version=\"1.2\" baseprofile=\"tiny\"><path d=\"M18.2 9.3l-6.2-6.3-6.2 6.3c-.2.2-.3.4-.3.7s.1.5.3.7c.2.2.4.3.7.3h11c.3 0 .5-.1.7-.3.2-.2.3-.5.3-.7s-.1-.5-.3-.7zM5.8 14.7l6.2 6.3 6.2-6.3c.2-.2.3-.5.3-.7s-.1-.5-.3-.7c-.2-.2-.4-.3-.7-.3h-11c-.3 0-.5.1-.7.3-.2.2-.3.5-.3.7s.1.5.3.7z\"\/><\/svg><\/span><\/span><\/label><input type=\"checkbox\"  id=\"ez-toc-cssicon-toggle-item-6aa323f4364a4\"  aria-label=\"Attiva\/Disattiva\" \/><nav><ul class='ez-toc-list ez-toc-list-level-1' ><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-1\" href=\"https:\/\/convly.ai\/it\/gguf-model\/#What_GGUF_Actually_Is\" >Cos\u2019\u00e8 realmente GGUF<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-2\" href=\"https:\/\/convly.ai\/it\/gguf-model\/#Quantization_The_Naming_Scheme\" >Quantizzazione: la convenzione di denominazione<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-3\" href=\"https:\/\/convly.ai\/it\/gguf-model\/#Where_to_Get_GGUF_Files\" >Dove trovare i file GGUF<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-4\" href=\"https:\/\/convly.ai\/it\/gguf-model\/#Running_a_GGUF_Model\" >Eseguire un modello GGUF<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-5\" href=\"https:\/\/convly.ai\/it\/gguf-model\/#GGUF_vs_Safetensors_vs_AWQ_vs_GPTQ\" >GGUF vs Safetensors vs AWQ vs GPTQ<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-6\" href=\"https:\/\/convly.ai\/it\/gguf-model\/#When_GGUF_Is_Not_the_Right_Answer\" >Quando GGUF non \u00e8 la soluzione giusta<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-7\" href=\"https:\/\/convly.ai\/it\/gguf-model\/#Converting_a_Model_to_GGUF\" >Convertire un modello in GGUF<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-8\" href=\"https:\/\/convly.ai\/it\/gguf-model\/#Frequently_Asked_Questions\" >Domande frequenti<\/a><\/li><\/ul><\/nav><\/div>\n<h2><span class=\"ez-toc-section\" id=\"What_GGUF_Actually_Is\"><\/span>Cos\u2019\u00e8 realmente GGUF<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>GGUF sta per <em>GPT-Generated Unified Format<\/em>. Strutturalmente \u00e8 un file binario dotato di intestazione, di un blocco di metadati chiave-valore, di un indice dei tensori e dei dati tensoriali stessi. La <a href=\"https:\/\/github.com\/ggml-org\/ggml\/blob\/master\/docs\/gguf.md\" rel=\"noopener\" target=\"_blank\">specifica ufficiale GGUF<\/a> nel repository ggml ne definisce la struttura.<\/p>\n<p>Due propriet\u00e0 sono fondamentali per l\u2019utente:<\/p>\n<ul>\n<li><strong>Autosufficiente.<\/strong> Il file contiene il tokenizer, i token speciali, gli ID EOS\/BOS, il template di chat e i metadati sull\u2019architettura. Non hai bisogno di un file separato <code>tokenizer.json<\/code> o <code>config.json<\/code> accanto ad esso.<\/li>\n<li><strong>Mappabile in memoria.<\/strong> I runtime <code>usano mmap()<\/code> per caricare il file, quindi l\u2019avvio \u00e8 quasi istantaneo e il sistema operativo carica i pesi su richiesta. Questo spiega perch\u00e9 un file GGUF da 40 GB si apre in pochi secondi anche su un SSD lento.<\/li>\n<\/ul>\n<p>GGUF ha sostituito GGML perch\u00e9 quest\u2019ultimo non prevedeva alcun sistema di versioning, mescolava metadati e pesi e si rompeva ogni volta che veniva introdotta una nuova architettura. GGUF invece \u00e8 versionato ed estensibile.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Quantization_The_Naming_Scheme\"><\/span>Quantizzazione: la convenzione di denominazione<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>La maggior parte dei file GGUF che scarichi \u00e8 <em>quantizzata<\/em> \u2014 ovvero i pesi sono memorizzati con meno bit rispetto all\u2019originale in FP16. Il suffisso nel nome del file indica lo schema utilizzato. Le famiglie attuali sono documentate nel <a href=\"https:\/\/github.com\/ggml-org\/llama.cpp\/blob\/master\/tools\/quantize\/README.md\" rel=\"noopener\" target=\"_blank\">README di quantize di llama.cpp<\/a>.<\/p>\n<table>\n<thead>\n<tr>\n<th>Quant<\/th>\n<th>Bit per peso (approssimativi)<\/th>\n<th>Utilizzo tipico<\/th>\n<\/tr>\n<\/thead>\n<tbody>\n<tr>\n<td>Q2_K<\/td>\n<td>~2.6<\/td>\n<td>Pi\u00f9 piccolo, perdita di qualit\u00e0 percettibile<\/td>\n<\/tr>\n<tr>\n<td>Q3_K_M<\/td>\n<td>~3.9<\/td>\n<td>Compressione aggressiva<\/td>\n<\/tr>\n<tr>\n<td>Q4_K_M<\/td>\n<td>~4.8<\/td>\n<td>Valore predefinito pi\u00f9 comune \u2014 buon compromesso tra dimensioni e qualit\u00e0<\/td>\n<\/tr>\n<tr>\n<td>Q5_K_M<\/td>\n<td>~5.7<\/td>\n<td>Qualit\u00e0 superiore, file pi\u00f9 grande<\/td>\n<\/tr>\n<tr>\n<td>Q6_K<\/td>\n<td>~6.6<\/td>\n<td>Quasi senza perdita rispetto a FP16<\/td>\n<\/tr>\n<tr>\n<td>Q8_0<\/td>\n<td>~8.5<\/td>\n<td>Effettivamente senza perdita, circa il doppio della dimensione di Q4<\/td>\n<\/tr>\n<tr>\n<td>F16 \/ BF16<\/td>\n<td>16<\/td>\n<td>Riferimento non quantizzato<\/td>\n<\/tr>\n<\/tbody>\n<\/table>\n<p>Il <code>_K<\/code> Le varianti k-quants usano una precisione variabile per blocco di tensori. I suffissi <code>_M<\/code> \/ <code>_S<\/code> \/ <code>_L<\/code> indicano preset di miscelazione a blocchi di media, piccola o grande dimensione. Le varianti pi\u00f9 recenti (es. <code>IQ<\/code> IQ4_XS <code>) utilizzano una calibrazione basata su matrice di importanza per ottenere una qualit\u00e0 migliore con lo stesso budget di bit.<\/code>utilizza la calibrazione della matrice di importanza per ottenere una qualit\u00e0 superiore con lo stesso budget di bit.<\/p>\n<p>Come regola generale per la VRAM, prendi la dimensione del file su disco e aggiungi circa 1\u20133 GB per la cache KV in contesti brevi, e ancora di pi\u00f9 per contesti lunghi. Da <a href=\"https:\/\/convly.ai\/it\/models\/\">database dei modelli Convly<\/a>: Llama 3.1 8B needs around 5&nbsp;GB at 4-bit, Llama 3.3 70B around 40&nbsp;GB, and Mistral 7B around 4.5&nbsp;GB. For anything larger, the <a href=\"https:\/\/convly.ai\/it\/vram-requirements-every-major-llm-2026\/\">tabella dei requisiti di VRAM<\/a> \u00e8 la ricerca pi\u00f9 veloce.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Where_to_Get_GGUF_Files\"><\/span>Dove trovare i file GGUF<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Quasi tutte le distribuzioni GGUF avvengono su Hugging Face. Cerca il nome del modello seguito da \u00abGGUF\u00bb. Tra i re-quantizzatori affidabili figurano <strong>bartowski<\/strong>, <strong>Qwen<\/strong> (ufficiale per Qwen3), <strong>lmstudio-community<\/strong>, <strong>unsloth<\/strong> e <strong>MaziyarPanahi<\/strong>. Meta, Google, Mistral and Microsoft publish some official GGUF builds; for others the community quantizes from the released safetensors.<\/p>\n<p>Un repository contiene tipicamente un file per ogni livello di quantizzazione, ad esempio <code>Meta-Llama-3.1-8B-Instruct-Q4_K_M.gguf<\/code>. Per modelli superiori ai ~50&nbsp;GB, il file \u00e8 suddiviso in frammenti (shard) denominati <code>-00001-of-00003.gguf<\/code>; i runtime li caricano automaticamente a partire dal primo shard.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Running_a_GGUF_Model\"><\/span>Eseguire un modello GGUF<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<h3>Linux<\/h3>\n<p>Compila llama.cpp da sorgente oppure installa il binario precompilato. Con CUDA:<\/p>\n<pre><code>git clone https:\/\/github.com\/ggml-org\/llama.cpp\ncd llama.cpp\ncmake -B build -DGGML_CUDA=ON\ncmake --build build --config Release -j\n.\/build\/bin\/llama-cli -m ~\/models\/llama-3.1-8b-instruct-Q4_K_M.gguf \n    -p \"Spiega GGUF in un solo paragrafo.\" -n 256 -ngl 99<\/code><\/pre>\n<p>Il <code>-ngl<\/code> Il flag \u00abn-gpu-layers\u00bb determina quanti strati del transformer vengono spostati sulla GPU. Impostalo abbastanza alto da far entrare l\u2019intero modello nella VRAM; se esaurisci memoria, riducilo e i restanti strati rimarranno sulla CPU. Per esporre un\u2019API HTTP compatibile con OpenAI, usa <code>llama-server<\/code> che di default ascolta sulla porta 8080.<\/p>\n<h3>macOS<\/h3>\n<p>Su Apple Silicon, llama.cpp utilizza automaticamente il backend Metal. Installalo tramite Homebrew:<\/p>\n<pre><code>brew install llama.cpp\nllama-cli -m ~\/models\/qwen3-8b-Q5_K_M.gguf -p \"Ciao\" -ngl 99<\/code><\/pre>\n<p>La memoria unificata implica che il limite massimo \u00e8 rappresentato dalla RAM totale meno l\u2019overhead del sistema operativo. Un Mac con chip M da 32&nbsp;GB gestisce agevolmente Qwen3 da 14B o <code>-ngl<\/code> ceiling is your total RAM minus the OS overhead. A 32&nbsp;GB M-series Mac comfortably runs Qwen3 14B or Gemma 3 12B at Q4_K_M &mdash; the database lists those at ~9&nbsp;GB and ~8&nbsp;GB of VRAM respectively.<\/p>\n<p>Per un\u2019interfaccia grafica (GUI), <a href=\"https:\/\/convly.ai\/it\/lm-studio-complete-guide-2026\/\">LM Studio<\/a> \u00e8 la scelta pi\u00f9 comune su Mac. Scarica automaticamente i file GGUF da Hugging Face e fornisce un server locale compatibile con l\u2019API OpenAI.<\/p>\n<h3>Windows<\/h3>\n<p>Tre percorsi pratici:<\/p>\n<ul>\n<li><strong>Ollama.<\/strong> Installa da <a href=\"https:\/\/ollama.com\/download\" rel=\"noopener\" target=\"_blank\">ollama.com\/download<\/a>, quindi <code>ollama run llama3.1:8b<\/code>. Ollama scarica autonomamente le proprie versioni curate di GGUF. Per caricare un file arbitrario, crea un file Modelfile contenente una riga <code>FROM .\/mymodel.gguf<\/code> ed esegui <code>ollama create mymodel -f Modelfile<\/code>. Consulta la nostra <a href=\"https:\/\/convly.ai\/it\/how-to-install-ollama-2026\/\">Guida all'installazione di Ollama<\/a>.<\/li>\n<li><strong>LM Studio.<\/strong> Installazione in un clic, navigazione e download di GGUF tramite interfaccia grafica, con regolatore per l\u2019offload GPU.<\/li>\n<li><strong>binari precompilati di llama.cpp.<\/strong> Il progetto fornisce zippati precompilati per Windows (CPU, CUDA e Vulkan) sulla <a href=\"https:\/\/github.com\/ggml-org\/llama.cpp\/releases\" rel=\"noopener\" target=\"_blank\">pagina delle release su GitHub<\/a>. Estrai l\u2019archivio ed esegui <code>llama-cli.exe<\/code> nello stesso modo usato su Linux.<\/li>\n<\/ul>\n<p>Per quanto riguarda la scelta della GPU, la <a href=\"https:\/\/convly.ai\/it\/best-gpus-for-local-llms-2026\/\">guida GPU per LLM locali<\/a> illustra le attuali opzioni rapporto prezzo\/VRAM.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"GGUF_vs_Safetensors_vs_AWQ_vs_GPTQ\"><\/span>GGUF vs Safetensors vs AWQ vs GPTQ<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<table>\n<thead>\n<tr>\n<th>Formato<\/th>\n<th>Runtime principale<\/th>\n<th>Precisione<\/th>\n<th>Ideale per<\/th>\n<\/tr>\n<\/thead>\n<tbody>\n<tr>\n<td>GGUF<\/td>\n<td>llama.cpp, Ollama, LM Studio<\/td>\n<td>2\u20138 bit + F16<\/td>\n<td>CPU, inferenza mista CPU\/GPU, Apple Silicon, singolo utente<\/td>\n<\/tr>\n<tr>\n<td>Safetensors (FP16\/BF16)<\/td>\n<td>Transformers, vLLM<\/td>\n<td>16 bit<\/td>\n<td>Addestramento, ricerca, inferenza in piena precisione<\/td>\n<\/tr>\n<tr>\n<td>AWQ<\/td>\n<td>vLLM, AutoAWQ<\/td>\n<td>4 bit<\/td>\n<td>Servizio GPU ad alta velocit\u00e0 di elaborazione<\/td>\n<\/tr>\n<tr>\n<td>GPTQ<\/td>\n<td>vLLM, ExLlamaV2<\/td>\n<td>3\u20138 bit<\/td>\n<td>Inferenza GPU-only con batching<\/td>\n<\/tr>\n<tr>\n<td>MLX<\/td>\n<td>MLX (Apple)<\/td>\n<td>4\u201316 bit<\/td>\n<td>Solo per Apple Silicon<\/td>\n<\/tr>\n<\/tbody>\n<\/table>\n<p>Scegli GGUF quando il target \u00e8 un singolo utente su hardware eterogeneo o quando vuoi garantire che il modello possa essere eseguito anche su CPU. Scegli vLLM con safetensors AWQ\/GPTQ quando devi servire molti utenti concorrenti su una GPU datacenter.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"When_GGUF_Is_Not_the_Right_Answer\"><\/span>Quando GGUF non \u00e8 la soluzione giusta<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>GGUF presuppone inferenza monostream con batch size pari a 1. Il throughput \u00e8 molto inferiore rispetto a vLLM o TensorRT-LLM sotto carico concorrente e non supporta l\u2019attenzione paginata (paged attention). Se stai esponendo un\u2019API destinata a traffico reale, un deployment in FP16 o AWQ su vLLM superer\u00e0 GGUF in termini di token\/sec\/dollaro, anche prima di considerare il tempo di sviluppo impiegato.<\/p>\n<p>It also breaks down at the top end of model size. Kimi K3 needs ~1.4&nbsp;TB of VRAM at 4-bit and DeepSeek V4-Pro around 800&nbsp;GB &mdash; those are multi-node deployments, not desktop GGUF workloads. And for frontier hosted models like <a href=\"https:\/\/convly.ai\/it\/models\/\">Claude Sonnet 4.6<\/a> a 3 USD in ingresso \/ 15 USD in uscita per ogni milione di token oppure Gemini 3.6 Flash a 1,50 USD in ingresso \/ 7,50 USD in uscita, non esistono pesi locali da convertire. Fai i conti sul <a href=\"https:\/\/convly.ai\/it\/self-hosting-vs-api-calculator\/\">calcolatore self-hosting vs API<\/a> prima di impegnarti nell\u2019acquisto di una GPU.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Converting_a_Model_to_GGUF\"><\/span>Convertire un modello in GGUF<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Se un modello \u00e8 disponibile su Hugging Face in formato safetensors ma nessuno lo ha ancora quantizzato, il flusso di lavoro \u00e8 il seguente:<\/p>\n<pre><code># nella repository llama.cpp\npip install -r requirements.txt\npython convert_hf_to_gguf.py \/percorso\/verso\/hf-model --outfile model-f16.gguf\n.\/build\/bin\/llama-quantize model-f16.gguf model-Q4_K_M.gguf Q4_K_M<\/code><\/pre>\n<p>Lo script di conversione supporta soltanto le architetture gi\u00e0 integrate in llama.cpp \u2014 ad esempio llama, mistral, qwen2\/3, gemma, phi e una lista sempre crescente di altre. Per architetture nuove \u00e8 necessario prima modificare il codice. I nomi dei file e le opzioni della riga di comando nello script sono cambiati tra le diverse versioni di llama.cpp, quindi verifica <code>python convert_hf_to_gguf.py --help<\/code> rispetto al commit su cui hai eseguito la compilazione.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Frequently_Asked_Questions\"><\/span>Domande frequenti<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<h3>GGUF \u00e8 la stessa cosa di GGML?<\/h3>\n<p>No. GGML era il formato precedente utilizzato da llama.cpp fino a met\u00e0 2023. GGUF lo ha sostituito ad agosto 2023 introducendo un\u2019intestazione con numero di versione, metadati incorporati e un layout stabile dei tensori. I vecchi file <code>.bin<\/code> GGML non vengono pi\u00f9 caricati dalla versione attuale di llama.cpp; devi trovare una versione GGUF gi\u00e0 riquantizzata.<\/p>\n<h3>Quale quantizzazione devo scaricare?<\/h3>\n<p>Inizia con <code>Q4_K_M<\/code>. \u00c8 il formato che garantisce la massima compatibilit\u00e0 con l\u2019hardware disponibile e comporta una perdita di qualit\u00e0 minima rispetto all\u2019FP16 per la maggior parte dei modelli con oltre 7 miliardi di parametri. Passa a <code>Q5_K_M<\/code> o <code>Q6_K<\/code> se hai VRAM in eccesso e ti interessa migliorare l\u2019accuratezza nelle attivit\u00e0 di programmazione o ragionamento. Scendi a <code>Q3_K_M<\/code> oppure a una variante <code>IQ3<\/code> solo se il modello non riesce ad adattarsi alla memoria disponibile in alcun altro modo.<\/p>\n<h3>Can GGUF models use my GPU?<\/h3>\n<p>S\u00ec. llama.cpp supporta CUDA (NVIDIA), ROCm (AMD), Metal (Apple), Vulkan (multi-vendor) e SYCL (Intel). L\u2019opzione <code>-ngl<\/code> trasferisce i layer sulla GPU. Se l\u2019intero modello entra nella VRAM, le prestazioni in termini di throughput sono vicine a quelle ottenibili con runtime GPU dedicati; nel caso di offload parziale, la velocit\u00e0 dipende dal livello pi\u00f9 lento (CPU o GPU) che contiene il layer pi\u00f9 lento.<\/p>\n<h3>GGUF funziona con modelli per visione o audio?<\/h3>\n<p>Parzialmente. llama.cpp supporta modelli multimediali nello stile di LLaVA tramite un file <code>mmproj<\/code> GGUF abbinato che contiene il proiettore visivo. Il supporto per Qwen-VL, Gemma 3 Vision e modelli simili \u00e8 stato progressivamente aggiunto nel tempo, ma rimane in ritardo rispetto alle versioni testuali. I modelli audio come Whisper utilizzano invece un proprio formato correlato gestito da <code>whisper.cpp<\/code>, non dal binario principale di llama.cpp.<\/p>\n<h3>Come scelgo un modello GGUF adatto al mio hardware?<\/h3>\n<p>Cerca il modello nel <a href=\"https:\/\/convly.ai\/it\/models\/\">database dei modelli Convly<\/a> per conoscere il suo consumo di VRAM in versione 4-bit, quindi sottrai 1\u20133 GB di margine per il contesto e l\u2019overhead del sistema operativo. Su una GPU da 24 GB, Qwen3 32B (~20 GB) o Gemma 3 27B (~16 GB) in Q4 sono scelte confortevoli. Il <a href=\"https:\/\/convly.ai\/it\/llm-vram-calculator\/\">Calcolatore VRAM<\/a> gestisce contesti pi\u00f9 lunghi, il che fa crescere significativamente la cache KV.<\/p>\n<h3>I file GGUF sono sicuri da eseguire?<\/h3>\n<p>The weights themselves are just numbers &mdash; unlike Python pickle-based checkpoints, GGUF does not execute code on load. The risk is a maliciously crafted file triggering a parser bug in the runtime. Stick to known Hugging Face uploaders (bartowski, unsloth, lmstudio-community, official vendor accounts) and keep llama.cpp, Ollama or LM Studio updated.<\/p>","protected":false},"excerpt":{"rendered":"<p>GGUF (GPT-Generated Unified Format) is a single-file binary format for quantized large language models, introduced by the llama.cpp project in [\u2026]<\/p>\n","protected":false},"author":1,"featured_media":2609,"comment_status":"closed","ping_status":"closed","sticky":false,"template":"","format":"standard","meta":{"site-sidebar-layout":"default","site-content-layout":"","ast-site-content-layout":"default","site-content-style":"default","site-sidebar-style":"default","ast-global-header-display":"","ast-banner-title-visibility":"","ast-main-header-display":"","ast-hfb-above-header-display":"","ast-hfb-below-header-display":"","ast-hfb-mobile-header-display":"","site-post-title":"","ast-breadcrumbs-content":"","ast-featured-img":"","footer-sml-layout":"","ast-disable-related-posts":"","theme-transparent-header-meta":"","adv-header-id-meta":"","stick-header-meta":"","header-above-stick-meta":"","header-main-stick-meta":"","header-below-stick-meta":"","astra-migrate-meta-layouts":"default","ast-page-background-enabled":"default","ast-page-background-meta":{"desktop":{"background-color":"var(--ast-global-color-5)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"tablet":{"background-color":"","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"mobile":{"background-color":"","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""}},"ast-content-background-meta":{"desktop":{"background-color":"var(--ast-global-color-4)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"tablet":{"background-color":"var(--ast-global-color-4)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"mobile":{"background-color":"var(--ast-global-color-4)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""}},"footnotes":""},"categories":[7],"tags":[],"class_list":["post-2608","post","type-post","status-publish","format-standard","has-post-thumbnail","hentry","category-ai-news"],"_links":{"self":[{"href":"https:\/\/convly.ai\/it\/wp-json\/wp\/v2\/posts\/2608","targetHints":{"allow":["GET"]}}],"collection":[{"href":"https:\/\/convly.ai\/it\/wp-json\/wp\/v2\/posts"}],"about":[{"href":"https:\/\/convly.ai\/it\/wp-json\/wp\/v2\/types\/post"}],"author":[{"embeddable":true,"href":"https:\/\/convly.ai\/it\/wp-json\/wp\/v2\/users\/1"}],"replies":[{"embeddable":true,"href":"https:\/\/convly.ai\/it\/wp-json\/wp\/v2\/comments?post=2608"}],"version-history":[{"count":1,"href":"https:\/\/convly.ai\/it\/wp-json\/wp\/v2\/posts\/2608\/revisions"}],"predecessor-version":[{"id":2610,"href":"https:\/\/convly.ai\/it\/wp-json\/wp\/v2\/posts\/2608\/revisions\/2610"}],"wp:featuredmedia":[{"embeddable":true,"href":"https:\/\/convly.ai\/it\/wp-json\/wp\/v2\/media\/2609"}],"wp:attachment":[{"href":"https:\/\/convly.ai\/it\/wp-json\/wp\/v2\/media?parent=2608"}],"wp:term":[{"taxonomy":"category","embeddable":true,"href":"https:\/\/convly.ai\/it\/wp-json\/wp\/v2\/categories?post=2608"},{"taxonomy":"post_tag","embeddable":true,"href":"https:\/\/convly.ai\/it\/wp-json\/wp\/v2\/tags?post=2608"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}