{"id":2199,"date":"2026-08-14T06:18:40","date_gmt":"2026-08-14T06:18:40","guid":{"rendered":"https:\/\/convly.ai\/?p=2199"},"modified":"2026-08-14T06:18:40","modified_gmt":"2026-08-14T06:18:40","slug":"ollama-gpt-oss-guide","status":"publish","type":"post","link":"https:\/\/convly.ai\/it\/ollama-gpt-oss-guide\/","title":{"rendered":"Ollama GPT OSS: eseguire modelli linguistici di grandi dimensioni open source in locale (guida)"},"content":{"rendered":"<div class=\"convly-tldr\"><strong>In breve<\/strong><\/p>\n<ul>\n<li>OpenAI non ha rilasciato una famiglia di modelli denominata \u00abGPT-OSS\u00bb. Il termine di ricerca fa probabilmente riferimento all\u2019esecuzione di alternative open source (Llama 3, Mistral, Qwen) tramite Ollama.<\/li>\n<li>Ollama esegue localmente centinaia di modelli con pesi aperti. Alcune opzioni popolari: <code>ollama pull llama3.1:8b<\/code>, <code>ollama pull mistral:7b<\/code>, <code>ollama pull qwen2.5:7b<\/code>.<\/li>\n<li>Esigenze di VRAM: i modelli da 7 miliardi di parametri richiedono 6\u20138 GB (quantizzazione Q4), quelli da 13 miliardi ne richiedono 10\u201314 GB e quelli da 70 miliardi ne richiedono 40\u201348 GB. Per stimare le esigenze, utilizzare il <a href=\"https:\/\/convly.ai\/it\/llm-vram-calculator\/\">Calcolatore VRAM<\/a> calcolatore.<\/li>\n<li>I modelli quantizzati (Q4, Q5) si adattano alle GPU consumer con una perdita minima di qualit\u00e0. L\u2019FP16 garantisce la massima qualit\u00e0, ma raddoppia l\u2019uso di VRAM.<\/li>\n<\/ul>\n<\/div>\n<p>Se hai cercato \u00abollama gpt oss\u00bb, probabilmente desideri eseguire localmente modelli linguistici di grandi dimensioni open source tramite Ollama \u2014 tuttavia OpenAI non ha rilasciato una famiglia di modelli open weight chiamata \u00abGPT-OSS\u00bb. OpenAI ha reso disponibile GPT-2 nel 2019 come modello open weight, ma i suoi modelli pi\u00f9 recenti (GPT-4, GPT-4o, GPT-4.1) rimangono prodotti proprietari accessibili esclusivamente tramite API. Ci\u00f2 che <em>non<\/em> esiste invece sono centinaia di modelli open weight provenienti da Meta (Llama), Mistral AI, Alibaba (Qwen) e altri, che \u00e8 possibile scaricare ed eseguire tramite Ollama sul proprio hardware. Questa guida illustra quali modelli funzionano, la quantit\u00e0 di VRAM richiesta per ciascuna dimensione, come la quantizzazione influisce sulla qualit\u00e0 e come tali modelli si confrontano tra loro.<\/p>\n<div id=\"ez-toc-container\" class=\"ez-toc-v2_0_86 counter-flat ez-toc-counter ez-toc-container-direction\">\n<label for=\"ez-toc-cssicon-toggle-item-6a7ee9c9cae24\" class=\"ez-toc-cssicon-toggle-label\"><span class=\"\"><span class=\"eztoc-hide\" style=\"display:none;\">Attiva\/Disattiva<\/span><span class=\"ez-toc-icon-toggle-span\"><svg style=\"fill: #000000;color:#000000\" xmlns=\"http:\/\/www.w3.org\/2000\/svg\" class=\"list-377408\" width=\"20px\" height=\"20px\" viewbox=\"0 0 24 24\" fill=\"none\"><path d=\"M6 6H4v2h2V6zm14 0H8v2h12V6zM4 11h2v2H4v-2zm16 0H8v2h12v-2zM4 16h2v2H4v-2zm16 0H8v2h12v-2z\" fill=\"currentColor\"><\/path><\/svg><svg style=\"fill: #000000;color:#000000\" class=\"arrow-unsorted-368013\" xmlns=\"http:\/\/www.w3.org\/2000\/svg\" width=\"10px\" height=\"10px\" viewbox=\"0 0 24 24\" version=\"1.2\" baseprofile=\"tiny\"><path d=\"M18.2 9.3l-6.2-6.3-6.2 6.3c-.2.2-.3.4-.3.7s.1.5.3.7c.2.2.4.3.7.3h11c.3 0 .5-.1.7-.3.2-.2.3-.5.3-.7s-.1-.5-.3-.7zM5.8 14.7l6.2 6.3 6.2-6.3c.2-.2.3-.5.3-.7s-.1-.5-.3-.7c-.2-.2-.4-.3-.7-.3h-11c-.3 0-.5.1-.7.3-.2.2-.3.5-.3.7s.1.5.3.7z\"\/><\/svg><\/span><\/span><\/label><input type=\"checkbox\"  id=\"ez-toc-cssicon-toggle-item-6a7ee9c9cae24\"  aria-label=\"Attiva\/Disattiva\" \/><nav><ul class='ez-toc-list ez-toc-list-level-1' ><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-1\" href=\"https:\/\/convly.ai\/it\/ollama-gpt-oss-guide\/#What_Ollama_Actually_Runs\" >Cosa esegue effettivamente Ollama<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-2\" href=\"https:\/\/convly.ai\/it\/ollama-gpt-oss-guide\/#Open-Source_Model_Families_Available_in_Ollama\" >Famiglie di modelli open source disponibili in Ollama<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-3\" href=\"https:\/\/convly.ai\/it\/ollama-gpt-oss-guide\/#Pulling_and_Running_a_Model\" >Scaricare ed eseguire un modello<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-4\" href=\"https:\/\/convly.ai\/it\/ollama-gpt-oss-guide\/#Parameter_Sizes_and_VRAM_Requirements\" >Dimensioni dei parametri e requisiti di VRAM<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-5\" href=\"https:\/\/convly.ai\/it\/ollama-gpt-oss-guide\/#Quantization_Quality_vs_VRAM_Trade-Off\" >Quantizzazione: compromesso tra qualit\u00e0 e VRAM<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-6\" href=\"https:\/\/convly.ai\/it\/ollama-gpt-oss-guide\/#Performance_Comparison_7B_Class\" >Confronto delle prestazioni: classe da 7 miliardi di parametri<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-7\" href=\"https:\/\/convly.ai\/it\/ollama-gpt-oss-guide\/#Which_Model_to_Pick\" >Quale modello scegliere<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-8\" href=\"https:\/\/convly.ai\/it\/ollama-gpt-oss-guide\/#When_to_Self-Host_vs_Use_an_API\" >Quando eseguire autonomamente rispetto all\u2019uso di un\u2019API<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-9\" href=\"https:\/\/convly.ai\/it\/ollama-gpt-oss-guide\/#Platform-Specific_Notes\" >Note specifiche per piattaforma<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-10\" href=\"https:\/\/convly.ai\/it\/ollama-gpt-oss-guide\/#Frequently_Asked_Questions\" >Domande frequenti<\/a><\/li><\/ul><\/nav><\/div>\n<h2><span class=\"ez-toc-section\" id=\"What_Ollama_Actually_Runs\"><\/span>Cosa esegue effettivamente Ollama<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Ollama \u00e8 un motore di inferenza locale che scarica, quantizza ed esegue modelli linguistici di grandi dimensioni con pesi aperti su macOS, Linux e Windows. Non ospita modelli OpenAI. Il <a href=\"https:\/\/convly.ai\/it\/ollama-models-list-2026\/\">Elenco modelli Ollama<\/a> includes Llama 3.1, Mistral 7B, Qwen 2.5, Gemma 2, Phi-3, and dozens more. Each model is available in multiple quantization levels (Q4_K_M, Q5_K_M, FP16) to trade VRAM for quality.<\/p>\n<p>Istruzioni complete per l\u2019installazione: <a href=\"https:\/\/convly.ai\/it\/how-to-install-ollama-2026\/\">come installare Ollama<\/a>.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Open-Source_Model_Families_Available_in_Ollama\"><\/span>Famiglie di modelli open source disponibili in Ollama<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<table>\n<thead>\n<tr>\n<th>Famiglia di modelli<\/th>\n<th>Sviluppatore<\/th>\n<th>Dimensioni dei parametri<\/th>\n<th>Licenza<\/th>\n<th>Caratteristiche principali<\/th>\n<\/tr>\n<\/thead>\n<tbody>\n<tr>\n<td>Llama 3.1<\/td>\n<td>Meta<\/td>\n<td>8B, 70B, 405B<\/td>\n<td>Llama 3.1 (licenza commerciale permessa)<\/td>\n<td>Migliore ragionamento generale per ogni classe di dimensioni<\/td>\n<\/tr>\n<tr>\n<td>Mistral<\/td>\n<td>Mistral AI<\/td>\n<td>7B, 22B (Mixtral 8x7B)<\/td>\n<td>Apache 2.0<\/td>\n<td>Veloce, efficiente e particolarmente valido per la programmazione<\/td>\n<\/tr>\n<tr>\n<td>Qwen 2.5<\/td>\n<td>Alibaba<\/td>\n<td>0,5B, 1,5B, 3B, 7B, 14B, 32B, 72B<\/td>\n<td>Apache 2.0<\/td>\n<td>Multilingue, contesto lungo (128k)<\/td>\n<\/tr>\n<tr>\n<td>Gemma 2<\/td>\n<td>Google<\/td>\n<td>2B, 9B, 27B<\/td>\n<td>Gemma (licenza commerciale permessa)<\/td>\n<td>Leggero e veloce, eseguibile anche su CPU<\/td>\n<\/tr>\n<tr>\n<td>Phi-3.5<\/td>\n<td>Microsoft<\/td>\n<td>3,8B (mini), 14B (medium)<\/td>\n<td>MIT<\/td>\n<td>Compatto e performante nei benchmark di ragionamento<\/td>\n<\/tr>\n<\/tbody>\n<\/table>\n<p>Il <a href=\"https:\/\/convly.ai\/it\/models\/\">Database di modelli IA<\/a> elencano specifiche tecniche, requisiti di VRAM e prezzi per 37 modelli, inclusi tutti quelli sopra citati.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Pulling_and_Running_a_Model\"><\/span>Scaricare ed eseguire un modello<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Una volta installato Ollama, scarica un modello con il comando <code>ollama pull &lt;modello&gt;:&lt;tag&gt;<\/code>. Il tag specifica il numero di parametri e il livello di quantizzazione. Esempi:<\/p>\n<pre><code>ollama pull llama3.1:8b\nollama pull mistral:7b-instruct-q4_K_M\nollama pull qwen2.5:7b\nollama pull gemma2:9b<\/code><\/pre>\n<p>Esegui il modello:<\/p>\n<pre><code>ollama run llama3.1:8b<\/code><\/pre>\n<p>Questo avvia una sessione interattiva di chat. Digita il tuo prompt, premi Invio e il modello genera una risposta in locale. Per uscire, digita <code>\/bye<\/code>.<\/p>\n<p>Per utilizzare il modello a livello programmatico tramite l\u2019API:<\/p>\n<pre><code>curl http:\/\/localhost:11434\/api\/generate -d '{\n  \"model\": \"llama3.1:8b\",\n  \"prompt\": \"Spiega la ricorsione in una frase.\"\n}'<\/code><\/pre>\n<p>Ollama espone un endpoint compatibile con l\u2019API OpenAI, <code>\/v1\/chat\/completions<\/code> quindi \u00e8 possibile reindirizzare il codice esistente basato sull\u2019SDK OpenAI verso <code>http:\/\/localhost:11434<\/code> e sostituire il modello remoto con uno locale.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Parameter_Sizes_and_VRAM_Requirements\"><\/span>Dimensioni dei parametri e requisiti di VRAM<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>La dimensione del modello (7B, 13B, 70B) determina sia la qualit\u00e0 delle prestazioni sia l\u2019impronta di VRAM. Modelli pi\u00f9 grandi offrono migliori capacit\u00e0 di ragionamento, ma richiedono maggiore memoria GPU. La quantizzazione (Q4, Q5, FP16) comprime i pesi per ridurre l\u2019uso di VRAM, con un lieve impatto sulla qualit\u00e0.<\/p>\n<table>\n<thead>\n<tr>\n<th>Numero di parametri<\/th>\n<th>Quantizzazione<\/th>\n<th>VRAM (approssimativa)<\/th>\n<th>Modelli di esempio<\/th>\n<th>Raccomandazione GPU<\/th>\n<\/tr>\n<\/thead>\n<tbody>\n<tr>\n<td>7B<\/td>\n<td>Q4_K_M<\/td>\n<td>4,5 GB<\/td>\n<td>Llama 3.1 8B, Mistral 7B<\/td>\n<td>RTX 3060 (12 GB), RTX 4060 Ti (16 GB)<\/td>\n<\/tr>\n<tr>\n<td>7B<\/td>\n<td>Q5_K_M<\/td>\n<td>5,5 GB<\/td>\n<td>Come sopra<\/td>\n<td>Stesso<\/td>\n<\/tr>\n<tr>\n<td>7B<\/td>\n<td>FP16<\/td>\n<td>14 GB<\/td>\n<td>Come sopra<\/td>\n<td>RTX 4060 Ti (16 GB), RTX 4070<\/td>\n<\/tr>\n<tr>\n<td>13B<\/td>\n<td>Q4_K_M<\/td>\n<td>8 GB<\/td>\n<td>Qwen 2.5 14B, Phi-3.5 14B<\/td>\n<td>RTX 3060 (12 GB), RTX 4060 Ti (16 GB)<\/td>\n<\/tr>\n<tr>\n<td>13B<\/td>\n<td>FP16<\/td>\n<td>26 GB<\/td>\n<td>Stesso<\/td>\n<td>RTX 4090 (24 GB) o A5000 (24 GB)<\/td>\n<\/tr>\n<tr>\n<td>70B<\/td>\n<td>Q4_K_M<\/td>\n<td>40 GB<\/td>\n<td>Llama 3.1 70B, Qwen 2.5 72B<\/td>\n<td>A100 (40\/80 GB) o doppia RTX 3090 (48 GB totali)<\/td>\n<\/tr>\n<tr>\n<td>70B<\/td>\n<td>FP16<\/td>\n<td>140 GB<\/td>\n<td>Stesso<\/td>\n<td>Configurazione multi-GPU o A100 da 80 GB<\/td>\n<\/tr>\n<\/tbody>\n<\/table>\n<p>Usa la <a href=\"https:\/\/convly.ai\/it\/llm-vram-calculator\/\">Calcolatore VRAM<\/a> per stimare le esigenze di memoria per qualsiasi modello e livello di quantizzazione. Il <a href=\"https:\/\/convly.ai\/it\/vram-requirements-every-major-llm-2026\/\">Guida ai requisiti di VRAM<\/a> elenco riporta valori precisi per ogni modello principale.<\/p>\n<p>Per decisioni sull\u2019acquisto di una GPU, consulta <a href=\"https:\/\/convly.ai\/it\/best-gpus-for-local-llms-2026\/\">migliori GPU per eseguire LLM localmente<\/a>.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Quantization_Quality_vs_VRAM_Trade-Off\"><\/span>Quantizzazione: compromesso tra qualit\u00e0 e VRAM<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>La quantizzazione riduce la precisione dei pesi del modello da numeri in virgola mobile a 16 bit (FP16) a interi a 4 o 5 bit (Q4, Q5). Ci\u00f2 riduce la VRAM del 60\u201375% con una perdita minima di qualit\u00e0 per la maggior parte dei compiti.<\/p>\n<ul>\n<li><strong>Q4_K_M<\/strong>: Quantizzazione a 4 bit. Minima occupazione di VRAM, leggera perdita di qualit\u00e0 nel ragionamento complesso. Ideale per chatbot, riassunti e completamento del codice.<\/li>\n<li><strong>Q5_K_M<\/strong>: Quantizzazione a 5 bit. Occupa circa il 20% in pi\u00f9 di VRAM rispetto a Q4, con qualit\u00e0 molto vicina a quella FP16. Il miglior compromesso per la maggior parte degli utenti.<\/li>\n<li><strong>Q8_0<\/strong>: Quantizzazione a 8 bit. Qualit\u00e0 quasi equivalente a FP16, con una riduzione del 50% della VRAM. Da utilizzare solo se si dispone di sufficiente spazio VRAM disponibile.<\/li>\n<li><strong>FP16<\/strong>: Precisione completa. Massima qualit\u00e0, ma richiede il doppio della VRAM rispetto a Q4. Necessaria soltanto per scopi di ricerca o qualora le regressioni qualitative non siano accettabili.<\/li>\n<\/ul>\n<p>Example: Llama 3.1 8B at Q4_K_M uses 4.5 GB and scores 67.2 on MMLU. At FP16 it uses 14 GB and scores 68.1 on MMLU. For most tasks the 0.9-point difference is imperceptible.<\/p>\n<p>Per scaricare una specifica versione quantizzata:<\/p>\n<pre><code>ollama pull llama3.1:8b-instruct-q4_K_M\nollama pull llama3.1:8b-instruct-fp16<\/code><\/pre>\n<p>Se non specifichi il tag di quantizzazione, Ollama utilizza per impostazione predefinita Q4_K_M.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Performance_Comparison_7B_Class\"><\/span>Confronto delle prestazioni: classe da 7 miliardi di parametri<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>La classe di modelli da 7B a 8B \u00e8 la pi\u00f9 popolare per l\u2019uso locale: si adatta alle GPU consumer ed eroga ottime prestazioni in ambiti come programmazione, ragionamento e conversazione.<\/p>\n<table>\n<thead>\n<tr>\n<th>Modello<\/th>\n<th>MMLU (zero-shot)<\/th>\n<th>HumanEval (pass@1)<\/th>\n<th>Lunghezza del contesto<\/th>\n<th>VRAM (Q4)<\/th>\n<\/tr>\n<\/thead>\n<tbody>\n<tr>\n<td>Llama 3.1 8B<\/td>\n<td>67.2<\/td>\n<td>62.2<\/td>\n<td>128k<\/td>\n<td>4,5 GB<\/td>\n<\/tr>\n<tr>\n<td>Mistral 7B v0.3<\/td>\n<td>62.5<\/td>\n<td>40.2<\/td>\n<td>32k<\/td>\n<td>4,1 GB<\/td>\n<\/tr>\n<tr>\n<td>Qwen 2.5 7B<\/td>\n<td>70.3<\/td>\n<td>61.6<\/td>\n<td>128k<\/td>\n<td>4,3 GB<\/td>\n<\/tr>\n<tr>\n<td>Gemma 2 9B<\/td>\n<td>71.3<\/td>\n<td>61.0<\/td>\n<td>8k<\/td>\n<td>5,2 GB<\/td>\n<\/tr>\n<\/tbody>\n<\/table>\n<p>Qwen 2.5 7B e Gemma 2 9B ottengono i migliori risultati su MMLU (conoscenza generale); Llama 3.1 8B \u00e8 leader su HumanEval (programmazione); Mistral 7B offre le prestazioni pi\u00f9 elevate in termini di velocit\u00e0 di inferenza ed \u00e8 rilasciato con la licenza pi\u00f9 permissiva (Apache 2.0). La <a href=\"https:\/\/convly.ai\/it\/llm-leaderboard\/\">Classifica LLM<\/a> classifica tutti i modelli in base a intelligenza, costo e lunghezza del contesto.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Which_Model_to_Pick\"><\/span>Quale modello scegliere<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<ul>\n<li><strong>Migliore qualit\u00e0 complessiva (classe 7B)<\/strong>: <code>ollama pull qwen2.5:7b<\/code> o <code>ollama pull llama3.1:8b<\/code><\/li>\n<li><strong>Migliore per la programmazione<\/strong>: <code>ollama pull llama3.1:8b<\/code> o <code>ollama pull qwen2.5-coder:7b<\/code><\/li>\n<li><strong>Inferenza pi\u00f9 veloce<\/strong>: <code>ollama pull mistral:7b<\/code> o <code>ollama pull gemma2:2b<\/code> (per CPU\/bassa VRAM)<\/li>\n<li><strong>Multilingue<\/strong>: <code>ollama pull qwen2.5:7b<\/code> (supporta 29 lingue)<\/li>\n<li><strong>Documenti lunghi (contestuale \u2265128k)<\/strong>: <code>ollama pull llama3.1:8b<\/code> o <code>ollama pull qwen2.5:7b<\/code><\/li>\n<li><strong>Miglior ragionamento (se si dispone di almeno 40 GB di VRAM)<\/strong>: <code>ollama pull llama3.1:70b<\/code> o <code>ollama pull qwen2.5:72b<\/code><\/li>\n<\/ul>\n<p>Il <a href=\"https:\/\/convly.ai\/it\/best-local-llms-to-run-on-ollama-2026\/\">i migliori modelli linguistici locali per Ollama<\/a> guida confronta sistematicamente tutti i modelli e raccomanda tag specifici in base all\u2019uso previsto.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"When_to_Self-Host_vs_Use_an_API\"><\/span>Quando eseguire autonomamente rispetto all\u2019uso di un\u2019API<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Esegui Ollama localmente se:<\/p>\n<ul>\n<li>Possiedi gi\u00e0 una GPU con almeno 12 GB di VRAM (ad es. RTX 3060, 4060 Ti o superiore)<\/li>\n<li>Elabori dati sensibili che non possono lasciare la tua rete<\/li>\n<li>Generi oltre 5 milioni di token al mese (i costi dell\u2019API superano il TCO dell\u2019hosting autonomo)<\/li>\n<li>Hai bisogno di uptime garantito e di assenza di limiti di frequenza<\/li>\n<\/ul>\n<p>Utilizza un\u2019API ospitata (OpenAI, Anthropic, Groq) se:<\/p>\n<ul>\n<li>Generi meno di 1 milione di token al mese (l'ammortamento della GPU per l'auto-hosting richiede anni)<\/li>\n<li>Hai bisogno della qualit\u00e0 assolutamente migliore (Claude 3.5 Sonnet e GPT-4o superano tutti i modelli open source)<\/li>\n<li>Non vuoi gestire l'infrastruttura per l'inferenza<\/li>\n<\/ul>\n<p>Il <a href=\"https:\/\/convly.ai\/it\/self-hosting-vs-api-calculator\/\">calcolatore self-hosting vs API<\/a> stima il punto di pareggio in base al tuo volume di token, al costo della GPU e al prezzo dell'elettricit\u00e0. Il <a href=\"https:\/\/convly.ai\/it\/ai-api-cost-calculator\/\">Calcolatore dei costi API<\/a> proietta la spesa mensile per modello.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Platform-Specific_Notes\"><\/span>Note specifiche per piattaforma<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<h3>macOS<\/h3>\n<p>Ollama utilizza Metal per l'accelerazione GPU sui Mac M1\/M2\/M3. La memoria unificata significa che la VRAM corrisponde alla RAM di sistema. Un chip M2 Max con 64 GB di RAM pu\u00f2 eseguire Llama 3.1 70B in quantizzazione Q4 (40 GB) lasciando spazio sufficiente per il sistema operativo. Installalo tramite Homebrew:<\/p>\n<pre><code>eseguite brew install ollama<\/code><\/pre>\n<p>Avvia il servizio:<\/p>\n<pre><code>ollama serve<\/code><\/pre>\n<h3>Linux<\/h3>\n<p>Ollama richiede GPU NVIDIA con CUDA 11.8+ o GPU AMD con ROCm 5.7+. Installalo con:<\/p>\n<pre><code>curl -fsSL https:\/\/ollama.com\/install.sh | sh<\/code><\/pre>\n<p>Questo comando installa il binario in <code>\/usr\/local\/bin\/ollama<\/code> e crea un servizio systemd. Avvialo con:<\/p>\n<pre><code>sudo systemctl start ollama<\/code><\/pre>\n<p>I modelli vengono scaricati in <code>~\/.ollama\/models<\/code>. Per modificare la cartella di destinazione, imposta <code>OLLAMA_MODELS=\/percorso\/alla\/cartella\/dei\/modelli<\/code> in <code>, quindi esegue<\/code>.<\/p>\n<h3>Windows<\/h3>\n<p>Ollama per Windows richiede GPU NVIDIA con CUDA 11.8+ e driver versione 520+. Scarica l'installer da <code>ollama.com<\/code> ed eseguilo. Il servizio viene avviato automaticamente. I modelli vengono scaricati in <code>C:\\Users\\\\.ollama\\models<\/code>.<\/p>\n<p>Per eseguirlo da PowerShell:<\/p>\n<pre><code>ollama run llama3.1:8b<\/code><\/pre>\n<h2><span class=\"ez-toc-section\" id=\"Frequently_Asked_Questions\"><\/span>Domande frequenti<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<h3>OpenAI offre un modello open source che posso eseguire in Ollama?<\/h3>\n<p>No. OpenAI ha rilasciato GPT-2 (2019) come modello a pesi aperti, ma tutti i modelli pi\u00f9 recenti (GPT-3.5, GPT-4, GPT-4o, o1) sono proprietari e disponibili esclusivamente tramite API. Se desideri ragionamenti di qualit\u00e0 paragonabile a quelli di OpenAI da eseguire localmente, prova Llama 3.1 70B o Qwen 2.5 72B: entrambi superano GPT-3.5 nella maggior parte dei benchmark ed \u00e8 possibile eseguirli in Ollama con 40 GB di VRAM in quantizzazione Q4.<\/p>\n<h3>Posso eseguire Ollama su CPU senza GPU?<\/h3>\n<p>S\u00ec, ma l'inferenza \u00e8 10\u201350 volte pi\u00f9 lenta. Modelli piccoli (Gemma 2 2B, Qwen 2.5 0.5B, Phi-3.5 mini 3.8B) sono utilizzabili su CPU moderne (16+ thread). Modelli pi\u00f9 grandi (7B+) genereranno 1\u20133 token al secondo su CPU, una velocit\u00e0 troppo bassa per un utilizzo interattivo. Se non possiedi una GPU, valuta l'uso di un'API ospitata invece di quella locale \u2014 consulta la sezione <a href=\"https:\/\/convly.ai\/it\/self-hosting-vs-api-calculator\/\">calcolatore self-hosting vs API<\/a>.<\/p>\n<h3>Quanto costa eseguire Ollama rispetto all'API di OpenAI?<\/h3>\n<p>OpenAI addebita $0,15 per milione di token in input e $0,60 per milione di token in output per GPT-4o mini. Una GPU da 12 GB (RTX 4060 Ti, $400) che esegue Llama 3.1 8B consuma $0,05\/ora di elettricit\u00e0 (con un costo di $0,12\/kWh e un assorbimento del sistema di 400 W). Il punto di pareggio si attesta intorno ai 3\u20135 milioni di token al mese. Il <a href=\"https:\/\/convly.ai\/it\/ai-api-cost-calculator\/\">Calcolatore dei costi API<\/a> e <a href=\"https:\/\/convly.ai\/it\/self-hosting-vs-api-calculator\/\">calcolatore per l'auto-hosting<\/a> mostra il costo totale di propriet\u00e0 (TCO) esatto in base al tuo utilizzo.<\/p>\n<h3>Qual \u00e8 la differenza tra Q4_K_M, Q5_K_M e FP16?<\/h3>\n<p>Q4_K_M utilizza una quantizzazione a 4 bit (minima occupazione di VRAM, lieve perdita di qualit\u00e0). Q5_K_M utilizza una quantizzazione a 5 bit (20% in pi\u00f9 di VRAM, qualit\u00e0 molto vicina a quella completa). FP16 \u00e8 la precisione completa a 16 bit (massima qualit\u00e0, doppia occupazione di VRAM rispetto a Q4). Per la maggior parte dei compiti, Q5_K_M rappresenta il miglior compromesso. Usa FP16 solo se hai VRAM in eccesso e hai bisogno dell'ultimo 1\u20132% di qualit\u00e0 per ricerca o produzione.<\/p>\n<h3>Posso effettuare il fine-tuning di modelli in Ollama?<\/h3>\n<p>No. Ollama \u00e8 un motore di inferenza, non un framework per il training. Per effettuare il fine-tuning di un modello open source, usa Hugging Face Transformers con PEFT\/LoRA, Axolotl o LLaMA Factory. Esporta i pesi ottenuti dopo il fine-tuning nel formato GGUF e importali in Ollama con il comando <code>ollama create<\/code>. Il blocco <a href=\"https:\/\/convly.ai\/it\/what-is-ollama-complete-guide-2026\/\">Guida completa a Ollama<\/a> illustra questo flusso di lavoro.<\/p>\n<h3>Quale GPU dovrei acquistare per eseguire modelli da 7B in locale?<\/h3>\n<p>Per la quantizzazione Q4 (4,5 GB di VRAM): RTX 3060 da 12 GB ($250 usata) o RTX 4060 Ti da 16 GB ($450 nuova). Per FP16 (14 GB di VRAM): RTX 4060 Ti da 16 GB o RTX 4070 ($550\u2013600). Per modelli da 70B in quantizzazione Q4 (40 GB): due RTX 3090 da 24 GB ciascuna ($1800 usate) oppure A100 da 40 GB ($6000+ usata). La <a href=\"https:\/\/convly.ai\/it\/best-gpus-for-local-llms-2026\/\">guida alle migliori GPU<\/a> presenta benchmark sul rapporto prezzo\/prestazioni per ogni classe di dimensione.<\/p>","protected":false},"excerpt":{"rendered":"<p>TL;DR OpenAI has not released a model family called &#8220;GPT-OSS&#8221;. The search term likely refers to running open-source alternatives (Llama [&hellip;]<\/p>\n","protected":false},"author":1,"featured_media":2200,"comment_status":"closed","ping_status":"closed","sticky":false,"template":"","format":"standard","meta":{"site-sidebar-layout":"default","site-content-layout":"","ast-site-content-layout":"default","site-content-style":"default","site-sidebar-style":"default","ast-global-header-display":"","ast-banner-title-visibility":"","ast-main-header-display":"","ast-hfb-above-header-display":"","ast-hfb-below-header-display":"","ast-hfb-mobile-header-display":"","site-post-title":"","ast-breadcrumbs-content":"","ast-featured-img":"","footer-sml-layout":"","ast-disable-related-posts":"","theme-transparent-header-meta":"","adv-header-id-meta":"","stick-header-meta":"","header-above-stick-meta":"","header-main-stick-meta":"","header-below-stick-meta":"","astra-migrate-meta-layouts":"default","ast-page-background-enabled":"default","ast-page-background-meta":{"desktop":{"background-color":"var(--ast-global-color-5)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"tablet":{"background-color":"","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"mobile":{"background-color":"","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""}},"ast-content-background-meta":{"desktop":{"background-color":"var(--ast-global-color-4)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"tablet":{"background-color":"var(--ast-global-color-4)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"mobile":{"background-color":"var(--ast-global-color-4)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""}},"footnotes":""},"categories":[7],"tags":[],"class_list":["post-2199","post","type-post","status-publish","format-standard","has-post-thumbnail","hentry","category-ai-news"],"_links":{"self":[{"href":"https:\/\/convly.ai\/it\/wp-json\/wp\/v2\/posts\/2199","targetHints":{"allow":["GET"]}}],"collection":[{"href":"https:\/\/convly.ai\/it\/wp-json\/wp\/v2\/posts"}],"about":[{"href":"https:\/\/convly.ai\/it\/wp-json\/wp\/v2\/types\/post"}],"author":[{"embeddable":true,"href":"https:\/\/convly.ai\/it\/wp-json\/wp\/v2\/users\/1"}],"replies":[{"embeddable":true,"href":"https:\/\/convly.ai\/it\/wp-json\/wp\/v2\/comments?post=2199"}],"version-history":[{"count":1,"href":"https:\/\/convly.ai\/it\/wp-json\/wp\/v2\/posts\/2199\/revisions"}],"predecessor-version":[{"id":2201,"href":"https:\/\/convly.ai\/it\/wp-json\/wp\/v2\/posts\/2199\/revisions\/2201"}],"wp:featuredmedia":[{"embeddable":true,"href":"https:\/\/convly.ai\/it\/wp-json\/wp\/v2\/media\/2200"}],"wp:attachment":[{"href":"https:\/\/convly.ai\/it\/wp-json\/wp\/v2\/media?parent=2199"}],"wp:term":[{"taxonomy":"category","embeddable":true,"href":"https:\/\/convly.ai\/it\/wp-json\/wp\/v2\/categories?post=2199"},{"taxonomy":"post_tag","embeddable":true,"href":"https:\/\/convly.ai\/it\/wp-json\/wp\/v2\/tags?post=2199"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}