{"id":2182,"date":"2026-08-12T20:06:35","date_gmt":"2026-08-12T20:06:35","guid":{"rendered":"https:\/\/convly.ai\/?p=2182"},"modified":"2026-08-12T20:06:35","modified_gmt":"2026-08-12T20:06:35","slug":"text-generation-webui-guide","status":"publish","type":"post","link":"https:\/\/convly.ai\/it\/text-generation-webui-guide\/","title":{"rendered":"Text Generation WebUI (Oobabooga): Guida all'installazione, ai loader e all'uso"},"content":{"rendered":"<div class=\"convly-tldr\">\n<ul>\n<li>text-generation-webui (comunemente chiamata <em>oobabooga<\/em> dal nome dell'autore su GitHub) \u00e8 un'interfaccia gratuita, open source e basata sul browser per eseguire modelli linguistici di grandi dimensioni (LLM) in locale sul proprio hardware.<\/li>\n<li>Installazione tramite script a un clic \u2014 <code>start_windows.bat<\/code>, <code>start_linux.sh<\/code>, oppure <code>start_macos.sh<\/code> \u2014 nessuna configurazione manuale dell'ambiente Python richiesta.<\/li>\n<li>Supporta diversi backend: llama.cpp per file GGUF, ExLlamaV2 per modelli EXL2\/GPTQ su NVIDIA e Transformers per modelli Hugging Face.<\/li>\n<li>Include un'estensione API compatibile con OpenAI (<code>--extensions openai<\/code>) che consente ad altre applicazioni di connettersi al proprio modello locale senza modifiche al codice.<\/li>\n<\/ul>\n<\/div>\n<p>text-generation-webui \u00e8 un'interfaccia web open source e auto-hosted per l'esecuzione locale di modelli linguistici di grandi dimensioni. \u00c8 mantenuta su GitHub come <strong>oobabooga\/text-generation-webui<\/strong>, si avvia nel browser all'indirizzo <code>http:\/\/localhost:7860<\/code>, supports a wide range of model formats through swappable inference backends, and exposes an OpenAI-compatible REST API. It is the most feature-complete local LLM frontend available, at the cost of a steeper setup curve than desktop apps like LM Studio.<\/p>\n<div id=\"ez-toc-container\" class=\"ez-toc-v2_0_86 counter-flat ez-toc-counter ez-toc-container-direction\">\n<label for=\"ez-toc-cssicon-toggle-item-6a7d13d65934d\" class=\"ez-toc-cssicon-toggle-label\"><span class=\"\"><span class=\"eztoc-hide\" style=\"display:none;\">Attiva\/Disattiva<\/span><span class=\"ez-toc-icon-toggle-span\"><svg style=\"fill: #000000;color:#000000\" xmlns=\"http:\/\/www.w3.org\/2000\/svg\" class=\"list-377408\" width=\"20px\" height=\"20px\" viewbox=\"0 0 24 24\" fill=\"none\"><path d=\"M6 6H4v2h2V6zm14 0H8v2h12V6zM4 11h2v2H4v-2zm16 0H8v2h12v-2zM4 16h2v2H4v-2zm16 0H8v2h12v-2z\" fill=\"currentColor\"><\/path><\/svg><svg style=\"fill: #000000;color:#000000\" class=\"arrow-unsorted-368013\" xmlns=\"http:\/\/www.w3.org\/2000\/svg\" width=\"10px\" height=\"10px\" viewbox=\"0 0 24 24\" version=\"1.2\" baseprofile=\"tiny\"><path d=\"M18.2 9.3l-6.2-6.3-6.2 6.3c-.2.2-.3.4-.3.7s.1.5.3.7c.2.2.4.3.7.3h11c.3 0 .5-.1.7-.3.2-.2.3-.5.3-.7s-.1-.5-.3-.7zM5.8 14.7l6.2 6.3 6.2-6.3c.2-.2.3-.5.3-.7s-.1-.5-.3-.7c-.2-.2-.4-.3-.7-.3h-11c-.3 0-.5.1-.7.3-.2.2-.3.5-.3.7s.1.5.3.7z\"\/><\/svg><\/span><\/span><\/label><input type=\"checkbox\"  id=\"ez-toc-cssicon-toggle-item-6a7d13d65934d\"  aria-label=\"Attiva\/Disattiva\" \/><nav><ul class='ez-toc-list ez-toc-list-level-1' ><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-1\" href=\"https:\/\/convly.ai\/it\/text-generation-webui-guide\/#What_text-generation-webui_Is_and_Why_People_Call_It_Oobabooga\" >Cos\u2019\u00e8 text-generation-webui (e perch\u00e9 viene chiamata Oobabooga)<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-2\" href=\"https:\/\/convly.ai\/it\/text-generation-webui-guide\/#Installing_text-generation-webui\" >Installazione di text-generation-webui<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-3\" href=\"https:\/\/convly.ai\/it\/text-generation-webui-guide\/#Model_Loaders_Which_One_to_Use\" >Loader dei modelli: quale scegliere<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-4\" href=\"https:\/\/convly.ai\/it\/text-generation-webui-guide\/#Loading_a_GGUF_Model_Step_by_Step\" >Caricamento passo passo di un modello GGUF<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-5\" href=\"https:\/\/convly.ai\/it\/text-generation-webui-guide\/#The_OpenAI-Compatible_API_Extension\" >L\u2019estensione API compatibile con OpenAI<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-6\" href=\"https:\/\/convly.ai\/it\/text-generation-webui-guide\/#text-generation-webui_vs_LM_Studio_vs_Jan\" >text-generation-webui vs LM Studio vs Jan<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-7\" href=\"https:\/\/convly.ai\/it\/text-generation-webui-guide\/#Frequently_Asked_Questions\" >Domande frequenti<\/a><\/li><\/ul><\/nav><\/div>\n<h2><span class=\"ez-toc-section\" id=\"What_text-generation-webui_Is_and_Why_People_Call_It_Oobabooga\"><\/span>Cos\u2019\u00e8 text-generation-webui (e perch\u00e9 viene chiamata Oobabooga)<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Il nome utente GitHub del progetto \u00e8 <em>oobabooga<\/em>, che \u00e8 diventato il termine colloquiale usato dalla comunit\u00e0 per indicare lo strumento stesso. Entrambi i nomi fanno riferimento allo stesso progetto disponibile all\u2019indirizzo <a href=\"https:\/\/github.com\/oobabooga\/text-generation-webui\" rel=\"noopener noreferrer\" target=\"_blank\">github.com\/oobabooga\/text-generation-webui<\/a>.<\/p>\n<p>L\u2019interfaccia \u00e8 costruita su Gradio e funziona interamente sulla tua macchina locale \u2014 nessun dato lascia il tuo sistema. Oltre alla chat di base, supporta:<\/p>\n<ul>\n<li>Tre modalit\u00e0 di input: Chat (instruct), Chat (roleplay con schede personaggio) e Notebook (completamento raw)<\/li>\n<li>Caricamento di LoRA per pesi adattatori finetunati sopra un modello base<\/li>\n<li>Un sistema di estensioni con plugin della community per riassunti, sintesi vocale, generazione di didascalie per immagini e molto altro<\/li>\n<li>Un endpoint API compatibile con OpenAI per connettere client di terze parti e script di automazione<\/li>\n<\/ul>\n<p>Prima di scegliere un modello, utilizza il <a href=\"https:\/\/convly.ai\/it\/llm-vram-calculator\/\">Calcolatore VRAM<\/a> calcolatore di memoria VRAM<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Installing_text-generation-webui\"><\/span>Installazione di text-generation-webui<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Il metodo consigliato su ogni piattaforma \u00e8 l\u2019installer a un clic. Crea automaticamente un ambiente Conda isolato e installa tutte le dipendenze Python. Non installare nell\u2019ambiente Python di sistema, a meno che tu non abbia una ragione specifica per farlo.<\/p>\n<h3>Windows<\/h3>\n<ol>\n<li>Clona il repository o scarica l\u2019archivio zip della release dalla pagina GitHub:<br \/><code>git clone https:\/\/github.com\/oobabooga\/text-generation-webui<\/code><\/li>\n<li>Fai doppio clic su <code>start_windows.bat<\/code> nella cartella clonata.<\/li>\n<li>Lo script rileva il tipo di GPU (NVIDIA, AMD o solo CPU) e installa le dipendenze corrispondenti \u2014 seleziona l\u2019opzione appropriata quando richiesto.<\/li>\n<li>Al termine della configurazione, il server viene avviato automaticamente. Apri <code>http:\/\/localhost:7860<\/code> nel tuo browser.<\/li>\n<\/ol>\n<p>Nei successivi avvii, fai doppio clic nuovamente su <code>start_windows.bat<\/code> . L\u2019ambiente Conda \u00e8 gi\u00e0 stato creato; l\u2019avvio richiede solo pochi secondi.<\/p>\n<h3>Linux<\/h3>\n<ol>\n<li>Clona il repository ed entra nella directory:\n<pre><code>git clone https:\/\/github.com\/oobabooga\/text-generation-webui\ncd text-generation-webui<\/code><\/pre>\n<\/li>\n<li>Rendi lo script eseguibile ed eseguilo:\n<pre><code>chmod +x start_linux.sh\n.\/start_linux.sh<\/code><\/pre>\n<\/li>\n<li>Quando richiesto, seleziona il tipo di GPU: NVIDIA, AMD, solo CPU o Apple Silicon (non applicabile su Linux, ma la richiesta compare comunque).<\/li>\n<li>Accedi all\u2019interfaccia all\u2019indirizzo <code>http:\/\/localhost:7860<\/code> non appena il server \u00e8 in esecuzione.<\/li>\n<\/ol>\n<h3>macOS<\/h3>\n<ol>\n<li>Clona il repository ed esegui lo script di avvio:\n<pre><code>git clone https:\/\/github.com\/oobabooga\/text-generation-webui\ncd text-generation-webui\n.\/start_macos.sh<\/code><\/pre>\n<\/li>\n<li>Quando richiesto, seleziona l\u2019opzione D (Apple Silicon \/ Metal) o C (solo CPU).<\/li>\n<li>Il backend llama.cpp utilizza Metal per l\u2019accelerazione GPU sui chip M-series \u2014 non \u00e8 richiesto CUDA.<\/li>\n<\/ol>\n<p>Gli utenti macOS possono utilizzare esclusivamente i loader llama.cpp e Transformers. ExLlamaV2 richiede CUDA e non \u00e8 compatibile con Apple Silicon.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Model_Loaders_Which_One_to_Use\"><\/span>Loader dei modelli: quale scegliere<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>text-generation-webui separa logicamente il motore di inferenza dall\u2019interfaccia utente. Puoi selezionare un loader specifico per ciascun modello dalla scheda <strong>Modello<\/strong> Loader<\/p>\n<table>\n<thead>\n<tr>\n<th>Loader<\/th>\n<th>Formato<\/th>\n<th>Hardware<\/th>\n<th>Quando utilizzare<\/th>\n<\/tr>\n<\/thead>\n<tbody>\n<tr>\n<td>llama.cpp<\/td>\n<td>GGUF<\/td>\n<td>NVIDIA, AMD, Apple Silicon, CPU<\/td>\n<td>Predefinito per i file GGUF; il pi\u00f9 portabile tra le piattaforme<\/td>\n<\/tr>\n<tr>\n<td>ExLlamaV2<\/td>\n<td>EXL2, GPTQ<\/td>\n<td>Solo NVIDIA CUDA<\/td>\n<td>Attraversputo NVIDIA pi\u00f9 elevato; preferito rispetto ad AutoGPTQ per i modelli nuovi<\/td>\n<\/tr>\n<tr>\n<td>Transformer<\/td>\n<td>HuggingFace (fp16, bf16, int8, int4)<\/td>\n<td>NVIDIA, CPU<\/td>\n<td>Modelli HuggingFace nel formato originale; pi\u00f9 lenti ma con la massima compatibilit\u00e0<\/td>\n<\/tr>\n<tr>\n<td>AutoAWQ<\/td>\n<td>AWQ<\/td>\n<td>NVIDIA CUDA<\/td>\n<td>Modelli quantizzati AWQ<\/td>\n<\/tr>\n<tr>\n<td>AutoGPTQ<\/td>\n<td>GPTQ<\/td>\n<td>NVIDIA CUDA<\/td>\n<td>Modelli GPTQ pi\u00f9 vecchi; ExLlamaV2 \u00e8 pi\u00f9 veloce per lo stesso formato<\/td>\n<\/tr>\n<\/tbody>\n<\/table>\n<p><strong>Predefinito pratico:<\/strong> Se hai scaricato un <code>.gguf<\/code> file (il formato pi\u00f9 comune sulle pagine dei modelli di HuggingFace), utilizza <strong>llama.cpp<\/strong>. Se disponi di una GPU NVIDIA e desideri la massima velocit\u00e0 di generazione, cerca una variante EXL2 dello stesso modello e utilizza <strong>ExLlamaV2<\/strong>.<\/p>\n<p>Per una panoramica dei modelli che effettivamente si adattano a ciascuna GPU, consulta <a href=\"https:\/\/convly.ai\/it\/vram-requirements-every-major-llm-2026\/\">Requisiti di VRAM per i principali LLM<\/a>.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Loading_a_GGUF_Model_Step_by_Step\"><\/span>Caricamento passo passo di un modello GGUF<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<ol>\n<li><strong>Copia il file<\/strong> nella cartella <code>text-generation-webui\/models\/<\/code>. I file GGUF monofile (ad esempio, <code>mistral-7b-instruct.Q4_K_M.gguf<\/code>) vanno inseriti direttamente in tale cartella. I file suddivisi in pi\u00f9 parti devono essere collocati in una sottocartella denominata.<\/li>\n<li><strong>Apri la scheda Modello<\/strong> l\u2019indirizzo <code>http:\/\/localhost:7860<\/code>.<\/li>\n<li>Seleziona il tuo file dal menu a discesa dei modelli (fai clic sull'icona di aggiornamento se non compare).<\/li>\n<li>Impostare <strong>Loader<\/strong> a <code>llama.cpp<\/code>.<\/li>\n<li>Impostare <strong>n-gpu-layers<\/strong> per controllare lo scarico sulla GPU. Inserisci un numero elevato (ad esempio, <code>999<\/code>) per spostare il maggior numero possibile di livelli nella VRAM; inserisci <code>0<\/code> per l'inferenza esclusivamente su CPU.<\/li>\n<li>Clicca <strong>Carica<\/strong>. Un messaggio di conferma appare nella casella di stato non appena il modello \u00e8 pronto.<\/li>\n<\/ol>\n<p>Passa alla scheda <strong>Chat<\/strong> per avviare una conversazione oppure alla scheda <strong>Predefinito<\/strong> per il completamento diretto del prompt. Il template instruct viene impostato automaticamente per le famiglie di modelli note; per modelli sconosciuti, selezionalo manualmente dal menu a discesa <strong>Template istruzioni<\/strong> nella scheda Parametri.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"The_OpenAI-Compatible_API_Extension\"><\/span>L\u2019estensione API compatibile con OpenAI<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>L'estensione integrata <code>openai<\/code> espone endpoint REST che replicano il formato delle API OpenAI Chat Completions e Completions. Qualsiasi client che accetti un URL base personalizzato \u2014 LangChain, Open WebUI, Continue.dev o uno script <code>curl<\/code> \u2014 pu\u00f2 connettersi al tuo modello locale senza modifiche al codice.<\/p>\n<p>Abilitala passando una flag all'avvio:<\/p>\n<pre><code># Linux \/ macOS\n.\/start_linux.sh --extensions openai\n\n# oppure avvia direttamente server.py all'interno dell'ambiente Conda\npython server.py --extensions openai<\/code><\/pre>\n<p>In alternativa, abilitala dalla scheda <strong>Sessione<\/strong> nell'interfaccia utente, quindi fai clic su <strong>Applica flag \/ Riavvia<\/strong>.<\/p>\n<p>Per impostazione predefinita, l'API ascolta sulla porta 5000, distinta dall'interfaccia Gradio sulla porta 7860. Configura il tuo client con:<\/p>\n<pre><code>base_url = \"http:\/\/localhost:5000\/v1\"\napi_key  = \"qualsiasi_valore\"  # richiesto dalla maggior parte dei client, ma non convalidato localmente<\/code><\/pre>\n<p>Gli endpoint supportati includono <code>\/v1\/chat\/completions<\/code>, <code>\/v1\/completions<\/code>, e <code>\/v1\/models<\/code>. La porta \u00e8 configurabile tramite la flag di avvio <code>--api-port<\/code> .<\/p>\n<h2><span class=\"ez-toc-section\" id=\"text-generation-webui_vs_LM_Studio_vs_Jan\"><\/span>text-generation-webui vs LM Studio vs Jan<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Tutti e tre gli strumenti eseguono i modelli localmente, senza dipendenze dal cloud. Sono rivolti a utenti e casi d'uso diversi.<\/p>\n<table>\n<thead>\n<tr>\n<th><\/th>\n<th>text-generation-webui<\/th>\n<th>LM Studio<\/th>\n<th>Jan<\/th>\n<\/tr>\n<\/thead>\n<tbody>\n<tr>\n<td>Interfaccia<\/td>\n<td>Browser (Gradio)<\/td>\n<td>Desktop nativo<\/td>\n<td>Desktop nativo<\/td>\n<\/tr>\n<tr>\n<td>Complessit\u00e0 di configurazione<\/td>\n<td>Media (script con un solo clic)<\/td>\n<td>Bassa (installer grafico)<\/td>\n<td>Bassa (installer grafico)<\/td>\n<\/tr>\n<tr>\n<td>Formati dei modelli<\/td>\n<td>GGUF, EXL2, GPTQ, AWQ, HF fp16<\/td>\n<td>Principalmente GGUF<\/td>\n<td>Principalmente GGUF<\/td>\n<\/tr>\n<tr>\n<td>Browser integrato per i modelli<\/td>\n<td>No<\/td>\n<td>S\u00ec<\/td>\n<td>S\u00ec<\/td>\n<\/tr>\n<tr>\n<td>API compatibile con OpenAI<\/td>\n<td>S\u00ec (estensione)<\/td>\n<td>S\u00ec (integrato)<\/td>\n<td>S\u00ec (integrato)<\/td>\n<\/tr>\n<tr>\n<td>Sistema di estensioni \/ plugin<\/td>\n<td>S\u00ec<\/td>\n<td>Limitato<\/td>\n<td>Limitato<\/td>\n<\/tr>\n<tr>\n<td>Apple Silicon (Metal)<\/td>\n<td>S\u00ec (llama.cpp)<\/td>\n<td>S\u00ec<\/td>\n<td>S\u00ec<\/td>\n<\/tr>\n<tr>\n<td>Ideale per<\/td>\n<td>Utenti avanzati, automazione e ricerca<\/td>\n<td>Principianti, utilizzo quotidiano per conversazioni<\/td>\n<td>Utenti focalizzati sull\u2019open source<\/td>\n<\/tr>\n<\/tbody>\n<\/table>\n<p><strong>Scegli text-generation-webui<\/strong> quando hai bisogno di pi\u00f9 backend di caricamento, delle prestazioni di EXL2 su NVIDIA, del caricamento di LoRA o dell\u2019ecosistema di estensioni, oppure di accesso API tramite script per l\u2019automazione e i flussi di sviluppo.<\/p>\n<p><strong>Scegli LM Studio o Jan<\/strong> quando desideri un installer ben rifinito, una ricerca integrata di modelli con download in un solo clic e una configurazione minima. Consulta la <a href=\"https:\/\/convly.ai\/it\/lm-studio-complete-guide-2026\/\">Guida completa a LM Studio<\/a> per una guida dettagliata su questa opzione.<\/p>\n<p>Se stai valutando se l\u2019inferenza locale valga effettivamente il costo hardware, il <a href=\"https:\/\/convly.ai\/it\/self-hosting-vs-api-calculator\/\">Calcolatore del punto di pareggio tra auto-hosting e utilizzo di API<\/a> pu\u00f2 quantificare il compromesso rispetto al pagamento per l\u2019accesso all\u2019API in base al tuo volume di utilizzo.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Frequently_Asked_Questions\"><\/span>Domande frequenti<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<h3>Perch\u00e9 l\u2019installer con un solo clic richiede cos\u00ec tanto tempo alla prima esecuzione?<\/h3>\n<p>Scarica Miniconda e crea un ambiente Python isolato con PyTorch e tutte le librerie per il caricamento dei modelli da zero. Su una connessione veloce ci\u00f2 richiede tipicamente 5\u201315 minuti. Avvii successivi saltano questo passaggio e partono in pochi secondi.<\/p>\n<h3>Posso eseguire text-generation-webui senza GPU?<\/h3>\n<p>S\u00ec. Seleziona l\u2019opzione CPU-only durante l\u2019installazione, quindi imposta <code>n-gpu-layers<\/code> a <code>0<\/code> al momento del caricamento di un modello GGUF. Un modello da 7B pu\u00f2 generare 2\u20135 token al secondo su una CPU desktop moderna \u2014 sufficiente per test ma lento per conversazioni. Quantizzazioni pi\u00f9 leggere (Q4 e inferiori) migliorano il throughput. Controlla <a href=\"https:\/\/convly.ai\/it\/best-gpus-for-local-llms-2026\/\">le migliori GPU per LLM locali<\/a> se stai considerando un aggiornamento hardware.<\/p>\n<h3>Come aggiorno text-generation-webui?<\/h3>\n<p>Esegui <code>git pull<\/code> nella directory del repository per recuperare l\u2019ultimo codice, quindi riesegui lo script di avvio. Lo script rileva le modifiche all\u2019ambiente e aggiorna automaticamente le dipendenze. Puoi anche eseguire manualmente <code>pip install -r requirements.txt<\/code> nell\u2019ambiente Conda attivo, se preferisci un aggiornamento mirato.<\/p>\n<h3>Qual \u00e8 la differenza tra GGUF ed EXL2?<\/h3>\n<p>Entrambi sono formati quantizzati che riducono le dimensioni del file del modello e i requisiti di VRAM. GGUF (tramite llama.cpp) funziona su NVIDIA, AMD e Apple Silicon \u2014 \u00e8 la scelta pi\u00f9 portabile e dispone della maggiore disponibilit\u00e0 di modelli. EXL2 (tramite ExLlamaV2) \u00e8 supportato esclusivamente su NVIDIA, ma genera generalmente token pi\u00f9 velocemente a parit\u00e0 di qualit\u00e0. Se possiedi una GPU NVIDIA e la velocit\u00e0 \u00e8 la priorit\u00e0, vale la pena procurarsi modelli in formato EXL2.<\/p>\n<h3>Dove vengono salvati i log delle conversazioni?<\/h3>\n<p>I log vengono memorizzati nella cartella <code>text-generation-webui\/logs\/<\/code>. Ogni conversazione viene salvata come file JSON. Puoi inoltre esportarla direttamente dall\u2019interfaccia della scheda Chat utilizzando il pulsante di download sotto la finestra della conversazione.<\/p>\n<h3>Pi\u00f9 utenti possono connettersi a un\u2019unica istanza?<\/h3>\n<p>Il <code>--listen<\/code> Il flag di avvio rende il server accessibile sulla tua rete locale anzich\u00e9 solo su localhost. Tuttavia, text-generation-webui non \u00e8 progettato per distribuzioni produttive multi-utente: non include autenticazione integrata e l\u2019interfaccia Gradio supporta una sola sessione alla volta. L\u2019estensione OpenAI API gestisce meglio le richieste API concorrenti rispetto all\u2019interfaccia web nei casi con pi\u00f9 client, ma, se si espone il servizio oltre localhost, \u00e8 necessario aggiungere un reverse proxy con autenticazione.<\/p>","protected":false},"excerpt":{"rendered":"<p>text-generation-webui (widely called oobabooga after its GitHub author) is a free, open-source, browser-based interface for running LLMs locally on your [&hellip;]<\/p>\n","protected":false},"author":1,"featured_media":2183,"comment_status":"closed","ping_status":"closed","sticky":false,"template":"","format":"standard","meta":{"site-sidebar-layout":"default","site-content-layout":"","ast-site-content-layout":"default","site-content-style":"default","site-sidebar-style":"default","ast-global-header-display":"","ast-banner-title-visibility":"","ast-main-header-display":"","ast-hfb-above-header-display":"","ast-hfb-below-header-display":"","ast-hfb-mobile-header-display":"","site-post-title":"","ast-breadcrumbs-content":"","ast-featured-img":"","footer-sml-layout":"","ast-disable-related-posts":"","theme-transparent-header-meta":"","adv-header-id-meta":"","stick-header-meta":"","header-above-stick-meta":"","header-main-stick-meta":"","header-below-stick-meta":"","astra-migrate-meta-layouts":"default","ast-page-background-enabled":"default","ast-page-background-meta":{"desktop":{"background-color":"var(--ast-global-color-5)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"tablet":{"background-color":"","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"mobile":{"background-color":"","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""}},"ast-content-background-meta":{"desktop":{"background-color":"var(--ast-global-color-4)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"tablet":{"background-color":"var(--ast-global-color-4)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"mobile":{"background-color":"var(--ast-global-color-4)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""}},"footnotes":""},"categories":[7],"tags":[],"class_list":["post-2182","post","type-post","status-publish","format-standard","has-post-thumbnail","hentry","category-ai-news"],"_links":{"self":[{"href":"https:\/\/convly.ai\/it\/wp-json\/wp\/v2\/posts\/2182","targetHints":{"allow":["GET"]}}],"collection":[{"href":"https:\/\/convly.ai\/it\/wp-json\/wp\/v2\/posts"}],"about":[{"href":"https:\/\/convly.ai\/it\/wp-json\/wp\/v2\/types\/post"}],"author":[{"embeddable":true,"href":"https:\/\/convly.ai\/it\/wp-json\/wp\/v2\/users\/1"}],"replies":[{"embeddable":true,"href":"https:\/\/convly.ai\/it\/wp-json\/wp\/v2\/comments?post=2182"}],"version-history":[{"count":1,"href":"https:\/\/convly.ai\/it\/wp-json\/wp\/v2\/posts\/2182\/revisions"}],"predecessor-version":[{"id":2184,"href":"https:\/\/convly.ai\/it\/wp-json\/wp\/v2\/posts\/2182\/revisions\/2184"}],"wp:featuredmedia":[{"embeddable":true,"href":"https:\/\/convly.ai\/it\/wp-json\/wp\/v2\/media\/2183"}],"wp:attachment":[{"href":"https:\/\/convly.ai\/it\/wp-json\/wp\/v2\/media?parent=2182"}],"wp:term":[{"taxonomy":"category","embeddable":true,"href":"https:\/\/convly.ai\/it\/wp-json\/wp\/v2\/categories?post=2182"},{"taxonomy":"post_tag","embeddable":true,"href":"https:\/\/convly.ai\/it\/wp-json\/wp\/v2\/tags?post=2182"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}