{"id":2182,"date":"2026-08-12T20:06:35","date_gmt":"2026-08-12T20:06:35","guid":{"rendered":"https:\/\/convly.ai\/?p=2182"},"modified":"2026-08-12T20:06:35","modified_gmt":"2026-08-12T20:06:35","slug":"text-generation-webui-guide","status":"publish","type":"post","link":"https:\/\/convly.ai\/pt\/text-generation-webui-guide\/","title":{"rendered":"Text Generation WebUI (Oobabooga): Guia de Instala\u00e7\u00e3o, Carregadores e Uso"},"content":{"rendered":"<div class=\"convly-tldr\">\n<ul>\n<li>text-generation-webui (amplamente chamado de <em>oobabooga<\/em> pelo nome de seu autor no GitHub) \u00e9 uma interface gratuita, de c\u00f3digo aberto e baseada em navegador para executar modelos de linguagem de grande porte (LLMs) localmente, em seu pr\u00f3prio hardware.<\/li>\n<li>Instale por meio de scripts de um clique \u2014 <code>start_windows.bat<\/code>, <code>start_linux.sh<\/code>, ou <code>start_macos.sh<\/code> \u2014 sem necessidade de configura\u00e7\u00e3o manual do ambiente Python.<\/li>\n<li>Oferece suporte a m\u00faltiplos back-ends: llama.cpp para arquivos GGUF, ExLlamaV2 para modelos EXL2\/GPTQ em GPUs NVIDIA e Transformers para modelos do Hugging Face.<\/li>\n<li>Inclui uma extens\u00e3o compat\u00edvel com a API da OpenAI (<code>--extensions openai<\/code>) para que outros aplicativos possam se conectar ao seu modelo local sem altera\u00e7\u00f5es no c\u00f3digo.<\/li>\n<\/ul>\n<\/div>\n<p>text-generation-webui \u00e9 uma interface web de c\u00f3digo aberto e auto-hospedada para executar modelos de linguagem de grande porte localmente. Mantido no GitHub como <strong>oobabooga\/text-generation-webui<\/strong>, ele \u00e9 executado em seu navegador no endere\u00e7o <code>http:\/\/localhost:7860<\/code>, supports a wide range of model formats through swappable inference backends, and exposes an OpenAI-compatible REST API. It is the most feature-complete local LLM frontend available, at the cost of a steeper setup curve than desktop apps like LM Studio.<\/p>\n<div id=\"ez-toc-container\" class=\"ez-toc-v2_0_86 counter-flat ez-toc-counter ez-toc-container-direction\">\n<label for=\"ez-toc-cssicon-toggle-item-6a7d153e40ef4\" class=\"ez-toc-cssicon-toggle-label\"><span class=\"\"><span class=\"eztoc-hide\" style=\"display:none;\">Alternar<\/span><span class=\"ez-toc-icon-toggle-span\"><svg style=\"fill: #000000;color:#000000\" xmlns=\"http:\/\/www.w3.org\/2000\/svg\" class=\"list-377408\" width=\"20px\" height=\"20px\" viewbox=\"0 0 24 24\" fill=\"none\"><path d=\"M6 6H4v2h2V6zm14 0H8v2h12V6zM4 11h2v2H4v-2zm16 0H8v2h12v-2zM4 16h2v2H4v-2zm16 0H8v2h12v-2z\" fill=\"currentColor\"><\/path><\/svg><svg style=\"fill: #000000;color:#000000\" class=\"arrow-unsorted-368013\" xmlns=\"http:\/\/www.w3.org\/2000\/svg\" width=\"10px\" height=\"10px\" viewbox=\"0 0 24 24\" version=\"1.2\" baseprofile=\"tiny\"><path d=\"M18.2 9.3l-6.2-6.3-6.2 6.3c-.2.2-.3.4-.3.7s.1.5.3.7c.2.2.4.3.7.3h11c.3 0 .5-.1.7-.3.2-.2.3-.5.3-.7s-.1-.5-.3-.7zM5.8 14.7l6.2 6.3 6.2-6.3c.2-.2.3-.5.3-.7s-.1-.5-.3-.7c-.2-.2-.4-.3-.7-.3h-11c-.3 0-.5.1-.7.3-.2.2-.3.5-.3.7s.1.5.3.7z\"\/><\/svg><\/span><\/span><\/label><input type=\"checkbox\"  id=\"ez-toc-cssicon-toggle-item-6a7d153e40ef4\"  aria-label=\"Alternar\" \/><nav><ul class='ez-toc-list ez-toc-list-level-1' ><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-1\" href=\"https:\/\/convly.ai\/pt\/text-generation-webui-guide\/#What_text-generation-webui_Is_and_Why_People_Call_It_Oobabooga\" >O que \u00e9 o text-generation-webui (e por que as pessoas o chamam de Oobabooga)<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-2\" href=\"https:\/\/convly.ai\/pt\/text-generation-webui-guide\/#Installing_text-generation-webui\" >Instalando o text-generation-webui<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-3\" href=\"https:\/\/convly.ai\/pt\/text-generation-webui-guide\/#Model_Loaders_Which_One_to_Use\" >Carregadores de modelos: qual escolher<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-4\" href=\"https:\/\/convly.ai\/pt\/text-generation-webui-guide\/#Loading_a_GGUF_Model_Step_by_Step\" >Carregando um modelo GGUF passo a passo<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-5\" href=\"https:\/\/convly.ai\/pt\/text-generation-webui-guide\/#The_OpenAI-Compatible_API_Extension\" >A extens\u00e3o de API compat\u00edvel com a OpenAI<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-6\" href=\"https:\/\/convly.ai\/pt\/text-generation-webui-guide\/#text-generation-webui_vs_LM_Studio_vs_Jan\" >text-generation-webui vs LM Studio vs Jan<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-7\" href=\"https:\/\/convly.ai\/pt\/text-generation-webui-guide\/#Frequently_Asked_Questions\" >Perguntas frequentes<\/a><\/li><\/ul><\/nav><\/div>\n<h2><span class=\"ez-toc-section\" id=\"What_text-generation-webui_Is_and_Why_People_Call_It_Oobabooga\"><\/span>O que \u00e9 o text-generation-webui (e por que as pessoas o chamam de Oobabooga)<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>O nome de usu\u00e1rio do projeto no GitHub \u00e9 <em>oobabooga<\/em>, que se tornou a forma abreviada usada pela comunidade para designar a pr\u00f3pria ferramenta. Ambos os nomes referem-se ao mesmo projeto em <a href=\"https:\/\/github.com\/oobabooga\/text-generation-webui\" rel=\"noopener noreferrer\" target=\"_blank\">github.com\/oobabooga\/text-generation-webui<\/a>.<\/p>\n<p>A interface \u00e9 constru\u00edda sobre o Gradio e executa-se inteiramente em sua m\u00e1quina local \u2014 nenhum dado deixa seu sistema. Al\u00e9m do chat b\u00e1sico, ela oferece suporte a:<\/p>\n<ul>\n<li>Tr\u00eas modos de entrada: Chat (modo instru\u00e7\u00e3o), Chat (roleplay com cart\u00f5es de personagens) e Notebook (conclus\u00e3o bruta)<\/li>\n<li>Carregamento de LoRAs para pesos adaptadores ajustados finamente sobre um modelo base<\/li>\n<li>Um sistema de extens\u00f5es com plugins comunit\u00e1rios para resumo, s\u00edntese de fala, legendagem de imagens e muito mais<\/li>\n<li>Um ponto de extremidade (endpoint) de API compat\u00edvel com a OpenAI para conectar clientes de terceiros e scripts de automa\u00e7\u00e3o<\/li>\n<\/ul>\n<p>Antes de escolher um modelo, use o <a href=\"https:\/\/convly.ai\/pt\/llm-vram-calculator\/\">Calculadora de VRAM<\/a> para confirmar se sua GPU consegue carreg\u00e1-lo \u2014 os requisitos variam amplamente conforme o tamanho do modelo e o n\u00edvel de quantiza\u00e7\u00e3o.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Installing_text-generation-webui\"><\/span>Instalando o text-generation-webui<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>O caminho recomendado em todas as plataformas \u00e9 o instalador de um clique. Ele cria um ambiente isolado do Conda e instala automaticamente todas as depend\u00eancias Python. N\u00e3o instale no Python do sistema, a menos que tenha uma raz\u00e3o espec\u00edfica para faz\u00ea-lo.<\/p>\n<h3>Windows<\/h3>\n<ol>\n<li>Clone o reposit\u00f3rio ou baixe um arquivo ZIP da vers\u00e3o mais recente na p\u00e1gina do GitHub:<br \/><code>git clone https:\/\/github.com\/oobabooga\/text-generation-webui<\/code><\/li>\n<li>Clique duas vezes em <code>start_windows.bat<\/code> na pasta clonada.<\/li>\n<li>O script detecta automaticamente o tipo de sua GPU (NVIDIA, AMD ou apenas CPU) e instala as depend\u00eancias correspondentes \u2014 selecione a op\u00e7\u00e3o apropriada quando solicitado.<\/li>\n<li>Ap\u00f3s a conclus\u00e3o da configura\u00e7\u00e3o, o servidor \u00e9 iniciado automaticamente. Abra <code>http:\/\/localhost:7860<\/code> em seu navegador.<\/li>\n<\/ol>\n<p>Nas execu\u00e7\u00f5es subsequentes, basta clicar duas vezes novamente em <code>start_windows.bat<\/code> . O ambiente Conda j\u00e1 est\u00e1 configurado; a inicializa\u00e7\u00e3o leva apenas alguns segundos.<\/p>\n<h3>Linux<\/h3>\n<ol>\n<li>Clone o reposit\u00f3rio e entre no diret\u00f3rio:\n<pre><code>git clone https:\/\/github.com\/oobabooga\/text-generation-webui\ncd text-generation-webui<\/code><\/pre>\n<\/li>\n<li>Torne o script execut\u00e1vel e execute-o:\n<pre><code>chmod +x start_linux.sh\n.\/start_linux.sh<\/code><\/pre>\n<\/li>\n<li>Selecione seu tipo de GPU quando solicitado: NVIDIA, AMD, apenas CPU ou Apple Silicon (n\u00e3o aplic\u00e1vel no Linux, mas a op\u00e7\u00e3o aparece na tela).<\/li>\n<li>Acesse a interface em <code>http:\/\/localhost:7860<\/code> assim que o servidor estiver em execu\u00e7\u00e3o.<\/li>\n<\/ol>\n<h3>macOS<\/h3>\n<ol>\n<li>Clone o reposit\u00f3rio e execute o script de inicializa\u00e7\u00e3o:\n<pre><code>git clone https:\/\/github.com\/oobabooga\/text-generation-webui\ncd text-generation-webui\n.\/start_macos.sh<\/code><\/pre>\n<\/li>\n<li>Selecione a op\u00e7\u00e3o D (Apple Silicon \/ Metal) ou C (apenas CPU) quando solicitado.<\/li>\n<li>O back-end llama.cpp usa Metal para acelera\u00e7\u00e3o por GPU em chips da s\u00e9rie M \u2014 n\u00e3o \u00e9 necess\u00e1rio CUDA.<\/li>\n<\/ol>\n<p>Usu\u00e1rios do macOS ficam limitados aos carregadores llama.cpp e Transformers. O ExLlamaV2 requer CUDA e n\u00e3o funciona em chips Apple Silicon.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Model_Loaders_Which_One_to_Use\"><\/span>Carregadores de modelos: qual escolher<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>O text-generation-webui desacopla o mecanismo de infer\u00eancia da interface gr\u00e1fica. Voc\u00ea seleciona um carregador por modelo na guia <strong>Modelo<\/strong> . Cada carregador aceita formatos espec\u00edficos de arquivos e possui diferentes requisitos de hardware.<\/p>\n<table>\n<thead>\n<tr>\n<th>Carregador<\/th>\n<th>Formato<\/th>\n<th>Hardware<\/th>\n<th>Quando usar<\/th>\n<\/tr>\n<\/thead>\n<tbody>\n<tr>\n<td>llama.cpp<\/td>\n<td>GGUF<\/td>\n<td>NVIDIA, AMD, Apple Silicon, CPU<\/td>\n<td>Padr\u00e3o para arquivos GGUF; mais port\u00e1til entre plataformas<\/td>\n<\/tr>\n<tr>\n<td>ExLlamaV2<\/td>\n<td>EXL2, GPTQ<\/td>\n<td>Apenas NVIDIA CUDA<\/td>\n<td>Maior taxa de processamento (throughput) na NVIDIA; preferido em vez do AutoGPTQ para novos modelos<\/td>\n<\/tr>\n<tr>\n<td>Transformers<\/td>\n<td>Hugging Face (fp16, bf16, int8, int4)<\/td>\n<td>NVIDIA, CPU<\/td>\n<td>Modelos originais do Hugging Face; mais lentos, mas com a maior compatibilidade<\/td>\n<\/tr>\n<tr>\n<td>AutoAWQ<\/td>\n<td>AWQ<\/td>\n<td>NVIDIA CUDA<\/td>\n<td>Modelos quantizados com AWQ<\/td>\n<\/tr>\n<tr>\n<td>AutoGPTQ<\/td>\n<td>GPTQ<\/td>\n<td>NVIDIA CUDA<\/td>\n<td>Modelos GPTQ antigos; o ExLlamaV2 \u00e9 mais r\u00e1pido para o mesmo formato<\/td>\n<\/tr>\n<\/tbody>\n<\/table>\n<p><strong>Padr\u00e3o pr\u00e1tico:<\/strong> Se voc\u00ea baixou um arquivo <code>.gguf<\/code> (o formato mais comum nas p\u00e1ginas de modelos do Hugging Face), use <strong>llama.cpp<\/strong>. Se voc\u00ea possui uma GPU NVIDIA e deseja a m\u00e1xima velocidade de gera\u00e7\u00e3o, procure uma variante EXL2 do mesmo modelo e use <strong>ExLlamaV2<\/strong>.<\/p>\n<p>Para uma an\u00e1lise detalhada dos modelos que cabem realista e eficientemente em cada GPU, consulte <a href=\"https:\/\/convly.ai\/pt\/vram-requirements-every-major-llm-2026\/\">Requisitos de VRAM para grandes modelos de linguagem (LLMs)<\/a>.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Loading_a_GGUF_Model_Step_by_Step\"><\/span>Carregando um modelo GGUF passo a passo<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<ol>\n<li><strong>Copie o arquivo<\/strong> para a pasta <code>text-generation-webui\/models\/<\/code>. Arquivos \u00fanicos GGUF (por exemplo, <code>mistral-7b-instruct.Q4_K_M.gguf<\/code>) devem ser colocados diretamente nessa pasta. Arquivos divididos em v\u00e1rias partes devem ser colocados em uma subpasta nomeada.<\/li>\n<li><strong>Abra a guia Modelo<\/strong> para <code>http:\/\/localhost:7860<\/code>.<\/li>\n<li>Selecione seu arquivo no menu suspenso de modelos (clique no \u00edcone de atualiza\u00e7\u00e3o se ele n\u00e3o aparecer).<\/li>\n<li>Defina <strong>Carregador<\/strong> para <code>llama.cpp<\/code>.<\/li>\n<li>Defina <strong>n-gpu-layers<\/strong> para controlar a descarga (offloading) para a GPU. Insira um n\u00famero elevado (por exemplo, <code>999<\/code>) para transferir o maior n\u00famero poss\u00edvel de camadas para a VRAM; insira <code>0<\/code> para infer\u00eancia exclusivamente na CPU.<\/li>\n<li>Clique <strong>Carregar<\/strong>. Uma mensagem de confirma\u00e7\u00e3o aparece na caixa de status assim que o modelo estiver pronto.<\/li>\n<\/ol>\n<p>Mude para a guia <strong>Conversa<\/strong> para iniciar uma conversa ou para a guia <strong>Padr\u00e3o<\/strong> Conclus\u00e3o de Prompt <strong>Modelo de instru\u00e7\u00e3o<\/strong> no menu suspenso da guia Par\u00e2metros.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"The_OpenAI-Compatible_API_Extension\"><\/span>A extens\u00e3o de API compat\u00edvel com a OpenAI<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>A extens\u00e3o embutida <code>openai<\/code> exp\u00f5e endpoints REST que replicam o formato das APIs OpenAI Chat Completions e Completions. Qualquer cliente que aceite uma URL base personalizada \u2014 LangChain, Open WebUI, Continue.dev ou at\u00e9 mesmo um script <code>curl<\/code> \u2014 pode se conectar ao seu modelo local sem altera\u00e7\u00f5es no c\u00f3digo.<\/p>\n<p>Ative-a passando uma flag ao iniciar:<\/p>\n<pre><code># Linux \/ macOS\n.\/start_linux.sh --extensions openai\n\n# ou inicie diretamente o server.py dentro do ambiente Conda\npython server.py --extensions openai<\/code><\/pre>\n<p>Alternativamente, ative-a na guia <strong>Sess\u00e3o<\/strong> na interface gr\u00e1fica e clique em <strong>Aplicar flags \/ Reiniciar<\/strong>.<\/p>\n<p>Por padr\u00e3o, a API escuta na porta 5000, separadamente da interface Gradio, que opera na porta 7860. Configure seu cliente para acessar:<\/p>\n<pre><code>base_url = \"http:\/\/localhost:5000\/v1\"\napi_key  = \"qualquer_coisa\"  # exigido pela maioria dos clientes, mas n\u00e3o validado localmente<\/code><\/pre>\n<p>Os endpoints suportados incluem <code>\/v1\/chat\/completions<\/code>, <code>\/v1\/completions<\/code>, e <code>\/v1\/models<\/code>. A porta pode ser configurada via a flag de inicializa\u00e7\u00e3o <code>--api-port<\/code> .<\/p>\n<h2><span class=\"ez-toc-section\" id=\"text-generation-webui_vs_LM_Studio_vs_Jan\"><\/span>text-generation-webui vs LM Studio vs Jan<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>As tr\u00eas ferramentas executam modelos localmente, sem depend\u00eancias em nuvem. Cada uma atende a usu\u00e1rios e casos de uso distintos.<\/p>\n<table>\n<thead>\n<tr>\n<th><\/th>\n<th>text-generation-webui<\/th>\n<th>LM Studio<\/th>\n<th>Jan<\/th>\n<\/tr>\n<\/thead>\n<tbody>\n<tr>\n<td>Interface<\/td>\n<td>Navegador (Gradio)<\/td>\n<td>Aplicativo nativo para desktop<\/td>\n<td>Aplicativo nativo para desktop<\/td>\n<\/tr>\n<tr>\n<td>Complexidade de configura\u00e7\u00e3o<\/td>\n<td>M\u00e9dio (script de um clique)<\/td>\n<td>Baixo (instalador gr\u00e1fico)<\/td>\n<td>Baixo (instalador gr\u00e1fico)<\/td>\n<\/tr>\n<tr>\n<td>Formatos de modelo<\/td>\n<td>GGUF, EXL2, GPTQ, AWQ, HF fp16<\/td>\n<td>Principalmente GGUF<\/td>\n<td>Principalmente GGUF<\/td>\n<\/tr>\n<tr>\n<td>Navegador integrado de modelos<\/td>\n<td>N\u00e3o<\/td>\n<td>Sim<\/td>\n<td>Sim<\/td>\n<\/tr>\n<tr>\n<td>API compat\u00edvel com OpenAI<\/td>\n<td>Sim (extens\u00e3o)<\/td>\n<td>Sim (integrado)<\/td>\n<td>Sim (integrado)<\/td>\n<\/tr>\n<tr>\n<td>Sistema de extens\u00f5es\/plug-ins<\/td>\n<td>Sim<\/td>\n<td>Limitado<\/td>\n<td>Limitado<\/td>\n<\/tr>\n<tr>\n<td>Apple Silicon (Metal)<\/td>\n<td>Sim (llama.cpp)<\/td>\n<td>Sim<\/td>\n<td>Sim<\/td>\n<\/tr>\n<tr>\n<td>Melhor para<\/td>\n<td>Usu\u00e1rios avan\u00e7ados, automa\u00e7\u00e3o e pesquisa<\/td>\n<td>Iniciantes, uso di\u00e1rio em conversas<\/td>\n<td>Usu\u00e1rios focados em software livre<\/td>\n<\/tr>\n<\/tbody>\n<\/table>\n<p><strong>Escolha o text-generation-webui<\/strong> quando voc\u00ea precisar de m\u00faltiplos backends de carregamento, desempenho EXL2 em GPUs NVIDIA, carregamento de LoRA, ecossistema de extens\u00f5es ou acesso \u00e0 API por meio de scripts para automa\u00e7\u00e3o e fluxos de desenvolvimento.<\/p>\n<p><strong>Escolha LM Studio ou Jan<\/strong> quando desejar um instalador polido, busca integrada de modelos com downloads de um clique e configura\u00e7\u00e3o m\u00ednima. Consulte o <a href=\"https:\/\/convly.ai\/pt\/lm-studio-complete-guide-2026\/\">Guia completo do LM Studio<\/a> para um passo a passo detalhado dessa op\u00e7\u00e3o.<\/p>\n<p>Se voc\u00ea estiver avaliando se a infer\u00eancia local vale o custo do hardware, o <a href=\"https:\/\/convly.ai\/pt\/self-hosting-vs-api-calculator\/\">calculadora de ponto de equil\u00edbrio entre hospedagem local e uso de API<\/a> pode quantificar a rela\u00e7\u00e3o custo-benef\u00edcio em compara\u00e7\u00e3o com o pagamento pelo acesso \u00e0 API, conforme seu volume de uso.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Frequently_Asked_Questions\"><\/span>Perguntas frequentes<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<h3>Por que o instalador de um clique demora tanto na primeira execu\u00e7\u00e3o?<\/h3>\n<p>Ele faz o download do Miniconda e constr\u00f3i, do zero, um ambiente isolado do Python com PyTorch e todas as bibliotecas de carregamento de modelos. Em uma conex\u00e3o r\u00e1pida, isso normalmente leva de 5 a 15 minutos. Lan\u00e7amentos subsequentes ignoram essa etapa e iniciam em poucos segundos.<\/p>\n<h3>Posso executar o text-generation-webui sem GPU?<\/h3>\n<p>Sim. Selecione a op\u00e7\u00e3o somente para CPU durante a instala\u00e7\u00e3o e defina <code>n-gpu-layers<\/code> para <code>0<\/code> ao carregar um modelo GGUF. Um modelo de 7B pode gerar de 2 a 5 tokens por segundo em uma CPU moderna de desktop \u2014 suficiente para testes, mas lento para conversa\u00e7\u00f5es. Quantiza\u00e7\u00f5es menores (Q4 e inferiores) melhoram o rendimento. Consulte o <a href=\"https:\/\/convly.ai\/pt\/best-gpus-for-local-llms-2026\/\">melhores GPUs para LLMs locais<\/a> se estiver considerando uma atualiza\u00e7\u00e3o de hardware.<\/p>\n<h3>Como atualizo o text-generation-webui?<\/h3>\n<p>Executar <code>git pull<\/code> dentro do diret\u00f3rio do reposit\u00f3rio para obter o c\u00f3digo mais recente e, em seguida, execute novamente o script de inicializa\u00e7\u00e3o. O script detecta altera\u00e7\u00f5es no ambiente e atualiza automaticamente as depend\u00eancias. Voc\u00ea tamb\u00e9m pode executar <code>pip install -r requirements.txt<\/code> manualmente dentro do ambiente ativo do Conda, caso prefira uma atualiza\u00e7\u00e3o direcionada.<\/p>\n<h3>Qual \u00e9 a diferen\u00e7a entre GGUF e EXL2?<\/h3>\n<p>Ambos s\u00e3o formatos quantizados que reduzem o tamanho dos arquivos de modelo e os requisitos de VRAM. O GGUF (por meio do llama.cpp) roda em GPUs NVIDIA, AMD e Apple Silicon \u2014 trata-se da op\u00e7\u00e3o mais port\u00e1til e com maior disponibilidade de modelos. O EXL2 (por meio do ExLlamaV2) funciona apenas em GPUs NVIDIA, mas normalmente gera tokens mais rapidamente com qualidade equivalente. Se voc\u00ea possui uma GPU NVIDIA e prioriza velocidade, vale a pena procurar modelos no formato EXL2.<\/p>\n<h3>Onde s\u00e3o salvos os registros das conversas?<\/h3>\n<p>Os registros s\u00e3o armazenados em <code>text-generation-webui\/logs\/<\/code>. Cada conversa \u00e9 salva como um arquivo JSON. Voc\u00ea tamb\u00e9m pode export\u00e1-la diretamente pela interface da guia Chat, usando o bot\u00e3o de download abaixo da janela de conversa\u00e7\u00e3o.<\/p>\n<h3>V\u00e1rios usu\u00e1rios podem se conectar a uma \u00fanica inst\u00e2ncia?<\/h3>\n<p>O <code>--listen<\/code> faz com que o servidor fique acess\u00edvel em sua rede local, em vez de apenas no localhost. No entanto, o text-generation-webui n\u00e3o foi projetado para implanta\u00e7\u00f5es de produ\u00e7\u00e3o multiusu\u00e1rio \u2014 n\u00e3o h\u00e1 autentica\u00e7\u00e3o integrada e a interface Gradio \u00e9 de sess\u00e3o \u00fanica. A extens\u00e3o da API OpenAI lida melhor com requisi\u00e7\u00f5es API simult\u00e2neas do que a interface web em cen\u00e1rios com m\u00faltiplos clientes, mas, se for exposta al\u00e9m do localhost, recomenda-se adicionar um proxy reverso com autentica\u00e7\u00e3o na frente dela.<\/p>","protected":false},"excerpt":{"rendered":"<p>text-generation-webui (widely called oobabooga after its GitHub author) is a free, open-source, browser-based interface for running LLMs locally on your [&hellip;]<\/p>\n","protected":false},"author":1,"featured_media":2183,"comment_status":"closed","ping_status":"closed","sticky":false,"template":"","format":"standard","meta":{"site-sidebar-layout":"default","site-content-layout":"","ast-site-content-layout":"default","site-content-style":"default","site-sidebar-style":"default","ast-global-header-display":"","ast-banner-title-visibility":"","ast-main-header-display":"","ast-hfb-above-header-display":"","ast-hfb-below-header-display":"","ast-hfb-mobile-header-display":"","site-post-title":"","ast-breadcrumbs-content":"","ast-featured-img":"","footer-sml-layout":"","ast-disable-related-posts":"","theme-transparent-header-meta":"","adv-header-id-meta":"","stick-header-meta":"","header-above-stick-meta":"","header-main-stick-meta":"","header-below-stick-meta":"","astra-migrate-meta-layouts":"default","ast-page-background-enabled":"default","ast-page-background-meta":{"desktop":{"background-color":"var(--ast-global-color-5)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"tablet":{"background-color":"","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"mobile":{"background-color":"","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""}},"ast-content-background-meta":{"desktop":{"background-color":"var(--ast-global-color-4)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"tablet":{"background-color":"var(--ast-global-color-4)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"mobile":{"background-color":"var(--ast-global-color-4)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""}},"footnotes":""},"categories":[7],"tags":[],"class_list":["post-2182","post","type-post","status-publish","format-standard","has-post-thumbnail","hentry","category-ai-news"],"_links":{"self":[{"href":"https:\/\/convly.ai\/pt\/wp-json\/wp\/v2\/posts\/2182","targetHints":{"allow":["GET"]}}],"collection":[{"href":"https:\/\/convly.ai\/pt\/wp-json\/wp\/v2\/posts"}],"about":[{"href":"https:\/\/convly.ai\/pt\/wp-json\/wp\/v2\/types\/post"}],"author":[{"embeddable":true,"href":"https:\/\/convly.ai\/pt\/wp-json\/wp\/v2\/users\/1"}],"replies":[{"embeddable":true,"href":"https:\/\/convly.ai\/pt\/wp-json\/wp\/v2\/comments?post=2182"}],"version-history":[{"count":1,"href":"https:\/\/convly.ai\/pt\/wp-json\/wp\/v2\/posts\/2182\/revisions"}],"predecessor-version":[{"id":2184,"href":"https:\/\/convly.ai\/pt\/wp-json\/wp\/v2\/posts\/2182\/revisions\/2184"}],"wp:featuredmedia":[{"embeddable":true,"href":"https:\/\/convly.ai\/pt\/wp-json\/wp\/v2\/media\/2183"}],"wp:attachment":[{"href":"https:\/\/convly.ai\/pt\/wp-json\/wp\/v2\/media?parent=2182"}],"wp:term":[{"taxonomy":"category","embeddable":true,"href":"https:\/\/convly.ai\/pt\/wp-json\/wp\/v2\/categories?post=2182"},{"taxonomy":"post_tag","embeddable":true,"href":"https:\/\/convly.ai\/pt\/wp-json\/wp\/v2\/tags?post=2182"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}