{"id":2485,"date":"2026-08-30T20:13:51","date_gmt":"2026-08-30T20:13:51","guid":{"rendered":"https:\/\/convly.ai\/?p=2485"},"modified":"2026-08-30T20:13:51","modified_gmt":"2026-08-30T20:13:51","slug":"ollama-local-ai","status":"publish","type":"post","link":"https:\/\/convly.ai\/pt\/ollama-local-ai\/","title":{"rendered":"IA Local Ollama: Guia Completo de Configura\u00e7\u00e3o e Requisitos de Modelos"},"content":{"rendered":"<div class=\"convly-tldr\"><strong>Resumo<\/strong><\/p>\n<ul>\n<li>O Ollama permite executar modelos de IA como Llama, Mistral e Gemma localmente por meio de uma \u00fanica ferramenta de linha de comando<\/li>\n<li>Instala\u00e7\u00e3o em segundos: <code>curl https:\/\/ollama.com\/install.sh | sh<\/code> (Linux\/macOS) ou baixe o instalador para Windows<\/li>\n<li>Modelos de entrada exigem 4\u20138 GB de VRAM; modelos de produ\u00e7\u00e3o de 70B exigem cerca de 40 GB de VRAM com quantiza\u00e7\u00e3o de 4 bits<\/li>\n<li>Ponto de equil\u00edbrio versus APIs em nuvem: cerca de 500 mil tokens\/m\u00eas para um modelo de 70B, menos para modelos menores<\/li>\n<\/ul>\n<\/div>\n<p>Ollama is a command-line tool that packages AI language models into containers you can run on your own hardware. Instead of sending prompts to OpenAI, Anthropic, or Google and paying per token, you download a model once\u2014Llama 3.3 70B, Mistral 7B, Phi-4, or any of <a href=\"https:\/\/convly.ai\/pt\/ollama-models-list-2026\/\">dezenas de modelos suportados<\/a>\u2014 e a infer\u00eancia \u00e9 executada inteiramente em sua GPU ou CPU. Seus dados permanecem locais, voc\u00ea n\u00e3o paga nada por requisi\u00e7\u00e3o ap\u00f3s o custo inicial do hardware e mant\u00e9m controle total sobre o comportamento do modelo e sua disponibilidade.<\/p>\n<p>A contrapartida \u00e9 o hardware: voc\u00ea precisa de VRAM suficiente para armazenar o modelo. Um modelo de 7B par\u00e2metros com quantiza\u00e7\u00e3o de 4 bits requer cerca de 4\u20135 GB de mem\u00f3ria de GPU, o que cabe em uma RTX 4060 de consumo. Um modelo de 70B precisa de aproximadamente 40 GB com quantiza\u00e7\u00e3o de 4 bits, exigindo uma placa workstation como a RTX 6000 Ada ou uma configura\u00e7\u00e3o multi-GPU. A <a href=\"https:\/\/convly.ai\/pt\/llm-vram-calculator\/\">Calculadora de VRAM<\/a> mostra os requisitos exatos para qualquer tamanho de modelo e n\u00edvel de quantiza\u00e7\u00e3o.<\/p>\n<div id=\"ez-toc-container\" class=\"ez-toc-v2_0_86 counter-flat ez-toc-counter ez-toc-container-direction\">\n<label for=\"ez-toc-cssicon-toggle-item-6a94c1ca10a34\" class=\"ez-toc-cssicon-toggle-label\"><span class=\"\"><span class=\"eztoc-hide\" style=\"display:none;\">Alternar<\/span><span class=\"ez-toc-icon-toggle-span\"><svg style=\"fill: #000000;color:#000000\" xmlns=\"http:\/\/www.w3.org\/2000\/svg\" class=\"list-377408\" width=\"20px\" height=\"20px\" viewbox=\"0 0 24 24\" fill=\"none\"><path d=\"M6 6H4v2h2V6zm14 0H8v2h12V6zM4 11h2v2H4v-2zm16 0H8v2h12v-2zM4 16h2v2H4v-2zm16 0H8v2h12v-2z\" fill=\"currentColor\"><\/path><\/svg><svg style=\"fill: #000000;color:#000000\" class=\"arrow-unsorted-368013\" xmlns=\"http:\/\/www.w3.org\/2000\/svg\" width=\"10px\" height=\"10px\" viewbox=\"0 0 24 24\" version=\"1.2\" baseprofile=\"tiny\"><path d=\"M18.2 9.3l-6.2-6.3-6.2 6.3c-.2.2-.3.4-.3.7s.1.5.3.7c.2.2.4.3.7.3h11c.3 0 .5-.1.7-.3.2-.2.3-.5.3-.7s-.1-.5-.3-.7zM5.8 14.7l6.2 6.3 6.2-6.3c.2-.2.3-.5.3-.7s-.1-.5-.3-.7c-.2-.2-.4-.3-.7-.3h-11c-.3 0-.5.1-.7.3-.2.2-.3.5-.3.7s.1.5.3.7z\"\/><\/svg><\/span><\/span><\/label><input type=\"checkbox\"  id=\"ez-toc-cssicon-toggle-item-6a94c1ca10a34\"  aria-label=\"Alternar\" \/><nav><ul class='ez-toc-list ez-toc-list-level-1' ><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-1\" href=\"https:\/\/convly.ai\/pt\/ollama-local-ai\/#Installing_Ollama\" >Instalando o Ollama<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-2\" href=\"https:\/\/convly.ai\/pt\/ollama-local-ai\/#Running_Your_First_Model\" >Executando seu primeiro modelo<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-3\" href=\"https:\/\/convly.ai\/pt\/ollama-local-ai\/#Model_Selection_and_VRAM_Requirements\" >Sele\u00e7\u00e3o de modelos e requisitos de VRAM<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-4\" href=\"https:\/\/convly.ai\/pt\/ollama-local-ai\/#Common_Commands_and_Configuration\" >Comandos comuns e configura\u00e7\u00e3o<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-5\" href=\"https:\/\/convly.ai\/pt\/ollama-local-ai\/#Hardware_Requirements\" >Requisitos de hardware<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-6\" href=\"https:\/\/convly.ai\/pt\/ollama-local-ai\/#Cost_Comparison_Local_vs_API\" >Compara\u00e7\u00e3o de custos: local versus API<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-7\" href=\"https:\/\/convly.ai\/pt\/ollama-local-ai\/#Frequently_Asked_Questions\" >Perguntas frequentes<\/a><\/li><\/ul><\/nav><\/div>\n<h2><span class=\"ez-toc-section\" id=\"Installing_Ollama\"><\/span>Instalando o Ollama<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<h3>Linux<\/h3>\n<p>Execute o script oficial de instala\u00e7\u00e3o, que detecta sua distribui\u00e7\u00e3o e configura o <code>ollama<\/code> servi\u00e7o:<\/p>\n<pre>curl -fsSL https:\/\/ollama.com\/install.sh | sh<\/pre>\n<p>Isso instala o bin\u00e1rio em <code>\/usr\/local\/bin\/ollama<\/code> e registra um servi\u00e7o systemd. O servi\u00e7o inicia automaticamente e persiste ap\u00f3s reinicializa\u00e7\u00f5es. Para verificar:<\/p>\n<pre>ollama --version<\/pre>\n<p>Se voc\u00ea estiver atr\u00e1s de um proxy corporativo ou precisar de instala\u00e7\u00e3o manual, baixe o bin\u00e1rio diretamente das <a href=\"https:\/\/github.com\/ollama\/ollama\/releases\" rel=\"noopener\" target=\"_blank\">vers\u00f5es no GitHub<\/a> e coloque-o em seu <code>PATH<\/code>.<\/p>\n<h3>macOS<\/h3>\n<p>Baixe o <code>.dmg<\/code> instalador do <a href=\"https:\/\/ollama.com\/download\" rel=\"noopener\" target=\"_blank\">ollama.com\/download<\/a>, abra-o e arraste o Ollama para a pasta Aplicativos. O aplicativo da barra de menus inicia o servidor local em <code>localhost:11434<\/code>. Para usar o Ollama no Terminal:<\/p>\n<pre>ollama --version<\/pre>\n<p>macOS users on Apple Silicon (M1\/M2\/M3\/M4) can run models using unified memory instead of discrete VRAM. A Mac Studio with 192 GB unified memory can serve a Llama 4 Maverick (240 GB at 4-bit) by swapping to disk, though inference speed drops significantly when exceeding physical RAM.<\/p>\n<h3>Windows<\/h3>\n<p>Baixe o <code>OllamaSetup.exe<\/code> instalador do <a href=\"https:\/\/ollama.com\/download\" rel=\"noopener\" target=\"_blank\">ollama.com\/download<\/a> e execute-o. O instalador adiciona <code>ollama.exe<\/code> ao seu PATH e inicia o servi\u00e7o em segundo plano. Abra o PowerShell ou o Prompt de Comando e verifique:<\/p>\n<pre>ollama --version<\/pre>\n<p>O Windows Subsystem for Linux (WSL2) com passagem de GPU \u00e9 suportado: instale o Ollama dentro de sua distribui\u00e7\u00e3o WSL2 seguindo as instru\u00e7\u00f5es para Linux e certifique-se de ter os drivers NVIDIA CUDA instalados no host Windows.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Running_Your_First_Model\"><\/span>Executando seu primeiro modelo<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Baixe e execute o Llama 3.1 8B, um modelo capaz de seguir instru\u00e7\u00f5es que cabe em 5 GB de VRAM:<\/p>\n<pre>ollama run llama3.1:8b<\/pre>\n<p>O Ollama baixa o modelo (aproximadamente 4,7 GB) para <code>~\/.ollama\/models<\/code> (Linux\/macOS) ou <code>%USERPROFILE%\\.ollama\\models<\/code> (Windows), carrega-o na mem\u00f3ria e abre um prompt interativo. Digite uma mensagem, pressione Enter e o modelo gera uma resposta localmente. Pressione <code>Ctrl+D<\/code> ou digite <code>\/bye<\/code> para sair.<\/p>\n<p>Para executar um modelo em segundo plano e consult\u00e1-lo via API:<\/p>\n<pre>ollama serve<\/pre>\n<p>Isso inicia um servidor em <code>http:\/\/localhost:11434<\/code>. Em outro terminal:<\/p>\n<pre>curl http:\/\/localhost:11434\/api\/generate -d '{\n  \"model\": \"llama3.1:8b\",\n  \"prompt\": \"Explique o controle de congestionamento TCP\",\n  \"stream\": false\n}'<\/pre>\n<p>A resposta \u00e9 retornada em JSON, com a conclus\u00e3o completa no campo <code>response<\/code> .<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Model_Selection_and_VRAM_Requirements\"><\/span>Sele\u00e7\u00e3o de modelos e requisitos de VRAM<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>O Ollama suporta modelos de pesos abertos da Meta, Mistral AI, Microsoft, Google, Alibaba e outras empresas. A tabela abaixo mostra op\u00e7\u00f5es populares e sua ocupa\u00e7\u00e3o de mem\u00f3ria com quantiza\u00e7\u00e3o de 4 bits, extra\u00eddas do <a href=\"https:\/\/convly.ai\/pt\/vram-requirements-every-major-llm-2026\/\">banco de dados de requisitos de VRAM<\/a>:<\/p>\n<table>\n<thead>\n<tr>\n<th>Modelo<\/th>\n<th>Par\u00e2metros<\/th>\n<th>Comprimento do contexto<\/th>\n<th>VRAM em 4 bits<\/th>\n<th>Caso de uso<\/th>\n<\/tr>\n<\/thead>\n<tbody>\n<tr>\n<td>Llama 3.1 8B<\/td>\n<td>8B<\/td>\n<td>128K<\/td>\n<td>~5 GB<\/td>\n<td>Seguimento geral de instru\u00e7\u00f5es, adequado para GPUs de consumo<\/td>\n<\/tr>\n<tr>\n<td>Mistral 7B<\/td>\n<td>7B<\/td>\n<td>32K<\/td>\n<td>~4,5 GB<\/td>\n<td>Infer\u00eancia r\u00e1pida, boa gera\u00e7\u00e3o de c\u00f3digo<\/td>\n<\/tr>\n<tr>\n<td>Phi-4<\/td>\n<td>14B<\/td>\n<td>16K<\/td>\n<td>~9 GB<\/td>\n<td>Racioc\u00ednio e matem\u00e1tica, eficiente para seu tamanho<\/td>\n<\/tr>\n<tr>\n<td>Mistral NeMo 12B<\/td>\n<td>12B<\/td>\n<td>128K<\/td>\n<td>~7,5 GB<\/td>\n<td>Tarefas de contexto longo, multil\u00edngue<\/td>\n<\/tr>\n<tr>\n<td>Qwen3 8B<\/td>\n<td>8B<\/td>\n<td>128K<\/td>\n<td>~5 GB<\/td>\n<td>Fortemente multil\u00edngue, competitivo com modelos maiores<\/td>\n<\/tr>\n<tr>\n<td>Gemma 3 4B<\/td>\n<td>4B<\/td>\n<td>128K<\/td>\n<td>~3 GB<\/td>\n<td>Menor modelo vi\u00e1vel, executa em GPUs integradas<\/td>\n<\/tr>\n<tr>\n<td>Llama 3.3 70B<\/td>\n<td>70B<\/td>\n<td>128K<\/td>\n<td>~40 GB<\/td>\n<td>Racioc\u00ednio de n\u00edvel produtivo, equivalente \u00e0 classe GPT-4<\/td>\n<\/tr>\n<tr>\n<td>DeepSeek R1 Distill Llama 70B<\/td>\n<td>70B<\/td>\n<td>128K<\/td>\n<td>~40 GB<\/td>\n<td>Modelo de racioc\u00ednio destilado, com desempenho s\u00f3lido em STEM<\/td>\n<\/tr>\n<\/tbody>\n<\/table>\n<p>Para listar todos os modelos dispon\u00edveis no seu sistema:<\/p>\n<pre>ollama list<\/pre>\n<p>Para excluir um modelo e liberar espa\u00e7o em disco:<\/p>\n<pre>ollama rm llama3.1:8b<\/pre>\n<p>As tags dos modelos seguem o formato <code>nome:tamanho<\/code> ou <code>nome:vers\u00e3o<\/code>. Omitir a tag assume como padr\u00e3o <code>:latest<\/code>. Veja o cat\u00e1logo completo em <a href=\"https:\/\/convly.ai\/pt\/best-local-llms-to-run-on-ollama-2026\/\">melhores LLMs locais para Ollama<\/a>.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Common_Commands_and_Configuration\"><\/span>Comandos comuns e configura\u00e7\u00e3o<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Execute um modelo com par\u00e2metros personalizados:<\/p>\n<pre>ollama run llama3.1:8b --temperature 0.7 --top-p 0.9<\/pre>\n<p>Passe um prompt diretamente, sem entrar no modo interativo:<\/p>\n<pre>ollama run llama3.1:8b \"Escreva uma fun\u00e7\u00e3o Python para analisar datas no formato ISO 8601\"<\/pre>\n<p>Carregue um modelo na mem\u00f3ria sem exibir o prompt (\u00fatil para pr\u00e9-aquecimento antes de atender requisi\u00e7\u00f5es):<\/p>\n<pre>ollama pull llama3.1:8b<\/pre>\n<p>Verifique quais modelos est\u00e3o atualmente carregados na VRAM:<\/p>\n<pre>ollama ps<\/pre>\n<p>Defina o n\u00famero de camadas da GPU a serem descarregadas (\u00fatil para descarregamento parcial na GPU quando a VRAM \u00e9 limitada):<\/p>\n<pre>OLLAMA_NUM_GPU=35 ollama run llama3.3:70b<\/pre>\n<p>Por padr\u00e3o, o Ollama descarrega todas as camadas para a GPU. Reduzir <code>OLLAMA_NUM_GPU<\/code> mant\u00e9m algumas camadas na CPU, trocando velocidade por menor uso de VRAM. Um modelo de 70B com 20 camadas na GPU pode exigir apenas 20 GB de VRAM, mas executar\u00e1 3\u20135\u00d7 mais lentamente.<\/p>\n<p>Para alterar o diret\u00f3rio de armazenamento dos modelos, defina <code>OLLAMA_MODELS<\/code> antes de executar:<\/p>\n<pre>export OLLAMA_MODELS=\/mnt\/nvme\/ollama_models\nollama pull llama3.1:8b<\/pre>\n<p>O Ollama usa arquivos mapeados em mem\u00f3ria, portanto os modelos s\u00e3o carregados mais rapidamente a partir de unidades NVMe do que de SSDs SATA. Espere de 10 a 15 segundos para carregar um modelo de 8B em um sistema moderno, e de 60 a 90 segundos para um modelo de 70B.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Hardware_Requirements\"><\/span>Requisitos de hardware<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>O fator limitante \u00e9 a VRAM, n\u00e3o o poder computacional. Um modelo de 70B quantizado em 4 bits requer 40 GB de mem\u00f3ria GPU, mas executa adequadamente em arquiteturas de gera\u00e7\u00f5es anteriores. Uma RTX 3090 (24 GB) pode servir dois modelos de 8B ou um modelo de 30B. Uma RTX 4090 (24 GB) lida com a mesma carga com 30\u201340% mais alto throughput gra\u00e7as aos n\u00facleos tensoriais aprimorados da arquitetura Ada Lovelace.<\/p>\n<p>GPUs recomendadas por faixa de pre\u00e7o:<\/p>\n<ul>\n<li><strong>Entrada ($300\u2013500):<\/strong> RTX 4060 Ti 16 GB executa modelos de 8B e 12B<\/li>\n<li><strong>Usu\u00e1rio avan\u00e7ado ($1000\u20131500):<\/strong> RTX 4090 ou A4000 Ada executa modelos de 30B confortavelmente<\/li>\n<li><strong>Esta\u00e7\u00e3o de trabalho ($4000\u20137000):<\/strong> RTX 6000 Ada (48 GB) ou duas RTX 4090 para modelos de 70B<\/li>\n<li><strong>Atendimento a m\u00faltiplos modelos ($10.000+):<\/strong> A100 80GB ou H100 80GB para executar v\u00e1rias inst\u00e2ncias de modelos de 70B<\/li>\n<\/ul>\n<p>Veja o <a href=\"https:\/\/convly.ai\/pt\/best-gpus-for-local-llms-2026\/\">Guia de compra de GPUs<\/a> para compara\u00e7\u00f5es detalhadas. Usu\u00e1rios de Apple Silicon se beneficiam da mem\u00f3ria unificada: um M2 Ultra com 192 GB pode executar modelos que exigiriam uma configura\u00e7\u00e3o NVIDIA de $25.000, embora o throughput de tokens seja 2\u20133\u00d7 menor que o de um A100.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Cost_Comparison_Local_vs_API\"><\/span>Compara\u00e7\u00e3o de custos: local versus API<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>As APIs em nuvem cobram por token. <a href=\"https:\/\/convly.ai\/pt\/models\/\">Claude Sonnet 5<\/a> custa $2,00 por milh\u00e3o de tokens de entrada e $10,00 por milh\u00e3o de tokens de sa\u00edda. Uma sess\u00e3o t\u00edpica de assistente de programa\u00e7\u00e3o gera 500 mil tokens por m\u00eas (250 mil de entrada, 250 mil de sa\u00edda), custando $3.000 anualmente.<\/p>\n<p>Um modelo Llama 3.3 70B auto-hospedado em uma esta\u00e7\u00e3o de trabalho de $6.000 (RTX 6000 Ada) tem custo marginal zero ap\u00f3s a aquisi\u00e7\u00e3o do hardware. O ponto de equil\u00edbrio ocorre aproximadamente em 500 mil tokens por m\u00eas. Abaixo disso, as APIs s\u00e3o mais baratas; acima disso, a infer\u00eancia local \u00e9 vantajosa. Use a <a href=\"https:\/\/convly.ai\/pt\/self-hosting-vs-api-calculator\/\">calculadora de hospedagem pr\u00f3pria<\/a> para modelar sua carga de trabalho espec\u00edfica.<\/p>\n<p>Modelos menores atingem o ponto de equil\u00edbrio mais rapidamente. Um modelo de 8B em uma RTX 4060 Ti de $500 paga-se em 3\u20134 meses comparado ao uso de APIs em nuvem com uso moderado (100 mil tokens\/m\u00eas). A vantagem adicional \u00e9 a privacidade: seu c\u00f3digo, documentos e dados internos nunca deixam sua rede.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Frequently_Asked_Questions\"><\/span>Perguntas frequentes<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<h3>O Ollama pode executar modelos apenas na CPU?<\/h3>\n<p>Sim, mas a infer\u00eancia \u00e9 10\u201350\u00d7 mais lenta, dependendo do tamanho do modelo. Um modelo de 8B gera 1\u20133 tokens por segundo em uma CPU moderna Ryzen ou Intel, comparado a 40\u201380 tokens\/seg em uma RTX 4090. Defina <code>OLLAMA_NUM_GPU=0<\/code> para for\u00e7ar o modo somente CPU. \u00c9 pr\u00e1tico para processamento em lote ou uso com baixo tr\u00e1fego, mas invi\u00e1vel para chat interativo.<\/p>\n<h3>Como a quantiza\u00e7\u00e3o afeta a qualidade?<\/h3>\n<p>A quantiza\u00e7\u00e3o em 4 bits reduz o tamanho do modelo em 75%, com perda m\u00ednima de qualidade \u2014 benchmarks mostram degrada\u00e7\u00e3o de 1\u20133% na precis\u00e3o em MMLU e HumanEval comparado ao FP16. A quantiza\u00e7\u00e3o em 3 bits (Q3) reduz ainda mais o tamanho, mas degrada significativamente o racioc\u00ednio e o seguimento de instru\u00e7\u00f5es. O Ollama usa Q4_0 como padr\u00e3o, equilibrando qualidade e uso de VRAM. Voc\u00ea pode baixar vers\u00f5es em 8 bits ou FP16 especificando tags como <code>llama3.1:8b-q8_0<\/code>, dobrando os requisitos de VRAM.<\/p>\n<h3>Posso ajustar finamente modelos com o Ollama?<\/h3>\n<p>N\u00e3o. O Ollama \u00e9 um ambiente de execu\u00e7\u00e3o para infer\u00eancia, n\u00e3o um framework de treinamento. Para ajuste fino de um modelo, use ferramentas como Hugging Face Transformers, Axolotl ou LLaMA Factory, exporte o resultado no formato GGUF e importe-o para o Ollama via um Modelfile. O processo est\u00e1 documentado no reposit\u00f3rio GitHub do Ollama em <code>docs\/import.md<\/code>.<\/p>\n<h3>O que \u00e9 a API do Ollama e como us\u00e1-la?<\/h3>\n<p>O Ollama exp\u00f5e uma API REST compat\u00edvel com OpenAI em <code>localhost:11434<\/code>. O bloco <code>\/api\/generate<\/code> o endpoint lida com conclus\u00f5es, e <code>\/api\/chat<\/code> suporta conversas com m\u00faltiplas voltas, mantendo o hist\u00f3rico de mensagens. Voc\u00ea pode integr\u00e1-lo a bases de c\u00f3digo existentes simplesmente alterando a URL base: em vez de <code>https:\/\/api.openai.com\/v1<\/code>, aponte seu cliente para <code>http:\/\/localhost:11434<\/code>. Muitos frameworks, como LangChain e LlamaIndex, possuem suporte nativo ao Ollama.<\/p>\n<h3>Quantas requisi\u00e7\u00f5es por segundo o Ollama consegue lidar?<\/h3>\n<p>Um \u00fanico modelo carregado atende uma requisi\u00e7\u00e3o por vez. O throughput depende do tamanho do modelo e do hardware: uma RTX 4090 gera 60\u201380 tokens\/seg para um modelo de 8B e 15\u201325 tokens\/seg para um modelo de 70B. Para lidar com usu\u00e1rios simult\u00e2neos, voc\u00ea pode escalar horizontalmente (v\u00e1rias m\u00e1quinas) ou usar agrupamento (batching) na camada de aplica\u00e7\u00e3o. O Ollama n\u00e3o possui fila de requisi\u00e7\u00f5es embutida; voc\u00ea precisa de um proxy reverso como o NGINX ou de um balanceador de carga.<\/p>\n<h3>Posso executar v\u00e1rios modelos simultaneamente?<\/h3>\n<p>Sim, desde que voc\u00ea tenha VRAM suficiente. Carregue um segundo modelo com <code>ollama run<\/code> em um novo terminal enquanto o primeiro estiver em execu\u00e7\u00e3o. O Ollama compartilha a GPU entre os modelos. Dois modelos de 8B (10 GB no total) rodam confortavelmente em uma RTX 4090 de 24 GB. A altern\u00e2ncia entre modelos \u00e9 quase instant\u00e2nea se ambos j\u00e1 estiverem carregados; caso contr\u00e1rio, espere tempos de carregamento de 10 a 90 segundos, dependendo do tamanho do modelo.<\/p>","protected":false},"excerpt":{"rendered":"<p>TL;DROllama lets you run AI models like Llama, Mistral, and Gemma locally via a single command-line tool Install in seconds: [\u2026]<\/p>\n","protected":false},"author":1,"featured_media":2486,"comment_status":"closed","ping_status":"closed","sticky":false,"template":"","format":"standard","meta":{"site-sidebar-layout":"default","site-content-layout":"","ast-site-content-layout":"default","site-content-style":"default","site-sidebar-style":"default","ast-global-header-display":"","ast-banner-title-visibility":"","ast-main-header-display":"","ast-hfb-above-header-display":"","ast-hfb-below-header-display":"","ast-hfb-mobile-header-display":"","site-post-title":"","ast-breadcrumbs-content":"","ast-featured-img":"","footer-sml-layout":"","ast-disable-related-posts":"","theme-transparent-header-meta":"","adv-header-id-meta":"","stick-header-meta":"","header-above-stick-meta":"","header-main-stick-meta":"","header-below-stick-meta":"","astra-migrate-meta-layouts":"default","ast-page-background-enabled":"default","ast-page-background-meta":{"desktop":{"background-color":"var(--ast-global-color-5)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"tablet":{"background-color":"","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"mobile":{"background-color":"","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""}},"ast-content-background-meta":{"desktop":{"background-color":"var(--ast-global-color-4)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"tablet":{"background-color":"var(--ast-global-color-4)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"mobile":{"background-color":"var(--ast-global-color-4)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""}},"footnotes":""},"categories":[7],"tags":[],"class_list":["post-2485","post","type-post","status-publish","format-standard","has-post-thumbnail","hentry","category-ai-news"],"_links":{"self":[{"href":"https:\/\/convly.ai\/pt\/wp-json\/wp\/v2\/posts\/2485","targetHints":{"allow":["GET"]}}],"collection":[{"href":"https:\/\/convly.ai\/pt\/wp-json\/wp\/v2\/posts"}],"about":[{"href":"https:\/\/convly.ai\/pt\/wp-json\/wp\/v2\/types\/post"}],"author":[{"embeddable":true,"href":"https:\/\/convly.ai\/pt\/wp-json\/wp\/v2\/users\/1"}],"replies":[{"embeddable":true,"href":"https:\/\/convly.ai\/pt\/wp-json\/wp\/v2\/comments?post=2485"}],"version-history":[{"count":1,"href":"https:\/\/convly.ai\/pt\/wp-json\/wp\/v2\/posts\/2485\/revisions"}],"predecessor-version":[{"id":2487,"href":"https:\/\/convly.ai\/pt\/wp-json\/wp\/v2\/posts\/2485\/revisions\/2487"}],"wp:featuredmedia":[{"embeddable":true,"href":"https:\/\/convly.ai\/pt\/wp-json\/wp\/v2\/media\/2486"}],"wp:attachment":[{"href":"https:\/\/convly.ai\/pt\/wp-json\/wp\/v2\/media?parent=2485"}],"wp:term":[{"taxonomy":"category","embeddable":true,"href":"https:\/\/convly.ai\/pt\/wp-json\/wp\/v2\/categories?post=2485"},{"taxonomy":"post_tag","embeddable":true,"href":"https:\/\/convly.ai\/pt\/wp-json\/wp\/v2\/tags?post=2485"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}