{"id":2205,"date":"2026-08-14T20:17:07","date_gmt":"2026-08-14T20:17:07","guid":{"rendered":"https:\/\/convly.ai\/?p=2205"},"modified":"2026-08-14T20:17:07","modified_gmt":"2026-08-14T20:17:07","slug":"ollama-not-using-gpu-fix","status":"publish","type":"post","link":"https:\/\/convly.ai\/es\/ollama-not-using-gpu-fix\/","title":{"rendered":"Ollama no utiliza la GPU: diagn\u00f3stico y soluci\u00f3n del uso forzado de la CPU"},"content":{"rendered":"<div class=\"convly-tldr\">\n<ul>\n<li>Ejecutar <code>ollama ps<\/code> mientras se carga un modelo: la columna PROCESADOR indica si Ollama est\u00e1 utilizando la GPU o la CPU.<\/li>\n<li>La soluci\u00f3n m\u00e1s habitual en sistemas NVIDIA consiste en instalar o actualizar el controlador del sistema anfitri\u00f3n para que <code>nvidia-smi<\/code> detecte la tarjeta gr\u00e1fica y, a continuaci\u00f3n, reiniciar el servicio de Ollama.<\/li>\n<li>Si el modelo es m\u00e1s grande que su VRAM, Ollama descarga capas a la CPU; utilice la <a href=\"https:\/\/convly.ai\/es\/llm-vram-calculator\/\">Calculadora de VRAM<\/a> para comprobar si su modelo cabe antes de descargarlo.<\/li>\n<li>AMD, Docker y WSL2 requieren pasos espec\u00edficos para cada plataforma, explicados a continuaci\u00f3n.<\/li>\n<\/ul>\n<\/div>\n<p>Cuando Ollama no utiliza su GPU, la causa m\u00e1s frecuente es un controlador ausente o incompatible. Ejecute <code>ollama ps<\/code> \u2014si la columna PROCESADOR muestra 100 % CPU, Ollama ha pasado completamente a la CPU. La soluci\u00f3n depende de su plataforma: NVIDIA necesita el entorno de ejecuci\u00f3n CUDA adecuado, AMD requiere ROCm y Docker necesita banderas expl\u00edcitas de paso de GPU.<\/p>\n<div id=\"ez-toc-container\" class=\"ez-toc-v2_0_86 counter-flat ez-toc-counter ez-toc-container-direction\">\n<label for=\"ez-toc-cssicon-toggle-item-6a7fb8f2795a6\" class=\"ez-toc-cssicon-toggle-label\"><span class=\"\"><span class=\"eztoc-hide\" style=\"display:none;\">Alternar<\/span><span class=\"ez-toc-icon-toggle-span\"><svg style=\"fill: #000000;color:#000000\" xmlns=\"http:\/\/www.w3.org\/2000\/svg\" class=\"list-377408\" width=\"20px\" height=\"20px\" viewbox=\"0 0 24 24\" fill=\"none\"><path d=\"M6 6H4v2h2V6zm14 0H8v2h12V6zM4 11h2v2H4v-2zm16 0H8v2h12v-2zM4 16h2v2H4v-2zm16 0H8v2h12v-2z\" fill=\"currentColor\"><\/path><\/svg><svg style=\"fill: #000000;color:#000000\" class=\"arrow-unsorted-368013\" xmlns=\"http:\/\/www.w3.org\/2000\/svg\" width=\"10px\" height=\"10px\" viewbox=\"0 0 24 24\" version=\"1.2\" baseprofile=\"tiny\"><path d=\"M18.2 9.3l-6.2-6.3-6.2 6.3c-.2.2-.3.4-.3.7s.1.5.3.7c.2.2.4.3.7.3h11c.3 0 .5-.1.7-.3.2-.2.3-.5.3-.7s-.1-.5-.3-.7zM5.8 14.7l6.2 6.3 6.2-6.3c.2-.2.3-.5.3-.7s-.1-.5-.3-.7c-.2-.2-.4-.3-.7-.3h-11c-.3 0-.5.1-.7.3-.2.2-.3.5-.3.7s.1.5.3.7z\"\/><\/svg><\/span><\/span><\/label><input type=\"checkbox\"  id=\"ez-toc-cssicon-toggle-item-6a7fb8f2795a6\"  aria-label=\"Alternar\" \/><nav><ul class='ez-toc-list ez-toc-list-level-1' ><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-1\" href=\"https:\/\/convly.ai\/es\/ollama-not-using-gpu-fix\/#Step_1_Confirm_Whether_Ollama_Is_Using_the_GPU\" >Paso 1: Confirmar si Ollama est\u00e1 utilizando la GPU<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-2\" href=\"https:\/\/convly.ai\/es\/ollama-not-using-gpu-fix\/#Step_2_NVIDIA_%E2%80%94_Drivers_and_CUDA_Runtime\" >Paso 2: NVIDIA \u2014 Controladores y entorno de ejecuci\u00f3n CUDA<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-3\" href=\"https:\/\/convly.ai\/es\/ollama-not-using-gpu-fix\/#Step_3_Model_Too_Large_for_VRAM\" >Paso 3: Modelo demasiado grande para la VRAM<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-4\" href=\"https:\/\/convly.ai\/es\/ollama-not-using-gpu-fix\/#Step_4_AMD_GPU_and_ROCm\" >Paso 4: GPU AMD y ROCm<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-5\" href=\"https:\/\/convly.ai\/es\/ollama-not-using-gpu-fix\/#Step_5_Docker_%E2%80%94_Missing_GPU_Passthrough\" >Paso 5: Docker \u2014 Falta el paso de GPU<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-6\" href=\"https:\/\/convly.ai\/es\/ollama-not-using-gpu-fix\/#Step_6_WSL2_on_Windows\" >Paso 6: WSL2 en Windows<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-7\" href=\"https:\/\/convly.ai\/es\/ollama-not-using-gpu-fix\/#macOS_%E2%80%94_Metal_Apple_Silicon_and_AMD\" >macOS \u2014 Metal (Apple Silicon y AMD)<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-8\" href=\"https:\/\/convly.ai\/es\/ollama-not-using-gpu-fix\/#Verifying_the_Fix_and_Expected_Throughput\" >Verificaci\u00f3n de la soluci\u00f3n y rendimiento esperado<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-9\" href=\"https:\/\/convly.ai\/es\/ollama-not-using-gpu-fix\/#Frequently_Asked_Questions\" >Preguntas frecuentes<\/a><\/li><\/ul><\/nav><\/div>\n<h2><span class=\"ez-toc-section\" id=\"Step_1_Confirm_Whether_Ollama_Is_Using_the_GPU\"><\/span>Paso 1: Confirmar si Ollama est\u00e1 utilizando la GPU<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Antes de realizar cualquier cambio, verifique lo que Ollama est\u00e1 haciendo realmente. Cargue un modelo y, mientras se est\u00e9 ejecutando, abra una segunda terminal:<\/p>\n<pre><code>ollama ps<\/code><\/pre>\n<p>Salida de ejemplo:<\/p>\n<pre><code>NOMBRE              ID              TAMA\u00d1O      PROCESADOR    HASTA\nllama3.2:8b       abc123def456    5,0 GB      100 % GPU     dentro de 4 minutos<\/code><\/pre>\n<p>La columna PROCESADOR es la se\u00f1al definitiva:<\/p>\n<table>\n<thead>\n<tr>\n<th>Valor de PROCESADOR<\/th>\n<th>Significado<\/th>\n<\/tr>\n<\/thead>\n<tbody>\n<tr>\n<td>100 % GPU<\/td>\n<td>Todas las capas en la GPU \u2014 comportamiento esperado y correcto<\/td>\n<\/tr>\n<tr>\n<td>XX % GPU \/ YY % CPU<\/td>\n<td>El modelo cabe parcialmente en la VRAM; las capas restantes se ejecutan en la CPU<\/td>\n<\/tr>\n<tr>\n<td>100 % CPU<\/td>\n<td>Uso forzado completo de la CPU \u2014 la GPU no se utiliza en absoluto<\/td>\n<\/tr>\n<\/tbody>\n<\/table>\n<p>En sistemas NVIDIA, compruebe tambi\u00e9n con <code>nvidia-smi<\/code> mientras se realiza la inferencia. La columna Uso de memoria deber\u00eda aumentar conforme se carga el modelo. Si permanece constante, la GPU est\u00e1 inactiva, independientemente de lo que indiquen otras herramientas.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Step_2_NVIDIA_%E2%80%94_Drivers_and_CUDA_Runtime\"><\/span>Paso 2: NVIDIA \u2014 Controladores y entorno de ejecuci\u00f3n CUDA<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>La ausencia o desactualizaci\u00f3n del controlador NVIDIA es la causa m\u00e1s com\u00fan de uso forzado completo de la CPU. Aunque Ollama incluye sus propias bibliotecas CUDA, sigue requiriendo un controlador del sistema anfitri\u00f3n compatible con CUDA 11.3 o posterior.<\/p>\n<h3>Compruebe primero el controlador<\/h3>\n<pre><code>nvidia-smi<\/code><\/pre>\n<p>Si el comando no se encuentra, no hay ning\u00fan controlador instalado. Si se ejecuta, anote la versi\u00f3n del controlador y la versi\u00f3n de CUDA que aparecen en el encabezado. La versi\u00f3n de CUDA mostrada corresponde a la versi\u00f3n m\u00e1xima que soporta dicho controlador \u2014no implica que se haya instalado por separado el kit de herramientas CUDA, y Ollama no lo requiere.<\/p>\n<table>\n<thead>\n<tr>\n<th>Plataforma<\/th>\n<th>Versi\u00f3n m\u00ednima del controlador<\/th>\n<\/tr>\n<\/thead>\n<tbody>\n<tr>\n<td>Linux<\/td>\n<td>525.xx (compatible con CUDA 12.0)<\/td>\n<\/tr>\n<tr>\n<td>Windows nativo<\/td>\n<td>527.xx (compatible con CUDA 12.0)<\/td>\n<\/tr>\n<tr>\n<td>WSL2 (anfitri\u00f3n Windows)<\/td>\n<td>525.xx en el lado de Windows \u2014 no instale el controlador NVIDIA para Linux dentro de WSL2<\/td>\n<\/tr>\n<\/tbody>\n<\/table>\n<h3>Instale o actualice el controlador<\/h3>\n<p><strong>Ubuntu \/ Debian:<\/strong><\/p>\n<pre><code>sudo apt install nvidia-driver-550\nsudo reboot<\/code><\/pre>\n<p><strong>Windows:<\/strong> Desc\u00e1rguelo desde nvidia.com\/Download o use GeForce Experience, y luego reinicie el sistema. Tras instalar o actualizar el controlador, es obligatorio reiniciar completamente el sistema \u2014no basta con reiniciar \u00fanicamente el servicio.<\/p>\n<p>Tras el reinicio, confirme que <code>nvidia-smi<\/code> muestra su tarjeta gr\u00e1fica y reinicie Ollama:<\/p>\n<pre><code># Linux (systemd)\nsudo systemctl restart ollama\n\n# macOS\nlaunchctl kickstart -k gui\/$(id -u)\/com.ollama.ollama\n\n# Windows \u2014 reinicie la aplicaci\u00f3n de Ollama en la bandeja del sistema o reinicie el equipo<\/code><\/pre>\n<p>Ejecute un modelo y vuelva a comprobar <code>ollama ps<\/code> . Si la columna PROCESADOR sigue mostrando 100 % CPU, contin\u00fae con los siguientes pasos.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Step_3_Model_Too_Large_for_VRAM\"><\/span>Paso 3: Modelo demasiado grande para la VRAM<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Cuando los pesos de un modelo superan la VRAM disponible, Ollama no rechaza su ejecuci\u00f3n, sino que divide la inferencia. Se asignan tantas capas del transformador como sea posible a la GPU; el resto se ejecuta en la CPU. Esto aparece como un porcentaje dividido en <code>ollama ps<\/code> y constituye un comportamiento intencional, no un error.<\/p>\n<p>Un modelo de 70 mil millones de par\u00e1metros con cuantizaci\u00f3n Q4_K_M suele requerir aproximadamente 40 GB de VRAM, lo cual supera la capacidad de cualquier GPU de consumo individual. Antes de descargar un modelo grande, compruebe si cabe mediante la <a href=\"https:\/\/convly.ai\/es\/llm-vram-calculator\/\">Calculadora de VRAM<\/a>. Para conocer los requisitos de VRAM por modelo entre los LLM m\u00e1s populares, consulte <a href=\"https:\/\/convly.ai\/es\/vram-requirements-every-major-llm-2026\/\">Requisitos de VRAM para cada LLM importante<\/a>.<\/p>\n<p>Si el modelo no cabe en su VRAM, tiene las siguientes opciones:<\/p>\n<ul>\n<li>Utilice una cuantizaci\u00f3n inferior (por ejemplo, Q2_K o Q3_K_S), lo que reduce el uso de VRAM con una ligera p\u00e9rdida de calidad.<\/li>\n<li>Cambie a una variante de modelo m\u00e1s peque\u00f1a (por ejemplo, 8B en lugar de 70B). La p\u00e1gina <a href=\"https:\/\/convly.ai\/es\/best-local-llms-to-run-on-ollama-2026\/\">mejores modelos locales para Ollama<\/a> explica qu\u00e9 modelos funcionan bien en hardware de consumo.<\/li>\n<li>Acepte la descarga parcial \u2014el rendimiento estar\u00e1 entre los valores correspondientes al uso exclusivo de GPU y al uso exclusivo de CPU.<\/li>\n<li>Actualice su GPU. La <a href=\"https:\/\/convly.ai\/es\/best-gpus-for-local-llms-2026\/\">mejoras GPUs para modelos de lenguaje local<\/a> esta gu\u00eda compara las opciones actuales seg\u00fan la cantidad de VRAM y el precio.<\/li>\n<\/ul>\n<h2><span class=\"ez-toc-section\" id=\"Step_4_AMD_GPU_and_ROCm\"><\/span>Paso 4: GPU AMD y ROCm<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>El soporte para AMD en Ollama se basa en ROCm, la plataforma de c\u00f3mputo GPU de AMD. Ollama admite oficialmente las tarjetas RDNA 2 (serie RX 6000) y RDNA 3 (serie RX 7000) en Linux. El soporte para AMD en Windows es limitado: consulte las notas de la versi\u00f3n de Ollama instalada antes de esperar que funcione en Windows.<\/p>\n<h3>Verifique que ROCm detecte la tarjeta<\/h3>\n<pre><code>rocm-smi<\/code><\/pre>\n<p>Si <code>rocm-smi<\/code> no se encuentra, la pila ROCm no est\u00e1 instalada. Consulte amd.com\/es\/developer\/rocm para obtener las instrucciones de instalaci\u00f3n actuales para su distribuci\u00f3n, ya que los nombres de los paquetes y los requisitos de versi\u00f3n cambian entre versiones de ROCm.<\/p>\n<p>Si la tarjeta no aparece en la salida de <code>rocm-smi<\/code> despu\u00e9s de la instalaci\u00f3n:<\/p>\n<pre><code>sudo usermod -aG render,video $USER\n# Cierre y vuelva a iniciar sesi\u00f3n para que el cambio de grupo surta efecto<\/code><\/pre>\n<p>Para dirigirse a una GPU espec\u00edfica cuando hay varias presentes:<\/p>\n<pre><code>HIP_VISIBLE_DEVICES=0 ollama serve<\/code><\/pre>\n<h2><span class=\"ez-toc-section\" id=\"Step_5_Docker_%E2%80%94_Missing_GPU_Passthrough\"><\/span>Paso 5: Docker \u2014 Falta el paso de GPU<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Los contenedores Docker no tienen acceso a la GPU a menos que se le pase expl\u00edcitamente el dispositivo. Esta es la causa m\u00e1s com\u00fan por la que Ollama recurre a la CPU en despliegues con contenedores: la GPU del host funciona correctamente, pero el contenedor no puede verla.<\/p>\n<h3>NVIDIA en Docker<\/h3>\n<p>Instale la herramienta NVIDIA Container Toolkit en el host:<\/p>\n<pre><code>sudo apt install nvidia-container-toolkit\nsudo nvidia-ctk runtime configure --runtime=docker\nsudo systemctl restart docker<\/code><\/pre>\n<p>Luego pase la GPU al iniciar el contenedor:<\/p>\n<pre><code>docker run -d --gpus all \n  -v ollama:\/root\/.ollama \n  -p 11434:11434 \n  ollama\/ollama<\/code><\/pre>\n<p>Sin la opci\u00f3n <code>--gpus all<\/code> (o <code>--gpus device=0<\/code> (para especificar una tarjeta concreta), el contenedor no tendr\u00e1 acceso a la GPU, independientemente de la configuraci\u00f3n del host.<\/p>\n<h3>AMD en Docker<\/h3>\n<pre><code>docker run -d \n  --device \/dev\/kfd --device \/dev\/dri \n  -v ollama:\/root\/.ollama \n  -p 11434:11434 \n  ollama\/ollama:rocm<\/code><\/pre>\n<p>El <code>:rocm<\/code> la etiqueta de imagen es obligatoria. La imagen predeterminada <code>ollama\/ollama<\/code> no incluye ROCm y recurrir\u00e1 a la CPU en hardware AMD.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Step_6_WSL2_on_Windows\"><\/span>Paso 6: WSL2 en Windows<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>WSL2 puede compartir la GPU NVIDIA con el host Windows, pero existe una regla absoluta: el controlador NVIDIA debe instalarse en <strong>Windows<\/strong>Windows<\/p>\n<ul>\n<li>Instale o actualice el controlador NVIDIA en Windows y reinicie el sistema.<\/li>\n<li>WSL2 requiere un kernel 5.10.43 o posterior. Compru\u00e9belo ejecutando <code>uname -r<\/code> dentro de WSL2; actual\u00edcelo mediante <code>wsl --update<\/code> en una terminal de Windows.<\/li>\n<li>El kit de herramientas CUDA se puede instalar dentro de WSL2 si su flujo de trabajo lo requiere; esto es independiente del controlador y no entra en conflicto con \u00e9l.<\/li>\n<\/ul>\n<p>Verifique la visibilidad de la GPU desde dentro de WSL2:<\/p>\n<pre><code>nvidia-smi<\/code><\/pre>\n<p>Si esto muestra su tarjeta, Ollama, al ejecutarse dentro de WSL2, la utilizar\u00e1 autom\u00e1ticamente. Si falla, actualice el controlador del lado de Windows y vuelva a ejecutar <code>wsl --update<\/code>.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"macOS_%E2%80%94_Metal_Apple_Silicon_and_AMD\"><\/span>macOS \u2014 Metal (Apple Silicon y AMD)<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>En macOS, Ollama utiliza Apple Metal para la aceleraci\u00f3n por GPU: no es necesario instalar controladores ni establecer variables de entorno. Si usa un Mac con chip Apple Silicon y Ollama se ejecuta lentamente, aseg\u00farese de haber instalado la versi\u00f3n nativa ARM desde ollama.com y no la versi\u00f3n x86 ejecut\u00e1ndose bajo Rosetta. Los Mac con Apple Silicon utilizan memoria unificada, por lo que toda la RAM del sistema est\u00e1 disponible para los modelos: ingrese su RAM total como l\u00edmite de VRAM al usar la opci\u00f3n <a href=\"https:\/\/convly.ai\/es\/llm-vram-calculator\/\">Calculadora de VRAM<\/a>.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Verifying_the_Fix_and_Expected_Throughput\"><\/span>Verificaci\u00f3n de la soluci\u00f3n y rendimiento esperado<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Tras realizar los cambios, ejecute un modelo y compruebe simult\u00e1neamente dos indicadores:<\/p>\n<pre><code># Terminal 1 \u2014 inicie una generaci\u00f3n\nollama run llama3.2:8b \"\u00bfCu\u00e1l es la capital de Francia?\"\n\n# Terminal 2 \u2014 mientras se genera\nollama ps\n\n# NVIDIA: tambi\u00e9n supervise la utilizaci\u00f3n de la GPU por segundo\nnvidia-smi dmon -s u<\/code><\/pre>\n<p>Rendimiento de referencia (aproximado \u2014 var\u00eda seg\u00fan la cuantizaci\u00f3n, la versi\u00f3n del controlador y el ancho de banda PCIe):<\/p>\n<table>\n<thead>\n<tr>\n<th>Hardware<\/th>\n<th>Modelo<\/th>\n<th>~tok\/s<\/th>\n<\/tr>\n<\/thead>\n<tbody>\n<tr>\n<td>RTX 4090 (24 GB)<\/td>\n<td>Llama 3.1 8B Q4<\/td>\n<td>120\u2013160<\/td>\n<\/tr>\n<tr>\n<td>RTX 3080 (10 GB)<\/td>\n<td>Llama 3.1 8B Q4<\/td>\n<td>60\u201380<\/td>\n<\/tr>\n<tr>\n<td>Apple M3 Pro (memoria unificada)<\/td>\n<td>Llama 3.1 8B Q4<\/td>\n<td>40\u201360<\/td>\n<\/tr>\n<tr>\n<td>Solo CPU (Ryzen 9 7950X)<\/td>\n<td>Llama 3.1 8B Q4<\/td>\n<td>5\u201315<\/td>\n<\/tr>\n<\/tbody>\n<\/table>\n<p>Un rendimiento de unos pocos tokens por segundo con una GPU capaz presente es la se\u00f1al m\u00e1s clara de que la soluci\u00f3n no ha surtido efecto.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Frequently_Asked_Questions\"><\/span>Preguntas frecuentes<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<h3>\u00bfPor qu\u00e9 <code>ollama ps<\/code> muestra una divisi\u00f3n GPU\/CPU en lugar de un 100 % en GPU?<\/h3>\n<p>El modelo es m\u00e1s grande que la VRAM disponible. Ollama coloca tantas capas como sea posible en la GPU y ejecuta el resto en la CPU. El resultado es m\u00e1s r\u00e1pido que usar \u00fanicamente la CPU, pero m\u00e1s lento que usar \u00fanicamente la GPU. Cargue un modelo m\u00e1s peque\u00f1o o cambie a una cuantizaci\u00f3n inferior para trasladar m\u00e1s capas a la GPU.<\/p>\n<h3>Ollama estaba usando la GPU anteriormente y de repente dej\u00f3 de hacerlo: \u00bfqu\u00e9 cambi\u00f3?<\/h3>\n<p>Una actualizaci\u00f3n del controlador, del sistema operativo o de la versi\u00f3n de Ollama puede interrumpir la detecci\u00f3n de la GPU. Verifique que <code>nvidia-smi<\/code> sigue mostrando la tarjeta y luego reinicie completamente el servicio. Si actualiz\u00f3 recientemente el controlador NVIDIA, a veces es necesario reiniciar completamente el sistema, no solo reiniciar el servicio.<\/p>\n<h3>\u00bfPuede Ollama utilizar varias GPUs simult\u00e1neamente?<\/h3>\n<p>S\u00ed. Ollama distribuye autom\u00e1ticamente las capas del modelo entre todas las GPUs visibles cuando hay m\u00e1s de una presente. Para restringir qu\u00e9 GPUs utiliza Ollama, establezca <code>CUDA_VISIBLE_DEVICES<\/code> (NVIDIA) o <code>HIP_VISIBLE_DEVICES<\/code> (AMD) antes de iniciar <code>ollama serve<\/code>.<\/p>\n<h3>\u00bfFunciona Ollama con tarjetas gr\u00e1ficas GeForce de consumo, o necesito una GPU para centros de datos?<\/h3>\n<p>Las tarjetas GeForce GTX 10xx y posteriores est\u00e1n completamente compatibles: no se requiere ninguna GPU para centros de datos. El l\u00edmite pr\u00e1ctico para la mayor\u00eda de los usuarios es la VRAM: una tarjeta de 8 GB ejecuta c\u00f3modamente modelos de 7\u20138 mil millones de par\u00e1metros en cuantizaci\u00f3n Q4. Utilice el <a href=\"https:\/\/convly.ai\/es\/llm-vram-calculator\/\">Calculadora de VRAM<\/a> para verificar que un modelo espec\u00edfico quepa en su hardware antes de descargarlo.<\/p>\n<h3>Mi GPU tiene suficiente VRAM, pero Ollama sigue utilizando la CPU. \u00bfPor qu\u00e9?<\/h3>\n<p>Otro proceso podr\u00eda estar ocupando la VRAM; compruebe <code>nvidia-smi<\/code> para detectar otros consumidores, como un navegador con aceleraci\u00f3n por hardware o cualquier otro modelo en ejecuci\u00f3n. Es posible tambi\u00e9n que el modelo se haya cargado antes de que el controlador de la GPU estuviera listo. Detenga el modelo cargado mediante <code>ollama stop &lt;nombre&gt;<\/code>, libere la VRAM en otras aplicaciones y vuelva a cargar el modelo.<\/p>\n<h3>\u00bfD\u00f3nde puedo obtener m\u00e1s informaci\u00f3n sobre la configuraci\u00f3n de Ollama y la selecci\u00f3n de modelos?<\/h3>\n<p>El <a href=\"https:\/\/convly.ai\/es\/what-is-ollama-complete-guide-2026\/\">Gu\u00eda completa de Ollama<\/a> cubre en profundidad las variables de entorno, la gesti\u00f3n de modelos y el uso de la API. Para elegir qu\u00e9 modelo ejecutar en su hardware espec\u00edfico, consulte la <a href=\"https:\/\/convly.ai\/es\/best-local-llms-to-run-on-ollama-2026\/\">mejores modelos locales para Ollama<\/a>.<\/p>","protected":false},"excerpt":{"rendered":"<p>Run ollama ps while a model is loaded \u2014 the PROCESSOR column tells you whether Ollama is using GPU or [&hellip;]<\/p>\n","protected":false},"author":1,"featured_media":2206,"comment_status":"closed","ping_status":"closed","sticky":false,"template":"","format":"standard","meta":{"site-sidebar-layout":"default","site-content-layout":"","ast-site-content-layout":"default","site-content-style":"default","site-sidebar-style":"default","ast-global-header-display":"","ast-banner-title-visibility":"","ast-main-header-display":"","ast-hfb-above-header-display":"","ast-hfb-below-header-display":"","ast-hfb-mobile-header-display":"","site-post-title":"","ast-breadcrumbs-content":"","ast-featured-img":"","footer-sml-layout":"","ast-disable-related-posts":"","theme-transparent-header-meta":"","adv-header-id-meta":"","stick-header-meta":"","header-above-stick-meta":"","header-main-stick-meta":"","header-below-stick-meta":"","astra-migrate-meta-layouts":"default","ast-page-background-enabled":"default","ast-page-background-meta":{"desktop":{"background-color":"var(--ast-global-color-5)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"tablet":{"background-color":"","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"mobile":{"background-color":"","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""}},"ast-content-background-meta":{"desktop":{"background-color":"var(--ast-global-color-4)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"tablet":{"background-color":"var(--ast-global-color-4)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"mobile":{"background-color":"var(--ast-global-color-4)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""}},"footnotes":""},"categories":[7],"tags":[],"class_list":["post-2205","post","type-post","status-publish","format-standard","has-post-thumbnail","hentry","category-ai-news"],"_links":{"self":[{"href":"https:\/\/convly.ai\/es\/wp-json\/wp\/v2\/posts\/2205","targetHints":{"allow":["GET"]}}],"collection":[{"href":"https:\/\/convly.ai\/es\/wp-json\/wp\/v2\/posts"}],"about":[{"href":"https:\/\/convly.ai\/es\/wp-json\/wp\/v2\/types\/post"}],"author":[{"embeddable":true,"href":"https:\/\/convly.ai\/es\/wp-json\/wp\/v2\/users\/1"}],"replies":[{"embeddable":true,"href":"https:\/\/convly.ai\/es\/wp-json\/wp\/v2\/comments?post=2205"}],"version-history":[{"count":1,"href":"https:\/\/convly.ai\/es\/wp-json\/wp\/v2\/posts\/2205\/revisions"}],"predecessor-version":[{"id":2207,"href":"https:\/\/convly.ai\/es\/wp-json\/wp\/v2\/posts\/2205\/revisions\/2207"}],"wp:featuredmedia":[{"embeddable":true,"href":"https:\/\/convly.ai\/es\/wp-json\/wp\/v2\/media\/2206"}],"wp:attachment":[{"href":"https:\/\/convly.ai\/es\/wp-json\/wp\/v2\/media?parent=2205"}],"wp:term":[{"taxonomy":"category","embeddable":true,"href":"https:\/\/convly.ai\/es\/wp-json\/wp\/v2\/categories?post=2205"},{"taxonomy":"post_tag","embeddable":true,"href":"https:\/\/convly.ai\/es\/wp-json\/wp\/v2\/tags?post=2205"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}