Tuesday, 25 August 2026 | Updating Daily AI insight, written for builders

Ollama y OpenClaw: cómo ejecutar OpenClaw con un modelo local

  • No existe una integración específica para Ollama. Conectas OpenClaw a Ollama mediante la API compatible con OpenAI de Ollama en http://localhost:11434/v1, tratándola como un proveedor genérico compatible con OpenAI.
  • La elección del modelo lo es todo. OpenClaw es un bucle de agente que invoca herramientas, por lo que necesitas un modelo con soporte nativo para llamadas a herramientas — qwen3, gpt-oss, llama3.1/3.3, mistral-small. Un modelo exclusivo para chat fallará en silencio describiendo las llamadas a herramientas en lugar de ejecutarlas.
  • Amplía la ventana de contexto. El contexto predeterminado de Ollama es mucho más pequeño que el indicador del sistema de OpenClaw más los esquemas de herramientas más la conversación. Crea un Modelfile con PARÁMETRO num_ctx 32768 o mayor.
  • Espera una caída real en la calidad. Los modelos locales con menos de ~30 000 millones de parámetros pierden cadenas de tareas de varios pasos que los modelos punteros sí completan. Una configuración híbrida —local para respuestas rutinarias y en la nube para tareas complejas— es la solución práctica.

OpenClaw es un asistente de IA autoalojado que interactúa contigo a través de aplicaciones de mensajería y controla herramientas en tu equipo. No dispone de ninguna integración específica para Ollama; conectas ambos componentes apuntando el proveedor de modelos de OpenClaw al punto final compatible con OpenAI de Ollama, http://localhost:11434/v1. Funciona, pero únicamente con un modelo que invoque herramientas de forma fiable y con una ventana de contexto considerablemente mayor que la predeterminada de Ollama.

Qué es realmente OpenClaw

OpenClaw es un asistente personal de código abierto que se ejecuta como un proceso de puerta de enlace persistente en tu propio hardware. Conecta canales de mensajería —WhatsApp, Telegram, Discord, Signal, iMessage— con un bucle de agente que tiene acceso a herramientas: comandos de shell, operaciones con archivos, recuperación web, calendario y memoria. El proyecto comenzó como Clawdbot, fue renombrado brevemente como Moltbot, y finalmente adoptó el nombre de OpenClaw. Su «cerebro» predeterminado era un modelo de Anthropic, pero como habla el protocolo de finalizaciones de chat de OpenAI para proveedores externos, cualquier sistema que ofrezca dicho protocolo puede sustituirlo —incluido Ollama.

Una aclaración: existe otro proyecto sin relación llamado OpenClaw, que es una reimplementación en C++ del juego de plataformas de 1997 Captain Claw. No tiene nada que ver con los modelos de lenguaje de gran tamaño (LLM). Si buscaste «ollama openclaw», casi con toda seguridad te refieres al asistente.

Por qué esta combinación es más difícil que una interfaz de chat

Apuntar una interfaz frontal de chat a Ollama es trivial. Sin embargo, un marco de agentes no lo es, por tres razones:

  • Las llamadas a herramientas deben ser estructuralmente correctas. OpenClaw envía definiciones de herramientas y espera objetos JSON de llamadas a herramientas como respuesta. Los modelos sin una plantilla de chat consciente de herramientas generan texto en prosa como «Ahora ejecutaré ls» y el bucle se bloquea.
  • El indicador ya es largo antes incluso de escribir nada. Las instrucciones del sistema más los esquemas de herramientas consumen habitualmente varios miles de tokens. El contexto predeterminado de Ollama trunca ese contenido, y la truncación al inicio del indicador elimina precisamente las instrucciones de las que depende el agente.
  • Los errores se acumulan a lo largo de los turnos. Un modelo con una precisión del 90 % por paso en las llamadas a herramientas completa una tarea de seis pasos aproximadamente la mitad de las veces.

Paso 1: Configura Ollama para que sirva en una dirección accesible

Si aún no tienes instalado Ollama, sigue las instrucciones de la Guía de instalación de Ollama primera. Confirma que el servidor responde:

curl http://localhost:11434/api/version
curl http://localhost:11434/v1/models

Si OpenClaw se ejecuta en el mismo host y fuera de un contenedor, el enlace predeterminado de bucle invertido (loopback) es suficiente y puedes pasar directamente al paso 2. Si OpenClaw se ejecuta dentro de Docker o en otra máquina, Ollama debe vincularse más allá del bucle invertido mediante OLLAMA_HOST. La forma de hacerlo varía según la plataforma.

macOS

La aplicación de barra de menú no lee tu perfil de shell. Establece la variable en el entorno de lanzamiento y reinicia la aplicación desde el icono de la bandeja:

launchctl setenv OLLAMA_HOST "0.0.0.0:11434"

Los modelos se almacenan en ~/.ollama/models. Los registros del servidor están en ~/.ollama/logs/. Desde un contenedor en la misma Mac, accede al host en http://host.docker.internal:11434.

Linux

El instalador registra una unidad systemd. Anula su entorno en lugar de editar directamente el archivo de unidad suministrado:

sudo systemctl edit ollama.service

Agrega:

[Service]
Environment="OLLAMA_HOST=0.0.0.0:11434"
Environment="OLLAMA_KEEP_ALIVE=-1"

Entonces sudo systemctl daemon-reload && sudo systemctl restart ollama. Los registros provienen de journalctl -u ollama -f. Bajo la cuenta de servicio, los modelos usan como ubicación predeterminada /usr/share/ollama/.ollama/models, no su directorio personal —una fuente común de confusión cuando ollama list aparece vacío al ejecutarse como root.

Windows

Establezca la variable mediante la interfaz gráfica: Inicio → «Editar las variables de entorno del sistema» → Variables de entornoNuevo en la sección de variables de usuario; el nombre es OLLAMA_HOST, y el valor es 0.0.0.0:11434. Cierre Ollama desde la bandeja del sistema y vuelva a iniciarlo; el proceso de la bandeja solo lee las variables de entorno al arrancar. Los modelos se almacenan en %USERPROFILE%\.ollama\models; los registros, en %LOCALAPPDATA%\Ollama.

OpenClaw en sí es una aplicación Node y funciona de forma más fiable en Linux o macOS. En Windows, ejecute OpenClaw dentro de WSL2. En ese caso, Ollama puede permanecer instalado de forma nativa en Windows: WSL2 accede al host de Windows mediante la dirección de puerta de enlace reflejada o NAT, así que verifíquelo con curl desde dentro de WSL antes de realizar cualquier configuración.

Nota de seguridad: Ollama no incluye autenticación. Vincular 0.0.0.0 expone la inferencia de modelos a cualquier host capaz de enrutar hacia ese puerto. Manténgalo restringido a una LAN de confianza o una VPN, o utilice un proxy inverso que exija un token. Nunca lo exponga a Internet público.

Paso 2: Descarga un modelo capaz de invocar herramientas

La invocación de herramientas en Ollama depende de la plantilla de chat del modelo, no de una bandera que usted pase. Los tamaños indicados a continuación son aproximados para etiquetas comunes cuantizadas a 4 bits y pueden variar entre versiones —consulte ollama list y la lista actual de etiquetas para obtener cifras exactas.

Etiqueta del modeloParámetrosDescarga aproximadaVRAM práctica con contexto de 32KAdecuado para OpenClaw
llama3.1:8b8B~4,7 GB8–10 GBMínimo. Solo tareas sencillas con una única herramienta.
qwen3:8b8B~5 GB8–10 GBDisciplina en el uso de herramientas superior a la de Llama 3.1 8B.
qwen3:14b14B~9 GB12–16 GBBuen equilibrio en una tarjeta de 16 GB.
gpt-oss:20b20B MoE~14 GB16 GBUso sólido de herramientas; rápido gracias a la activación dispersa.
mistral-small24B~14 GB16–20 GBLlamadas a funciones fiables.
qwen3:32b32B~20 GB24 GB o másMejor experiencia local realista.

Descargue uno y verifique que acepte herramientas antes de integrarlo con OpenClaw:

ollama pull qwen3:14b

Para una comparación más amplia de candidatos y su comportamiento bajo cargas de trabajo de agentes, consulte los mejores modelos locales para Ollama.

Paso 3: Amplía la ventana de contexto

Este es el paso que muchas personas omiten, y constituye la causa más frecuente de configuraciones de OpenClaw sobre Ollama que «casi funcionan». Ollama aplica un contexto predeterminado moderado (tradicionalmente 2048, aumentado en versiones posteriores), independientemente de lo que el modelo soporte. Las versiones recientes aceptan una variable de entorno válida para todo el servidor, pero el método independiente de la versión consiste en incorporarla directamente en un modelo derivado: OLLAMA_CONTEXT_LENGTH FROM qwen3:14b PARAMETER num_ctx 32768

Guárdelo como

ollama create qwen3-14b-32k -f Modelfile Modelfile, entonces:

qwen3-14b-32k

Usa como nombre del modelo en OpenClaw. Contextos más amplios consumen VRAM para la caché KV, que es independiente de los pesos —use para conocer la cantidad real de VRAM que requiere un modelo determinado con una longitud específica de contexto, antes de descubrirlo por una interrupción por falta de memoria (OOM). En versiones recientes de Ollama, Calculadora de VRAM para ver qué necesita realmente un modelo y una longitud de contexto determinados antes de descubrirlo mediante un error de memoria insuficiente (OOM). En las versiones recientes de Ollama, OLLAMA_FLASH_ATTENTION=1 OLLAMA_KV_CACHE_TYPE=q8_0) reducen significativamente esa sobrecarga.) reducir significativamente esa sobrecarga.

Paso 4: Apunta OpenClaw a Ollama

OpenClaw almacena su configuración en un directorio oculto bajo su directorio personal (~/.openclaw/) y permite anular valores mediante variables de entorno. Los tres valores que necesita siempre son, en esencia, los mismos:

ConfiguraciónValor
URL basehttp://localhost:11434/v1 —el sufijo /v1 es obligatorio
Clave APICualquier cadena no vacía, p. ej. ollama. El valor se ignora, pero muchos clientes rechazan una cadena vacía.
ModeloEtiqueta exacta de ollama list, incluida la ruta :etiqueta porción

La configuración exacta nombres de clave han cambiado a lo largo de los cambios de nombre del proyecto y su rápido ritmo de lanzamientos. En lugar de copiar un bloque de configuración de una entrada de blog, ejecute la salida de ayuda de la CLI e inspeccione el archivo de configuración generado en su versión instalada:

openclaw --help

En la práctica, debe buscar el bloque genérico del proveedor compatible con OpenAI —el mismo que se usa para OpenRouter, vLLM o LM Studio — y establecer allí la URL base, la clave y el modelo. Si OpenClaw ofrece selección de proveedor durante la configuración inicial, elija la opción compatible con OpenAI en lugar de un proveedor con nombre.

Antes de depurar OpenClaw, confirme que el punto final responde directamente a una solicitud de invocación de herramienta con curl contra /v1/chat/completions. Si esto falla, el problema radica en Ollama, no en OpenClaw.

Realidad hardware

OpenClaw es un servicio en segundo plano. El modelo se carga y recarga a medida que llegan los mensajes, y cada recarga implica varios segundos de latencia; por tanto, desea que los pesos permanezcan cargados de forma permanente —de ahí OLLAMA_KEEP_ALIVE=-1. Esto significa que la VRAM queda asignada mientras el asistente esté en ejecución, no solo durante una solicitud. Planifique su presupuesto en consecuencia: una tarjeta de 24 GB ejecutando qwen3:32b con un contexto de 32K prácticamente no deja memoria disponible para ninguna otra tarea.

Una GPU de 16 GB es el punto de entrada razonable para un modelo de 14B–20B con un contexto útil. Por debajo de los 12 GB, queda restringido a modelos de 8B, donde la fiabilidad en tareas de varios pasos disminuye notablemente. Los sistemas Apple Silicon con 32 GB o más de memoria unificada funcionan bien porque la memoria es compartida, aunque el procesamiento de indicaciones es más lento que en una GPU NVIDIA discreta. Consulte la guía de GPU para LLM locales para conocer las tarjetas específicas recomendables en cada categoría.

La configuración híbrida que la mayoría de los usuarios acaba adoptando

El resultado realista: un modelo local de 14B maneja perfectamente mensajes rutinarios, resúmenes, recordatorios y búsquedas sencillas con una sola herramienta. Sin embargo, cadenas largas de investigación, modificaciones de código en varios archivos y cualquier tarea que requiera seguir instrucciones con precisión se ven afectadas de forma notable. Por ello, muchos usuarios de OpenClaw mantienen configurado un proveedor en la nube para el bucle principal del agente y usan Ollama para trabajos de alto volumen y bajo riesgo, o para contenido sensible desde el punto de vista de la privacidad que no debe salir del equipo.

Si esta división supone un ahorro depende de su volumen de mensajes y del costo de la electricidad. Calcule sus cifras con la calculadora de punto de equilibrio entre alojamiento local y uso de API antes de comprar una GPU específicamente para este fin; con volúmenes bajos, normalmente resulta más económico usar la API que amortizar el hardware.

Solución de problemas

SíntomaCausa y solución
ECONNREFUSED / conexión rechazadaEl servidor no está en ejecución o está vinculado a loopback mientras OpenClaw se ejecuta dentro de un contenedor. Pruebe curl http://localhost:11434/api/version desde el espacio de nombres de red del contenedor.
Errores 404 en las solicitudesFalta la URL base /v1, o apunta a la ruta nativa de Ollama /api/chat en lugar de la ruta compatible con OpenAI.
401 / falta clave de APIEstablezca el campo «key» como una cadena no vacía.
modelo no encontradoCoincidencia incorrecta de etiquetas. Copie el nombre literalmente desde ollama list.
El agente describe el uso de herramientas en lugar de ejecutarlasEl modelo carece de una plantilla para invocación de herramientas. Cambie a uno de la tabla anterior.
El agente olvida sus instrucciones a mitad de tareaTruncamiento del contexto. Vuelva a compilar con un valor mayor de num_ctx.
La primera respuesta tras un período de inactividad tarda más de 30 segundosEl modelo se descargó tras el tiempo de espera de mantenimiento activo (keep-alive). Establezca OLLAMA_KEEP_ALIVE=-1.

Preguntas frecuentes

¿Soporta oficialmente OpenClaw a Ollama?

No como integración con nombre. El soporte es indirecto: OpenClaw puede usar cualquier punto final compatible con OpenAI para chat-completions, y Ollama lo proporciona en /v1. Esa ruta es estable y poco probable que cambie, pero el esquema de configuración propio de OpenClaw evoluciona rápidamente, así que consulte su documentación actual para conocer las claves exactas del proveedor, sin hacer suposiciones.

¿Cuál es el modelo más pequeño que realmente funciona?

Un modelo de 8B con soporte para invocación de herramientas, como qwen3:8b , representa el límite realista, y únicamente para interacciones breves y de una sola herramienta. Por debajo de ese tamaño, los argumentos de las herramientas suelen estar mal formados con suficiente frecuencia como para que el bucle del agente resulte más frustrante que útil. A partir de los 14B es cuando comienza a sentirse fiable.

¿Puedo ejecutar esto en Windows?

Sí, con OpenClaw dentro de WSL2 y Ollama instalado de forma nativa en Windows para aprovechar directamente su controlador de GPU. Verifique la conectividad desde el shell de WSL con curl antes de configurar OpenClaw. Tenga en cuenta que el canal iMessage solo está disponible en macOS, independientemente de la plataforma, ya que depende de la base de datos local de Mensajes.

¿Por qué la versión local de OpenClaw es tan inferior a la versión respaldada por la nube?

Dos factores acumulativos. Primero, la precisión en la invocación de herramientas por paso es menor, y los errores se multiplican en tareas de varios pasos. Segundo, los modelos locales se degradan más rápidamente a medida que se llena el contexto, y la indicación (prompt) de OpenClaw ya es grande antes de añadir su mensaje. Ambos son límites inherentes a las capacidades del modelo, no problemas de configuración.

¿Puede ejecutarse Ollama en una máquina distinta de OpenClaw?

Sí, y es un patrón recomendable: coloque Ollama en la máquina con la GPU y ejecute la puerta de enlace (gateway) en un dispositivo siempre encendido y de bajo consumo. Establezca OLLAMA_HOST=0.0.0.0:11434 en el host con GPU y use su dirección LAN en la URL base de OpenClaw. Dado que Ollama no dispone de autenticación, restrinja este acceso a una red de confianza o a una VPN.

¿Es este el mismo OpenClaw que el proyecto del juego Captain Claw?

No. Ese OpenClaw es una reimplementación no relacionada en C++ de una plataforma DOS de 1997 y solo comparte el nombre. Si un resultado de búsqueda menciona archivos de niveles o renderizado de sprites, ha accedido al proyecto del juego.

Conclusión

Conectar Ollama y OpenClaw es una tarea de configuración de cinco minutos: el punto final compatible con OpenAI, una clave no vacía y una etiqueta de modelo exacta. El trabajo que determina si la solución es utilizable se realiza previamente: elegir un modelo con soporte real para invocación de herramientas, dotarlo de una ventana de contexto lo bastante amplia para la indicación del agente y disponer de suficiente VRAM para mantenerlo cargado permanentemente. Compare los modelos candidatos en la Base de datos de modelos, y si es nuevo en la superficie de configuración de Ollama, la guía completa de Ollama explica con mayor profundidad las variables de entorno y la mecánica del Modelfile.

Escrito por Mustafa Ihsan

Mustafa Ihsan es el fundador y editor de Convly.ai. Creó y mantiene la base de datos en vivo de modelos de IA del sitio, su índice de relación precio-rendimiento y sus calculadoras gratuitas para los requisitos de VRAM, los costos de las API y la economía del autohospedaje. Escribe sobre precios de modelos, resultados de pruebas comparativas y el hardware necesario para ejecutar modelos de IA localmente, y prefiere sistemáticamente los datos medidos a las afirmaciones de los fabricantes.

Scroll to Top
Featured on There's An AI For That