Saturday, 10 October 2026 | Updating Daily AI insight, written for builders

Ollama und OpenClaw: So führen Sie OpenClaw auf einem lokalen Modell aus

  • There is no dedicated Ollama integration. Sie verbinden OpenClaw mit Ollama über Ollamas OpenAI-kompatible API unter http://localhost:11434/v1, wobei Sie Ollama als generischen OpenAI-ähnlichen Anbieter behandeln.
  • Die Wahl des Modells ist entscheidend. OpenClaw ist eine Agenten-Schleife, die Tools aufruft; daher benötigen Sie ein Modell mit nativer Unterstützung für Tool-Aufrufe – qwen3, gpt-oss, llama3.1/3.3, mistral-small. Ein reines Chat-Modell schlägt stillschweigend fehl, indem es Tool-Aufrufe beschreibt, anstatt sie tatsächlich auszuführen.
  • Erhöhen Sie das Kontextfenster. Ollamas Standard-Kontext ist deutlich kleiner als OpenClaws System-Prompt plus Tool-Schemata plus Gesprächsverlauf. Erstellen Sie eine Modelfile mit PARAMETER num_ctx 32768 oder größer.
  • Rechnen Sie mit einem spürbaren Qualitätsverlust. Lokale Modelle mit weniger als etwa 30 Milliarden Parametern versagen bei mehrstufigen Aufgabenketten, die Spitzenmodelle problemlos bewältigen. Eine hybride Konfiguration – lokal für Routineantworten, Cloud für anspruchsvolle Aufgaben – ist die praktikable Lösung.

OpenClaw ist ein selbstgehosteter KI-Assistent, der über Messaging-Apps mit Ihnen kommuniziert und Tools auf Ihrem Rechner steuert. Es verfügt über keine Ollama-spezifische Integration; stattdessen verbinden Sie die beiden Komponenten, indem Sie OpenClaws Modellanbieter auf Ollamas OpenAI-kompatiblen Endpunkt http://localhost:11434/v1ausrichten. Das funktioniert, allerdings nur mit einem Modell, das Tool-Aufrufe zuverlässig ausführt, sowie einem Kontextfenster, das deutlich über Ollamas Standardgröße liegt.

Was OpenClaw tatsächlich ist

OpenClaw ist ein quelloffener persönlicher Assistent, der als langlaufender Gateway-Prozess auf Ihrer eigenen Hardware ausgeführt wird. Er verbindet Messaging-Kanäle – WhatsApp, Telegram, Discord, Signal, iMessage – mit einer Agenten-Schleife, die Zugriff auf Tools bietet: Shell-Befehle, Dateioperationen, Webabrufe, Kalender- und Speicherfunktionen. Das Projekt begann als Clawdbot, wurde kurz darauf in Moltbot, umbenannt und erhielt schließlich den Namen OpenClaw. Sein Standard-„Gehirn“ war ein Anthropic-Modell, doch da es das OpenAI-Chat-Completions-Protokoll für Drittanbieter unterstützt, kann jedes System, das dieses Protokoll bereitstellt, als Ersatz dienen – darunter auch Ollama.

Eine Klarstellung: Ein anderes, nicht verwandtes Projekt namens OpenClaw ist eine C++-Neuimplementierung des Plattformers aus dem Jahr 1997 Captain Claw. Es hat nichts mit Sprachmodellen (LLMs) zu tun. Falls Sie nach „ollama openclaw“ gesucht haben, wollen Sie mit großer Wahrscheinlichkeit den Assistenten.

Warum diese Kombination komplizierter ist als eine Chat-Oberfläche

Eine Chat-Oberfläche mit Ollama zu verbinden, ist trivial. Ein Agenten-Framework hingegen ist es nicht – und zwar aus drei Gründen:

  • Tool-Aufrufe müssen strukturell korrekt sein. OpenClaw übergibt Tool-Definitionen und erwartet JSON-Objekte für Tool-Aufrufe als Antwort. Modelle ohne ein tool-bewusstes Chat-Template generieren stattdessen Prosa wie „Ich werde jetzt den Befehl lsausführen“ – wodurch die Schleife zum Stillstand kommt.
  • Der Prompt ist bereits vor Ihrer ersten Eingabe sehr umfangreich. Systemanweisungen plus Tool-Schemata beanspruchen regelmäßig mehrere tausend Tokens. Ollamas Standard-Kontext kürzt diesen Prompt ab, wobei die Kürzung am Anfang genau jene Anweisungen entfernt, auf die der Agent angewiesen ist.
  • Fehler verstärken sich über mehrere Schritte hinweg. Ein Modell mit 90% Genauigkeit pro Schritt absolviert eine sechsstufige Aufgabe etwa zur Hälfte der Zeit.

Schritt 1: Stellen Sie sicher, dass Ollama auf einer erreichbaren Adresse bereitgestellt wird

Falls Ollama noch nicht installiert ist, folgen Sie Ollama-Installationsanleitung zuerst. Bestätigen Sie, dass der Server antwortet:

curl http://localhost:11434/api/version
curl http://localhost:11434/v1/models

Wenn OpenClaw auf demselben Host und außerhalb eines Containers läuft, ist die Standard-Loopback-Bindung ausreichend und Sie können zu Schritt 2 springen. Wenn OpenClaw in Docker oder auf einem anderen Computer läuft, muss Ollama über Loopback hinaus binden via OLLAMA_HOST. Die Konfiguration unterscheidet sich je nach Plattform.

macOS

Die Menüleisten-App liest Ihr Shell-Profil nicht. Setzen Sie die Variable in der Startumgebung und starten Sie die App dann neu über das Tray-Symbol:

launchctl setenv OLLAMA_HOST "0.0.0.0:11434"

Modelle befinden sich in ~/.ollama/models. Server-Logs sind unter ~/.ollama/logs/. Von einem Container auf demselben Mac erreichen Sie den Host unter http://host.docker.internal:11434.

Linux

Das Installationsprogramm registriert eine systemd-Unit. Überschreiben Sie deren Umgebung, anstatt die ausgelieferte Unit-Datei zu bearbeiten:

sudo systemctl edit ollama.service

Fügen Sie hinzu:

[Service]
Environment="OLLAMA_HOST=0.0.0.0:11434"
Environment="OLLAMA_KEEP_ALIVE=-1"

Dann sudo systemctl daemon-reload && sudo systemctl restart ollama. Logs kommen von journalctl -u ollama -f. Unter dem Dienstkonto sind Modelle standardmäßig in /usr/share/ollama/.ollama/models, nicht in Ihrem Home-Verzeichnis — eine häufige Überraschung, wenn ollama list als Root leer aussieht.

Windows

Setzen Sie die Variable über die GUI: Start → „Umgebungsvariablen bearbeiten“ → Umgebungsvariablen → Neu unter Benutzervariablen, Name OLLAMA_HOST, Wert 0.0.0.0:11434. Beenden Sie Ollama über das Systemtray und starten Sie es neu; der Tray-Prozess liest Umgebungsvariablen nur beim Start. Modelle befinden sich in %USERPROFILE%.ollamamodels; Logs in %LOCALAPPDATA%\Ollama.

OpenClaw selbst ist eine Node-Anwendung und läuft am zuverlässigsten unter Linux oder macOS. Unter Windows führen Sie es in WSL2 aus. In diesem Fall kann Ollama als native Windows-Installation verbleiben — WSL2 erreicht den Windows-Host über die gespiegelte oder NAT-Gateway-Adresse, also überprüfen Sie mit curl von innen in WSL, bevor Sie etwas konfigurieren.

Sicherheitshinweis: Ollama verfügt über keine Authentifizierung. Das Binden auf 0.0.0.0 macht Modell-Inferenzen für jeden Host verfügbar, der zu diesem Port geroutet werden kann. Halten Sie es in einem vertrauenswürdigen LAN oder VPN, oder setzen Sie es vor einen Reverse Proxy mit Token-Anforderung. Exponieren Sie es niemals dem öffentlichen Internet.

Schritt 2: Laden Sie ein Modell herunter, das Tools aufrufen kann

Tool Calling in Ollama hängt von der Chat-Vorlage des Modells ab, nicht von einem Flag, das Sie übergeben. Die unten angegebenen Größen sind Näherungswerte für häufige 4-Bit-Tags und ändern sich zwischen Releases — überprüfen Sie ollama list und die aktuelle Tag-Liste für genaue Zahlen.

Modell-Tag Parameter Ungefähre Downloadgröße Praktisches VRAM bei 32K ctx Geeignet für OpenClaw
llama3.1:8b 8B ~4,7 GB 8–10 GB Mindest. Nur einfache Single-Tool-Aufgaben.
qwen3:8b 8B ~5 GB 8–10 GB Bessere Tool-Disziplin als Llama 3.1 8B.
qwen3:14b 14B ~9 GB 12–16 GB Gutes Gleichgewicht auf einer 16-GB-Karte.
gpt-oss:20b 20B MoE ~14 GB 16 GB Starke Tool-Nutzung; schnell durch spärliche Aktivierung.
mistral-small 24B ~14 GB 16–20 GB Zuverlässiger Function Calling.
qwen3:32b 32B ~20 GB 24 GB+ Beste realistische lokale Erfahrung.

Pullen Sie eines und überprüfen Sie, dass es Tools akzeptiert, bevor Sie OpenClaw anfassen:

ollama pull qwen3:14b

Für einen breiteren Vergleich von Kandidaten und ihrem Verhalten unter Agent-Workloads siehe die besten lokalen Modelle für Ollama.

Schritt 3: Erhöhen Sie das Kontextfenster

Dies ist der Schritt, den Menschen überspringen, und er ist die häufigste Ursache für ein OpenClaw-on-Ollama-Setup, das „fast funktioniert“. Ollama wendet einen moderaten Standard-Context an (historisch 2048, später erhöht), unabhängig von dem, was das Modell unterstützt. Neuere Versionen akzeptieren eine serverweite OLLAMA_CONTEXT_LENGTH Umgebungsvariable, aber die versionsunabhängige Methode besteht darin, sie in ein abgeleitetes Modell zu integrieren:

FROM qwen3:14b
PARAMETER num_ctx 32768

Speichern unter Modelfile, dann:

ollama create qwen3-14b-32k -f Modelfile

Nutzen Sie qwen3-14b-32k als Modellname in OpenClaw. Größere Kontexte benötigen VRAM für den KV-Cache, der separat von den Gewichten ist — verwenden Sie VRAM-Rechner um zu sehen, wie viel VRAM ein bestimmtes Modell und eine bestimmte Kontextlänge tatsächlich benötigen, bevor Sie durch OOM davon erfahren. In neueren Ollama-Builds OLLAMA_FLASH_ATTENTION=1 und ein quantisierter KV-Cache (OLLAMA_KV_CACHE_TYPE=q8_0) reduzieren diesen Overhead deutlich.

Schritt 4: Richten Sie OpenClaw auf Ollama aus

OpenClaw speichert die Konfiguration in einem Dot-Verzeichnis unter Ihrem Home-Verzeichnis (~/.openclaw/) und erlaubt Umgebungsvariablen-Overrides. Die drei Werte, die Sie benötigen, sind immer inhaltlich gleich:

Einstellung Wert
Basis-URL http://localhost:11434/v1 — das /v1 Suffix ist obligatorisch
API-Schlüssel Jeder nicht-leere String, z. B. Ollama. Der Wert wird ignoriert, aber viele Clients lehnen einen leeren Wert ab.
Modell Exaktes Tag aus ollama list, einschließlich der :tag Teil

Die genaue Konfiguration Schlüsselnamen haben sich im Zuge der Umbenennungen des Projekts und seinem schnellen Release-Tempo verschoben. Anstatt einen Config-Block von einer Blog-Post zu kopieren, führen Sie die Help-Ausgabe der CLI aus und inspizieren Sie die generierte Config-Datei in Ihrer installierten Version:

openclaw --help

Praktisch gesehen suchen Sie nach dem generischen OpenAI-kompatiblen Provider-Block — demselben, der für OpenRouter, vLLM oder LM Studio verwendet wird — und setzen dort Base-URL, Schlüssel und Modell. Wenn OpenClaw während des Onboarding eine Provider-Auswahl anbietet, wählen Sie die OpenAI-kompatible Option statt eines benannten Anbieters.

Bevor Sie OpenClaw debuggen, bestätigen Sie, dass der Endpoint eine Tool-Calling-Anfrage direkt mit beantwortet curl gegenüber /v1/chat/completions. Wenn das fehlschlägt, liegt das Problem bei Ollama, nicht bei OpenClaw.

Hardware-realitätscheck

OpenClaw ist ein Background-Service. Das Modell wird geladen und neu geladen, wenn Nachrichten ankommen, und jedes Neuladen kostet Sekunden Latenz — daher wollen Sie, dass die Gewichte dauerhaft im Speicher resident sind — also OLLAMA_KEEP_ALIVE=-1. Das bedeutet, der VRAM ist so lange gebunden, wie der Assistant läuft, nicht nur während einer Anfrage. Budgetieren Sie entsprechend: eine 24-GB-Karte mit qwen3:32b bei 32K Kontext hat praktisch nichts mehr für irgendetwas anderes.

Eine 16-GB-GPU ist der sinnvolle Einstiegspunkt für ein 14B–20B-Modell mit brauchbarem Kontext. Unter 12 GB sind Sie auf 8B-Modelle beschränkt, wo die Multi-Step-Zuverlässigkeit stark abfällt. Apple Silicon mit 32 GB oder mehr Unified Memory funktioniert gut, weil der Speicher gemeinsam genutzt wird, allerdings ist die Prompt-Verarbeitung langsamer als auf einer diskreten NVIDIA-Karte. Siehe der GPU-Leitfaden für lokale LLMs für die konkreten Grafikkarten, die sich in jeder Leistungsstufe lohnen.

Die hybride Konfiguration, auf die die meisten Nutzer letztlich zurückgreifen

Das ehrliche Fazit: Ein lokales 14B-Modell bewältigt Routine-Nachrichten, Zusammenfassungen, Erinnerungen und einfache Single-Tool-Abfragen hervorragend. Längere Rechercheketten, Codeänderungen über mehrere Dateien hinweg sowie Aufgaben, die sorgfältiges Befolgen von Anweisungen erfordern, zeigen deutlich erkennbare Einbußen. Viele OpenClaw-Nutzer konfigurieren daher einen Cloud-Anbieter für die Haupt-Agenten-Schleife und nutzen Ollama für hochvolumige, wenig kritische Arbeiten oder für datenschutzsensible Inhalte, die den Rechner nicht verlassen dürfen.

Ob diese Aufteilung Kosten spart, hängt von Ihrem Nachrichtenvolumen und Ihren Stromkosten ab. Rechnen Sie Ihre Zahlen mit dem Selbsthosting- versus-API-Kosten-Grenzwert-Rechner durch, bevor Sie gezielt eine GPU dafür kaufen; bei geringem Volumen ist die API in der Regel günstiger als die Amortisation der Hardware.

Fehlerbehebung

Symptom Ursache und Behebung
ECONNREFUSED / Verbindung abgelehnt Der Server läuft nicht, oder er ist an die Loopback-Adresse gebunden, während OpenClaw in einem Container läuft. Testen Sie curl http://localhost:11434/api/version aus dem Netzwerk-Namespace des Containers heraus.
404 bei Anfragen Basis-URL fehlt /v1, oder sie verweist auf den nativen Ollama- /api/chat Pfad statt auf den OpenAI-kompatiblen.
401 / fehlender API-Schlüssel Legen Sie das Schlüsselfeld auf einen beliebigen nicht-leeren String fest.
Modell nicht gefunden Tag-Unterschied. Kopieren Sie den Namen wörtlich aus ollama list.
Der Agent beschreibt die Tool-Nutzung statt sie auszuführen Das Modell verfügt über keine Tool-Calling-Vorlage. Wechseln Sie zu einem Modell aus der obigen Tabelle.
Der Agent vergisst seine Anweisungen mitten in einer Aufgabe Kontext-Trunkierung. Erstellen Sie das Modell mit einem größeren num_ctx.
Die erste Antwort nach einer Pause dauert 30+ Sekunden Das Modell wurde nach Ablauf des Keep-Alive-Timeouts entladen. Legen Sie OLLAMA_KEEP_ALIVE=-1.

Häufig gestellte Fragen

Unterstützt OpenClaw offiziell Ollama?

Nicht als benannte Integration. Die Unterstützung ist indirekt: OpenClaw kann jeden OpenAI-kompatiblen Chat-Completions-Endpunkt nutzen, und Ollama stellt einen solchen unter /v1zur Verfügung. Dieser Pfad ist stabil und wird sich wahrscheinlich nicht ändern; das eigene Konfigurationsschema von OpenClaw entwickelt sich jedoch rasch weiter – prüfen Sie daher stets die aktuelle Dokumentation auf die exakten Provider-Schlüssel, statt Annahmen zu treffen.

Welches ist das kleinste Modell, das tatsächlich funktioniert?

Ein 8B-Modell mit Tool-Calling-Unterstützung wie qwen3:8b ist die realistische Untergrenze – allerdings nur für kurze, Single-Tool-Interaktionen. Darunter werden Tool-Argumente so häufig fehlerhaft, dass die Agenten-Schleife eher frustrierend als nützlich wird. Ab 14B beginnt das System wirklich verlässlich zu wirken.

Kann ich dies unter Windows ausführen?

Ja, mit OpenClaw innerhalb von WSL2 und Ollama nativ unter Windows installiert, damit es direkt Ihren GPU-Treiber nutzt. Überprüfen Sie die Erreichbarkeit vom WSL-Shell aus mit curl bevor Sie OpenClaw konfigurieren. Beachten Sie, dass der iMessage-Kanal unabhängig von der Plattform ausschließlich unter macOS verfügbar ist, da er von der lokalen Messages-Datenbank abhängt.

Warum ist die lokale OpenClaw-Version so viel schlechter als die cloudbasierte Variante?

Zwei sich verstärkende Faktoren: Erstens ist die Genauigkeit des Tool-Calls pro Schritt niedriger, und Fehler multiplizieren sich bei mehrstufigen Aufgaben. Zweitens verschlechtern sich lokale Modelle schneller, sobald der Kontext gefüllt ist – und OpenClaws Prompt ist bereits vor Hinzufügen Ihrer Nachricht sehr groß. Beides sind Grenzen der Modellfähigkeit – keine Konfigurationsprobleme.

Kann Ollama auf einem anderen Rechner als OpenClaw laufen?

Ja – und das ist sogar ein empfehlenswertes Vorgehen: Installieren Sie Ollama auf dem Rechner mit der GPU und betreiben Sie das Gateway auf einem stromsparenden, immer eingeschalteten Gerät. Setzen Sie OLLAMA_HOST=0.0.0.0:11434 auf dem GPU-Rechner und verwenden Sie dessen LAN-Adresse als Basis-URL in OpenClaw. Da Ollama keine Authentifizierung bietet, beschränken Sie den Zugriff auf ein vertrauenswürdiges Netzwerk oder ein VPN.

Ist dies dasselbe OpenClaw wie das Captain-Claw-Spieleprojekt?

Nein. Jenes OpenClaw ist eine unabhängige C++-Neuimplementierung eines DOS-Plattformspiels aus dem Jahr 1997 und teilt lediglich den Namen. Falls ein Suchergebnis Level-Dateien oder Sprite-Rendering behandelt, haben Sie das Spieleprojekt gefunden.

Fazit

Die Verbindung zwischen Ollama und OpenClaw ist eine Fünf-Minuten-Konfigurationsaufgabe: Der OpenAI-kompatible Endpunkt, ein nicht-leerer API-Schlüssel und ein exakter Modell-Tag. Die entscheidende Arbeit für die Nutzbarkeit erfolgt jedoch davor – nämlich die Auswahl eines Modells mit echter Tool-Calling-Unterstützung, die Bereitstellung eines ausreichend großen Kontextfensters für das Agenten-Prompt und das Vorhandensein genügend VRAM, um das Modell dauerhaft im Speicher zu halten. Vergleichen Sie geeignete Modelle in der Modelldatenbank, und falls Sie neu bei Ollamas Konfigurationsoberfläche sind, behandelt die umfassender Ollama-Leitfaden die Umgebungsvariablen und die Modelfile-Mechanik ausführlicher.

Verfasst von Mustafa Ihsan

Mustafa Ihsan ist Gründer und Chefredakteur von Convly.ai. Er entwickelte und pflegt die Live-Datenbank für KI-Modelle der Website, ihren Preis-Leistungs-Index sowie kostenlose Rechner für VRAM-Anforderungen, API-Kosten und Wirtschaftlichkeit des Self-Hostings. Er schreibt über Modellpreise, Benchmark-Ergebnisse und die Hardware, die zum lokalen Betrieb von KI-Modellen erforderlich ist, und bevorzugt stets messbare Zahlen gegenüber Herstellerangaben.

Scroll to Top