Tuesday, 25 August 2026 | Updating Daily AI insight, written for builders

Ollama und OpenClaw: So führen Sie OpenClaw auf einem lokalen Modell aus

  • Es gibt keine dedizierte Ollama-Integration. Sie verbinden OpenClaw mit Ollama über Ollamas OpenAI-kompatible API unter http://localhost:11434/v1, wobei Sie Ollama als generischen OpenAI-ähnlichen Anbieter behandeln.
  • Die Wahl des Modells ist entscheidend. OpenClaw ist eine Agenten-Schleife, die Tools aufruft; daher benötigen Sie ein Modell mit nativer Unterstützung für Tool-Aufrufe – qwen3, gpt-oss, llama3.1/3.3, mistral-small. Ein reines Chat-Modell schlägt stillschweigend fehl, indem es Tool-Aufrufe beschreibt, anstatt sie tatsächlich auszuführen.
  • Erhöhen Sie das Kontextfenster. Ollamas Standard-Kontext ist deutlich kleiner als OpenClaws System-Prompt plus Tool-Schemata plus Gesprächsverlauf. Erstellen Sie eine Modelfile mit PARAMETER num_ctx 32768 oder größer.
  • Rechnen Sie mit einem spürbaren Qualitätsverlust. Lokale Modelle mit weniger als etwa 30 Milliarden Parametern versagen bei mehrstufigen Aufgabenketten, die Spitzenmodelle problemlos bewältigen. Eine hybride Konfiguration – lokal für Routineantworten, Cloud für anspruchsvolle Aufgaben – ist die praktikable Lösung.

OpenClaw ist ein selbstgehosteter KI-Assistent, der über Messaging-Apps mit Ihnen kommuniziert und Tools auf Ihrem Rechner steuert. Es verfügt über keine Ollama-spezifische Integration; stattdessen verbinden Sie die beiden Komponenten, indem Sie OpenClaws Modellanbieter auf Ollamas OpenAI-kompatiblen Endpunkt http://localhost:11434/v1ausrichten. Das funktioniert, allerdings nur mit einem Modell, das Tool-Aufrufe zuverlässig ausführt, sowie einem Kontextfenster, das deutlich über Ollamas Standardgröße liegt.

Was OpenClaw tatsächlich ist

OpenClaw ist ein quelloffener persönlicher Assistent, der als langlaufender Gateway-Prozess auf Ihrer eigenen Hardware ausgeführt wird. Er verbindet Messaging-Kanäle – WhatsApp, Telegram, Discord, Signal, iMessage – mit einer Agenten-Schleife, die Zugriff auf Tools bietet: Shell-Befehle, Dateioperationen, Webabrufe, Kalender- und Speicherfunktionen. Das Projekt begann als Clawdbot, wurde kurz darauf in Moltbot, umbenannt und erhielt schließlich den Namen OpenClaw. Sein Standard-„Gehirn“ war ein Anthropic-Modell, doch da es das OpenAI-Chat-Completions-Protokoll für Drittanbieter unterstützt, kann jedes System, das dieses Protokoll bereitstellt, als Ersatz dienen – darunter auch Ollama.

Eine Klarstellung: Ein anderes, nicht verwandtes Projekt namens OpenClaw ist eine C++-Neuimplementierung des Plattformers aus dem Jahr 1997 Captain Claw. Es hat nichts mit Sprachmodellen (LLMs) zu tun. Falls Sie nach „ollama openclaw“ gesucht haben, wollen Sie mit großer Wahrscheinlichkeit den Assistenten.

Warum diese Kombination komplizierter ist als eine Chat-Oberfläche

Eine Chat-Oberfläche mit Ollama zu verbinden, ist trivial. Ein Agenten-Framework hingegen ist es nicht – und zwar aus drei Gründen:

  • Tool-Aufrufe müssen strukturell korrekt sein. OpenClaw übergibt Tool-Definitionen und erwartet JSON-Objekte für Tool-Aufrufe als Antwort. Modelle ohne ein tool-bewusstes Chat-Template generieren stattdessen Prosa wie „Ich werde jetzt den Befehl lsausführen“ – wodurch die Schleife zum Stillstand kommt.
  • Der Prompt ist bereits vor Ihrer ersten Eingabe sehr umfangreich. Systemanweisungen plus Tool-Schemata beanspruchen regelmäßig mehrere tausend Tokens. Ollamas Standard-Kontext kürzt diesen Prompt ab, wobei die Kürzung am Anfang genau jene Anweisungen entfernt, auf die der Agent angewiesen ist.
  • Fehler summieren sich über mehrere Gesprächsrunden hinweg. Ein Modell mit einer Tool-Aufruf-Genauigkeit von 90 % pro Schritt löst eine sechsschrittige Aufgabe nur etwa zur Hälfte erfolgreich.

Schritt 1: Stellen Sie sicher, dass Ollama auf einer erreichbaren Adresse bereitgestellt wird

Falls Ollama noch nicht installiert ist, folgen Sie zunächst den Ollama-Installationsanleitung Anweisungen.

Überprüfen Sie, ob der Server antwortet:
curl http://localhost:11434/api/version
curl http://localhost:11434/v1/models

Falls OpenClaw auf demselben Host und außerhalb eines Containers läuft, reicht die Standard-Loopback-Bindung aus, und Sie können direkt zu Schritt 2 wechseln. Falls OpenClaw jedoch in Docker oder auf einem anderen Rechner läuft, muss Ollama über die Loopback-Schnittstelle hinaus gebunden werden, z. B. mittels OLLAMA_HOST. Die genaue Vorgehensweise variiert je nach Plattform.

macOS

Die Menüleisten-Anwendung liest Ihr Shell-Profil nicht ein. Legen Sie die Umgebungsvariable im Startkontext fest und starten Sie die Anwendung dann über das Symbol im Infobereich neu:

launchctl setenv OLLAMA_HOST "0.0.0.0:11434"

Modelle befinden sich in ~/.ollama/models. Server-Logs finden Sie unter ~/.ollama/logs/. Von einem Container auf demselben Mac aus erreichen Sie den Host unter http://host.docker.internal:11434.

Linux

Der Installer registriert eine systemd-Einheit. Überschreiben Sie deren Umgebung statt die mitgelieferte Einheitsdatei zu bearbeiten:

sudo systemctl edit ollama.service

Fügen Sie hinzu:

[Service]
Environment="OLLAMA_HOST=0.0.0.0:11434"
Environment="OLLAMA_KEEP_ALIVE=-1"

Danach führen Sie aus: sudo systemctl daemon-reload && sudo systemctl restart ollama. Die Logs stammen von journalctl -u ollama -fUnter dem Dienstkonto verwenden Modelle standardmäßig /usr/share/ollama/.ollama/models, nicht Ihr Heimatverzeichnis – eine häufige Überraschung, wenn ollama list als root leer erscheint.

Windows

Legen Sie die Variable über die grafische Benutzeroberfläche fest: Start → „Systemumgebungsvariablen bearbeiten“ → UmgebungsvariablenNeu unter Benutzervariablen; Name: OLLAMA_HOST, Wert: 0.0.0.0:11434. Beenden Sie Ollama über das Symbol in der Taskleiste und starten Sie es neu; der Taskleistenprozess liest Umgebungsvariablen nur beim Start. Die Modelle befinden sich in %USERPROFILE%.ollamamodels; Protokolle in %LOCALAPPDATA%\Ollama.

OpenClaw selbst ist eine Node-Anwendung und läuft zuverlässigsten unter Linux oder macOS. Unter Windows führen Sie es innerhalb von WSL2 aus. In diesem Fall kann Ollama als native Windows-Installation belassen werden – WSL2 erreicht den Windows-Host über die gespiegelte oder NAT-Gateway-Adresse; überprüfen Sie dies daher mit curl aus WSL heraus, bevor Sie etwas konfigurieren.

Sicherheitshinweis: Ollama verfügt über keine Authentifizierung. Das Binden an 0.0.0.0 stellt die Modell-Inferenz jedem Host zur Verfügung, der auf diesen Port routen kann. Halten Sie es daher in einem vertrauenswürdigen LAN oder VPN oder schalten Sie einen Reverse-Proxy davor, der ein Token erfordert. Exponieren Sie es niemals gegenüber dem öffentlichen Internet.

Schritt 2: Laden Sie ein Modell herunter, das Tools aufrufen kann

Die Tool-Aufruf-Funktion in Ollama hängt von der Chat-Vorlage des Modells ab, nicht von einer Flagge, die Sie übergeben. Die unten angegebenen Größen sind Näherungswerte für gängige 4-Bit-Tags und können zwischen Versionen variieren – prüfen Sie ollama list und die aktuelle Tag-Liste für exakte Angaben.

Modell-TagParameterGeschätzter DownloadPraktischer VRAM bei 32K KontextGeeignet für OpenClaw
llama3.1:8b8B~4,7 GB8–10 GBGrundlagenlevel. Nur einfache Einzel-Tool-Aufgaben.
qwen3:8b8B~5 GB8–10 GBBessere Tool-Disziplin als Llama 3.1 8B.
qwen3:14b14B~9 GB12–16 GBGutes Verhältnis auf einer 16-GB-Karte.
gpt-oss:20b20B MoE~14 GB16 GBStarke Tool-Nutzung; schnell dank sparsamer Aktivierung.
mistral-small24B~14 GB16–20 GBZuverlässiger Funktionsaufruf.
qwen3:32b32 Mrd.~20 GB24 GB+Beste realistische lokale Erfahrung.

Laden Sie eines herunter und prüfen Sie, ob es Tools akzeptiert, bevor Sie OpenClaw konfigurieren:

ollama pull qwen3:14b

Für einen umfassenderen Vergleich möglicher Kandidaten und ihres Verhaltens unter Agent-Workloads siehe die besten lokalen Modelle für Ollama.

Schritt 3: Erhöhen Sie das Kontextfenster

Dieser Schritt wird oft übersprungen und ist die häufigste Ursache dafür, dass eine OpenClaw-auf-Ollama-Konfiguration „fast funktioniert“. Ollama verwendet unabhängig davon, was das Modell unterstützt, einen moderaten Standardkontext (historisch 2048, in neueren Versionen erhöht). Neuere Versionen akzeptieren eine serverweite OLLAMA_CONTEXT_LENGTH -Umgebungsvariable, doch die versionsunabhängige Methode besteht darin, sie in ein abgeleitetes Modell einzubauen:

FROM qwen3:14b
PARAMETER num_ctx 32768

Speichern Sie als Modelfile, dann:

ollama create qwen3-14b-32k -f Modelfile

Nutzen Sie qwen3-14b-32k als Modellname in OpenClaw. Größere Kontexte beanspruchen VRAM für den KV-Cache, der separat von den Gewichten ist – nutzen Sie den VRAM-Rechner , um vorab zu ermitteln, wie viel VRAM ein bestimmtes Modell bei einer gegebenen Kontextlänge tatsächlich benötigt, bevor Sie durch einen OOM-Fehler darauf stoßen. Bei neueren Ollama-Versionen reduzieren OLLAMA_FLASH_ATTENTION=1 und ein quantisierter KV-Cache (OLLAMA_KV_CACHE_TYPE=q8_0) diesen Overhead deutlich.

Schritt 4: Richten Sie OpenClaw auf Ollama aus

OpenClaw speichert seine Konfiguration in einem Punktverzeichnis unter Ihrem Home-Verzeichnis (~/.openclaw/) und unterstützt Überschreibungen über Umgebungsvariablen. Die drei erforderlichen Werte sind inhaltlich stets dieselben:

EinstellungWert
Basis-URLhttp://localhost:11434/v1 – die /v1 -Endung ist zwingend vorgeschrieben
API-SchlüsselJeder nicht-leere String, z. B. Ollama. Der Wert wird ignoriert, doch lehnen viele Clients einen leeren Wert ab.
ModellExakter Tag aus ollama list, einschließlich der :tag -Anteil

Die genaue Konfiguration Schlüsselnamen haben sich im Zuge der Umbenennungen des Projekts und seines schnellen Release-Rhythmus verschoben. Kopieren Sie daher nicht einfach einen Konfigurations-Block aus einem Blogbeitrag, sondern führen Sie die Hilfsausgabe der CLI aus und prüfen Sie die generierte Konfigurationsdatei in Ihrer installierten Version:

openclaw --help

Praktisch gesprochen suchen Sie nach dem generischen OpenAI-kompatiblen Provider-Block – demselben, der auch für OpenRouter, vLLM oder LM Studio verwendet wird – und setzen dort die Basis-URL, den API-Schlüssel und das Modell fest. Falls OpenClaw während der Ersteinrichtung eine Provider-Auswahl anbietet, wählen Sie die OpenAI-kompatible Option statt eines benannten Anbieters.

Bevor Sie OpenClaw debuggen, stellen Sie sicher, dass der Endpunkt direkt auf eine Tool-Calling-Anfrage mit curl gegenüber /v1/chat/completionsantwortet. Wenn dies fehlschlägt, liegt das Problem bei Ollama – nicht bei OpenClaw.

Hardware-realitätscheck

OpenClaw ist ein Hintergrunddienst. Das Modell wird beim Eintreffen von Nachrichten geladen und neu geladen; jeder Neuladevorgang verursacht mehrere Sekunden Latenz – daher möchten Sie, dass die Gewichte dauerhaft im Speicher verbleiben. Deshalb gilt: OLLAMA_KEEP_ALIVE=-1Das bedeutet, dass die VRAM so lange reserviert bleibt, wie der Assistent läuft – nicht nur während einer einzelnen Anfrage. Planen Sie entsprechend: Eine 24-GB-Karte mit qwen3:32b bei einem Kontext von 32K hat praktisch keinen Speicher mehr für andere Aufgaben übrig.

Eine 16-GB-GPU ist der sinnvolle Einstiegspunkt für ein 14B–20B-Modell bei nutzbarem Kontext. Bei weniger als 12 GB sind Sie auf 8B-Modelle beschränkt, bei denen die Zuverlässigkeit bei mehrstufigen Abläufen deutlich abfällt. Apple Silicon mit 32 GB oder mehr einheitlichem Arbeitsspeicher funktioniert gut, da der Speicher geteilt ist – allerdings ist die Prompt-Verarbeitung langsamer als auf einer dedizierten NVIDIA-Grafikkarte. Siehe der GPU-Leitfaden für lokale LLMs für die konkreten Grafikkarten, die sich in jeder Leistungsstufe lohnen.

Die hybride Konfiguration, auf die die meisten Nutzer letztlich zurückgreifen

Das ehrliche Fazit: Ein lokales 14B-Modell bewältigt Routine-Nachrichten, Zusammenfassungen, Erinnerungen und einfache Single-Tool-Abfragen hervorragend. Längere Rechercheketten, Codeänderungen über mehrere Dateien hinweg sowie Aufgaben, die sorgfältiges Befolgen von Anweisungen erfordern, zeigen deutlich erkennbare Einbußen. Viele OpenClaw-Nutzer konfigurieren daher einen Cloud-Anbieter für die Haupt-Agenten-Schleife und nutzen Ollama für hochvolumige, wenig kritische Arbeiten oder für datenschutzsensible Inhalte, die den Rechner nicht verlassen dürfen.

Ob diese Aufteilung Kosten spart, hängt von Ihrem Nachrichtenvolumen und Ihren Stromkosten ab. Rechnen Sie Ihre Zahlen mit dem Selbsthosting- versus-API-Kosten-Grenzwert-Rechner durch, bevor Sie gezielt eine GPU dafür kaufen; bei geringem Volumen ist die API in der Regel günstiger als die Amortisation der Hardware.

Fehlerbehebung

SymptomUrsache und Behebung
ECONNREFUSED / Verbindung abgelehntDer Server läuft nicht, oder er ist an die Loopback-Adresse gebunden, während OpenClaw in einem Container läuft. Testen Sie curl http://localhost:11434/api/version aus dem Netzwerk-Namespace des Containers heraus.
404 bei AnfragenBasis-URL fehlt /v1, oder sie verweist auf den nativen Ollama- /api/chat Pfad statt auf den OpenAI-kompatiblen.
401 / fehlender API-SchlüsselLegen Sie das Schlüsselfeld auf einen beliebigen nicht-leeren String fest.
Modell nicht gefundenTag-Unterschied. Kopieren Sie den Namen wörtlich aus ollama list.
Der Agent beschreibt die Tool-Nutzung statt sie auszuführenDas Modell verfügt über keine Tool-Calling-Vorlage. Wechseln Sie zu einem Modell aus der obigen Tabelle.
Der Agent vergisst seine Anweisungen mitten in einer AufgabeKontext-Trunkierung. Erstellen Sie das Modell mit einem größeren num_ctx.
Die erste Antwort nach einer Pause dauert 30+ SekundenDas Modell wurde nach Ablauf des Keep-Alive-Timeouts entladen. Legen Sie OLLAMA_KEEP_ALIVE=-1.

Häufig gestellte Fragen

Unterstützt OpenClaw offiziell Ollama?

Nicht als benannte Integration. Die Unterstützung ist indirekt: OpenClaw kann jeden OpenAI-kompatiblen Chat-Completions-Endpunkt nutzen, und Ollama stellt einen solchen unter /v1zur Verfügung. Dieser Pfad ist stabil und wird sich wahrscheinlich nicht ändern; das eigene Konfigurationsschema von OpenClaw entwickelt sich jedoch rasch weiter – prüfen Sie daher stets die aktuelle Dokumentation auf die exakten Provider-Schlüssel, statt Annahmen zu treffen.

Welches ist das kleinste Modell, das tatsächlich funktioniert?

Ein 8B-Modell mit Tool-Calling-Unterstützung wie qwen3:8b ist die realistische Untergrenze – allerdings nur für kurze, Single-Tool-Interaktionen. Darunter werden Tool-Argumente so häufig fehlerhaft, dass die Agenten-Schleife eher frustrierend als nützlich wird. Ab 14B beginnt das System wirklich verlässlich zu wirken.

Kann ich dies unter Windows ausführen?

Ja, mit OpenClaw innerhalb von WSL2 und Ollama nativ unter Windows installiert, damit es direkt Ihren GPU-Treiber nutzt. Überprüfen Sie die Erreichbarkeit vom WSL-Shell aus mit curl bevor Sie OpenClaw konfigurieren. Beachten Sie, dass der iMessage-Kanal unabhängig von der Plattform ausschließlich unter macOS verfügbar ist, da er von der lokalen Messages-Datenbank abhängt.

Warum ist die lokale OpenClaw-Version so viel schlechter als die cloudbasierte Variante?

Zwei sich verstärkende Faktoren: Erstens ist die Genauigkeit des Tool-Calls pro Schritt niedriger, und Fehler multiplizieren sich bei mehrstufigen Aufgaben. Zweitens verschlechtern sich lokale Modelle schneller, sobald der Kontext gefüllt ist – und OpenClaws Prompt ist bereits vor Hinzufügen Ihrer Nachricht sehr groß. Beides sind Grenzen der Modellfähigkeit – keine Konfigurationsprobleme.

Kann Ollama auf einem anderen Rechner als OpenClaw laufen?

Ja – und das ist sogar ein empfehlenswertes Vorgehen: Installieren Sie Ollama auf dem Rechner mit der GPU und betreiben Sie das Gateway auf einem stromsparenden, immer eingeschalteten Gerät. Setzen Sie OLLAMA_HOST=0.0.0.0:11434 auf dem GPU-Rechner und verwenden Sie dessen LAN-Adresse als Basis-URL in OpenClaw. Da Ollama keine Authentifizierung bietet, beschränken Sie den Zugriff auf ein vertrauenswürdiges Netzwerk oder ein VPN.

Ist dies dasselbe OpenClaw wie das Captain-Claw-Spieleprojekt?

Nein. Jenes OpenClaw ist eine unabhängige C++-Neuimplementierung eines DOS-Plattformspiels aus dem Jahr 1997 und teilt lediglich den Namen. Falls ein Suchergebnis Level-Dateien oder Sprite-Rendering behandelt, haben Sie das Spieleprojekt gefunden.

Fazit

Die Verbindung zwischen Ollama und OpenClaw ist eine Fünf-Minuten-Konfigurationsaufgabe: Der OpenAI-kompatible Endpunkt, ein nicht-leerer API-Schlüssel und ein exakter Modell-Tag. Die entscheidende Arbeit für die Nutzbarkeit erfolgt jedoch davor – nämlich die Auswahl eines Modells mit echter Tool-Calling-Unterstützung, die Bereitstellung eines ausreichend großen Kontextfensters für das Agenten-Prompt und das Vorhandensein genügend VRAM, um das Modell dauerhaft im Speicher zu halten. Vergleichen Sie geeignete Modelle in der Modelldatenbank, und falls Sie neu bei Ollamas Konfigurationsoberfläche sind, behandelt die umfassender Ollama-Leitfaden die Umgebungsvariablen und die Modelfile-Mechanik ausführlicher.

Verfasst von Mustafa Ihsan

Mustafa Ihsan ist Gründer und Chefredakteur von Convly.ai. Er entwickelte und pflegt die Live-Datenbank für KI-Modelle der Website, ihren Preis-Leistungs-Index sowie kostenlose Rechner für VRAM-Anforderungen, API-Kosten und Wirtschaftlichkeit des Self-Hostings. Er schreibt über Modellpreise, Benchmark-Ergebnisse und die Hardware, die zum lokalen Betrieb von KI-Modellen erforderlich ist, und bevorzugt stets messbare Zahlen gegenüber Herstellerangaben.

Scroll to Top
Featured on There's An AI For That