Thursday, 6 August 2026 | Updating Daily AI insight, written for builders

So installieren Sie Ollama im Jahr 2026: Schritt-für-Schritt-Anleitung für Mac, Windows und Linux

Aktualisiert · Erstmals veröffentlicht am 6. Juni 2026

Die Installation von Ollama ist auf jedem gängigen Betriebssystem tatsächlich innerhalb von zwei Minuten erledigt. Dieser Leitfaden enthält die genauen Schritte für Mac, Windows und Linux, zeigt Ihnen, wie Sie Ihr erstes Modell ausführen, und behandelt die wenigen Fehler, auf die Nutzer tatsächlich stoßen.

Noch nie mit dem Tool gearbeitet? Beginnen Sie zunächst mit einer Erklärung, was Ollama ist und wie es funktioniert, und kehren Sie danach hierher zurück, um es zu installieren.

Quick answer: How do you install Ollama?

Installing Ollama is a download-and-run process that takes around two minutes on every major operating system. On macOS, download the app from ollama.com or run installieren Sie Ollama über Homebrew mit „brew install ollama“; on Windows, run the official installer, which is native and needs no WSL; on Linux, run the one-liner curl -fsSL https://ollama.com/install.sh | sh. Then pull and run your first model with ollama run gemma4, and confirm it works when the local API answers at http://localhost:11434.

  • macOS: download the app from ollama.com or run installieren Sie Ollama über Homebrew mit „brew install ollama“.
  • Windows: run the official .exe installer — native, no WSL required — then check ollama --version.
  • Linux: Ein einziger Befehl – curl -fsSL https://ollama.com/install.sh | sh.
  • First model to run: ollama run gemma4 downloads and runs a strong all-rounder in a single command.
  • RAM you need: roughly as much free RAM (or VRAM) as the quantized model size — around 4–5 GB for a 7B model and about 8 GB for a 13B model.

Wichtigste Erkenntnisse

  • Mac: Laden Sie die App von ollama.com herunter oder installieren Sie Ollama über Homebrew mit „brew install ollama“.
  • Windows: Laden Sie den offiziellen Installer herunter und führen Sie ihn aus – native Unterstützung, kein WSL erforderlich.
  • Linux: Ein einziger Befehl – curl -fsSL https://ollama.com/install.sh | sh.
  • Erstes Modell: ollama run gemma4 lädt ein leistungsstarkes Allround-Modell herunter und führt es aus.
  • Überprüfen Sie, ob es funktioniert: Die API antwortet unter http://localhost:11434.

Bevor Sie installieren: Ist Ihr Rechner dafür geeignet?

Ollama selbst ist sehr klein, doch die Modellen Modelle sind es nicht. Als Faustregel gilt: Sie benötigen ungefähr so viel freien Arbeitsspeicher (RAM) oder Grafikspeicher (VRAM), wie das quantisierte Modell groß ist – etwa 4–5 GB für ein 7B-Modell, 8 GB für ein 13B-Modell und deutlich mehr für größere Modelle. Falls Sie unsicher sind, welche Hardwarekapazitäten Ihr System bietet, lesen Sie zunächst unseren Leitfaden zu den Systemanforderungen für Ollama , um ein Modell auszuwählen, das tatsächlich auf Ihrem System läuft.

Installation unter macOS

Der einfachste Weg ist die native App:

  1. Gehen Sie zu ollama.com/download und laden Sie die macOS-App herunter.
  2. Öffnen Sie die .dmg-Datei und ziehen Sie Ollama in den Ordner „Anwendungen“.
  3. Starten Sie die Anwendung – Ollama läuft im Hintergrund, und der Befehl ollama steht anschließend in Ihrem Terminal zur Verfügung.

Sie bevorzugen die Kommandozeile? Verwenden Sie Homebrew:

installieren Sie Ollama über Homebrew mit „brew install ollama“

Auf Apple Silicon (M1–M5) nutzt Ollama seit Version 0.19 automatisch die GPU über Apples MLX-Backend, sodass Sie schnelle Inferenz ohne zusätzliche Konfiguration erhalten.

Installation unter Windows

Ollama läuft nativ unter Windows – Sie benötigen nicht mehr WSL:

  1. Laden Sie den Windows-Installer von ollama.com/download.
  2. Führen Sie die .exe aus und folgen Sie den Anweisungen.
  3. Öffnen PowerShell oder Eingabeaufforderung und geben Sie ein: ollama --version um zu bestätigen, dass die Installation erfolgreich war.

Falls Sie eine NVIDIA-GPU besitzen, erkennt Ollama diese automatisch und nutzt CUDA. Keine komplizierten Treiberanpassungen erforderlich – vorausgesetzt, Ihre GPU-Treiber sind aktuell.

Installation unter Linux

Ein einziger Befehl erledigt alles:

curl -fsSL https://ollama.com/install.sh | sh

Dies installiert Ollama und richtet es als systemd -Dienst ein, der beim Systemstart automatisch gestartet wird. Um zu überprüfen, ob der Dienst läuft:

systemctl status ollama

Unter Ubuntu und den meisten anderen Distributionen erkennt der Installer NVIDIA- und AMD-GPUs automatisch und konfiguriert das passende Backend. Für AMD-Grafikkarten stellen Sie bitte sicher, dass ROCm installiert ist – weitere Informationen finden Sie in unserem ausführlichen Vergleich „ ROCm vs. CUDA “, der den Stand der AMD-Unterstützung im Jahr 2026 darstellt.

Führen Sie Ihr erstes Modell aus

Nach der Installation von Ollama können Sie ein Modell mit einem einzigen Befehl herunterladen und ausführen:

ollama run gemma4

Beim ersten Aufruf wird das Modell (mehrere Gigabyte groß) heruntergeladen und anschließend wird eine Chat-Eingabeaufforderung geöffnet. Geben Sie eine Frage ein – erhalten Sie eine Antwort, vollständig lokal auf Ihrem Rechner. Einige nützliche Befehle:

  • ollama list – zeigt alle heruntergeladenen Modelle an.
  • ollama pull qwen3 – lädt ein Modell herunter, ohne es sofort auszuführen.
  • ollama rm gemma4 – löscht ein Modell, um Speicherplatz freizugeben.
  • ollama ps – zeigt an, welche Modelle aktuell im Arbeitsspeicher geladen sind.

Unsicher, mit welchem Modell Sie beginnen sollen? Unser Leitfaden zu den besten lokalen LLMs für Ollama empfiehlt Modelle je nach Einsatzszenario und Hardware.

Überprüfen Sie, ob die API läuft

Ollama stellt eine REST-API auf Port 11434 bereit. Um zu prüfen, ob sie aktiv ist, führen Sie aus:

curl http://localhost:11434/api/tags

Eine JSON-Antwort mit Ihrer Modellliste bedeutet, dass alles korrekt funktioniert. Diese Schnittstelle nutzen auch Ihre eigenen Anwendungen – und da Ollama eine OpenAI-kompatible API bietet, funktioniert viel vorhandener Code bereits nach einer einfachen Änderung der Basis-URL.

Häufige Installationsprobleme und Lösungen

  • „ollama: Befehl nicht gefunden“ (Mac/Linux): Die Anwendung wurde zwar installiert, befindet sich aber nicht im PATH. Unter macOS stellen Sie sicher, dass die App mindestens einmal gestartet wurde; unter Linux öffnen Sie nach der Installation eine neue Shell.
  • Modell-Downloads sind langsam oder hängen fest: Ollama lädt große Dateien herunter; ein hängender Download löst sich meist durch erneutes Ausführen von ollama pull <Modell> – der Vorgang wird fortgesetzt, statt von vorne zu beginnen.
  • GPU wird nicht genutzt: Prüfen Sie ollama ps – zeigt die Ausgabe 100 % CPU-Auslastung an, so könnten Ihre GPU-Treiber veraltet sein oder das Modell zu groß für den verfügbaren VRAM sein und daher auf die CPU ausgelagert werden. Probieren Sie stattdessen ein kleineres oder stärker quantisiertes Modell aus.
  • „Out of memory“-Fehler: Das Modell ist größer als Ihr verfügbarer Arbeitsspeicher bzw. VRAM. Laden Sie stattdessen ein kleineres Quantisierungsformat herunter (achten Sie auf Varianten mit q4 ) oder wählen Sie ein kleineres Modell. Unsere Leitfaden zu den Systemanforderungen Übersicht zeigt, welche Modelle auf welcher Hardware laufen.
  • Port 11434 ist bereits belegt: Eine andere Ollama-Instanz läuft bereits. Beenden Sie diese (ollama ps schließen Sie dann die App bzw. den Dienst), bevor Sie eine neue Instanz starten.

Konfigurieren Sie Ollama nach der Installation: Speicherplatz, Arbeitsspeicher und eine Benutzeroberfläche

Die Installation von Ollama ist der einfache Teil. Einige Einstellungen entscheiden darüber, ob Ollama im Hintergrund bleibt oder stillschweigend Festplattenspeicher und Arbeitsspeicher verbraucht. Alle diese Einstellungen erfolgen über Umgebungsvariablen; wo Sie diese setzen, hängt vom Betriebssystem ab: Unter macOS verwenden Sie launchctl setenv, unter Linux bearbeiten Sie den Dienst mittels systemctl edit ollama.service und fügen eine Zeile mit Environment= hinzu; unter Windows fügen Sie eine Benutzer-Umgebungsvariable über die Systemeinstellungen hinzu. Starten Sie Ollama nach jeder Änderung neu, damit diese wirksam wird.

Die vier wichtigsten Variablen lauten:

  • OLLAMA_MODELS – legt fest, wo Modelle gespeichert werden. Modelle sind groß, und die Standardpfade liegen auf Ihrem Systemlaufwerk (~/.ollama/models unter macOS, /usr/share/ollama/.ollama/models unter Linux, C:\Users\<Sie>\.ollama\models unter Windows). Weisen Sie diese Variable auf ein größeres oder schnelleres Laufwerk, bevor Sie mehrere Modelle herunterladen. Stellen Sie unter Linux sicher, dass der Benutzer „ollama“ Lese- und Schreibzugriff auf das neue Verzeichnis besitzt. ollama user can read and write the new directory.
  • OLLAMA_KEEP_ALIVE – legt fest, wie lange ein Modell nach einer Anfrage im Arbeitsspeicher verbleibt. Der Standardwert beträgt fünf Minuten. Setzen Sie diesen Wert auf -1 um ein Modell dauerhaft im Arbeitsspeicher zu halten, sodass die erste Anfrage nie langsam ist, oder auf 0 um das Modell unverzüglich zu entladen und den VRAM sofort freizugeben, sobald Sie fertig sind.
  • OLLAMA_CONTEXT_LENGTH – definiert das Kontextfenster. Ollama verwendet standardmäßig konservativ 4096 Token, weshalb lange Dokumente stumm abgeschnitten werden. Erhöhen Sie diesen Wert (z. B. auf 8192 oder höher), falls Ihr Modell dies unterstützt, und kombinieren Sie dies mit OLLAMA_FLASH_ATTENTION=1 , um die zusätzlichen Speicherkosten gering zu halten.
  • OLLAMA_HOST – legt fest, an welche Adresse der Server gebunden wird. Standardmäßig lauscht Ollama nur auf 127.0.0.1:11434, sodass kein anderes Gerät in Ihrem Netzwerk darauf zugreifen kann. Setzen Sie diesen Wert auf 0.0.0.0:11434 , um Ollama von einem anderen Rechner, einem Smartphone oder einem Docker-Container aus nutzen zu können.

Ein wichtiger Hinweis zu dieser letzten Einstellung: Die Ollama-API verfügt über keine integrierte Authentifizierung. Wenn Sie Ollama an 0.0.0.0 binden, kann jeder, der Zugriff auf Port 11434 hat, Modelle auf Ihrer Hardware ausführen. Führen Sie diesen Schritt daher ausschließlich in einem vertrauenswürdigen lokalen Netzwerk durch und schützen Sie den Zugriff gegebenenfalls durch einen Reverse-Proxy oder eine Firewall-Regel, falls der Rechner öffentlich erreichbar ist.

Abschließend: Die Kommandozeile eignet sich gut zum Testen, ist aber für den täglichen Einsatz mühsam. Die gängige Lösung hierfür ist Open WebUI, eine selbstgehostete, ChatGPT-ähnliche Oberfläche, die mit Ihrer lokalen Ollama-Instanz kommuniziert. Der schnellste Weg führt über Docker: Der Container stellt seinen Dienst intern auf Port 8080 bereit; mappen Sie diesen daher mit -p 3000:8080 auf einen Host-Port und rufen Sie http://localhost:3000im Browser auf. Konfigurieren Sie anschließend die Verbindung zu Ihrer Ollama-Instanz. Sie erhalten Chatverlauf, Modellumschaltung und Dokument-Uploads – alles vollständig auf Ihrem eigenen Rechner.

Häufig gestellte Fragen (FAQ)

Wie installiere ich Ollama unter Windows?

Laden Sie den nativen Installer von ollama.com/download herunter und führen Sie die .exe.exe aus. Ollama läuft nativ unter Windows – WSL ist nicht erforderlich – und nutzt bei Vorhandensein einer NVIDIA-GPU automatisch CUDA. Bestätigen Sie die Installation mit ollama --version ollama --version in PowerShell.

Wie installiere ich Ollama unter Linux?

Ausführen curl -fsSL https://ollama.com/install.sh | sh. Dadurch wird Ollama installiert und als systemd-Dienst registriert. Überprüfen Sie die Installation mit systemctl status ollama. Der Installer erkennt NVIDIA- und AMD-GPUs automatisch.

Kann ich Ollama über Homebrew installieren?

Ja – installieren Sie Ollama über Homebrew mit „brew install ollama“ funktioniert unter macOS. Die native App von ollama.com ist genauso gut und bietet zudem eine Anwesenheit in der Menüleiste; der Homebrew-Weg ist praktisch, wenn Sie sämtliche Software über die Kommandozeile verwalten.

Wo speichert Ollama Modelle?

Standardmäßig unter Mac und Linux im Verzeichnis ~/.ollama/models, unter Windows hingegen im Benutzerprofil. Modelle können mehrere Gigabyte groß sein; verwenden Sie daher ollama list um nachzuvollziehen, was Sie bereits heruntergeladen haben, und ollama rm <Modell> zum Aufräumen.

Ist die Installation von Ollama sicher?

Ja. Ollama ist Open-Source (MIT-lizenziert) und weit verbreitet. Für das Linux-One-Liner-Installations-Skript gilt die übliche Vorsicht: Es handelt sich um das offizielle Skript des Projekts; falls Sie dies bevorzugen, können Sie jedoch zuvor die Datei install.sh herunterladen und prüfen, bevor Sie sie ausführen.

Warum schneidet Ollama lange Eingaben oder Dokumente immer wieder ab?

Ollama verwendet standardmäßig ein Kontextfenster mit 4096 Token, unabhängig davon, wie viele Token das Modell tatsächlich verarbeiten kann; längere Eingaben werden daher ohne Warnung abgeschnitten. Erhöhen Sie diesen Wert, indem Sie den Server mit OLLAMA_CONTEXT_LENGTH auf einen höheren Wert (z. B. 8192 oder mehr) festlegen – allerdings höchstens bis zur vom Modell unterstützten Obergrenze. Ein größerer Kontext beansprucht mehr Arbeitsspeicher; aktivieren Sie daher OLLAMA_FLASH_ATTENTION=1 , um die zusätzliche Speicherlast auszugleichen, und achten Sie auf Ihren verfügbaren Arbeitsspeicher- oder VRAM-Puffer.

Wie greife ich von einem anderen Computer im Netzwerk auf Ollama zu?

Standardmäßig lauscht Ollama nur auf localhost und ist daher für andere Geräte unsichtbar. Legen Sie OLLAMA_HOST=0.0.0.0:11434 fest und starten Sie Ollama neu. Stellen Sie dann über die LAN-IP-Adresse des Host-Computers an Port 11434 eine Verbindung her. Beachten Sie, dass die API keine Authentifizierung bietet; stellen Sie Ollama daher ausschließlich in einem Netzwerk bereit, dem Sie vertrauen. Falls der Rechner von außerhalb Ihres Heim- oder Büro-Netzwerks erreichbar ist, verwenden Sie eine Firewall-Regel oder einen Reverse-Proxy.

Wie verhindere ich, dass Ollama das Modell bei jeder Anfrage neu lädt?

Diese Verzögerung entsteht durch das Entladen des Modells aus dem Arbeitsspeicher zwischen den Nutzungsvorgängen. Ollama hält ein Modell standardmäßig fünf Minuten lang im Speicher; setzen Sie OLLAMA_KEEP_ALIVE=-1 fest, um es dauerhaft im Arbeitsspeicher zu halten – so erfolgen Prompt-Antworten sofort. Der Nachteil ist, dass das Modell Ihren Arbeitsspeicher oder Ihre VRAM kontinuierlich belegt; verwenden Sie stattdessen 0 , falls Sie den Speicher unmittelbar nach Abschluss einer Anfrage wieder freigeben möchten.

Fazit

Auf jedem Betriebssystem ist die Installation von Ollama ein einfacher Download-und-Ausführen-Vorgang, der etwa zwei Minuten dauert – und Ihr erstes lokales Modell ist nur einen Befehl entfernt. Wählen Sie ein Modell, das zu Ihrer Hardware passt, stellen Sie sicher, dass die API auf Port 11434 antwortet, und schon läuft ein privater, kostenloser LLM auf Ihrem eigenen Rechner. Von hier aus können Sie erkunden, welche Modelle geeignet sind und wie viel Hardware jedes einzelne Modell benötigt.

Verfasst von Mustafa Ihsan

Mustafa Ihsan ist Gründer und Chefredakteur von Convly.ai. Er hat die Live-Datenbank für KI-Modelle der Website sowie ihren Preis-Leistungs-Index und kostenlose Rechner für VRAM-Bedarf, API-Kosten und Selbsthosting-Kosten entwickelt und pflegt sie. Er schreibt über Modellpreise, Benchmark-Ergebnisse und die Hardware, die zum lokalen Betrieb von KI-Modellen erforderlich ist, und bevorzugt stets messbare Zahlen gegenüber Herstellerangaben.

Scroll to Top
Featured on There's An AI For That