Die Installation von Ollama ist auf jedem gängigen Betriebssystem tatsächlich innerhalb von zwei Minuten erledigt. Dieser Leitfaden enthält die genauen Schritte für Mac, Windows und Linux, zeigt Ihnen, wie Sie Ihr erstes Modell ausführen, und behandelt die wenigen Fehler, auf die Nutzer tatsächlich stoßen.
Noch nie mit dem Tool gearbeitet? Beginnen Sie zunächst mit einer Erklärung, was Ollama ist und wie es funktioniert, und kehren Sie danach hierher zurück, um es zu installieren.
- Quick answer: How do you install Ollama?
- Bevor Sie installieren: Ist Ihr Rechner dafür geeignet?
- Installation unter macOS
- Installation unter Windows
- Installation unter Linux
- Führen Sie Ihr erstes Modell aus
- Überprüfen Sie, ob die API läuft
- Häufige Installationsprobleme und Lösungen
- Konfigurieren Sie Ollama nach der Installation: Speicherplatz, Arbeitsspeicher und eine Benutzeroberfläche
- Häufig gestellte Fragen (FAQ)
- Fazit
- Verwandte Artikel
Quick answer: How do you install Ollama?
Installing Ollama is a download-and-run process that takes around two minutes on every major operating system. On macOS, download the app from ollama.com or run installieren Sie Ollama über Homebrew mit „brew install ollama“; on Windows, run the official installer, which is native and needs no WSL; on Linux, run the one-liner curl -fsSL https://ollama.com/install.sh | sh. Then pull and run your first model with ollama run gemma4, and confirm it works when the local API answers at http://localhost:11434.
- macOS: download the app from ollama.com or run
installieren Sie Ollama über Homebrew mit „brew install ollama“. - Windows: run the official
.exeinstaller — native, no WSL required — then checkollama --version. - Linux: Ein einziger Befehl –
curl -fsSL https://ollama.com/install.sh | sh. - First model to run:
ollama run gemma4downloads and runs a strong all-rounder in a single command. - RAM you need: roughly as much free RAM (or VRAM) as the quantized model size — around 4–5 GB for a 7B model and about 8 GB for a 13B model.
Wichtigste Erkenntnisse
- Mac: Laden Sie die App von ollama.com herunter oder
installieren Sie Ollama über Homebrew mit „brew install ollama“. - Windows: Laden Sie den offiziellen Installer herunter und führen Sie ihn aus – native Unterstützung, kein WSL erforderlich.
- Linux: Ein einziger Befehl –
curl -fsSL https://ollama.com/install.sh | sh. - Erstes Modell:
ollama run gemma4lädt ein leistungsstarkes Allround-Modell herunter und führt es aus. - Überprüfen Sie, ob es funktioniert: Die API antwortet unter
http://localhost:11434.
Bevor Sie installieren: Ist Ihr Rechner dafür geeignet?
Ollama selbst ist sehr klein, doch die Modellen Modelle sind es nicht. Als Faustregel gilt: Sie benötigen ungefähr so viel freien Arbeitsspeicher (RAM) oder Grafikspeicher (VRAM), wie das quantisierte Modell groß ist – etwa 4–5 GB für ein 7B-Modell, 8 GB für ein 13B-Modell und deutlich mehr für größere Modelle. Falls Sie unsicher sind, welche Hardwarekapazitäten Ihr System bietet, lesen Sie zunächst unseren Leitfaden zu den Systemanforderungen für Ollama , um ein Modell auszuwählen, das tatsächlich auf Ihrem System läuft.
Installation unter macOS
Der einfachste Weg ist die native App:
- Gehen Sie zu ollama.com/download und laden Sie die macOS-App herunter.
- Öffnen Sie die
.dmg-Dateiund ziehen Sie Ollama in den Ordner „Anwendungen“. - Starten Sie die Anwendung – Ollama läuft im Hintergrund, und der Befehl
ollamasteht anschließend in Ihrem Terminal zur Verfügung.
Sie bevorzugen die Kommandozeile? Verwenden Sie Homebrew:
installieren Sie Ollama über Homebrew mit „brew install ollama“
Auf Apple Silicon (M1–M5) nutzt Ollama seit Version 0.19 automatisch die GPU über Apples MLX-Backend, sodass Sie schnelle Inferenz ohne zusätzliche Konfiguration erhalten.
Installation unter Windows
Ollama läuft nativ unter Windows – Sie benötigen nicht mehr WSL:
- Laden Sie den Windows-Installer von ollama.com/download.
- Führen Sie die
.exeaus und folgen Sie den Anweisungen. - Öffnen PowerShell oder Eingabeaufforderung und geben Sie ein:
ollama --versionum zu bestätigen, dass die Installation erfolgreich war.
Falls Sie eine NVIDIA-GPU besitzen, erkennt Ollama diese automatisch und nutzt CUDA. Keine komplizierten Treiberanpassungen erforderlich – vorausgesetzt, Ihre GPU-Treiber sind aktuell.
Installation unter Linux
Ein einziger Befehl erledigt alles:
curl -fsSL https://ollama.com/install.sh | sh
Dies installiert Ollama und richtet es als systemd -Dienst ein, der beim Systemstart automatisch gestartet wird. Um zu überprüfen, ob der Dienst läuft:
systemctl status ollama
Unter Ubuntu und den meisten anderen Distributionen erkennt der Installer NVIDIA- und AMD-GPUs automatisch und konfiguriert das passende Backend. Für AMD-Grafikkarten stellen Sie bitte sicher, dass ROCm installiert ist – weitere Informationen finden Sie in unserem ausführlichen Vergleich „ ROCm vs. CUDA “, der den Stand der AMD-Unterstützung im Jahr 2026 darstellt.
Führen Sie Ihr erstes Modell aus
Nach der Installation von Ollama können Sie ein Modell mit einem einzigen Befehl herunterladen und ausführen:
ollama run gemma4
Beim ersten Aufruf wird das Modell (mehrere Gigabyte groß) heruntergeladen und anschließend wird eine Chat-Eingabeaufforderung geöffnet. Geben Sie eine Frage ein – erhalten Sie eine Antwort, vollständig lokal auf Ihrem Rechner. Einige nützliche Befehle:
ollama list– zeigt alle heruntergeladenen Modelle an.ollama pull qwen3– lädt ein Modell herunter, ohne es sofort auszuführen.ollama rm gemma4– löscht ein Modell, um Speicherplatz freizugeben.ollama ps– zeigt an, welche Modelle aktuell im Arbeitsspeicher geladen sind.
Unsicher, mit welchem Modell Sie beginnen sollen? Unser Leitfaden zu den besten lokalen LLMs für Ollama empfiehlt Modelle je nach Einsatzszenario und Hardware.
Überprüfen Sie, ob die API läuft
Ollama stellt eine REST-API auf Port 11434 bereit. Um zu prüfen, ob sie aktiv ist, führen Sie aus:
curl http://localhost:11434/api/tags
Eine JSON-Antwort mit Ihrer Modellliste bedeutet, dass alles korrekt funktioniert. Diese Schnittstelle nutzen auch Ihre eigenen Anwendungen – und da Ollama eine OpenAI-kompatible API bietet, funktioniert viel vorhandener Code bereits nach einer einfachen Änderung der Basis-URL.
Häufige Installationsprobleme und Lösungen
- „ollama: Befehl nicht gefunden“ (Mac/Linux): Die Anwendung wurde zwar installiert, befindet sich aber nicht im
PATH. Unter macOS stellen Sie sicher, dass die App mindestens einmal gestartet wurde; unter Linux öffnen Sie nach der Installation eine neue Shell. - Modell-Downloads sind langsam oder hängen fest: Ollama lädt große Dateien herunter; ein hängender Download löst sich meist durch erneutes Ausführen von
ollama pull <Modell>– der Vorgang wird fortgesetzt, statt von vorne zu beginnen. - GPU wird nicht genutzt: Prüfen Sie
ollama ps– zeigt die Ausgabe 100 % CPU-Auslastung an, so könnten Ihre GPU-Treiber veraltet sein oder das Modell zu groß für den verfügbaren VRAM sein und daher auf die CPU ausgelagert werden. Probieren Sie stattdessen ein kleineres oder stärker quantisiertes Modell aus. - „Out of memory“-Fehler: Das Modell ist größer als Ihr verfügbarer Arbeitsspeicher bzw. VRAM. Laden Sie stattdessen ein kleineres Quantisierungsformat herunter (achten Sie auf Varianten mit
q4) oder wählen Sie ein kleineres Modell. Unsere Leitfaden zu den Systemanforderungen Übersicht zeigt, welche Modelle auf welcher Hardware laufen. - Port 11434 ist bereits belegt: Eine andere Ollama-Instanz läuft bereits. Beenden Sie diese (
ollama psschließen Sie dann die App bzw. den Dienst), bevor Sie eine neue Instanz starten.
Konfigurieren Sie Ollama nach der Installation: Speicherplatz, Arbeitsspeicher und eine Benutzeroberfläche
Die Installation von Ollama ist der einfache Teil. Einige Einstellungen entscheiden darüber, ob Ollama im Hintergrund bleibt oder stillschweigend Festplattenspeicher und Arbeitsspeicher verbraucht. Alle diese Einstellungen erfolgen über Umgebungsvariablen; wo Sie diese setzen, hängt vom Betriebssystem ab: Unter macOS verwenden Sie launchctl setenv, unter Linux bearbeiten Sie den Dienst mittels systemctl edit ollama.service und fügen eine Zeile mit Environment= hinzu; unter Windows fügen Sie eine Benutzer-Umgebungsvariable über die Systemeinstellungen hinzu. Starten Sie Ollama nach jeder Änderung neu, damit diese wirksam wird.
Die vier wichtigsten Variablen lauten:
- OLLAMA_MODELS – legt fest, wo Modelle gespeichert werden. Modelle sind groß, und die Standardpfade liegen auf Ihrem Systemlaufwerk (
~/.ollama/modelsunter macOS,/usr/share/ollama/.ollama/modelsunter Linux,C:\Users\<Sie>\.ollama\modelsunter Windows). Weisen Sie diese Variable auf ein größeres oder schnelleres Laufwerk, bevor Sie mehrere Modelle herunterladen. Stellen Sie unter Linux sicher, dass der Benutzer „ollama“ Lese- und Schreibzugriff auf das neue Verzeichnis besitzt.ollamauser can read and write the new directory. - OLLAMA_KEEP_ALIVE – legt fest, wie lange ein Modell nach einer Anfrage im Arbeitsspeicher verbleibt. Der Standardwert beträgt fünf Minuten. Setzen Sie diesen Wert auf
-1um ein Modell dauerhaft im Arbeitsspeicher zu halten, sodass die erste Anfrage nie langsam ist, oder auf0um das Modell unverzüglich zu entladen und den VRAM sofort freizugeben, sobald Sie fertig sind. - OLLAMA_CONTEXT_LENGTH – definiert das Kontextfenster. Ollama verwendet standardmäßig konservativ 4096 Token, weshalb lange Dokumente stumm abgeschnitten werden. Erhöhen Sie diesen Wert (z. B. auf 8192 oder höher), falls Ihr Modell dies unterstützt, und kombinieren Sie dies mit OLLAMA_FLASH_ATTENTION=1 , um die zusätzlichen Speicherkosten gering zu halten.
- OLLAMA_HOST – legt fest, an welche Adresse der Server gebunden wird. Standardmäßig lauscht Ollama nur auf
127.0.0.1:11434, sodass kein anderes Gerät in Ihrem Netzwerk darauf zugreifen kann. Setzen Sie diesen Wert auf0.0.0.0:11434, um Ollama von einem anderen Rechner, einem Smartphone oder einem Docker-Container aus nutzen zu können.
Ein wichtiger Hinweis zu dieser letzten Einstellung: Die Ollama-API verfügt über keine integrierte Authentifizierung. Wenn Sie Ollama an 0.0.0.0 binden, kann jeder, der Zugriff auf Port 11434 hat, Modelle auf Ihrer Hardware ausführen. Führen Sie diesen Schritt daher ausschließlich in einem vertrauenswürdigen lokalen Netzwerk durch und schützen Sie den Zugriff gegebenenfalls durch einen Reverse-Proxy oder eine Firewall-Regel, falls der Rechner öffentlich erreichbar ist.
Abschließend: Die Kommandozeile eignet sich gut zum Testen, ist aber für den täglichen Einsatz mühsam. Die gängige Lösung hierfür ist Open WebUI, eine selbstgehostete, ChatGPT-ähnliche Oberfläche, die mit Ihrer lokalen Ollama-Instanz kommuniziert. Der schnellste Weg führt über Docker: Der Container stellt seinen Dienst intern auf Port 8080 bereit; mappen Sie diesen daher mit -p 3000:8080 auf einen Host-Port und rufen Sie http://localhost:3000im Browser auf. Konfigurieren Sie anschließend die Verbindung zu Ihrer Ollama-Instanz. Sie erhalten Chatverlauf, Modellumschaltung und Dokument-Uploads – alles vollständig auf Ihrem eigenen Rechner.
Häufig gestellte Fragen (FAQ)
Wie installiere ich Ollama unter Windows?
Laden Sie den nativen Installer von ollama.com/download herunter und führen Sie die .exe.exe aus. Ollama läuft nativ unter Windows – WSL ist nicht erforderlich – und nutzt bei Vorhandensein einer NVIDIA-GPU automatisch CUDA. Bestätigen Sie die Installation mit ollama --version ollama --version in PowerShell.
Wie installiere ich Ollama unter Linux?
Ausführen curl -fsSL https://ollama.com/install.sh | sh. Dadurch wird Ollama installiert und als systemd-Dienst registriert. Überprüfen Sie die Installation mit systemctl status ollama. Der Installer erkennt NVIDIA- und AMD-GPUs automatisch.
Kann ich Ollama über Homebrew installieren?
Ja – installieren Sie Ollama über Homebrew mit „brew install ollama“ funktioniert unter macOS. Die native App von ollama.com ist genauso gut und bietet zudem eine Anwesenheit in der Menüleiste; der Homebrew-Weg ist praktisch, wenn Sie sämtliche Software über die Kommandozeile verwalten.
Wo speichert Ollama Modelle?
Standardmäßig unter Mac und Linux im Verzeichnis ~/.ollama/models, unter Windows hingegen im Benutzerprofil. Modelle können mehrere Gigabyte groß sein; verwenden Sie daher ollama list um nachzuvollziehen, was Sie bereits heruntergeladen haben, und ollama rm <Modell> zum Aufräumen.
Ist die Installation von Ollama sicher?
Ja. Ollama ist Open-Source (MIT-lizenziert) und weit verbreitet. Für das Linux-One-Liner-Installations-Skript gilt die übliche Vorsicht: Es handelt sich um das offizielle Skript des Projekts; falls Sie dies bevorzugen, können Sie jedoch zuvor die Datei install.sh herunterladen und prüfen, bevor Sie sie ausführen.
Warum schneidet Ollama lange Eingaben oder Dokumente immer wieder ab?
Ollama verwendet standardmäßig ein Kontextfenster mit 4096 Token, unabhängig davon, wie viele Token das Modell tatsächlich verarbeiten kann; längere Eingaben werden daher ohne Warnung abgeschnitten. Erhöhen Sie diesen Wert, indem Sie den Server mit OLLAMA_CONTEXT_LENGTH auf einen höheren Wert (z. B. 8192 oder mehr) festlegen – allerdings höchstens bis zur vom Modell unterstützten Obergrenze. Ein größerer Kontext beansprucht mehr Arbeitsspeicher; aktivieren Sie daher OLLAMA_FLASH_ATTENTION=1 , um die zusätzliche Speicherlast auszugleichen, und achten Sie auf Ihren verfügbaren Arbeitsspeicher- oder VRAM-Puffer.
Wie greife ich von einem anderen Computer im Netzwerk auf Ollama zu?
Standardmäßig lauscht Ollama nur auf localhost und ist daher für andere Geräte unsichtbar. Legen Sie OLLAMA_HOST=0.0.0.0:11434 fest und starten Sie Ollama neu. Stellen Sie dann über die LAN-IP-Adresse des Host-Computers an Port 11434 eine Verbindung her. Beachten Sie, dass die API keine Authentifizierung bietet; stellen Sie Ollama daher ausschließlich in einem Netzwerk bereit, dem Sie vertrauen. Falls der Rechner von außerhalb Ihres Heim- oder Büro-Netzwerks erreichbar ist, verwenden Sie eine Firewall-Regel oder einen Reverse-Proxy.
Wie verhindere ich, dass Ollama das Modell bei jeder Anfrage neu lädt?
Diese Verzögerung entsteht durch das Entladen des Modells aus dem Arbeitsspeicher zwischen den Nutzungsvorgängen. Ollama hält ein Modell standardmäßig fünf Minuten lang im Speicher; setzen Sie OLLAMA_KEEP_ALIVE=-1 fest, um es dauerhaft im Arbeitsspeicher zu halten – so erfolgen Prompt-Antworten sofort. Der Nachteil ist, dass das Modell Ihren Arbeitsspeicher oder Ihre VRAM kontinuierlich belegt; verwenden Sie stattdessen 0 , falls Sie den Speicher unmittelbar nach Abschluss einer Anfrage wieder freigeben möchten.
Fazit
Auf jedem Betriebssystem ist die Installation von Ollama ein einfacher Download-und-Ausführen-Vorgang, der etwa zwei Minuten dauert – und Ihr erstes lokales Modell ist nur einen Befehl entfernt. Wählen Sie ein Modell, das zu Ihrer Hardware passt, stellen Sie sicher, dass die API auf Port 11434 antwortet, und schon läuft ein privater, kostenloser LLM auf Ihrem eigenen Rechner. Von hier aus können Sie erkunden, welche Modelle geeignet sind und wie viel Hardware jedes einzelne Modell benötigt.

