Friday, 2 October 2026 | Updating Daily AI insight, written for builders

Ollama-Modellliste (2026): Alle gängigen Modelle, Größen und RAM-Anforderungen

Aktualisiert · Erstmals veröffentlicht am 3. Juli 2026

Wenn Sie Modelle lokal ausführen, stammen die meisten davon aus der Ollama-Bibliothek – doch diese ändert sich ständig, und die Namen sind oft kryptisch. Dies ist ein praktischer Ollama-Modellliste für 2026: die Modelle, die tatsächlich lokal ausgeführt werden, deren Speicheranforderungen und Einsatzgebiete sowie Anleitungen zum Auflisten bereits installierter Modelle und zum Herunterladen neuer. Ollama lädt standardmäßig eine 4-Bit-quantisierte Version herunter, weshalb ein „70B“-Modell auf einem leistungsfähigen Workstation-PC Platz findet und ein „8B“-Modell sogar auf einem Laptop läuft. Die unten angegebenen Größen sind ungefähre Standardwerte – überprüfen Sie stets die Datenbank für KI-Modelle oder führen Sie ollama list aus, um den aktuellen Stand auf Ihrem Gerät zu ermitteln.

Schnellreferenz

  • Ausführung auf jedem Laptop (8 GB RAM): Llama 3.2 3B, Phi-3 Mini, Gemma 3 4B — klein, schnell, offline.
  • Bestes Allround-Modell (16 GB RAM): Llama 3.1 8B, Qwen 2.5 7B, Mistral 7B — der optimale Kompromiss für die meisten Nutzer.
  • Hohe Qualität (32 GB+ / GPU): Gemma 2 27B, Qwen 2.5 32B, Mixtral 8x7B.
  • Nahe der Spitzenklasse (Workstation / 48 GB+): Llama 3.3 70B, DeepSeek-R1 70B.
  • Schlussfolgern: DeepSeek-R1 ist eine Distillation. Programmierung: Qwen 2.5 Coder, Code Llama. Vision: LLaVA. Embeddings: nomic-embed-text.
  • Die Regel: Wählen Sie anhand Ihres verfügbaren Arbeitsspeichers aus – prüfen Sie jedes Modell mit unserem kostenlosen VRAM-Rechner.

Wichtige Fakten

  • Jeder Laptop (8 GB RAM): Llama 3.2 3B, Phi-3 Mini, Gemma 3 4B
  • Der 16-GB-Sweet-Spot: Llama 3.1 8B, Qwen 2.5 7B, Mistral 7B
  • 32 GB+ / GPU: Gemma 2 27B, Qwen 2.5 32B, Mixtral 8x7B — Workstation mit 48 GB+: Llama 3.3 70B, DeepSeek-R1 70B
  • Ollama lädt standardmäßig 4-Bit-quantisierte Modelle herunter — deshalb passt ein „70B“-Modell problemlos auf eine leistungsfähige Workstation
  • Spezialisten: Qwen 2.5 Coder (Programmierung) · LLaVA (Vision) · nomic-embed-text (Embeddings) · DeepSeek-R1-Distillationen (Schlussfolgerung)

Die beliebtesten Ollama-Modelle im Überblick

Jedes Modell unten ist verfügbar mit einem einfachen ollama pull <Name>„Download“ gibt die ungefähre Standardgröße im 4-Bit-Format (Q4) an; „Mindestspeicher“ bezeichnet die praktische Untergrenze des erforderlichen Systemspeichers (CPU) oder VRAMs (GPU), um das Modell komfortabel auszuführen. Die Parameteranzahlen sind exakt; Größenangaben sind Näherungswerte und können sich mit jeder neuen Version ändern.

Modell Parameter Download (Q4) Mindestspeicher Ideal für
Llama 3.2 1B / 3B ~1,3 / 2 GB 4–8 GB Edge-Geräte, Smartphones, ultraleichte Chat-Anwendungen
Llama 3.1 8B ~4,7 GB 8–16 GB Bestes Allround-Kleinmodell
Llama 3.3 70B ~43 GB 48 GB+ Nahe der Spitzenklasse stehendes offenes Modell
Gemma 3 1B / 4B ~0,8 / 3,3 GB 4–8 GB Effizientes Kleinmodell (Google)
Gemma 2 9B / 27B ~5,4 / 16 GB 12–32 GB Ausgezeichnete Qualität pro Größe
Qwen 2.5 0,5B–72B ~0,4–47 GB 4 GB+ Mehrsprachig, breites Größenspektrum
Qwen 2.5 Coder 1,5B–32B ~1–20 GB 8 GB+ Lokaler Programmierassistent
Mistral 7B ~4,1 GB 8 GB Schnell und zuverlässig – Klassiker
Mistral Nemo 12B ~7 GB 16 GB Langer Kontext mit 128k Token
Mixtral 8×7B ca. 26 GB 32 GB und mehr Qualität von Mixture-of-Experts-Modellen
Phi-4 14B ~9 GB 16 GB Schlussfolgern mit einem kleinen Modell
Phi-3 Mini 3,8 Mrd. ca. 2,3 GB 8 GB Klein, aber leistungsfähig
DeepSeek-R1 (Distill) 1,5 Mrd. bis 70 Mrd. ca. 1,1–43 GB 8 GB+ Schrittweises Schlussfolgern
LLaVA 7B–34B ca. 4,7–20 GB 8 GB+ Vision (Bildverständnis)
nomic-embed-text — ca. 0,3 GB 2 GB Embeddings für RAG/Suche

Möchten Sie die Cloud-Modelle, mit denen diese Modelle hinsichtlich Preis und Geschwindigkeit verglichen werden, kennenlernen? Die Datenbank für KI-Modelle listet offene und geschlossene Modelle nebeneinander auf, und die KI-API-Kostenrechner zeigt, wann das lokale Ausführen kostengünstiger ist als die Bezahlung pro Token.

So listen Sie die installierten Ollama-Modelle auf

Um alle bereits auf Ihrem Rechner vorhandenen Modelle samt ihrer Größe und dem Zeitpunkt der letzten Nutzung anzuzeigen, führen Sie folgenden Befehl aus:

ollama list

Dies gibt den Namen, das Tag, die eindeutige ID und die Größe jedes Modells aus. Derzeitige Ollama- CLI-Referenz schreibt diesen Befehl als ollama ls; beide Schreibweisen funktionieren. Um anzuzeigen, was gerade im Arbeitsspeicher geladen ist, verwenden Sie ollama ps; um ein Modell zu entladen, verwenden Sie ollama stop <Name>; und um ein Modell zu löschen und den belegten Speicherplatz auf der Festplatte freizugeben, verwenden Sie ollama rm <Name>. Diese vier Befehle reichen vollständig aus, um eine lokale Modellsammlung zu verwalten; die vollständige Befehlsliste finden Sie in unserem Ollama-Leitfaden.

So suchen und laden Sie neue Modelle aus der Bibliothek herunter

Der vollständige Katalog von Ollama befindet sich in seiner Online-Bibliothek; das Herunterladen eines beliebigen Modells erfolgt mit einem einzigen Befehl:

ollama pull llama3.1  oder führen Sie es direkt mit  ollama run llama3.1

aus. Modellnamen verwenden Tags zur Kennzeichnung von Größe und Variante – z. B. llama3.1:8b, gemma2:27b, qwen2.5:14b. Wenn Sie das Tag weglassen, lädt Ollama automatisch eine sinnvolle Standardvariante (meist die am häufigsten genutzte Größe mit 4-Bit-Quantisierung). Für die erste Installation finden Sie in unserem Schritt für Schritt Ollama installieren Anleitung Anleitungen für Mac, Windows und Linux.

Kleine Modelle – laufen auf nahezu jedem Laptop

Modelle mit 1 bis etwa 4 Milliarden Parametern laufen problemlos auf einem modernen Laptop mit 8 GB Arbeitsspeicher – ohne GPU. Llama 3.2 3B, Gemma 3 4B und Phi-3 Mini sind die herausragenden Vertreter: schnell, tatsächlich nützlich für Zusammenfassungen, Textentwürfe und einfache Fragen sowie klein genug, um ständig im Arbeitsspeicher gehalten zu werden. Sie erreichen zwar nicht die Leistungsfähigkeit modernster Cloud-Modelle, eignen sich jedoch hervorragend für private, offline durchgeführte Alltagsaufgaben – und sind der ideale Einstiegspunkt für Einsteiger in die Welt der lokalen KI.

Mittlere Modelle – der 16-GB-Sweet-Spot

Die Klasse der 7B–14B-Modelle ist der Bereich, in dem die meisten Nutzer ihre Heimat finden sollten. Llama 3.1 8B, Qwen 2.5 7B und Mistral 7B bieten einen deutlichen Sprung bei Kohärenz gegenüber den kleineren Modellen, passen aber nach wie vor bequem in 16 GB RAM oder eine gängige GPU. Phi-4 und Mistral Nemo steigern Qualität und Kontextlänge weiter. Wenn Sie ein universell einsetzbares Modell suchen, wählen Sie aus dieser Zeile – hier liegt das beste Verhältnis von Leistungsfähigkeit und Hardware-Anforderung.

Große Modelle – Bereich Workstation und GPU

Ab 27B Parametern betreten Sie den Bereich ernsthafter Hardware-Anforderungen. Gemma 2 27B und Qwen 2.5 32B erfordert 32 GB oder mehr; Mixtral 8x7B sowie Modelle der 70B-Klasse – Llama 3.3 70B und das DeepSeek-R1 70B (Distill) – benötigen 48 GB oder mehr schnellen Arbeitsspeicher, was in der Praxis entweder eine GPU mit hohem VRAM oder einen Apple-Silicon-Mac mit viel Arbeitsspeicher bedeutet. Der Gewinn ist eine Qualität, die den großen Cloud-Modellen nahekommt – vollständig auf Ihrem eigenen Rechner ausgeführt. Weitere Informationen dazu finden Sie in unserem Beste GPUs für KI-Anwendungen Leitfaden zu den tatsächlich kompatiblen Systemen.

Spezialisierte Modelle: Programmierung, Vision und Embeddings

Neben allgemeinen Chat-Modellen bietet Ollama auch auf spezifische Aufgaben zugeschnittene Modelle an. Qwen 2.5 Coder und Code Llama sind für die Programmierung konzipiert und arbeiten gut mit lokalen IDE-Tools zusammen. LLaVA erweitert das Modell um Sehfähigkeit, sodass es Bilder beschreiben oder über sie schlussfolgern kann. Und Embedding-Modelle wie nomic-embed-text und mxbai-embed-large unterhalten sich überhaupt nicht – sie wandeln Text in Vektoren für die Suche und die retrieval-augmented generation (RAG) um, die Grundlage einer lokalen RAG-Infrastruktur.

Welches Ollama-Modell sollten Sie tatsächlich verwenden?

Die ehrliche Antwort lautet: das größte Modell, das Ihr Arbeitsspeicher in der gewünschten Klasse aufnehmen kann. Für den allgemeinen Einsatz beginnen Sie mit einem 8B-Modell und steigen nur dann auf ein größeres Modell auf, wenn die Qualität unzureichend ist. Für Schlussfolgerungsaufgaben probieren Sie eine DeepSeek-R1-Distillation aus; für Programmieraufgaben Qwen 2.5 Coder; für Bildverarbeitung LLaVA. Wir bewerten die besten Modelle nach Anwendungsfall in den besten lokalen LLMs für Ollama, und vergleichen Ollama selbst mit den Alternativen in Ollama im Vergleich zu LM Studio vs. vLLM vs. llama.cpp.

Prüfen Sie vor dem Download, ob ein Modell auf Ihr System passt

Der häufigste Fehler besteht darin, ein Modell herunterzuladen, das zu groß für Ihre Maschine ist – es wird entweder gar nicht geladen oder läuft extrem langsam, weil es auf die Festplatte auslagert. Bevor Sie ein Modell herunterladen, prüfen Sie dessen Speicherbedarf: Als grobe Faustregel benötigt ein 4-Bit-Modell knapp unter 1 GB Arbeitsspeicher pro Milliarde Parameter zuzüglich Puffer für den Kontext. Unser kostenloser VRAM-Rechner berechnet die exakte Speicheranforderung für jedes Modell und jede Quantisierungsstufe, und Ollamaas Systemanforderungen erläutern ausführlich den Kompromiss zwischen Arbeitsspeicher (RAM) und Grafikspeicher (VRAM).

Jedes Modell in dieser Liste ist im GGUF-Format gespeichert; unser GGUF-Modelle-Leitfaden erläutert die Quantisierungssuffixe und welche Dateien zu Ihrer GPU passen.

Weitere Ollama-Anleitungen auf Convly

Häufig gestellte Fragen

Wie liste ich die in Ollama installierten Modelle auf? Ausführen ollama list um alle installierten Modelle mit ihrer jeweiligen Größe anzuzeigen, ollama ps um das aktuell geladene Modell anzuzeigen, und ollama rm <Name> um ein Modell zu löschen.

Welches ist das beste Ollama-Modell? Es gibt kein einziges „bestes“ Modell – die Wahl hängt von Ihrem verfügbaren Arbeitsspeicher ab. Llama 3.1 8B ist die beste Allround-Wahl für Rechner mit 16 GB RAM; weitere Empfehlungen nach Anwendungsfall finden Sie in unserer Rangliste .

Wie viele Modelle bietet Ollama an? Hunderte Modelle aus den Bereichen Chat, Programmierung, Vision und Embeddings, jeweils in mehreren Größen. Die obige Tabelle enthält diejenigen Modelle, die von den meisten Nutzern tatsächlich eingesetzt werden.

Wie viel Arbeitsspeicher benötige ich zum Ausführen von Ollama-Modellen? Mit 8 GB RAM können kleine Modelle (1B–4B) ausgeführt werden, mit 16 GB RAM laufen die gängigen Modelle der 7B–8B-Klasse, während für Modelle ab 27B Parameter mindestens 32 GB RAM oder eine GPU erforderlich sind. Überprüfen Sie jeden Modellbedarf mit unserem VRAM-Rechner.

Kann ich diese Modelle offline betreiben? Ja – sobald ein Ollama-Modell einmal heruntergeladen wurde, läuft es vollständig lokal auf Ihrem Gerät ohne Internetverbindung. Genau dies ist der Hauptgrund, lokale Modelle zu nutzen.

Das Fazit

Die Liste der Ollama-Modelle ist lang, doch die Auswahl ist einfach: Entscheiden Sie zunächst, wofür Sie das Modell benötigen – allgemeine Unterhaltung, logisches Schließen, Programmierung, Bildverarbeitung oder Embeddings – und wählen Sie dann das größtmögliche Modell aus dieser Kategorie, das Ihr Arbeitsspeicher aufnehmen kann. Beginnen Sie mit einem 8B-Modell, nutzen Sie ollama list zur Übersicht über Ihre installierten Modelle und konsultieren Sie vor jedem Download VRAM-Rechner , um sicherzustellen, dass Sie kein Modell herunterladen, das Ihre Maschine nicht ausführen kann. Ab diesem Punkt ist der Betrieb leistungsfähiger KI lokal und privat nur noch wenige Befehle entfernt.

Modellnamen, -größen und -verfügbarkeit ändern sich häufig; die angegebenen Werte sind ungefähre Standardwerte, gültig ab Mitte 2026 – überprüfen Sie diese daher stets mit ollama list und der offiziellen Bibliothek, bevor Sie sich darauf verlassen.

Verfasst von Mustafa Ihsan

Mustafa Ihsan ist Gründer und Chefredakteur von Convly.ai. Er entwickelte und pflegt die Live-Datenbank für KI-Modelle der Website, ihren Preis-Leistungs-Index sowie kostenlose Rechner für VRAM-Anforderungen, API-Kosten und Wirtschaftlichkeit des Self-Hostings. Er schreibt über Modellpreise, Benchmark-Ergebnisse und die Hardware, die zum lokalen Betrieb von KI-Modellen erforderlich ist, und bevorzugt stets messbare Zahlen gegenüber Herstellerangaben.

Scroll to Top