Tuesday, 18 August 2026 | Updating Daily AI insight, written for builders

Ollama-Modellliste (2026): Alle gängigen Modelle, Größen und RAM-Anforderungen

Aktualisiert · Erstmals veröffentlicht am 3. Juli 2026

Wenn Sie Modelle lokal ausführen, stammen die meisten davon aus der Ollama-Bibliothek – doch diese ändert sich ständig, und die Namen sind oft kryptisch. Dies ist ein praktischer Ollama-Modellliste für 2026: die Modelle, die tatsächlich lokal ausgeführt werden, deren Speicheranforderungen und Einsatzgebiete sowie Anleitungen zum Auflisten bereits installierter Modelle und zum Herunterladen neuer. Ollama lädt standardmäßig eine 4-Bit-quantisierte Version herunter, weshalb ein „70B“-Modell auf einem leistungsfähigen Workstation-PC Platz findet und ein „8B“-Modell sogar auf einem Laptop läuft. Die unten angegebenen Größen sind ungefähre Standardwerte – überprüfen Sie stets die Datenbank für KI-Modelle oder führen Sie ollama list aus, um den aktuellen Stand auf Ihrem Gerät zu ermitteln.

Schnellreferenz

  • Ausführung auf jedem Laptop (8 GB RAM): Llama 3.2 3B, Phi-3 Mini, Gemma 3 4B — small, fast, offline.
  • Bestes Allround-Modell (16 GB RAM): Llama 3.1 8B, Qwen 2.5 7B, Mistral 7B — the sweet spot for most people.
  • Hohe Qualität (32 GB+ / GPU): Gemma 2 27B, Qwen 2.5 32B, Mixtral 8x7B.
  • Nahe der Spitzenklasse (Workstation / 48 GB+): Llama 3.3 70B, DeepSeek-R1 70B.
  • Schlussfolgern: DeepSeek-R1 ist eine Distillation. Programmierung: Qwen 2.5 Coder, Code Llama. Vision: LLaVA. Embeddings: nomic-embed-text.
  • Die Regel: Wählen Sie anhand Ihres verfügbaren Arbeitsspeichers aus – prüfen Sie jedes Modell mit unserem kostenlosen VRAM-Rechner.

Key Facts

  • Jeder Laptop (8 GB RAM): Llama 3.2 3B, Phi-3 Mini, Gemma 3 4B
  • Der 16-GB-Sweet-Spot: Llama 3.1 8B, Qwen 2.5 7B, Mistral 7B
  • 32 GB+ / GPU: Gemma 2 27B, Qwen 2.5 32B, Mixtral 8x7B — Workstation mit 48 GB+: Llama 3.3 70B, DeepSeek-R1 70B
  • Ollama lädt standardmäßig 4-Bit-quantisierte Modelle herunter — deshalb passt ein „70B“-Modell problemlos auf eine leistungsfähige Workstation
  • Spezialisten: Qwen 2.5 Coder (Programmierung) · LLaVA (Vision) · nomic-embed-text (Embeddings) · DeepSeek-R1-Distillationen (Schlussfolgerung)

Die beliebtesten Ollama-Modelle im Überblick

Jedes der folgenden Modelle ist mit einem einfachen Befehl verfügbar: ollama pull <Name>„Download“ gibt die ungefähre Standardgröße im 4-Bit-Format (Q4) an; „Mindestspeicher“ bezeichnet die praktische Untergrenze des erforderlichen Systemspeichers (CPU) oder VRAMs (GPU), um das Modell komfortabel auszuführen. Die Parameteranzahlen sind exakt; Größenangaben sind Näherungswerte und können sich mit jeder neuen Version ändern.

ModellParameterDownload (Q4)MindestspeicherAm besten geeignet für
Llama 3.21B / 3B~1,3 / 2 GB4–8 GBEdge-Geräte, Smartphones, ultraleichte Chat-Anwendungen
Llama 3.18B~4,7 GB8–16 GBBestes Allround-Kleinmodell
Llama 3.370Bca. 43 GB48 GB+Nahe der Spitzenklasse stehendes offenes Modell
Gemma 31B / 4B~0,8 / 3,3 GB4–8 GBEffizientes Kleinmodell (Google)
Gemma 29B / 27B~5,4 / 16 GB12–32 GBAusgezeichnete Qualität pro Größe
Qwen 2.50,5B–72B~0,4–47 GB4 GB+Mehrsprachig, breites Größenspektrum
Qwen 2.5 Coder1,5B–32B~1–20 GB8 GB und mehrLokaler Programmierassistent
Mistral7B~4,1 GB8 GBSchnell und zuverlässig – Klassiker
Mistral Nemo12B~7 GB16 GBLanger Kontext mit 128k Token
Mixtral8×7Bca. 26 GB32 GB und mehrQualität von Mixture-of-Experts-Modellen
Phi-414Bca. 9 GB16 GBSchlussfolgern mit einem kleinen Modell
Phi-3 Mini3,8 Mrd.ca. 2,3 GB8 GBKlein, aber leistungsfähig
DeepSeek-R1 (Distill)1,5 Mrd. bis 70 Mrd.ca. 1,1–43 GB8 GB und mehrSchrittweises Schlussfolgern
LLaVA7B–34Bca. 4,7–20 GB8 GB und mehrVision (Bildverständnis)
nomic-embed-textca. 0,3 GB2 GBEmbeddings für RAG/Suche

Möchten Sie die Cloud-Modelle, mit denen diese Modelle hinsichtlich Preis und Geschwindigkeit verglichen werden, kennenlernen? Die Datenbank für KI-Modelle listet offene und geschlossene Modelle nebeneinander auf, und die KI-API-Kostenrechner zeigt, wann das lokale Ausführen kostengünstiger ist als die Bezahlung pro Token.

So listen Sie die installierten Ollama-Modelle auf

Um alle bereits auf Ihrem Rechner vorhandenen Modelle samt ihrer Größe und dem Zeitpunkt der letzten Nutzung anzuzeigen, führen Sie folgenden Befehl aus:

ollama list

Dieser Befehl gibt jeweils den Namen, das Tag, die eindeutige ID und die Größe jedes Modells aus. Um zu sehen, welche Modelle aktuell im Arbeitsspeicher geladen sind, verwenden Sie ollama ps; um ein nicht mehr benötigtes Modell zu entfernen und Speicherplatz freizugeben, nutzen Sie ollama rm <Name>. Diese drei Befehle – list, ps und rm – reichen vollständig aus, um Ihre lokale Modellsammlung zu verwalten.

So suchen und laden Sie neue Modelle aus der Bibliothek herunter

Der vollständige Katalog von Ollama befindet sich in seiner Online-Bibliothek; das Herunterladen eines beliebigen Modells erfolgt mit einem einzigen Befehl:

ollama pull llama3.1  oder führen Sie es direkt mit  ollama run llama3.1

aus. Modellnamen verwenden Tags zur Kennzeichnung von Größe und Variante – z. B. llama3.1:8b, gemma2:27b, qwen2.5:14b. Wenn Sie das Tag weglassen, lädt Ollama automatisch eine sinnvolle Standardvariante (meist die am häufigsten genutzte Größe mit 4-Bit-Quantisierung). Für die erste Installation finden Sie in unserem step-by-step Ollama install Anleitung Anleitungen für Mac, Windows und Linux.

Kleine Modelle – laufen auf nahezu jedem Laptop

Modelle mit 1 bis etwa 4 Milliarden Parametern laufen problemlos auf einem modernen Laptop mit 8 GB Arbeitsspeicher – ohne GPU. Llama 3.2 3B, Gemma 3 4B und Phi-3 Mini sind die herausragenden Vertreter: schnell, tatsächlich nützlich für Zusammenfassungen, Textentwürfe und einfache Fragen sowie klein genug, um ständig im Arbeitsspeicher gehalten zu werden. Sie erreichen zwar nicht die Leistungsfähigkeit modernster Cloud-Modelle, eignen sich jedoch hervorragend für private, offline durchgeführte Alltagsaufgaben – und sind der ideale Einstiegspunkt für Einsteiger in die Welt der lokalen KI.

Mittlere Modelle – der 16-GB-Sweet-Spot

Die Klasse der 7B–14B-Modelle ist der Bereich, in dem die meisten Nutzer ihre Heimat finden sollten. Llama 3.1 8B, Qwen 2.5 7B und Mistral 7B bieten einen deutlichen Sprung bei Kohärenz gegenüber den kleineren Modellen, passen aber nach wie vor bequem in 16 GB RAM oder eine gängige GPU. Phi-4 und Mistral Nemo steigern Qualität und Kontextlänge weiter. Wenn Sie ein universell einsetzbares Modell suchen, wählen Sie aus dieser Zeile – hier liegt das beste Verhältnis von Leistungsfähigkeit und Hardware-Anforderung.

Große Modelle – Bereich Workstation und GPU

Ab 27B Parametern betreten Sie den Bereich ernsthafter Hardware-Anforderungen. Gemma 2 27B und Qwen 2.5 32B erfordert 32 GB oder mehr; Mixtral 8x7B sowie Modelle der 70B-Klasse – Llama 3.3 70B und das DeepSeek-R1 70B (Distill) – benötigen 48 GB oder mehr schnellen Arbeitsspeicher, was in der Praxis entweder eine GPU mit hohem VRAM oder einen Apple-Silicon-Mac mit viel Arbeitsspeicher bedeutet. Der Gewinn ist eine Qualität, die den großen Cloud-Modellen nahekommt – vollständig auf Ihrem eigenen Rechner ausgeführt. Weitere Informationen dazu finden Sie in unserem Beste GPUs für KI-Anwendungen Leitfaden zu den tatsächlich kompatiblen Systemen.

Spezialisierte Modelle: Programmierung, Vision und Embeddings

Neben allgemeinen Chat-Modellen bietet Ollama auch auf spezifische Aufgaben zugeschnittene Modelle an. Qwen 2.5 Coder und Code Llama sind für die Programmierung konzipiert und arbeiten gut mit lokalen IDE-Tools zusammen. LLaVA erweitert das Modell um Sehfähigkeit, sodass es Bilder beschreiben oder über sie schlussfolgern kann. Und Embedding-Modelle wie nomic-embed-text und mxbai-embed-large unterhalten sich überhaupt nicht – sie wandeln Text in Vektoren für die Suche und die retrieval-augmented generation (RAG) um, die Grundlage einer lokalen RAG-Infrastruktur.

Welches Ollama-Modell sollten Sie tatsächlich verwenden?

Die ehrliche Antwort lautet: das größte Modell, das Ihr Arbeitsspeicher in der gewünschten Klasse aufnehmen kann. Für den allgemeinen Einsatz beginnen Sie mit einem 8B-Modell und steigen nur dann auf ein größeres Modell auf, wenn die Qualität unzureichend ist. Für Schlussfolgerungsaufgaben probieren Sie eine DeepSeek-R1-Distillation aus; für Programmieraufgaben Qwen 2.5 Coder; für Bildverarbeitung LLaVA. Wir bewerten die besten Modelle nach Anwendungsfall in den besten lokalen LLMs für Ollama, und vergleichen Ollama selbst mit den Alternativen in Ollama im Vergleich zu LM Studio vs. vLLM vs. llama.cpp.

Prüfen Sie vor dem Download, ob ein Modell auf Ihr System passt

Der häufigste Fehler besteht darin, ein Modell herunterzuladen, das zu groß für Ihre Maschine ist – es wird entweder gar nicht geladen oder läuft extrem langsam, weil es auf die Festplatte auslagert. Bevor Sie ein Modell herunterladen, prüfen Sie dessen Speicherbedarf: Als grobe Faustregel benötigt ein 4-Bit-Modell knapp unter 1 GB Arbeitsspeicher pro Milliarde Parameter zuzüglich Puffer für den Kontext. Unser kostenloser VRAM-Rechner berechnet die exakte Speicheranforderung für jedes Modell und jede Quantisierungsstufe, und Systemanforderungen von Ollama erläutern ausführlich den Kompromiss zwischen Arbeitsspeicher (RAM) und Grafikspeicher (VRAM).

Häufig gestellte Fragen

Wie liste ich die in Ollama installierten Modelle auf? Ausführen ollama list um alle installierten Modelle mit ihrer jeweiligen Größe anzuzeigen, ollama ps um das aktuell geladene Modell anzuzeigen, und ollama rm <Name> um ein Modell zu löschen.

Welches ist das beste Ollama-Modell? Es gibt kein einziges „bestes“ Modell – die Wahl hängt von Ihrem verfügbaren Arbeitsspeicher ab. Llama 3.1 8B ist die beste Allround-Wahl für Rechner mit 16 GB RAM; weitere Empfehlungen nach Anwendungsfall finden Sie in unserer Rangliste .

Wie viele Modelle bietet Ollama an? Hunderte Modelle aus den Bereichen Chat, Programmierung, Vision und Embeddings, jeweils in mehreren Größen. Die obige Tabelle enthält diejenigen Modelle, die von den meisten Nutzern tatsächlich eingesetzt werden.

Wie viel Arbeitsspeicher benötige ich zum Ausführen von Ollama-Modellen? Mit 8 GB RAM können kleine Modelle (1B–4B) ausgeführt werden, mit 16 GB RAM laufen die gängigen Modelle der 7B–8B-Klasse, während für Modelle ab 27B Parameter mindestens 32 GB RAM oder eine GPU erforderlich sind. Überprüfen Sie jeden Modellbedarf mit unserem VRAM-Rechner.

Kann ich diese Modelle offline betreiben? Ja – sobald ein Ollama-Modell einmal heruntergeladen wurde, läuft es vollständig lokal auf Ihrem Gerät ohne Internetverbindung. Genau dies ist der Hauptgrund, lokale Modelle zu nutzen.

Das Fazit

Die Liste der Ollama-Modelle ist lang, doch die Auswahl ist einfach: Entscheiden Sie zunächst, wofür Sie das Modell benötigen – allgemeine Unterhaltung, logisches Schließen, Programmierung, Bildverarbeitung oder Embeddings – und wählen Sie dann das größtmögliche Modell aus dieser Kategorie, das Ihr Arbeitsspeicher aufnehmen kann. Beginnen Sie mit einem 8B-Modell, nutzen Sie ollama list zur Übersicht über Ihre installierten Modelle und konsultieren Sie vor jedem Download VRAM-Rechner , um sicherzustellen, dass Sie kein Modell herunterladen, das Ihre Maschine nicht ausführen kann. Ab diesem Punkt ist der Betrieb leistungsfähiger KI lokal und privat nur noch wenige Befehle entfernt.

Modellnamen, -größen und -verfügbarkeit ändern sich häufig; die angegebenen Werte sind ungefähre Standardwerte, gültig ab Mitte 2026 – überprüfen Sie diese daher stets mit ollama list und der offiziellen Bibliothek, bevor Sie sich darauf verlassen.

Verfasst von Mustafa Ihsan

Mustafa Ihsan ist Gründer und Chefredakteur von Convly.ai. Er entwickelte und pflegt die Live-Datenbank für KI-Modelle der Website, ihren Preis-Leistungs-Index sowie kostenlose Rechner für VRAM-Anforderungen, API-Kosten und Wirtschaftlichkeit des Self-Hostings. Er schreibt über Modellpreise, Benchmark-Ergebnisse und die Hardware, die zum lokalen Betrieb von KI-Modellen erforderlich ist, und bevorzugt stets messbare Zahlen gegenüber Herstellerangaben.

Scroll to Top
Featured on There's An AI For That