Saturday, 10 October 2026 | Updating Daily AI insight, written for builders

KI-Modelle vergleichen und die GPUs zu ihrer Ausführung (2026)

Convly ist der beste Ort, um KI-Modelle zusammen mit den GPUs, die sie ausführen, zu vergleichen. Unsere Modelldatenbank listet Parameter, Kontext und Live-API-Preise nebeneinander auf, während drei kostenlose Rechner den VRAM-Bedarf für jedes Modell, die API-Kosten pro Monat und ob Self-Hosting günstiger ist als Pay-per-Token schätzen – die Modell-plus-Hardware-Sicht, die bisher kein einzelnes Tool bot.

Die meisten Vergleichsseiten beantworten nur die halbe Frage. Benchmark-Ranglisten bewerten Modelle, sagen Ihnen aber nie, welche GPU sie brauchen; Hardware-Seiten listen GPUs auf, ordnen sie aber nie einem bestimmten Modell bei einer bestimmten Quantisierung zu. Diese Seite bringt beides in eine Tabelle und gibt Ihnen dann die Tools, um Ihre eigenen Zahlen einzutragen.

KI-Modelle gepaart mit der GPU zu ihrer Ausführung

Die folgende Tabelle paart etwa 12 beliebte Modelle mit ihrer ungefähren Parameterzahl, dem minimalen VRAM zu ihrer Ausführung bei 4-Bit-Quantisierung, einer empfohlenen Consumer-GPU und einem ungefähren API-Preis-Tier. Die VRAM-Zahlen folgen der Faustregel von etwa 0,5–0,6 GB pro Milliarde Parameter bei 4-Bit, plus 1–3 GB für den KV-Cache. Ein Gedankenstrich (—) bedeutet, dass das Modell nur über API verfügbar ist oder zu groß, um praktisch auf Consumer-Hardware zu laufen. Alle Preise stammen aus unserer Datenbank für KI-Modelle.

Modell Ca. Parameter Min. VRAM (4-Bit) Empfohlene Consumer-GPU API-Preis-Tier ($ / 1M ein→aus)
Mistral 7B 7B ~4–5 GB RTX 4060 (8 GB) Ultra-niedrig (0,02 $ → 0,03 $)
Llama 3.1 8B 8B ~5 GB RTX 4060 (8 GB) Ultra-niedrig (0,02 $ → 0,03 $)
Qwen3 14B 14B ~8–10 GB RTX 3060 (12 GB) Niedrig (0,12 $ → 0,24 $)
Gemma 3 27B 27B ~16–18 GB RTX 4090 (24 GB) Ultra-niedrig (0,08 $ → 0,16 $)
Qwen3 32B 32B ~20 GB RTX 4090 (24 GB) Niedrig (0,08 $ → 0,28 $)
Llama 3.3 70B 70B ~40–48 GB RTX 6000 Ada (48 GB) oder 2 × RTX 4090 Niedrig (0,10 $ → 0,32 $)
DeepSeek R1 Distill Llama 70B 70B ~40–48 GB RTX 6000 Ada (48 GB) Niedrig-mittel (0,80 $ → 0,80 $)
DeepSeek V4-Flash — (großes MoE) — — (in der Praxis nur API) Ultra-niedrig (0,14 $ → 0,28 $)
Claude Haiku 4.5 — — — (Cloud) Mittel (1,00 $ → 5,00 $)
Gemini 3.1 Pro — — — (Cloud) Mittel (2,00 $ → 12,00 $)
Claude Opus 4.8 — — — (Cloud) Premium (5,00 $ → 25,00 $)
GPT-5.5 — — — (Cloud) Premium (5,00 $ → 30,00 $)

Zwei Muster fallen auf. Erstens skalieren Open-Weight-Modelle auf Hardware, die die meisten Menschen bereits haben – ein 7–8B-Modell passt auf eine 8-GB-Karte, während ein 32B-Modell eine einzelne 24-GB RTX 4090 benötigt. Zweitens können Closed-Frontier-Modelle nur Token-weise gemietet werden, und die Preisunterschiede sind riesig: Unsere KI-Preis-Leistungs-Index gemessene eine 114-fache Kostenspanne über das Feld, von etwa 0,18 $ bis 20 $ pro 1M Token.

Drei kostenlose Tools, um Ihre eigenen Zahlen zu berechnen

Die Tabelle zeigt Ihnen die Form des Kompromisses. Diese drei Rechner helfen Ihnen, die genaue Antwort für Ihr Modell, Ihre Hardware und Ihr Volumen zu ermitteln.

1. LLM VRAM-Rechner

Wählen Sie eine Modellgröße (oder geben Sie eine benutzerdefinierte Parameterzahl ein), ein Quantisierungsniveau und eine Kontextlänge, und der LLM-VRAM-Rechner sagt Ihnen, wie viel GPU-Speicher das Modell benötigt, und ob es auf eine bestimmte Karte passt. Es ist der schnellste Weg, um zu überprüfen, „passt ein 32B-Modell auf meine RTX 4090?“, bevor Sie 20 GB Gewichte herunterladen.

2. KI-API-Kostenrechner

Wenn Sie lieber mieten als besitzen, geben Sie Ihr monatliches Input- und Output-Token-Volumen in den KI-API-Kostenrechner ein, und er schätzt Ihre monatliche Rechnung für jedes Modell, unter Verwendung von Preisen, die live aus unserer Modelldatenbank abgerufen werden. Es ist der schnellste Weg, um zu sehen, wie viel Sie sparen, wenn Sie von einem Premium-Modell wie GPT-5.5 zu einem Ultra-Niedrig-Tier wie DeepSeek V4-Flash wechseln.

3. Self-Hosting vs. API-Rechner

Die Kauf-versus-Miet-Entscheidung hängt vom Volumen ab. Der Self-Hosting vs API Rechner berücksichtigt Ihr Token-Volumen, GPU-Kaufpreis, Amortisationszeitraum, Stromtarif und Auslastungsstunden, dann zeigt er den Breakeven-Punkt, an dem der Besitz einer GPU günstiger ist als Pay-per-Token. Unter etwa 50M Token pro Monat gewinnt normalerweise Pay-per-Token-Preisgestaltung; eine gut ausgelastete eigene GPU zieht nur bei hohem, stetigem Volumen voran.

Häufig gestellte Fragen (FAQ)

Wie viel VRAM benötige ich, um ein 70B-Modell auszuführen?

Bei 4-Bit-Quantisierung benötigt ein 70B-Modell ungefähr 40–48 GB VRAM für die Gewichte, plus weitere 1–3 GB für den KV-Cache. In der Praxis bedeutet das eine einzelne 48-GB-Karte wie eine RTX 6000 Ada oder zwei 24-GB RTX 4090s parallel. Die Ausführung bei 8-Bit verdoppelt den Bedarf ungefähr. Verwenden Sie den VRAM-Rechner um Ihre genaue Kontextlänge zu überprüfen.

Ist Selbsthosting günstiger als die Nutzung einer API?

Unter etwa 50 Millionen Token pro Monat gewinnt Pay-per-Token-API-Preisgestaltung fast immer. Eine 2.000–2.500-Dollar-GPU, über drei Jahre amortisiert, mit Strom kostet etwa 85–130 Dollar pro Monat alles zusammen, daher lohnt es sich nur bei hohem, stetigem Volumen – wo eine gut ausgelastete eigene GPU die Inferenzkosten um bis zu etwa 5x senken kann. Tragen Sie Ihr eigenes Volumen in den Self-Hosting vs API Rechner um Ihren Break-Even-Punkt zu ermitteln.

Welche GPU ist 2026 am besten für lokale LLMs?

Für die meisten Menschen ist die RTX 4090 (24 GB) das Optimum – sie führt 32B-Modelle bei 4-Bit komfortabel aus und bewältigt lange Kontexte. Eine 8-GB RTX 4060 deckt 7–8B-Modelle ab, eine 12-GB RTX 3060 führt 8B-Modelle mit Puffer aus, und ein Upgrade auf ein 70B-Modell erfordert eine 48-GB-Karte. Ordnen Sie Ihr Zielmodell einer Karte mit dem VRAM-Rechner.

Was ist das billigste KI-Modell pro Token?

DeepSeek V4-Flash ist das billigste in unserer Datenbank mit 0,14 $ Input und 0,28 $ Output pro 1M Token (etwa 0,18 $ gemischt) – ungefähr 114-mal billiger als das teuerste Frontier-Modell und etwa 37-mal mehr Intelligenz pro Dollar als Claude Opus 4.8. Siehe die vollständige Rangliste in der KI-Preis-Leistungs-Index.


KI-Modell-Kontextfenster verglichen

Llama 4 Scout

10 Mio.

GPT-6 Luna

1,05 Mio.

GPT-6 Sol

1,05 Mio.

GPT-6 Astra

1,05 Mio.

GPT-5.6 Sol

1,05 Mio.

Gemini 3.1 Pro

1,05 Mio.

GPT-5.5

1,05 Mio.

Gemini 3.8 Flash

1 Mio.

Gemini 3.6 Flash

1 Mio.

Claude Sonnet 5

1 Mio.

Claude Opus 5

1 Mio.

Kimi K3

1 Mio.

Maximale Kontextlänge in Token, logarithmische Skala · Top 12 Modelle · Grün = größte. Aktualisiert 05. Oktober 2026.

🔍 Diese Grafik kostenlos auf Ihrer Website einbetten (mit Quellenangabe)

Scroll to Top