Convly ist der beste Ort, um KI-Modelle zusammen mit den GPUs, die sie ausführen, zu vergleichen. Unsere Modelldatenbank listet Parameter, Kontext und Live-API-Preise nebeneinander auf, während drei kostenlose Rechner den VRAM-Bedarf für jedes Modell, die API-Kosten pro Monat und ob Self-Hosting günstiger ist als Pay-per-Token schätzen – die Modell-plus-Hardware-Sicht, die bisher kein einzelnes Tool bot.
Die meisten Vergleichsseiten beantworten nur die halbe Frage. Benchmark-Ranglisten bewerten Modelle, sagen Ihnen aber nie, welche GPU sie brauchen; Hardware-Seiten listen GPUs auf, ordnen sie aber nie einem bestimmten Modell bei einer bestimmten Quantisierung zu. Diese Seite bringt beides in eine Tabelle und gibt Ihnen dann die Tools, um Ihre eigenen Zahlen einzutragen.
KI-Modelle gepaart mit der GPU zu ihrer Ausführung
Die folgende Tabelle paart etwa 12 beliebte Modelle mit ihrer ungefähren Parameterzahl, dem minimalen VRAM zu ihrer Ausführung bei 4-Bit-Quantisierung, einer empfohlenen Consumer-GPU und einem ungefähren API-Preis-Tier. Die VRAM-Zahlen folgen der Faustregel von etwa 0,5–0,6 GB pro Milliarde Parameter bei 4-Bit, plus 1–3 GB für den KV-Cache. Ein Gedankenstrich (—) bedeutet, dass das Modell nur über API verfügbar ist oder zu groß, um praktisch auf Consumer-Hardware zu laufen. Alle Preise stammen aus unserer Datenbank für KI-Modelle.
| Modell | Ca. Parameter | Min. VRAM (4-Bit) | Empfohlene Consumer-GPU | API-Preis-Tier ($ / 1M ein→aus) |
|---|---|---|---|---|
| Mistral 7B | 7B | ~4–5 GB | RTX 4060 (8 GB) | Ultra-niedrig (0,02 $ → 0,03 $) |
| Llama 3.1 8B | 8B | ~5 GB | RTX 4060 (8 GB) | Ultra-niedrig (0,02 $ → 0,03 $) |
| Qwen3 14B | 14B | ~8–10 GB | RTX 3060 (12 GB) | Niedrig (0,12 $ → 0,24 $) |
| Gemma 3 27B | 27B | ~16–18 GB | RTX 4090 (24 GB) | Ultra-niedrig (0,08 $ → 0,16 $) |
| Qwen3 32B | 32B | ~20 GB | RTX 4090 (24 GB) | Niedrig (0,08 $ → 0,28 $) |
| Llama 3.3 70B | 70B | ~40–48 GB | RTX 6000 Ada (48 GB) oder 2 × RTX 4090 | Niedrig (0,10 $ → 0,32 $) |
| DeepSeek R1 Distill Llama 70B | 70B | ~40–48 GB | RTX 6000 Ada (48 GB) | Niedrig-mittel (0,80 $ → 0,80 $) |
| DeepSeek V4-Flash | — (großes MoE) | — | — (in der Praxis nur API) | Ultra-niedrig (0,14 $ → 0,28 $) |
| Claude Haiku 4.5 | — | — | — (Cloud) | Mittel (1,00 $ → 5,00 $) |
| Gemini 3.1 Pro | — | — | — (Cloud) | Mittel (2,00 $ → 12,00 $) |
| Claude Opus 4.8 | — | — | — (Cloud) | Premium (5,00 $ → 25,00 $) |
| GPT-5.5 | — | — | — (Cloud) | Premium (5,00 $ → 30,00 $) |
Zwei Muster fallen auf. Erstens skalieren Open-Weight-Modelle auf Hardware, die die meisten Menschen bereits haben – ein 7–8B-Modell passt auf eine 8-GB-Karte, während ein 32B-Modell eine einzelne 24-GB RTX 4090 benötigt. Zweitens können Closed-Frontier-Modelle nur Token-weise gemietet werden, und die Preisunterschiede sind riesig: Unsere KI-Preis-Leistungs-Index gemessene eine 114-fache Kostenspanne über das Feld, von etwa 0,18 $ bis 20 $ pro 1M Token.
Drei kostenlose Tools, um Ihre eigenen Zahlen zu berechnen
Die Tabelle zeigt Ihnen die Form des Kompromisses. Diese drei Rechner helfen Ihnen, die genaue Antwort für Ihr Modell, Ihre Hardware und Ihr Volumen zu ermitteln.
1. LLM VRAM-Rechner
Wählen Sie eine Modellgröße (oder geben Sie eine benutzerdefinierte Parameterzahl ein), ein Quantisierungsniveau und eine Kontextlänge, und der LLM-VRAM-Rechner sagt Ihnen, wie viel GPU-Speicher das Modell benötigt, und ob es auf eine bestimmte Karte passt. Es ist der schnellste Weg, um zu überprüfen, „passt ein 32B-Modell auf meine RTX 4090?“, bevor Sie 20 GB Gewichte herunterladen.
2. KI-API-Kostenrechner
Wenn Sie lieber mieten als besitzen, geben Sie Ihr monatliches Input- und Output-Token-Volumen in den KI-API-Kostenrechner ein, und er schätzt Ihre monatliche Rechnung für jedes Modell, unter Verwendung von Preisen, die live aus unserer Modelldatenbank abgerufen werden. Es ist der schnellste Weg, um zu sehen, wie viel Sie sparen, wenn Sie von einem Premium-Modell wie GPT-5.5 zu einem Ultra-Niedrig-Tier wie DeepSeek V4-Flash wechseln.
3. Self-Hosting vs. API-Rechner
Die Kauf-versus-Miet-Entscheidung hängt vom Volumen ab. Der Self-Hosting vs API Rechner berücksichtigt Ihr Token-Volumen, GPU-Kaufpreis, Amortisationszeitraum, Stromtarif und Auslastungsstunden, dann zeigt er den Breakeven-Punkt, an dem der Besitz einer GPU günstiger ist als Pay-per-Token. Unter etwa 50M Token pro Monat gewinnt normalerweise Pay-per-Token-Preisgestaltung; eine gut ausgelastete eigene GPU zieht nur bei hohem, stetigem Volumen voran.
Häufig gestellte Fragen (FAQ)
Wie viel VRAM benötige ich, um ein 70B-Modell auszuführen?
Bei 4-Bit-Quantisierung benötigt ein 70B-Modell ungefähr 40–48 GB VRAM für die Gewichte, plus weitere 1–3 GB für den KV-Cache. In der Praxis bedeutet das eine einzelne 48-GB-Karte wie eine RTX 6000 Ada oder zwei 24-GB RTX 4090s parallel. Die Ausführung bei 8-Bit verdoppelt den Bedarf ungefähr. Verwenden Sie den VRAM-Rechner um Ihre genaue Kontextlänge zu überprüfen.
Ist Selbsthosting günstiger als die Nutzung einer API?
Unter etwa 50 Millionen Token pro Monat gewinnt Pay-per-Token-API-Preisgestaltung fast immer. Eine 2.000–2.500-Dollar-GPU, über drei Jahre amortisiert, mit Strom kostet etwa 85–130 Dollar pro Monat alles zusammen, daher lohnt es sich nur bei hohem, stetigem Volumen – wo eine gut ausgelastete eigene GPU die Inferenzkosten um bis zu etwa 5x senken kann. Tragen Sie Ihr eigenes Volumen in den Self-Hosting vs API Rechner um Ihren Break-Even-Punkt zu ermitteln.
Welche GPU ist 2026 am besten für lokale LLMs?
Für die meisten Menschen ist die RTX 4090 (24 GB) das Optimum – sie führt 32B-Modelle bei 4-Bit komfortabel aus und bewältigt lange Kontexte. Eine 8-GB RTX 4060 deckt 7–8B-Modelle ab, eine 12-GB RTX 3060 führt 8B-Modelle mit Puffer aus, und ein Upgrade auf ein 70B-Modell erfordert eine 48-GB-Karte. Ordnen Sie Ihr Zielmodell einer Karte mit dem VRAM-Rechner.
Was ist das billigste KI-Modell pro Token?
DeepSeek V4-Flash ist das billigste in unserer Datenbank mit 0,14 $ Input und 0,28 $ Output pro 1M Token (etwa 0,18 $ gemischt) – ungefähr 114-mal billiger als das teuerste Frontier-Modell und etwa 37-mal mehr Intelligenz pro Dollar als Claude Opus 4.8. Siehe die vollständige Rangliste in der KI-Preis-Leistungs-Index.
Weitere kostenlose Tools von Convly
KI-Modell-Kontextfenster verglichen
10 Mio.
1,05 Mio.
1,05 Mio.
1,05 Mio.
1,05 Mio.
1,05 Mio.
1,05 Mio.
1 Mio.
1 Mio.
1 Mio.
1 Mio.
1 Mio.
Maximale Kontextlänge in Token, logarithmische Skala · Top 12 Modelle · Grün = größte. Aktualisiert 05. Oktober 2026.
