Fragen Sie sich, ob Ihre GPU ein bestimmtes großes Sprachmodell (LLM) lokal ausführen kann? Dieser kostenlose Rechner schätzt den VRAM-Bedarf jedes Modells für sämtliche Quantisierungsstufen – und zeigt Ihnen präzise an, welche Modelle auf Ihrer Grafikkarte Platz finden.
| Quantisierung | Qualität | Geschätzter VRAM-Bedarf | Passt auf Ihre GPU? |
|---|
Schätzung basierend auf den Modellgewichten bei jeder Quantisierung plus einem Laufzeit-Overhead von ca. 1,5 GB. Bei langen Kontexten kommt zusätzlich Speicher für den KV-Cache hinzu (der mit der gewählten Kontextlänge wächst). Bei Mixture-of-Experts-Modellen müssen alle Parameter in den VRAM geladen werden, obwohl pro Token nur ein Teil davon berechnet wird.
Wählen Sie ein Modell aus unserer Datenbank für KI-Modelle (oder geben Sie eine benutzerdefinierte Parameteranzahl ein), wählen Sie Ihre GPU, legen Sie Ihre Kontextlänge fest und sehen Sie sofort, ob das Modell darauf läuft – und mit welcher Qualität. Die Schätzungen basieren auf den Modellgewichten; bei langen Kontexten kommt zusätzlich Speicher für den KV-Cache hinzu.
Schnelle Antwort: Wie viel VRAM benötigen Sie, um ein LLM lokal auszuführen?
Um ein großes Sprachmodell (LLM) lokal mit 4-Bit-Quantisierung auszuführen, planen Sie grob 0,5–0,6 GB GPU-VRAM pro Milliarde Parameter ein – zuzüglich 1–3 GB für den KV-Cache bei typischen Kontextlängen. Praktisch passt ein 8B-Modell in etwa 5–6 GB (bequem auf einer 12-GB-RTX-3060; läuft auch auf einer 8-GB-RTX-4060), ein 13B-Modell benötigt ca. 8–10 GB, ein 32B-Modell erfordert eine 24-GB-Karte wie die RTX-4090 (~20 GB Gewichte), und ein 70B-Modell benötigt etwa 40–48 GB – also entweder eine einzelne 48-GB-Karte oder zwei 24-GB-GPUs.
Schnelle Faustregeln für die Modellgewichte – bevor der Kontext hinzugefügt wird:
- 4-Bit (Q4): ~0,5–0,6 GB pro Milliarde Parameter
- 8-Bit (Q8): ~1–1,2 GB pro Milliarde Parameter
- fp16 / bf16: ~2 GB pro Milliarde Parameter
- KV-Cache (Kontext): Fügen Sie bei 8K–32K Tokens ~1–4 GB hinzu; bei sehr langem Kontext oder größeren Modellen mehr.
Häufig gestellte Fragen
Wie viel VRAM benötige ich, um ein 70B-Modell auszuführen?
Ein 70B-Modell benötigt bei 4-Bit-Quantisierung etwa 40–48 GB VRAM – rund 0,5–0,6 GB pro Milliarde Parameter für die Gewichte plus den KV-Cache. Das passt auf eine einzelne 48-GB-Karte oder zwei 24-GB-GPUs, z. B. ein Paar RTX-4090s. Bei 8-Bit verdoppelt sich dieser Wert grob auf ~80 GB, bei fp16 benötigen Sie etwa 140 GB.
Kann meine RTX-4060 oder eine 12-GB-GPU ein 8B- oder 7B-Modell ausführen?
Ja. Ein 7B–8B-Modell mit 4-Bit-Quantisierung nutzt nur etwa 4–5 GB VRAM und läuft daher bequem auf einer 12-GB-Karte wie der RTX-3060 – mit ausreichend Reserve für den Kontext. Die RTX-4060 verfügt über 8 GB VRAM und bewältigt ein 7–8B-Modell ebenfalls problemlos – allerdings bleibt weniger Platz für lange Kontextfenster.
Wie viel VRAM benötigt ein 13B-Modell?
Ein 13B-Modell benötigt bei 4-Bit-Quantisierung etwa 8–10 GB VRAM. Es passt auf eine 12-GB-GPU bei kurzen bis mittellangen Kontexten, doch ab einem längeren Kontextfenster sowie unter Berücksichtigung des Overheads durch Frameworks ist eine 16-GB-Karte sicherer.
Kann eine 24-GB-GPU wie die RTX-4090 ein 32B- oder 70B-Modell ausführen?
Eine 24-GB-GPU führt ein 32B-Modell bei 4-Bit-Quantisierung gut aus: Die Gewichte beanspruchen etwa 20 GB und lassen noch einige GB für den KV-Cache frei. Ein 70B-Modell passt bei 4-Bit jedoch nicht darauf – dafür werden ~40–48 GB benötigt. Sie bräuchten stattdessen eine zweite GPU, CPU-Offloading oder eine niedrigere Quantisierung mit 2–3 Bit.
Wie viel GPU-Speicher benötigt ein LLM pro Milliarde Parameter?
Als Faustregel planen Sie bei 4-Bit ~0,5–0,6 GB, bei 8-Bit ~1–1,2 GB und bei fp16/bf16 ~2 GB pro Milliarde Parameter ein. Ein 30B-Modell benötigt also bei 4-Bit etwa 16–18 GB, bei 8-Bit ~32 GB und bei fp16 ~60 GB – ohne den KV-Cache.
Wie viel zusätzliches VRAM benötigt die Kontextlänge (der KV-Cache)?
Der KV-Cache wächst linear mit der Kontextlänge und verbraucht bei einem 8B-Modell etwa 3 GB mehr, wenn man von 8K auf 32K Tokens geht (ca. 1 GB bei 8K steigt auf etwa 4 GB bei 32K); größere Modelle und längere Kontexte verbrauchen entsprechend mehr. Eine 8-Bit-Quantisierung des KV-Caches halbiert diese Last grob – reservieren Sie daher stets 1–4 GB Spielraum zusätzlich zu den Modellgewichten.
Welche Modellgröße kann ich mit 8 GB oder 16 GB VRAM ausführen?
Mit 8 GB VRAM können Sie bequem 7–8B-Modelle bei 4-Bit-Quantisierung ausführen; mit 16 GB reichen Sie bis zu ~13B bequem und schaffen gegebenenfalls ein 20–24B-Modell mit moderatem Kontext. Für ein 32B-Modell benötigen Sie 24 GB, für ein 70B-Modell etwa 48 GB.
Weitere kostenlose Tools von Convly
VRAM-Bedarf für lokale Ausführung offener KI-Modelle (4-Bit)
1,4 GB
3 GB
4,5 GB
5 GB
5 GB
7,5 GB
8 GB
9 GB
9 GB
16 GB
18 GB
20 GB
21 GB
40 GB
40 GB
65 GB
140 GB
140 GB
240 GB
370 GB
400 GB
400 GB
500 GB
800 GB
GB of VRAM at 4-bit quantization · open-weight models in the Convly database · Green = best value, orange = highest. Updated Sep 14, 2026.
🔍 Diese Grafik kostenlos auf Ihrer Website einbetten (mit Quellenangabe)
Erhalten Sie die Zahlen, bevor alle anderen sie kennen
Einmal wöchentlich per E-Mail: Welche KI-Modelle haben ihren Preis geändert, was die neuen Benchmarks tatsächlich gemessen haben und welche GPU sich lohnt. Kein Hype, keine Füllwörter.
Kostenlos. Mit einem Klick abmelden. Wir verkaufen oder teilen Ihre Adresse niemals.
