Das Fine-tuning eines Sprachmodells mit eigenen Daten erforderte früher eine Rechenzentrum-GPU. Im Jahr 2026 ist es dank speichereffizienter Techniken tatsächlich auf einem Heimrechner möglich – wenn sofern Sie die GPU richtig wählen. Und beim Fine-tuning bedeutet „richtig“ vor allem eines: VRAMVRAM-Kapazität. Das Fine-tuning ist die speicherintensivste Aufgabe, die die meisten Nutzer einer GPU jemals stellen werden.
This guide ranks the best GPUs for fine-tuning LLMs at home and explains exactly how much memory you need.
Wichtigste Erkenntnisse
- Gesamtsieger: RTX 5090 (32 GB) – die leistungsfähigste Einzelkarte für Fine-tuning zu Hause.
- Bestes Preis-Leistungs-Verhältnis: eine gebrauchte RTX 3090 (24 GB) – das praktische Minimum zum besten Preis.
- QLoRA verändert alles – es macht Fine-tuning auf Consumer-VRAM möglich.
- 24 GB ist die realistische Untergrenze für das Fine-tuning nutzbarer Modellgrößen.
- Zwei gebrauchte RTX 3090s (insgesamt 48 GB) sind der kostengünstige Power-User-Ansatz.
Warum Fine-tuning so VRAM-intensiv ist
Das Ausführen eines Modells (Inferenz) benötigt Speicher für die Gewichte des Modells. Feinabstimmung Fine-tuning benötigt deutlich mehr Speicher – für die Gewichte, zusätzlich für die Gradienten, den Optimierer-Zustand sowie die Aktivierungen. Bei naivem Full-Fine-tuning kann der VRAM-Bedarf mehrere Male die Größe des Modells betragen, wodurch es für alle außer den kleinsten Modellen mit keiner Consumer-GPU realisierbar ist.
Deshalb QLoRA (und LoRA-artige Verfahren allgemein) sind deshalb so entscheidend. Statt alle Gewichte zu aktualisieren, lädt diese Technik das Modell in komprimierter (quantisierter) Form und trainiert lediglich einen kleinen Satz zusätzlicher Parameter. Die VRAM-Einsparung ist enorm – sie ist der einzige Grund, warum Fine-tuning zu Hause im Jahr 2026 realistisch geworden ist. Alle nachfolgenden Empfehlungen gehen davon aus, dass Sie diese speichereffizienten Methoden nutzen werden.
Wie viel VRAM benötigen Sie?
Ein praktischer Leitfaden für QLoRA-basiertes Fine-tuning:
| VRAM | Was Sie fine-tunen können |
|---|---|
| 16 GB | Kleine Modelle (bis ca. ~7–8 Mrd. Parameter) – möglich, aber knapp bemessen |
| 24 GB | Komfortabel für ~7–13 Mrd. Parameter; die realistische Mindestanforderung für Heimanwendungen |
| 32 GB | Größere Modelle und größere Batches; der ideale Bereich für Heimanwendungen |
| 48 GB (2× Grafikkarten) | Serious Fine-tuning bis hin zu Modellen der ~30-Mrd.-Klasse |
Die zentrale Erkenntnis: 24 GB ist die Untergrenze für das Fine-tuning wirklich nützlicher Modelle, und 32 GB und mehr ist das komfortable Ziel.
Die Platzierungen
1. RTX 5090 – beste Wahl für Fine-tuning zu Hause
Die 32 GB GDDR7 32-GB-VRAM-Kapazität der RTX 5090 macht sie zur besten einzelnen Consumer-Grafikkarte für Fine-tuning. Dieser zusätzliche Speicher gegenüber einer 24-GB-Karte ermöglicht direkt größere Modelle, längere Kontexte und größere Batch-Größen – alles Faktoren, die das Fine-tuning beschleunigen und leistungsfähiger machen. Ihre Blackwell-Rechenleistung verkürzt zudem die Trainingsdauer. Sie ist zwar teuer und stromhungrig, doch für ernsthaftes Fine-tuning zu Hause ist sie die erste Wahl.
2. Gebrauchte RTX 3090 – beste Preis-Leistungs-Relation, das praktische Minimum
Die verwendete RTX 3090 ist die preisgünstigste Wahl, und ihre 24 GB ist das realistische Minimum für das Feintuning zu Hause. Mit QLoRA können Sie problemlos Modelle der Größenklasse 7–13 Mrd. Parameter feintunen. Zu einem Preis von rund 700–900 US-Dollar gebraucht stellt sie den kostengünstigsten ernstzunehmenden Einstieg dar. Der klassische Power-User-Trick besteht darin, zwei solcher Karten mit insgesamt 48 GB Speicher einzusetzen – ein deutlicher Leistungssprung zu weit geringeren Kosten als bei einer einzelnen High-End-Karte.
3. RTX 4090 – ausgezeichnet, wenn der Preis stimmt
Die RTX 4090 verfügt ebenfalls über 24 GB und starke Rechenleistung. Neuware ist knapp und die Preise schwanken, doch eine gut preislich positionierte 4090 (neu oder gebraucht) ist eine hervorragende Karte für das Feintuning – schneller als eine 3090 bei gleicher Speichermenge. Kaufen Sie sie, wenn ihr Preis im Vergleich zur 5090 oder zu zwei 3090s wettbewerbsfähig ist.
4. RTX 5080 / 5070 Ti (16 GB) – ausschließlich für Einsteiger
Die 16-GB-Karten ermöglichen das Feintuning kleiner Modelle, doch 16 GB stellen eine echte Einschränkung dar: Sie sind auf die kleinsten Modelle, kurze Kontextlängen und winzige Batches beschränkt. Sie eignen sich gut für das Erlernen des Feintuning-Workflows, doch falls Feintuning Ihr tatsächliches Ziel ist, sollten Sie zu einer 24-GB-Karte greifen.
Eine einzelne leistungsstarke Karte versus zwei kleinere Karten
Eine echte Entscheidungswegkreuzung für Feintuner:
- Eine RTX 5090 (32 GB) – einfachste Konfiguration, schnellste Verarbeitung pro Aufgabe, keine Multi-GPU-Komplexität. Beste Wahl, wenn das Budget es zulässt.
- Zwei gebrauchte RTX 3090 (insgesamt 48 GB) – mehr gesamter VRAM zu geringeren Kosten, sodass größere Modelle feingetunt werden können – allerdings müssen Sie sich mit der Multi-GPU-Konfiguration, höherem Stromverbrauch und mehr Wärmeentwicklung auseinandersetzen.
Wenn Sie maximale Modellgröße pro Dollar anstreben, gewinnen zwei 3090er. Wenn Sie Einfachheit und Geschwindigkeit bevorzugen, gewinnt eine 5090.
Vergessen Sie nicht: Cloud ist eine Alternative
Feintuning erfolgt in Schüben – Sie führen es gelegentlich durch, nicht kontinuierlich. Falls Sie nur hin und wieder feintunen, kann es günstiger sein, für diese wenigen Stunden eine Cloud-GPU zu mieten, statt eine Flagship-Karte zu kaufen. Kaufen Sie Hardware, wenn Sie regelmäßig feintunen oder volle Datenschutzkontrolle über Ihre Trainingsdaten benötigen; mieten Sie, wenn es nur gelegentlich geschieht.
Fehler, die eine gute GPU vergeuden
Ausreichend VRAM zu kaufen, ist notwendig, aber allein nicht entscheidend für den Erfolg eines Feintunings. Am häufigsten verschwenden Nutzer ein ganzes Wochenende auf einer leistungsfähigen Karte, weil sie den Softwarestack, die unterstützende Hardware oder den Datensatz falsch wählen. Hier sind die Fallen, die Sie vor Beginn kennen sollten.
Verwendung von reinen Transformers statt eines optimierten Trainers. Die VRAM-Angaben weiter oben in diesem Leitfaden gehen von einem speichereffizienten Stack aus. Tools wie Unsloth nutzen manuell geschriebene CUDA-Kernel, um den Trainings-Speicherbedarf um rund 70 % zu senken und laufen zwei bis mehrere Male schneller als die Standard-Hugging-Face-Implementierung auf derselben Karte; Axolotl ist die flexiblere Alternative. Mit QLoRA auf Unsloth lässt sich ein 7B-Modell bereits mit etwa 6 GB VRAM feintunen – daher kommt sogar eine alte RTX 3060 noch infrage. Wählen Sie den naiven Ansatz, und dieselbe Aufgabe passt möglicherweise gar nicht mehr in den Speicher.
Vergessen, dass nicht nur die Modellgröße, sondern auch die Kontextlänge den VRAM-Bedarf bestimmt. Der Speicherbedarf für Aktivierungen skaliert mit der Sequenzlänge. Eine Konfiguration, die bei 512 Tokens problemlos passt, kann bei 4K-Token einen „Out-of-Memory“-Fehler auslösen. Bevor Sie nach einer größeren Karte greifen, aktivieren Sie Gradient-Checkpointing, verwenden Sie einen gepaginierten Optimierer zur Absorption von Speicherspitzen und reduzieren Sie Ihre Sequenzlänge auf das Maß, das Ihre Daten tatsächlich benötigen.
Der Rest des Systems wird ausgehungert. Sobald Sie Gewichte oder Optimierer-Zustände auf die CPU auslagern, wird der Arbeitsspeicher (RAM) zur Engstelle. Fassen Sie ausreichend System-RAM als integralen Bestandteil Ihres Systems auf – nicht als nachträgliche Ergänzung – und speichern Sie Ihre Datensätze sowie Checkpoints auf schnellen NVMe-Laufwerken, damit das Datenladen die GPU nicht in Leerlauf versetzt.
Mehr Daten mit besseren Daten zu verwechseln. Dies ist der kostspieligste Fehler – und keine GPU kann ihn beheben. Sehr kleine Datensätze zwingen ein Modell zum Auswendiglernen statt zum echten Lernen; Qualität schlägt Quantität entscheidend. Bei Generierungsaufgaben gilt grob tausend sorgfältig kuratierte Beispiele als vernünftige Untergrenze; einige hundert saubere, konsistente Beispiele übertreffen regelmäßig mehrere tausend verrauschte. LoRA hilft hier ebenfalls, da es die Überanpassung (Overfitting) eindämmt, die bei vollständigem Fine-Tuning kleiner Datensätze häufig auftritt.
Die ehrliche Erkenntnis: Wählen Sie den richtigen Trainer, dimensionieren Sie das gesamte System angemessen und investieren Sie in Ihren Datensatz. Eine Mittelklasse-GPU mit einer sauberen Pipeline übertrifft eine Flagship-Karte, die mit unstrukturierten Daten arbeitet.
Häufig gestellte Fragen (FAQ)
Welche GPU eignet sich am besten zum Feintuning von LLMs zu Hause?
Die RTX 5090 mit 32 GB VRAM ist die beste einzelne Consumer-GPU für das Feintuning zu Hause. Für beste Preis-Leistung ist eine gebrauchte RTX 3090 (24 GB) das praktische Minimum und die kostengünstigste Wahl; zwei zusammengefasste 3090er (48 GB) bieten den budgetfreundlichen Weg, größere Modelle zu feintunen.
Wie viel VRAM benötige ich zum Feintuning eines LLM?
Mit speichereffizienten Methoden wie QLoRA sind 24 GB das realistische Minimum, um nützliche Modellgrößen (ca. 7–13 Mrd. Parameter) zu feintunen. 32 GB oder mehr sind komfortabel und erlauben größere Modelle sowie größere Batches. 16 GB funktionieren nur für die kleinsten Modelle und eignen sich am besten zum Erlernen des Workflows.
Kann ich einen LLM auf einer Consumer-GPU feintunen?
Ja – dies gehört zu den bedeutendsten Entwicklungen der letzten Jahre. Techniken wie QLoRA laden das Modell in komprimierter Form und trainieren nur eine kleine Teilmenge der Parameter, wodurch der VRAM-Bedarf drastisch sinkt. Mit einer Consumer-GPU mit 24 GB oder mehr VRAM ist das Feintuning von Modellen zu Hause tatsächlich praktikabel.
Was ist QLoRA und warum ist es wichtig?
QLoRA ist eine speichereffiziente Feintuning-Methode, bei der ein Modell in quantisierter (komprimierter) Form geladen und nur eine kleine Anzahl zusätzlicher Parameter trainiert wird, anstatt sämtliche Gewichte. Dadurch sinkt der VRAM-Bedarf so stark, dass Feintuning auf Consumer-GPUs statt auf Rechenzentrumshardware möglich wird.
Ist Feintuning in der Cloud günstiger?
Das kann der Fall sein, da Feintuning gelegentlich und nicht kontinuierlich erfolgt. Wenn Sie nur hin und wieder feintunen, kann die Miete einer Cloud-GPU für wenige Stunden weniger kosten als der Kauf einer Flagship-Karte. Kaufen Sie eigene Hardware, wenn Sie regelmäßig feintunen oder volle Datenschutzkontrolle über Ihre Trainingsdaten benötigen.
Benötige ich spezielle Software, um Fine-Tuning auf einer Consumer-GPU durchzuführen?
Effektiv ja. Die ansprechenden VRAM-Angaben setzen einen speichereffizienten Software-Stack voraus – nicht nur die Standard-Bibliothek Hugging Face Transformers. Unsloth ist der einfachste Einstiegspunkt und kann den Speicherbedarf für das Training um rund 70 % senken, während es gleichzeitig die Laufzeit verkürzt; Axolotl bietet mehr Kontrolle für komplexe Konfigurationen. Beide Tools lassen sich nahtlos mit QLoRA kombinieren – dies ermöglicht es erst, Modelle der 7B-Klasse überhaupt auf Grafikkarten mit lediglich 8–12 GB VRAM zu fine-tunen.
Wie viel System-RAM benötige ich zusätzlich zum VRAM für Fine-Tuning?
Mehr, als viele erwarten. Sobald Sie CPU-Offloading nutzen, um größere Aufgaben zu bewältigen, werden Parameter und Optimierer-Zustand im System-RAM zwischengespeichert – ein zu kleiner Arbeitsspeicher wird damit zur eigentlichen Engstelle. Als Faustregel sollten Sie mindestens so viel System-RAM bereitstellen wie Ihre GPU an VRAM besitzt – besser noch etwas mehr. Speichern Sie Datensätze und Checkpoints zudem auf schnellen NVMe-Laufwerken, damit der Speicherzugriff die GPU niemals ausbremst.
Wie lange dauert ein Fine-Tuning tatsächlich auf einer einzelnen Karte?
Bei einem parameter-effizienten LoRA- oder QLoRA-Lauf mit einem moderaten Datensatz können Sie auf einer modernen Consumer-GPU mit einer Laufzeit von Stunden – nicht Tagen – rechnen. Die Dauer skaliert mit der Größe des Datensatzes, der Sequenzlänge und der Anzahl der Durchläufe über die Daten; ein optimierter Trainer wie Unsloth kann sie etwa halbieren. Vollständiges Fine-Tuning dauert deutlich länger und ist zu Hause selten die richtige Wahl.
Fazit
Feintuning von LLMs zu Hause ist 2026 Realität – und entscheidend ist der VRAM. Die RTX 5090 (32 GB) ist die beste einzelne Karte für diese Aufgabe. Eine gebrauchte RTX 3090 (24 GB) ist die preisgünstigste Wahl und das praktische Minimum, während zwei 3090er den budgetfreundlichen Weg zu größeren Modellen darstellen.
Unabhängig von Ihrer Wahl: Nutzen Sie QLoRA-artige Methoden, betrachten Sie 24 GB als untere Grenze und bedenken Sie, dass für gelegentliches Feintuning die Cloud eine durchaus legitime Alternative zum Kauf der leistungsstärksten Karte im Angebot darstellt.

