Während DeepSeek Schlagzeilen macht, Alibabas Qwen hat still und leise die umfassendste Modellfamilie der künstlichen Intelligenz aufgebaut – von winzigen, auf Endgeräten lauffähigen Modellen bis hin zu einem Flaggschiff-Modell, das im Mai 2026 weltweit das höchstrangierte chinesische Modell auf unabhängigen Intelligenz-Benchmarks wurde. Wenn DeepSeek der Störer ist, dann ist Qwen die Plattform. Hier erfahren Sie, was es ist und warum es wichtig ist.
Wichtigste Erkenntnisse
- Qwen3.7 Max (Mai 2026) erzielte einen Wert von 56,6 auf dem Artificial Analysis Intelligence Index – Platz unter den Top 10 weltweit und damit das bisher höchste Ergebnis eines chinesischen Modells.
- Die breiteste Modellfamilie in der KI: von 0,5-Milliarden-Parameter-Modellen für Endgeräte bis hin zu Flaggschiff-Modellen mit einer Billion Parametern, sowohl Open-Source- als auch proprietär.
- Kontextfenster mit einer Länge von 1 Million Token auf dem Flaggschiff-Modell, wobei die erweiterte Denkfunktion standardmäßig aktiviert ist.
- Führer bei Open-Weight-Modellen: Alibaba konkurriert mit Meta als größter Anbieter von Modellen mit permissiver Lizenz.
- Einschränkung: Die leistungsstärksten Max-Modelle sind proprietär und ausschließlich über eine API verfügbar; zudem gelten für den gehosteten Dienst Einschränkungen hinsichtlich Datenspeicherort und Inhaltsmoderation.
- Wer ist Qwen?
- Das Flaggschiff: Qwen3.7 Max
- Die eigentliche Geschichte: die Familie mit offenen Gewichten
- Wo Qwen punktet
- Wo Qwen zurücksteht – ehrliche Einschränkungen
- Qwen im Vergleich zum Feld
- Vor- und Nachteile
- Wie Sie auf Qwen zugreifen können
- Welches Qwen-Modell sollten Sie tatsächlich auf Ihrer Hardware ausführen?
- Häufig gestellte Fragen (FAQ)
- Fazit
- Verwandte Artikel
Wer ist Qwen?
Qwen (Abkürzung für „Tongyi Qianwen“, 通义千问) ist die Familie großer Sprachmodelle von Alibaba Cloud, Chinas größtem Cloud-Anbieter. Im Gegensatz zu DeepSeek (einem fokussierten Forschungslabor) oder Moonshot (einem Startup) steht Qwen die volle Kraft eines Milliardenunternehmens hinter sich: die Infrastruktur von Alibaba Cloud, die enorme Datenmenge aus dem E-Commerce-Bereich sowie der klare Auftrag, Qwen zur Standard-KI-Schicht innerhalb des gesamten Alibaba-Konzerns und der Open-Source-Welt zu machen.
Diese Unterstützung zeigt sich in Breite. Qwen ist kein einzelnes Modell – es ist eine umfangreiche Modellfamilie, die Text-, Bild-, Audio-, Code-, Mathematik- und Embedding-Modelle umfasst, in Größenordnungen von Sub-Milliarden-Parameter-Modellen für Smartphones bis hin zu Flaggschiff-Modellen mit einer Billion Parametern. Alibaba hat einen Großteil dieser Modelle als Open Source veröffentlicht und macht Qwen damit neben Metas Llama zu einer der beiden tragenden Säulen des globalen Open-Weight-Ökosystems.
Das Flaggschiff: Qwen3.7 Max
Am 19. Mai 2026 veröffentlicht Qwen3.7 Max ist Alibabas leistungsfähigstes Modell und ein echter Meilenstein für die chinesische KI:
- 56,6 im Artificial Analysis Intelligence Index — Platzierung unter den Top 10 weltweit und der höchste Wert, den jemals ein chinesisches Modell in diesem unabhängigen Benchmark erreicht hat.
- 92,4 im GPQA Diamond (wissenschaftliche Fragen auf Graduiertenniveau) sowie 97,1 im HMMT Februar 2026 (Wettbewerbsmathematik) — der höchste Wert innerhalb seiner Vergleichsgruppe.
- Kontextfenster mit einer Länge von 1 Million Token mit erweitertem Denken standardmäßig aktiviert.
- Preisgestaltung von 2,50 USD Eingabe / 7,50 USD Ausgabe pro Million Tokens, bei zwischengespeicherter Eingabe 0,25 USD.
Der Vorgänger Qwen3.6 Max (April 2026) bleibt zu geringeren Kosten verfügbar (ca. 1,04 USD / 6,24 USD). Beide Modelle sind proprietär und werden über Alibaba Cloud Model Studio, OpenRouter und Together AI bereitgestellt.
Die eigentliche Geschichte: die Familie mit offenen Gewichten
Das Max-Flaggschiff dominiert die Benchmark-Schlagzeilen, doch die strategische Waffe von Qwen ist sein Katalog mit offenen Gewichten. Alibaba hat Dutzende Qwen-Modelle unter großzügigen Lizenzen (überwiegend Apache 2.0) veröffentlicht, darunter:
- Dichte und MoE-Textmodelle mit 0,5 Milliarden bis hin zu mehreren Hundert Milliarden Parametern.
- Qwen-VL Vision-Sprache-Modelle.
- Qwen-Coder Modelle, die speziell für Softwareentwicklung optimiert sind.
- Qwen-Audio sowie Embedding-Modelle.
Dies ist entscheidend, denn es macht Qwen zur Grundlage für Tausende nachgelagerter Produkte und Feinabstimmungen weltweit. Wenn Sie ein chinesisches Modell mit offenen Gewichten verwendet haben – und es war nicht von DeepSeek – dann war es sehr wahrscheinlich ein Qwen-Ableger. Für Entwickler, die volle Kontrolle über ihren Technologie-Stack wünschen – also Feinabstimmung, Eigenhosting und keine Abhängigkeit von einer API – bietet Qwen mehr Größen- und Leistungsoptionen als jeder Konkurrent.
Wo Qwen punktet
1. Breite der Modellfamilie – vom Edge bis zur Spitzenleistung
Kein anderer Anbieter deckt das gesamte Spektrum derart umfassend ab. Sie können Prototypen mit der 1B-Max-API erstellen und anschließend ein feinabgestimmtes, offenes 7B-Modell auf Ihrer eigenen Hardware einsetzen – stets innerhalb derselben Modellfamilie mit konsistentem Verhalten und Tokenisierung. Diese Kohärenz ist für Produktions-Teams tatsächlich von großem Wert.
2. Tiefe der Modelle mit offenen Gewichten
Alibabas Engagement für Modelle mit offenen Gewichten steht dem von Meta in nichts nach. Für alle, die auf selbstgehosteten Modellen aufbauen, stellt Qwens Katalog die umfangreichste Auswahl dar – und die Lizenzen sind geschäftsfreundlich.
3. Multilinguale und multimodale Stärke
Aufgrund des umfangreichen multilingualen und E-Commerce-Datensatzes von Alibaba ist Qwen außergewöhnlich stark in Chinesisch, Englisch und Dutzenden weiterer Sprachen sowie in visuellen und akustischen Aufgaben. Für nicht-englischsprachige und multimodale Workloads ist es oft die beste offene Option.
Wo Qwen zurücksteht – ehrliche Einschränkungen
1. Die besten Modelle sind geschlossen
Das schlagzeilenträchtige Qwen3.7 Max ist proprietär und ausschließlich über die API nutzbar. Falls Ihre Entscheidung für chinesische KI auf Offenheit beruht, erfüllt die Spitze der Qwen-Reihe diese Erwartung nicht – Sie müssen auf die (immer noch exzellenten) offenen Modelle der nächstniedrigeren Stufe zurückgreifen.
2. Daten- und Moderationshinweise bei gehosteten APIs
Die Model Studio-API läuft auf der Alibaba-Cloud-Infrastruktur in China und unterliegt denselben Regelungen hinsichtlich Datenaufbewahrungsort und Inhaltsmoderation wie andere in China gehostete Dienste. Durch das Eigenhosting der Modelle mit offenen Gewichten entfällt dieser Aspekt.
3. Fragmentierung
Die Breite der Familie ist zugleich auch eine Schwäche: Bei so vielen Modellen und Versionen erfordert die Auswahl des richtigen Qwen-Modells für eine konkrete Aufgabe Recherche. Es gibt keine einfache Empfehlung wie „Nehmen Sie einfach dieses Modell“, wie sie bei einem Labor mit nur einem Modell üblich ist.
Qwen im Vergleich zum Feld
| Dimension | Qwen | DeepSeek V4 | Llama (Meta) | GPT-5.5 |
|---|---|---|---|---|
| Breite der Modellfamilie | Breitestes Angebot (Edge → Spitzenleistung) | Eng | Breit | Eng |
| Tiefe der Modelle mit offenen Gewichten | Größte Tiefe | Stark (MIT-Lizenz) | Tief | Keines |
| Spitzenintelligenz | Platzierung unter den Top 10 weltweit | Stark | Hinter der Spitzenleistung | Spitzenmodell |
| Mehrsprachig / multimodal | Ausgezeichnet | Gut | Gut | Ausgezeichnet |
| Bestes offenes Modell? | Nein (Max geschlossen) | Ja | Ja | Nein |
Vor- und Nachteile
Qwen-Stärken
- Breiteste Modellfamilie in der KI – von Edge bis zur Spitze
- Umfangreichster Open-Weight-Katalog (Apache 2.0)
- Das Flaggschiff durchbrach weltweit die Top 10 bei Intelligenztests
- Hervorragende multilinguale und multimodale Abdeckung
- Unterstützt durch Skalierbarkeit und Zuverlässigkeit von Alibaba Cloud
Qwen-Schwächen
- Die besten (Max-)Modelle sind proprietär und ausschließlich über eine API verfügbar
- Die gehostete API unterliegt chinesischen Daten-Residenz-Anforderungen
- Fragmentierung innerhalb der Modellfamilie – erschwert die Auswahl des richtigen Modells
- Inhaltliche Moderation im gehosteten Dienst
Wie Sie auf Qwen zugreifen können
- Flaggschiff (Max): Alibaba Cloud Model Studio, OpenRouter, Together AI – ausschließlich über API.
- Open-Source-Modelle: Laden Sie Qwen3, Qwen-Coder, Qwen-VL usw. von Hugging Face / ModelScope herunter und hosten oder fine-tunen Sie sie selbst.
- Chat: Die Qwen-Chat-Webanwendung für gelegentliche Nutzung.
Welches Qwen-Modell sollten Sie tatsächlich auf Ihrer Hardware ausführen?
Qwens größter praktischer Vorteil ist zugleich seine größte Quelle der Verwirrung: Es gibt einfach zu viele Modelle zur Auswahl. Der ehrliche Shortcut besteht darin, mit der Hardware zu beginnen, die Sie besitzen, und rückwärts zu arbeiten. Fast jedes Qwen-Modell ist im GGUF-Format verfügbar, das von Ollama, LM Studio und llama.cpp erwartet wird, sowie dem Q4_K_M Quantisierung ist für nahezu alle Nutzer die richtige Standardeinstellung – sie reduziert die Modellgröße um den Faktor drei bis vier gegenüber voller Präzision, wobei nur ein geringer Qualitätsverlust entsteht. Wählen Sie für Ihre Maschine ein Modell der nächstkleineren Leistungsklasse und nehmen Sie das größte Modell, das problemlos Platz findet – inklusive ausreichend Speicherplatz für den Kontext.
| Ihre Hardware | Bestes Qwen-Modell zum Ausführen (Q4_K_M) | Was Sie erwarten können |
|---|---|---|
| Smartphone / Raspberry Pi (4–8 GB RAM) | 0,6B–4B dicht (z. B. ein kleines Modell mit ca. 1,7 Mrd. Parametern) | Offline-Chat und Zusammenfassung; ein ~0,6B-Modell umfasst ca. 500 MB und erreicht etwa 15–25 Tokens/Sekunde |
| 8-GB-GPU (RTX 3060 / 4060) | 8B dicht | Flotter Allzweck-Assistent mit rund 40+ Tokens/Sekunde – der Einstiegspunkt für ernsthafte Anwendungen |
| 12-GB-GPU (RTX 3060 12 GB / 5070) | 14B dicht | Deutlich besseres Schlussfolgern; benötigt bei 8K Kontext etwa 11 GB Gesamtspeicher |
| 24-GB-GPU (RTX 3090 / 4090 / 5090) | 32B dicht oder ein MoE-Modell der 30B-Klasse (30B-A3B) | Die lokale „Goldilocks-Zone“; nahe-spitzenmäßige Qualität auf einer einzigen Consumer-Grafikkarte |
| 48 GB+ oder Apple Silicon mit 64 GB+ | Ein großes MoE-Modell wie das 235B-A22B-Flaggschiff | Die leistungsfähigsten Modelle, die Sie ohne Server selbst hosten können |
Zwei Regeln halten Sie aus Schwierigkeiten heraus. Erstens: Halten Sie Puffer frei – ein Modell, das Ihren VRAM genau ausfüllt, führt bei langen Eingabeprompten zu einem Überlauf; wählen Sie daher für große Kontexte stets eine Stufe kleiner. Zweitens: Wenn die Open-Weight-Familie innerhalb Ihrer Leistungsklasse eine Mixture-of-Experts (MoE) -Variante anbietet, entscheiden Sie sich dafür – ein 30B-A3B-Modell liefert annähernd die Qualität eines 30B-dichten Modells, verursacht aber nur etwa so hohe Laufzeitkosten wie ein 3B-Modell, da pro Token lediglich rund drei Milliarden Parameter aktiviert werden. Dichte Modelle sind einfacher und etwas vorhersehbarer; MoE-Modelle sind die klügere Wahl, wenn Sie maximale Leistung pro Gigabyte erreichen möchten.
Häufig gestellte Fragen (FAQ)
Gehört Qwen Alibaba?
Yes. Qwen is developed and owned by Alibaba Cloud, Alibaba’s cloud-computing division and China’s largest cloud provider. It carries the full backing of the trillion-dollar conglomerate, drawing on Alibaba Cloud’s infrastructure, e-commerce data, and organizational resources to train and ship the model family.
Is Qwen free and open source?
Mostly yes. Most of the Qwen family, including very capable models, is released under permissive Apache 2.0 open weights, spanning text, vision, audio, and code from 0.5B to hundreds of billions of parameters. The top-tier Qwen-Max flagship models, however, are proprietary and API-only.
What is the latest Qwen model?
Qwen3.7 Max, released May 19, 2026, is the latest flagship. It’s a sparse mixture-of-experts model with roughly 1 trillion total parameters and a 1-million-token context window, scoring 56.6 on the Artificial Analysis Intelligence Index, 92.4 on GPQA Diamond, and 97.1 on HMMT February 2026.
Qwen vs DeepSeek: which is better?
They win on different fronts. DeepSeek leads on price-performance and ships its very best model as open weights under an MIT license. Qwen wins on family breadth, multimodal and multilingual coverage, and top-end benchmark intelligence, ranking among the top-10 globally while releasing the deepest range of open-weight models.
Ist Qwen Open Source?
Teilweise. Der Großteil der Qwen-Familie – darunter sehr leistungsfähige Modelle – wird unter der Apache-2.0-Lizenz als Open-Weight-Modell veröffentlicht. Die hochrangigen Qwen-Max-Flaggschiffmodelle sind proprietär und nur über eine API nutzbar. Daher ist die Aussage „Qwen ist Open Source“ für die gesamte Modellfamilie zutreffend, nicht jedoch für das absolut beste Modell.
Ist Qwen besser als DeepSeek?
Beide haben unterschiedliche Stärken. DeepSeek überzeugt durch Preis-Leistungs-Verhältnis und stellt sein bestes Modell als Open-Weight-Modell bereit. Qwen punktet mit Breite der Modellfamilie, multimodaler und multilingualler Abdeckung sowie herausragender Benchmark-Intelligenz (Qwen3.7 Max erreicht weltweit ein höheres Ranking). Für Flexibilität beim Self-Hosting bietet Qwen einen umfangreicheren Katalog; für ein einzelnes, kostengünstiges und exzellentes Open-Source-Modell ist DeepSeek einfacher zu handhaben.
Was bedeutet „Qwen“?
Es ist die Kurzform für Tongyi Qianwen (通义千问), etwa „Wahrheit aus tausend Fragen“ – Alibabas Markenname für seine LLM-Familie.
Darf ich Qwen kommerziell nutzen?
Ja – die Open-Source-Modelle unterliegen größtenteils der Apache-2.0-Lizenz, die kommerzielle Nutzung erlaubt. Für die Max-API gelten übliche kommerzielle Nutzungsbedingungen. Prüfen Sie stets die jeweilige Lizenzkarte des Modells auf Hugging Face.
Läuft Qwen auf einem Smartphone?
Die kleinsten Qwen-Modelle (mit weniger als einer Milliarde Parameter) sind speziell für den Einsatz direkt auf Geräten konzipiert – inklusive Smartphones und Edge-Hardware. Das trägt wesentlich dazu bei, dass die Modellfamilie ungewöhnlich vollständig ist.
Ist Qwen sicher zu verwenden?
Für nicht sensible Aufgaben ja. Die Open-Weight-Qwen-Modelle können selbst gehostet werden, sodass Ihre Daten vollständig unter Ihrer Kontrolle bleiben – die sicherste Option. Die gehostete Qwen-API läuft auf Alibaba Cloud in China und unterliegt den üblichen Anforderungen hinsichtlich Datenresidenz und Inhaltsmoderation. Bei sensiblen oder regulierten Daten empfiehlt sich daher entweder das Self-Hosting der Open-Weight-Modelle oder die Nutzung eines westlichen Anbieters.
Ist Qwen kostenlos nutzbar?
Grundsätzlich ja – die großen Open-Weight-Qwen-Modelle können kostenlos heruntergeladen und unter weitgehend permissiven (meist Apache-2.0-)Lizenzen ausgeführt werden; Sie zahlen lediglich für Ihre eigene Rechenleistung. Das hochrangige Qwen-Max-Flaggschiffmodell ist ein kostenpflichtiger API-Dienst. Zudem steht eine kostenlose Qwen-Chat-Webanwendung für gelegentliche Nutzung zur Verfügung.
Wie viel VRAM benötige ich, um Qwen lokal auszuführen?
Bei der Standard-Quantisierung Q4_K_M planen Sie etwa 6 GB VRAM für ein 8B-Modell, rund 11 GB für ein 14B-Modell und ca. 20–22 GB für ein 30–32B-Modell – stets mit einigen zusätzlichen Gigabytes freiem Speicher für Ihr Kontextfenster. Eine 8-GB-Karte ist der realistische Einstiegspunkt für einen schnellen, nützlichen Assistenten; 24 GB (z. B. eine RTX 3090, 4090 oder 5090) stellen den lokalen Optimalpunkt dar. Darunter laufen die kleinsten Qwen-Modelle noch auf einem Smartphone oder der CPU eines Laptops – allerdings deutlich langsamer.
Welches Qwen-Modell eignet sich am besten für Programmierung?
Für maximale Leistung ist das spezialisierte Flaggschiffmodell Qwen3-Coder (ein Mixture-of-Experts-Modell mit 480 Milliarden Parametern) die stärkste Option und konkurriert mit führenden geschlossenen Code-Modellen – doch bei dieser Größe verwenden Sie es realistischerweise über eine API und nicht auf Ihrem eigenen Rechner. Für lokale Programmieraufgaben läuft das Qwen3-Coder-30B-A3B-Modell gut in Q4_K_M-Quantisierung auf einer einzelnen 24-GB-GPU (ca. 19 GB auf der Festplatte) und ist die praktische Standardwahl. Falls Sie nur eine 8–10-GB-Karte oder einen Laptop mit 16 GB RAM besitzen, wechseln Sie zu einem kleineren allgemeinen Qwen3 (4B oder 8B) oder zum älteren Qwen2.5-Coder-7B, der für Code-Vervollständigung immer noch solide geeignet ist. Wählen Sie das größtmögliche Code-Modell, das auf Ihrer Hardware läuft – nicht unbedingt das prominenteste Modell.
Sollte ich ein dichtes Qwen-Modell oder ein Mixture-of-Experts-Modell ausführen?
Wählen Sie dichte Modelle bei kleinen Größen und höchster Einfachheit – sie lassen sich leicht quantisieren, sind vorhersehbar und nahezu überall gut unterstützt. Entscheiden Sie sich für MoE-Modelle, wenn Sie maximale Leistung pro Gigabyte Arbeitsspeicher wünschen: Ein Mixture-of-Experts-Modell aktiviert pro Token nur einen Bruchteil seiner Parameter und bietet daher die Qualität eines deutlich größeren Modells zu den Inferenzkosten eines kleinen Modells. Auf einer 24-GB-Karte ist das 30B-A3B-MoE-Modell oft die klügste einzelne Qwen-Wahl.
Fazit
Qwen ist die am meisten unterschätzte Kraft der chinesischen KI-Landschaft. Im Gegensatz zu DeepSeek verfügt es nicht über eine disruptiv preisorientierte Narrative, bietet aber etwas, das möglicherweise noch wertvoller ist: die breiteste, tiefste und produktionsreifste Modellfamilie der Welt – mit einem Flaggschiffmodell, das mittlerweile global mit der KI-Spitze konkurriert, sowie einer langen Reihe offener Modelle, die weltweit Tausende von Produkten antreiben.
Wenn Sie einen einzigen KI-Anbieter suchen, der Sie von einem smartphonefähigen Modell bis hin zu einem weltweit top-10-platzierten Flaggschiffmodell begleitet – mit Open-Source-Modellen dort, wo es zählt, multimodaler und multilingueller Unterstützung sowie der Zuverlässigkeit von Alibaba Cloud – dann ist Qwen 2026 die umfassendste verfügbare Lösung. Beachten Sie allerdings, dass das allerbeste Qwen-Modell geschlossen ist und die gehostete API die üblichen rechtlichen Rahmenbedingungen Chinas mit sich bringt. Für den Großteil dessen, was die meisten Teams entwickeln, reichen die offenen Qwen-Modelle mehr als aus.

