Im Jahr 2026 führt Claude Opus 4.8 unseren Intelligenzindex mit 55,7 Punkten an, knapp vor OpenAIs GPT-5.5 (54,8). Googles Gemini 3.5 Flash (50,2) und das open-weight-Modell GLM-5.2 (51,1) folgen dicht dahinter, während Gemini 3.1 Pro (46,5) und DeepSeek V4 Pro (44,3) das vorderste Feld abschließen. Falls Ihre Wahl tatsächlich zwischen den beiden Assistenten und nicht zwischen den zugrundeliegenden Rohmodellen liegt, behandelt der Vergleich Claude vs. ChatGPT diesen Aspekt direkt im Kopf-an-Kopf-Vergleich. Das einzige „beste“ Modell hängt davon ab, wie stark Sie Intelligenz gegenüber Preis und Geschwindigkeit gewichten.
Die Spalte ‚Intelligenz‘ zeigt einen zusammengesetzten Wert von 0 bis 100 gemäß dem Artificial Analysis Intelligence Index v4.1, der neun anspruchsvolle Bewertungen aus den Bereichen logisches Denken, Programmierung, agentenbasierte Werkzeugnutzung und naturwissenschaftliches Wissen vereint. Höhere Werte bedeuten mehr Intelligenz – doch eine Differenz von nur zwei Punkten im obersten Bereich verändert die Qualität der praktischen Ergebnisse kaum; betrachten Sie daher Gruppen ähnlicher Modelle als grob äquivalent, statt minimale Unterschiede als entscheidend zu werten.
Bewerten Sie Intelligenz stets gemeinsam mit Preis und Geschwindigkeit. Ein Frontier-Modell wie Opus 4.8 kostet pro Token deutlich mehr als DeepSeek V4 Flash (40,3) oder GLM-5.2, die 70–90 % der Intelligenz zu einem Bruchteil der Kosten liefern. Für hochvolumige oder latenzkritische Anwendungen überzeugt meist ein günstigeres, schnelleres Modell; bei den anspruchsvollsten Schlussfolger- und Agentenaufgaben rechtfertigt die Spitze der Tabelle ihren Aufpreis. Sortieren Sie nach der Metrik, die am besten zu Ihrem Anwendungsfall passt.
| # | Modell ↓ | Entwickler | Intelligenz ↓ | Kontext ↓ | Eingabe $/1 Mio. ↓ | Ausgabe $/1 Mio. ↓ | Open Weights |
|---|---|---|---|---|---|---|---|
| 1 | Claude Opus 5 | Anthropic | 61 | 1 Mio. | $5.00 | $25.00 | Nein |
| 2 | GPT-6 Astra | OpenAI | 61 | 1,05 Mio. | $10.00 | $50.00 | Nein |
| 3 | Claude Fable 5 | Anthropic | 60 | 1 Mio. | $10.00 | $50.00 | Nein |
| 4 | GPT-5.6 Sol | OpenAI | 59 | 1,05 Mio. | $5.00 | $30.00 | Nein |
| 5 | Kimi K3 | Moonshot AI | 57 | 1 Mio. | $3.00 | $15.00 | Ja |
| 6 | Claude Opus 4.8 | Anthropic | 55.7 | 1 Mio. | $5.00 | $25.00 | Nein |
| 7 | GPT-5.5 | OpenAI | 54.8 | 1,05 Mio. | $5.00 | $30.00 | Nein |
| 8 | GLM 5.2 | Zhipu AI | 51.1 | 1 Mio. | $1.40 | $4.40 | Ja |
| 9 | Gemini 3.5 Flash | 50.2 | 1 Mio. | $1.50 | $9.00 | Nein | |
| 10 | Claude Sonnet 4.6 | Anthropic | 47 | 1 Mio. | $3.00 | $15.00 | Nein |
| 11 | Gemini 3.1 Pro | 46.5 | 1,05 Mio. | $2.00 | $12.00 | Nein | |
| 12 | DeepSeek V4-Pro | DeepSeek | 44.3 | 1 Mio. | $0.44 | $0.87 | Ja |
| 13 | Kimi K2.7 Code | Moonshot AI | 42 | 256K | $0.60 | $2.50 | Ja |
| 14 | DeepSeek V4-Flash | DeepSeek | 40.3 | 1 Mio. | $0.14 | $0.28 | Ja |
| 15 | Claude Haiku 4.5 | Anthropic | 37 | 200 K | $1.00 | $5.00 | Nein |
| 16 | DeepSeek R1 | DeepSeek | 20.1 | 128 K | $0.50 | $2.15 | Ja |
| 17 | Mistral Large 3 | Mistral AI | 15.9 | 256K | $2.00 | $6.00 | Ja |
| 18 | Llama 4 Maverick | Meta | 14.3 | 1 Mio. | $0.20 | $0.80 | Ja |
| 19 | Qwen3 235B-A22B | Alibaba | 13 | 128 K | $0.45 | $1.80 | Ja |
| 20 | Qwen3 32B | Alibaba | 12 | 128 K | $0.08 | $0.28 | Ja |
| 21 | Llama 4 Scout | Meta | 10.0 | 10 Mio. | $0.10 | $0.30 | Ja |
| 22 | Gemma 3 27B | 7.4 | 128 K | $0.08 | $0.16 | Ja | |
| 23 | Phi-4 | Microsoft | 4.9 | 16K | $0.07 | $0.14 | Ja |
| 24 | Claude Opus 5.5 | Anthropic | — | — | $4.00 | $20.00 | Nein |
| 25 | Claude Sonnet 5 | Anthropic | — | 1 Mio. | $2.00 | $10.00 | Nein |
| 26 | Claude Sonnet 5.5 | Anthropic | — | — | $2.00 | $10.00 | Nein |
| 27 | DeepSeek R1 Distill Llama 70B | DeepSeek | — | 128 K | $0.80 | $0.80 | Ja |
| 28 | Gemini 2.5 Pro | — | 1 Mio. (1.048.576 Tokens) | $1.25 | $10.00 | Nein | |
| 29 | Gemini 3.6 Flash | — | 1 Mio. | $1.50 | $7.50 | Nein | |
| 30 | Gemini 3.8 Flash | — | 1 Mio. | $0.75 | $3.75 | Nein | |
| 31 | Gemini 4 Argon | Google DeepMind | — | — | $2.00 | $10.00 | Nein |
| 32 | Gemma 3 12B | — | 128 K | $0.05 | $0.15 | Ja | |
| 33 | Gemma 3 4B | — | 128 K | $0.05 | $0.10 | Ja | |
| 34 | GPT-6 Luna | OpenAI | — | 1,05 Mio. | $0.10 | $0.50 | Nein |
| 35 | GPT-6 Sol | OpenAI | — | 1,05 Mio. | $2.00 | $10.00 | Nein |
| 36 | GPT-6.1 Sol | OpenAI | — | — | $2.00 | $10.00 | Nein |
| 37 | Grok 4 | xAI | — | 256.000 Tokens | $3.00 | $15.00 | Nein |
| 38 | Kling 2.5 Turbo Pro | Kuaishou | — | — | — | — | Nein |
| 39 | Llama 3.1 8B | Meta | — | 128 K | $0.02 | $0.03 | Ja |
| 40 | Llama 3.3 70B | Meta | — | 128 K | $0.10 | $0.32 | Ja |
| 41 | MiniMax H3 (Hailuo 3.0) | MiniMax | — | — | — | — | Ja |
| 42 | Mistral 7B | Mistral AI | — | 32K | $0.02 | $0.03 | Ja |
| 43 | Mistral NeMo 12B | Mistral AI | — | 128 K | $0.02 | $0.04 | Ja |
| 44 | NVIDIA Nemotron 3 Nano Omni | NVIDIA | — | 256K | — | — | Ja |
| 45 | Qwen3 14B | Alibaba | — | 128 K | $0.12 | $0.24 | Ja |
| 46 | Qwen3 30B-A3B | Alibaba | — | 128 K | $0.12 | $0.50 | Ja |
| 47 | Qwen3 8B | Alibaba | — | 128 K | $0.04 | $0.14 | Ja |
| 48 | Seedance 2.5 | ByteDance | — | — | — | — | Nein |
| 49 | Sora 2 | OpenAI | — | — | — | — | Nein |
| 50 | Sora 2 Pro | OpenAI | — | — | — | — | Nein |
| 51 | Veo 3.1 | — | — | — | — | Nein | |
| 52 | Wan 2.5 | Alibaba | — | — | — | — | Nein |
Click any column heading to re-sort. Intelligence = a 0–100 composite of public reasoning/knowledge benchmarks; — means not yet scored. Prices are USD per 1M tokens. Updated October 2026.
Häufig gestellte Fragen (FAQ)
Welches ist derzeit das beste LLM?
Stand Mitte 2026 ist Claude Opus 4.8 das Modell mit der höchsten Bewertung im Artificial Analysis Intelligence Index (55,7), knapp vor GPT-5.5 (54,8). Beide führen bei Aufgaben rund um Schlussfolgern, Programmieren und agentenbasierte Anwendungen, sodass die praktische Wahl zwischen ihnen meist von Preis, Geschwindigkeit und Ökosystem abhängt – nicht von einem signifikanten Unterschied in der Intelligenz.
Welches ist das intelligenteste Open-Source-Modell?
GLM-5.2 ist derzeit das intelligenteste Open-Weight-Modell mit 51,1 Punkten im Intelligenzindex – vor DeepSeek V4 Pro (44,3) und DeepSeek V4 Flash (40,3). Damit liegen die besten Open-Modelle nur etwa vier Punkte hinter proprietären Frontier-Modellen wie GPT-5.5, während sie weiterhin kostenlos selbst gehostet oder über kostengünstige APIs ausgeführt werden können.
Welches KI-Modell bietet den besten Wert?
DeepSeek V4 Flash und GLM-5.2 bieten das beste Verhältnis von Intelligenz zu Preis. DeepSeek V4 Flash erzielt 40,3 Punkte zu einem Bruchteil der Kosten von Opus 4.8 und liefert damit rund 70 % der Top-Bewertung für nur einen kleinen Anteil der Ausgaben. Für budgetkritische oder hochvolumige Workloads sind diese Open-Modelle eindeutig die wertorientierten Spitzenreiter.
Wie wird die Intelligenz-Bewertung berechnet?
Unsere Bewertungen orientieren sich am Artificial Analysis Intelligence Index v4.1 – einem zusammengesetzten Wert von 0 bis 100, der neun anspruchsvolle Tests umfasst, darunter Humanity’s Last Exam, GPQA Diamond, Terminal-Bench, SciCode sowie Aufgaben zur agentenbasierten Werkzeugnutzung. Er misst Schlussfolgerfähigkeit, Wissen, Programmierkompetenz und agentenbasierte Fähigkeiten in einer einzigen Zahl: Ein höherer Wert bedeutet also generell mehr Kompetenz bei schwierigen, realen Aufgaben.
