Saturday, 10 October 2026 | Updating Daily AI insight, written for builders

LLM-Leaderboard 2026 – KI-Modell-Intelligenzindex

Im Jahr 2026 führt Claude Opus 4.8 unseren Intelligenzindex mit 55,7 Punkten an, knapp vor OpenAIs GPT-5.5 (54,8). Googles Gemini 3.5 Flash (50,2) und das open-weight-Modell GLM-5.2 (51,1) folgen dicht dahinter, während Gemini 3.1 Pro (46,5) und DeepSeek V4 Pro (44,3) das vorderste Feld abschließen. Falls Ihre Wahl tatsächlich zwischen den beiden Assistenten und nicht zwischen den zugrundeliegenden Rohmodellen liegt, behandelt der Vergleich Claude vs. ChatGPT diesen Aspekt direkt im Kopf-an-Kopf-Vergleich. Das einzige „beste“ Modell hängt davon ab, wie stark Sie Intelligenz gegenüber Preis und Geschwindigkeit gewichten.

Die Spalte ‚Intelligenz‘ zeigt einen zusammengesetzten Wert von 0 bis 100 gemäß dem Artificial Analysis Intelligence Index v4.1, der neun anspruchsvolle Bewertungen aus den Bereichen logisches Denken, Programmierung, agentenbasierte Werkzeugnutzung und naturwissenschaftliches Wissen vereint. Höhere Werte bedeuten mehr Intelligenz – doch eine Differenz von nur zwei Punkten im obersten Bereich verändert die Qualität der praktischen Ergebnisse kaum; betrachten Sie daher Gruppen ähnlicher Modelle als grob äquivalent, statt minimale Unterschiede als entscheidend zu werten.

Bewerten Sie Intelligenz stets gemeinsam mit Preis und Geschwindigkeit. Ein Frontier-Modell wie Opus 4.8 kostet pro Token deutlich mehr als DeepSeek V4 Flash (40,3) oder GLM-5.2, die 70–90 % der Intelligenz zu einem Bruchteil der Kosten liefern. Für hochvolumige oder latenzkritische Anwendungen überzeugt meist ein günstigeres, schnelleres Modell; bei den anspruchsvollsten Schlussfolger- und Agentenaufgaben rechtfertigt die Spitze der Tabelle ihren Aufpreis. Sortieren Sie nach der Metrik, die am besten zu Ihrem Anwendungsfall passt.

# Modell ↓ Entwickler Intelligenz ↓ Kontext ↓ Eingabe $/1 Mio. ↓ Ausgabe $/1 Mio. ↓ Open Weights
1 Claude Opus 5 Anthropic 61 1 Mio. $5.00 $25.00 Nein
2 GPT-6 Astra OpenAI 61 1,05 Mio. $10.00 $50.00 Nein
3 Claude Fable 5 Anthropic 60 1 Mio. $10.00 $50.00 Nein
4 GPT-5.6 Sol OpenAI 59 1,05 Mio. $5.00 $30.00 Nein
5 Kimi K3 Moonshot AI 57 1 Mio. $3.00 $15.00 Ja
6 Claude Opus 4.8 Anthropic 55.7 1 Mio. $5.00 $25.00 Nein
7 GPT-5.5 OpenAI 54.8 1,05 Mio. $5.00 $30.00 Nein
8 GLM 5.2 Zhipu AI 51.1 1 Mio. $1.40 $4.40 Ja
9 Gemini 3.5 Flash Google 50.2 1 Mio. $1.50 $9.00 Nein
10 Claude Sonnet 4.6 Anthropic 47 1 Mio. $3.00 $15.00 Nein
11 Gemini 3.1 Pro Google 46.5 1,05 Mio. $2.00 $12.00 Nein
12 DeepSeek V4-Pro DeepSeek 44.3 1 Mio. $0.44 $0.87 Ja
13 Kimi K2.7 Code Moonshot AI 42 256K $0.60 $2.50 Ja
14 DeepSeek V4-Flash DeepSeek 40.3 1 Mio. $0.14 $0.28 Ja
15 Claude Haiku 4.5 Anthropic 37 200 K $1.00 $5.00 Nein
16 DeepSeek R1 DeepSeek 20.1 128 K $0.50 $2.15 Ja
17 Mistral Large 3 Mistral AI 15.9 256K $2.00 $6.00 Ja
18 Llama 4 Maverick Meta 14.3 1 Mio. $0.20 $0.80 Ja
19 Qwen3 235B-A22B Alibaba 13 128 K $0.45 $1.80 Ja
20 Qwen3 32B Alibaba 12 128 K $0.08 $0.28 Ja
21 Llama 4 Scout Meta 10.0 10 Mio. $0.10 $0.30 Ja
22 Gemma 3 27B Google 7.4 128 K $0.08 $0.16 Ja
23 Phi-4 Microsoft 4.9 16K $0.07 $0.14 Ja
24 Claude Opus 5.5 Anthropic — — $4.00 $20.00 Nein
25 Claude Sonnet 5 Anthropic — 1 Mio. $2.00 $10.00 Nein
26 Claude Sonnet 5.5 Anthropic — — $2.00 $10.00 Nein
27 DeepSeek R1 Distill Llama 70B DeepSeek — 128 K $0.80 $0.80 Ja
28 Gemini 2.5 Pro Google — 1 Mio. (1.048.576 Tokens) $1.25 $10.00 Nein
29 Gemini 3.6 Flash Google — 1 Mio. $1.50 $7.50 Nein
30 Gemini 3.8 Flash Google — 1 Mio. $0.75 $3.75 Nein
31 Gemini 4 Argon Google DeepMind — — $2.00 $10.00 Nein
32 Gemma 3 12B Google — 128 K $0.05 $0.15 Ja
33 Gemma 3 4B Google — 128 K $0.05 $0.10 Ja
34 GPT-6 Luna OpenAI — 1,05 Mio. $0.10 $0.50 Nein
35 GPT-6 Sol OpenAI — 1,05 Mio. $2.00 $10.00 Nein
36 GPT-6.1 Sol OpenAI — — $2.00 $10.00 Nein
37 Grok 4 xAI — 256.000 Tokens $3.00 $15.00 Nein
38 Kling 2.5 Turbo Pro Kuaishou — — — — Nein
39 Llama 3.1 8B Meta — 128 K $0.02 $0.03 Ja
40 Llama 3.3 70B Meta — 128 K $0.10 $0.32 Ja
41 MiniMax H3 (Hailuo 3.0) MiniMax — — — — Ja
42 Mistral 7B Mistral AI — 32K $0.02 $0.03 Ja
43 Mistral NeMo 12B Mistral AI — 128 K $0.02 $0.04 Ja
44 NVIDIA Nemotron 3 Nano Omni NVIDIA — 256K — — Ja
45 Qwen3 14B Alibaba — 128 K $0.12 $0.24 Ja
46 Qwen3 30B-A3B Alibaba — 128 K $0.12 $0.50 Ja
47 Qwen3 8B Alibaba — 128 K $0.04 $0.14 Ja
48 Seedance 2.5 ByteDance — — — — Nein
49 Sora 2 OpenAI — — — — Nein
50 Sora 2 Pro OpenAI — — — — Nein
51 Veo 3.1 Google — — — — Nein
52 Wan 2.5 Alibaba — — — — Nein

Click any column heading to re-sort. Intelligence = a 0–100 composite of public reasoning/knowledge benchmarks; — means not yet scored. Prices are USD per 1M tokens. Updated October 2026.

Häufig gestellte Fragen (FAQ)

Welches ist derzeit das beste LLM?

Stand Mitte 2026 ist Claude Opus 4.8 das Modell mit der höchsten Bewertung im Artificial Analysis Intelligence Index (55,7), knapp vor GPT-5.5 (54,8). Beide führen bei Aufgaben rund um Schlussfolgern, Programmieren und agentenbasierte Anwendungen, sodass die praktische Wahl zwischen ihnen meist von Preis, Geschwindigkeit und Ökosystem abhängt – nicht von einem signifikanten Unterschied in der Intelligenz.

Welches ist das intelligenteste Open-Source-Modell?

GLM-5.2 ist derzeit das intelligenteste Open-Weight-Modell mit 51,1 Punkten im Intelligenzindex – vor DeepSeek V4 Pro (44,3) und DeepSeek V4 Flash (40,3). Damit liegen die besten Open-Modelle nur etwa vier Punkte hinter proprietären Frontier-Modellen wie GPT-5.5, während sie weiterhin kostenlos selbst gehostet oder über kostengünstige APIs ausgeführt werden können.

Welches KI-Modell bietet den besten Wert?

DeepSeek V4 Flash und GLM-5.2 bieten das beste Verhältnis von Intelligenz zu Preis. DeepSeek V4 Flash erzielt 40,3 Punkte zu einem Bruchteil der Kosten von Opus 4.8 und liefert damit rund 70 % der Top-Bewertung für nur einen kleinen Anteil der Ausgaben. Für budgetkritische oder hochvolumige Workloads sind diese Open-Modelle eindeutig die wertorientierten Spitzenreiter.

Wie wird die Intelligenz-Bewertung berechnet?

Unsere Bewertungen orientieren sich am Artificial Analysis Intelligence Index v4.1 – einem zusammengesetzten Wert von 0 bis 100, der neun anspruchsvolle Tests umfasst, darunter Humanity’s Last Exam, GPQA Diamond, Terminal-Bench, SciCode sowie Aufgaben zur agentenbasierten Werkzeugnutzung. Er misst Schlussfolgerfähigkeit, Wissen, Programmierkompetenz und agentenbasierte Fähigkeiten in einer einzigen Zahl: Ein höherer Wert bedeutet also generell mehr Kompetenz bei schwierigen, realen Aufgaben.

Scroll to Top