{"id":2102,"date":"2026-08-03T19:59:47","date_gmt":"2026-08-03T19:59:47","guid":{"rendered":"https:\/\/convly.ai\/ai-benchmarks\/"},"modified":"2026-08-03T19:59:47","modified_gmt":"2026-08-03T19:59:47","slug":"ai-benchmarks","status":"publish","type":"page","link":"https:\/\/convly.ai\/de\/ai-benchmarks\/","title":{"rendered":"Erkl\u00e4rung zu KI-Benchmarks (2026): Was jeder einzelne misst und wer aktuell f\u00fchrt"},"content":{"rendered":"<p><strong>Ein KI-Benchmark ist ein festgelegter Satz von Aufgaben, mit dem die Leistungsf\u00e4higkeit eines Modells bewertet wird, damit<br \/>\nverschiedene Modelle anhand desselben Tests verglichen werden k\u00f6nnen.<\/strong> Es gibt keinen einzigen Benchmark, der<br \/>\nentscheidet, welches Modell das beste ist \u2013 jeder misst etwas Spezifisches, und mehrere der bekannten Benchmarks<br \/>\nsind mittlerweile nahezu ausgereizt. Der praktikable Ansatz besteht darin, die zwei bis drei Benchmarks zu betrachten, die Ihrer<br \/>\ntats\u00e4chlichen Arbeitslast entsprechen, und jede einzelne Schlagzeilenzahl kritisch zu hinterfragen.<\/p>\n<h2>Wer f\u00fchrt derzeit<\/h2>\n<p>Sortiert nach dem Artificial Analysis Intelligence Index, einer Zusammensetzung mehrerer unabh\u00e4ngiger<br \/>\nBewertungen statt eines einzelnen Tests. Die letzte Spalte wird bei den meisten Vergleichen weggelassen: die Punktzahl<br \/>\ngeteilt durch den gewichteten Preis \u2013 das ist letztlich das, was Sie tats\u00e4chlich kaufen.<\/p>\n<div class=\"cbm\">\n  <table class=\"cm-table cbm-lead\">\n    <thead><tr><th>#<\/th><th>Modell<\/th><th>Entwickler<\/th><th>Intelligenz-Punktzahl<\/th>\n      <th>Gewichteter Preis pro Million US-Dollar<\/th><th>Punkte pro Dollar<\/th><\/tr><\/thead>\n    <tbody>\n          <tr>\n        <td data-label=\"#\">1<\/td>\n        <td data-label=\"Model\"><a href=\"https:\/\/convly.ai\/de\/model\/claude-opus-5\/\">Claude Opus 5<\/a><\/td>\n        <td data-label=\"Developer\">Anthropic<\/td>\n        <td data-label=\"Score\"><strong>61<\/strong><\/td>\n        <td data-label=\"Blended\">$9.00<\/td>\n        <td data-label=\"Score per $\">6.8<\/td>\n      <\/tr>\n          <tr>\n        <td data-label=\"#\">2<\/td>\n        <td data-label=\"Model\"><a href=\"https:\/\/convly.ai\/de\/model\/claude-fable-5\/\">Claude Fable 5<\/a><\/td>\n        <td data-label=\"Developer\">Anthropic<\/td>\n        <td data-label=\"Score\"><strong>60<\/strong><\/td>\n        <td data-label=\"Blended\">$18.00<\/td>\n        <td data-label=\"Score per $\">3.3<\/td>\n      <\/tr>\n          <tr>\n        <td data-label=\"#\">3<\/td>\n        <td data-label=\"Model\"><a href=\"https:\/\/convly.ai\/de\/model\/gpt-5-6-sol\/\">GPT-5.6 Sol<\/a><\/td>\n        <td data-label=\"Developer\">OpenAI<\/td>\n        <td data-label=\"Score\"><strong>59<\/strong><\/td>\n        <td data-label=\"Blended\">$10.00<\/td>\n        <td data-label=\"Score per $\">5.9<\/td>\n      <\/tr>\n          <tr>\n        <td data-label=\"#\">4<\/td>\n        <td data-label=\"Model\"><a href=\"https:\/\/convly.ai\/de\/model\/kimi-k3\/\">Kimi K3<\/a> <span class=\"cbm-tag\">Open Weights<\/span><\/td>\n        <td data-label=\"Developer\">Moonshot AI<\/td>\n        <td data-label=\"Score\"><strong>57<\/strong><\/td>\n        <td data-label=\"Blended\">$5.40<\/td>\n        <td data-label=\"Score per $\">10.6<\/td>\n      <\/tr>\n          <tr>\n        <td data-label=\"#\">5<\/td>\n        <td data-label=\"Model\"><a href=\"https:\/\/convly.ai\/de\/model\/claude-opus-4-8\/\">Claude Opus 4.8<\/a><\/td>\n        <td data-label=\"Developer\">Anthropic<\/td>\n        <td data-label=\"Score\"><strong>55.7<\/strong><\/td>\n        <td data-label=\"Blended\">$9.00<\/td>\n        <td data-label=\"Score per $\">6.2<\/td>\n      <\/tr>\n          <tr>\n        <td data-label=\"#\">6<\/td>\n        <td data-label=\"Model\"><a href=\"https:\/\/convly.ai\/de\/model\/gpt-5-5\/\">GPT-5.5<\/a><\/td>\n        <td data-label=\"Developer\">OpenAI<\/td>\n        <td data-label=\"Score\"><strong>54.8<\/strong><\/td>\n        <td data-label=\"Blended\">$10.00<\/td>\n        <td data-label=\"Score per $\">5.5<\/td>\n      <\/tr>\n          <tr>\n        <td data-label=\"#\">7<\/td>\n        <td data-label=\"Model\"><a href=\"https:\/\/convly.ai\/de\/model\/glm-5-2\/\">GLM 5.2<\/a> <span class=\"cbm-tag\">Open Weights<\/span><\/td>\n        <td data-label=\"Developer\">Zhipu AI<\/td>\n        <td data-label=\"Score\"><strong>51.1<\/strong><\/td>\n        <td data-label=\"Blended\">$2.00<\/td>\n        <td data-label=\"Score per $\">25.6<\/td>\n      <\/tr>\n          <tr>\n        <td data-label=\"#\">8<\/td>\n        <td data-label=\"Model\"><a href=\"https:\/\/convly.ai\/de\/model\/gemini-3-5-flash\/\">Gemini 3.5 Flash<\/a><\/td>\n        <td data-label=\"Developer\">Google<\/td>\n        <td data-label=\"Score\"><strong>50.2<\/strong><\/td>\n        <td data-label=\"Blended\">$3.00<\/td>\n        <td data-label=\"Score per $\">16.7<\/td>\n      <\/tr>\n          <tr>\n        <td data-label=\"#\">9<\/td>\n        <td data-label=\"Model\"><a href=\"https:\/\/convly.ai\/de\/model\/claude-sonnet-4-6\/\">Claude Sonnet 4.6<\/a><\/td>\n        <td data-label=\"Developer\">Anthropic<\/td>\n        <td data-label=\"Score\"><strong>47<\/strong><\/td>\n        <td data-label=\"Blended\">$5.40<\/td>\n        <td data-label=\"Score per $\">8.7<\/td>\n      <\/tr>\n          <tr>\n        <td data-label=\"#\">10<\/td>\n        <td data-label=\"Model\"><a href=\"https:\/\/convly.ai\/de\/model\/gemini-3-1-pro\/\">Gemini 3.1 Pro<\/a><\/td>\n        <td data-label=\"Developer\">Google<\/td>\n        <td data-label=\"Score\"><strong>46.5<\/strong><\/td>\n        <td data-label=\"Blended\">$4.00<\/td>\n        <td data-label=\"Score per $\">11.6<\/td>\n      <\/tr>\n          <tr>\n        <td data-label=\"#\">11<\/td>\n        <td data-label=\"Model\"><a href=\"https:\/\/convly.ai\/de\/model\/deepseek-v4-pro\/\">DeepSeek V4-Pro<\/a> <span class=\"cbm-tag\">Open Weights<\/span><\/td>\n        <td data-label=\"Developer\">DeepSeek<\/td>\n        <td data-label=\"Score\"><strong>44.3<\/strong><\/td>\n        <td data-label=\"Blended\">$0.522<\/td>\n        <td data-label=\"Score per $\">84.9<\/td>\n      <\/tr>\n          <tr>\n        <td data-label=\"#\">12<\/td>\n        <td data-label=\"Model\"><a href=\"https:\/\/convly.ai\/de\/model\/kimi-k2-7-code\/\">Kimi K2.7 Code<\/a> <span class=\"cbm-tag\">Open Weights<\/span><\/td>\n        <td data-label=\"Developer\">Moonshot AI<\/td>\n        <td data-label=\"Score\"><strong>42<\/strong><\/td>\n        <td data-label=\"Blended\">$0.980<\/td>\n        <td data-label=\"Score per $\">42.9<\/td>\n      <\/tr>\n        <\/tbody>\n  <\/table>\n  <p class=\"cbm-note\">Die Punktzahlen basieren auf der Skala des Artificial Analysis Intelligence Index, einer Zusammensetzung mehrerer unabh\u00e4ngiger Bewertungen statt eines einzelnen Tests \u2013 so sollte man auch eine Schlagzeilenbehauptung wie \u201ebestes Modell\u201c interpretieren. Der st\u00e4rkste Open-Weights-Eintrag ist\n     <a href=\"https:\/\/convly.ai\/de\/model\/kimi-k3\/\">Kimi K3<\/a>\n     mit 57 Punkten. Sortieren Sie die vollst\u00e4ndige Liste selbst auf der\n     <a href=\"https:\/\/convly.ai\/de\/llm-leaderboard\/\">LLM-Leaderboard<\/a>.<\/p>\n<\/div>\n\n<h2>Die f\u00fcr 2026 relevanten Benchmarks<\/h2>\n<h3>MMLU (Massive Multitask Language Understanding)<\/h3>\n<p>Multiple-Choice-Fragen aus 57 Fachgebieten \u2013 von Grundschulmathematik bis hin zum Fachrecht.<br \/>\nJahrelang war dies die Standard-Schlagzeilenzahl; mittlerweile ist dies jedoch zum Problem geworden: Spitzenmodelle liegen so eng beieinander, dass Unterschiede zwischen ihnen innerhalb der statistischen Messunsicherheit liegen. MMLU bleibt zwar n\u00fctzlich, um ein kleines Open-Source-Modell mit einem gro\u00dfen zu vergleichen, ist aber nahezu nutzlos, um zwei Spitzenmodelle voneinander abzugrenzen. Behandeln Sie eine MMLU-Angabe aus dem Jahr 2026 als Mindestanforderungspr\u00fcfung, nicht als Rangliste.<br \/>\nso eng am oberen Ende gruppiert, dass die Unterschiede zwischen ihnen innerhalb des Rauschens liegen. MMLU ist nach wie vor<br \/>\nn\u00fctzlich, um ein kleines offenes Modell mit einem gro\u00dfen zu vergleichen, aber nahezu nutzlos, um zwei State-of-the-Art-Modelle voneinander abzugrenzen. Behandeln Sie eine MMLU-Angabe aus dem Jahr 2026 als Mindestanforderungstest, nicht als Rangfolge.<br \/>\nzwei Spitzenmodelle. Behandeln Sie eine MMLU-Angabe f\u00fcr 2026 als untere Grenze, nicht als Rangfolge.<\/p>\n<h3>GPQA (Graduate-Level Google-Proof Q&amp;A)<\/h3>\n<p>Von Fach-PhDs aus Biologie, Physik und Chemie erstellt und gezielt so konzipiert, dass eine Internetrecherche keine Hilfe bietet.<br \/>\nDieser Benchmark beantwortet eine andere Frage als MMLU: nicht \u201ehat das Modell viel gelesen?\u201c, sondern \u201ekann es wirklich schwierige Probleme in einem technischen Fachgebiet logisch durchdenken?\u201c. Da er sowohl Auswendiglernen als auch reine Informationsabrufstrategien widersteht, hat sich GPQA im Vergleich zu MMLU besser als Differenzierungsma\u00dfstab gehalten.<br \/>\nviel gelesen hat\u201c, sondern \u201ekann es wirklich eine genuinely schwierige Aufgabe aus einem technischen Fachgebiet logisch durchdringen?\u201c Da<br \/>\nes sowohl Auswendiglernen als auch Abruf widersteht, hat es sich im Vergleich zu MMLU besser als Differenzierungskriterium behauptet.<\/p>\n<h3>SWE-bench Verified<\/h3>\n<p>Tats\u00e4chliche Fehlerberichte aus echten GitHub-Repositories, bewertet danach, ob der vom Modell generierte Patch den<br \/>\ndie eigenen Tests des Projekts bestehen. Der Verified-Teil ist der von Menschen validierte Teil, gefiltert, um<br \/>\nAufgaben zu entfernen, die fehlerhaft oder unl\u00f6sbar waren \u2013 weshalb Sie unbedingt pr\u00fcfen sollten, <em>welche<\/em> SWE-bench eine<br \/>\nder vom Anbieter angegebene Wert ist. Dies ist der entscheidungsrelevanteste Benchmark, wenn Sie ein<br \/>\nModell f\u00fcr einen Codierungs-Agenten ausw\u00e4hlen, da sowohl die Aufgabe als auch die Bewertung authentisch sind. Claude Sonnet 5<br \/>\nerreicht 85,2 % bei SWE-bench Verified und 63,2 % beim anspruchsvolleren SWE-bench Pro.<\/p>\n<h3>Terminal-Bench<\/h3>\n<p>Agentische Aufgaben in einer echten Terminal-Umgebung: etwas installieren, einen Fehler diagnostizieren, ein Skript zur<br \/>\nBehebung schreiben. Es misst eine andere F\u00e4higkeit als das Schreiben eines Patches \u2013 n\u00e4mlich die Toleranz gegen\u00fcber mehrstufigen Aufgaben, bei denen<br \/>\ndas Modell seine eigenen Fehlermeldungen lesen und darauf reagieren muss. Claude Sonnet 5 erreicht 80,4 % bei<br \/>\nTerminal-Bench 2.1. Falls Ihr Anwendungsfall ein autonomer Agent und nicht ein Inline-Code-Assistent ist, sagen Ihnen dieser Benchmark und OSWorld mehr als SWE-bench.<br \/>\nAssistenten \u2013 dieser Test und OSWorld liefern Ihnen mehr Informationen als SWE-bench.<\/p>\n<h3>OSWorld<\/h3>\n<p>Computer-Nutzung in einer realen Desktop-Umgebung \u2013 Anwendungen \u00f6ffnen, durch Benutzeroberfl\u00e4chen klicken,<br \/>\neine Aufgabe erledigen, die eine Person mit der Maus ausf\u00fchren w\u00fcrde. Die Ergebnisse hier liegen deutlich unter den Werten bei Text-<br \/>\nBenchmarks, was ehrlich signalisiert, wie unreif Computer-Nutzungs-Agenten nach wie vor sind. Claude Sonnet 5 erreicht 81,2 % bei OSWorld-Verified; NVIDIAs Nemotron 3 Nano Omni,<br \/>\nein offenes 30-Milliarden-Parameter-Modell, erreicht 47,4 % bei OSWorld \u2013 ein solides Ergebnis f\u00fcr seine Gr\u00f6\u00dfe.<br \/>\nein offenes 30-Milliarden-Parameter-Modell, erzielt 47,4 % auf OSWorld \u2013 ein solides Ergebnis f\u00fcr seine Gr\u00f6\u00dfe.<\/p>\n<h3>ARC-AGI<\/h3>\n<p>Abstrakte visuelle Denkaufgaben, die so konstruiert sind, dass Mustererkennung aus Trainingsdaten nicht \u00fcbertragbar ist. Jede Aufgabe besteht aus wenigen Gittertransformationen, die das Modell anhand einiger<br \/>\nBeispiele erschlie\u00dfen muss. ARC-AGI ist das derzeit beste verf\u00fcgbare Instrument zur Messung echter Generalisierungsf\u00e4higkeit statt blo\u00dfer Erinnerung \u2013 daher verl\u00e4uft der Fortschritt langsam und signifikante Verbesserungen werden als bedeutend gewertet.<br \/>\nBeispiele. ARC-AGI ist das derzeit beste verf\u00fcgbare Ma\u00df f\u00fcr echte Generalisierungsf\u00e4higkeit statt blo\u00dfen Abrufs, weshalb Fortschritte darauf langsam sind und Verbesserungen als bedeutend gelten.<br \/>\nals Abruf, weshalb der Fortschritt hier langsam ist und Fortschritte daher als bedeutend gelten.<br \/>\nClaude Opus 5 liegt bei ARC-AGI 3 etwa dreimal so hoch wie das jeweils n\u00e4chstbeste Modell.<\/p>\n<h3>Die letzte Pr\u00fcfung der Menschheit<\/h3>\n<p>Von Experten erstellte Fragen aus zahlreichen Disziplinen, speziell entwickelt, um der S\u00e4ttigung entgegenzuwirken, die MMLU \u00fcberrollt hat. Das Ziel war ein Benchmark, der auch bei steigender Modellleistung weiterhin herausfordernd bleibt,<br \/>\nsodass die Ergebnisse per Konstruktion niedrig ausfallen und bereits kleine Verbesserungen aussagekr\u00e4ftig sind. Lesen Sie ihn als \u201eFrontier-Diskriminator\u201c, nicht als Ma\u00dfstab f\u00fcr die Alltagstauglichkeit.<br \/>\nsind die Punktzahlen daher konstruktionsbedingt niedrig, und bereits kleine Gewinne sind aussagekr\u00e4ftig. Lesen Sie sie als Differenzierungskriterium f\u00fcr State-of-the-Art-Modelle, nicht als Ma\u00df f\u00fcr die N\u00fctzlichkeit im allt\u00e4glichen Einsatz.<br \/>\nDiskriminator, nicht als Ma\u00df f\u00fcr die N\u00fctzlichkeit im gew\u00f6hnlichen Arbeitsalltag.<\/p>\n<h3>Artificial Analysis Intelligence Index<\/h3>\n<p>Kein einzelner Test, sondern eine Zusammenfassung mehrerer unabh\u00e4ngiger Bewertungen zu einer einzigen Kennzahl. Genau darin liegt sein Wert: Einzelne Benchmarks k\u00f6nnen gezielt optimiert werden, w\u00e4hrend eine Kombination deutlich schwerer zu manipulieren ist. Er wird in der obigen Tabelle verwendet. Claude Opus 5 f\u00fchrt derzeit mit 61 Punkten, gefolgt von Claude Fable 5 mit 60 und GPT-5.6 Sol mit 59 \u2013 sowie Kimi K3 mit 57, dem besten bisher dokumentierten Ergebnis f\u00fcr ein Open-Weight-Modell, das nur vier Punkte hinter dem besten Closed-Weight-Modell liegt.<br \/>\nihren Wert: Ein einzelner Benchmark kann gezielt optimiert werden, w\u00e4hrend eine Kombination aus mehreren Benchmarks deutlich schwerer zu manipulieren ist. Sie stellt die<br \/>\nSkala, die in der obigen Tabelle verwendet wird. Claude Opus 5 ist derzeit mit 61 f\u00fchrend, gefolgt von Claude Fable 5 mit 60 und GPT-5.6 Sol mit 59 \u2013 sowie Kimi K3 mit 57, dem bislang st\u00e4rksten Ergebnis eines offenen Modells, das nur vier Punkte hinter dem besten geschlossenen Modell liegt.<br \/>\ninnerhalb von vier Punkten des besten geschlossenen Modells.<br \/>\ninnerhalb von vier Punkten des besten geschlossenen Modells.<\/p>\n<h2>Wie man eine Benchmark-Angabe liest<\/h2>\n<p><strong>Fragen Sie, wer sie durchgef\u00fchrt hat.<\/strong> Ein vom Anbieter selbst ver\u00f6ffentlichtes Ergebnis auf dessen Launch-Seite und eine unabh\u00e4ngige Bewertung stellen unterschiedliche Arten von Evidenz dar. Unabh\u00e4ngige Leaderboards wenden denselben Testrahmen (\u201eharness\u201c) auf jedes Modell an; ein Anbieter w\u00e4hlt hingegen seine eigenen Bedingungen.<br \/>\nunabh\u00e4ngige Bewertungen stellen eine andere Art von Evidenz dar. Unabh\u00e4ngige Leaderboards wenden denselben Testrahmen (\u201eharness\u201c) auf jedes Modell an; ein Anbieter w\u00e4hlt hingegen seine eigenen Bedingungen.<br \/>\nunabh\u00e4ngige Bewertungen stellen eine andere Art von Evidenz dar. Unabh\u00e4ngige Leaderboards wenden denselben Testrahmen (\u201eharness\u201c) auf jedes Modell an; ein Anbieter w\u00e4hlt hingegen seine eigenen Bedingungen.<\/p>\n<p><strong>Pr\u00fcfen Sie auf Datenkontamination.<\/strong> Wenn die Fragen eines Benchmarks vor dem Stichtag f\u00fcr die Trainingsdaten eines Modells ver\u00f6ffentlicht wurden und \u00f6ffentlich zug\u00e4nglich sind, befinden sich wahrscheinlich einige davon bereits in den Trainingsdaten. Dies ist der Hauptgrund daf\u00fcr, dass \u00e4ltere Benchmarks im Laufe der Zeit \u00fcberh\u00f6hte Werte anzeigen \u2013 und warum neuere Benchmarks bewusst \u201eGoogle-sicher\u201c gestaltet oder vollst\u00e4ndig zur\u00fcckgehalten werden.<br \/>\nTrainingsstoppdatum liegen und \u00f6ffentlich zug\u00e4nglich sind, befinden sich einige von ihnen wahrscheinlich bereits im Trainingsdatensatz. Dies ist der<br \/>\nHauptgrund daf\u00fcr, dass \u00e4ltere Benchmarks im Laufe der Zeit \u00fcberh\u00f6hte Werte anzeigen, und warum neuere Benchmarks gezielt \u201eGoogle-proof\u201c gestaltet oder vollst\u00e4ndig zur\u00fcckgehalten werden.<br \/>\n\u201eGoogle-proof\u201c gestaltet oder vollst\u00e4ndig zur\u00fcckgehalten werden.<\/p>\n<p><strong>Achten Sie auf verschobene Zielmarken.<\/strong> \u201eSWE-bench\u201c ohne Zusatz \u201eVerified\u201c, ein nicht n\u00e4her benannter Teildatensatz,<br \/>\neine andere Anzahl zul\u00e4ssiger Versuche oder ein Vergleich eines Ergebnisses mit Werkzeugnutzung gegen eines ohne \u2013 all dies sind \u00fcbliche Wege, wie ein Vergleich seine Vergleichbarkeit verliert.<br \/>\nsind die \u00fcblichen Gr\u00fcnde, warum ein Vergleich nicht mehr \u201eapples-to-apples\u201c bleibt.<\/p>\n<p><strong>Vorsicht vor S\u00e4ttigung.<\/strong> Wenn jedes ernstzunehmende Modell bei einem Test \u00fcber 90 Punkte erreicht, rangiert dieser Test nicht mehr sinnvoll. Unterschiede von einem oder zwei Punkten an der Spitze eines ges\u00e4ttigten<br \/>\nBenchmarks sind Rauschen, kein Signal.<br \/>\nBenchmarks sind Rauschen statt Signal.<\/p>\n<p><strong>Der Preis geh\u00f6rt zur Bewertung.<\/strong> Ein Modell, das zwei Punkte besser, aber sechsmal teurer ist, ist f\u00fcr die meisten Workloads nicht besser. Deshalb enth\u00e4lt die obige Tabelle eine Spalte \u201ePunkte pro Dollar\u201c, und deshalb existiert der<br \/>\nteuer ist, bedeutet nicht automatisch besser f\u00fcr die meisten Workloads. Deshalb enth\u00e4lt die obige Tabelle eine Spalte mit der Kennzahl \u201ePunkte pro Dollar\u201c sowie die<br \/>\nSpalte und warum die <a href=\"https:\/\/convly.ai\/de\/ai-price-performance-index-2026\/\">Preis-Leistungs-<br \/>\nIndex<\/a> .<\/p>\n<h2>Welcher Benchmark ist f\u00fcr Sie tats\u00e4chlich relevant?<\/h2>\n<p><strong>F\u00fcr die Entwicklung eines Codierungs-Agenten:<\/strong> Zuerst SWE-bench Verified, dann Terminal-Bench.<br \/>\nIgnorieren Sie MMLU vollst\u00e4ndig.<\/p>\n<p><strong>Entwicklung eines Computer-Nutzungs- oder Desktop-Agents:<\/strong> OSWorld, dann Terminal-Bench.<br \/>\nErwarten Sie, dass die absoluten Zahlen niedrig ausfallen.<\/p>\n<p><strong>Technische oder wissenschaftliche Fragebeantwortung:<\/strong> GPQA und Humanity\u2019s Last Exam, falls<br \/>\nIhre Fragen tats\u00e4chlich expertenniveau sind.<\/p>\n<p><strong>Allgemeiner Assistent oder Chat:<\/strong> Ein zusammengesetzter Index ist aussagekr\u00e4ftiger als ein einzelner Test, da kein einziger Benchmark die breite Palette an Aufgaben widerspiegelt, die echte Nutzer stellen.<br \/>\nAuswahl eines kleinen Modells f\u00fcr das Selbsthosting:<\/p>\n<p><strong>Benchmarks spielen eine geringere Rolle als die Passgenauigkeit. Pr\u00fcfen Sie zuerst<\/strong> was physisch auf Ihrer Hardware l\u00e4uft, und vergleichen Sie anschlie\u00dfend<br \/>\ndie Benchmark-Ergebnisse nur unter den Modellen, die darauf lauff\u00e4hig sind.<br \/>\n<a href=\"https:\/\/convly.ai\/de\/llm-vram-calculator\/\">VRAM-Rechner<\/a> Ver\u00f6ffentlichte Benchmark-Ergebnisse in unserer Datenbank<br \/>\nVer\u00f6ffentlichte Ergebnisse<\/p>\n<h2>Artificial Analysis Intelligence Index: 59.<\/h2>\n<div class=\"cbm\">\n  <table class=\"cm-table cbm-scores\">\n    <thead><tr><th>Modell<\/th><th>SWE-Bench Verified 85,2 %; SWE-Bench Pro 63,2 %; Terminal-Bench 2.1 80,4 %; OSWorld-Verified 81,2 %.<\/th><\/tr><\/thead>\n    <tbody>\n          <tr>\n        <td data-label=\"Model\"><a href=\"https:\/\/convly.ai\/de\/model\/gpt-5-6-sol\/\">GPT-5.6 Sol<\/a><\/td>\n        <td data-label=\"Results\">Artificial Analysis Intelligence Index: 61 (Platz 1 von 170 Modellen). Mehr als doppelt so hoch wie Opus 4.8 auf Frontier-Bench v0.1; rund dreimal so hoch wie das n\u00e4chstbeste Modell auf ARC-AGI 3.<\/td>\n      <\/tr>\n          <tr>\n        <td data-label=\"Model\"><a href=\"https:\/\/convly.ai\/de\/model\/claude-sonnet-5\/\">Claude Sonnet 5<\/a><\/td>\n        <td data-label=\"Results\">OCRBench V2: 67,04 | Video-MME: 72,2 | OSWorld: 47,4 | Speech IF: 89,39<\/td>\n      <\/tr>\n          <tr>\n        <td data-label=\"Model\"><a href=\"https:\/\/convly.ai\/de\/model\/claude-opus-5\/\">Claude Opus 5<\/a><\/td>\n        <td data-label=\"Results\">Nur Modelle, deren Entwickler konkrete Zahlen ver\u00f6ffentlichen, werden aufgef\u00fchrt. Ein Fehlen hier bedeutet nicht, dass ein Modell schlecht abschneidet \u2013 sondern lediglich, dass wir keine ver\u00f6ffentlichte Zahl verifiziert haben; dies ist an sich bereits eine wichtige Information, insbesondere wenn ein Anbieter mit einer Benchmark-Angabe wirbt.<\/td>\n      <\/tr>\n          <tr>\n        <td data-label=\"Model\"><a href=\"https:\/\/convly.ai\/de\/model\/nvidia-nemotron-3-nano-omni\/\">NVIDIA Nemotron 3 Nano Omni<\/a><\/td>\n        <td data-label=\"Results\">Was ist ein KI-Benchmark?<\/td>\n      <\/tr>\n        <\/tbody>\n  <\/table>\n  <p class=\"cbm-note\">Eine feste Aufgabensammlung mit definiertem Bewertungsverfahren, um verschiedene Modelle an identischen Eingaben vergleichen zu k\u00f6nnen. Benchmarks reichen von Multiple-Choice-Wissenspr\u00fcfungen wie MMLU<\/p>\n<\/div>\n\n<h2>H\u00e4ufig gestellte Fragen<\/h2>\n<div class=\"cbm-faq\">\n<details class=\"cmp-q\">\n<summary>bis hin zu agentischen Aufgaben wie der L\u00f6sung realer GitHub-Probleme auf SWE-Bench; jeder misst jedoch nur einen eng begrenzten Aspekt der Leistungsf\u00e4higkeit und nicht die Gesamtqualit\u00e4t.<\/summary>\n<p>Welcher KI-Benchmark ist am zuverl\u00e4ssigsten?<br \/>\nKeiner einzeln. Zusammengesetzte Indizes sind die zuverl\u00e4ssigste \u00dcbersichtsgr\u00f6\u00dfe, weil es deutlich schwieriger ist, mehrere unterschiedliche Bewertungen gleichzeitig zu optimieren als sich gezielt auf einen einzelnen Test einzustellen. F\u00fcr eine konkrete Entscheidung ist der zuverl\u00e4ssigste Benchmark derjenige, der Ihrer eigentlichen Arbeitslast am n\u00e4chsten kommt \u2013 beispielsweise SWE-Bench Verified f\u00fcr Code-Agenten, OSWorld f\u00fcr Computer-Nutzung oder GPQA f\u00fcr technisches Schlussfolgern.<br \/>\nWas ist 2026 eine gute MMLU-Punktzahl?<br \/>\nMMLU ist bei f\u00fchrenden Modellen weitgehend ges\u00e4ttigt, sodass eine hohe Punktzahl sie nicht mehr voneinander unterscheidet.<\/p>\n<\/details>\n<details class=\"cmp-q\">\n<summary>Sie bleibt jedoch n\u00fctzlich zur Einordnung kleinerer Open-Source-Modelle, bei denen die Leistungsspanne noch deutlich ist. Wenn Sie zwei Spitzenmodelle vergleichen, trennt MMLU diese nicht \u2013 hier helfen GPQA oder ein zusammengesetzter Index weiter.<\/summary>\n<p>K\u00f6nnen KI-Benchmarks manipuliert werden?<br \/>\nJa, auf zwei Arten: Zum einen kann Trainingsdaten Benchmark-Fragen enthalten, was die Ergebnisse k\u00fcnstlich erh\u00f6ht, ohne echte Leistungssteigerung zu bewirken \u2013 daher sind neuere Benchmarks speziell darauf ausgelegt, Such- und Auswendiglern-Effekte zu unterbinden. Zum anderen k\u00f6nnen die Evaluationsbedingungen gezielt g\u00fcnstig gew\u00e4hlt werden: etwa ein anderer Datensatz-Teil, mehr Versuche oder der Einsatz externer Tools im Vergleich zu einem Modell, dem diese nicht zur Verf\u00fcgung stehen. Unabh\u00e4ngig betriebene Leaderboards und zusammengesetzte Indizes mildern beide Risiken ab.<br \/>\nVorhersagen Benchmark-Ergebnisse die reale Leistung?<br \/>\nTeilweise. Aufgabenauthentische Benchmarks wie SWE-Bench Verified und OSWorld prognostizieren relativ gut, weil die gestellte Aufgabe identisch mit der realen Anwendung ist. Multiple-Choice-Akademik-Benchmarks hingegen sagen schlecht voraus, da das Beantworten von Pr\u00fcfungsfragen nicht dem entspricht, was die meisten Anwendungen leisten m\u00fcssen. Der zuverl\u00e4ssigste Pr\u00e4diktor bleibt jedoch immer noch eine eigene Evaluation mit Ihren eigenen Daten.<\/p>\n<\/details>\n<details class=\"cmp-q\">\n<summary>Welches Open-Weight-Modell erzielt die h\u00f6chste Punktzahl?<\/summary>\n<p>Kimi K3 mit 57 Punkten im Artificial Analysis Intelligence Index \u2013 das beste bisher dokumentierte Open-Weight-Ergebnis, nur vier Punkte hinter dem besten Closed-Weight-Modell. Die obige Rangliste kennzeichnet jedes Open-Weight-Modell explizit, und die vollst\u00e4ndige Liste ist sortierbar auf der<br \/>\nEs bleibt n\u00fctzlich, um kleinere Open-Modelle einzustufen, bei denen die Leistungsspanne nach wie vor gro\u00df ist. Wenn Sie<br \/>\nzwei State-of-the-Art-Modelle vergleichen, trennt MMLU diese nicht voneinander, stattdessen eignen sich GPQA oder ein zusammengesetzter Index<br \/>\nbesser.<\/p>\n<\/details>\n<details class=\"cmp-q\">\n<summary>K\u00f6nnen KI-Benchmarks manipuliert werden?<\/summary>\n<p>Ja, auf zwei Arten. Zum einen kann Trainingsdaten bereits die Fragen eines Benchmarks enthalten, was zu k\u00fcnstlich \u00fcberh\u00f6hten Scores f\u00fchrt, ohne dass eine echte Leistungssteigerung vorliegt \u2013 weshalb neuere Benchmarks gezielt gegen Such- und Auswendiglern-Effekte robust gestaltet werden. Zum anderen k\u00f6nnen die Evaluierungsbedingungen gezielt g\u00fcnstig gew\u00e4hlt werden: beispielsweise ein anderer Datensatz-Teilbereich, mehr Versuche oder der Einsatz von Tools im Vergleich zu einem Modell, das keine Tools nutzt. Unabh\u00e4ngig betriebene Leaderboards und zusammengesetzte Indizes mindern beide Probleme.<br \/>\ngegen Such- und Auswendiglern-Effekte robust gestaltet werden. Zum anderen k\u00f6nnen die Evaluierungsbedingungen gezielt g\u00fcnstig gew\u00e4hlt werden: beispielsweise ein anderer Datensatz-Teilbereich, mehr Versuche oder der Einsatz von Tools im Vergleich zu einem Modell, das keine Tools nutzt. Unabh\u00e4ngig betriebene Leaderboards und zusammengesetzte Indizes mindern beide Probleme.<br \/>\ngegen Such- und Auswendiglern-Effekte robust gestaltet werden. Zum anderen k\u00f6nnen die Evaluierungsbedingungen gezielt g\u00fcnstig gew\u00e4hlt werden: beispielsweise ein anderer Datensatz-Teilbereich, mehr Versuche oder der Einsatz von Tools im Vergleich zu einem Modell, das keine Tools nutzt. Unabh\u00e4ngig betriebene Leaderboards und zusammengesetzte Indizes mindern beide Probleme.<br \/>\ngegen Such- und Auswendiglern-Effekte robust gestaltet werden. Zum anderen k\u00f6nnen die Evaluierungsbedingungen gezielt g\u00fcnstig gew\u00e4hlt werden: beispielsweise ein anderer Datensatz-Teilbereich, mehr Versuche oder der Einsatz von Tools im Vergleich zu einem Modell, das keine Tools nutzt. Unabh\u00e4ngig betriebene Leaderboards und zusammengesetzte Indizes mindern beide Probleme.<br \/>\ngegen Such- und Auswendiglern-Effekte robust gestaltet werden. Zum anderen k\u00f6nnen die Evaluierungsbedingungen gezielt g\u00fcnstig gew\u00e4hlt werden: beispielsweise ein anderer Datensatz-Teilbereich, mehr Versuche oder der Einsatz von Tools im Vergleich zu einem Modell, das keine Tools nutzt. Unabh\u00e4ngig betriebene Leaderboards und zusammengesetzte Indizes mindern beide Probleme.<\/p>\n<\/details>\n<details class=\"cmp-q\">\n<summary>Vorhersagen Benchmark-Scores die reale Leistung in der Praxis?<\/summary>\n<p>Teilweise. Aufgabenauthentische Benchmarks wie SWE-bench Verified und OSWorld prognostizieren relativ gut, weil die gestellte Aufgabe identisch mit der realen Aufgabe ist. Multiple-Choice-Akademik-Benchmarks hingegen prognostizieren schlecht,<br \/>\nweil sie stark von Fakt-Wissen und Teststrategien abh\u00e4ngen, nicht aber von praktischer Probleml\u00f6sungsf\u00e4higkeit.<br \/>\ndenn das Beantworten von Pr\u00fcfungsfragen ist nicht das, was die meisten Anwendungen tun. Der st\u00e4rkste Pr\u00e4diktor ist<br \/>\nimmer noch eine Bewertung, die Sie selbst anhand Ihrer eigenen Daten erstellen.<\/p>\n<\/details>\n<details class=\"cmp-q\">\n<summary>Welches Open-Weight-Modell erzielt die h\u00f6chste Punktzahl?<\/summary>\n<p>Kimi K3 mit 57 Punkten auf dem Artificial Analysis Intelligence Index \u2013 das beste Ergebnis eines Open-Weight-Modells bisher, nur vier Punkte hinter dem besten Closed-Model. Die obige Rangliste kennzeichnet jeden<br \/>\nOpen-Weight-Eintrag, und die vollst\u00e4ndige Liste l\u00e4sst sich nach allen Spalten sortieren.<br \/>\nOpen-Weight-Eintrag, und die vollst\u00e4ndige Liste l\u00e4sst sich nach allen Spalten sortieren.<br \/>\n<a href=\"https:\/\/convly.ai\/de\/llm-leaderboard\/\">LLM-Leaderboard<\/a>.<\/p>\n<\/details>\n<\/div>","protected":false},"excerpt":{"rendered":"<p>An AI benchmark is a fixed set of tasks used to score a model&#8217;s ability, so that different models can [&hellip;]<\/p>\n","protected":false},"author":1,"featured_media":0,"parent":0,"menu_order":0,"comment_status":"closed","ping_status":"closed","template":"","meta":{"site-sidebar-layout":"default","site-content-layout":"","ast-site-content-layout":"default","site-content-style":"default","site-sidebar-style":"default","ast-global-header-display":"","ast-banner-title-visibility":"","ast-main-header-display":"","ast-hfb-above-header-display":"","ast-hfb-below-header-display":"","ast-hfb-mobile-header-display":"","site-post-title":"","ast-breadcrumbs-content":"","ast-featured-img":"","footer-sml-layout":"","ast-disable-related-posts":"","theme-transparent-header-meta":"","adv-header-id-meta":"","stick-header-meta":"","header-above-stick-meta":"","header-main-stick-meta":"","header-below-stick-meta":"","astra-migrate-meta-layouts":"default","ast-page-background-enabled":"default","ast-page-background-meta":{"desktop":{"background-color":"var(--ast-global-color-5)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"tablet":{"background-color":"","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"mobile":{"background-color":"","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""}},"ast-content-background-meta":{"desktop":{"background-color":"var(--ast-global-color-4)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"tablet":{"background-color":"var(--ast-global-color-4)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"mobile":{"background-color":"var(--ast-global-color-4)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""}},"footnotes":""},"class_list":["post-2102","page","type-page","status-publish","hentry"],"_links":{"self":[{"href":"https:\/\/convly.ai\/de\/wp-json\/wp\/v2\/pages\/2102","targetHints":{"allow":["GET"]}}],"collection":[{"href":"https:\/\/convly.ai\/de\/wp-json\/wp\/v2\/pages"}],"about":[{"href":"https:\/\/convly.ai\/de\/wp-json\/wp\/v2\/types\/page"}],"author":[{"embeddable":true,"href":"https:\/\/convly.ai\/de\/wp-json\/wp\/v2\/users\/1"}],"replies":[{"embeddable":true,"href":"https:\/\/convly.ai\/de\/wp-json\/wp\/v2\/comments?post=2102"}],"version-history":[{"count":0,"href":"https:\/\/convly.ai\/de\/wp-json\/wp\/v2\/pages\/2102\/revisions"}],"wp:attachment":[{"href":"https:\/\/convly.ai\/de\/wp-json\/wp\/v2\/media?parent=2102"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}