Thursday, 24 September 2026 | Updating Daily AI insight, written for builders

Llama 4 Scout vs. Llama 4 Maverick: Spezifikationen, Preise & Entscheidungshilfe (2026)

Aktualisiert · Ursprünglich veröffentlicht am 23. Juni 2026

Meta veröffentlichte Llama 4 Scout und Llama 4 Maverick am selben Tag – dem 5. April 2025 – und es liegt nahe, sie als „die kleine“ und „die große“ Variante zu verstehen. Doch diese Sichtweise ist in Bezug auf Ihre Rechnung falsch. Beide Modelle aktivieren genau 17 Milliarden Parameter pro Token. Unterschiedlich ist lediglich die Größe des Expertenpools, aus dem diese 17 Mrd. Parameter gezogen werden: 16 Experten bei Scout, 128 bei Maverick. Alle anderen Unterschiede – die Preis-Differenz, der Hardware-Aufwand, die Benchmark-Ergebnisse – ergeben sich unmittelbar aus dieser einen architektonischen Entscheidung.

Das bedeutet auch, dass die übliche Intuition „größeres Modell, bessere Antworten“ hier versagt. Maverick umfasst insgesamt 3,7-mal mehr Parameter, liefert aber keineswegs 3,7-mal bessere Ergebnisse; bei einigen Benchmarks schneidet es sogar nicht besser ab. Im Folgenden finden Sie den vollständigen direkten Vergleich, basierend auf Meta’s offizieller Modellkarte und den aktuellen Preisen der Anbieter – inklusive jener Spezifikation, die ständig zitiert wird, aber praktisch nicht verfügbar ist.

Wichtigste Erkenntnisse

  • Gleiche Anzahl aktiver Parameter, unterschiedliche Expertenpools. Scout umfasst insgesamt 109 Mrd. Parameter, davon sind 17 Mrd. pro Token aktiv – verteilt auf 16 Experten. Maverick umfasst insgesamt 400 Mrd. Parameter, davon ebenfalls 17 Mrd. pro Token aktiv – verteilt auf 128 Experten. Der Rechenaufwand pro Token ist nahezu identisch; der Speicherbedarf hingegen nicht.
  • Scouts 10-Mio.-Token-Kontextfenster ist real, doch Sie können es fast sicher nicht mieten. Meta trainierte Scout für 10 Millionen Tokens. Gehostete Anbieter bieten jedoch nur zwischen 128K und ca. 1,3 Mio. an. Die volle Spanne von 10 Mio. erfordert Self-Hosting sowie einen enormen KV-Cache.
  • Mavericks Vorteil konzentriert sich auf Schlussfolgerungsfähigkeit und Programmierung. GPQA Diamond +12,6 Punkte, LiveCodeBench +10,6. Bei Dokumentenverständnis liegen beide Modelle gleichauf – DocVQA erreicht bei beiden 94,4.
  • Scout kostet bei gemischter Berechnung rund 2,3-mal weniger (0,15 USD gegenüber 0,35 USD pro 1 Mio. gemischter Tokens bei einem Eingabe-zu-Ausgabe-Verhältnis von 3:1).
  • Der lokale Hardware-Einsatz ist der Bereich, in dem sich beide Modelle wirklich unterscheiden. Scout passt bei 4-Bit-Quantisierung auf eine einzelne 80-GB-H100-GPU; Maverick benötigt bei 4-Bit etwa 240 GB und bei FP8 einen kompletten 8-GPU-Host.
  • Behandeln Sie Mavericks berühmte LMArena-Punktzahl von 1417 als ungültig. Dieser Wert stammt von einer noch nicht veröffentlichten experimentellen Chat-Variante, nicht von den herunterladbaren Gewichten.

Die 30-Sekunden-Zusammenfassung

Auswählen Scout wenn Sie langdokumentenbasierte Aufgaben, Retrieval, Zusammenfassung, OCR sowie Extraktion von Diagrammen oder Formularen durchführen – oder generell hochvolumige Anwendungen mit stark kumulierenden Kosten pro Token, insbesondere wenn Sie auf einer einzelnen GPU self-hosten möchten. Wählen Sie Maverick wenn Ihre Arbeitslast tatsächlich auf Schlussfolgerungsfähigkeit oder Programmierung ausgerichtet ist, wo sein zweistelliger Vorsprung bei GPQA Diamond und LiveCodeBench die zusätzliche Hardware und die höheren Kosten rechtfertigt. Für die meisten Dokumenten- und Extraktions-Pipelines bringt die 2,3-fach höhere Bezahlung für Maverick nahezu keine messbaren Vorteile.

Architektur: ein einziger Parameter, zwei sehr unterschiedliche Modelle

Beide Modelle sind Mixture-of-Experts-Transformer mit einer von Meta als früher Fusion bezeichneten Architektur für native Multimodalität – Bild- und Text-Token durchlaufen denselben Backbone statt über einen separaten Vision-Adapter verbunden zu werden. Beide akzeptieren Text und Bilder und geben Text aus. Beide haben einen Wissensstand vom August 2024.

Der Unterschied liegt im Router: Scout wählt aus 16 Experten, Maverick aus 128. Da bei beiden Modellen jeweils nur 17 Mrd. Parameter pro Token aktiviert werden, fallen die Kosten für die Berechnung pro Token nahezu identisch aus – doch jeder Experte muss im Arbeitsspeicher resident sein, unabhängig davon, ob er gerade aktiviert wird. Daher benötigt Maverick 3,7-mal so viel Speicher wie Scout, während die Verarbeitung pro Token nur marginal langsamer ist; genau das ermöglicht es, ein sparsames 400-Mrd.-Parameter-Modell zu Preisen anzubieten, die für ein dichtes 400-Mrd.-Parameter-Modell unmöglich wären.

Ein weiterer Unterschied, der erwähnenswert ist: Scout wurde auf rund 40 Billionen Tokens trainiert, Maverick auf rund 22 Billionen. Scout verarbeitete mehr Daten über weniger Experten; Maverick weniger Daten über deutlich mehr Experten. Das erklärt, warum Scout bei breiten Wissens- und Dokumentenaufgaben mithält, bei anspruchsvollen Schlussfolgerungsaufgaben jedoch zurückbleibt.

Kontextfenster: 10 Mio. auf dem Papier, deutlich weniger in der Praxis

Dies ist die am häufigsten zitierte und zugleich irreführendste Zahl der Llama-4-Veröffentlichung. Meta wirbt mit einem „branchenführenden Kontextfenster von 10 Millionen Tokens“ für Scout, das mittels eines interleaved-Attention-Designs ohne Positions-Embeddings erreicht wird. Maverick bietet 1 Mio.

Der Haken: Im Wesentlichen stellt kein gehosteter Anbieter 10 Mio. zur Verfügung. In der Praxis sehen die Limits wie folgt aus: Groq bei rund 128K–131K, DeepInfra bei rund 320K, Together bei rund 328K, Fireworks nahe 1 Mio., OpenRouter listet Scout mit 1.310.720 Tokens und einer Begrenzung von 16.384 Tokens für die Antwort. Um tatsächlich 10 Mio. Tokens nutzen zu können, müssen Sie selbst hosten – und stoßen dann auf die eigentliche Einschränkung: den KV-Cache. Bei Tiefen im mehrmillionenbereich übertrifft dessen Größe die Modellgewichte bei weitem – genau deshalb begrenzen Anbieter ihn.

Der ehrliche Vergleich lautet daher nicht „10 Mio. vs. 1 Mio.“, sondern eher ~1,3 Mio. vs. ~1 Mio. auf den Plattformen, die die meisten Nutzer tatsächlich verwenden – ein echter, aber enger Vorteil für Scout, nicht die zehnfach größere Differenz, die die Spezifikation suggeriert. Falls Sie eine echte Multi-Millionen-Token-Anforderung haben, planen Sie Self-Hosting ein und testen Sie Durchsatz und Leistung bei großer Tiefe, bevor Sie sich endgültig festlegen.

Benchmarks: Wo sich die zusätzlichen 291 Mrd. Parameter bemerkbar machen

Alle nachfolgenden Zahlen stammen aus Meta’s eigenen veröffentlichten Ergebnissen für die Instruct-Varianten. Es handelt sich um Erstpartei-Daten – interpretieren Sie sie daher als Richtwerte, nicht als endgültige Werte.

Benchmark Llama 4 Scout Llama 4 Maverick Lücke
MMLU Pro (Schlussfolgerungsfähigkeit) 74.3 80.5 +6.2
GPQA Diamond (Graduierten-Naturwissenschaften) 57.2 69.8 +12.6
LiveCodeBench (Programmierung) 32.8 43.4 +10.6
MMMU (Bildschlussfolgerung) 69.4 73.4 +4.0
MMMU Pro 52.2 59.6 +7.4
MathVista 70.7 73.7 +3.0
ChartQA 88.8 90.0 +1.2
DocVQA (Test) 94.4 94.4 0.0
MGSM (mehrsprachige Mathematik) 90.6 92.3 +1.7
MTOB-Halbbuch (Englisch → Kgv) 42.2 54.0 +11.8

Die Form dieser Tabelle ist die gesamte Argumentation. Maverick’s Vorteil liegt in großem und konstantem Ausmaß bei Schlussfolgern, Naturwissenschaften und Programmierung — ein relativer Gewinn von 22 % bei GPQA Diamond und ein relativer Gewinn von 32 % bei LiveCodeBench. Bei Dokument- und Diagrammverständnis bricht er jedoch vollständig zusammen: 1,2 Punkte bei ChartQA und ein Unentschieden bei DocVQA.

Falls Ihre Pipeline auf Rechnungsextraktion, Formularauswertung, Beleg-OCR oder Diagrammlesung ausgerichtet ist, besagen Metas eigene Zahlen, dass Maverick Ihre Dokumente nicht besser lesen wird als Scout — und dafür zahlen Sie etwa das 2,3-Fache pro Token. Das ist der einzige wirklich handlungsrelevante Befund hier.

Ein Benchmark, den Sie gänzlich ignorieren sollten: Maverick’s weit verbreitete 1417 LMArena-ELO. Meta reichte eine „experimentelle Chat-Version“ ein, die niemals zum Download bereitgestellt oder allgemein über die API zugänglich gemacht wurde; Forscher stellten fest, dass deren Ausgaben nicht mit den Gewichten auf Hugging Face übereinstimmten. LMArena aktualisierte am 8. April 2025 seine Richtlinien dahingehend, dass für Open-Weight-Einreichungen eine Übereinstimmung mit den veröffentlichten Gewichten erforderlich ist, und erklärte, dass Metas Interpretation der Regeln nicht dem entspricht, was es von Modellanbietern erwartet. Die unveränderten öffentlichen Gewichte erreichten deutlich niedrigere Platzierungen. Welche reale Qualität Mavericks Konversationsfähigkeit auch immer hat — 1417 ist kein Beleg dafür.

Lokale Hardware: VRAM bei FP16, FP8 und 4-Bit

Der Speicherbedarf für Gewichte ergibt sich einfach aus Parameteranzahl × Bytes pro Parameter, zuzüglich etwa 15–25 % für den KV-Cache und Aktivierungsoverhead bei moderaten Kontextlängen. Lange Kontexte treiben den Cache deutlich höher.

Präzision Scout (109 Mrd.) Maverick (400 Mrd.)
BF16/FP16-Gewichte ca. 218 GB ~800 GB
FP8-Gewichte ca. 109 GB ~400 GB
INT4-Gewichte ca. 55 GB ca. 200 GB
INT4 praktisch (inkl. Overhead) ca. 65 GB ca. 240 GB
Minimale realistische Hardware 1× H100 mit 80 GB oder ein Mac mit 128 GB Multi-GPU-Server (4× H100 im 4-Bit-Modus)

Meta stellt ausdrücklich fest, dass Scout „auf einer einzigen NVIDIA-H100-GPU Platz findet“, wenn Int4-Quantisierung verwendet wird, und dass Maverick „auf einem einzelnen H100-Host Platz findet“ — beachten Sie das Wort Host, was einen 8-GPU-Knoten und nicht eine einzelne Karte bedeutet. Ein 8×H100-Knoten bietet 640 GB, was Maverick bei FP8 problemlos bewältigt, aber nicht bei BF16, wo allein die 800 GB Gewichte den Knoten überschreiten. Maverick in voller Genauigkeit benötigt H200-Klasse-Speicher oder zwei Knoten.

Praktisch gesehen: Scout ist ein Single-GPU- oder Single-Workstation-Modell und eines der leistungsfähigsten Modelle, die auf einem Mac Studio mit 128 GB laufen. Maverick ist ausschließlich für Rechenzentren geeignet. Nutzen Sie den VRAM-Rechner um Ihre eigene Konfiguration und Kontexttiefe zu prüfen.

SpezifikationLlama 4 ScoutLlama 4 Maverick
EntwicklerMetaMeta
TypMultimodal (MoE)Multimodal (MoE)
Parameter109 Mrd. insgesamt / 17 Mrd. aktiv (MoE)400 Mrd. insgesamt / 17 Mrd. aktiv (MoE)
Kontextfenster10 Mio.1 Mio.
ModalityText, Bild → TextText, Bild → Text
LizenzLlama 4 Community (EU-beschränkt)Llama 4 Community (EU-beschränkt)
Offene Gewichte✅ Ja✅ Ja
Eingabepreis (pro 1 Mio. Token in USD)$0.1$0.2
Ausgabepreis (pro 1 Mio. Token in USD)$0.3$0.8
VRAM (4-Bit)ca. 65 GBca. 240 GB
Mindest-GPU-Anforderung (lokal)H100 80 GB / Mac 128 GBMulti-GPU-Server
Veröffentlicht20252025

Wesentliche Unterschiede

  • Kosten: Llama 4 Scout ist 133 % günstiger als Llama 4 Maverick – bezogen auf den durchschnittlichen Preis pro Token.
  • Kontext: Llama 4 Scout überzeugt beim Kontextfenster (10 Mio. vs. 1 Mio.) – ideal für lange Dokumente, umfangreiche Codebasen und große RAG-Eingaben.
  • Offenheit: Beide Modelle verfügen über offene Gewichte und können daher entweder selbst gehostet oder feinjustiert werden. Vergleichen Sie oben die erforderliche VRAM-Menge, um zu ermitteln, welches Modell auf Ihrer GPU läuft.
  • Llama 4 Scout lokal ausführen: ca. 65 GB im 4-Bit-Format (mindestens H100 mit 80 GB VRAM oder Mac mit 128 GB RAM).
  • Llama 4 Maverick lokal ausführen: ca. 240 GB im 4-Bit-Format (mindestens Multi-GPU-Server).

Welches Modell sollten Sie wählen?

Llama-4-Scout wählen wenn Sie niedrigere Kosten pro Token bei Hochvolumen-Arbeitslasten benötigen oder ein größeres Kontextfenster benötigen.

Wählen Sie Llama 4 Maverick wenn es in Ihre bestehende Technologieumgebung passt oder Sie Meta bevorzugen.

→ Ermitteln Sie die tatsächlichen Kosten mit dem API-Kostenrechner · prüfen Sie Ihre lokale Hardware mit dem VRAM-Rechner · durchsuchen Sie alle über 30 Modelle.

API-Preise bei verschiedenen Anbietern

Keines der beiden Modelle ist nach Stand der Technik teuer; beide werden als kommerziell nutzbare Open-Weight-Inferenzmodelle positioniert. Die folgenden Preise gelten pro 1 Mio. Tokens und ändern sich häufig.

Anbieter Scout Eingabe / Ausgabe Maverick Eingabe / Ausgabe
DeepInfra $0.10 / $0.30 $0.20 / $0.80
Groq $0.11 / $0.34 —
DigitalOcean — $0.20 / $0.696
NovitaAI $0.18 / $0.59 $0.27 / $0.85
Parasail — $0.35 / $1.00
Google Vertex $0.25 / $0.70 $0.35 / $1.15

Groq ist bei Scout besonders erwähnenswert: Es ist marginal teurer als DeepInfra, bietet aber zwischengespeicherte Eingaben für 0,055 USD pro 1 Mio. Tokens — ein entscheidender Vorteil für Agent-Loops, die dieselbe Systemanweisung tausendfach neu versenden. Parasail bietet das äquivalente für Maverick für 0,17 USD.

Was das tatsächlich kostet

Gehen Sie von einer moderaten Produktionslast von 100 Mio. Eingabe- und 20 Mio. Ausgabetokens pro Monat zum günstigsten Mainstream-Preis aus:

  • Scout: (100 × 0,10 USD) + (20 × 0,30 USD) = 16 USD/Monat
  • Maverick: (100 × 0,20 USD) + (20 × 0,80 USD) = 36 USD/Monat

Bei zehnmal so hoher Last wächst die Differenz auf 160 USD vs. 360 USD pro Monat. Das Verhältnis bleibt bei etwa 2,25–2,3× unabhängig vom Volumen, sodass die Entscheidung nicht primär von absoluten Kosten bei kleinem Volumen abhängt — sondern davon, ob Mavericks Führungsposition bei Schlussfolgern und Programmierung eine dauerhafte Verdopplung der Stückkosten wert ist. Berechnen Sie Ihre eigenen Zahlen im API-Kostenrechner.

Lizenzierung: Lesen Sie vor der Entwicklung den EU-Abschnitt sorgfältig durch

Beide Modelle werden unter der Llama-4-Community-Lizenzvereinbarungausgeliefert, die Open-Weight und kommerziell nutzbar ist, aber keine OSI-zertifizierte Open-Source-Lizenz darstellt. Zwei Einschränkungen sind in der Praxis relevant. Erstens erfordern Produkte mit mehr als 700 Millionen monatlichen aktiven Nutzern eine gesonderte Lizenz, die direkt mit Meta ausgehandelt werden muss. Zweitens — und dies betrifft Sie weitaus wahrscheinlicher — beschränkt die Lizenz multimodale Nutzung für Unternehmen und Einzelpersonen mit Sitz in der Europäischen Union.

Falls Sie ein in der EU ansässiges Unternehmen sind und die Vision-Funktionen nutzen möchten, ist dies eine juristische Frage, die vor dem Schreiben des ersten Codes geklärt werden muss — nicht danach. Teams in dieser Lage entscheiden sich oft für ein alternatives Open-Weight-Modell mit einer klareren Lizenz, wie beispielsweise eine Apache-2.0- oder MIT-lizenzierte Qwen- oder GLM-Version.

Welches Modell sollten Sie wählen?

Wählen Sie Llama 4 Scout, wenn

  • Ihre Workload Dokumente, OCR, Formulare, Diagramme oder Retrieval umfasst — dort zeigen die Benchmarks nahezu Parität
  • Sie es auf einer einzelnen H100, einem Mac mit 128 GB oder einer moderaten GPU-Hardware selbst hosten möchten
  • Die Kosten pro Token summieren sich mit Ihrem Volumen, und Sie möchten die etwa 2,3-fache Einsparung.
  • Sie benötigen das längste verfügbare Kontextfenster und können innerhalb der vom Anbieter gesetzten Grenzen arbeiten.
  • Sie befinden sich in der Prototyp-Phase und suchen das günstigste leistungsfähige multimodale Open-Weight-Modell.

Wählen Sie Llama 4 Maverick, wenn

  • Ihre Arbeitslast tatsächlich auf Schlussfolgerung beruht – wissenschaftliche Fragen & Antworten, Analyse, mehrstufige Logik.
  • Sie Code generieren oder überprüfen, wo die Lücke im LiveCodeBench 32 % beträgt.
  • Sie bereits über eine Multi-GPU-Infrastruktur verfügen oder diese ohnehin über eine API nutzen.
  • Sie die stärkere multilinguale Leistung und bessere Übersetzungsfähigkeit benötigen, wie sie auf MGSM und MTOB gezeigt wird.
  • Die Genauigkeit bei schwierigen Aufgaben ist wichtiger, als Ihre Kosten pro Token zu verdoppeln.

Der pragmatische Weg für die meisten Teams lautet: Beginnen Sie mit Scout, messen Sie die Leistung und leiten Sie ausschließlich die fehlgeschlagenen Abfragen an Maverick weiter. Da beide Modelle dasselbe Promptformat und dieselben multimodalen Eingaben akzeptieren, ist es nur mit geringem technischem Aufwand verbunden, anspruchsvolle Abfragen an Maverick zu routen, während der Großteil über Scout bedient wird – und dies schlägt in der Regel die Standardisierung auf eines der beiden Modelle.

Häufig gestellte Fragen

Ist Llama 4 Maverick besser als Llama 4 Scout?

Bei Schlussfolgerung und Programmierung ja klar – Maverick liegt um 12,6 Punkte vorne bei GPQA Diamond und um 10,6 Punkte bei LiveCodeBench. Bei Dokumenten- und Diagrammverständnis liegen beide Modelle praktisch gleichauf, mit identischen DocVQA-Werten von 94,4. Ob ein Modell „besser“ ist, hängt vollständig davon ab, ob Ihre Arbeitslast auf Schlussfolgerung oder auf Extraktion ausgerichtet ist.

Kann ich wirklich den 10-Millionen-Token-Kontext von Llama 4 Scout nutzen?

Nicht über eine gehostete API. Meta hat Scout für 10 Millionen Tokens trainiert, doch Anbieter stellen zwischen 128K und etwa 1,3 Mio. zur Verfügung – Groq begrenzt auf rund 131K, DeepInfra auf rund 320K, Together auf rund 328K. Um die volle Spanne von 10 Mio. zu erreichen, ist Self-Hosting erforderlich; dabei wird der KV-Cache bei dieser Tiefe größer als die Modellgewichte selbst.

Wie viel VRAM benötige ich, um Llama 4 Scout lokal auszuführen?

Etwa 65 GB bei 4-Bit-Quantisierung inklusive Overhead – das passt auf eine einzelne 80-GB-H100-GPU; Meta bestätigt diese Konfiguration. Bei FP8 benötigen Sie etwa 109 GB, bei BF16 etwa 218 GB. Ein Mac Studio mit 128 GB einheitlichem Arbeitsspeicher kann das quantisierte Modell ausführen.

Kann Llama 4 Maverick auf einer einzigen GPU laufen?

Nein. In 4-Bit benötigt es etwa 240 GB VRAM, was etwa vier H100-GPUs entspricht. Meta behauptet zwar, das Modell passe „auf einen einzelnen H100-Host“, meint damit aber einen 8-GPU-Knoten im FP8-Format – nicht eine einzelne Karte. Im BF16-Format übersteigen die 800 GB Gewichte sogar einen 640-GB-8×H100-Knoten.

Wie viel günstiger ist Scout im Vergleich zu Maverick?

Rund 2,3-mal günstiger bei einem gemischten Verhältnis von Eingabe zu Ausgabe von 3:1 – also etwa 0,15 USD pro 1 Mio. gemischter Tokens gegenüber 0,35 USD. Bei einer monatlichen Arbeitslast von 100 Mio. Eingabe- und 20 Mio. Ausgabetokens beläuft sich dies auf 16 USD gegenüber 36 USD.

Dürfen Llama-4-Modelle kommerziell genutzt werden?

Überwiegend ja. Die Llama-4-Community-Lizenz erlaubt die kommerzielle Nutzung, allerdings benötigen Produkte mit mehr als 700 Millionen monatlich aktiven Nutzern eine gesonderte Vereinbarung mit Meta, und die multimodale Nutzung ist für in der EU ansässige Unternehmen eingeschränkt. Das Modell ist open-weight, aber nicht OSI-konform offen.

Warum war die LMArena-Bewertung von Llama 4 Maverick umstritten?

Meta reichte eine noch nicht veröffentlichte „experimentelle Chat-Version“ ein, die 1417 ELO erzielte; ihre Ausgaben stimmten jedoch nicht mit den öffentlich verfügbaren Gewichten überein. LMArena änderte am 8. April 2025 seine Richtlinie dahingehend, dass bei Open-Weight-Einreichungen zwingend die veröffentlichten Gewichte zugrunde gelegt werden müssen; das unveränderte Modell erreichte daraufhin deutlich niedrigere Platzierungen.

Fazit

Scout und Maverick sind dieselbe Engine mit unterschiedlich großen Experten-Pools, und die Entscheidung zwischen ihnen fällt ungewöhnlich klar aus, weil Metas eigene Benchmarks die Trennlinie ziehen: Maverick rechtfertigt seinen Aufpreis bei hochschulreifer Schlussfolgerung und Code-Generierung, wo zweistellige Leistungslücken unbestreitbar sind. Bei Dokumentenverständnis bringt es hingegen keinerlei Vorteil – hier liegt es exakt gleichauf mit Scout, kostet jedoch 2,3-mal so viel pro Token und erfordert statt einer einzelnen GPU einen kompletten Rechenzentrumsrack.

Zwei Einschränkungen, die Sie stets im Blick behalten sollten: Die Schlagzeile „10 Mio. Token Kontext“ bei Scout ist aktuell nicht mietbar – planen Sie stattdessen realistisch mit rund 1,3 Mio., es sei denn, Sie hosten das Modell selbst. Und die LMArena-Zahl von 1417 für Maverick gehört vollständig aus Ihrer Bewertung gestrichen – sie bezieht sich auf ein Modell, das niemand herunterladen kann. Beurteilen Sie beide Modelle stattdessen anhand der offiziellen Modellkarten-Benchmarks – und noch besser: anhand Ihres eigenen Evaluations-Sets. Der Unterschied zwischen Hersteller-Marketing und tatsächlich ausgelieferten Gewichten war die zentrale Lehre dieser Launch-Veranstaltung.

Verfasst von Mustafa Ihsan

Mustafa Ihsan ist Gründer und Chefredakteur von Convly.ai. Er entwickelte und pflegt die Live-Datenbank für KI-Modelle der Website, ihren Preis-Leistungs-Index sowie kostenlose Rechner für VRAM-Anforderungen, API-Kosten und Wirtschaftlichkeit des Self-Hostings. Er schreibt über Modellpreise, Benchmark-Ergebnisse und die Hardware, die zum lokalen Betrieb von KI-Modellen erforderlich ist, und bevorzugt stets messbare Zahlen gegenüber Herstellerangaben.

Scroll to Top