- Drei große KI-Modelle kamen in drei Tagen an: Claude Sonnet 5.5 (Anthropic, 28. September 2026), GPT-6.1 Sol (OpenAI, 29. September) und Gemini 4 Argon (Google, 30. September).
- Alle drei starten zum gleichen Entwicklerpreis: 2 Dollar pro Million Input-Token und 10 Dollar pro Million Output-Token. Argons Preis ist einführend und steigt später auf 4 Dollar / 20 Dollar.
- Der eigentliche Unterschied liegt darin, wer sie heute nutzen kann: Sonnet 5.5 ist für alle zugänglich, einschließlich kostenloser Claude-Nutzer; GPT-6.1 Sol gilt für bezahlte ChatGPT-Pläne (in ChatGPT Work und Codex) und die API; Gemini 4 Argon ist noch nicht öffentlich verfügbar.
- Jedes Unternehmen meldet unterschiedliche Tests, daher gibt es noch keinen fairen einzelnen Gewinner. Google beansprucht die höchsten Scores; OpenAI und Anthropic betonen Kosten pro Aufgabe.
Die letzte Woche des September 2026 brachte einen ungewöhnlichen Ansturm von Launches. Innerhalb von drei Tagen veröffentlichten Anthropic, OpenAI und Google jeweils ein neues Modell – und alle drei landeten exakt zum gleichen Entwicklerpreis. Wenn Sie versuchen herauszufinden, welches für Sie wichtig ist, hält dieser Vergleich sich an das, was jedes Unternehmen tatsächlich veröffentlicht hat.
Die drei Modelle auf einen Blick
| Gemini 4 Argon | GPT-6.1 Sol | Claude Sonnet 5.5 | |
|---|---|---|---|
| Unternehmen | Google DeepMind | OpenAI | Anthropic |
| Angekündigt | 30. September 2026 | 29. September 2026 (DevDay) | 28. September 2026 |
| Position | Googles neues Frontier-Modell | Verbessertes Mid-Tier-Modell, unter GPT-6 Astra | Mid-Tier-Modell, unter Claude Opus 5.5 |
| API-Preis (Eingabe / Ausgabe pro 1 Million Token) | 2 Dollar / 10 Dollar einführend, dann 4 Dollar / 20 Dollar | $2 / $10 | $2 / $10 |
| Zwischengespeicherte Eingabe pro 1 Million Token | 95 % Rabatt auf Eingabepreis | $0.10 | 0,20 Dollar (Cache-Lesevorgänge) |
| Besondere Behauptung | Limit für 1-Million-Token-Ausgabe; 77,9 % bei DeepSWE v1.1 | Ähnliche Ergebnisse wie Astra zum fünften Teil des Astra-Preises | 30+ % schneller als Sonnet 5, bis zu 30 % günstiger pro Aufgabe |
| Kostenloser Verbraucherzugriff | Nicht angekündigt | Nein (bezahlte ChatGPT-Pläne) | Ja, auf Claude kostenlosen Plan gemeldet |
| Heute verfügbar? | Nein – nur für vertrauenswürdige Tester | Ja | Ja |
Quellen: Google, OpenAI und Anthropic Ankündigungen.
Wer kann jedes Modell jetzt nutzen
Für die meisten Menschen ist das der wichtigste Teil, denn ein Modell, das Sie nicht öffnen können, ist nicht viel wert.
Claude Sonnet 5.5: verfügbar für alle
Sonnet 5.5 ist live in den Claude-Apps und auf jeder großen Cloud. Der kostenlose Plan von Claude umfasst Sonnet-Modelle, und Berichten zufolge erhalten kostenlose Nutzer Sonnet 5.5, während Opus 5.5 bezahlten Plänen vorbehalten bleibt. Vollständige Details: Claude Sonnet 5.5 erklärt.
GPT-6.1 Sol: bezahlte ChatGPT-Pläne und die API
OpenAI erklärt, dass GPT-6.1 Sol für Plus, Pro, Business, Enterprise und Edu Nutzer in ChatGPT Work und Codexverfügbar ist, und für Entwickler als gpt-6.1-sol. OpenAI fügt hinzu, dass es „noch nicht in Chat“ verfügbar ist, dem normalen ChatGPT-Gesprächsbildschirm. Kostenlose ChatGPT-Nutzer erhalten es nicht. Nicht sicher, welchen ChatGPT-Plan Sie benötigen? Siehe ChatGPT Free vs Go vs Plus vs Pro. Für die DevDay-Ankündigungen dazu lesen Sie unseren DevDay-Bericht.
Gemini 4 Argon: noch nicht
Google hat Argon nur an ausgewählte Cybersicherheitsverteidiger über sein Fairwind-Programm und an seine eigenen Mitarbeiter freigegeben. Das Unternehmen teilt mit, dass der Zugriff „so bald wie möglich“ erweitert wird, beginnend mit zahlenden API-Kunden und Google AI Ultra Abonnenten, hat aber kein Datum genannt. Vollständige Details: Gemini 4 Argon erklärt.
Preis: gleich 2 Dollar / 10 Dollar, mit einem Haken
Es ist selten, dass drei konkurrierende Flaggschiff-Launches beim Preis übereinstimmen. Für Entwickler, die pro Token zahlen:
- Claude Sonnet 5.5 behält Sonnet 5 mit $2 / $10, und Anthropic sagt, dass es weniger Token pro Aufgabe benötigt, was es in der Praxis bis zu 30% günstiger macht.
- GPT-6.1 Sol behält GPT-6 Solmit $2 / $10 und halbiert den Zwischenspeicher für Eingaben auf $0,10. OpenAI argumentiert, dass es fast mit GPT-6 Astra — das $10 / $50 kostet — zu einem Fünftel des Preises mithalten kann.
- Gemini 4 Argon beginnt bei $2 / $10, aber nur für einen einleitenden Zeitraum unbekannter Dauer, verdoppelt sich dann auf $4 / $20 — das Gleiche wie Claude Opus 5.5.
Der Preis pro Token ist nur die halbe Geschichte: Ein Modell, das weniger Token verbraucht oder die Aufgabe mit weniger Versuchen löst, kann auch zum gleichen Preis günstiger sein. Sowohl OpenAI als auch Anthropic veröffentlichen jetzt Kosten-pro-Aufgabe-Zahlen genau aus diesem Grund. Um eine Rechnung für deine eigene Nutzung zu schätzen, probiere den KI-API-Kostenrechner oder vergleiche alle aktuellen Modelle im Datenbank für KI-Modelle.
Benchmarks: was jedes Unternehmen meldet
Hier ist das ehrliche Problem beim Vergleich dieser drei: Sie berichten größtenteils unterschiedliche Tests, oft in unterschiedlichen Versionen und bei unterschiedlichen "Aufwands"-Einstellungen. Die folgende Tabelle listet die eigenen Headline-Zahlen jedes Unternehmens nebeneinander auf, aber eine höhere Zahl in einer Spalte beweist nicht, dass ein Modell das andere schlägt.
| Bereich | Gemini 4 Argon (Google) | GPT-6.1 Sol (OpenAI) | Claude Sonnet 5.5 (Anthropic) |
|---|---|---|---|
| Programmierung | DeepSWE v1.1: 77,9% (State of the Art) | DeepSWE v1.1: entspricht GPT-6 Astra bei ca. ⅕ der Kosten; 6,4 Punkte über dem besten Wert von GPT-6 Sol | Terminal-Bench 4.0: 70,6%; CursorBench 4.0: 55,5% |
| Business Workflows | AutomationBench: 51,3% (#1) | AutomationBench: 2,2 Punkte über Claude Opus 5.5 mit mittlerem Aufwand, ca. ⅓ der Kosten | GDPval-AA v2.1: 1844 (Opus 5.5: 1846) |
| Computer nutzen | — | OSWorld 2.0 offline: innerhalb von 2,1 Punkten von Astra bei ca. ⅐ der Kosten pro Aufgabe | OSWorld 2.1: 80,1% |
| Dokumente, Diagramme, Video | LVBench (langes Video): 91,7% | GDP.pdf: über Opus 5.5 bei weniger als der Hälfte der Kosten pro Aufgabe | Chartography: 61,6% |
| Genauigkeit | — | Antworten mit faktischem Fehler: 7,7% vs. 11,4% für GPT-6 Sol (schwierige Prompts, niedriger Aufwand) | Humanity's Last Exam (mit Tools): 64,5% |
| Sicherheit | CWE-bench v1: 68% (an erster Stelle gebunden) | — | Startet mit Opus-ähnlichen Cybersicherheitsmaßnahmen |
Ein paar faire Beobachtungen aus diesen Zahlen:
- Programmierung: DeepSWE v1.1 ist der eine Coding-Test, den sowohl Google als auch OpenAI anführen. Google gibt Argon einen festen Wert von 77,9%; OpenAI gibt Sol keine absolute Zahl, nur dass es mit GPT-6 Astra mithalten kann. Bis unabhängige Ergebnisse erscheinen, ist Argons Anspruch der stärkste.
- Business Workflows: AutomationBench ist der andere Test, auf den sich Google und OpenAI beziehen. Google sagt, Argon liegt mit 51,3% auf Platz #1. OpenAI sagt, Sol schlägt Claude Opus 5.5 dort um 2,2 Punkte. Anthropic meldet es nicht für Sonnet 5.5.
- Sonnet 5.5 vs. Opus 5.5: Anthropic' Zahlen zeigen, dass sein Mid-Range-Modell bei Büroarbeit fast auf Augenhöhe mit seinem eigenen Top-Modell steht, aber zu halben Kosten.
Behandle jede Zahl hier als Marketing, bis außenstehende Evaluatoren wie Artificial Analysis oder LMArena ihre eigenen Ergebnisse veröffentlichen, was normalerweise Tage bis Wochen nach einem Launch dauert.
Sicherheit: eine ungewöhnlich vorsichtige Woche
Alle drei Launches kamen mit mehr Sicherheitsdiskussionen als üblich:
- OpenAI veröffentlichte GPT-6.1 Sol anstelle des größeren GPT-6.1 Astra, das es nach internen Tests zurückhielt, die Bedenken hinsichtlich Täuschung und Handeln ohne Genehmigung aufwarfen (unser Bericht). OpenAI sagt, dass Sol eine bessere Ausrichtung als GPT-6 Sol zeigt.
- Google rolliert Argon schrittweise aus und nimmt am freiwilligen Pre-Release-Zugriff der U.S. Regierung teil und fügt Monitore hinzu, die das Modell mitten in einer Aufgabe stoppen können.
- Anthropic gab Sonnet 5.5 die gleichen Cybersicherheitsmaßnahmen wie seine Top-Modelle: Sicherheitsanfragen mit höherem Risiko werden auf das ältere Sonnet 5 zurückgeführt.
Welches sollten Sie nutzen?
- Du möchtest etwas Kostenloses, heute: Claude Sonnet 5.5 ist das einzige der drei im kostenlosen Plan. Gemini-Nutzer behalten die aktuellen Modelle in der Gemini App, bis Argon ankommt.
- Du zahlst bereits für ChatGPT: Probiere GPT-6.1 Sol in ChatGPT Work oder Codex für Coding, Dokumente und mehrstufige Aufgaben.
- Du zahlst für Google AI Ultra: Achte auf Argon in der Gemini App, aber es gibt kein Datum. Unser Leitfaden zu Google AI Plans erklärt, was Ultra jetzt enthält.
- Du erstellst Apps: Sonnet 5.5 und GPT-6.1 Sol sind beide heute zu $2 / $10 verfügbar, also teste beide bei deinen eigenen Aufgaben. Argon ist einen Test wert, sobald die API öffnet, aber plane ein, dass sich der Preis nach dem einleitenden Zeitraum verdoppelt.
- Du wählst einen Chatbot, kein Modell: die Features rund um das Modell sind genauso wichtig wie das Modell selbst — siehe Claude vs. ChatGPT.
Häufig gestellte Fragen
Welches ist das beste KI-Modell im Moment: Gemini 4 Argon, GPT-6.1 Sol oder Claude Sonnet 5.5?
Es gibt noch keine faire einzelne Antwort. Google meldet die stärksten Headline-Scores für Argon, aber Argon ist nicht öffentlich verfügbar. Bei Modellen, die Sie heute nutzen können, kosten GPT-6.1 Sol und Claude Sonnet 5.5 gleich viel, und jedes Unternehmen meldet Stärken bei unterschiedlichen Tests.
Kosten Gemini 4 Argon, GPT-6.1 Sol und Claude Sonnet 5.5 gleich viel?
Beim Start ja: $2 pro Million Input-Token und $10 pro Million Output-Token über die API jedes Unternehmens. Der Preis von Argon ist einführend und steigt später auf $4 / $20.
Welches der drei kann ich kostenlos nutzen?
Claude Sonnet 5.5 im kostenlosen Plan von Claude mit Nutzungsbeschränkungen. GPT-6.1 Sol benötigt einen bezahlten ChatGPT-Plan, und Gemini 4 Argon hat noch keine öffentliche Veröffentlichung.
Wann wird Gemini 4 Argon verfügbar?
Google hat kein Datum angegeben. Das Unternehmen teilte mit, dass der Rollout mit zahlenden API-Kunden und Google AI Ultra-Abonnenten beginnt.
Ist GPT-6.1 Sol besser als GPT-6 Astra?
Nein. OpenAI sagt, dass es bei Coding, Computer-Nutzung und professioneller Arbeit Astra fast gleichkommt, aber zu einem Fünftel des Preises von Astra, aber Astra schneidet immer noch höher bei den schwierigsten Aufgaben ab, wie Terminal-Bench Science (68,1%).
