Das in den USA ansässige KI-Unternehmen Anthropic hat eine Warnung vor dem Hacking-Vermögen von GLM-5.3ausgegeben und berichtet, dass das chinesische open-weight-Modell von Z.ai eine Cyber-Exploit-Leistung demonstriert, die den Systemen des Unternehmens mit den stärksten Einschränkungen entspricht – aber mit erheblich schwächeren Schutzvorrichtungen gegen böswillige Nutzung bereitgestellt wird.
Wichtigste Erkenntnisse
- GLM-5.3 vollendete erfolgreich 50 von 410 End-to-End-Exploit-Versuchen in Tests von Anthropic, im Vergleich zu 56 für Claude Mythos Preview
- Das Claude Mythos Preview-Modell von Anthropic erfordert geprüften Benutzerzugriff, während GLM-5.3 offen als open-weight-Release verfügbar ist
- Das San Francisco-basierte Unternehmen warnt vor größerem Potenzial für böswillige Akteure, GLM-5.3 aufgrund schwächerer Sicherheitsbeschränkungen zu missbrauchen
- Z.ai ist ein chinesisches KI-Unternehmen, das GLM-5.3 als open-weight-Modell ohne geschützte Kontrollen veröffentlicht hat
- Anthropic veröffentlichte seine Cyber-Funktionsbewertung in einem Bericht, der am 30. September 2026 veröffentlicht wurde
- Tests von Anthropic enthüllen nahezu Parität bei Exploit-Erfolgsquoten
- Open-Weight-Verteilung verschärft Sicherheitsbedenken
- Vergleichende Leistung: GLM-5.3 und Frontier-Modelle
- Z.ai und die GLM-Modellfamilie
- Auswirkungen auf KI-gestützte offensive Sicherheit
- Regulierungs- und Politische Dimensionen
- Häufig gestellte Fragen
- Das Fazit
Tests von Anthropic enthüllen nahezu Parität bei Exploit-Erfolgsquoten
In einem am Dienstag veröffentlichten Berichtbeschrieb Anthropic seine Tests von GLM-5.3 bei der Erstellung von End-to-End-Cyber-Exploits. Das chinesische Modell vollendete 50 von 410 Exploit-Versuchen – eine Erfolgsquote von 12,2 Prozent – im Vergleich zu 56 erfolgreichen Exploits für Claude Mythos Preview, das Frontier-Modell von Anthropic, das auf ausschließlich geprüfte Benutzer beschränkt ist.
Die enge Lücke von sechs Exploits zwischen einem offen verfügbaren Modell und einem stark geschützten Frontier-System stellt dar, was Anthropic als besorgniserregende Entwicklung bei von KI unterstützten Cybersicherheitsbedrohungen charakterisiert. Nach der South China Morning Post konzentriert sich die Besorgnis nicht allein auf reine Leistungsfähigkeit, sondern auf die Kombination von fortgeschrittener Exploit-Generierung mit minimalen Zugriffskontrolle.
Claude Mythos Preview, das in der gleichen Testsuite 56 erfolgreiche Exploits verzeichnete, unterliegt strikten Prüfanforderungen, die den Zugriff auf genehmigte Sicherheitsforscher und autorisiertes Personal beschränken. GLM-5.3 dagegen wird als open-weight-Modell ohne vergleichbare Einschränkungen verteilt.
Open-Weight-Verteilung verschärft Sicherheitsbedenken
Die open-weight-Natur von GLM-5.3 steht im Mittelpunkt der Warnung von Anthropic. Im Gegensatz zu geschlossenen API-basierten KI-Modellen die es Anbietern ermöglichen, Nutzung zu überwachen und Richtlinien zur akzeptablen Nutzung durchzusetzen, ermöglichen open-weight-Releases uneingeschränkte lokale Bereitstellung und Modifizierung. Benutzer können die Modellgewichte herunterladen, Inferenz auf ihrer eigenen Hardware ausführen und alle im ursprünglichen Release integrierten Sicherheitsmechanismen umgehen.
Dieses Verteilungsmodell schafft, wie Anthropic beschreibt, „wesentlich schwächere Schutzvorrichtungen“ im Vergleich zu Frontier-Systemen. Während Anthropic mit Claude Mythos Preview´s geschütztem Zugriff Berechtigungen widerrufen und Nutzung prüfen kann, bleiben GLM-5.3´s Gewichte – nach dem Herunterladen – außerhalb von Z.ai´s Kontrolle. Böswillige Akteure können das Modell feinjustieren, Sicherheitsfilter entfernen oder es in adversarialen Kontexten ohne Aufsicht einsetzen.
Der Debatte über offene versus geschlossene KI konzentrierte sich historisch auf Demokratisierung des Zugangs und Reproduzierbarkeit von Forschung. Anthropic´s Bewertung führt Cyber-Leistung als eine Dimension ein, in der offene Verteilung möglicherweise eigene Sicherheitsexternalitäten mit sich bringt, besonders wenn Modelle Frontier-Leistung bei defensiven Aufgaben erreichen.
Vergleichende Leistung: GLM-5.3 und Frontier-Modelle
Anthropic´s Test-Framework bewertete End-to-End-Exploit-Konstruktion – einen Arbeitsablauf, der von Modellen verlangt, Schwachstellen zu identifizieren, funktionsfähigen Exploit-Code zu generieren und mehrere Schritte in funktionsfähige Angriffssequenzen zu verknüpfen. Die Testsuite mit 410 Versuchen deckte wahrscheinlich diverse Schwachstellen-Klassen, Software-Ziele und Exploit-Komplexitätsstufen ab.
| Modell | Entwickler | Erfolgreiche Exploits | Erfolgsquote | Zugriffskontrolle |
|---|---|---|---|---|
| GLM-5.3 | Z.ai (China) | 50 / 410 | 12.2% | Open-weight |
| Claude Mythos Preview | Anthropic (USA) | 56 / 410 | 13.7% | Nur geprüfte Benutzer |
Die Lücke von 1,5 Prozentpunkten deutet darauf hin, dass GLM-5.3 bei diesem spezifischen Benchmark mit ungefähr 89 Prozent der Effektivität von Claude Mythos Preview arbeitet. Zur Einordnung: Anthropic positioniert Claude Mythos Preview als ein Frontier-Modell – unter den fähigsten Systemen weltweit – was GLM-5.3´s Leistung angesichts seiner offenen Verteilung besonders bemerkenswert macht.
Z.ai und die GLM-Modellfamilie
Z.ai, das chinesische Unternehmen hinter GLM-5.3, war in westlichen Berichten über die KI-Industrie vor dieser Sicherheitsbewertung nicht weit verbreitet. Die GLM-Bezeichnung deutet auf eine Verbindung zu Zhipu AI´s GLM-Serie hin, die GLM-5.2umfasst, ein 1-Million-Token-Kontext-Modell mit Preisen von 1,40 $ Eingabe und 4,40 $ Ausgabe pro Million Tokens.
Falls GLM-5.3 eine Nachfolger-Veröffentlichung in derselben Reihe darstellt, könnte die Versionssteigerung Leistungsverbesserungen jenseits der Kontext- und Reasoning-Verbesserungen signalisieren, die typisch für Modell-Updates sind. Anthropic´s Tests zeigen an, dass sich diese Verbesserungen auf Cyber-Operationen erstrecken – ein Bereich, wo Modellentwickler typischerweise aggressives Sicherheits-Filtering während des Trainings und Post-Deployment-Schutzvorrichtungen implementieren.
Die Entscheidung, GLM-5.3 als open-weight statt nur API bereitzustellen, deutet darauf hin, dass Z.ai lokale Zugänglichkeit und Bereitstellung über zentralisierte Kontrolle priorisierte. Diese Verteilungswahl stimmt mit breiteren Trends in der chinesischen KI-Entwicklung überein, wo open-weight-Releases von DeepSeek, Alibaba´s Qwen-Serie und anderen heimischen Laboren unter Entwicklern, die Alternativen zu westlichen API-basierten Angeboten suchen, an Fahrt gewonnen haben.
Auswirkungen auf KI-gestützte offensive Sicherheit
Anthropic´s Warnung kommt an, da KI-gestützte Anfälligkeit-Forschung und Exploit-Entwicklung von experimentellen Tools zu praktischen Arbeitsabläufen übergehen. Sicherheitsforscher haben die Fähigkeit von Language Models demonstriert, Code auf Fehler zu analysieren, Proof-of-Concept-Exploits zu generieren und Aufklärung zu automatisieren – Fähigkeiten, die sowohl defensive Sicherheitsarbeit als auch böswillige Aktivität beschleunigen.
Die Erfolgsquote von 12,2 Prozent, die GLM-5.3 in Anthropic´s Testsuite erreichte, deutet darauf hin, dass diese Fähigkeiten über Proof-of-Concept-Demonstrationen hinaus ausgereift sind. Ein Modell, das 50 End-to-End-Exploits über eine Benchmark mit 410 Versuchen abschließt, deutet auf zuverlässige Leistung bei realen Anfälligkeit-Klassen hin, nicht bloß Spielzeug-Beispiele oder gut dokumentierte CVEs.
Für offensive Sicherheitsteams, Red-Teamer und Penetrationstester versprechen solche Fähigkeiten Produktivitätssteigerungen bei autorisierten Einsätzen. Für Bedrohungsakteure senken die gleichen Fähigkeiten Barrieren für Exploit-Entwicklung – besonders für Gegner mit starken Softwareentwicklungs-Fähigkeiten aber begrenzter Anfälligkeit-Forschungs-Erfahrung.
Regulierungs- und Politische Dimensionen
Die GLM-5.3-Fallstudie hebt Spannungen in neu entstehenden KI-Governance-Rahmenwerken hervor. Die Vereinigten Staaten haben sich zu Exportkontrollen und Compute-Einschränkungen bewegt, die fortgeschrittene KI-Entwicklung in China anvisieren, gestützt auf nationale Sicherheitsbedenken um Dual-Use-Fähigkeiten. Das AI Act der Europäischen Union verhängt Transparenz- und Risikomanagement-Anforderungen auf hochriskante Systeme, obwohl die Durchsetzung noch in den Anfängen steckt.
Open-weight-Modelle erschweren beide Ansätze. Exportkontrollen für Trainings-Computing oder Chip-Zugang können die Verteilung bereits trainierter Gewichte nicht verhindern. Risikomanagement-Rahmenwerke, die für API-Anbieter konzipiert sind, verlieren ihre Wirksamkeit, wenn Modelle lokal bereitgestellt werden. GLM-5.3´s offensive Cyber-Fähigkeit – von einem US-Unternehmen getestet, aber außerhalb direkt kontrollierten Bereichs – veranschaulicht die Governance-Herausforderung, die von fähigen open-weight-Releases ausgehen.
Anthropic´s Entscheidung, vergleichende Test-Ergebnisse zu veröffentlichen statt Test-Bewertungen still einzubehalten, signalisiert eine Absicht, politische Diskussionen mit empirischen Fähigkeits-Daten zu informieren. Ob Regulatoren solche Warnungen in umsetzbarer Politik übersetzen, bleibt unklar, besonders angesichts der verteilten Natur der open-weight-Modell-Bereitstellung und der Schwierigkeit, nachgelagerter Schäden upstream-Veröffentlichungs-Entscheidungen zuzuordnen.
Häufig gestellte Fragen
Was ist GLM-5.3 und wer hat es entwickelt? GLM-5.3 ist ein open-weight KI-Modell, das von Z.ai entwickelt wurde, einem chinesischen Unternehmen im Bereich künstliche Intelligenz. Das Modell hat laut Tests des in den USA ansässigen Unternehmens Anthropic fortgeschrittene Fähigkeiten bei der Generierung von Cyber-Exploits demonstriert.
Wie schneidet GLM-5.3 gegen Anthropic´s Claude Mythos Preview ab? In Anthropic´s Tests vollendete GLM-5.3 50 von 410 End-to-End-Exploit-Versuchen (12,2 %) im Vergleich zu 56 erfolgreichen Exploits (13,7 %) für Claude Mythos Preview. Die Modelle demonstrierten nahezu äquivalente Cyber-Fähigkeiten, aber GLM-5.3 ist offen verfügbar während Mythos Preview geprüften Benutzerzugriff erfordert.
Was sind open-weight KI-Modelle? Open-weight-Modelle verteilen ihre trainierten Parameter öffentlich und ermöglichen Benutzern, sie lokal herunterzuladen und auszuführen, ohne API-Zugriffskontrolle. Dies steht im Gegensatz zu geschlossenen Modellen, auf die nur über geschützte APIs zugegriffen wird, wo Anbieter die Nutzung überwachen und Richtlinien zur akzeptablen Nutzung durchsetzen können.
Warum macht sich Anthropic Sorgen um GLM-5.3´s Fähigkeiten? Anthropic warnt davor, dass GLM-5.3 leistungsstarke Exploit-Generierung auf Frontier-Niveau mit minimalen Zugriffsbeschränkungen kombiniert. Die open-weight-Verteilung verhindert, dass Z.ai die Nutzung überwacht, den Zugriff widerruft oder böswillige Akteure daran hindert, das Modell für böse Zwecke feinjustieren zu können.
Können open-weight-Modelle wirksam reguliert werden? Die Regulierung von open-weight-Modellen stellt erhebliche Herausforderungen dar, da die Gewichte nach Veröffentlichung heruntergeladen, kopiert und ohne Aufsicht eingesetzt werden können. Exportkontrollen für Trainings-Computing können bereits verteilte Modelle nicht zurückrufen, und Risikomanagement-Rahmenwerke, die für API-Anbieter ausgelegt sind, verlieren ihre Wirksamkeit, wenn Modelle lokal auf benutzergesteuerte Infrastruktur laufen.
Das Fazit
Anthropic´s Bewertung von GLM-5.3 quantifiziert eine Sicherheitsbesorgnis, die in KI-politischen Debatten weitgehend theoretisch geblieben ist: offen verfügbare Modelle, die Frontier-Niveau-Leistung bei defensiven Cyber-Aufgaben demonstrieren. Die Lücke von sechs Exploits zwischen GLM-5.3 und Claude Mythos Preview – 12,2 Prozent versus 13,7 Prozent Erfolgsquoten – deutet auf Parität bei roher Leistungsfähigkeit hin, während sie stark Unterschiede in Verteilung und Zugriffskontrolle hervorhebt.
Für Entwickler und Sicherheitspraktiker unterstreichen die Ergebnisse die Dual-Use-Natur von KI-Programmierungs- und Analyse-Fähigkeiten. Die gleichen Modell-Architekturen, die legitime Sicherheitsforschung beschleunigen, ermöglichen auch gegnerische Exploit-Entwicklung. Da die Leistungsfähigkeit weiter fortschreitet, scheint sich die Lücke zwischen geschützten Frontier-Systemen und offen verfügbaren Alternativen in Bereichen jenseits von General Reasoning und Programmierung zu verengen – sich auf spezialisierte, sicherheitsempfindliche Aufgaben erstreckend, wo Zugriffsbeschränkungen historisch einen Puffer gegen Missbrauch bereitgestellt haben.
Quellen: www.scmp.com. Bericht vom 30. September 2026.
