Thursday, 6 August 2026 | Updating Daily AI insight, written for builders

Zhipu GLM-5.1 nel 2026: il modello aperto addestrato senza una singola GPU Nvidia

Aggiornato · Pubblicato originariamente il 30 maggio 2026

Tra tutti i laboratori di IA cinesi, Zhipu AI — ora operante a livello internazionale come Z.ai — potrebbe essere il più strategicamente rilevante. Il suo GLM-5.1 ha conquistato la prima posizione in una classifica globale di programmazione, è rilasciato con la permissiva licenza MIT, costa una frazione rispetto alle alternative occidentali ed è stato addestrato interamente su chip Huawei, senza alcuna GPU NVIDIA. Quest’ultimo dettaglio rende GLM non solo un prodotto, ma anche una dichiarazione sul futuro dell’indipendenza nell’IA. Ecco il quadro completo.

Punti chiave

  • GLM-5.1 (marzo 2026, pesi aperti dal 7 aprile) è un modello MoE da 744 miliardi di parametri rilasciato sotto licenza MIT.
  • Ha ottenuto il primo posto su SWE-Bench Pro con un punteggio del 58,4%, superando di poco GPT-5.4 (57,7%) e Claude Opus 4.6 (57,3%) — sebbene alcuni punteggi siano auto-dichiarati.
  • Estremamente economico: circa 0,98 $/3,08 $ per milione di token; piani dedicati alla programmazione da 3 $ a 30 $ al mese, contro i 100–200 $ richiesti da Claude Max.
  • Addestrato interamente su chip Huawei Ascend — nessun hardware NVIDIA, un importante punto dimostrativo per un’IA indipendente dai semiconduttori statunitensi.
  • Ideale per: team attenti ai costi che desiderano un modello aperto con prestazioni simili a quelle di Opus, da poter auto-hostare.

Chi è Zhipu / Z.ai

Zhipu AI è un laboratorio con sede a Pechino, nato dall’ Università Tsinghua, una delle istituzioni più prestigiose della Cina. È tra le prime startup cinesi definite «tigri dell’IA» e si è posizionata come alternativa orientata alle imprese e agli sviluppatori rispetto a soluzioni consumer come Doubao. Nel 2026 ha cambiato nome a livello internazionale in Z.ai, segnalando un impegno rivolto agli sviluppatori globali.

La sua famiglia di modelli è GLM (General Language Model, modello linguistico generale). Dove DeepSeek competono su prezzo e Kimi sull’abilità di coding agente, la proposta di Zhipu è «qualità pari al 90%+ di quella di Claude a un decimo del costo, completamente open source e costruita su una stack hardware sovrana». Quest’ultima parte rappresenta il fattore differenziante che nessun altro può vantare con altrettanta chiarezza.

AziendaZhipu AI / Z.ai (Pechino; spin-off del Tsinghua University)
Modello più recenteGLM-5.1 (27 marzo 2026; pesi rilasciati il 7 aprile)
Architettura~744 miliardi di parametri MoE (aggiornamento post-training rispetto a GLM-5)
Finestra contestualeFinestra contestuale di 200K token, output massimo di 128K token
LicenzaMIT (pesi completamente aperti)
Prezzi delle API~0,98 USD in ingresso / 3,08 USD in uscita per ogni milione di token; piano coding da 3 a 30 USD/mese
Addestrato suHuawei Ascend 910B (senza GPU NVIDIA)
Ideale perTeam attenti ai costi che desiderano un modello auto-hostabile vicino alle prestazioni di Opus

Che cos’è realmente la GLM-5.1

La GLM-5.1, rilasciata il 27 marzo 2026 con i relativi pesi aperti il 7 aprile, è un aggiornamento post-training della base GLM-5 — la stessa architettura Mixture-of-Experts da circa 744 miliardi di parametri, potenziata significativamente nelle capacità di coding, utilizzo di strumenti ed esecuzione autonoma. Supporta una finestra contestuale di 200K token, un output massimo di 128K token, una modalità di ragionamento (thinking mode), chiamate a funzioni, output strutturati, caching contestuale e integrazione nativa con MCP.

Fondamentalmente, è rilasciata sotto la licenza licenza MIT MIT su Hugging Face — scaricabile, modificabile, addestrabile ulteriormente e distribuibile commercialmente senza restrizioni né royalties. Unitamente alle sue solide prestazioni, ciò rende la GLM-5.1 uno dei modelli open source più effettivamente utili oggi disponibili.

Il benchmark — con un onesto asterisco

Attivo SWE-Bench Pro, la GLM-5.1 ha ottenuto secondo quanto riportato un punteggio di 58.4, superando la classifica globale e battendo di misura GPT-5.4 (57,7) e Claude Opus 4.6 (57,3). Zhipu dichiara inoltre un punteggio di coding pari a 45,3 — circa il 94,6% delle prestazioni di Claude Opus 4.6.

Ecco la precisazione onesta, fondamentale: alcuni di questi risultati in prima pagina sono stati comunicati direttamente da Z.ai, e, all’inizio del 2026, laboratori indipendenti non avevano ancora pienamente verificato le cifre più lusinghiere relative al coding. Il modello è chiaramente eccellente — numerose recensioni di terze parti confermano che le sue prestazioni sul lavoro reale sono prossime a quelle di Opus — ma il dato esatto «94,6% di Opus» va considerato come una dichiarazione del fornitore, non come verità assoluta. La conclusione pratica resta valida: la GLM-5.1 offre gran parte della qualità di Claude per compiti quotidiani a una frazione minima del costo.

L’aspetto legato a Huawei — perché la GLM conta oltre che nei benchmark

Il fatto più significativo riguardo alla GLM non è un benchmark, bensì l’hardware. Zhipu ha addestrato l’intera famiglia GLM-5 esclusivamente su acceleratori Huawei Ascend 910B, con nessuna GPU NVIDIA coinvolta.

Si tratta di un traguardo storico. I controlli all’esportazione statunitensi hanno cercato deliberatamente di limitare l’accesso della Cina ai migliori chip NVIDIA proprio per rallentare lo sviluppo dell’intelligenza artificiale cinese di frontiera. La GLM-5.1 dimostra concretamente che è possibile costruire un modello di frontiera competitivo e leader nelle classifiche utilizzando esclusivamente silicio cinese domestico. Qualunque sia il proprio giudizio sulla geopolitica, questo muta radicalmente il quadro strategico: il collo di bottiglia hardware è più permeabile di quanto si supponesse.

Dove la GLM eccelle

1. Qualità paragonabile a quella di Claude a un trentesimo del costo

Il piano Coding GLM parte da 3–30 USD/mese contro 100–200 USD/mese per Claude Max. Se la GLM fornisce il 90%+ della qualità di Opus per attività di coding quotidiane — e per molti team è proprio così — i risparmi sono trasformativi.

2. Pesi open source con licenza MIT

Come DeepSeek, GLM rilascia il suo modello migliore completamente open source. Auto-hosting, fine-tuning, deploy in ambienti isolati (air-gap) — controllo totale, zero royalty.

3. Capacità di coding agente davvero solide

I miglioramenti della GLM-5.1 sono mirati all’utilizzo di strumenti e all’esecuzione autonoma, con supporto nativo per MCP. È progettata per l’era degli agenti, non solo per il dialogo.

4. Sovranità hardware

Per organizzazioni (soprattutto in Cina e nei mercati alleati) che vogliono evitare la dipendenza da silicio e software statunitensi, la GLM rappresenta il percorso più chiaro — e questo vantaggio strategico è reale, indipendentemente dai benchmark.

Dove la GLM mostra limiti — le oneste precisazioni

1. Alcuni benchmark sono auto-riferiti

I dati più favorevoli provengono direttamente da Z.ai, senza piena corrobora­zione indipendente. Il modello è eccellente, ma è opportuno ridimensionare le affermazioni del fornitore e testarlo sui propri carichi di lavoro specifici.

2. Avvertenze relative all’API ospitata

L’API di Z.ai comporta le consuete considerazioni relative alla residenza dei dati in Cina e alla moderazione dei contenuti. I pesi con licenza MIT consentono invece di auto-hostare il modello, evitando entrambi gli aspetti.

3. Contesto inferiore rispetto ai concorrenti

Una finestra contestuale di 200K token è solida, ma resta inferiore alle finestre da 1 milione di token di DeepSeek e Qwen. Per lavori su documenti molto lunghi o interi codebase, questa è una limitazione effettiva.

4. Ecosistema ancora in fase di maturazione

L’esperienza internazionale per gli sviluppatori offerta da Z.ai è più recente rispetto a quella di Alibaba o dei principali laboratori statunitensi. Sta migliorando rapidamente, ma non ha ancora raggiunto la parità.

GLM vs. la concorrenza

DimensioneGLM-5.1DeepSeek V4Kimi K2.6Claude Opus 4.8
Pesi apertiSì (MIT)Sì (MIT)No
Coding (SWE-Bench Pro)58.4~5858.6Frontiera
Prezzo~$0.98/$3.08~$0.44/$0.87~$0.60/$2.50~$5/$25
Finestra contestuale200.0001 milione262K1 milione
Notizie hardwareSolo HuaweiNvidiaNvidiaNvidia/TPU

Punti di forza e di debolezza

Punti di forza di GLM

  • Qualità paragonabile a quella di Claude a una frazione del costo
  • Pesi aperti con licenza MIT — ospitabili autonomamente
  • Capacità eccellenti di programmazione autonoma (agentic coding) con supporto nativo per MCP
  • Addestrato interamente su chip Huawei (stack sovrano)
  • Piano di programmazione da 3 a 30 USD al mese

Punti deboli di GLM

  • Alcuni benchmark principali sono in parte auto-riferiti
  • Contesto di 200K token è inferiore rispetto ai concorrenti con contesto da 1M
  • L'API ospitata presenta limitazioni relative ai dati e alla moderazione specifiche della Cina
  • L'ecosistema internazionale è ancora in fase di maturazione

Come accedere a GLM

  • API ospitata / piano di programmazione: z.ai (ex open.bigmodel.cn) — l’opzione diretta più economica, inclusa la versione del Piano di programmazione GLM da 3 a 30 USD/mese.
  • Provider occidentali: OpenRouter e altri servizi offrono GLM-5.1 con residenza dei dati al di fuori della Cina.
  • Auto-ospitaggio: Scarica i pesi di GLM-5.1 da Hugging Face (licenza MIT) ed eseguilo sul tuo hardware.

Quale modello GLM scegliere in pratica?

«GLM» non indica un singolo modello. Z.ai distribuisce un’intera famiglia di modelli, e la scelta corretta dipende quasi esclusivamente dal fatto che tu voglia chiamare un’API o eseguire i pesi sul tuo hardware. Scegliere automaticamente il modello flagship è l’errore più comune — e anche il più costoso.

In pratica, tre livelli sono quelli rilevanti:

  • GLM-5.1 — il flagship MoE (Mixture-of-Experts) da 754 miliardi di parametri (circa 40 miliardi attivi per token), con finestra di contesto da 200K token. Questo è il modello che domina i leaderboard di programmazione autonoma, ma è pensato espressamente per data center. Anche le aggressive quantizzazioni 1-2 bit di Unsloth occupano circa 200 GB su disco, quindi per quasi tutti si tratta di un modello utilizzabile solo tramite API .
  • GLM-4.5-Air — un MoE da 106 miliardi di parametri (circa 12 miliardi attivi) che può essere quantizzato su workstation performanti: pensa a un sistema multi-GPU con molta VRAM oppure a un Mac con Apple Silicon da 128 GB. È la soluzione intermedia quando desideri pesi aperti ma non puoi ospitare il modello flagship.
  • GLM-4.7-Flash — un MoE da circa 30 miliardi di parametri che ne attiva solo circa 3,6 miliardi per token, ottiene un punteggio vicino al 59% su SWE-bench Verified ed è eseguibile su una singola GPU da 24 GB. In quantizzazione a 4 bit richiede circa 18 GB e genera 60-100 token/secondo su una RTX 3090 o 4090. Per la programmazione locale, questa è la scelta più indicata.

Un semplice percorso decisionale:

  • Vuoi il risultato migliore possibile, indipendentemente da dove viene eseguito: chiama GLM-5.1 tramite l’API. Ottieni capacità di programmazione autonoma all’avanguardia a una frazione del costo per token di Claude.
  • Vuoi una programmazione completamente privata e a costo marginale zero sul tuo hardware: eseguire GLM-4.7-Flash localmente su una scheda da 24 GB. Preferisci llama.cpp, LM Studio, oppure Jan rispetto a Ollama per il momento, poiché il template di chat potrebbe comportarsi in modo anomalo sotto Ollama.
  • Vuoi pesi aperti con prestazioni prossime a quelle del flagship e disponi di una workstation potente: GLM-4.5-Air rappresenta il compromesso onesto tra capacità e quanto puoi effettivamente ospitare.
ModelloParametri totali / attiviDove viene eseguitoIdeale per
GLM-5.1~754 miliardi / ~40 miliardiGPU per API o data centerProgrammazione agente di fascia alta
GLM-4.5-Air~106 miliardi / ~12 miliardiWorkstation ad alta VRAM / Mac da 128 GBPesi aperti, quasi di fascia alta
GLM-4.7-Flash~30 miliardi / ~3,6 miliardiSingola GPU da 24 GBProgrammazione privata e locale

La conclusione: scegliere innanzitutto il modello in base all’ambiente di distribuzione, quindi in base al compito. La maggior parte degli utenti dovrebbe chiamare GLM-5.1 tramite API per lavori seri, mantenendo invece GLM-4.7-Flash sul proprio computer per iterazioni private, offline e senza costi.

Domande frequenti

GLM-5.1 è davvero all’altezza di Claude?

For routine coding and general work, multiple reviews put it at roughly 90-95% of Claude Opus 4.6’s quality — at a tiny fraction of the cost. For the most demanding frontier reasoning, Claude Opus 4.8 (newer) still leads. The honest framing: GLM gives you most of Claude’s value for a fraction of the price, with the caveat that the most flattering benchmark numbers are vendor-reported.

Cosa significa, per me utente, l’addestramento «senza Nvidia»?

Dal punto di vista pratico, nulla cambia nell’utilizzo del modello. Strategicamente, dimostra che modelli all’avanguardia competitivi possono essere sviluppati su hardware non statunitense — un aspetto cruciale per chi considera i rischi a lungo termine nella catena di approvvigionamento dell’IA e l’efficacia dei controlli sull’esportazione di chip.

GLM è open source?

Sì — i pesi di GLM-5.1 sono disponibili su Hugging Face con licenza MIT, una delle più permissive esistenti. Puoi utilizzarlo commercialmente senza alcuna restrizione.

Chi è Z.ai?

Z.ai è il marchio internazionale di Zhipu AI, un laboratorio di Pechino nato dall’Università Tsinghua. Il rebranding avvenuto nel 2026 riflette una strategia volta a servire gli sviluppatori globali.

Come si confronta il Piano di programmazione GLM con Claude Max?

Il piano di programmazione GLM costa da 3 a 30 USD/mese; Claude Max costa invece da 100 a 200 USD/mese. Se GLM soddisfa le tue esigenze quotidiane con una qualità accettabile — come effettivamente accade per molti sviluppatori — ciò comporta una riduzione dei costi compresa tra 5 e 30 volte. Molte squadre ora usano GLM per la programmazione su larga scala e riservano Claude solo per i compiti più impegnativi.

GLM-5.1 è gratuito?

Sì — i pesi di GLM-5.1 sono rilasciati con la permissiva licenza MIT, quindi puoi scaricarli, ospitarli autonomamente, affinarli e usarli commercialmente gratuitamente (paghi solo per le risorse computazionali). L’API ospitata di z.ai è a pagamento, ma estremamente economica, incluso il Piano di programmazione GLM da 3 a 30 USD/mese, molto più conveniente rispetto a Claude Max.

Is GLM-5.1 better than DeepSeek V4?

Sono molto simili, ma con punti di forza diversi. GLM-5.1 è ottimizzato per la programmazione autonoma (agentic coding) e domina alcuni leaderboard dedicati alla programmazione; inoltre, il suo addestramento esclusivo su hardware Huawei rappresenta un vantaggio strategico unico. DeepSeek V4 è ancora più economico, dispone di una finestra di contesto più ampia (1M token contro i 200K di GLM) ed è un modello più equilibrato in termini di prestazioni generali. Entrambi sono eccellenti per la programmazione quotidiana su budget contenuto; per lavori che richiedono contesti molto lunghi, DeepSeek ha un leggero vantaggio.

Posso eseguire GLM su una RTX 4090?

Non è il modello di fascia alta, ma sì: è il modello che la maggior parte degli utenti desidera effettivamente utilizzare localmente. GLM-4.7-Flash, un modello Mixture-of-Experts da circa 30 miliardi di parametri, si adatta comodamente su una scheda da 24 GB come la RTX 4090 o la 3090 con quantizzazione a 4 bit (circa 18 GB), raggiungendo una velocità di circa 60–100 token al secondo. Il modello completo GLM-5.1 da 754 miliardi richiede invece hardware da data center, pertanto va utilizzato esclusivamente tramite API.

Qual è la differenza tra GLM-4.7-Flash e GLM-5.1?

Sono progettati per estremi opposti dello spettro. GLM-5.1 è il modello di punta da 754 miliardi, costruito per garantire la massima qualità nella programmazione agente ed è realistico utilizzarlo esclusivamente tramite API. GLM-4.7-Flash è invece un modello compatto da circa 30 miliardi, concepito per girare su una singola GPU consumer; ottiene un punteggio vicino al 59% su SWE-bench Verified, risultato eccellente per un modello locale, sebbene inferiore a quello del modello di fascia alta. Scegli Flash per lavori privati e gratuiti sul proprio dispositivo, e GLM-5.1 quando ti serve il risultato migliore possibile.

Dove posso accedere all’API di GLM?

Puoi chiamare direttamente GLM tramite l’API di Z.ai oppure attraverso aggregatori come OpenRouter, dove GLM-5.1 costa circa 1 dollaro per milione di token in input e circa 3 dollari per milione di token in output. Z.ai fornisce inoltre un endpoint compatibile con Anthropic, quindi GLM-5.1 può essere utilizzato come sostituto diretto di Claude negli strumenti come Claude Code. Per un’intensa attività quotidiana di programmazione, il piano di abbonamento GLM Coding Plan (con tier che vanno da circa 10 a 80 dollari al mese) risulta solitamente più economico rispetto al pagamento per singolo token.

Conclusione

GLM-5.1 è il modello più strategicamente interessante dell’intelligenza artificiale cinese. Offre una qualità di programmazione quasi equivalente a quella di Claude, è rilasciato con pesi aperti sotto licenza MIT, costa una frazione delle alternative occidentali e — in modo unico — dimostra che un modello competitivo all’avanguardia può essere addestrato interamente su silicio cinese.

Le dovute cautele mantengono il quadro realistico: scontare i picchi nei benchmark auto-riferiti, tenere presente il limite di contesto a 200K token e aggirare l’API ospitata per dati sensibili ricorrendo all’auto-ospitazione dei pesi aperti. Fatto questo, GLM-5.1 rappresenta una delle migliori proposte di valore nell’ambito dell’IA — e, grazie al suo addestramento esclusivamente su hardware Huawei, il segnale più chiaro finora che il panorama globale dell’IA non è più controllabile dagli Stati Uniti tramite il solo hardware.

Scritto da Mustafa Ihsan

Mustafa Ihsan è fondatore e redattore capo di Convly.ai. Ha progettato e gestisce il database in tempo reale di modelli IA del sito, il suo indice prezzo-prestazioni e i suoi calcolatori gratuiti per i requisiti di VRAM, i costi delle API e l'economia dell'auto-hosting. Scrive di prezzi dei modelli, risultati di benchmark e hardware necessario per eseguire modelli IA localmente, privilegiando costantemente dati misurati rispetto alle dichiarazioni dei produttori.

Scroll to Top
Featured on There's An AI For That