Z.ai dołożyło właśnie argument do tezy, że otwarte modele nie muszą już oglądać pleców zamkniętej czołówce. GLM-5.2 prowadzi w rankingu Artificial Analysis dla open weights, a przy okazji dorzuca 1 mln tokenów kontekstu i ceny, które nie wyglądają jak kara za ambicję.

TL;DR

  • GLM-5.2 zdobywa 51 punktów na Artificial Analysis Intelligence Index v4.1 – najwięcej wśród open weights
  • Model ma 744B parametrów ogółem i 40B aktywnych, identycznie jak GLM-5.1, ale wyraźnie lepszy w rozumowaniu naukowym
  • Kontekst wzrósł do 1M tokenów, licencja MIT, dostępny m.in. przez DeepInfra i Fireworks
  • Wynik 1524 na GDPval-AA v2 stawia go na poziomie GPT-5.5 w zadaniach agentycznych
  • Koszt za zadanie na poziomie Pareto frontier – ~0,46 USD przy wysokiej inteligencji

Jak GLM-5.2 wypadł w rankingu Artificial Analysis?

Z.ai opisało GLM-5.2 jako nowego lidera wśród modeli open weights w rankingu Artificial Analysis Intelligence Index v4.1. Według danych przywołanych w tekście model uzyskał 51 punktów, wyprzedzając MiniMax-M3 i DeepSeek V4 Pro, które mają po 44 punkty.

To ważne z prostego powodu: Artificial Analysis jest dziś jednym z częściej cytowanych punktów odniesienia w świecie modeli językowych. GLM-5.2 prowadzi w open weights, więc nie chodzi już tylko o lokalny sukces Z.ai, ale o sygnał dla całego segmentu otwartych wagowych modeli.

Co poprawiło Z.ai względem GLM-5.1?

Największe skoki widać w testach związanych z rozumowaniem i zadaniami technicznymi. W przywołanych wynikach CritPt rośnie do 21%, HLE do 40%, SciCode do 50%, a TerminalBench v2.1 do 78%. Sam szkic sugeruje, że to właśnie tutaj GLM-5.2 najbardziej odjechał starszej wersji.

Jest też druga strona medalu: model generuje średnio więcej tokenów wyjściowych na zadanie, około 43 tys. To zwykle oznacza bardziej rozbudowany tok rozumowania, ale też większy koszt i mniejszą oszczędność tokenową niż u części rywali. GDPval-AA v2: 1524 punkty to z kolei wynik, który według przywołanych benchmarków ustawia GLM-5.2 bardzo blisko GPT-5.5 w zadaniach agentycznych.

Co Z.ai daje w praktyce: parametry, kontekst i licencja

Pod względem architektury Z.ai nie zrobiło rewolucji. GLM-5.2 zachowuje skalę GLM-5.1: 744 mld parametrów łącznie i 40 mld aktywnych w architekturze MoE. Zmiana, którą odczuje użytkownik, leży gdzie indziej – kontekst wzrósł z 200 tys. do 1 mln tokenów.

Dla firm i deweloperów istotna jest też licencja MIT, bo mocno upraszcza komercyjne użycie modelu. 1 mln tokenów kontekstu oznacza, że GLM-5.2 da się sensownie testować w długich dokumentach, repozytoriach czy złożonych przepływach agentowych. Wagi są dostępne m.in. na Hugging Face, a inferencję oferują także Z.ai, DeepInfra, Novita, Nebius, Siliconflow i Fireworks.

Ile kosztuje GLM-5.2 i gdzie trafia na rynku?

Według cennika przywołanego w szkicu stawki pozostają na poziomie GLM-5.1: 1,4 USD za milion tokenów wejściowych, 4,4 USD za milion tokenów wyjściowych i 0,26 USD za cache hit. W praktyce to pozycjonuje model w grupie tych, które próbują dowieźć wysoki wynik bez natychmiastowego rachunku grozy.

Szkic podaje też koszt zadania rzędu 0,46 USD i wskazuje, że GLM-5.2 znajduje się na granicy Pareto między „inteligencją” a kosztem wykonania zadania. Cena nie zabija opłacalności, choć przy polskim kursie to wciąż koszt, który przy większym wdrożeniu trzeba liczyć uważnie, a nie „na oko”.

Czy GLM-5.2 naprawdę dogonił zamknięte modele?

Model Intelligence Index GDPval-AA v2 Kontekst Licencja
GLM-5.2 51 1524 1M MIT
MiniMax-M3 44 1418
DeepSeek V4 Pro 44 1328
GPT-5.5 xhigh 1514 zamknięta
Porównanie kluczowych wyników GLM-5.2 z innymi modelami open weights i zamkniętymi

Najuczciwsza odpowiedź brzmi: w części zadań wygląda na to, że bardzo się zbliżył, ale jedno zwycięstwo benchmarkowe nie zamyka sprawy. Wynik w GDPval-AA v2 sugeruje sąsiedztwo z GPT-5.5, a przewaga nad innymi modelami open weights jest wyraźna. To już nie jest ciekawostka z boku rynku.

Jednocześnie porównanie z modelami zamkniętymi nadal zależy od tego, które testy uznamy za najważniejsze: kod, agentowość, długi kontekst czy stabilność w produkcji. Open weights przestały gonić po cichu – i to jest tu chyba najciekawszy wniosek.

Źródła:

artificialanalysis.ai, simonwillison.net, docs.z.ai, linkedin.com/posts/artificial-analysis, news.ycombinator.com

Najczęściej zadawane pytania