Z.ai dołożyło właśnie argument do tezy, że otwarte modele nie muszą już oglądać pleców zamkniętej czołówce. GLM-5.2 prowadzi w rankingu Artificial Analysis dla open weights, a przy okazji dorzuca 1 mln tokenów kontekstu i ceny, które nie wyglądają jak kara za ambicję.
TL;DR
- GLM-5.2 zdobywa 51 punktów na Artificial Analysis Intelligence Index v4.1 – najwięcej wśród open weights
- Model ma 744B parametrów ogółem i 40B aktywnych, identycznie jak GLM-5.1, ale wyraźnie lepszy w rozumowaniu naukowym
- Kontekst wzrósł do 1M tokenów, licencja MIT, dostępny m.in. przez DeepInfra i Fireworks
- Wynik 1524 na GDPval-AA v2 stawia go na poziomie GPT-5.5 w zadaniach agentycznych
- Koszt za zadanie na poziomie Pareto frontier – ~0,46 USD przy wysokiej inteligencji
Jak GLM-5.2 wypadł w rankingu Artificial Analysis?
Z.ai opisało GLM-5.2 jako nowego lidera wśród modeli open weights w rankingu Artificial Analysis Intelligence Index v4.1. Według danych przywołanych w tekście model uzyskał 51 punktów, wyprzedzając MiniMax-M3 i DeepSeek V4 Pro, które mają po 44 punkty.
To ważne z prostego powodu: Artificial Analysis jest dziś jednym z częściej cytowanych punktów odniesienia w świecie modeli językowych. GLM-5.2 prowadzi w open weights, więc nie chodzi już tylko o lokalny sukces Z.ai, ale o sygnał dla całego segmentu otwartych wagowych modeli.
Co poprawiło Z.ai względem GLM-5.1?
Największe skoki widać w testach związanych z rozumowaniem i zadaniami technicznymi. W przywołanych wynikach CritPt rośnie do 21%, HLE do 40%, SciCode do 50%, a TerminalBench v2.1 do 78%. Sam szkic sugeruje, że to właśnie tutaj GLM-5.2 najbardziej odjechał starszej wersji.
Jest też druga strona medalu: model generuje średnio więcej tokenów wyjściowych na zadanie, około 43 tys. To zwykle oznacza bardziej rozbudowany tok rozumowania, ale też większy koszt i mniejszą oszczędność tokenową niż u części rywali. GDPval-AA v2: 1524 punkty to z kolei wynik, który według przywołanych benchmarków ustawia GLM-5.2 bardzo blisko GPT-5.5 w zadaniach agentycznych.
Co Z.ai daje w praktyce: parametry, kontekst i licencja
Pod względem architektury Z.ai nie zrobiło rewolucji. GLM-5.2 zachowuje skalę GLM-5.1: 744 mld parametrów łącznie i 40 mld aktywnych w architekturze MoE. Zmiana, którą odczuje użytkownik, leży gdzie indziej – kontekst wzrósł z 200 tys. do 1 mln tokenów.
Dla firm i deweloperów istotna jest też licencja MIT, bo mocno upraszcza komercyjne użycie modelu. 1 mln tokenów kontekstu oznacza, że GLM-5.2 da się sensownie testować w długich dokumentach, repozytoriach czy złożonych przepływach agentowych. Wagi są dostępne m.in. na Hugging Face, a inferencję oferują także Z.ai, DeepInfra, Novita, Nebius, Siliconflow i Fireworks.
Ile kosztuje GLM-5.2 i gdzie trafia na rynku?
Według cennika przywołanego w szkicu stawki pozostają na poziomie GLM-5.1: 1,4 USD za milion tokenów wejściowych, 4,4 USD za milion tokenów wyjściowych i 0,26 USD za cache hit. W praktyce to pozycjonuje model w grupie tych, które próbują dowieźć wysoki wynik bez natychmiastowego rachunku grozy.
Szkic podaje też koszt zadania rzędu 0,46 USD i wskazuje, że GLM-5.2 znajduje się na granicy Pareto między „inteligencją” a kosztem wykonania zadania. Cena nie zabija opłacalności, choć przy polskim kursie to wciąż koszt, który przy większym wdrożeniu trzeba liczyć uważnie, a nie „na oko”.
Czy GLM-5.2 naprawdę dogonił zamknięte modele?
| Model | Intelligence Index | GDPval-AA v2 | Kontekst | Licencja |
|---|---|---|---|---|
| GLM-5.2 | 51 | 1524 | 1M | MIT |
| MiniMax-M3 | 44 | 1418 | – | – |
| DeepSeek V4 Pro | 44 | 1328 | – | – |
| GPT-5.5 xhigh | – | 1514 | – | zamknięta |
Najuczciwsza odpowiedź brzmi: w części zadań wygląda na to, że bardzo się zbliżył, ale jedno zwycięstwo benchmarkowe nie zamyka sprawy. Wynik w GDPval-AA v2 sugeruje sąsiedztwo z GPT-5.5, a przewaga nad innymi modelami open weights jest wyraźna. To już nie jest ciekawostka z boku rynku.
Jednocześnie porównanie z modelami zamkniętymi nadal zależy od tego, które testy uznamy za najważniejsze: kod, agentowość, długi kontekst czy stabilność w produkcji. Open weights przestały gonić po cichu – i to jest tu chyba najciekawszy wniosek.
Źródła:
artificialanalysis.ai, simonwillison.net, docs.z.ai, linkedin.com/posts/artificial-analysis, news.ycombinator.com
