GLM-5.3 i GLM-5.3-Flash: benchmarki, cyber capabilities, Ox Alpha, open weights i porównanie z Kimi K3, Hy4, Claude oraz GPT-5.6 Sol Skip to content

GLM-5.3 i GLM-5.3-Flash: benchmarki, cyber capabilities, Ox Alpha, open weights i porównanie z Kimi K3, Hy4, Claude oraz GPT-5.6 Sol

Zweryfikowana analiza GLM-5.3 i GLM-5.3-Flash: architektura, 1M context, 753B/40B oraz 320B/18B, multimodalność, Ox Alpha, benchmarki coding i cyber, licencje, ceny API, self-hosting i porównanie z Kimi K3, Hy4, Claude oraz GPT-5.6 Sol.

Opublikowano Autor Czas czytania 23 min czytania

Zweryfikowana analiza GLM-5.3 i GLM-5.3-Flash: architektura, 1M context, 753B/40B oraz 320B/18B, multimodalność, Ox Alpha, benchmarki coding i cyber, licencje, ceny API, self-hosting i porównanie z Kimi K3, Hy4, Claude oraz GPT-5.6 Sol.

Na tej stronie
  1. 1TL;DR
  2. 2Co dokładnie wydarzyło się w sierpniu?
  3. 3GLM-5.3 nie jest po prostu „większym Flash”
  4. 4Ile parametrów ma GLM-5.3?
  5. 5GLM-5.3-Flash: 320B total, tylko 18B aktywnych
  6. 61M context i 128K output
  7. 7GLM-5.3 jest text-only, Flash jest natywnie multimodalny
  8. 8Hybrydowe sparse + linear attention
  9. 9IndexPool
  10. 10Manifold-Constrained Hyper-Connections
  11. 1130T tokenów multimodalnego pre-trainingu
  12. 12Ox Alpha to GLM-5.3-Flash
  13. 13Dlaczego stealth test jest interesujący?
  14. 14GLM-5.3: wzrost tylko z post-trainingu
  15. 1550% lepiej w Z.ai Code Bench
  16. 16Publiczne benchmarki codingowe GLM-5.3
  17. 17Terminal-Bench 3.0 pokazuje największy skok
  18. 18DeepSWE: 66.9 vs 46.2
  19. 19Terminal-Bench 2.1: praktycznie remis z Kimi K3
  20. 20Agent's Last Exam: niemal remis z GPT-5.6 Sol
  21. 21CyberGym: GLM-5.3 wyprzedza GPT-5.6 Sol w tabeli Z.ai
  22. 22ExploitBench pokazuje granicę możliwości GLM-5.3
  23. 23ExploitGym: jeszcze większy dystans do frontier
  24. 242 436 podatności w realnych projektach
  25. 25Dlaczego cyber capabilities wymagają osobnego podejścia?
  26. 26GLM-5.3-Flash: benchmarki codingowe
  27. 27Z.ai Code Bench: Flash prawie dogania Opus 4.8
  28. 28Niezależny Artificial Analysis: 60 vs 57
  29. 29Ceny API: ogromna różnica
  30. 30„One-tenth the price” jest więc zasadniczo uzasadnione
  31. 31GLM-5.3 vs Kimi K3
  32. 32GLM-5.3 vs Hy4 preview
  33. 33GLM-5.3 vs GPT-5.6 Sol
  34. 34A co z Claude Opus 5?
  35. 35Open weights: ważna różnica licencyjna
  36. 36Self-hosting
  37. 37Chińskie chipy AI i 3× wzrost serving performance
  38. 38Który model wybrać?
  39. 39Checklista POC przed produkcją
  40. 40Werdykt POLPROG

Końcówka sierpnia 2026 roku przyniosła Z.ai dwa bardzo różne modele z tej samej generacji.

GLM-5.3 to duży, tekstowy model reasoningowy nastawiony przede wszystkim na długie zadania inżynierskie, coding agents i coraz mocniejsze możliwości cyberbezpieczeństwa. Z.ai ogłosiło go 14 sierpnia, a publiczne wagi trafiły na Hugging Face 28 sierpnia, po zapowiedzianym okresie safety evaluation i hardeningu.[1][17]

GLM-5.3-Flash został wypuszczony pod koniec sierpnia jako dużo tańszy, natywnie multimodalny model z zupełnie nową bazą. Ma 320B parametrów łącznie, 18B aktywnych na token, 1M kontekstu, wejście text/image/video/file i publiczne wagi na licencji MIT.[6][8][11]

Flash był wcześniej testowany anonimowo jako:

Ox Alpha

na OpenCode i OpenRouter. Z.ai twierdzi, że w okresie stealth szybko stał się najpopularniejszym modelem tygodnia, a cały ten ruch był obsługiwany na chińskich akceleratorach AI.[6]

Najciekawsze jest jednak to, że te modele nie są po prostu wariantami „duży” i „mały”.

GLM-5.3:

~753B parametrów według metadanych HF / AA
~40B aktywnych
text-only
1M context
128K max output
reasoning zawsze włączony
custom GLM-5.3 License

GLM-5.3-Flash:

320B total
18B active
native multimodal
1M context
128K max output
hybrid sparse + linear attention
MIT

[2][6][10][11]

Do tego GLM-5.3 zanotował bardzo duży wzrost w benchmarkach codingowych i cyber względem GLM-5.2, podczas gdy Flash osiąga dużą część tej jakości przy ułamku ceny API.

Jednocześnie nie należy bezkrytycznie przepisywać marketingu Z.ai.

Benchmarki launchowe są w większości Z.ai-reported, część porównań korzysta z agentowych harnessów i konkretnych konfiguracji, a wyniki modeli konkurencyjnych nie zawsze można bezpośrednio porównywać z tabelami publikowanymi przez innych vendorów.

Dlatego poniżej oddzielamy:

fakty techniczne
vendor-reported benchmarki
niezależne pomiary
porównania cross-vendor

Stan informacji: 31 sierpnia 2026 roku.

TL;DR

PytanieZweryfikowana odpowiedź
GLM-5.3 ogłoszono14 sierpnia 2026
Wagi GLM-5.3publicznie dostępne od 28 sierpnia
GLM-5.3-Flashwydany pod koniec sierpnia; Artificial Analysis datuje release na 26 sierpnia
GLM-5.3 parametry753B w metadanych HF/AA, ok. 40B aktywnych
GLM-5.3-Flash320B total, 18B active
GLM-5.3 inputtext
Flash inputtext, image, video, file
Outputtext
Context1M dla obu
Max output128K dla obu w oficjalnych docs Z.ai
Reasoningzawsze włączony, low / high / max, domyślnie max
GLM-5.3 licensecustom GLM-5.3 License
Flash licenseMIT
GLM-5.3 API$1.40 input / $0.26 cached / $4.40 output za 1M tokenów
Flash list price$0.15 / $0.03 / $0.50
Flash promo do 9.09.2026$0.075 / $0.015 / $0.25
Terminal-Bench 2.1, GLM-5.388.2, Z.ai-reported
Terminal-Bench 3.028.3, Z.ai-reported
DeepSWE v1.166.9, Z.ai-reported
CyberGym84.5%, Z.ai-reported
ExploitBench54.4%, Z.ai-reported
Ox Alphapre-release identity GLM-5.3-Flash
Artificial AnalysisGLM-5.3: 60, Flash: 57 w Intelligence Index v4.1.1
Hy4 vs GLM-5.3Tencent internal blind test: 2.99 vs 2.92
Największy caveatbenchmarki agentowe zależą od harnessu, toolingu, budgetu i inferencji

Co dokładnie wydarzyło się w sierpniu?

14 sierpnia Z.ai ogłosiło GLM-5.3 jako kolejną iterację swojego flagowego modelu.[1]

Nietypowe było to, że firma nie zmieniła base modelu.

Z.ai napisało wprost:

GLM-5.3 uses the same base model as GLM-5.2.
Every gain comes from post-training.

[1][2]

Na premierę API model był dostępny od razu, ale firma zapowiedziała, że publiczne wagi pojawią się po około dwóch tygodniach, po dodatkowej ocenie bezpieczeństwa i hardeningu.[1]

Hugging Face utworzył stronę planowanej premiery na 28 sierpnia 2026. Wagi są już dostępne.[17][5]

Kilka dni wcześniej pojawił się natomiast zupełnie inny model:

GLM-5.3-Flash

który ma nowy base model, nową architekturę i natywną multimodalność.[6][8]

GLM-5.3 nie jest po prostu „większym Flash”

To dwa różne kierunki.

GLM-5.3

Priorytet:

najwyższa jakość
coding
long-horizon agents
terminal work
cyber reasoning

GLM-5.3-Flash

Priorytet:

koszt
multimodalność
wydajność inferencji
visual coding
office workflows
duży kontekst

Flash nie jest destylacją GLM-5.3 opartą na tej samej bazie.

Z.ai podaje, że Flash został wytrenowany od nowego base modelu i korzysta z innej architektury.[6][8]

Ile parametrów ma GLM-5.3?

Tu łatwo znaleźć różne liczby.

Pierwotny GLM-5 był komunikowany przez Z.ai jako:

744B total
40B active

[16]

Hugging Face i Artificial Analysis dla obecnego GLM-5.3 raportują około:

753B total
40B active

[5][10]

GLM-5.3 korzysta z tej samej bazy co GLM-5.2.[1]

Różnica między 744B a 753B wynika z konwencji liczenia parametrów i metadanych implementacji. Dlatego w tym artykule przy porównaniu współczesnych deploymentów używamy 753B / 40B, ale zaznaczamy, że Z.ai historycznie opisywało backbone rodziny GLM-5 jako 744B / 40B.

GLM-5.3-Flash: 320B total, tylko 18B aktywnych

Flash jest dużo mniejszy:

320B total
18B active
45 layers

[6]

Dla porównania Z.ai zestawia go z serią GLM-4.5:

GLM-4.5:
355B total
32B active
92 layers

[6]

To oznacza niemal dwukrotnie mniej aktywnych parametrów i mniej niż połowę liczby warstw przy podobnym total parameter count.

1M context i 128K output

Oficjalne dokumenty Z.ai podają dla obu modeli:

Context Length: 1M
Maximum Output Tokens: 128K

[2][6]

To ważne dla:

  • dużych repozytoriów,
  • długich agent sessions,
  • wieloplikowej analizy,
  • migracji systemów,
  • automatycznego researchu,
  • pracy z dokumentami.

Nie należy jednak utożsamiać:

1M context

z:

1M perfekcyjnej pamięci

Jakość retrieval i reasoning przy maksymalnym kontekście trzeba testować na własnych danych.

GLM-5.3 jest text-only, Flash jest natywnie multimodalny

GLM-5.3 według docs obsługuje obecnie:

input: text
output: text

[2]

Flash:

input:
- text
- image
- video
- file

output:
- text

[6]

To bardzo istotna różnica.

Flash może analizować:

  • screenshots,
  • interfejsy,
  • dokumenty,
  • PDF,
  • prezentacje,
  • arkusze,
  • obrazy,
  • materiały wideo.

Z.ai pozycjonuje go również do visual coding i self-verification przez renderowane rezultaty.[6]

Hybrydowe sparse + linear attention

GLM-5.3-Flash wprowadza do rodziny GLM-5 architekturę łączącą:

sparse attention
+
linear attention

[6][8]

Linear attention ma obsługiwać bardziej lokalne zależności przez state modeling.

Sparse attention pobiera istotne informacje z globalnego kontekstu przy pomocy lekkiego indexera.

Celem jest przede wszystkim obniżenie kosztu inferencji przy długich kontekstach.

IndexPool

Dla kontekstu 1M Z.ai wprowadza:

IndexPool

[6]

Mechanizm kompresuje cztery cache'owane key vectors indexera do jednego przy użyciu weighted pooling.

Z.ai raportuje, że w porównaniu z GLM-5.3 Flash redukuje:

attention compute: 3.01×
KV cache: 4.44×

[6]

To liczby Z.ai z ich porównania architektonicznego, a nie niezależny benchmark infrastruktury.

Manifold-Constrained Hyper-Connections

Flash używa również:

mHC
Manifold-Constrained Hyper-Connections

[6][8]

Technika ma poprawiać efektywność skalowania i przepływ informacji między warstwami.

W praktyce istotniejszy od samej nazwy jest końcowy efekt: Flash próbuje odzyskać dużą część inteligencji flagowego modelu przy znacznie mniejszym aktywnym compute.

30T tokenów multimodalnego pre-trainingu

Z.ai podaje, że GLM-5.3-Flash został wytrenowany na najnowszym:

30T-token multimodal corpus

[6][8]

To jedna z największych różnic względem flagowego GLM-5.3, który zachowuje base model GLM-5.2 i otrzymuje wzrost głównie przez post-training.

Flash dostał nowy pre-training i nową architekturę.

Ox Alpha to GLM-5.3-Flash

Przed oficjalną premierą Flash działał anonimowo jako:

ox-alpha

na:

OpenCode
OpenRouter

[6]

Z.ai twierdzi, że szybko został najpopularniejszym modelem tygodnia.

To informacja producenta. Nie traktujemy jej jako niezależnej statystyki globalnego rynku.

Najważniejszy fakt jest prostszy:

Ox Alpha został oficjalnie ujawniony jako GLM-5.3-Flash.

Dlaczego stealth test jest interesujący?

Anonimowy test ogranicza część efektu marki.

Użytkownicy wybierający Ox Alpha nie musieli wiedzieć, że testują model Z.ai.

Nie oznacza to jednak kontrolowanego badania naukowego.

Ruch platformowy może zależeć od:

  • ceny,
  • promocji,
  • routingu,
  • dostępności,
  • UI,
  • rekomendacji,
  • ciekawości użytkowników.

Dlatego popularność Ox Alpha warto traktować jako sygnał realnego zainteresowania, nie jako benchmark jakości.

GLM-5.3: wzrost tylko z post-trainingu

To jeden z najciekawszych aspektów tej premiery.

Z.ai mówi, że między GLM-5.2 a GLM-5.3 nie zmieniło base modelu.[1][15]

Skalowano za to:

  • liczbę środowisk,
  • różnorodność zadań,
  • compute post-trainingu,
  • długie taski agentowe,
  • automatyczne tworzenie środowisk,
  • weryfikatory,
  • reinforcement learning.

Z.ai rozwija do tego open-source framework:

slime

który łączy training, rollout i data generation dla długich tasków.[1]

50% lepiej w Z.ai Code Bench

Z.ai reklamuje:

+50% coding performance vs GLM-5.2

[1][2]

Trzeba jednak zrozumieć, co to znaczy.

To nie oznacza:

GLM-5.3 jest o 50% lepszy we wszystkich zadaniach programistycznych.

Chodzi o własny, prywatny:

Z.ai Code Bench

W Max effort firma podaje:

GLM-5.3: 34.5%
~75K output tokens/task

GLM-5.2: 23.4%
~96K output tokens/task

[1]

Z.ai twierdzi więc jednocześnie o wyższej skuteczności i niższym token consumption w swoim benchmarku.

Publiczne benchmarki codingowe GLM-5.3

Z.ai publikuje szeroką tabelę porównawczą.[3]

Wybrane wartości:

BenchmarkGLM-5.3GLM-5.2Kimi K3Opus 4.8Fable 5GPT-5.6 Sol
Terminal-Bench 2.188.281.088.385.088.088.8
Terminal-Bench 3.028.34.617.421.133.734.6
DeepSWE v1.166.946.267.558.069.772.7
Toolathlon Verified73.059.976.576.274.774.9
AutomationBench 1.0.648.226.246.741.046.245.8
Agents' Last Exam28.523.827.625.723.828.6
HLE w/ Tools62.554.759.857.963.964.5
GDPval-AA v2176915081682158817431730

To wyniki Z.ai-reported.

Terminal-Bench 3.0 pokazuje największy skok

Zmiana:

GLM-5.2: 4.6
GLM-5.3: 28.3

[1][3]

To ponad sześciokrotny wynik liczbowy, ale nie należy pisać „6× inteligentniejszy”.

Benchmark mierzy określone zadania terminalowe w konkretnym harnessie.

Z.ai używało m.in.:

Claude Code 2.1.207
reasoning_effort=max
400K context
128K max output
avg@3
do 600 agent turns
10h timeout

[3]

Tak szczegółowy setup pokazuje, jak mocno agentowe benchmarki zależą od infrastruktury.

DeepSWE: 66.9 vs 46.2

Z.ai raportuje:

GLM-5.2: 46.2
GLM-5.3: 66.9
Kimi K3: 67.5
GPT-5.6 Sol: 72.7

[3]

GLM-5.3 robi ogromny krok generacyjny, ale w tabeli Z.ai nie wygrywa z Kimi K3 ani GPT-5.6 Sol.

To dobry przykład, dlaczego „SOTA” zawsze trzeba przypisywać do konkretnego benchmarku.

Terminal-Bench 2.1: praktycznie remis z Kimi K3

Wartości Z.ai:

GLM-5.3: 88.2
Kimi K3: 88.3
GPT-5.6 Sol: 88.8
Fable 5: 88.0

[3]

Różnice są bardzo małe.

Na podstawie tego benchmarku nie ma sensu pisać, że którykolwiek model „miażdży” pozostałe.

Agent's Last Exam: niemal remis z GPT-5.6 Sol

Z.ai raportuje:

GLM-5.3: 28.5
GPT-5.6 Sol: 28.6
Kimi K3: 27.6

[3]

Ponownie, różnica jest minimalna.

W innych benchmarkach kolejność zmienia się.

CyberGym: GLM-5.3 wyprzedza GPT-5.6 Sol w tabeli Z.ai

Z.ai raportuje:

GLM-5.3: 84.5%
GPT-5.6 Sol: 83.6%
Fable 5: 83.8%
GLM-5.2: 77.2%
Kimi K3: 80.0%

[1][3]

CyberGym bazuje na white-box source code i sprawdza, czy model potrafi znaleźć oraz zweryfikować podatności poprzez doprowadzenie do faultu.

To benchmark defensywnego i ofensywnego reasoning o kodzie, ale wynik sam w sobie nie mówi o realnej zdolności do przeprowadzania ataków na działające systemy.

ExploitBench pokazuje granicę możliwości GLM-5.3

Z.ai raportuje:

GLM-5.3: 54.4%
GLM-5.2: 24.4%
Kimi K3: 32.2%
Opus 4.8: 40.0%
Fable 5: 78.0%
GPT-5.6 Sol: 76.5%

[1][3]

To bardzo duży wzrost względem GLM-5.2.

Jednocześnie closed frontier pozostaje wyraźnie z przodu.

To znacznie bardziej uczciwy obraz niż prosty slogan „GLM-5.3 najlepszy w cyber”.

ExploitGym: jeszcze większy dystans do frontier

W time-normalized ExploitGym Z.ai podaje liczbę zakończonych tasków przy budżecie 2h / 6h:

GLM-5.3: 105 / 130
Kimi K3: 36 / 70
Fable 5: 181 / 247
GPT-5.6 Sol: 216 / 293

[3]

Z.ai normalizuje czas na podstawie per-model throughput, więc metodologia jest nietypowa i musi być uwzględniona przy interpretacji.

Wniosek jest jednak czytelny:

GLM-5.3 mocno przyspieszył w cyber względem poprzedniej generacji, ale w głębszym exploitation nadal wyraźnie ustępuje najlepszym modelom zamkniętym.

2 436 podatności w realnych projektach

Z.ai twierdzi, że we współpracy z zespołami security w Chinach modele z rodziny GLM znalazły po review, screening i deduplikacji:

2,436 findings
269 projects
1,097 critical + high

[1][2]

Według Z.ai:

53 publicznie ujawnione
2,383 nadal under embargo
107 critical
990 high
1,286 medium
53 low

Najstarszy problem miał pochodzić z 1981 roku, a średni czas życia wykrytej podatności wynosić 26,6 roku.[1]

To dane producenta i jego procesu disclosure, nie niezależna globalna baza CVE.

Dlaczego cyber capabilities wymagają osobnego podejścia?

Z perspektywy przedsiębiorstwa model o takich możliwościach może być bardzo cenny do:

  • secure code review,
  • vulnerability triage,
  • reprodukcji błędów w kontrolowanym środowisku,
  • SAST augmentation,
  • analizy patchy,
  • fuzzing support,
  • threat modeling.

Jednocześnie zwiększa to znaczenie:

  • sandboxingu,
  • logowania działań,
  • kontroli tool use,
  • network isolation,
  • approval gates,
  • ograniczeń środowisk testowych.

Wysoki wynik security benchmarku nie jest tylko funkcją marketingową. To również większa powierzchnia ryzyka operacyjnego.

GLM-5.3-Flash: benchmarki codingowe

Z.ai raportuje dla Flash:[7][8]

BenchmarkGLM-5.3-FlashGLM-5.2
Terminal-Bench 2.184.381.0
DeepSWE v1.163.446.2
NL2Repo56.348.9
Toolathlon Verified78.459.9
AutomationBench 1.0.648.826.2
Agents' Last Exam26.320.4
HLE w/ Tools55.354.7
GDPval-AA v217731504

Najważniejszy wniosek nie brzmi:

Flash jest tak samo dobry jak GLM-5.3.

Tylko:

Flash odzyskuje dużą część jakości za radykalnie niższą cenę.

Z.ai Code Bench: Flash prawie dogania Opus 4.8

W prywatnym Z.ai Code Bench firma podaje przy Max effort:

GLM-5.3-Flash: 29.0
Claude Opus 4.8: 29.5

[6]

To bardzo interesujący wynik.

Ale ponieważ benchmark jest prywatny i utrzymywany przez Z.ai, nie można traktować go jako niezależnego dowodu, że Flash „dorównuje Claude” we wszystkich zadaniach.

Niezależny Artificial Analysis: 60 vs 57

Tu mamy ważniejszy punkt odniesienia.

Artificial Analysis Intelligence Index v4.1.1 raportuje obecnie:

GLM-5.3 max: 60
GLM-5.3-Flash: 57

[10][11][20][12]

To niezależniejszy benchmark composite obejmujący m.in.:

  • GDPval-AA v2,
  • Terminal-Bench 2.1,
  • HLE,
  • GPQA Diamond,
  • SciCode,
  • CritPt,
  • AA-Omniscience,
  • AA-LCR.

Artificial Analysis podaje również dla first-party API:

GLM-5.3:
~66.5 output tokens/s
~1.6 s TTFT

Flash:
~45–49 output tokens/s
~1.5 s TTFT

[10][11]

Paradoksalnie „Flash” nie musi więc oznaczać najwyższej prędkości token generation na każdym providerze. Jego największą przewagą jest obecnie przede wszystkim koszt i aktywny compute.

Ceny API: ogromna różnica

Oficjalny cennik Z.ai 31 sierpnia 2026:[9]

GLM-5.3

Input:        $1.40 / 1M
Cached input: $0.26 / 1M
Output:       $4.40 / 1M

GLM-5.3-Flash — cena katalogowa

Input:        $0.15 / 1M
Cached input: $0.03 / 1M
Output:       $0.50 / 1M

GLM-5.3-Flash — promocja do 9 września

Input:        $0.075 / 1M
Cached input: $0.015 / 1M
Output:       $0.25 / 1M

Promocja kończy się 9 września 2026 o 24:00 UTC+8.[9]

To oznacza, że przy cenach katalogowych Flash jest około:

9.3× tańszy na input
8.8× tańszy na output

od GLM-5.3.

W promocji różnica jest jeszcze większa.

OpenRouter również udostępnia oba modele, ale ceny i routing mogą różnić się od first-party API Z.ai, dlatego produkcyjne porównanie kosztów powinno używać faktycznego providera wybranego przez aplikację.[18][19]

„One-tenth the price” jest więc zasadniczo uzasadnione

Z.ai opisuje Flash jako model działający za około jedną dziesiątą ceny GLM-5.2.[8]

Przy cenach katalogowych:

GLM-5.2 input: $1.40
Flash input:   $0.15

GLM-5.2 output: $4.40
Flash output:   $0.50

[9]

To około 9× różnicy, więc slogan „one-tenth the price” jest rozsądnym marketingowym zaokrągleniem.

Nie oznacza jednak automatycznie dziesięciokrotnie niższego kosztu pełnego tasku, bo modele mogą generować różną liczbę tokenów i wykonywać różną liczbę tool calls.

GLM-5.3 vs Kimi K3

W tabeli Z.ai:

Terminal Bench 2.1:
GLM-5.3 88.2
Kimi K3 88.3

DeepSWE:
GLM-5.3 66.9
Kimi K3 67.5

Terminal Bench 3.0:
GLM-5.3 28.3
Kimi K3 17.4

AutomationBench:
GLM-5.3 48.2
Kimi K3 46.7

ExploitBench:
GLM-5.3 54.4
Kimi K3 32.2

[3]

Nie ma jednego zwycięzcy.

Kimi jest minimalnie wyżej w części codingu, GLM mocno wyżej w Terminal-Bench 3.0 i security evals.

GLM-5.3 vs Hy4 preview

Tencent przeprowadził osobny blind test:

163 ekspertów
203 realne zadania engineeringowe
skala 0–4

Wynik:

Hy4 preview: 2.99
Kimi K3: 2.94
GLM-5.3: 2.92

[13][14]

Dla Hy4 vs GLM Tencent podaje:

46.8% wins
12.8% ties
40.4% losses

z perspektywy Hy4.[14]

To wskazuje małą przewagę Hy4 w tym konkretnym wewnętrznym workloadzie.

Nie należy łączyć tego z tabelami Z.ai w jeden uniwersalny ranking, bo setup jest całkowicie inny.

GLM-5.3 vs GPT-5.6 Sol

W tabeli Z.ai GPT-5.6 Sol pozostaje mocniejszy w kilku najtrudniejszych benchmarkach:[3]

Terminal Bench 3.0:
28.3 vs 34.6

DeepSWE:
66.9 vs 72.7

ExploitBench:
54.4 vs 76.5

ExploitGym 6h:
130 vs 293

HLE w/ Tools:
62.5 vs 64.5

GLM-5.3 jest natomiast minimalnie wyżej w CyberGym:

84.5 vs 83.6

oraz w AutomationBench:

48.2 vs 45.8

na danych Z.ai.

To jest dużo bardziej zniuansowany obraz niż „open model pokonał GPT”.

A co z Claude Opus 5?

Launchowa tabela Z.ai porównuje przede wszystkim:

Claude Opus 4.8
Claude Fable 5

nie Claude Opus 5.[3]

Dlatego nie należy przepisywać tych wyników jako:

GLM-5.3 > Claude Opus 5

bez identycznego benchmarku i harnessu.

Opus 5 można oceniać w osobnych, współczesnych benchmarkach, ale mieszanie tabel różnych vendorów bez kontroli metodologii daje fałszywą precyzję.

Open weights: ważna różnica licencyjna

To jeden z najbardziej niedocenianych punktów.

GLM-5.3-Flash

Hugging Face wskazuje:

MIT

[8]

To klasyczna, bardzo permissive open-source license.

GLM-5.3

Nie jest pod MIT.

Ma własną:

GLM-5.3 License

[4]

Licencja pozwala m.in.:

  • używać,
  • kopiować,
  • modyfikować,
  • wdrażać,
  • fine-tunować,
  • tworzyć derivative works,
  • dystrybuować,
  • sublicencjonować,
  • sprzedawać.

Ale zawiera ważny warunek dla Model as a Service.

Jeśli podmiot wraz z affiliates prowadzi MaaS i przekroczy 10 mld USD łącznego przychodu w dowolnych kolejnych 12 miesiącach, przed komercyjnym użyciem modelu lub pochodnych musi przejść security review Z.ai.[4]

To oznacza, że:

GLM-5.3 ma publiczne wagi i szerokie prawa komercyjne, ale nie jest licencjonowany identycznie jak MIT.

Self-hosting

Oba modele mają oficjalne instrukcje dla:

vLLM
SGLang
Transformers
Docker Model Runner

a Z.ai wskazuje również dodatkowe frameworki, m.in. KTransformers, TokenSpeed i Unsloth.[3][8]

GLM-5.3 repo na Hugging Face ma około:

756 GB
141 safetensors shards

dla głównego publikowanego wariantu.[5]

To nadal duży deployment.

Flash przy 320B total / 18B active jest znacznie lżejszy obliczeniowo, ale nadal nie jest typowym modelem do wygodnego uruchomienia na pojedynczej konsumenckiej GPU.

Chińskie chipy AI i 3× wzrost serving performance

Z.ai mówi, że realny traffic GLM-5.3-Flash był obsługiwany na dużym klastrze chińskich AI accelerators.[6][7]

Stack obejmował m.in.:

tensor parallelism
ReplaySSM
W8A8
hybrid INT8/FP8/BF16 cache
Layer Split
Encode–Prefill–Decode disaggregation

Z.ai raportuje:

3× end-to-end serving performance
vs initial baseline on the same hardware

[6][7]

Firma twierdzi też, że osiągnęła per-token cost porównywalny z mainstream NVIDIA GPUs.

To vendor-reported infrastructure claim i wymaga niezależnej replikacji, zanim stanie się podstawą decyzji zakupowej.

Który model wybrać?

Wybierz GLM-5.3, jeśli:

  • liczy się najwyższa jakość codingu w rodzinie GLM,
  • prowadzisz długie zadania terminalowe,
  • budujesz coding agents,
  • potrzebujesz mocnego reasoning,
  • security analysis jest istotnym use case,
  • koszt API jest drugorzędny względem jakości.

Wybierz GLM-5.3-Flash, jeśli:

  • koszt ma duże znaczenie,
  • potrzebujesz vision,
  • analizujesz screenshots i GUI,
  • generujesz lub sprawdzasz dokumenty,
  • potrzebujesz video/file input,
  • chcesz długi kontekst przy dużo niższej cenie,
  • MIT jest istotną przewagą licencyjną.

Rozważ Kimi K3 / Hy4 / GPT / Claude, jeśli:

Twój własny benchmark pokazuje lepszy:

cost per successful task

Nie ma podstaw, aby wybierać model wyłącznie na podstawie jednego launchowego leaderboardu.

Checklista POC przed produkcją

Jakość

  • Testuj własne realne zadania.
  • Używaj identycznego harnessu dla wszystkich modeli.
  • Mierz test pass rate.
  • Mierz task completion.
  • Mierz regresje.
  • Mierz out-of-scope changes.
  • Testuj długie sesje.
  • Testuj recovery po błędzie.
  • Testuj tool calling.
  • Testuj structured output.

Reasoning

  • Porównaj low, high i max.
  • Pamiętaj, że reasoning nie może być wyłączony.
  • Mierz reasoning tokens.
  • Mierz całkowity output.
  • Mierz latency end-to-end.
  • Nie używaj max automatycznie do każdego prostego tasku.

Long context

  • Test 32K.
  • Test 128K.
  • Test 256K.
  • Test 1M.
  • Mierz retrieval accuracy.
  • Mierz utratę instrukcji.
  • Testuj duże repo.
  • Testuj cross-file dependencies.
  • Mierz KV-cache i concurrency.
  • Nie zakładaj perfekcyjnej pamięci 1M.

Multimodalność Flash

  • Testuj screenshots.
  • Testuj dokumenty.
  • Testuj wykresy.
  • Testuj OCR-like workflows.
  • Testuj GUI verification.
  • Testuj video na własnych danych.

Security

  • Uruchamiaj cyber workflows w sandboxie.
  • Ogranicz network access.
  • Loguj tool calls.
  • Wprowadź approval gates.
  • Oddziel production secrets.
  • Nie dawaj agentowi niepotrzebnych credentiali.
  • Waliduj patch przed merge.
  • Traktuj model jako narzędzie wspomagające, nie autonomiczny autorytet bezpieczeństwa.

Licencja i operacje

  • Sprawdź GLM-5.3 License.
  • Sprawdź warunek MaaS >$10B revenue.
  • Dla Flash zweryfikuj MIT obligations.
  • Sprawdź politykę danych wybranego API providera.
  • Sprawdź region processingu.
  • Sprawdź retention.
  • Mierz cache hit rate.
  • Mierz cost per successful task.
  • Zdefiniuj fallback model.
  • Monitoruj zmiany cen po promocji Flash.

Werdykt POLPROG

GLM-5.3 jest jedną z najciekawszych premier codingowych sierpnia 2026 nie dlatego, że „pokonał wszystkie modele”.

Nie pokonał.

Znacznie ciekawsze jest to, że ten sam base model co GLM-5.2 został przesunięty bardzo daleko przez skalowanie post-trainingu.[1]

Skoki:

Terminal-Bench 3.0:
4.6 → 28.3

DeepSWE:
46.2 → 66.9

ExploitBench:
24.4 → 54.4

są bardzo duże.[1][3]

GLM-5.3-Flash pokazuje z kolei inną strategię:

320B total
18B active
native multimodal
1M context
MIT
bardzo niska cena

przy niezależnym wyniku 57 w Artificial Analysis Intelligence Index wobec 60 dla GLM-5.3 max.[10][11][12]

To sprawia, że Flash może być dla wielu realnych produktów bardziej interesującym modelem niż flagship.

Najważniejsze wnioski:

  1. GLM-5.3 zrobił ogromny post-training leap.
  2. Jego cyber capabilities są realnie istotne, ale closed frontier nadal prowadzi w głębszym exploitation.
  3. GLM-5.3-Flash jest wyjątkowo agresywny cenowo.
  4. Ox Alpha był właśnie Flash.
  5. Flash ma MIT, GLM-5.3 ma custom license z warunkiem dla ogromnych MaaS providers.
  6. Nie ma jednego benchmarku, który rozstrzyga Kimi K3, Hy4, GLM, Claude i GPT.
  7. Dla produkcji liczy się cost per successful task, a nie sam wynik leaderboardu.

Jeżeli trzeba wybrać jeden model do pierwszego POC:

GLM-5.3 dla maksymalnej jakości tekstowego coding agenta.

GLM-5.3-Flash dla najlepszego kompromisu koszt, multimodalność, długi kontekst i otwarta licencja MIT.

GLM-5.3 GLM-5.3-Flash Z.ai Ox Alpha Open Weights Coding AI Cybersecurity AI Kimi K3 Hy4 GPT-5.6 Sol

Najczęściej zadawane pytania

Kiedy wydano GLM-5.3?

Z.ai ogłosiło model 14 sierpnia 2026. Publiczne wagi trafiły na Hugging Face 28 sierpnia.

Czy GLM-5.3 jest open source?

Z.ai używa określenia open source, ale precyzyjniej jest mówić open weights pod custom GLM-5.3 License. Licencja jest szeroka, lecz nie jest MIT i zawiera dodatkowy warunek dla bardzo dużych podmiotów MaaS.

Czy GLM-5.3-Flash jest open source?

Wagi są publiczne, a Hugging Face oznacza licencję jako MIT.

Ile parametrów ma GLM-5.3?

Hugging Face i Artificial Analysis raportują około 753B total oraz 40B active. Pierwotna specyfikacja GLM-5 używała 744B total / 40B active.

Ile parametrów ma Flash?

320B total, 18B active.

Czy oba mają 1M context?

Tak, oficjalne dokumenty Z.ai podają 1M.

Maksymalny output?

128K według aktualnej dokumentacji Z.ai.

Czy GLM-5.3 obsługuje obrazy?

Nie, obecnie text-only.

Czy Flash obsługuje obrazy?

Tak. Oficjalne docs wymieniają text, image, video i file jako input.

Czy można wyłączyć reasoning?

Nie. Dla obu thinking.type jest zawsze enabled.

Jakie reasoning levels są dostępne?

low, high, max, domyślnie max.

Co to Ox Alpha?

Anonimowy pre-release GLM-5.3-Flash testowany na OpenCode i OpenRouter.

Czy GLM-5.3 jest lepszy od Kimi K3?

Nie we wszystkim. W tabeli Z.ai Kimi jest minimalnie wyżej w Terminal-Bench 2.1 i DeepSWE, a GLM wyżej m.in. w Terminal-Bench 3.0 i ExploitBench.

Czy GLM-5.3 jest lepszy od Hy4?

Tencent w swoim wewnętrznym blind teście dał Hy4 2.99/4, GLM-5.3 2.92/4. To jeden vendor-specific test, nie uniwersalny ranking.

Czy GLM-5.3 pokonał GPT-5.6 Sol?

Nie ogólnie. W tabeli Z.ai GPT-5.6 Sol prowadzi w wielu trudnych benchmarkach, szczególnie DeepSWE, Terminal-Bench 3.0 i exploitation.

Czy GLM-5.3 pokonał Claude Opus 5?

Brak podstaw do takiego stwierdzenia. Tabela launchowa Z.ai porównuje głównie Opus 4.8 i Fable 5, a nie Opus 5.

Czy 84.5% CyberGym oznacza najlepszy model do security?

Nie. To jeden benchmark. W głębszych exploitation benchmarkach Fable 5 i GPT-5.6 Sol pozostają wyraźnie z przodu według tabeli Z.ai.

Ile kosztuje GLM-5.3?

Direct Z.ai: $1.40 / 1M input, $0.26 cached input, $4.40 / 1M output.

Ile kosztuje Flash?

List price: $0.15 input, $0.03 cached, $0.50 output. Do 9 września 2026 obowiązuje promocja 50%: $0.075 / $0.015 / $0.25.

Który ma lepszą licencję do self-hostingu?

Dla większości zastosowań permissive MIT w Flash jest prostsza. GLM-5.3 używa własnej licencji.

Czy można uruchomić lokalnie?

Tak. Oba mają publiczne wagi i wsparcie m.in. dla vLLM oraz SGLang, ale wymagania sprzętowe są wysokie.

Który wybrać do produktu?

Najlepiej ustalić to przez własny POC mierzący jakość, latency, tokeny, tool calls i cost per successful task.

Źródła i przypisy

  1. Z.ai, GLM-5.3: Frontier Coding with Emergent Cyber Capabilities, 14 sierpnia 2026, dostęp 31 sierpnia 2026.12345678910111213141516
  2. Z.ai Developer Docs, GLM-5.3 — Overview, dostęp 31 sierpnia 2026.123456
  3. Z.ai / Hugging Face, GLM-5.3 — official model card, dostęp 31 sierpnia 2026.1234567891011121314
  4. Z.ai / Hugging Face, GLM-5.3 License, dostęp 31 sierpnia 2026.12
  5. Hugging Face, zai-org/GLM-5.3 — files and versions, dostęp 31 sierpnia 2026.123
  6. Z.ai Developer Docs, GLM-5.3-Flash — Overview, dostęp 31 sierpnia 2026.12345678910111213141516171819
  7. Z.ai, GLM-5.3-Flash: Frontier Intelligence, Flash Cost, sierpień 2026, dostęp 31 sierpnia 2026.123
  8. Z.ai / Hugging Face, GLM-5.3-Flash — official model card, dostęp 31 sierpnia 2026.12345678910
  9. Z.ai Developer Docs, Pricing, dostęp 31 sierpnia 2026.123
  10. Artificial Analysis, GLM-5.3 (max) — Intelligence, Performance & Price Analysis, stan 31 sierpnia 2026.12345
  11. Artificial Analysis, GLM-5.3-Flash — Intelligence, Performance & Price Analysis, stan 31 sierpnia 2026.12345
  12. Artificial Analysis, GLM-5.3-Flash vs GLM-5.3 (max), stan 31 sierpnia 2026.12
  13. Tencent, Tencent Releases and Open-Sources Tencent Hy4 preview, 28 sierpnia 2026.
  14. Tencent / Hugging Face, Hy4 preview — official model card, dostęp 31 sierpnia 2026.12
  15. Z.ai, GLM-5.2: Built for Long-Horizon Tasks, 16 czerwca 2026.
  16. GLM-5 Team, GLM-5: from Vibe Coding to Agentic Engineering, arXiv:2602.15763, 2026.
  17. Hugging Face, zai-org/GLM-5.3 — planned weights release for August 28, 2026, archiwalny release marker sprawdzony 31 sierpnia 2026.12
  18. OpenRouter, Z.ai: GLM 5.3, stan 31 sierpnia 2026.
  19. OpenRouter, Z.ai: GLM 5.3 Flash, stan 31 sierpnia 2026.
  20. Artificial Analysis, GLM-5.3-Flash API Provider Benchmarking, stan 31 sierpnia 2026.

Czy ten artykuł był pomocny?

Nowe artykuły na e-mail

Jeden krótki e-mail przy każdym nowym artykule. Bez spamu, wypisujesz się jednym kliknięciem.

Wykorzystujemy e-mail wyłącznie do wysyłki nowych artykułów. Bez udostępniania stronom trzecim.

Wróć do bazy wiedzy