2026-08-27 · 5 min čtení
Z.ai vydal open-source model GLM-5.3-Flash, který v testech zaostává za vlajkovým GLM-5.3 jen o tři body, ale stojí zhruba sedmkrát méně. Zajímavé je, že veškerý provoz při jeho tajném testování běžel na čínských AI čipech, ne na hardwaru Nvidia.
Čínská firma Z.ai vydala model GLM-5.3-Flash, který v žebříčku Intelligence Index od Artificial Analysis dosáhl 57 bodů — jen tři body za větším modelem GLM-5.3, který má 60 bodů. Rozdíl v cenách je ale výrazný: podle stejného měření vyjde jedna úloha z indexu u GLM-5.3-Flash na 0,09 dolaru, zatímco u většího GLM-5.3 na 0,68 dolaru. To je zhruba sedminásobný rozdíl. Podle dostupných zdrojů kolem 26. srpna 2026 firma model oficiálně představila, ale ještě před tím ho několik týdnů tajně testovala pod krycím jménem „ox-alpha" na platformách OpenCode a OpenRouter, kde se stal nejpopulárnějším modelem týdne.
GLM-5.3-Flash je první nativně multimodální model v řadě GLM-5 — umí zpracovávat text, obrázky i video v jednom vstupu. Má 320 miliard parametrů celkem, ale díky architektuře mixture-of-experts (model si pro každý úkol „aktivuje" jen část svých neuronových sítí) používá při každém výpočtu jen 18 miliard z nich. Díky tomu je rychlejší a levnější na provoz než jeho velikost napovídá. Kontextové okno má přes 1 milion tokenů, což zhruba odpovídá obsahu několika tlustých knih najednou.
Cena v API je 0,15 dolaru za milion vstupních tokenů, 0,03 dolaru za milion kešovaných vstupních tokenů (opakovaně použitý kontext vyjde levněji) a 0,50 dolaru za milion výstupních tokenů. Váhy modelu jsou volně ke stažení na Hugging Face pod licencí MIT, takže si ho může kdokoliv stáhnout a provozovat na vlastním hardwaru.
Nejvíc pozornosti si ale vysloužilo něco jiného: podle Zhipu AI (matky Z.ai) běžel celý skrytý test „ox-alpha" na clusteru 100 000 domácích čínských čipů, bez jakéhokoli podílu Nvidia hardwaru. Na OpenRouter model za první tři dny po odhalení zpracoval přes 11 bilionů tokenů — dosud největší launch na této platformě. Akcie Zhipu na to reagovaly růstem o víc než 12 % na 1 160 hongkongských dolarů.
Model je dostupný přes API Z.ai nebo přes platformu OpenRouter, kde ho lze vyzkoušet i bez vlastního účtu u Z.ai. Kdo má aktivní GLM Coding Plan (úrovně Lite za 18 dolarů, Pro za 80 dolarů a Max za 168 dolarů měsíčně), dostává u GLM-5.3-Flash trojnásobnou využitelnou kvótu oproti standardnímu GLM-5.3 na stejné úrovni předplatného.
Pro rychlé vyzkoušení stačí zaregistrovat se na OpenRouter, vybrat model „zai-org/glm-5.3-flash" a zadat prompt přímo v chatovacím okně nebo přes API. Jako testovací zadání můžeš zkusit něco, co ověří jeho agentické a kódovací schopnosti současně s prací s obrázkem:
Podívej se na přiložený screenshot chybové hlášky z Pythonu a napiš mi funkční opravu kódu. Vysvětli mi krok za krokem, proč k chybě došlo.
Model má i slabší stránky. Generuje text rychlostí 48,7 tokenu za sekundu, což je pod mediánem podobně velkých open-weight modelů (67 tokenů za sekundu) — na dlouhé odpovědi si tedy počkáš déle. Ve vizuálních úlohách typu BabyVision nebo MVbench zaostává za Gemini 3.7 Flash, takže na náročnou práci s obrazem není ideální volba. Problém je i efektivita: podle Artificial Analysis tvoří přibližně 90 % vygenerovaných výstupních tokenů „reasoning" (vnitřní úvahy modelu před finální odpovědí), což znamená vyšší reálné náklady, než by odpovídalo délce viditelné odpovědi. A pokud chceš model provozovat sám na vlastním serveru, aktuální podpora ve vLLM (populární nástroj pro nasazení modelů) funguje jen na Nvidia GPU řady Hopper a novějších — takže „nezávislost na Nvidia" platí hlavně pro to, jak model vytrénovala a testovala Z.ai, ne pro self-hosting u běžného uživatele.
Pro běžného uživatele je hlavní zpráva jednoduchá: levné, otevřené modely se dál přibližují výkonu drahých vlajkových systémů. Pokud vyvíjíš vlastní aplikaci nebo chatbota a řešíš rozpočet, GLM-5.3-Flash je reálná alternativa k dražším API od OpenAI nebo Anthropicu — za zlomek ceny dostaneš výkon srovnatelný s GPT-5.6 Terra. Zároveň to potvrzuje, že čínské firmy dokážou trénovat i provozovat konkurenceschopné modely bez závislosti na Nvidia čipech, což může časem ovlivnit i to, jak stabilní a dostupné budou ceny AI služeb celosvětově.
Technicky stojí za povšimnutí hybridní architektura kombinující sparse a lineární pozornost (attention) — mechanismus, díky kterému model zvládá dlouhý kontext bez extrémního nárůstu výpočetních nákladů. Z.ai uvádí, že oproti výchozímu nastavení na stejném čínském hardwaru dosáhli trojnásobného zlepšení end-to-end výkonu obsluhy, čímž se efektivita nákladů na token vyrovnala běžným nasazením na Nvidia GPU. Čas do prvního tokenu (TTFT) činí 1,52 sekundy, což ovlivňuje především pocit „odezvy" u interaktivních aplikací typu chatbotů.
Zdroj informací: The Decoder (https://the-decoder.com/the-chinese-ai-model-glm-5-3-flash-runs-without-nvidia-and-costs-a-fraction-of-what-the-competition-does/), doplněno o data z Baseten, MarkTechPost, Hugging Face, SCMP a Artificial Analysis