← Zpět na novinky

GLM-5.3-Flash: čínský model dorovnává špičku a běží bez Nvidia čipů

2026-08-27 · 5 min čtení

Z.ai vydal open-source model GLM-5.3-Flash, který v testech zaostává za vlajkovým GLM-5.3 jen o tři body, ale stojí zhruba sedmkrát méně. Zajímavé je, že veškerý provoz při jeho tajném testování běžel na čínských AI čipech, ne na hardwaru Nvidia.

GLM-5.3-Flash: čínský model dorovnává špičku a běží bez Nvidia čipů

Čínská firma Z.ai vydala model GLM-5.3-Flash, který v žebříčku Intelligence Index od Artificial Analysis dosáhl 57 bodů — jen tři body za větším modelem GLM-5.3, který má 60 bodů. Rozdíl v cenách je ale výrazný: podle stejného měření vyjde jedna úloha z indexu u GLM-5.3-Flash na 0,09 dolaru, zatímco u většího GLM-5.3 na 0,68 dolaru. To je zhruba sedminásobný rozdíl. Podle dostupných zdrojů kolem 26. srpna 2026 firma model oficiálně představila, ale ještě před tím ho několik týdnů tajně testovala pod krycím jménem „ox-alpha" na platformách OpenCode a OpenRouter, kde se stal nejpopulárnějším modelem týdne.

Co je nového

GLM-5.3-Flash je první nativně multimodální model v řadě GLM-5 — umí zpracovávat text, obrázky i video v jednom vstupu. Má 320 miliard parametrů celkem, ale díky architektuře mixture-of-experts (model si pro každý úkol „aktivuje" jen část svých neuronových sítí) používá při každém výpočtu jen 18 miliard z nich. Díky tomu je rychlejší a levnější na provoz než jeho velikost napovídá. Kontextové okno má přes 1 milion tokenů, což zhruba odpovídá obsahu několika tlustých knih najednou.

Cena v API je 0,15 dolaru za milion vstupních tokenů, 0,03 dolaru za milion kešovaných vstupních tokenů (opakovaně použitý kontext vyjde levněji) a 0,50 dolaru za milion výstupních tokenů. Váhy modelu jsou volně ke stažení na Hugging Face pod licencí MIT, takže si ho může kdokoliv stáhnout a provozovat na vlastním hardwaru.

Nejvíc pozornosti si ale vysloužilo něco jiného: podle Zhipu AI (matky Z.ai) běžel celý skrytý test „ox-alpha" na clusteru 100 000 domácích čínských čipů, bez jakéhokoli podílu Nvidia hardwaru. Na OpenRouter model za první tři dny po odhalení zpracoval přes 11 bilionů tokenů — dosud největší launch na této platformě. Akcie Zhipu na to reagovaly růstem o víc než 12 % na 1 160 hongkongských dolarů.

Jak to vyzkoušet

Model je dostupný přes API Z.ai nebo přes platformu OpenRouter, kde ho lze vyzkoušet i bez vlastního účtu u Z.ai. Kdo má aktivní GLM Coding Plan (úrovně Lite za 18 dolarů, Pro za 80 dolarů a Max za 168 dolarů měsíčně), dostává u GLM-5.3-Flash trojnásobnou využitelnou kvótu oproti standardnímu GLM-5.3 na stejné úrovni předplatného.

Pro rychlé vyzkoušení stačí zaregistrovat se na OpenRouter, vybrat model „zai-org/glm-5.3-flash" a zadat prompt přímo v chatovacím okně nebo přes API. Jako testovací zadání můžeš zkusit něco, co ověří jeho agentické a kódovací schopnosti současně s prací s obrázkem:

Podívej se na přiložený screenshot chybové hlášky z Pythonu a napiš mi funkční opravu kódu. Vysvětli mi krok za krokem, proč k chybě došlo.

Kdy se to nehodí

Model má i slabší stránky. Generuje text rychlostí 48,7 tokenu za sekundu, což je pod mediánem podobně velkých open-weight modelů (67 tokenů za sekundu) — na dlouhé odpovědi si tedy počkáš déle. Ve vizuálních úlohách typu BabyVision nebo MVbench zaostává za Gemini 3.7 Flash, takže na náročnou práci s obrazem není ideální volba. Problém je i efektivita: podle Artificial Analysis tvoří přibližně 90 % vygenerovaných výstupních tokenů „reasoning" (vnitřní úvahy modelu před finální odpovědí), což znamená vyšší reálné náklady, než by odpovídalo délce viditelné odpovědi. A pokud chceš model provozovat sám na vlastním serveru, aktuální podpora ve vLLM (populární nástroj pro nasazení modelů) funguje jen na Nvidia GPU řady Hopper a novějších — takže „nezávislost na Nvidia" platí hlavně pro to, jak model vytrénovala a testovala Z.ai, ne pro self-hosting u běžného uživatele.

Co to znamená pro tebe

Pro běžného uživatele je hlavní zpráva jednoduchá: levné, otevřené modely se dál přibližují výkonu drahých vlajkových systémů. Pokud vyvíjíš vlastní aplikaci nebo chatbota a řešíš rozpočet, GLM-5.3-Flash je reálná alternativa k dražším API od OpenAI nebo Anthropicu — za zlomek ceny dostaneš výkon srovnatelný s GPT-5.6 Terra. Zároveň to potvrzuje, že čínské firmy dokážou trénovat i provozovat konkurenceschopné modely bez závislosti na Nvidia čipech, což může časem ovlivnit i to, jak stabilní a dostupné budou ceny AI služeb celosvětově.

Pro pokročilé

Technicky stojí za povšimnutí hybridní architektura kombinující sparse a lineární pozornost (attention) — mechanismus, díky kterému model zvládá dlouhý kontext bez extrémního nárůstu výpočetních nákladů. Z.ai uvádí, že oproti výchozímu nastavení na stejném čínském hardwaru dosáhli trojnásobného zlepšení end-to-end výkonu obsluhy, čímž se efektivita nákladů na token vyrovnala běžným nasazením na Nvidia GPU. Čas do prvního tokenu (TTFT) činí 1,52 sekundy, což ovlivňuje především pocit „odezvy" u interaktivních aplikací typu chatbotů.

Zdroj informací: The Decoder (https://the-decoder.com/the-chinese-ai-model-glm-5-3-flash-runs-without-nvidia-and-costs-a-fraction-of-what-the-competition-does/), doplněno o data z Baseten, MarkTechPost, Hugging Face, SCMP a Artificial Analysis

Související nástroje

Přečtěte si dál