← Zpět na novinky

Alibaba představila Qwen3.8-Flash-Next – model, který šetří výpočetní výkon jako nikdo předtím

2026-08-27 · 5 min čtení

Nový open-weight model od týmu Qwen aktivuje na jeden token jen 6 miliard z celkových 125 miliard parametrů, a přesto v kódovacích testech porazil dražší konkurenci. Alibaba jej představuje jako předzvěst architektury chystaného Qwen4.

Alibaba představila Qwen3.8-Flash-Next – model, který šetří výpočetní výkon jako nikdo předtím

Alibaba 26. srpna 2026 zveřejnila Qwen3.8-Flash-Next, open-weight model, který na zpracování každého tokenu použije jen 6 miliard ze svých 125 miliard parametrů. Přesto podle zveřejněných testů překonává v kódovacích a kancelářských úlohách i podstatně větší nebo dražší konkurenty, včetně DeepSeek-V4-Flash a Claude Opus 5. Jde o experimentální model, který má ukázat, jak bude fungovat architektura připravovaného Qwen4.

Co je nového

Klíčové číslo je poměr 6 ku 125 miliardám – tolik parametrů se z celkového modelu aktivuje na jeden token. Tomuto principu se říká mixture-of-experts (MoE, směs expertů): model si pro každý úkol „vybere" jen tu část svých znalostí, kterou zrovna potřebuje, místo aby pokaždé zapojil celou svou kapacitu. Díky tomu je provoz i trénink výrazně levnější.

Novinkou je také takzvaná N-gram embedding vrstva s 51 miliardami parametrů. Ta funguje jako slovník běžných slovních spojení – ukládá si je jako hotové položky, takže je model nemusí pokaždé znovu skládat z jednotlivých slov. Tahle vrstva navíc může běžet v běžné systémové paměti počítače, ne nutně na drahé grafické kartě, což dále snižuje nároky na hardware.

Model má nativní kontextové okno 262 144 tokenů (zhruba 200 000 slov), které lze technikou YaRN roztáhnout až na jeden milion tokenů. Podle Alibaby dosáhl Flash-Next lepších výsledků než předchozí Qwen3.7-Plus, a to při zhruba devítinových nákladech na trénink. V agentním testování kódování získal 58,7 bodu na benchmarku DeepSWE a 62,5 bodu na SWE-bench Pro – v obou případech více než DeepSeek-V4-Flash i Claude Opus 5. Na testu obecných znalostí GPQA Diamond dosáhl 91,7 %, na testu programování LiveCodeBench v6 pak 91,9 %.

Produkční verze pod názvem Qwen3.8-Flash bude dostupná přes QwenCloud za 0,16 USD za milion vstupních tokenů a 0,47 USD za milion výstupních tokenů. API má být spuštěno v nejbližší době. Váhy experimentální verze jsou už teď volně ke stažení na Hugging Face a ModelScope pod licencí qwen-community-1.0.

Jak to vyzkoušet

Model si můžete vyzkoušet dvěma způsoby. Pokud chcete jen otestovat schopnosti bez instalace, počkejte na spuštění API přes QwenCloud a zavolejte model stejně jako jiné jazykové modely – stačí zadat API klíč a v požadavku uvést jméno modelu.

Pokud chcete pracovat s otevřenými váhami přímo, stáhněte si model z Hugging Face (repozitář najdete pod názvem Qwen3.8-Flash-Next) a spusťte ho lokálně pomocí knihovny transformers nebo nástroje jako vLLM. Vzhledem k celkové velikosti přes 180 miliard parametrů v BF16 formátu ale budete potřebovat výkonný server s dostatkem GPU paměti – na běžném notebooku model nerozjedete.

Ukázkový prompt pro test kódovacích schopností, který odpovídá typu úloh z benchmarků SWE-bench:

Mám v repozitáři chybu: funkce parse_config() v souboru config.py 
vrací None místo slovníku, když je vstupní JSON prázdný. 
Najdi příčinu, oprav kód a napiš unit test, který chybu ověří.

Kdy se to nehodí

Qwen3.8-Flash-Next je experimentální náhled na budoucí architekturu, ne finální produkt – Alibaba sama píše, že jde o přípravu na Qwen4. To znamená riziko nestability, chybějící dokumentace k některým funkcím a možné změny chování v produkční verzi Qwen3.8-Flash.

Pro běžného uživatele bez technického zázemí je model prakticky nepoužitelný přímo – potřebujete buď počkat na hotové API, nebo mít přístup k serverové infrastruktuře s dostatkem paměti pro model s 180 miliardami parametrů v BF16. Pokud hledáte model pro okamžité použití v chatovacím rozhraní, je jednodušší sáhnout po hotových produktech typu Gemini 3.5 Flash nebo GPT-5.6 Luna.

Nejasná zůstává také otázka bezplatných limitů pro testování – oficiální informace o zkušební kvótě pro tento konkrétní model zatím nejsou k dispozici, takže s náklady je třeba počítat od začátku.

Co to znamená pro tebe

Pro běžného uživatele chatovacích aplikací se nic nemění okamžitě – Flash-Next je model určený spíš pro vývojáře a firmy, které si stavějí vlastní AI nástroje. Dopad ale pocítíte nepřímo: pokud aplikace nebo služba, kterou používáte, přejde na tento typ efektivních modelů, může vám nabídnout stejnou nebo lepší kvalitu odpovědí za nižší cenu, případně rychleji.

Pro firmy a vývojáře je zpráva jasná – cena 0,16 USD za milion vstupních tokenů řadí Qwen3.8-Flash mezi nejlevnější modely na trhu s vysokým výkonem, srovnatelnou cenu má jen DeepSeek-V4-Flash za 0,14 USD za milion vstupních tokenů. Kdo staví agentní nástroje pro programování nebo automatizaci kancelářské práce, získává levnou alternativu k dražším modelům jako Claude Opus 5.

Pro pokročilé

Architektura Flash-Next kombinuje čtyři inovace: hybridní pozornost spojující Gated DeltaNet a Qwen Sparse Attention (QSA), mechanismus Gated Residual, zmíněnou N-gram Embedding vrstvu a optimalizátor Muon použitý při tréninku. Podle NVIDIA jde o 176miliardový multimodální MoE model optimalizovaný právě pro řešení úzkých míst při zpracování dlouhého kontextu, testovaný na jejich hardwaru GB300 NVL72 pro agentní kódovací úlohy. Technická zpráva s detaily je veřejně dostupná na GitHubu týmu QwenLM.

Zdroj informací: The Decoder (https://the-decoder.com/alibaba-releases-qwen3-8-flash-next-targeting-ultimate-cost-efficiency/)

Související nástroje

Přečtěte si dál