2026-09-20 · 4 min čtení
Alibaba vydala 18. září 2026 model Qwen3.8-Omni-Flash, který zpracovává text, obrázky, zvuk i video najednou. Vstup stojí 0,15 USD za milion tokenů, tedy pětinu toho, co si za Flash řadu účtuje Google. Hodina videa v 720p vyjde zhruba na 0,20 USD.
Alibaba vydala 18. září 2026 model Qwen3.8-Omni-Flash, který přijímá text, obrázky, zvuk i video v jednom vstupu a stojí 0,15 USD za milion vstupních tokenů a 0,47 USD za milion výstupních tokenů. Pro srovnání: aktuální Flash řada od Googlu (na našem webu vedená jako Gemini 3.7 Flash) má sazbu 0,75 USD za milion vstupních a 3,75 USD za milion výstupních tokenů. Zdroje k Qwenu srovnávají nový model s variantou, kterou označují jako „Gemini 3.8 Flash“ — tento název se nám nepodařilo nezávisle ověřit, ceny v obou případech odpovídají zmíněné sazbě 0,75/3,75 USD, u Googlu jde o zaváděcí tarif s plánovaným zdvojnásobením k 1. lednu 2027.
Qwen3.8-Omni-Flash je podle Alibaby první omnimodální model firmy stavěný přímo pro AI agenty. Omnimodální znamená, že model nepotřebuje zvlášť přepisovač řeči a zvlášť analyzátor obrazu — zvuk a video zpracovává dohromady a sám sahá po nástrojích, například když má sestříhat vlog, přeložit krátké video nebo shrnout film.
Kontextové okno má 1 milion tokenů. Zajímavější než tohle číslo je ale cena za reálný materiál: Qwen odhaduje zvukový vstup pod 0,01 USD za hodinu a hodinu videa v 720p se zvukem při jednom snímku za sekundu na zhruba 0,20 USD (bez nákladů na vygenerovanou odpověď).
Z benchmarků: na OmniVideoBench si model polepšil z 63,4 na 67,8 bodu a současně snížil spotřebu tokenů o 45,7 % (ze 145 736 na 79 117). Na sadě AliMeeting, která testuje rozpoznávání řeči více mluvčích, Qwen uvádí 3,4 % DER a 17,2 % cpWER proti 72,6 % / 53,1 % u konkurenčního Flash modelu. Všechna tato čísla pocházejí z vlastního měření Alibaby a nezávisle reprodukovaná nejsou.
Nejrychlejší cesta je chatové rozhraní Qwen nebo jeho mobilní aplikace — model ale nenaskočí sám, musíš ho ručně vybrat v přepínači modelů. Bezplatný spotřebitelský tarif pro tento model není podle dostupných poznámek k vydání popsán.
Přes API běží model v Alibaba Cloud Model Studiu s endpointy v Pekingu a Singapuru. Identifikátor je `qwen3.8-omni-flash`, realtime varianta `qwen3.8-omni-flash-realtime`. Rozhraní je kompatibilní s OpenAI (Chat Completions i Responses API), takže existující kód většinou stačí přesměrovat a změnit název modelu.
Ukázkový prompt, který dává smysl zadat k nahranému videu:
Tohle je záznam hodinové porady. Udělej tři věci:
1) Vypiš mluvčí a u každého shrň jeho hlavní stanovisko do dvou vět.
2) Vytvoř seznam úkolů ve formátu: úkol – kdo – termín (pokud zazněl).
3) Označ časové kódy (mm:ss) míst, kde padlo rozhodnutí.
Odpověz česky. Pokud si u přiřazení mluvčího nejsi jistý, napiš to.
Vlastní srovnávací tabulka Qwenu přiznává, že konkurenční Flash model zůstává lepší v několika úlohách video-uvažování, například na Video-MME-v2. Qwen naopak vede v audio benchmarcích a v multimodálním používání nástrojů (71,0 vs 58,9 na WildClawBench-MM). Pokud tedy potřebuješ hlavně porozumění ději ve videu, srovnávej sám na vlastních datech.
Druhá překážka je praktická: většina agentních prostředí zatím neumí přivádět zvuk přímo do modelu, takže audio se musí posílat přes API. Nefunguje to tedy „jen tak“ v běžném vývojářském nástroji.
A co zatím nevíme: maximální délka videa nebo zvuku v jednom požadavku, podporovaná rozlišení a rate limity nebyly zveřejněny. Stejně tak není jasné, zda uvedené ceny platí i pro realtime variantu a zda jsou váhy modelu volně ke stažení, nebo běží jen přes API.
Pro běžného uživatele je podstatná cena za hodinu záznamu. Modelový (hypotetický, nikým nepotvrzený) výpočet: kdyby někdo poslal na vstup 100 hodin zvuku, při odhadu pod 0,01 USD za hodinu jde o necelý dolar za vstup — plus náklady na vygenerované odpovědi, které závisí na tom, jak dlouhé shrnutí chceš. U videa se stejné množství pohybuje kolem 20 USD. To otevírá úlohy, které se dřív nevyplatily: procházení archivu přednášek, hledání konkrétní pasáže v záznamech, hromadné titulkování.
Sama Alibaba uvádí, že hodinová cena zvukového vstupu klesla oproti staršímu Qwen3.5-Omni-Plus o více než 98 % a audiovizuálního vstupu o více než 93 % — jde ale o srovnání s vlastním předchůdcem, ne s konkurencí.
Alibaba deklaruje průměrné zlepšení přes 25 % napříč 29 benchmarky oproti Qwen3.5-Omni-Plus; nezávislé evaluace v době vydání chyběly. Spolu s modelem vyšla otevřená sada Qwen-MM-Plugins, která přidává omnimodální schopnosti do existujících agentních prostředí jako Codex, Claude Code, Qwen Code nebo Gemini CLI. Název modelu se v různých zdrojích objevuje i jako „Qwen3-Omni Flash“ — která podoba je oficiální, není potvrzeno.
Zdroje: The Decoder, Neowin, DataCamp, explainX, Progressive Robot.
Zdroj informací: The Decoder (https://the-decoder.com/qwen3-8-omni-flash-undercuts-gemini-flash-pricing-while-matching-its-multimodal-benchmarks/), dále Neowin, DataCamp, explainX a Progressive Robot.
Téma: Open-source modely · Ceny a bezplatné tarify