← Zpět na novinky

Qwen3.8-Omni-Flash: multimodální model za 0,15 USD za milion tokenů

2026-09-20 · 4 min čtení

Alibaba vydala 18. září 2026 model Qwen3.8-Omni-Flash, který zpracovává text, obrázky, zvuk i video najednou. Vstup stojí 0,15 USD za milion tokenů, tedy pětinu toho, co si za Flash řadu účtuje Google. Hodina videa v 720p vyjde zhruba na 0,20 USD.

Alibaba vydala 18. září 2026 model Qwen3.8-Omni-Flash, který přijímá text, obrázky, zvuk i video v jednom vstupu a stojí 0,15 USD za milion vstupních tokenů a 0,47 USD za milion výstupních tokenů. Pro srovnání: aktuální Flash řada od Googlu (na našem webu vedená jako Gemini 3.7 Flash) má sazbu 0,75 USD za milion vstupních a 3,75 USD za milion výstupních tokenů. Zdroje k Qwenu srovnávají nový model s variantou, kterou označují jako „Gemini 3.8 Flash“ — tento název se nám nepodařilo nezávisle ověřit, ceny v obou případech odpovídají zmíněné sazbě 0,75/3,75 USD, u Googlu jde o zaváděcí tarif s plánovaným zdvojnásobením k 1. lednu 2027.

Co je nového

Qwen3.8-Omni-Flash je podle Alibaby první omnimodální model firmy stavěný přímo pro AI agenty. Omnimodální znamená, že model nepotřebuje zvlášť přepisovač řeči a zvlášť analyzátor obrazu — zvuk a video zpracovává dohromady a sám sahá po nástrojích, například když má sestříhat vlog, přeložit krátké video nebo shrnout film.

Kontextové okno má 1 milion tokenů. Zajímavější než tohle číslo je ale cena za reálný materiál: Qwen odhaduje zvukový vstup pod 0,01 USD za hodinu a hodinu videa v 720p se zvukem při jednom snímku za sekundu na zhruba 0,20 USD (bez nákladů na vygenerovanou odpověď).

Z benchmarků: na OmniVideoBench si model polepšil z 63,4 na 67,8 bodu a současně snížil spotřebu tokenů o 45,7 % (ze 145 736 na 79 117). Na sadě AliMeeting, která testuje rozpoznávání řeči více mluvčích, Qwen uvádí 3,4 % DER a 17,2 % cpWER proti 72,6 % / 53,1 % u konkurenčního Flash modelu. Všechna tato čísla pocházejí z vlastního měření Alibaby a nezávisle reprodukovaná nejsou.

Jak to vyzkoušet

Nejrychlejší cesta je chatové rozhraní Qwen nebo jeho mobilní aplikace — model ale nenaskočí sám, musíš ho ručně vybrat v přepínači modelů. Bezplatný spotřebitelský tarif pro tento model není podle dostupných poznámek k vydání popsán.

Přes API běží model v Alibaba Cloud Model Studiu s endpointy v Pekingu a Singapuru. Identifikátor je `qwen3.8-omni-flash`, realtime varianta `qwen3.8-omni-flash-realtime`. Rozhraní je kompatibilní s OpenAI (Chat Completions i Responses API), takže existující kód většinou stačí přesměrovat a změnit název modelu.

Ukázkový prompt, který dává smysl zadat k nahranému videu:

Tohle je záznam hodinové porady. Udělej tři věci:
1) Vypiš mluvčí a u každého shrň jeho hlavní stanovisko do dvou vět.
2) Vytvoř seznam úkolů ve formátu: úkol – kdo – termín (pokud zazněl).
3) Označ časové kódy (mm:ss) míst, kde padlo rozhodnutí.
Odpověz česky. Pokud si u přiřazení mluvčího nejsi jistý, napiš to.

Kdy se to nehodí

Vlastní srovnávací tabulka Qwenu přiznává, že konkurenční Flash model zůstává lepší v několika úlohách video-uvažování, například na Video-MME-v2. Qwen naopak vede v audio benchmarcích a v multimodálním používání nástrojů (71,0 vs 58,9 na WildClawBench-MM). Pokud tedy potřebuješ hlavně porozumění ději ve videu, srovnávej sám na vlastních datech.

Druhá překážka je praktická: většina agentních prostředí zatím neumí přivádět zvuk přímo do modelu, takže audio se musí posílat přes API. Nefunguje to tedy „jen tak“ v běžném vývojářském nástroji.

A co zatím nevíme: maximální délka videa nebo zvuku v jednom požadavku, podporovaná rozlišení a rate limity nebyly zveřejněny. Stejně tak není jasné, zda uvedené ceny platí i pro realtime variantu a zda jsou váhy modelu volně ke stažení, nebo běží jen přes API.

Co to znamená pro tebe

Pro běžného uživatele je podstatná cena za hodinu záznamu. Modelový (hypotetický, nikým nepotvrzený) výpočet: kdyby někdo poslal na vstup 100 hodin zvuku, při odhadu pod 0,01 USD za hodinu jde o necelý dolar za vstup — plus náklady na vygenerované odpovědi, které závisí na tom, jak dlouhé shrnutí chceš. U videa se stejné množství pohybuje kolem 20 USD. To otevírá úlohy, které se dřív nevyplatily: procházení archivu přednášek, hledání konkrétní pasáže v záznamech, hromadné titulkování.

Sama Alibaba uvádí, že hodinová cena zvukového vstupu klesla oproti staršímu Qwen3.5-Omni-Plus o více než 98 % a audiovizuálního vstupu o více než 93 % — jde ale o srovnání s vlastním předchůdcem, ne s konkurencí.

Pro pokročilé

Alibaba deklaruje průměrné zlepšení přes 25 % napříč 29 benchmarky oproti Qwen3.5-Omni-Plus; nezávislé evaluace v době vydání chyběly. Spolu s modelem vyšla otevřená sada Qwen-MM-Plugins, která přidává omnimodální schopnosti do existujících agentních prostředí jako Codex, Claude Code, Qwen Code nebo Gemini CLI. Název modelu se v různých zdrojích objevuje i jako „Qwen3-Omni Flash“ — která podoba je oficiální, není potvrzeno.

Zdroje: The Decoder, Neowin, DataCamp, explainX, Progressive Robot.

Zdroj informací: The Decoder (https://the-decoder.com/qwen3-8-omni-flash-undercuts-gemini-flash-pricing-while-matching-its-multimodal-benchmarks/), dále Neowin, DataCamp, explainX a Progressive Robot.

Související nástroje

Téma: Open-source modely · Ceny a bezplatné tarify

Přečtěte si dál