2026-09-20 · 4 min čtení
Alibaba uvolnila váhy modelu Qwen-Image-2.1, který generuje i edituje obrázky a zvládne až 10 referenčních snímků najednou. Generativní část má 7 miliard parametrů a rozjede se na silnější spotřebitelské grafice. Háček je v licenci — komerční použití vyžaduje samostatnou dohodu.
Tým Qwen pod Alibabou zveřejnil 20. září 2026 model Qwen-Image-2.1 včetně volně stažitelných vah na platformách Hugging Face a ModelScope. Jde o sjednocený model, který z textu vytvoří obrázek a zároveň umí existující obrázky upravovat. Jeho vizuálně-generativní část má 7 miliard parametrů a podle serveru The Decoder se rozběhne na výkonnějších spotřebitelských grafikách, například na RTX 3090.
Hlavní novinkou je práce s průhledností. Model nativně generuje i edituje obrázky ve formátu RGBA, tedy s alfa kanálem — a sám z promptu pozná, jestli má vytvořit běžný obrázek, nebo takový s průhledným pozadím. Zvládne také vyjmout objekt z fotografie. Tuhle schopnost Qwen dodával už v prosinci 2025, ale samostatným modelem Qwen-Image-Layered; teď je zabudovaná do jednoho modelu.
Editace přijme až 10 referenčních obrázků najednou. Lokální úpravy zadáte kroužkem, malovanou anotací přímo do obrázku nebo samostatnou maskou, přičemž model má zachovat identitu osob a produktů. Qwen na svém blogu zmiňuje jako silné stránky panoramata, infografiky a virtuální zkoušení oblečení.
Technicky model kombinuje pozornost se smíšenou granularitou (mixed-granularity attention) a opětovné využití prefix KV cache: vstupní obrázky a instrukce se spočítají jednou v prvním kroku a dál se drží jako statický kontext, což zrychluje běh a šetří paměť.
Zásadní změna je v licenci. Zatímco původní Qwen-Image vyšel pod Apache 2.0, verze 2.1 má Qwen Research License Agreement (na Hugging Face označenou jako „qwen-research“). Podle The Decoder tahle licence zakazuje komerční využití — na to je nutná samostatná licence od Qwenu. Její podmínky ani cena zatím nejsou veřejně známé.
Nejjednodušší cesta vede přes ComfyUI. Comfy-Org zveřejnil přebalené váhy — soubory `qwen_image_2.1_bf16.safetensors`, úspornější int8 variantu, VAE a textový enkodér `qwen3vl_8b` — pod toutéž licencí qwen-research.
Pokud pracujete v Pythonu, knihovna Diffusers model podporuje od prvního dne prostřednictvím třídy `QwenImage21Pipeline`. Oficiální repozitář `Qwen/Qwen-Image-2.1` na Hugging Face má 33,1 GB a obsahuje složky transformer, text_encoder, vae, scheduler a processor — počítejte s tím při stahování.
Průhlednost se aktivuje prostě tím, že si o ni v promptu řeknete. Ukázkové zadání:
Logo kávovaru ve tvaru stylizovaného šálku, plochý vektorový styl,
tmavě hnědá a krémová barva, průhledné pozadí (RGBA),
bez textu, ostré hrany, čtvercový formát
Pro editaci s referencemi vypadá zadání takto:
Použij přiložené 3 fotografie produktu jako referenci.
Zachovej přesný tvar a barvu lahve i etiketu.
Umísti produkt na dřevěný stůl u okna, měkké denní světlo zleva,
rozostřené pozadí. Označenou oblast (kroužek) uprav tak,
aby zmizel odlesk na skle.
Kromě NVIDIA karet vydání zahrnuje i běh na grafikách AMD Radeon přes ROCm a podporu dalších čipů přes stack FlagOS.
Největší omezení je licenční. Výzkumná licence komerční použití zakazuje, takže obrázky do e-shopu, klientské grafiky nebo reklamy z tohoto modelu bez samostatné dohody s Qwenem tvořit nemůžete. Pro komerční nasazení je potřeba sáhnout po nástroji s jasně vyřešenou komerční licencí.
Druhá výhrada se týká výkonu. Tvrzení, že model překonává většinu uzavřených konkurentů, pochází z vlastního benchmarku Qwenu — nezávislá měření zatím chybí. Přesné skóre ani seznam srovnávaných modelů nejsou k dispozici.
Qwen také nezveřejnil oficiální minimální požadavky na VRAM ani dobu generování. Agregátory uvádějí zhruba 18,7 sekundy pro obrázek 1024 × 1024 na RTX 4090 a špičku 22,7 GiB paměti při offloadu na CPU, ale primární potvrzení chybí. Z velikosti modelu a zmínky o RTX 3090 lze odhadovat, že na slabší grafice bude lokální běh problematický — je to ale odhad, ne doložený údaj.
Váhy jsou volně ke stažení, takže model můžete provozovat u sebe doma bez posílání dat na cizí server — ale jen pro nekomerční účely. Praktický přínos je hlavně v průhlednosti: obrázek s alfa kanálem jde rovnou vložit do prezentace, na web nebo do videa bez dodatečného odmazávání pozadí. Deset referenčních obrázků najednou zase pomůže tam, kde potřebujete udržet konzistentní vzhled jedné postavy nebo produktu napříč sérií.
Generativní část staví na architektuře Single-Stream DiT s 32 vrstvami a 7 miliardami parametrů. Textový enkodér vychází z Qwen3-VL 8B. Oficiální cena API přes Alibaba Cloud Model Studio ani případné bezplatné limity zatím zveřejněné nebyly. Nejasný zůstává i vztah k uzavřenému Qwen-Image 3.0, který nese vyšší číslo verze.
Zdroj informací: The Decoder (https://the-decoder.com/alibabas-open-weight-qwen-image-2-1-claims-to-beat-closed-models-in-image-generation-with-just-7-billion-parameters/), doplněno z oficiálních materiálů Qwen (huggingface.co/Qwen/Qwen-Image-2.1, github.com/QwenLM/Qwen-Image-2.1, qwen.ai/blog)
Téma: Obrázky a video · Open-source modely