Difuzní model tvoří obrázek tak, že začne u čistého šumu a v desítkách kroků z něj postupně „odstraňuje“ všechno, co neodpovídá zadání. Takhle fungují Midjourney, FLUX i většina generátorů obrázků.
Vysvětluje to dvě věci, které uživatele překvapí: proč stejné zadání pokaždé dá jiný obrázek (start je náhodný šum) a proč se dá výsledek ovlivnit číslem kroků a nastavením, jak přísně se má model držet zadání.
Text v obrázcích byl dlouho slabina právě proto, že písmena vznikají stejným postupem jako mraky. Novější modely to zvládají, ale delší nápisy je pořád lepší dopsat v grafickém editoru.
Příklad
Stejný prompt spuštěný pětkrát dá pět různých obrázků. Když chcete tentýž, musíte si uložit seed neboli počáteční nastavení šumu.
Kde na to narazíte
Midjourney — Nejkvalitnější AI generátor obrázků — V8.1
Ideogram — Ideogram 3.0 — fotorealismus + čitelný text v obrázcích
Leonardo AI — Generování obrázků s kontrolou a vlastními modely
Souvisí s tím
Jazykový model (LLM) — Jazykový model je program natrénovaný na obrovském množství textu, který k libovolnému zadání dopočítává nejpravděpodobnější pokračování.
Vodoznak v obsahu od AI — Vodoznak je značka, podle které jde poznat, že obsah vytvořila AI — buď viditelný nápis, nebo neviditelná stopa v obrázku či metadatech..