Multimodální model umí pracovat s víc druhy vstupu než jen s textem — s obrázky, zvukem, videem nebo tabulkami. Vyfotíte účtenku a zeptáte se na ni jako na text.
V praxi to mění nejvíc u papírů: fotka smlouvy, sken faktury, screenshot chybové hlášky. Přepisovat je do textu už není potřeba.
Přesnost ale kolísá podle kvality podkladu. U ručně psaných čísel a u tabulek s hodně sloupci se výsledek vyplatí kontrolovat vždy.
Příklad
Fotka jídelního lístku a dotaz „co z toho je bez lepku a do 200 Kč“ — model přečte text z obrázku a odpoví nad ním.
Kde na to narazíte
Gemini 3 — 1M tokenů, Google Workspace, multimodální reasoning
ChatGPT — Nejrozšířenější AI — Custom GPTs, hlas, kód, obrázky
Claude — Nejlepší pro kódování, dlouhé texty a bezpečné agenty
Souvisí s tím
Jazykový model (LLM) — Jazykový model je program natrénovaný na obrovském množství textu, který k libovolnému zadání dopočítává nejpravděpodobnější pokračování.
Halucinace — Halucinace je odpověď, která zní naprosto samozřejmě, ale není pravdivá — vymyšlená citace, neexistující paragraf, smyšlené číslo.