← Slovníček pojmů

Multimodální model

anglicky: multimodal model

Multimodální model umí pracovat s víc druhy vstupu než jen s textem — s obrázky, zvukem, videem nebo tabulkami. Vyfotíte účtenku a zeptáte se na ni jako na text.

V praxi to mění nejvíc u papírů: fotka smlouvy, sken faktury, screenshot chybové hlášky. Přepisovat je do textu už není potřeba.

Přesnost ale kolísá podle kvality podkladu. U ručně psaných čísel a u tabulek s hodně sloupci se výsledek vyplatí kontrolovat vždy.

Příklad

Fotka jídelního lístku a dotaz „co z toho je bez lepku a do 200 Kč“ — model přečte text z obrázku a odpoví nad ním.

Kde na to narazíte

Souvisí s tím