Inference je samotné použití hotového modelu — okamžik, kdy z vašeho zadání vzniká odpověď. Za inferenci se platí, na rozdíl od trénování ale po malých částkách za každý dotaz.
Cena a rychlost inference určují, co má vůbec smysl automatizovat. Úloha, která u jednoho dokumentu stojí halíře, může u milionu dokumentů rozhodnout celý rozpočet.
Odsud plyne i typické doporučení: levný model na hromadné třídění, drahý na výsledný text nebo úsudek.
Příklad
Roztřídit 10 000 e-mailů levným modelem stojí jednotky dolarů; napsat na ně odpovědi tím nejlepším už stovky.
Kde na to narazíte
ChatGPT — Nejrozšířenější AI — Custom GPTs, hlas, kód, obrázky
Mistral AI — Evropský open-weight model — GDPR, self-hosting, reasoning, OCR
Souvisí s tím
Token — Token je kousek textu, na které si model text dělí — zhruba čtyři znaky, tedy asi tři čtvrtiny běžného anglického slova.
API — API je způsob, jak model volat z vlastního programu místo z chatu.
Open-weight model — Open-weight model má veřejně dostupné váhy — soubor, který si můžete stáhnout a spustit na svém počítači nebo serveru.