2026-08-27 · 5 min čtení
Google 26. srpna 2026 oznámil nový model pro převod řeči na text s názvem Gemini 3.5 Transcribe, zatím ve veřejné preview fázi. Model nahrazuje starší Chirp 3, zvládá přes 85 jazyků a míří i do Chromu.
Google 26. srpna 2026 oznámil Gemini 3.5 Transcribe — model, který podle firmy patří k jejím nejpřesnějším nástrojům pro převod mluvené řeči na text. Cílí hlavně na „inteligentní hlasové interakce", tedy situace, kdy člověk mluví na telefon nebo počítač a očekává, že se jeho slova promění v čistý, srozumitelný text bez zádrhelů, odkašlání a chaotického vyjadřování.
Gemini 3.5 Transcribe nahrazuje dosavadní transkripční model Chirp 3. Podle měření společnosti Artificial Analysis dosahuje průměrné chybovosti slov (WER — word error rate, tedy procento špatně přepsaných slov) 4,0 % při streamování (přepis probíhá za pochodu, zatímco člověk stále mluví) a 2,6 % u nestreamovaných nahrávek, kde má model k dispozici celý zvuk najednou. Na standardizovaném testu FLEURS, který srovnává výkon napříč desítkami jazyků, model dosáhl 5,50 % WER ve streamovacím režimu a 5,04 % v nestreamovaném — to je zlepšení oproti Chirp 3. Doba do finálního přepisu se podle stejného měření zkrátila o 70 %.
Model automaticky rozpozná a přepíše více než 85 jazyků včetně regionálních akcentů a dialektů. U předem nahraných záznamů umí přiřadit řeč až třem různým mluvčím se slovními časovými značkami (podpora více mluvčích je zatím experimentální). Zvládá i technický žargon, dokáže se přizpůsobit uživatelem zadané vlastní slovní zásobě a spolehlivě zachytí alfanumerické řetězce jako čísla objednávek nebo poštovní směrovací čísla — tedy přesně ty případy, kde starší modely řeči na text často selhávaly.
Novinkou je i takzvané volání funkcí (function calling), díky kterému může model za běhu delegovat úkoly na jiné modely Gemini — třeba vygenerovat obrázek nebo analyzovat soubor na základě toho, co uživatel řekl nahlas.
Gemini 3.5 Transcribe už pohání funkci Rambler v Gboardu na Androidu, kterou najdou třeba majitelé telefonů řady Pixel 11, a je součástí aplikace Gemini na macOS. Tam funguje i s kontextem obrazovky — model dokáže kombinovat to, co říkáte nahlas, s tím, co zrovna vidíte na displeji.
Pokud chcete vyzkoušet praktický příklad, otevřete aplikaci Gemini na Macu, klikněte na mikrofon a řekněte nahlas:
Shrň mi obsah dokumentu, který mám teď otevřený na obrazovce, a napiš tři body k akci.
Model rozpozná řeč, propojí ji s obsahem na obrazovce a vrátí strukturovanou odpověď. Podobně funguje i v Google Antigravity, kde se ke kontextu obrazovky přidává i historie chatu (pokud to uživatel povolí), takže přepis zůstává přesný i uprostřed rozpracovaného kódu nebo poznámek agenta.
Vývojáři, kteří chtějí model testovat přímo, ho najdou přes Gemini API v Google AI Studiu nebo přes Gemini Enterprise Agent Platform. V AI Studiu lze v režimu Build model použít i k takzvanému „vibe codingu" — tedy k vytváření aplikací pomocí hlasových pokynů místo psaní kódu.
Do Chromu model teprve zamíří, půjde ale o funkci „talk to type" — možnost diktovat text do libovolného webového pole, ať už jde o rozepsaný e-mail, komentář, nebo hlasový prompt pro Gemini přímo v prohlížeči.
I s vylepšenou přesností zůstává chybovost v jednotkách procent — to v praxi znamená, že u delších nahrávek nebo hlučnějšího prostředí se chyby budou objevovat pravidelně, nejde o stoprocentně spolehlivý přepis. Podpora více než tří mluvčích je označená jako experimentální, takže pro přepis skupinové diskuze s pěti a více lidmi zatím nejde o ideální nástroj. Model je navíc stále ve veřejné preview fázi, což znamená, že se chování i dostupnost mohou v čase měnit a Google zatím nezveřejnil datum, kdy bude obecně dostupný (GA). Pro firmy, které potřebují garantovanou stabilitu API, může být rozumnější počkat na ostrou verzi.
Pro běžného uživatele je nejhmatatelnější změnou to, že diktování textu — do telefonu, do počítače i brzy do prohlížeče — by mělo být rychlejší a přesnější, hlavně u odborných termínů nebo čísel, se kterými si starší nástroje často nevěděly rady. Pokud používáte Gboard na Pixelu, Gemini na macOS nebo pracujete v Google Antigravity, nový model se k vám dostane postupně automaticky. Google plánuje nasazení i do Search Live, Gemini Live, Dokumentů Google, Keepu, Gmailu a dalších částí ekosystému, takže dopad pocítí širší okruh uživatelů než jen vývojáři a nadšenci do AI.
Model je dostupný přes Gemini API v Google AI Studiu a přes Gemini Enterprise Agent Platform ve veřejné preview fázi. Pro firmy se počítá i s nasazením do Gemini Enterprise for Customer Experience. Oficiální ceník za volání API pro tento konkrétní model Google zatím nezveřejnil — k dispozici jsou jen neoficiální a nezávazné odhady třetích stran, které se pohybují v řádu desetin centu za minutu zvuku. Stejně tak není potvrzen přesný bezplatný limit v AI Studiu ani maximální kontextový limit pro zpracování audia — jeden neoficiální zdroj zmiňuje 96 000 tokenů, jde ale o neprimární informaci, kterou nelze brát jako závaznou.
Zdroj informací: Ars Technica AI (https://arstechnica.com/ai/2026/08/google-announces-gemini-3-5-transcribe-for-ai-powered-speech-to-text/), blog.google, 9to5google.com, androidauthority.com, engadget.com