Google uvedl nový AI systém Gemini 3.5 Transcribe, který významně vylepšuje rozpoznávání řeči. Odstraňuje také nechtěné zvuky nebo slova.
Systémy umělé inteligence se stále zlepšují, a to v mnoha oblastech. Nový model Gemini 3.5 Transcribe se soustředí především na převod lidské řeči na text, což může najít využití v mnoha různých nasazeních. Ať už je to přepis textu do e-mailu nebo ovládání aplikace, přesnější zadání, kde se AI postará i o odstraněný lidských chyb, může přijít vhod.
Gemini 3.5 Transcribe tak při převodu umí odstranit různá výplňová slova, jako je třeba “ehm”, “v podstatě” a podobně. Také si lépe poradí se zvukovým šumem v pozadí, komplexnějším žargonem a neplynulou sekanou řečí. Fungovat má jak pro real-time rozpoznávání (gemini-3.5-transcribe-live), tak i pro již nahrané ukázky (gemini-3.5-transcribe). V prvním případě má chybovost WER (Word Error Rate) 4,0 %, v druhém pak dokonce jen 2,6 %. Podle testů dobře zvládá např. i situace, jako je diktování čísel a písmen s hlučným zvukovým pozadím.

Zajímavostí je ale i to, že dokáže zpracovat opravy hovořícího. Pokud se člověk např. splete a opraví, model napíše jen opravenou větu. Google to uvedl na příkladu “sejdeme se v úterý, tedy ne, ve středu”. Gemini vynechá první část a napíše už jen “sejdeme se ve středu”. Už dnes funguje v 85 různých jazycích, a to i s podporou regionálních přízvuků. Pro nahrané ukázky zvládá rozpoznávání až 3 osob a experimentálně i více než 3.
Nový model už pohání Gboard pro Android přes novou funkci Rambler. Google Antigravity ho používá k párování obsahu na obrazovce s historií chatu, Google AI Studio umožní ovládat programování hlasem. Gemini 3.5 Transcribe je už také součástí aplikace Gemini na macOS, kde dělá nejen přepisy, ale i rozpoznává příkazy. Brzy se dostane i do prohlížeče Chrome.






















