Přepis řeči jednoduše: co to je, jak funguje a proč na tom záleží
Co je přepis řeči jednoduše řečeno, jak funguje technologie rozpoznávání řeči a kde se převod řeči na text hodí.
Chcete-li převést zvuk na text, nahrajte nahrávku do automatické služby pro přepis — Any2Text, Whisper a podobných nástrojů — zvolte jazyk a nastavení, spusťte rozpoznávání a upravte výsledek. Na čisté nahrávce se přesnost moderních neuronových sítí drží v rozmezí 95–99 %.
Čtení textu je 3–5krát rychlejší než poslech téže zvukové nahrávky. Tento návod pokrývá, co je přepis, postupný proces, srovnání 8 služeb a expertní tipy pro maximální přesnost.
Přepis zvuku je převod mluvené řeči ze zvukové nebo video nahrávky na psaný text. Od tvorby titulků se liší formátem výsledku: titulky vznikají jako soubor SRT s časovými kódy navázanými na konkrétní snímky videa, zatímco přepis vytváří souvislý text. Od překladu se liší tím, že nemění jazyk — pouze formu, v níž je řeč podána.
Hodnota přepisu zvukové nahrávky spočívá v praktických věcech. V textu se snadno vyhledá konkrétní pasáž a ocituje se přesná fráze. Vyhledávače neindexují zvukové soubory přímo, ale text indexují dokonale, takže přepis podcastu má SEO přínos. Z jediného zvukového souboru vznikne hned několik formátů obsahu: článek, titulky, sada citací na sociální sítě. Textová verze také zpřístupňuje obsah lidem se sluchovým postižením. Hotový výsledek se obvykle ukládá jako DOCX, SRT nebo TXT podle toho, kde se text využije dál.
Automatické rozpoznávání řeči prochází několika fázemi: zvukový signál se nejprve předzpracuje, poté akustický model rozloží zvuk na fonémy — nejmenší jednotky zvuku — a jazykový model je pomocí kontextu poskládá do slov a frází. Pro přirovnání: akustický model pracuje jako ucho, které zachycuje zvuky, zatímco jazykový model pracuje jako mozek, který rozumí smyslu řečeného.
Neuronové sítě se trénují na tisících hodin označené řeči a s každou aktualizací rozpoznávají přesněji. Cloudové služby zpracovávají nahrávku na vzdáleném serveru, zatímco lokální modely jako Whisper běží přímo na počítači uživatele, aniž by soubor kamkoli odesílaly. Pro každou variantu platí jedno pravidlo: kvalita zdrojového zvukového souboru určuje kvalitu přepisu.
Výsledek ovlivňuje i kompatibilita s digitálním zvukovým formátem: služba nejprve převede nahraný záznam do interního formátu pro analýzu, a čím méně ztrát zdrojový soubor nese, tím čistší akustické rysy se modelu předloží. Komprimované formáty s nízkým datovým tokem — například hlasové zprávy z messengerů v OGG — se rozpoznávají znatelně hůř než nahrávka z diktafonu nebo profesionálního mikrofonu.
Jak proměnit zvukovou nahrávku v text je otázka, kterou řeší odborníci z velmi různorodých oborů:
Výstupní formát by měl odpovídat scénáři. Pro rozhovory je pohodlnější DOCX — text lze rovnou upravovat a proměnit v hotovou publikaci. Pro video na YouTube potřebujete SRT s časovými kódy, aby titulky seděly ke snímku. Pro poradu s několika účastníky zvolte rovnou službu s diarizací — jinak se repliky různých lidí slijí do jedné zdi textu a budete muset ručně zjišťovat, kdo co řekl. Pro přednášky a webináře stačí prostý textový soubor bez časových kódů — tady záleží víc na obsahu než na synchronizaci se zvukem.
Jednoduchý sedmikrokový postup vás provede celým procesem — od výběru služby po hotový textový soubor:
Níže je osm variant služeb pro přepis, od jednoduchých bezplatných nástrojů po profesionální placené, a poté srovnání všech osmi podle klíčových parametrů: jazykové pokrytí, přesnost, jedinečné funkce a cena.
Služba pro přepis zvuku a videa s podporou desítek formátů a přesností rozpoznávání až 98 %. Rozlišuje repliky mluvčích (diarizace) a umí surový text upravit do čisté, knižní podoby — automaticky odstraní výplňová slova a opakování. Mezi režimy následného zpracování patří krátké shrnutí nahrávky a formátování jako strukturovaný článek. Export je do DOCX, XLSX, SRT a TXT a k dispozici je bezplatný startovní příděl minut pro posouzení kvality. Webové rozhraní nabízí synchronizované přehrávání — kliknutí na pasáž textu přesune přehrávání zvuku na daný okamžik, což je praktické při ověřování přesných citací z rozhovoru.
Populární nástroj pro poznámky z porad a živý přepis. Nahrává a přepisuje v reálném čase, rozpoznává mluvčí a generuje automatická shrnutí. Integruje se se Zoomem, Google Meet a Microsoft Teams. Nejsilnější je v angličtině a bezplatná úroveň pokrývá omezený počet minut měsíčně. Export je do TXT, DOCX a SRT.
Jeden z nejpřesnějších strojů pro mnoho jazyků, dostupný přes API — to znamená, že se připojuje k vašim vlastním programům a webům. Podporuje časové kódy a filtrování vulgarismů. Jeho nastavení vyžaduje vývojářskou práci, takže se tato varianta hodí týmu, který má vývojáře na konfiguraci integrace.
Kombinuje automatizovaný přepis s volitelnou službou lidské kontroly pro téměř bezchybnou přesnost. Nabízí rychlé dodání, je silný v angličtině a exportuje do SRT, VTT, DOCX a dalších. Automatizovaná úroveň je levnější, zatímco lidský přepis stojí za minutu víc.
Vícejazyčný přepis s propracovaným online editorem, který text propojuje se zvukem pro rychlé ověření. Podporuje označení mluvčích a export titulků a je určen redakcím a obsahovým týmům. Bezplatný přístup je omezen na zkušební verzi.
Bezplatný model s otevřeným zdrojovým kódem, který si nainstalujete lokálně na počítač. Vykazuje vysokou přesnost v mnoha jazycích a dobře si poradí s přízvuky a hlukem v pozadí. Omezení: diarizace není vestavěná, interpunkce často vyžaduje ruční úpravu a jeho zprovoznění vyžaduje základní znalosti Pythonu nebo příkazové řádky.
Specializuje se na přepis firemních porad, integruje se se Zoomem a Google Meet, rozlišuje mluvčí a přidává časové kódy. Bezplatný přístup je omezený a interpunkce občas obsahuje chyby.
Deklarovaná přesnost rozpoznávání 99 %, podpora více než 53 jazyků a přes 30 exportních formátů, včetně SRT, VTT, Word a PDF. Data jsou chráněna šifrováním AES-256. Ceny jsou založené na předplatném a při intenzivním používání se mohou nasčítat, takže se nejlépe hodí pro týmy se stálým objemem nahrávek.
| Služba | Jazyky | Diarizace | Automatická interpunkce | Časové kódy | Bezplatný přístup | Export | Vhodné pro |
|---|---|---|---|---|---|---|---|
| Any2Text | 50+ | Ano | Ano | Ne | Startovní příděl | DOCX, XLSX, SRT, TXT | Rozhovory, podcasty, zpracování textu |
| Otter.ai | Hlavně angličtina | Ano | Ano | Ano | Omezeně měsíčně | TXT, DOCX, SRT | Porady a živé poznámky |
| Google Cloud Speech-to-Text | 100+ | Ano | Ano | Ano | Bezplatná kvóta API | Text, časové kódy | Vývojáře |
| Rev | Hlavně angličtina | Ano | Ano | Ano | Ne (placené) | SRT, VTT, DOCX | Nároky na vysokou přesnost |
| Trint | 30+ | Ano | Ano | Ano | Zkušební | Text, SRT, DOCX | Redakce, obsahové týmy |
| Whisper | Mnoho | Ne (vestavěná) | Částečně | Ano | Zcela zdarma | Text | Technické uživatele |
| mymeet.ai | Několik | Ano | Ano | Ano | Omezeně | Text | Hovory a porady |
| Sonix | 53+ | Ano | Ano | Ano | Zkušební | SRT, VTT, DOCX, PDF | Mezinárodní obsah |
Pro jednorázový úkol může začátečník začít s bezplatnou úrovní Otter.ai nebo s Whisperem — obojí nic nestojí a vyžaduje málo nastavení. Pro firmu s pravidelnými poradami jsou pohodlnější mymeet.ai nebo Otter.ai — nabízejí diarizaci a integraci s videohovory. Pro rozhovory, podcasty a materiály, které chcete nejen přepsat, ale rovnou přivést do čtivé podoby, se dobře hodí Any2Text se svou úpravou do knižního stylu a krátkými shrnutími nahrávek.
Přesnost rozpoznávání řeči závisí na třech věcech: kvalitě algoritmu, přípravě nahrávky a správném nastavení služby:
Vyzkoušejte některý z bezplatných nástrojů hned teď — přepsat krátkou nahrávku s Any2Text zabere jen pár minut. Pokud pracujete s videem, podívejte se také na to, jak převést video na text.
Ověřeno expertem
Zakladatel Any2Text
Ověřil, že materiál odpovídá reálným možnostem služby a přesnosti technických detailů.
Ověřeno: 20. srpna 2026