Převod řeči na text
Inteligentní modul Xeoma pro rozpoznávání řeči
Modul „naslouchá“ zvukovému streamu z kamery nebo samostatného mikrofonu, rozpoznává řeč, reaguje na klíčová slova a ukládá přepis konverzací do sestavy CSV. Dle vašeho nastavení jej může také zobrazit jako textový překryv v živém videu či archivu. Dokáže přepsat i soubory .mp3: nahrávky hovorů, školicí videa atd.

Důležité: verze beta
Modul je dostupný od verze Xeoma 24.8.12 a nachází se ve fázi beta, proto může v některých případech vynechávat slova nebo obsahovat smyčky. Není vyžadováno žádné specializované vybavení: postačí zvukový stream z libovolné kamery či mikrofonu a běžný počítač s GPU.
Scénáře nasazení
Převod řeči na text zvyšuje bezpečnost v soukromé sféře, ve městech i v komerčním sektoru a přispívá k optimalizaci firemních procesů.
Péče o seniory
Možnost okamžitě reagovat na volání o pomoc nebo chránit před podvodníky.
Jakékoli podnikání
Automatizovaná kontrola kvality zákaznického servisu (např. detekce vulgarismů).
Kontaktní centrum
Přepis nahrávek hovorů pro sledování souladu s firemními zásadami a konverzačními skripty.
Městský kamerový systém
Protiteroristická bezpečnost a rozpoznávání slov signalizujících nebezpečí.
Rodičovská kontrola
Pomoc při ochraně dítěte před šikanou nebo komunikací s podvodníky.
Policie
Kromě tělových kamer také přepis rozhovorů s podezřelými a detekce výhrůžek.
Výzkum a analytika
Sběr statistik na pozadí pro jazykové studie a analýzu frekvence používání slov.
Marketing
Zjistěte, zda zákazníci diskutují o reklamní kampani, jak reagují na banner atd.
Filtrování a automatizace
Detekce nežádoucích nebo klíčových frází pro cílenou kontrolu konverzací – bez nutnosti poslouchat všechny nahrávky.
Přínosy modulu Převod řeči na text
Bez nároků na speciální vybavení
Funguje na běžných počítačích s téměř libovolnou kamerou a grafickou kartou.
Špičková flexibilita
Různé typy reakcí (včetně vlastních programovatelných) a integrace se systémy třetích stran.
Provoz v reálném čase
Okamžité zpracování streamů bez zpoždění. Běží na vašem vlastním hardwaru.
Cenově dostupné řešení
Modul lze dokoupit k licenci Standard nebo Pro.
Jak to funguje

Sestavení řetězce
Protože modul pracuje se zvukovým streamem, potřebujete v řetězci zdroj zvuku.
- Zdroj zvuku: mikrofon integrovaný v kameře nebo samostatný USB či IP mikrofon
- Ukázka řetězce: „Univerzální kamera“ – „Převod řeči na text“ – „Náhled a archiv“
- Licence modulu se pořizuje samostatně k licenci Xeoma Pro nebo Standard

Stažení prostředků AI
Kliknutím na ikonu Převod řeči na text v řetězci otevřete nastavení modulu. Při prvním otevření nastavení se automaticky spustí stahování dodatečných prostředků. Jakmile zmizí hláška „Probíhá stahování“, je vše připraveno.
- Dodatečné prostředky obsahují datové sady pro umělou inteligenci a stahují se na vyžádání ze serverů Felenasoft
- Prostředky se stahují pouze podle potřeby – velikost programu tak zůstává malá

Volba modelu rozpoznávání a klíčových slov
Pro různé jazyky je k dispozici několik modelů AI, které se liší velikostí, kvalitou rozpoznávání a zátěží hardwaru. V poli „Model rozpoznávání řeči“ vyberte jazyk transkriptu (jazyk samotné řeči není nutné zadávat) a v případě potřeby do pole níže zadejte klíčová slova pro detekci. Přepínače „Zobrazovat rozpoznanou řeč při sledování v reálném čase“ a „Ukládat rozpoznanou řeč do titulků při nahrávání/exportu archivu“ umožňují zobrazit transkript přes živé video i v archivu.
- „Klíčová slova pro detekci“ — modul reaguje pouze na slova nebo fráze, které potřebujete
- Překryv transkriptu v živém náhledu a v archivu
- „Uložit data do reportu CSV“ — transkript se uloží do tabulkového souboru na disku
- Po modulu připojte reakci: nahrávání, oznámení, odeslání příkazu
- Makro
%VOICE%je dostupné v modulech „Odesílatel HTTP požadavků“, „Odesílání e-mailů“ a „Spouštěč aplikací“
Integrace s externími programy
Voice-to-Text lze využívat z externích programů – například pro přepis hovorů VoIP. Předložte modulu soubor .mp3 a získejte textový výsledek – i na pracovních stanicích operátorů bez nainstalované Xeomy či připojených kamer. Důležité: podporovány jsou pouze soubory .mp3.
Příklad požadavku prostřednictvím Xeoma API (JSON):
curl -F "audio_file=@speech.mp3" "http://192.168.0.67:10090/api?login=Administrator&password=123&speech_recognition=recognition&model=qwen3-asr-1.7b&ttl=10&language=en"
Kde:
audio_file=@speech.mp3— cesta k zvukovému souboru ve vašem počítači192.168.0.67— IP adresa serveru Xeoma10090— port serveru XeomaAdministrator/123— přihlašovací jméno správce (vždy Administrator) a heslomodel=…— model rozpoznávání (viz seznam níže)language=en— jazyk transkriptu. Pokud se liší od skutečného jazyka mluveného projevu, bude transkript automaticky přeložen do vámi zvoleného jazyka
Pro uložení výsledku jako textového souboru přidejte za příkaz >savetext.txt, kde savetext.txt je název textového souboru.
Modely rozpoznávání pro API:
| Název | Popis | Kód API |
|---|---|---|
| Ruský základní | 140 MB | tone |
| Ruský rozšířený | interpunkce, 215 MB | giga |
| Anglický základní | 70 MB | zipformer |
| Multijazykový základní | interpunkce, 1 GB, 0,6 mld. parametrů | qwen3-asr-0.6b |
| Rozšířená vícejazyčná verze | interpunkce, 2,2 GB, 1,7 mld. parametrů | qwen3-asr-1.7b |
| Gemma4 základní vícejazyčná verze | interpunkce, 2,2 GB, 1,7 mld. parametrů | gemma4-e2b |
| Gemma4 rozšířená vícejazyčná verze | interpunkce, 7 GB, 12 mld. parametrů | gemma4-12b |
Seznam kódů jazyků
en — angličtina, zh — čínština, de — němčina, es — španělština, ru — ruština, ko — korejština, fr — francouzština, ja — japonština, pt — portugalština, tr — turečtina, pl — polština, ca — katalánština, nl — nizozemština, ar — arabština, sv — švédština, it — italština, id — indonéština, hi — hindština, fi — finština, vi — vietnamština, he — hebrejština, uk — ukrajinština, el — řečtina, ms — malajština, cs — čeština, ro — rumunština, da — dánština, hu — maďarština, ta — tamilština, no — norština, th — thajština, ur — urdština, hr — chorvatština, bg — bulharština, lt — litevština, la — latina, mi — maorština, ml — malajálamština, cy — velština, sk — slovenština, te — telugština, fa — perština, lv — lotyština, bn — bengálština, sr — srbština, az — ázerbájdžánština, sl — slovinština, kn — kannadština, et — estonština, mk — makedonština, br — bretonština, eu — baskičtina, is — islandština, hy — arménština, ne — nepálština, mn — mongolština, bs — bosenština, kk — kazaština, sq — albánština, sw — svahilština, gl — galicijština, mr — maráthština, pa — paňdžábština, si — sinhálština, km — khmérština, sn — shona, yo — jorubština, so — somálština, af — afrikánština, oc — okcitánština, ka — gruzínština, be — běloruština, tg — tádžičtina, sd — sindhština, gu — gudžarátština, am — amharština, yi — jidiš, lo — laoština, uz — uzbečtina, fo — faerština, ht — haitská kreolština, ps — paštština, tk — turkmenština, nn — nynorsk, mt — maltština, sa — sanskrt, lb — lucemburština, my — barmština, bo — tibetština, tl — tagalog, mg — malgaština, as — ásámština, tt — tatarština, haw — havajština, ln — lingalština, ha — hauština, ba — baškirština, jw — javánština, su — sundština, yue — kantonština.
Jak testovat
Stáhněte a spusťte Xeoma. Použijte zkušební verzi nebo aktivujte licenci Xeoma Standard/Xeoma Pro + licenci doplňkového modulu „Voice-to-Text“.
Přidejte kameru ručně nebo počkejte, než Xeoma automaticky nalezne kamery ve vaší síti. Pro samostatný mikrofon připojte modul „Mikrofon“ a vyberte příslušný zdroj zvuku.
Přidejte modul „Voice-to-Text“ do řetězce, nastavte reakci na klíčová slova nebo průběžný přepis řeči a v případě potřeby povolte překryv přepisu v obraze kamery a v záznamech.
Nastavte reakci na událost – ukládání do CSV, mobilní oznámení nebo jinou akci.
demo licenci
Další moduly pro zpracování zvukových streamů
Tyto moduly fungují samostatně nebo společně s Voice-to-Text.
Jako zdroj zvuku vyberte USB mikrofon nebo samostatný IP mikrofon.
Analyzuje zvukové streamy a spustí se, když úroveň zvuku překročí stanovený limit.
Rozpoznává automobilové alarmy, pláč dítěte, výstřely, křik a tříštění skla.
Voice-to-Text: Rozpoznávání řeči v Xeoma
Vyzkoušejte Xeoma zdarma
Zadejte jméno a e-mail pro získání bezplatné demo licence. Kreditní karta není nutná.
Odeslat bezplatnou demo licenci Xeoma na e-mail
Plná funkcionalita. Okamžité doručení.
Důrazně doporučujeme nepoužívat e-maily obsahující osobní údaje ani nám je nezasílat jiným způsobem. Pokud tak přesto učiníte, odesláním tohoto formuláře potvrzujete svůj souhlas se zpracováním osobních údajů
Potřebujete něco jiného?
Modul zcela nevyhovuje vašim požadavkům? Můžeme vyvinout funkce, které potřebujete, a integrovat je do systému Xeoma jako placenou zakázkovou úpravu. Zobrazit podrobnosti.
Máte dotazy? Potřebujete poradit? Kontaktujte nás! Rádi vám pomůžeme!
Jste připraveni začít?
Vyzkoušejte modul Převod řeči na text s bezplatnou demo licencí – bez nutnosti zadávat platební kartu nebo osobní údaje.

