Zvuková analytika s AI

Převod řeči na text

Inteligentní modul Xeoma pro rozpoznávání řeči

Ikona modulu Voice-to-Text Modul „naslouchá“ zvukovému streamu z kamery nebo samostatného mikrofonu, rozpoznává řeč, reaguje na klíčová slova a ukládá přepis konverzací do sestavy CSV. Dle vašeho nastavení jej může také zobrazit jako textový překryv v živém videu či archivu. Dokáže přepsat i soubory .mp3: nahrávky hovorů, školicí videa atd.

Voice-to-Text: Inteligentní modul Xeoma pro rozpoznávání řeči
90+ jazyků přepisu
CSV sestava uložena na disk
Živé streamy a soubory .mp3
AI přídavný modul
Důležitá poznámka: modul je v beta verzi

Důležité: verze beta

Modul je dostupný od verze Xeoma 24.8.12 a nachází se ve fázi beta, proto může v některých případech vynechávat slova nebo obsahovat smyčky. Není vyžadováno žádné specializované vybavení: postačí zvukový stream z libovolné kamery či mikrofonu a běžný počítač s GPU.

Příklady použití

Scénáře nasazení

Převod řeči na text zvyšuje bezpečnost v soukromé sféře, ve městech i v komerčním sektoru a přispívá k optimalizaci firemních procesů.

Péče o seniory

Možnost okamžitě reagovat na volání o pomoc nebo chránit před podvodníky.

Jakékoli podnikání

Automatizovaná kontrola kvality zákaznického servisu (např. detekce vulgarismů).

Kontaktní centrum

Přepis nahrávek hovorů pro sledování souladu s firemními zásadami a konverzačními skripty.

Městský kamerový systém

Protiteroristická bezpečnost a rozpoznávání slov signalizujících nebezpečí.

Rodičovská kontrola

Pomoc při ochraně dítěte před šikanou nebo komunikací s podvodníky.

Policie

Kromě tělových kamer také přepis rozhovorů s podezřelými a detekce výhrůžek.

Výzkum a analytika

Sběr statistik na pozadí pro jazykové studie a analýzu frekvence používání slov.

Marketing

Zjistěte, zda zákazníci diskutují o reklamní kampani, jak reagují na banner atd.

Filtrování a automatizace

Detekce nežádoucích nebo klíčových frází pro cílenou kontrolu konverzací – bez nutnosti poslouchat všechny nahrávky.

Klíčové přínosy

Přínosy modulu Převod řeči na text

Bez nároků na speciální vybavení

Funguje na běžných počítačích s téměř libovolnou kamerou a grafickou kartou.

Špičková flexibilita

Různé typy reakcí (včetně vlastních programovatelných) a integrace se systémy třetích stran.

Provoz v reálném čase

Okamžité zpracování streamů bez zpoždění. Běží na vašem vlastním hardwaru.

Cenově dostupné řešení

Modul lze dokoupit k licenci Standard nebo Pro.

Pracovní postup

Jak to funguje

Ukázka řetězce s inteligentním modulem Voice-to-Text
Krok 1

Sestavení řetězce

Protože modul pracuje se zvukovým streamem, potřebujete v řetězci zdroj zvuku.

  • Zdroj zvuku: mikrofon integrovaný v kameře nebo samostatný USB či IP mikrofon
  • Ukázka řetězce: „Univerzální kamera“ – „Převod řeči na text“ – „Náhled a archiv“
  • Licence modulu se pořizuje samostatně k licenci Xeoma Pro nebo Standard
Stahování dodatečných AI prostředků
Krok 2

Stažení prostředků AI

Kliknutím na ikonu Převod řeči na text v řetězci otevřete nastavení modulu. Při prvním otevření nastavení se automaticky spustí stahování dodatečných prostředků. Jakmile zmizí hláška „Probíhá stahování“, je vše připraveno.

  • Dodatečné prostředky obsahují datové sady pro umělou inteligenci a stahují se na vyžádání ze serverů Felenasoft
  • Prostředky se stahují pouze podle potřeby – velikost programu tak zůstává malá
Výběr AI modelu a jazyka přepisu
Krok 3

Volba modelu rozpoznávání a klíčových slov

Pro různé jazyky je k dispozici několik modelů AI, které se liší velikostí, kvalitou rozpoznávání a zátěží hardwaru. V poli „Model rozpoznávání řeči“ vyberte jazyk transkriptu (jazyk samotné řeči není nutné zadávat) a v případě potřeby do pole níže zadejte klíčová slova pro detekci. Přepínače „Zobrazovat rozpoznanou řeč při sledování v reálném čase“ a „Ukládat rozpoznanou řeč do titulků při nahrávání/exportu archivu“ umožňují zobrazit transkript přes živé video i v archivu.

  • „Klíčová slova pro detekci“ — modul reaguje pouze na slova nebo fráze, které potřebujete
  • Překryv transkriptu v živém náhledu a v archivu
  • „Uložit data do reportu CSV“ — transkript se uloží do tabulkového souboru na disku
  • Po modulu připojte reakci: nahrávání, oznámení, odeslání příkazu
  • Makro %VOICE% je dostupné v modulech „Odesílatel HTTP požadavků“, „Odesílání e-mailů“ a „Spouštěč aplikací“
API

Integrace s externími programy

Voice-to-Text lze využívat z externích programů – například pro přepis hovorů VoIP. Předložte modulu soubor .mp3 a získejte textový výsledek – i na pracovních stanicích operátorů bez nainstalované Xeomy či připojených kamer. Důležité: podporovány jsou pouze soubory .mp3.

Příklad požadavku prostřednictvím Xeoma API (JSON):

curl -F "audio_file=@speech.mp3" "http://192.168.0.67:10090/api?login=Administrator&password=123&speech_recognition=recognition&model=qwen3-asr-1.7b&ttl=10&language=en"

Kde:

  • audio_file=@speech.mp3 — cesta k zvukovému souboru ve vašem počítači
  • 192.168.0.67 — IP adresa serveru Xeoma
  • 10090 — port serveru Xeoma
  • Administrator / 123 — přihlašovací jméno správce (vždy Administrator) a heslo
  • model=… — model rozpoznávání (viz seznam níže)
  • language=en — jazyk transkriptu. Pokud se liší od skutečného jazyka mluveného projevu, bude transkript automaticky přeložen do vámi zvoleného jazyka

Pro uložení výsledku jako textového souboru přidejte za příkaz >savetext.txt, kde savetext.txt je název textového souboru.

Modely rozpoznávání pro API:

Název Popis Kód API
Ruský základní 140 MB tone
Ruský rozšířený interpunkce, 215 MB giga
Anglický základní 70 MB zipformer
Multijazykový základní interpunkce, 1 GB, 0,6 mld. parametrů qwen3-asr-0.6b
Rozšířená vícejazyčná verze interpunkce, 2,2 GB, 1,7 mld. parametrů qwen3-asr-1.7b
Gemma4 základní vícejazyčná verze interpunkce, 2,2 GB, 1,7 mld. parametrů gemma4-e2b
Gemma4 rozšířená vícejazyčná verze interpunkce, 7 GB, 12 mld. parametrů gemma4-12b

Seznam kódů jazyků

en — angličtina, zh — čínština, de — němčina, es — španělština, ru — ruština, ko — korejština, fr — francouzština, ja — japonština, pt — portugalština, tr — turečtina, pl — polština, ca — katalánština, nl — nizozemština, ar — arabština, sv — švédština, it — italština, id — indonéština, hi — hindština, fi — finština, vi — vietnamština, he — hebrejština, uk — ukrajinština, el — řečtina, ms — malajština, cs — čeština, ro — rumunština, da — dánština, hu — maďarština, ta — tamilština, no — norština, th — thajština, ur — urdština, hr — chorvatština, bg — bulharština, lt — litevština, la — latina, mi — maorština, ml — malajálamština, cy — velština, sk — slovenština, te — telugština, fa — perština, lv — lotyština, bn — bengálština, sr — srbština, az — ázerbájdžánština, sl — slovinština, kn — kannadština, et — estonština, mk — makedonština, br — bretonština, eu — baskičtina, is — islandština, hy — arménština, ne — nepálština, mn — mongolština, bs — bosenština, kk — kazaština, sq — albánština, sw — svahilština, gl — galicijština, mr — maráthština, pa — paňdžábština, si — sinhálština, km — khmérština, sn — shona, yo — jorubština, so — somálština, af — afrikánština, oc — okcitánština, ka — gruzínština, be — běloruština, tg — tádžičtina, sd — sindhština, gu — gudžarátština, am — amharština, yi — jidiš, lo — laoština, uz — uzbečtina, fo — faerština, ht — haitská kreolština, ps — paštština, tk — turkmenština, nn — nynorsk, mt — maltština, sa — sanskrt, lb — lucemburština, my — barmština, bo — tibetština, tl — tagalog, mg — malgaština, as — ásámština, tt — tatarština, haw — havajština, ln — lingalština, ha — hauština, ba — baškirština, jw — javánština, su — sundština, yue — kantonština.

Rychlé spuštění

Jak testovat

1
Spustit Xeoma

Stáhněte a spusťte Xeoma. Použijte zkušební verzi nebo aktivujte licenci Xeoma Standard/Xeoma Pro + licenci doplňkového modulu „Voice-to-Text“.

2
Přidat kameru

Přidejte kameru ručně nebo počkejte, než Xeoma automaticky nalezne kamery ve vaší síti. Pro samostatný mikrofon připojte modul „Mikrofon“ a vyberte příslušný zdroj zvuku.

3
Přidat modul

Přidejte modul „Voice-to-Text“ do řetězce, nastavte reakci na klíčová slova nebo průběžný přepis řeči a v případě potřeby povolte překryv přepisu v obraze kamery a v záznamech.

4
Nastavit reakce

Nastavte reakci na událost – ukládání do CSV, mobilní oznámení nebo jinou akci.

Nastavení modulu Voice-to-Text v Xeoma
Zkušební verze má určitá omezení. Pro důkladné seznámení s modulem Voice-to-Text doporučujeme požádat o bezplatnou demo licenci. Poskytuje přístup ke všem funkcím bez omezení a závazků. Jedinou podmínkou je zadání e-mailové adresy. Začněte kliknutím na tlačítko níže:
Získat bezplatnou
demo licenci
Video

Voice-to-Text: Rozpoznávání řeči v Xeoma

Bezplatná zkušební verze

Vyzkoušejte Xeoma zdarma

Zadejte jméno a e-mail pro získání bezplatné demo licence. Kreditní karta není nutná.

Odeslat bezplatnou demo licenci Xeoma na e-mail

Plná funkcionalita. Okamžité doručení.

Důrazně doporučujeme nepoužívat e-maily obsahující osobní údaje ani nám je nezasílat jiným způsobem. Pokud tak přesto učiníte, odesláním tohoto formuláře potvrzujete svůj souhlas se zpracováním osobních údajů

Potřebujete modul přizpůsobit vašim potřebám?

Potřebujete něco jiného?

Modul zcela nevyhovuje vašim požadavkům? Můžeme vyvinout funkce, které potřebujete, a integrovat je do systému Xeoma jako placenou zakázkovou úpravu. Zobrazit podrobnosti.

Máte dotazy? Potřebujete poradit? Kontaktujte nás! Rádi vám pomůžeme!

Jste připraveni začít?

Vyzkoušejte modul Převod řeči na text s bezplatnou demo licencí – bez nutnosti zadávat platební kartu nebo osobní údaje.