Audioanalitika pokretana umjetnom inteligencijom

Pretvorba govora u tekst

Napredni Xeoma modul za prepoznavanje govora

Ikona Voice-to-Text modula Modul „sluša“ audioprijenos s kamere ili zasebnog mikrofona, prepoznaje govor, reagira na ključne riječi i sprema transkript razgovora u CSV izvješće ili ga prikazuje kao tekst na videoprijenosu uživo odnosno u arhivi, ovisno o vašim postavkama. Također može transkribirati .mp3 datoteke: snimke razgovora, edukacijske videozapise itd.

Voice-to-Text: Xeomin inteligentni modul za prepoznavanje govora
90+ jezika za transkripciju
CSV izvješće spremljeno na disk
Prijenos uživo i .mp3 datoteke
AI dodatni modul
Važna napomena: modul je u beta fazi

Važno: beta verzija

Modul je dostupan od verzije Xeoma 24.8.12 i nalazi se u beta fazi, stoga u pojedinim slučajevima može preskočiti riječi ili sadržavati ponavljanja. Nije potrebna specijalizirana oprema: dovoljni su audioprijenos s bilo koje kamere ili mikrofona te standardno računalo s GPU-om.

Primjeri upotrebe

Scenariji primjene

Pretvaranje glasa u tekst poboljšava sigurnost u privatnom životu, urbanim sredinama i komercijalnom sektoru te doprinosi optimizaciji poslovnih procesa.

Briga o starijima

Mogućnost trenutačne reakcije na poziv u pomoć ili zaštita od prijevaranata.

Bilo koji posao

Automatizirana kontrola kvalitete korisničke podrške (npr. detekcija psovki).

Call centar

Transkripcija snimki poziva radi nadzora usklađenosti s pravilima tvrtke i skriptama razgovora.

Gradski nadzor

Antiteroristička zaštita i prepoznavanje riječi koje ukazuju na opasnost.

Roditeljski nadzor

Pomoć u zaštiti djeteta od vršnjačkog nasilja ili komunikacije s prevarantima.

Policija

Uz kamere na tijelu — transkripcija razgovora s osumnjičenicima i detekcija prijetnji.

Istraživanje i analitika

Pozadinsko prikupljanje statistike za govorne studije i analizu učestalosti riječi.

Marketing

Saznajte raspravljaju li klijenti o promotivnoj kampanji, kakva je njihova reakcija na oglas itd.

Filtriranje i automatizacija

Detekcija neželjenih ili ključnih fraza za ciljanu kontrolu razgovora — bez potrebe za preslušavanjem svih snimki.

Prednosti

Prednosti modula za pretvaranje glasa u tekst

Bez potrebe za posebnom opremom

Radi na standardnim računalima s gotovo bilo kojom kamerom i grafičkom karticom.

Jednostavna fleksibilnost

Različite reakcije (uključujući vlastite programabilne) i integracija sa sustavima trećih strana.

Rad u stvarnom vremenu

Obrada prijenosa u stvarnom vremenu, bez kašnjenja. Radi na vašem hardveru.

Pristupačno rješenje

Modul se može kupiti kao dodatak licenciji Standard ili Pro.

Radni proces

Kako radi

Primjer lanca s inteligentnim Voice-to-Text modulom
Korak 1

Izgradite lanac

Budući da modul radi s audioprijenosom, u lancu je potreban izvor zvuka.

  • Izvor zvuka: mikrofon ugrađen u kameru ili zaseban USB odnosno IP mikrofon
  • Primjer lanca: „Universal Camera“ – „Voice-to-Text“ – „Preview and Archive“
  • Licencija za ovaj modul kupuje se dodatno uz licenciju Xeoma Pro ili Standard
Preuzimanje dodatnih AI resursa
Korak 2

Preuzmite AI resurse

Kliknite na ikonu Voice-to-Text u lancu za otvaranje postavki modula. Preuzimanje dodatnih resursa započet će automatski pri prvom otvaranju postavki. Kada poruka „Preuzimanje u tijeku“ nestane, sve je spremno.

  • Dodatni resursi sadrže podatkovne skupove za umjetnu inteligenciju i preuzimaju se na zahtjev s FelenaSoftovih poslužitelja
  • Resursi se preuzimaju samo po potrebi — čime se smanjuje veličina programa
Odabir AI modela i jezika transkripcije
Korak 3

Odaberite model prepoznavanja i ključne riječi

Dostupno je nekoliko AI modela za različite jezike koji se razlikuju po veličini, kvaliteti prepoznavanja i opterećenju hardvera. U polju „Model prepoznavanja govora” odaberite jezik transkripcije (nije potrebno navoditi jezik samog govora), a po potrebi u polju ispod navedite ključne riječi za detekciju. Prekidači „Prikaz prepoznatog govora tijekom pregleda uživo” i „Spremanje prepoznatog govora u titlove pri snimanju/izvozu arhive” omogućuju prikaz transkripcije preko videa uživo i u arhivi.

  • „Ključne riječi za detekciju” — modul reagira samo na riječi ili fraze koje su vam potrebne
  • Preklapanje transkripcije u prijenosu uživo i u arhivi
  • „Spremi podatke u CSV izvješće” — transkripcija se sprema u tabličnu datoteku na disku
  • Povežite reakciju nakon modula: snimanje, obavijest, slanje naredbe
  • Makronaredba %VOICE% dostupna je u modulima „Slanje HTTP zahtjeva”, „Slanje e-pošte” i „Pokretač aplikacija”
API

Integracija s vanjskim programima

Voice-to-Text može se koristiti iz vanjskih programa, primjerice za transkribiranje VoIP razgovora. Proslijedite .mp3 datoteku modulu i primite rezultat kao tekst — čak i na operaterskim radnim stanicama na kojima nisu instalirani Xeoma ili kamere. Važno: podržane su samo .mp3 datoteke.

Primjer zahtjeva putem Xeoma API-ja (JSON):

curl -F "audio_file=@speech.mp3" "http://192.168.0.67:10090/api?login=Administrator&password=123&speech_recognition=recognition&model=qwen3-asr-1.7b&ttl=10&language=en"

Gdje:

  • audio_file=@speech.mp3 — put do audiodatoteke na vašem računalu
  • 192.168.0.67 — IP adresa Xeoma poslužitelja
  • 10090 — port Xeoma poslužitelja
  • Administrator / 123 — prijava administratora (uvijek Administrator) i lozinka
  • model=… — model prepoznavanja (pogledajte popis u nastavku)
  • language=en — jezik transkripcije. Ako se razlikuje od stvarnog jezika govora, transkripcija će se automatski prevesti na navedeni jezik

Za spremanje rezultata u tekstualnu datoteku dodajte >savetext.txt nakon naredbe, pri čemu je savetext.txt naziv tekstualne datoteke.

Modeli prepoznavanja za API:

Naziv Opis API kod
Ruski osnovni 140 MB tone
Ruski napredni interpunkcija, 215 MB giga
Engleski osnovni 70 MB zipformer
Višejezični osnovni interpunkcija, 1 GB, 0,6 milijardi parametara qwen3-asr-0.6b
Poboljšani višejezični model interpunkcija, 2,2 GB, 1,7 milijardi parametara qwen3-asr-1.7b
Gemma4 osnovni višejezični model interpunkcija, 2,2 GB, 1,7 milijardi parametara gemma4-e2b
Gemma4 poboljšani višejezični model interpunkcija, 7 GB, 12 milijardi parametara gemma4-12b

Popis jezičnih kodova

en — engleski, zh — kineski, de — njemački, es — španjolski, ru — ruski, ko — korejski, fr — francuski, ja — japanski, pt — portugalski, tr — turski, pl — poljski, ca — katalonski, nl — nizozemski, ar — arapski, sv — švedski, it — talijanski, id — indonezijski, hi — hindski, fi — finski, vi — vijetnamski, he — hebrejski, uk — ukrajinski, el — grčki, ms — malajski, cs — češki, ro — rumunjski, da — danski, hu — mađarski, ta — tamilski, no — norveški, th — tajlandski, ur — urdski, hr — hrvatski, bg — bugarski, lt — litavski, la — latinski, mi — maorski, ml — malajalamski, cy — velški, sk — slovački, te — teluški, fa — perzijski, lv — latvijski, bn — bengalski, sr — srpski, az — azerbajdžanski, sl — slovenski, kn — kannada, et — estonski, mk — makedonski, br — bretonski, eu — baskijski, is — islandski, hy — armenski, ne — nepalski, mn — mongolski, bs — bošnjački, kk — kazaški, sq — albanski, sw — svahili, gl — galicijski, mr — marathski, pa — pandžapski, si — sinhaleški, km — kmerski, sn — shona, yo — joruba, so — somalski, af — afrikaans, oc — okcitanski, ka — gruzijski, be — bjeloruski, tg — tadžički, sd — sindski, gu — gudžaratski, am — amharski, yi — jidiš, lo — laoški, uz — uzbečki, fo — ferojski, ht — haićanski kreolski, ps — paštunski, tk — turkmenski, nn — nynorsk, mt — malteški, sa — sanskrt, lb — luksemburški, my — burmanski, bo — tibetski, tl — tagalog, mg — malgaški, as — asamski, tt — tatarski, haw — havajski, ln — lingala, ha — hausa, ba — baškirski, jw — javanski, su — sundanski, yue — kantonski.

Brzi početak

Kako testirati

1
Pokrenite Xeoma

Preuzmite i pokrenite Xeomu. Koristite probnu verziju ili aktivirajte licencu za Xeoma Standard/Xeoma Pro + licencu za dodatni modul „Voice-to-Text”.

2
Dodajte kameru

Dodajte kameru ručno ili pričekajte da Xeoma automatski pronađe kamere u vašoj mreži. Za zaseban mikrofon, povežite modul „Microphone” i odaberite odgovarajući izvor zvuka.

3
Dodajte modul

Dodajte modul „Voice-to-Text” u lanac, postavite reakciju na ključne riječi ili kontinuiranu transkripciju govora te, ako je potrebno, omogućite prikaz transkripta preko slike kamere i snimaka.

4
Postavite reakcije

Postavite reakciju na događaj — spremanje u CSV, mobilne obavijesti ili drugu radnju.

Postavke Voice-to-Text modula u Xeomi
Probna verzija ima određena ograničenja. Za bolje upoznavanje modula Voice-to-Text preporučujemo zatražiti besplatnu demo licencu. Ona omogućuje pristup svim značajkama bez ograničenja i obveza. Potrebna je samo e-mail adresa. Kliknite gumb ispod za početak:
Nabavite besplatnu
demo licencu
Video

Voice-to-Text: Prepoznavanje govora u Xeomi

Besplatna proba

Isprobajte Xeomu besplatno

Unesite svoje ime i e-mail kako biste dobili besplatnu demo licencu. Kreditna kartica nije potrebna.

Primite besplatne demo licence za Xeomu putem e-maila

Potpuna funkcionalnost. Trenutna dostava.

Molimo vas da izbjegavate korištenje e-mail adresa koje sadrže osobne podatke i slanje osobnih podataka na bilo koji drugi način. Ako to ipak učinite, slanjem ovog obrasca potvrđujete svoj pristanak na obradu vaših osobnih podataka

Trebate li modul prilagođen vašim potrebama?

Trebate li nešto drugo?

Modul ne odgovara u potpunosti vašim uvjetima? Možemo razviti funkcije koje trebate i dodati ih u Xeomu kao uslugu prilagođenog razvoja. Pogledajte detalje.

Imate pitanja? Trebate pomoć? Kontaktirajte nas! Rado ćemo vam pomoći!

Spremni za početak?

Isprobajte pretvorbu govora u tekst s besplatnom demo licencom — bez kreditne kartice i osobnih podataka.