Pretvorba govora u tekst
Napredni Xeoma modul za prepoznavanje govora
Modul „sluša“ audioprijenos s kamere ili zasebnog mikrofona, prepoznaje govor, reagira na ključne riječi i sprema transkript razgovora u CSV izvješće ili ga prikazuje kao tekst na videoprijenosu uživo odnosno u arhivi, ovisno o vašim postavkama. Također može transkribirati .mp3 datoteke: snimke razgovora, edukacijske videozapise itd.

Važno: beta verzija
Modul je dostupan od verzije Xeoma 24.8.12 i nalazi se u beta fazi, stoga u pojedinim slučajevima može preskočiti riječi ili sadržavati ponavljanja. Nije potrebna specijalizirana oprema: dovoljni su audioprijenos s bilo koje kamere ili mikrofona te standardno računalo s GPU-om.
Scenariji primjene
Pretvaranje glasa u tekst poboljšava sigurnost u privatnom životu, urbanim sredinama i komercijalnom sektoru te doprinosi optimizaciji poslovnih procesa.
Briga o starijima
Mogućnost trenutačne reakcije na poziv u pomoć ili zaštita od prijevaranata.
Bilo koji posao
Automatizirana kontrola kvalitete korisničke podrške (npr. detekcija psovki).
Call centar
Transkripcija snimki poziva radi nadzora usklađenosti s pravilima tvrtke i skriptama razgovora.
Gradski nadzor
Antiteroristička zaštita i prepoznavanje riječi koje ukazuju na opasnost.
Roditeljski nadzor
Pomoć u zaštiti djeteta od vršnjačkog nasilja ili komunikacije s prevarantima.
Policija
Uz kamere na tijelu — transkripcija razgovora s osumnjičenicima i detekcija prijetnji.
Istraživanje i analitika
Pozadinsko prikupljanje statistike za govorne studije i analizu učestalosti riječi.
Marketing
Saznajte raspravljaju li klijenti o promotivnoj kampanji, kakva je njihova reakcija na oglas itd.
Filtriranje i automatizacija
Detekcija neželjenih ili ključnih fraza za ciljanu kontrolu razgovora — bez potrebe za preslušavanjem svih snimki.
Prednosti modula za pretvaranje glasa u tekst
Bez potrebe za posebnom opremom
Radi na standardnim računalima s gotovo bilo kojom kamerom i grafičkom karticom.
Jednostavna fleksibilnost
Različite reakcije (uključujući vlastite programabilne) i integracija sa sustavima trećih strana.
Rad u stvarnom vremenu
Obrada prijenosa u stvarnom vremenu, bez kašnjenja. Radi na vašem hardveru.
Pristupačno rješenje
Modul se može kupiti kao dodatak licenciji Standard ili Pro.
Kako radi

Izgradite lanac
Budući da modul radi s audioprijenosom, u lancu je potreban izvor zvuka.
- Izvor zvuka: mikrofon ugrađen u kameru ili zaseban USB odnosno IP mikrofon
- Primjer lanca: „Universal Camera“ – „Voice-to-Text“ – „Preview and Archive“
- Licencija za ovaj modul kupuje se dodatno uz licenciju Xeoma Pro ili Standard

Preuzmite AI resurse
Kliknite na ikonu Voice-to-Text u lancu za otvaranje postavki modula. Preuzimanje dodatnih resursa započet će automatski pri prvom otvaranju postavki. Kada poruka „Preuzimanje u tijeku“ nestane, sve je spremno.
- Dodatni resursi sadrže podatkovne skupove za umjetnu inteligenciju i preuzimaju se na zahtjev s FelenaSoftovih poslužitelja
- Resursi se preuzimaju samo po potrebi — čime se smanjuje veličina programa

Odaberite model prepoznavanja i ključne riječi
Dostupno je nekoliko AI modela za različite jezike koji se razlikuju po veličini, kvaliteti prepoznavanja i opterećenju hardvera. U polju „Model prepoznavanja govora” odaberite jezik transkripcije (nije potrebno navoditi jezik samog govora), a po potrebi u polju ispod navedite ključne riječi za detekciju. Prekidači „Prikaz prepoznatog govora tijekom pregleda uživo” i „Spremanje prepoznatog govora u titlove pri snimanju/izvozu arhive” omogućuju prikaz transkripcije preko videa uživo i u arhivi.
- „Ključne riječi za detekciju” — modul reagira samo na riječi ili fraze koje su vam potrebne
- Preklapanje transkripcije u prijenosu uživo i u arhivi
- „Spremi podatke u CSV izvješće” — transkripcija se sprema u tabličnu datoteku na disku
- Povežite reakciju nakon modula: snimanje, obavijest, slanje naredbe
- Makronaredba
%VOICE%dostupna je u modulima „Slanje HTTP zahtjeva”, „Slanje e-pošte” i „Pokretač aplikacija”
Integracija s vanjskim programima
Voice-to-Text može se koristiti iz vanjskih programa, primjerice za transkribiranje VoIP razgovora. Proslijedite .mp3 datoteku modulu i primite rezultat kao tekst — čak i na operaterskim radnim stanicama na kojima nisu instalirani Xeoma ili kamere. Važno: podržane su samo .mp3 datoteke.
Primjer zahtjeva putem Xeoma API-ja (JSON):
curl -F "audio_file=@speech.mp3" "http://192.168.0.67:10090/api?login=Administrator&password=123&speech_recognition=recognition&model=qwen3-asr-1.7b&ttl=10&language=en"
Gdje:
audio_file=@speech.mp3— put do audiodatoteke na vašem računalu192.168.0.67— IP adresa Xeoma poslužitelja10090— port Xeoma poslužiteljaAdministrator/123— prijava administratora (uvijek Administrator) i lozinkamodel=…— model prepoznavanja (pogledajte popis u nastavku)language=en— jezik transkripcije. Ako se razlikuje od stvarnog jezika govora, transkripcija će se automatski prevesti na navedeni jezik
Za spremanje rezultata u tekstualnu datoteku dodajte >savetext.txt nakon naredbe, pri čemu je savetext.txt naziv tekstualne datoteke.
Modeli prepoznavanja za API:
| Naziv | Opis | API kod |
|---|---|---|
| Ruski osnovni | 140 MB | tone |
| Ruski napredni | interpunkcija, 215 MB | giga |
| Engleski osnovni | 70 MB | zipformer |
| Višejezični osnovni | interpunkcija, 1 GB, 0,6 milijardi parametara | qwen3-asr-0.6b |
| Poboljšani višejezični model | interpunkcija, 2,2 GB, 1,7 milijardi parametara | qwen3-asr-1.7b |
| Gemma4 osnovni višejezični model | interpunkcija, 2,2 GB, 1,7 milijardi parametara | gemma4-e2b |
| Gemma4 poboljšani višejezični model | interpunkcija, 7 GB, 12 milijardi parametara | gemma4-12b |
Popis jezičnih kodova
en — engleski, zh — kineski, de — njemački, es — španjolski, ru — ruski, ko — korejski, fr — francuski, ja — japanski, pt — portugalski, tr — turski, pl — poljski, ca — katalonski, nl — nizozemski, ar — arapski, sv — švedski, it — talijanski, id — indonezijski, hi — hindski, fi — finski, vi — vijetnamski, he — hebrejski, uk — ukrajinski, el — grčki, ms — malajski, cs — češki, ro — rumunjski, da — danski, hu — mađarski, ta — tamilski, no — norveški, th — tajlandski, ur — urdski, hr — hrvatski, bg — bugarski, lt — litavski, la — latinski, mi — maorski, ml — malajalamski, cy — velški, sk — slovački, te — teluški, fa — perzijski, lv — latvijski, bn — bengalski, sr — srpski, az — azerbajdžanski, sl — slovenski, kn — kannada, et — estonski, mk — makedonski, br — bretonski, eu — baskijski, is — islandski, hy — armenski, ne — nepalski, mn — mongolski, bs — bošnjački, kk — kazaški, sq — albanski, sw — svahili, gl — galicijski, mr — marathski, pa — pandžapski, si — sinhaleški, km — kmerski, sn — shona, yo — joruba, so — somalski, af — afrikaans, oc — okcitanski, ka — gruzijski, be — bjeloruski, tg — tadžički, sd — sindski, gu — gudžaratski, am — amharski, yi — jidiš, lo — laoški, uz — uzbečki, fo — ferojski, ht — haićanski kreolski, ps — paštunski, tk — turkmenski, nn — nynorsk, mt — malteški, sa — sanskrt, lb — luksemburški, my — burmanski, bo — tibetski, tl — tagalog, mg — malgaški, as — asamski, tt — tatarski, haw — havajski, ln — lingala, ha — hausa, ba — baškirski, jw — javanski, su — sundanski, yue — kantonski.
Kako testirati
Preuzmite i pokrenite Xeomu. Koristite probnu verziju ili aktivirajte licencu za Xeoma Standard/Xeoma Pro + licencu za dodatni modul „Voice-to-Text”.
Dodajte kameru ručno ili pričekajte da Xeoma automatski pronađe kamere u vašoj mreži. Za zaseban mikrofon, povežite modul „Microphone” i odaberite odgovarajući izvor zvuka.
Dodajte modul „Voice-to-Text” u lanac, postavite reakciju na ključne riječi ili kontinuiranu transkripciju govora te, ako je potrebno, omogućite prikaz transkripta preko slike kamere i snimaka.
Postavite reakciju na događaj — spremanje u CSV, mobilne obavijesti ili drugu radnju.
demo licencu
Ostali moduli za obradu audio streamova
Ovi moduli rade samostalno ili u kombinaciji s Voice-to-Textom.
Odaberite USB mikrofon ili zaseban IP mikrofon kao izvor zvuka.
Analizira audio streamove i aktivira se kada razina zvuka prijeđe zadani prag.
Prepoznaje automobilski alarm, plač djeteta, pucnje, vrisak i lomljenje stakla.
Voice-to-Text: Prepoznavanje govora u Xeomi
Isprobajte Xeomu besplatno
Unesite svoje ime i e-mail kako biste dobili besplatnu demo licencu. Kreditna kartica nije potrebna.
Primite besplatne demo licence za Xeomu putem e-maila
Potpuna funkcionalnost. Trenutna dostava.
Molimo vas da izbjegavate korištenje e-mail adresa koje sadrže osobne podatke i slanje osobnih podataka na bilo koji drugi način. Ako to ipak učinite, slanjem ovog obrasca potvrđujete svoj pristanak na obradu vaših osobnih podataka
Trebate li nešto drugo?
Modul ne odgovara u potpunosti vašim uvjetima? Možemo razviti funkcije koje trebate i dodati ih u Xeomu kao uslugu prilagođenog razvoja. Pogledajte detalje.
Imate pitanja? Trebate pomoć? Kontaktirajte nas! Rado ćemo vam pomoći!
Spremni za početak?
Isprobajte pretvorbu govora u tekst s besplatnom demo licencom — bez kreditne kartice i osobnih podataka.

