Runas pārveidošana tekstā
Xeoma intelektuālais runas atpazīšanas modulis
Modulis "uzklausa" audio plūsmu no kameras vai atsevišķa mikrofona, atpazīst runu, reaģē uz atslēgvārdiem un saglabā sarunu transkriptu CSV atskaitē vai attēlo to kā tekstu tiešraides video/arhīvā atkarībā no iestatījumiem. Tas spēj transkribēt arī .mp3 failus: sarunu ierakstus, apmācību video u.c.

Svarīgi: beta versija
Modulis ir pieejams, sākot ar Xeoma 24.8.12, un pašlaik atrodas beta stadijā, tāpēc dažos gadījumos tas var izlaist vārdus vai saturēt atkārtojumus. Specializēts aprīkojums nav nepieciešams: pietiek ar jebkuras kameras vai mikrofona audio plūsmu un standarta datoru ar GPU.
Lietošanas scenāriji
Runas pārveidošana tekstā uzlabo drošību privātajā dzīvē, pilsētvidē un komerciālajā sektorā, kā arī veicina biznesa procesu optimizāciju.
Senioru aprūpe
Spēja nekavējoties reaģēt uz palīgā saucieniem vai pasargāt no krāpniekiem.
Jebkurš bizness
Automatizēta klientu apkalpošanas kvalitātes kontrole (piemēram, lamuvārdu detektēšana).
Zvanu centrs
Zvanu ierakstu transkribēšana, lai uzraudzītu atbilstību uzņēmuma politikai un sarunu skriptiem.
Pilsētas novērošana
Pretterorisma drošība un draudus saturošu vārdu atpazīšana.
Vecāku kontrole
Palīdzība bērna aizsardzībā pret iebiedēšanu vai saziņu ar krāpniekiem.
Policija
Papildus nēsājamajām kamerām — sarunu ar aizdomās turētajiem transkribēšana un draudu detektēšana.
Pētniecība un analītika
Fona statistikas vākšana runas pētījumiem un vārdu lietojuma biežuma analīzei.
Mārketings
Noskaidrojiet, vai klienti apspriež reklāmas kampaņu, kāda ir viņu reakcija uz baneri u.c.
Filtrēšana un automatizācija
Nevēlamu vai atslēgas frāžu detektēšana mērķtiecīgai sarunu kontrolei — bez nepieciešamības noklausīties visas sarunas.
Voice-to-Text moduļa priekšrocības
Nav nepieciešams īpašs aprīkojums
Darbojas standarta datoros ar gandrīz jebkuru kameru un grafisko karti.
Pilnīga elastība
Dažādas reakcijas (tostarp lietotāja programmētas) un integrācija ar trešo pušu sistēmām.
Darbs reāllaikā
Tūlītēja plūsmu apstrāde bez aizkaves. Darbojas uz jūsu aparatūras.
Pieejams risinājums
Moduli var iegādāties papildus Standard vai Pro licencei.
Kā tas darbojas

Izveidot ķēdi
Tā kā modulis darbojas ar audio plūsmu, ķēdē ir nepieciešams skaņas avots.
- Skaņas avots: kamerā iebūvēts mikrofons vai atsevišķs USB vai IP mikrofons
- Ķēdes piemērs: “Universal Camera” – “Voice-to-Text” – “Preview and Archive”
- Modulis tiek licencēts papildus Xeoma Pro vai Standard licencei

Lejupielādēt AI resursus
Noklikšķiniet uz Voice-to-Text ikonas ķēdē, lai atvērtu moduļa iestatījumus. Papildu resursu lejupielāde sāksies automātiski, pirmoreiz atverot iestatījumus. Kad ziņojums “Downloading in progress” pazūd, viss ir gatavs.
- Papildu resursi satur mākslīgā intelekta datu masīvus un tiek lejupielādēti pēc pieprasījuma no FelenaSoft serveriem
- Resursi tiek lejupielādēti tikai pēc nepieciešamības — tas saglabā nelielu programmas izmēru

Izvēlēties atpazīšanas modeli un atslēgvārdus
Dažādām valodām ir pieejami vairāki AI modeļi, kas atšķiras pēc izmēra, atpazīšanas kvalitātes un aparatūras noslodzes. Laukā “Runas atpazīšanas modelis” atlasiet transkripcijas valodu (pašu runas valodu norādīt nav nepieciešams) un, ja vajadzīgs, apakšējā laukā norādiet atslēgvārdus detektēšanai. Slēdži “Atpazītās runas rādīšana reāllaika skatījumā” un “Saglabāt atpazīto runu subtitros ierakstot/eksportējot arhīvu” ļauj uzklāt transkripciju gan tiešraides video, gan arhīvā.
- “Atslēgvārdi detektēšanai” — modulis reaģē tikai uz jums nepieciešamajiem vārdiem vai frāzēm
- Transkripcijas pārklājums tiešraidē un arhīvā
- “Saglabāt datus CSV pārskatā” — transkripcija tiek saglabāta izklājlapas failā diskā
- Pievienojiet reakciju aiz moduļa: ierakstīšanu, paziņojumu, komandas nosūtīšanu
- Makro
%VOICE%ir pieejams moduļos “HTTP pieprasījuma sūtītājs”, “E-pasta sūtīšana” un “Lietotnes palaidītājs”
Integrācija ar ārējām programmām
Voice-to-Text var izmantot no ārējām programmām — piemēram, VoIP sarunu transkribēšanai. Nosūtiet moduļam .mp3 failu un saņemiet rezultātu teksta formātā — pat operatoru darbstacijās, kur nav instalēta Xeoma vai kameras. Svarīgi: tiek atbalstīti tikai .mp3 faili.
Pieprasījuma piemērs, izmantojot Xeoma API (JSON):
curl -F "audio_file=@speech.mp3" "http://192.168.0.67:10090/api?login=Administrator&password=123&speech_recognition=recognition&model=qwen3-asr-1.7b&ttl=10&language=en"
Kur:
audio_file=@speech.mp3— audio faila ceļš datorā192.168.0.67— Xeoma servera IP adrese10090— Xeoma servera portsAdministrator/123— Administratora lietotājvārds (vienmēr Administrator) un parolemodel=…— atpazīšanas modelis (skatīt sarakstu zemāk)language=en— transkripcijas valoda. Ja tā atšķiras no faktiskās runas valodas, transkripcija tiks automātiski tulkota uz norādīto valodu
Lai saglabātu rezultātu kā teksta failu, pievienojiet >savetext.txt pēc komandas, kur savetext.txt ir teksta faila nosaukums.
Atpazīšanas modeļi API:
| Nosaukums | Apraksts | API kods |
|---|---|---|
| Krievu pamata | 140 MB | tone |
| Krievu paplašinātais | interpunkcija, 215 MB | giga |
| Angļu pamata | 70 MB | zipformer |
| Daudzvalodu pamata | interpunkcija, 1 GB, 0,6B parametri | qwen3-asr-0.6b |
| Daudzvalodu paplašinātais | interpunkcija, 2,2 GB, 1,7B parametri | qwen3-asr-1.7b |
Valodu kodu saraksts
en — angļu, zh — ķīniešu, de — vācu, es — spāņu, ru — krievu, ko — korejiešu, fr — franču, ja — japāņu, pt — portugāļu, tr — turku, pl — poļu, ca — katalāņu, nl — nīderlandiešu, ar — arābu, sv — zviedru, it — itāliešu, id — indonēziešu, hi — hindi, fi — somu, vi — vjetnamiešu, he — ebreju, uk — ukraiņu, el — grieķu, ms — malajiešu, cs — čehu, ro — rumāņu, da — dāņu, hu — ungāru, ta — tamilu, no — norvēģu, th — taju, ur — urdu, hr — horvātu, bg — bulgāru, lt — lietuviešu, la — latīņu, mi — maoru, ml — malajalu, cy — velsiešu, sk — slovāku, te — telugu, fa — persiešu, lv — latviešu, bn — bengāļu, sr — serbu, az — azerbaidžāņu, sl — slovēņu, kn — kannadu, et — igauņu, mk — maķedoniešu, br — bretoņu, eu — basku, is — islandiešu, hy — armēņu, ne — nepāliešu, mn — mongoļu, bs — bosniešu, kk — kazahu, sq — albāņu, sw — svahili, gl — galisiešu, mr — maratu, pa — pandžabu, si — singāļu, km — khmeru, sn — šonu, yo — jorubu, so — somāļu, af — afrikandu, oc — oksitāņu, ka — gruzīnu, be — baltkrievu, tg — tadžiku, sd — sindhu, gu — gudžaratu, am — amharu, yi — jidiša, lo — laosiešu, uz — uzbeku, fo — fēru, ht — haitiešu kreolu, ps — puštu, tk — turkmēņu, nn — jaunnorvēģu, mt — maltiešu, sa — sanskrits, lb — luksemburgiešu, my — birmiešu, bo — tibetiešu, tl — tagalu, mg — malagasu, as — asamiešu, tt — tatāru, haw — havajiešu, ln — lingala, ha — hausu, ba — baškīru, jw — javiešu, su — sundaniešu, yue — kantoniešu.
Kā testēt
Lejupielādējiet un palaidiet Xeoma. Izmantojiet izmēģinājuma versiju vai aktivizējiet Xeoma Standard/Xeoma Pro licenci un papildu moduļa “Voice-to-Text” licenci.
Pievienojiet kameru manuāli vai gaidiet, līdz Xeoma automātiski atradīs kameras jūsu tīklā. Lai izmantotu atsevišķu mikrofonu, pievienojiet moduli “Microphone” un izvēlieties atbilstošo skaņas avotu.
Pievienojiet moduli “Voice-to-Text” ķēdei, iestatiet reakciju uz atslēgvārdiem vai nepārtrauktu runas transkripciju un, ja nepieciešams, iespējojiet transkripta pārklājumu kameras attēlā un ierakstos.
Iestatiet reakciju uz notikumu — saglabāšanu CSV formātā, mobilos paziņojumus vai citu darbību.
demonstrācijas licenci
Citi audio plūsmas apstrādes moduļi
Šie moduļi darbojas neatkarīgi vai kopā ar Voice-to-Text.
Izvēlieties USB mikrofonu vai atsevišķu IP mikrofonu kā skaņas avotu.
Analizē audio plūsmas un aktivizējas, ja skaņas līmenis pārsniedz norādīto robežu.
Atpazīst automašīnu signalizācijas, bērna raudāšanu, šāvienus, kliedzienus un stikla plīšanu.
Voice-to-Text: Runas atpazīšana Xeoma
Izmēģiniet Xeoma bez maksas
Ievadiet vārdu un e-pastu, lai saņemtu bezmaksas demo licenci. Kredītkarte nav nepieciešama.
Saņemt Xeoma bezmaksas demonstrācijas licenci e-pastā
Pilna funkcionalitāte. Nosūtīta nekavējoties.
Lūdzam neizmantot e-pasta adreses, kas satur personas datus, un nesūtīt mums personas datus citos veidos. Ja tomēr to darāt, iesniedzot šo veidlapu, jūs apstiprināt savu piekrišanu personas datu apstrādei
Vai nepieciešams kaut kas cits?
Modulis neatbilst jūsu prasībām? Mēs varam izstrādāt nepieciešamās funkcijas un integrēt tās Xeoma kā maksas pakalpojumu. Uzzināt vairāk.
Ir jautājumi? Nepieciešama palīdzība? Sazinieties ar mums! Labprāt palīdzēsim!
Gatavs sākt?
Testējiet Voice-to-Text ar bezmaksas demo licenci — kredītkarte un personas dati nav nepieciešami.
