AI audio analītika

Runas pārveidošana tekstā

Xeoma intelektuālais runas atpazīšanas modulis

Voice-to-Text moduļa ikona Modulis "uzklausa" audio plūsmu no kameras vai atsevišķa mikrofona, atpazīst runu, reaģē uz atslēgvārdiem un saglabā sarunu transkriptu CSV atskaitē vai attēlo to kā tekstu tiešraides video/arhīvā atkarībā no iestatījumiem. Tas spēj transkribēt arī .mp3 failus: sarunu ierakstus, apmācību video u.c.

Voice-to-Text: Xeoma intelektuālais runas atpazīšanas modulis
90+ transkribēšanas valodas
CSV atskaite tiek saglabāta diskā
Tiešraides plūsmas un .mp3 faili
AI papildu modulis
Svarīgi: modulis ir beta versijā

Svarīgi: beta versija

Modulis ir pieejams, sākot ar Xeoma 24.8.12, un pašlaik atrodas beta stadijā, tāpēc dažos gadījumos tas var izlaist vārdus vai saturēt atkārtojumus. Specializēts aprīkojums nav nepieciešams: pietiek ar jebkuras kameras vai mikrofona audio plūsmu un standarta datoru ar GPU.

Lietošanas gadījumi

Lietošanas scenāriji

Runas pārveidošana tekstā uzlabo drošību privātajā dzīvē, pilsētvidē un komerciālajā sektorā, kā arī veicina biznesa procesu optimizāciju.

Senioru aprūpe

Spēja nekavējoties reaģēt uz palīgā saucieniem vai pasargāt no krāpniekiem.

Jebkurš bizness

Automatizēta klientu apkalpošanas kvalitātes kontrole (piemēram, lamuvārdu detektēšana).

Zvanu centrs

Zvanu ierakstu transkribēšana, lai uzraudzītu atbilstību uzņēmuma politikai un sarunu skriptiem.

Pilsētas novērošana

Pretterorisma drošība un draudus saturošu vārdu atpazīšana.

Vecāku kontrole

Palīdzība bērna aizsardzībā pret iebiedēšanu vai saziņu ar krāpniekiem.

Policija

Papildus nēsājamajām kamerām — sarunu ar aizdomās turētajiem transkribēšana un draudu detektēšana.

Pētniecība un analītika

Fona statistikas vākšana runas pētījumiem un vārdu lietojuma biežuma analīzei.

Mārketings

Noskaidrojiet, vai klienti apspriež reklāmas kampaņu, kāda ir viņu reakcija uz baneri u.c.

Filtrēšana un automatizācija

Nevēlamu vai atslēgas frāžu detektēšana mērķtiecīgai sarunu kontrolei — bez nepieciešamības noklausīties visas sarunas.

Priekšrocības

Voice-to-Text moduļa priekšrocības

Nav nepieciešams īpašs aprīkojums

Darbojas standarta datoros ar gandrīz jebkuru kameru un grafisko karti.

Pilnīga elastība

Dažādas reakcijas (tostarp lietotāja programmētas) un integrācija ar trešo pušu sistēmām.

Darbs reāllaikā

Tūlītēja plūsmu apstrāde bez aizkaves. Darbojas uz jūsu aparatūras.

Pieejams risinājums

Moduli var iegādāties papildus Standard vai Pro licencei.

Darba plūsma

Kā tas darbojas

Ķēdes paraugs ar Voice-to-Text intelektuālo moduli
1. solis

Izveidot ķēdi

Tā kā modulis darbojas ar audio plūsmu, ķēdē ir nepieciešams skaņas avots.

  • Skaņas avots: kamerā iebūvēts mikrofons vai atsevišķs USB vai IP mikrofons
  • Ķēdes piemērs: “Universal Camera” – “Voice-to-Text” – “Preview and Archive”
  • Modulis tiek licencēts papildus Xeoma Pro vai Standard licencei
Papildu AI resursu lejupielāde
2. solis

Lejupielādēt AI resursus

Noklikšķiniet uz Voice-to-Text ikonas ķēdē, lai atvērtu moduļa iestatījumus. Papildu resursu lejupielāde sāksies automātiski, pirmoreiz atverot iestatījumus. Kad ziņojums “Downloading in progress” pazūd, viss ir gatavs.

  • Papildu resursi satur mākslīgā intelekta datu masīvus un tiek lejupielādēti pēc pieprasījuma no FelenaSoft serveriem
  • Resursi tiek lejupielādēti tikai pēc nepieciešamības — tas saglabā nelielu programmas izmēru
AI modeļa un transkripcijas valodas izvēle
3. solis

Izvēlēties atpazīšanas modeli un atslēgvārdus

Dažādām valodām ir pieejami vairāki AI modeļi, kas atšķiras pēc izmēra, atpazīšanas kvalitātes un aparatūras noslodzes. Laukā “Runas atpazīšanas modelis” atlasiet transkripcijas valodu (pašu runas valodu norādīt nav nepieciešams) un, ja vajadzīgs, apakšējā laukā norādiet atslēgvārdus detektēšanai. Slēdži “Atpazītās runas rādīšana reāllaika skatījumā” un “Saglabāt atpazīto runu subtitros ierakstot/eksportējot arhīvu” ļauj uzklāt transkripciju gan tiešraides video, gan arhīvā.

  • “Atslēgvārdi detektēšanai” — modulis reaģē tikai uz jums nepieciešamajiem vārdiem vai frāzēm
  • Transkripcijas pārklājums tiešraidē un arhīvā
  • “Saglabāt datus CSV pārskatā” — transkripcija tiek saglabāta izklājlapas failā diskā
  • Pievienojiet reakciju aiz moduļa: ierakstīšanu, paziņojumu, komandas nosūtīšanu
  • Makro %VOICE% ir pieejams moduļos “HTTP pieprasījuma sūtītājs”, “E-pasta sūtīšana” un “Lietotnes palaidītājs”
API

Integrācija ar ārējām programmām

Voice-to-Text var izmantot no ārējām programmām — piemēram, VoIP sarunu transkribēšanai. Nosūtiet moduļam .mp3 failu un saņemiet rezultātu teksta formātā — pat operatoru darbstacijās, kur nav instalēta Xeoma vai kameras. Svarīgi: tiek atbalstīti tikai .mp3 faili.

Pieprasījuma piemērs, izmantojot Xeoma API (JSON):

curl -F "audio_file=@speech.mp3" "http://192.168.0.67:10090/api?login=Administrator&password=123&speech_recognition=recognition&model=qwen3-asr-1.7b&ttl=10&language=en"

Kur:

  • audio_file=@speech.mp3 — audio faila ceļš datorā
  • 192.168.0.67 — Xeoma servera IP adrese
  • 10090 — Xeoma servera ports
  • Administrator / 123 — Administratora lietotājvārds (vienmēr Administrator) un parole
  • model=… — atpazīšanas modelis (skatīt sarakstu zemāk)
  • language=en — transkripcijas valoda. Ja tā atšķiras no faktiskās runas valodas, transkripcija tiks automātiski tulkota uz norādīto valodu

Lai saglabātu rezultātu kā teksta failu, pievienojiet >savetext.txt pēc komandas, kur savetext.txt ir teksta faila nosaukums.

Atpazīšanas modeļi API:

Nosaukums Apraksts API kods
Krievu pamata 140 MB tone
Krievu paplašinātais interpunkcija, 215 MB giga
Angļu pamata 70 MB zipformer
Daudzvalodu pamata interpunkcija, 1 GB, 0,6B parametri qwen3-asr-0.6b
Daudzvalodu paplašinātais interpunkcija, 2,2 GB, 1,7B parametri qwen3-asr-1.7b

Valodu kodu saraksts

en — angļu, zh — ķīniešu, de — vācu, es — spāņu, ru — krievu, ko — korejiešu, fr — franču, ja — japāņu, pt — portugāļu, tr — turku, pl — poļu, ca — katalāņu, nl — nīderlandiešu, ar — arābu, sv — zviedru, it — itāliešu, id — indonēziešu, hi — hindi, fi — somu, vi — vjetnamiešu, he — ebreju, uk — ukraiņu, el — grieķu, ms — malajiešu, cs — čehu, ro — rumāņu, da — dāņu, hu — ungāru, ta — tamilu, no — norvēģu, th — taju, ur — urdu, hr — horvātu, bg — bulgāru, lt — lietuviešu, la — latīņu, mi — maoru, ml — malajalu, cy — velsiešu, sk — slovāku, te — telugu, fa — persiešu, lv — latviešu, bn — bengāļu, sr — serbu, az — azerbaidžāņu, sl — slovēņu, kn — kannadu, et — igauņu, mk — maķedoniešu, br — bretoņu, eu — basku, is — islandiešu, hy — armēņu, ne — nepāliešu, mn — mongoļu, bs — bosniešu, kk — kazahu, sq — albāņu, sw — svahili, gl — galisiešu, mr — maratu, pa — pandžabu, si — singāļu, km — khmeru, sn — šonu, yo — jorubu, so — somāļu, af — afrikandu, oc — oksitāņu, ka — gruzīnu, be — baltkrievu, tg — tadžiku, sd — sindhu, gu — gudžaratu, am — amharu, yi — jidiša, lo — laosiešu, uz — uzbeku, fo — fēru, ht — haitiešu kreolu, ps — puštu, tk — turkmēņu, nn — jaunnorvēģu, mt — maltiešu, sa — sanskrits, lb — luksemburgiešu, my — birmiešu, bo — tibetiešu, tl — tagalu, mg — malagasu, as — asamiešu, tt — tatāru, haw — havajiešu, ln — lingala, ha — hausu, ba — baškīru, jw — javiešu, su — sundaniešu, yue — kantoniešu.

Ātrā sākšana

Kā testēt

1
Palaist Xeoma

Lejupielādējiet un palaidiet Xeoma. Izmantojiet izmēģinājuma versiju vai aktivizējiet Xeoma Standard/Xeoma Pro licenci un papildu moduļa “Voice-to-Text” licenci.

2
Pievienot kameru

Pievienojiet kameru manuāli vai gaidiet, līdz Xeoma automātiski atradīs kameras jūsu tīklā. Lai izmantotu atsevišķu mikrofonu, pievienojiet moduli “Microphone” un izvēlieties atbilstošo skaņas avotu.

3
Pievienot moduli

Pievienojiet moduli “Voice-to-Text” ķēdei, iestatiet reakciju uz atslēgvārdiem vai nepārtrauktu runas transkripciju un, ja nepieciešams, iespējojiet transkripta pārklājumu kameras attēlā un ierakstos.

4
Konfigurēt reakcijas

Iestatiet reakciju uz notikumu — saglabāšanu CSV formātā, mobilos paziņojumus vai citu darbību.

Voice-to-Text moduļa iestatījumi Xeoma
Izmēģinājuma versijai ir vairāki ierobežojumi. Lai labāk iepazītos ar Voice-to-Text, iesakām pieprasīt bezmaksas demonstrācijas licenci. Tā nodrošina pilnu piekļuvi visām funkcijām bez ierobežojumiem un saistībām. Nepieciešama tikai e-pasta adrese. Noklikšķiniet uz pogas zemāk, lai sāktu:
Saņemt bezmaksas
demonstrācijas licenci
Video

Voice-to-Text: Runas atpazīšana Xeoma

Bezmaksas izmēģinājums

Izmēģiniet Xeoma bez maksas

Ievadiet vārdu un e-pastu, lai saņemtu bezmaksas demo licenci. Kredītkarte nav nepieciešama.

Saņemt Xeoma bezmaksas demonstrācijas licenci e-pastā

Pilna funkcionalitāte. Nosūtīta nekavējoties.

Lūdzam neizmantot e-pasta adreses, kas satur personas datus, un nesūtīt mums personas datus citos veidos. Ja tomēr to darāt, iesniedzot šo veidlapu, jūs apstiprināt savu piekrišanu personas datu apstrādei

Vai nepieciešams pielāgot moduli savām vajadzībām?

Vai nepieciešams kaut kas cits?

Modulis neatbilst jūsu prasībām? Mēs varam izstrādāt nepieciešamās funkcijas un integrēt tās Xeoma kā maksas pakalpojumu. Uzzināt vairāk.

Ir jautājumi? Nepieciešama palīdzība? Sazinieties ar mums! Labprāt palīdzēsim!

Gatavs sākt?

Testējiet Voice-to-Text ar bezmaksas demo licenci — kredītkarte un personas dati nav nepieciešami.