DI pagrindu veikianti garso analitika

Kalba į tekstą

Xeoma intelektualus kalbos atpažinimo modulis

Voice-to-Text modulio piktograma Modulis „klausosi“ garso srauto iš kameros arba atskiro mikrofono, atpažįsta kalbą, reaguoja į raktinius žodžius ir išsaugo pokalbių nuorašus CSV ataskaitoje arba pateikia juos kaip tekstą tiesioginiame vaizde / archyve, priklausomai nuo nustatymų. Taip pat galima transkribuoti .mp3 failus: pokalbių įrašus, mokymo vaizdo įrašus ir kt.

Balso konvertavimas į tekstą: intelektualus Xeoma kalbos atpažinimo modulis
90+ transkribavimo kalbų
CSV ataskaita išsaugoma diske
Tiesioginiai srautai ir .mp3 failai
AI papildomas modulis
Svarbi pastaba: modulis yra beta versijoje

Svarbu: beta versija

Modulis prieinamas nuo Xeoma 24.8.12 versijos ir yra beta stadijoje, todėl kai kuriais atvejais gali praleisti žodžius arba kartoti frazes. Specialios įrangos nereikia: tinka bet kurios kameros ar mikrofono garso srautas ir standartinis kompiuteris su GPU.

Panaudojimo atvejai

Taikymo scenarijai

„Kalbos vertimo į tekstą“ sprendimas didina saugumą privačioje erdvėje, miesto ir piliečių aplinkoje bei komerciniame sektoriuje, taip pat padeda optimizuoti verslo procesus.

Pagyvenusių žmonių priežiūra

Galimybė akimirksniu reaguoti į pagalbos šauksmą arba apsaugoti nuo sukčių.

Bet koks verslas

Automatizuota klientų aptarnavimo kokybės kontrolė (pvz., keiksmažodžių aptikimas).

Skambučių centras

Skambučių įrašų transkribavimas, siekiant stebėti atitiktį įmonės politikai ir pokalbių scenarijams.

Miesto stebėjimas

Antiteroristinis saugumas ir pavojų signalizuojančių žodžių atpažinimas.

Tėvų kontrolė

Pagalba apsaugant vaiką nuo patyčių ar bendravimo su sukčiais.

Policija

Be kūno kamerų – pokalbių su įtariamaisiais transkribavimas ir grasinimų aptikimas.

Tyrimai ir analizė

Foninis statistikos rinkimas kalbos tyrimams ir žodžių vartojimo dažnio analizei.

Rinkodara

Patikrinimas, ar klientai aptaria reklaminę kampaniją, kokia jų reakcija į reklaminius skydelius ir kt.

Filtravimas ir automatizavimas

Nepageidaujamų arba raktinių frazių aptikimas tikslingai pokalbių kontrolei – be poreikio klausytis jų visų.

Privalumai

„Kalbos vertimo į tekstą“ modulio privalumai

Nereikia specialios įrangos

Veikia standartiniuose kompiuteriuose su beveik bet kuria kamera ir bet kuria vaizdo plokšte.

Išskirtinis lankstumas

Įvairios reakcijos (įskaitant savarankiškai programuojamas) ir integracija su trečiųjų šalių sistemomis.

Veikimas realiuoju laiku

Tiesioginis darbas su srautais be vėlavimo. Veikia naudojant nuosavą aparatinę įrangą.

Prieinamas sprendimas

Modulį galima įsigyti papildomai prie „Standard“ arba „Pro“ licencijos.

Darbo eiga

Kaip tai veikia

Grandinės su „Balso konvertavimo į tekstą“ intelektualiuoju moduliu pavyzdys
1 žingsnis

Sukurti grandinę

Kadangi modulis dirba su garso srautu, grandinyje būtinas garso šaltinis.

  • Garso šaltinis: į kamerą integruotas mikrofonas arba atskiras USB ar IP mikrofonas
  • Pavyzdinė grandinė: „Universal Camera“ – „Kalbos vertimas į tekstą“ – „Preview and Archive“
  • Modulis licencijuojamas papildomai prie Xeoma Pro arba Standard licencijos
Papildomų AI išteklių atsisiuntimas
2 žingsnis

Atsisiųsti AI išteklius

Spustelėkite „Kalbos vertimo į tekstą“ piktogramą grandinėje, kad atidarytumėte modulio nustatymus. Papildomų išteklių atsisiuntimas prasidės automatiškai pirmą kartą atidarius nustatymus. Kai pranešimas „Atsiunčiama“ išnyks, viskas bus parengta.

  • Papildomuose ištekliuose yra dirbtinio intelekto duomenų masyvai, kurie atsisiunčiami pagal poreikį iš FelenaSoft serverių
  • Ištekliai atsisiunčiami tik tada, kai jų reikia – taip išlaikomas mažas programos dydis
AI modelio ir transkribavimo kalbos pasirinkimas
3 žingsnis

Pasirinkti atpažinimo modelį ir raktinius žodžius

Galimi keli AI modeliai skirtingoms kalboms, besiskiriantys dydžiu, atpažinimo kokybe ir apkrova aparatūrai. Laukelyje „Kalbos atpažinimo modelis“ pasirinkite transkripcijos kalbą (faktinės šnekos kalbos nurodyti nereikia) ir, jei reikia, tolesniame laukelyje nurodykite raktinius žodžius aptikimui. Jungikliai „Atpažintos kalbos rodymas realiuoju laiku“ ir „Atpažintos kalbos išsaugojimas subtitruose įrašant ar eksportuojant archyvą“ leidžia rodyti transkripciją tiek tiesioginiame vaizde, tiek archyve.

  • „Raktiniai žodžiai aptikimui“ — modulis reaguoja tik į jūsų nurodytus žodžius ar frazes
  • Transkripcijos perdanga tiesioginėje peržiūroje ir archyve
  • „Išsaugoti duomenis CSV ataskaitoje“ — transkripcija išsaugoma skaičiuoklės faile diske
  • Pridėkite reakciją po modulio: įrašymą, pranešimą ar komandos siuntimą
  • Makrokomandą %VOICE% galima naudoti moduliuose „HTTP užklausos siuntėjas“, „El. pašto siuntimas“ ir „Programos paleidėjas“
API

Integracija su išorinėmis programomis

„Voice-to-Text“ galima naudoti išorinėse programose – pavyzdžiui, VoIP pokalbių transkribavimui. Pateikite moduliui .mp3 failą ir gaukite tekstinį rezultatą net ir operatorių darbo stotyse, kuriose nėra įdiegta „Xeoma“ ar kamerų. Svarbu: palaikomi tik .mp3 failai.

Užklausos pavyzdys per Xeoma API (JSON):

curl -F "audio_file=@speech.mp3" "http://192.168.0.67:10090/api?login=Administrator&password=123&speech_recognition=recognition&model=qwen3-asr-1.7b&ttl=10&language=en"

Kur:

  • audio_file=@speech.mp3 — audio failo kelias kompiuteryje
  • 192.168.0.67 — Xeoma serverio IP adresas
  • 10090 — „Xeoma“ serverio prievadas
  • Administrator / 123 — administratoriaus prisijungimo vardas (visada Administrator) ir slaptažodis
  • model=… — atpažinimo modelis (žr. sąrašą žemiau)
  • language=en — transkripcijos kalba. Jei ji skiriasi nuo faktinės šnekos kalbos, transkripcija bus automatiškai išversta į nurodytą kalbą

Norėdami išsaugoti rezultatą kaip teksto failą, po komandos pridėkite >savetext.txt, kur savetext.txt yra teksto failo pavadinimas.

API atpažinimo modeliai:

Pavadinimas Aprašymas API kodas
Rusų k. bazinis 140 MB tone
Rusų k. patobulintas su skyryba, 215 MB giga
Anglų k. bazinis 70 MB zipformer
Daugiakalbis bazinis skyryba, 1 GB, 0,6 mlrd. parametrų qwen3-asr-0.6b
Daugiakalbė patobulinta skyryba, 2,2 GB, 1,7 mlrd. parametrų qwen3-asr-1.7b
Gemma4 daugiakalbė bazinė skyryba, 2,2 GB, 1,7 mlrd. parametrų gemma4-e2b
Gemma4 daugiakalbė patobulinta skyryba, 7 GB, 12 mlrd. parametrų gemma4-12b

Kalbų kodų sąrašas

en – anglų, zh – kinų, de – vokiečių, es – ispanų, ru – rusų, ko – korėjiečių, fr – prancūzų, ja – japonų, pt – portugalų, tr – turkų, pl – lenkų, ca – katalonų, nl – olandų, ar – arabų, sv – švedų, it – italų, id – indoneziečių, hi – hindi, fi – suomių, vi – vietnamiečių, he – hebrajų, uk – ukrainiečių, el – graikų, ms – malajų, cs – čekų, ro – rumunų, da – danų, hu – vengrų, ta – tamilų, no – norvegų, th – tajų, ur – urdų, hr – kroatų, bg – bulgarų, lt – lietuvių, la – lotynų, mi – maorių, ml – malajalių, cy – valų, sk – slovakų, te – telugų, fa – persų, lv – latvių, bn – bengalų, sr – serbų, az – azerbaidžaniečių, sl – slovėnų, kn – kanadų, et – estų, mk – makedonų, br – bretonų, eu – baskų, is – islandų, hy – armėnų, ne – nepaliečių, mn – mongolų, bs – bosnių, kk – kazachų, sq – albanų, sw – suahilių, gl – galisų, mr – maratų, pa – pandžabų, si – sinhalų, km – khmerų, sn – šonų, yo – jorubų, so – somaliečių, af – afrikanų, oc – oksitanų, ka – gruzinų, be – baltarusių, tg – tadžikų, sd – sindų, gu – gudžaratų, am – amharų, yi – jidiš, lo – laosiečių, uz – uzbekų, fo – fareriečių, ht – Haičio kreolų, ps – puštunų, tk – turkmėnų, nn – naujoji norvegų, mt – maltiečių, sa – sanskritas, lb – liuksemburgiečių, my – mianmariečių, bo – tibetiečių, tl – tagalų, mg – malagasių, as – asamiečių, tt – totorių, haw – havajiečių, ln – lingala, ha – hausų, ba – baškirų, jw – javiečių, su – sundų, yue – kantono

Greita pradžia

Kaip testuoti

1
Paleisti Xeoma

Atsisiųskite ir paleiskite Xeoma. Naudokite bandomąją versiją arba aktyvuokite Xeoma Standard/Xeoma Pro licenciją ir papildomo „Voice-to-text“ modulio licenciją.

2
Pridėti kamerą

Pridėkite kamerą rankiniu būdu arba palaukite, kol Xeoma automatiškai ras tinklo kameras. Jei naudojate atskirą mikrofoną, prijunkite „Microphone“ modulį ir pasirinkite tinkamą garso šaltinį.

3
Pridėti modulį

Pridėkite „Voice-to-Text“ modulį į grandinę, nustatykite reakciją į raktinius žodžius arba nuolatinį kalbos transkribavimą ir, jei reikia, įjunkite transkripcijos sluoksnį ant kameros vaizdo ir įrašų.

4
Nustatykite reakcijas

Nustatykite reakciją į įvykį – išsaugojimą CSV formatu, pranešimus mobiliuosiuose įrenginiuose ar bet kokią kitą.

Voice-to-Text modulio nustatymai Xeoma sistemoje
Bandomoji versija turi tam tikrų apribojimų. Norėdami geriau įvertinti Voice-to-Text galimybes, rekomenduojame užsisakyti nemokamą demonstracinę licenciją. Ji suteikia prieigą prie visų funkcijų be apribojimų ir įsipareigojimų. Tereikia el. pašto adreso. Norėdami pradėti, spustelėkite toliau esantį mygtuką:
Gauti nemokamą
demo licenciją
Video

Voice-to-Text: kalbos atpažinimas Xeoma sistemoje

Nemokamas išbandymas

Išbandykite Xeoma nemokamai

Įveskite vardą ir el. pašto adresą nemokamai demonstracinei licencijai gauti. Kredito kortelė nereikalinga.

Gauti nemokamas Xeoma demo licencijas el. paštu

Visas funkcionalumas. Siunčiama akimirksniu.

Prašome nenaudoti el. pašto adresų, kuriuose yra asmens duomenų, ir nesiųsti jų kitais būdais. Jei vis tiek tai darote, pateikdami šią formą patvirtinate savo sutikimą tvarkyti asmens duomenis

Reikia pritaikyti modulį pagal poreikius?

Reikia ko nors kito?

Modulis neatitinka jūsų poreikių? Galime sukurti reikiamas funkcijas ir integruoti jas į Xeoma kaip mokamą individualų sprendimą. Žiūrėti detales.

Turite klausimų? Reikia pagalbos? Susisiekite su mumis! Mielai padėsime!

Pasiruošę pradėti?

Išbandykite „Kalba į tekstą“ su nemokama demonstracine licencija – nereikia nei kreditinės kortelės, nei asmens duomenų.