Kalba į tekstą
Xeoma intelektualus kalbos atpažinimo modulis
Modulis „klausosi“ garso srauto iš kameros arba atskiro mikrofono, atpažįsta kalbą, reaguoja į raktinius žodžius ir išsaugo pokalbių nuorašus CSV ataskaitoje arba pateikia juos kaip tekstą tiesioginiame vaizde / archyve, priklausomai nuo nustatymų. Taip pat galima transkribuoti .mp3 failus: pokalbių įrašus, mokymo vaizdo įrašus ir kt.

Svarbu: beta versija
Modulis prieinamas nuo Xeoma 24.8.12 versijos ir yra beta stadijoje, todėl kai kuriais atvejais gali praleisti žodžius arba kartoti frazes. Specialios įrangos nereikia: tinka bet kurios kameros ar mikrofono garso srautas ir standartinis kompiuteris su GPU.
Taikymo scenarijai
„Kalbos vertimo į tekstą“ sprendimas didina saugumą privačioje erdvėje, miesto ir piliečių aplinkoje bei komerciniame sektoriuje, taip pat padeda optimizuoti verslo procesus.
Pagyvenusių žmonių priežiūra
Galimybė akimirksniu reaguoti į pagalbos šauksmą arba apsaugoti nuo sukčių.
Bet koks verslas
Automatizuota klientų aptarnavimo kokybės kontrolė (pvz., keiksmažodžių aptikimas).
Skambučių centras
Skambučių įrašų transkribavimas, siekiant stebėti atitiktį įmonės politikai ir pokalbių scenarijams.
Miesto stebėjimas
Antiteroristinis saugumas ir pavojų signalizuojančių žodžių atpažinimas.
Tėvų kontrolė
Pagalba apsaugant vaiką nuo patyčių ar bendravimo su sukčiais.
Policija
Be kūno kamerų – pokalbių su įtariamaisiais transkribavimas ir grasinimų aptikimas.
Tyrimai ir analizė
Foninis statistikos rinkimas kalbos tyrimams ir žodžių vartojimo dažnio analizei.
Rinkodara
Patikrinimas, ar klientai aptaria reklaminę kampaniją, kokia jų reakcija į reklaminius skydelius ir kt.
Filtravimas ir automatizavimas
Nepageidaujamų arba raktinių frazių aptikimas tikslingai pokalbių kontrolei – be poreikio klausytis jų visų.
„Kalbos vertimo į tekstą“ modulio privalumai
Nereikia specialios įrangos
Veikia standartiniuose kompiuteriuose su beveik bet kuria kamera ir bet kuria vaizdo plokšte.
Išskirtinis lankstumas
Įvairios reakcijos (įskaitant savarankiškai programuojamas) ir integracija su trečiųjų šalių sistemomis.
Veikimas realiuoju laiku
Tiesioginis darbas su srautais be vėlavimo. Veikia naudojant nuosavą aparatinę įrangą.
Prieinamas sprendimas
Modulį galima įsigyti papildomai prie „Standard“ arba „Pro“ licencijos.
Kaip tai veikia

Sukurti grandinę
Kadangi modulis dirba su garso srautu, grandinyje būtinas garso šaltinis.
- Garso šaltinis: į kamerą integruotas mikrofonas arba atskiras USB ar IP mikrofonas
- Pavyzdinė grandinė: „Universal Camera“ – „Kalbos vertimas į tekstą“ – „Preview and Archive“
- Modulis licencijuojamas papildomai prie Xeoma Pro arba Standard licencijos

Atsisiųsti AI išteklius
Spustelėkite „Kalbos vertimo į tekstą“ piktogramą grandinėje, kad atidarytumėte modulio nustatymus. Papildomų išteklių atsisiuntimas prasidės automatiškai pirmą kartą atidarius nustatymus. Kai pranešimas „Atsiunčiama“ išnyks, viskas bus parengta.
- Papildomuose ištekliuose yra dirbtinio intelekto duomenų masyvai, kurie atsisiunčiami pagal poreikį iš FelenaSoft serverių
- Ištekliai atsisiunčiami tik tada, kai jų reikia – taip išlaikomas mažas programos dydis

Pasirinkti atpažinimo modelį ir raktinius žodžius
Galimi keli AI modeliai skirtingoms kalboms, besiskiriantys dydžiu, atpažinimo kokybe ir apkrova aparatūrai. Laukelyje „Kalbos atpažinimo modelis“ pasirinkite transkripcijos kalbą (faktinės šnekos kalbos nurodyti nereikia) ir, jei reikia, tolesniame laukelyje nurodykite raktinius žodžius aptikimui. Jungikliai „Atpažintos kalbos rodymas realiuoju laiku“ ir „Atpažintos kalbos išsaugojimas subtitruose įrašant ar eksportuojant archyvą“ leidžia rodyti transkripciją tiek tiesioginiame vaizde, tiek archyve.
- „Raktiniai žodžiai aptikimui“ — modulis reaguoja tik į jūsų nurodytus žodžius ar frazes
- Transkripcijos perdanga tiesioginėje peržiūroje ir archyve
- „Išsaugoti duomenis CSV ataskaitoje“ — transkripcija išsaugoma skaičiuoklės faile diske
- Pridėkite reakciją po modulio: įrašymą, pranešimą ar komandos siuntimą
- Makrokomandą
%VOICE%galima naudoti moduliuose „HTTP užklausos siuntėjas“, „El. pašto siuntimas“ ir „Programos paleidėjas“
Integracija su išorinėmis programomis
„Voice-to-Text“ galima naudoti išorinėse programose – pavyzdžiui, VoIP pokalbių transkribavimui. Pateikite moduliui .mp3 failą ir gaukite tekstinį rezultatą net ir operatorių darbo stotyse, kuriose nėra įdiegta „Xeoma“ ar kamerų. Svarbu: palaikomi tik .mp3 failai.
Užklausos pavyzdys per Xeoma API (JSON):
curl -F "audio_file=@speech.mp3" "http://192.168.0.67:10090/api?login=Administrator&password=123&speech_recognition=recognition&model=qwen3-asr-1.7b&ttl=10&language=en"
Kur:
audio_file=@speech.mp3— audio failo kelias kompiuteryje192.168.0.67— Xeoma serverio IP adresas10090— „Xeoma“ serverio prievadasAdministrator/123— administratoriaus prisijungimo vardas (visada Administrator) ir slaptažodismodel=…— atpažinimo modelis (žr. sąrašą žemiau)language=en— transkripcijos kalba. Jei ji skiriasi nuo faktinės šnekos kalbos, transkripcija bus automatiškai išversta į nurodytą kalbą
Norėdami išsaugoti rezultatą kaip teksto failą, po komandos pridėkite >savetext.txt, kur savetext.txt yra teksto failo pavadinimas.
API atpažinimo modeliai:
| Pavadinimas | Aprašymas | API kodas |
|---|---|---|
| Rusų k. bazinis | 140 MB | tone |
| Rusų k. patobulintas | su skyryba, 215 MB | giga |
| Anglų k. bazinis | 70 MB | zipformer |
| Daugiakalbis bazinis | skyryba, 1 GB, 0,6 mlrd. parametrų | qwen3-asr-0.6b |
| Daugiakalbė patobulinta | skyryba, 2,2 GB, 1,7 mlrd. parametrų | qwen3-asr-1.7b |
| Gemma4 daugiakalbė bazinė | skyryba, 2,2 GB, 1,7 mlrd. parametrų | gemma4-e2b |
| Gemma4 daugiakalbė patobulinta | skyryba, 7 GB, 12 mlrd. parametrų | gemma4-12b |
Kalbų kodų sąrašas
en – anglų, zh – kinų, de – vokiečių, es – ispanų, ru – rusų, ko – korėjiečių, fr – prancūzų, ja – japonų, pt – portugalų, tr – turkų, pl – lenkų, ca – katalonų, nl – olandų, ar – arabų, sv – švedų, it – italų, id – indoneziečių, hi – hindi, fi – suomių, vi – vietnamiečių, he – hebrajų, uk – ukrainiečių, el – graikų, ms – malajų, cs – čekų, ro – rumunų, da – danų, hu – vengrų, ta – tamilų, no – norvegų, th – tajų, ur – urdų, hr – kroatų, bg – bulgarų, lt – lietuvių, la – lotynų, mi – maorių, ml – malajalių, cy – valų, sk – slovakų, te – telugų, fa – persų, lv – latvių, bn – bengalų, sr – serbų, az – azerbaidžaniečių, sl – slovėnų, kn – kanadų, et – estų, mk – makedonų, br – bretonų, eu – baskų, is – islandų, hy – armėnų, ne – nepaliečių, mn – mongolų, bs – bosnių, kk – kazachų, sq – albanų, sw – suahilių, gl – galisų, mr – maratų, pa – pandžabų, si – sinhalų, km – khmerų, sn – šonų, yo – jorubų, so – somaliečių, af – afrikanų, oc – oksitanų, ka – gruzinų, be – baltarusių, tg – tadžikų, sd – sindų, gu – gudžaratų, am – amharų, yi – jidiš, lo – laosiečių, uz – uzbekų, fo – fareriečių, ht – Haičio kreolų, ps – puštunų, tk – turkmėnų, nn – naujoji norvegų, mt – maltiečių, sa – sanskritas, lb – liuksemburgiečių, my – mianmariečių, bo – tibetiečių, tl – tagalų, mg – malagasių, as – asamiečių, tt – totorių, haw – havajiečių, ln – lingala, ha – hausų, ba – baškirų, jw – javiečių, su – sundų, yue – kantono
Kaip testuoti
Atsisiųskite ir paleiskite Xeoma. Naudokite bandomąją versiją arba aktyvuokite Xeoma Standard/Xeoma Pro licenciją ir papildomo „Voice-to-text“ modulio licenciją.
Pridėkite kamerą rankiniu būdu arba palaukite, kol Xeoma automatiškai ras tinklo kameras. Jei naudojate atskirą mikrofoną, prijunkite „Microphone“ modulį ir pasirinkite tinkamą garso šaltinį.
Pridėkite „Voice-to-Text“ modulį į grandinę, nustatykite reakciją į raktinius žodžius arba nuolatinį kalbos transkribavimą ir, jei reikia, įjunkite transkripcijos sluoksnį ant kameros vaizdo ir įrašų.
Nustatykite reakciją į įvykį – išsaugojimą CSV formatu, pranešimus mobiliuosiuose įrenginiuose ar bet kokią kitą.
demo licenciją
Kiti garso srautus apdorojantys moduliai
Šie moduliai veikia savarankiškai arba kartu su Voice-to-Text.
Garso šaltiniu pasirinkite USB mikrofoną arba atskirą IP mikrofoną.
Analizuoja garso srautus ir aktyvuojasi, kai garso lygis viršija nustatytą ribą.
Atpažįsta automobilių signalizacijas, vaiko verkimą, šūvius, rėksmus, dūžtantį stiklą.
Voice-to-Text: kalbos atpažinimas Xeoma sistemoje
Išbandykite Xeoma nemokamai
Įveskite vardą ir el. pašto adresą nemokamai demonstracinei licencijai gauti. Kredito kortelė nereikalinga.
Gauti nemokamas Xeoma demo licencijas el. paštu
Visas funkcionalumas. Siunčiama akimirksniu.
Prašome nenaudoti el. pašto adresų, kuriuose yra asmens duomenų, ir nesiųsti jų kitais būdais. Jei vis tiek tai darote, pateikdami šią formą patvirtinate savo sutikimą tvarkyti asmens duomenis
Reikia ko nors kito?
Modulis neatitinka jūsų poreikių? Galime sukurti reikiamas funkcijas ir integruoti jas į Xeoma kaip mokamą individualų sprendimą. Žiūrėti detales.
Turite klausimų? Reikia pagalbos? Susisiekite su mumis! Mielai padėsime!
Pasiruošę pradėti?
Išbandykite „Kalba į tekstą“ su nemokama demonstracine licencija – nereikia nei kreditinės kortelės, nei asmens duomenų.

