Conversie Voce-Text
Modulul inteligent Xeoma pentru recunoașterea vorbirii
Modulul „ascultă” fluxul audio de la o cameră sau un microfon separat, recunoaște vorbirea, reacționează la cuvinte cheie și salvează transcrierea conversațiilor într-un raport CSV sau o suprapune ca text peste video live/arhivă, în funcție de preferințe. De asemenea, poate transcrie fișiere .mp3: înregistrări ale conversațiilor, videoclipuri de instruire etc.

Important: versiune beta
Modulul este disponibil începând cu versiunea Xeoma 24.8.12 și se află în stadiu beta, astfel încât, în anumite cazuri, poate omite cuvinte sau poate genera bucle. Nu este necesar echipament specializat: sunt suficiente fluxul audio de la orice cameră sau microfon și un computer standard dotat cu GPU.
Scenarii de aplicare
Voice-to-Text îmbunătățește securitatea în viața privată, în mediul urban și în cel comercial, contribuind totodată la optimizarea operațiunilor de business.
Îngrijirea persoanelor vârstnice
Reacție instantanee la strigătele de ajutor sau protecție împotriva escrocilor.
Orice business
Control automat al calității serviciilor pentru clienți (de exemplu, detectarea limbajului obscen).
Call center
Transcrierea înregistrărilor apelurilor pentru monitorizarea conformității cu politicile companiei și cu scenariile de conversație.
Supraveghere urbană
Securitate antiteroristă și recunoașterea cuvintelor care indică un pericol.
Control parental
Asistență în protejarea copilului împotriva bullying-ului sau a comunicării cu escroci.
Poliție
Complementar camerelor body-worn — transcrierea conversațiilor cu suspecții și detectarea amenințărilor.
Cercetare și analiză
Colectarea statisticilor în fundal pentru studii lingvistice și analiza frecvenței utilizării cuvintelor.
Marketing
Aflați dacă clienții discută despre o campanie promoțională, care este reacția lor la un banner etc.
Filtrare și automatizare
Detectarea frazelor nedorite sau a cuvintelor cheie pentru controlul direcționat al conversațiilor — fără a fi necesară ascultarea integrală a acestora.
Avantajele modulului Voice-to-Text
Fără echipament special
Funcționează pe computere standard, cu aproape orice cameră și orice placă video.
Flexibilitate totală
Reacții diverse (inclusiv cele programabile de utilizator) și integrare cu sisteme terțe.
Procesare în timp real
Procesare instantanee a fluxurilor, fără latență. Rulează pe hardware propriu.
Soluție accesibilă
Modulul poate fi achiziționat suplimentar față de licența Standard sau Pro.
Cum funcționează

Construirea unui lanț
Deoarece modulul procesează un flux audio, este necesară o sursă sonoră în lanț.
- Sursă sonoră: microfon integrat în cameră sau microfon USB/IP separat
- Exemplu de lanț: „Universal Camera” – „Voice-to-Text” – „Preview and Archive”
- Modulul se licențiază suplimentar unei licențe Xeoma Pro sau Standard

Descărcarea resurselor de IA
Faceți clic pe pictograma Voice-to-Text din lanț pentru a deschide setările modulului. Descărcarea resurselor suplimentare începe automat la prima accesare a setărilor. Când mesajul „Downloading in progress” dispare, sistemul este pregătit.
- Resursele suplimentare conțin seturi de date pentru inteligența artificială și se descarcă la cerere de pe serverele FelenaSoft
- Resursele se descarcă doar la nevoie — astfel dimensiunea programului rămâne redusă

Alegerea modelului de recunoaștere și a cuvintelor cheie
Sunt disponibile mai multe modele de IA pentru diverse limbi, care diferă ca dimensiune, calitate a recunoașterii și consum de resurse hardware. În câmpul „Model de recunoaștere vocală”, selectați limba transcrierii (nu este necesar să specificați limba vorbită) și, dacă este cazul, definiți cuvintele-cheie pentru detecție în câmpul de mai jos. Opțiunile „Afișare text recunoscut în timpul vizualizării live” și „Salvare text recunoscut în subtitrări la înregistrare/export arhivă” permit suprapunerea transcrierii peste fluxul video live și în arhivă.
- „Cuvinte-cheie pentru detecție” — modulul reacționează exclusiv la cuvintele sau expresiile dorite
- Suprapunerea transcrierii în previzualizarea live și în arhivă
- „Salvare date în raport CSV” — transcrierea este salvată într-un fișier tabelar pe disc
- Configurați o acțiune ulterioară modulului: înregistrare, notificare, trimitere comandă
- Macrocomanda
%VOICE%este disponibilă în modulele „Trimitere cerere HTTP”, „Trimitere e-mail” și „Rulare aplicație”
Integrare cu programe externe
Voice-to-Text poate fi utilizat din programe externe — de exemplu, pentru transcrierea conversațiilor VoIP. Furnizați un fișier .mp3 modulului și obțineți rezultatul sub formă de text — chiar și pe stațiile de lucru ale operatorilor unde nu sunt instalate Xeoma sau camere video. Important: sunt acceptate doar fișierele .mp3.
Exemplu de solicitare prin Xeoma API (JSON):
curl -F "audio_file=@speech.mp3" "http://192.168.0.67:10090/api?login=Administrator&password=123&speech_recognition=recognition&model=qwen3-asr-1.7b&ttl=10&language=en"
Unde:
audio_file=@speech.mp3— calea către fișierul audio de pe computer192.168.0.67— adresa IP a serverului Xeoma10090— portul serverului XeomaAdministrator/123— numele de utilizator Administrator (întotdeauna Administrator) și parolamodel=…— modelul de recunoaștere (consultați lista de mai jos)language=en— limba transcrierii. Dacă aceasta diferă de limba vorbită efectiv, transcrierea va fi tradusă automat în limba specificată
Pentru a salva rezultatul ca fișier text, adăugați >savetext.txt după comandă, unde savetext.txt este numele fișierului text.
Modele de recunoaștere pentru API:
| Nume | Descriere | Cod API |
|---|---|---|
| Rusă de bază | 140 MB | tone |
| Rusă avansată | punctuație, 215 MB | giga |
| Engleză de bază | 70 MB | zipformer |
| Multilingvă de bază | punctuație, 1 GB, 0,6B parametri | qwen3-asr-0.6b |
| Multilingvă avansată | punctuație, 2,2 GB, 1,7B parametri | qwen3-asr-1.7b |
Lista codurilor de limbă
en — Engleză, zh — Chineză, de — Germană, es — Spaniolă, ru — Rusă, ko — Coreeană, fr — Franceză, ja — Japoneză, pt — Portugheză, tr — Turcă, pl — Poloneză, ca — Catalană, nl — Olandeză, ar — Arabă, sv — Suedeză, it — Italiană, id — Indoneziană, hi — Hindi, fi — Finlandeză, vi — Vietnameză, he — Ebraică, uk — Ucraineană, el — Greacă, ms — Malaeză, cs — Cehă, ro — Română, da — Daneză, hu — Maghiară, ta — Tamil, no — Norvegiană, th — Thai, ur — Urdu, hr — Croată, bg — Bulgară, lt — Lituaniană, la — Latină, mi — Maori, ml — Malayalam, cy — Galeză, sk — Slovacă, te — Telugu, fa — Persană, lv — Letonă, bn — Bengaleză, sr — Sârbă, az — Azerbaidjană, sl — Slovenă, kn — Kannada, et — Estonă, mk — Macedoneană, br — Bretonă, eu — Bască, is — Islandeză, hy — Armeană, ne — Nepaleză, mn — Mongolă, bs — Bosniacă, kk — Kazahă, sq — Albaneză, sw — Swahili, gl — Galiciană, mr — Marathi, pa — Punjabi, si — Sinhala, km — Khmeră, sn — Shona, yo — Yoruba, so — Somaleză, af — Afrikaans, oc — Occitană, ka — Georgiană, be — Bielorusă, tg — Tadjică, sd — Sindhi, gu — Gujarati, am — Amharică, yi — Idiș, lo — Lao, uz — Uzbecă, fo — Feroeză, ht — Creolă haitiană, ps — Paștună, tk — Turcmenă, nn — Nynorsk, mt — Malteză, sa — Sanscrită, lb — Luxemburgheză, my — Birmană, bo — Tibetană, tl — Tagalog, mg — Malgașă, as — Asameză, tt — Tătară, haw — Hawaiiană, ln — Lingala, ha — Hausa, ba — Bașkiră, jw — Javaneză, su — Sundaneză, yue — Cantoneză.
Cum se testează
Descărcați și lansați Xeoma. Utilizați ediția Trial sau activați licența Xeoma Standard/Xeoma Pro + licența pentru modulul suplimentar „Voice-to-Text”.
Adăugați o cameră manual sau așteptați ca Xeoma să găsească automat camerele din rețeaua dumneavoastră. Pentru un microfon separat, conectați modulul „Microphone” și selectați sursa audio corespunzătoare.
Adăugați modulul „Voice-to-Text” în lanț, configurați reacția la cuvinte cheie sau transcrierea continuă a vorbirii și, dacă este necesar, activați suprapunerea transcrierii pe imaginea camerei și pe înregistrări.
Configurați o reacție la eveniment — salvare în CSV, notificări mobile sau orice altă acțiune.
licență demo gratuită
Alte module care procesează fluxuri audio
Aceste module funcționează independent sau împreună cu Voice-to-Text.
Selectați un microfon USB sau un microfon IP dedicat ca sursă audio.
Analizează fluxurile audio și se declanșează atunci când nivelul sonor depășește limita specificată.
Recunoaște alarmele auto, plânsul unui copil, focuri de armă, țipete, spargerea sticlei.
Voice-to-Text: Recunoașterea vorbirii în Xeoma
Testați Xeoma gratuit
Introduceți numele și adresa de e-mail pentru a primi o licență demo gratuită. Nu este necesar cardul bancar.
Primiți licențe demo gratuite Xeoma pe e-mail
Funcționalitate completă. Trimise instantaneu.
Vă rugăm să nu folosiți adrese de e-mail care conțin date personale și să nu ne transmiteți date personale prin alte mijloace. Dacă totuși faceți acest lucru, prin trimiterea formularului vă confirmați consimțământul pentru prelucrarea datelor personale
Mai aveți nevoie de ceva?
Modulul nu corespunde exact cerințelor dumneavoastră? Putem dezvolta funcțiile necesare și le putem integra în Xeoma contra cost. Vedeți detalii.
Aveți întrebări sau nevoie de asistență? Contactați-ne! Suntem aici să vă ajutăm!
Citiți mai mult
Gata să începeți?
Testați Voice-to-Text cu o licență demo gratuită — fără card bancar și fără date personale.
