Analiză audio cu IA

Conversie Voce-Text

Modulul inteligent Xeoma pentru recunoașterea vorbirii

Iconița modulului Voice-to-Text Modulul „ascultă” fluxul audio de la o cameră sau un microfon separat, recunoaște vorbirea, reacționează la cuvinte cheie și salvează transcrierea conversațiilor într-un raport CSV sau o suprapune ca text peste video live/arhivă, în funcție de preferințe. De asemenea, poate transcrie fișiere .mp3: înregistrări ale conversațiilor, videoclipuri de instruire etc.

Voice-to-Text: Modulul inteligent de recunoaștere vocală din Xeoma
90+ limbi pentru transcriere
CSV raport salvat pe disc
Live fluxuri și fișiere .mp3
IA modul suplimentar
Notă importantă: modulul este în fază beta

Important: versiune beta

Modulul este disponibil începând cu versiunea Xeoma 24.8.12 și se află în stadiu beta, astfel încât, în anumite cazuri, poate omite cuvinte sau poate genera bucle. Nu este necesar echipament specializat: sunt suficiente fluxul audio de la orice cameră sau microfon și un computer standard dotat cu GPU.

Cazuri de utilizare

Scenarii de aplicare

Voice-to-Text îmbunătățește securitatea în viața privată, în mediul urban și în cel comercial, contribuind totodată la optimizarea operațiunilor de business.

Îngrijirea persoanelor vârstnice

Reacție instantanee la strigătele de ajutor sau protecție împotriva escrocilor.

Orice business

Control automat al calității serviciilor pentru clienți (de exemplu, detectarea limbajului obscen).

Call center

Transcrierea înregistrărilor apelurilor pentru monitorizarea conformității cu politicile companiei și cu scenariile de conversație.

Supraveghere urbană

Securitate antiteroristă și recunoașterea cuvintelor care indică un pericol.

Control parental

Asistență în protejarea copilului împotriva bullying-ului sau a comunicării cu escroci.

Poliție

Complementar camerelor body-worn — transcrierea conversațiilor cu suspecții și detectarea amenințărilor.

Cercetare și analiză

Colectarea statisticilor în fundal pentru studii lingvistice și analiza frecvenței utilizării cuvintelor.

Marketing

Aflați dacă clienții discută despre o campanie promoțională, care este reacția lor la un banner etc.

Filtrare și automatizare

Detectarea frazelor nedorite sau a cuvintelor cheie pentru controlul direcționat al conversațiilor — fără a fi necesară ascultarea integrală a acestora.

Avantaje

Avantajele modulului Voice-to-Text

Fără echipament special

Funcționează pe computere standard, cu aproape orice cameră și orice placă video.

Flexibilitate totală

Reacții diverse (inclusiv cele programabile de utilizator) și integrare cu sisteme terțe.

Procesare în timp real

Procesare instantanee a fluxurilor, fără latență. Rulează pe hardware propriu.

Soluție accesibilă

Modulul poate fi achiziționat suplimentar față de licența Standard sau Pro.

Flux de lucru

Cum funcționează

Exemplu de flux cu modulul inteligent Voice-to-Text
Pasul 1

Construirea unui lanț

Deoarece modulul procesează un flux audio, este necesară o sursă sonoră în lanț.

  • Sursă sonoră: microfon integrat în cameră sau microfon USB/IP separat
  • Exemplu de lanț: „Universal Camera” – „Voice-to-Text” – „Preview and Archive”
  • Modulul se licențiază suplimentar unei licențe Xeoma Pro sau Standard
Descărcarea resurselor IA suplimentare
Pasul 2

Descărcarea resurselor de IA

Faceți clic pe pictograma Voice-to-Text din lanț pentru a deschide setările modulului. Descărcarea resurselor suplimentare începe automat la prima accesare a setărilor. Când mesajul „Downloading in progress” dispare, sistemul este pregătit.

  • Resursele suplimentare conțin seturi de date pentru inteligența artificială și se descarcă la cerere de pe serverele FelenaSoft
  • Resursele se descarcă doar la nevoie — astfel dimensiunea programului rămâne redusă
Alegerea modelului IA și a limbii de transcriere
Pasul 3

Alegerea modelului de recunoaștere și a cuvintelor cheie

Sunt disponibile mai multe modele de IA pentru diverse limbi, care diferă ca dimensiune, calitate a recunoașterii și consum de resurse hardware. În câmpul „Model de recunoaștere vocală”, selectați limba transcrierii (nu este necesar să specificați limba vorbită) și, dacă este cazul, definiți cuvintele-cheie pentru detecție în câmpul de mai jos. Opțiunile „Afișare text recunoscut în timpul vizualizării live” și „Salvare text recunoscut în subtitrări la înregistrare/export arhivă” permit suprapunerea transcrierii peste fluxul video live și în arhivă.

  • „Cuvinte-cheie pentru detecție” — modulul reacționează exclusiv la cuvintele sau expresiile dorite
  • Suprapunerea transcrierii în previzualizarea live și în arhivă
  • „Salvare date în raport CSV” — transcrierea este salvată într-un fișier tabelar pe disc
  • Configurați o acțiune ulterioară modulului: înregistrare, notificare, trimitere comandă
  • Macrocomanda %VOICE% este disponibilă în modulele „Trimitere cerere HTTP”, „Trimitere e-mail” și „Rulare aplicație”
API

Integrare cu programe externe

Voice-to-Text poate fi utilizat din programe externe — de exemplu, pentru transcrierea conversațiilor VoIP. Furnizați un fișier .mp3 modulului și obțineți rezultatul sub formă de text — chiar și pe stațiile de lucru ale operatorilor unde nu sunt instalate Xeoma sau camere video. Important: sunt acceptate doar fișierele .mp3.

Exemplu de solicitare prin Xeoma API (JSON):

curl -F "audio_file=@speech.mp3" "http://192.168.0.67:10090/api?login=Administrator&password=123&speech_recognition=recognition&model=qwen3-asr-1.7b&ttl=10&language=en"

Unde:

  • audio_file=@speech.mp3 — calea către fișierul audio de pe computer
  • 192.168.0.67 — adresa IP a serverului Xeoma
  • 10090 — portul serverului Xeoma
  • Administrator / 123 — numele de utilizator Administrator (întotdeauna Administrator) și parola
  • model=… — modelul de recunoaștere (consultați lista de mai jos)
  • language=en — limba transcrierii. Dacă aceasta diferă de limba vorbită efectiv, transcrierea va fi tradusă automat în limba specificată

Pentru a salva rezultatul ca fișier text, adăugați >savetext.txt după comandă, unde savetext.txt este numele fișierului text.

Modele de recunoaștere pentru API:

Nume Descriere Cod API
Rusă de bază 140 MB tone
Rusă avansată punctuație, 215 MB giga
Engleză de bază 70 MB zipformer
Multilingvă de bază punctuație, 1 GB, 0,6B parametri qwen3-asr-0.6b
Multilingvă avansată punctuație, 2,2 GB, 1,7B parametri qwen3-asr-1.7b

Lista codurilor de limbă

en — Engleză, zh — Chineză, de — Germană, es — Spaniolă, ru — Rusă, ko — Coreeană, fr — Franceză, ja — Japoneză, pt — Portugheză, tr — Turcă, pl — Poloneză, ca — Catalană, nl — Olandeză, ar — Arabă, sv — Suedeză, it — Italiană, id — Indoneziană, hi — Hindi, fi — Finlandeză, vi — Vietnameză, he — Ebraică, uk — Ucraineană, el — Greacă, ms — Malaeză, cs — Cehă, ro — Română, da — Daneză, hu — Maghiară, ta — Tamil, no — Norvegiană, th — Thai, ur — Urdu, hr — Croată, bg — Bulgară, lt — Lituaniană, la — Latină, mi — Maori, ml — Malayalam, cy — Galeză, sk — Slovacă, te — Telugu, fa — Persană, lv — Letonă, bn — Bengaleză, sr — Sârbă, az — Azerbaidjană, sl — Slovenă, kn — Kannada, et — Estonă, mk — Macedoneană, br — Bretonă, eu — Bască, is — Islandeză, hy — Armeană, ne — Nepaleză, mn — Mongolă, bs — Bosniacă, kk — Kazahă, sq — Albaneză, sw — Swahili, gl — Galiciană, mr — Marathi, pa — Punjabi, si — Sinhala, km — Khmeră, sn — Shona, yo — Yoruba, so — Somaleză, af — Afrikaans, oc — Occitană, ka — Georgiană, be — Bielorusă, tg — Tadjică, sd — Sindhi, gu — Gujarati, am — Amharică, yi — Idiș, lo — Lao, uz — Uzbecă, fo — Feroeză, ht — Creolă haitiană, ps — Paștună, tk — Turcmenă, nn — Nynorsk, mt — Malteză, sa — Sanscrită, lb — Luxemburgheză, my — Birmană, bo — Tibetană, tl — Tagalog, mg — Malgașă, as — Asameză, tt — Tătară, haw — Hawaiiană, ln — Lingala, ha — Hausa, ba — Bașkiră, jw — Javaneză, su — Sundaneză, yue — Cantoneză.

Ghid de pornire rapidă

Cum se testează

1
Lansați Xeoma

Descărcați și lansați Xeoma. Utilizați ediția Trial sau activați licența Xeoma Standard/Xeoma Pro + licența pentru modulul suplimentar „Voice-to-Text”.

2
Adăugați o cameră

Adăugați o cameră manual sau așteptați ca Xeoma să găsească automat camerele din rețeaua dumneavoastră. Pentru un microfon separat, conectați modulul „Microphone” și selectați sursa audio corespunzătoare.

3
Adăugați modulul

Adăugați modulul „Voice-to-Text” în lanț, configurați reacția la cuvinte cheie sau transcrierea continuă a vorbirii și, dacă este necesar, activați suprapunerea transcrierii pe imaginea camerei și pe înregistrări.

4
Configurați reacțiile

Configurați o reacție la eveniment — salvare în CSV, notificări mobile sau orice altă acțiune.

Setările modulului Voice-to-Text în Xeoma
Ediția Trial are anumite limitări. Pentru a testa funcționalitățile Voice-to-Text, vă recomandăm să solicitați o licență demo gratuită. Aceasta oferă acces nelimitat la toate funcțiile, fără nicio obligație. Este necesară doar o adresă de e-mail. Faceți clic pe butonul de mai jos pentru a începe:
Obțineți o
licență demo gratuită
Video

Voice-to-Text: Recunoașterea vorbirii în Xeoma

Trial gratuit

Testați Xeoma gratuit

Introduceți numele și adresa de e-mail pentru a primi o licență demo gratuită. Nu este necesar cardul bancar.

Primiți licențe demo gratuite Xeoma pe e-mail

Funcționalitate completă. Trimise instantaneu.

Vă rugăm să nu folosiți adrese de e-mail care conțin date personale și să nu ne transmiteți date personale prin alte mijloace. Dacă totuși faceți acest lucru, prin trimiterea formularului vă confirmați consimțământul pentru prelucrarea datelor personale

Aveți nevoie de adaptarea modulului la cerințele specifice?

Mai aveți nevoie de ceva?

Modulul nu corespunde exact cerințelor dumneavoastră? Putem dezvolta funcțiile necesare și le putem integra în Xeoma contra cost. Vedeți detalii.

Aveți întrebări sau nevoie de asistență? Contactați-ne! Suntem aici să vă ajutăm!

Gata să începeți?

Testați Voice-to-Text cu o licență demo gratuită — fără card bancar și fără date personale.