Audio-analytics met AI

Voice-to-Text

De intelligente spraakherkenningsmodule van Xeoma

Voice-to-Text-modulepictogram De module 'luistert' naar de audiostream van een camera of aparte microfoon, herkent spraak, reageert op trefwoorden en slaat het transcript van gesprekken op in een CSV-rapport. Afhankelijk van uw voorkeuren wordt dit als tekst weergegeven in de live video of het archief. De module kan ook .mp3-bestanden transcriberen, zoals gespreksopnames en trainingsvideo's.

Voice-to-Text: Xeoma's intelligente module voor spraakherkenning
90+ talen voor transcriptie
CSV rapport op schijf opgeslagen
Live streams en .mp3-bestanden
AI extra module
Belangrijke opmerking: de module is in bètafase

Belangrijk: bètaversie

De module is beschikbaar vanaf Xeoma 24.8.12 en bevindt zich in de bètafase; hierdoor kunnen woorden soms worden overgeslagen of kunnen er lussen ontstaan. Er is geen speciale apparatuur vereist: de audiostream van elke camera of microfoon en een standaard computer met GPU volstaan.

Use cases

Toepassingsscenario's

Voice-to-Text verbetert de veiligheid in de privésfeer, de openbare ruimte en de commerciële sector, en draagt bij aan de optimalisatie van bedrijfsprocessen.

Zorg voor ouderen

Direct reageren op een hulpkreet of bescherming bieden tegen oplichters.

Elke onderneming

Geautomatiseerde controle van de klantenservicekwaliteit (bijvoorbeeld detectie van scheldwoorden).

Callcenter

Transcriptie van gespreksopnames om naleving van het bedrijfsbeleid en conversiescripts te monitoren.

Stedelijke surveillance

Antiterrorismebeveiliging en herkenning van woorden die op gevaar duiden.

Ouderlijk toezicht

Ondersteuning bij het beschermen van kinderen tegen pesten of communicatie met oplichters.

Politie

Naast bodycams: transcriptie van gesprekken met verdachten en detectie van bedreigingen.

Onderzoek en analytics

Achtergrondverzameling van statistieken voor spraakonderzoek en woordfrequenties.

Marketing

Inzicht krijgen in discussies van klanten over promotiecampagnes, hun reactie op banners, enz.

Filtering en automatisering

Detectie van ongewenste of belangrijke zinnen voor gerichte gesprekscontrole — zonder dat u alles handmatig hoeft te beluisteren.

Voordelen

Voordelen van de Voice-to-Text module

Geen speciale apparatuur vereist

Werkt op standaard computers met vrijwel elke camera en elke videokaart.

Volledig flexibel

Diverse reacties (inclusief eigen programmeerbare acties) en integratie met systemen van derden.

Real-time verwerking

Realtime verwerking van streams zonder vertraging. Draait op uw eigen hardware.

Betaalbare oplossing

De module is verkrijgbaar als aanvulling op de Standard- of Pro-licentie.

Workflow

Werking

Voorbeeld van een keten met de intelligente Voice-to-Text-module
Stap 1

Keten configureren

Omdat de module werkt met een audiostream, is een geluidsbron in de keten vereist.

  • Geluidsbron: ingebouwde cameramicrofoon of een aparte USB- of IP-microfoon
  • Voorbeeldketen: “Universele camera” – “Voice-to-Text” – “Preview en archief”
  • Voor deze module is een aanvullende licentie nodig bovenop een Xeoma Pro- of Standard-licentie
Aanvullende AI-bronnen downloaden
Stap 2

AI-resources downloaden

Klik op het Voice-to-Text-pictogram in de keten om de module-instellingen te openen. Bij het eerste bezoek aan de instellingen start het downloaden van extra resources automatisch. Zodra het bericht “Downloaden bezig” verdwijnt, is alles gereed.

  • Extra resources bevatten datasets voor kunstmatige intelligentie en worden op aanvraag gedownload van FelenaSoft-servers
  • Resources worden alleen gedownload wanneer nodig — dit houdt de programmaomvang beperkt
AI-model en transcriptietaal kiezen
Stap 3

Herkenningsmodel en trefwoorden kiezen

Er zijn diverse AI-modellen beschikbaar voor verschillende talen, die variëren in grootte, herkenningskwaliteit en hardwarebelasting. Selecteer in het veld “Spraakherkenningsmodel” de taal van het transcript (de gesproken taal zelf hoeft niet te worden opgegeven) en voer indien nodig trefwoorden voor detectie in het onderstaande veld in. Met de schakelaars “Herkende spraak weergeven tijdens livebeeld” en “Herkende spraak opslaan in ondertitels bij opname/archiefexport” wordt het transcript weergegeven over het livebeeld en in het archief.

  • “Trefwoorden voor detectie” — de module reageert uitsluitend op de door u gewenste woorden of zinnen
  • Transcript-overlay in live-voorbeeld en in het archief
  • “Gegevens opslaan in CSV-rapport” — het transcript wordt als spreadsheetbestand op de schijf opgeslagen
  • Koppel een reactie na de module: opname, melding of het verzenden van een commando
  • De macro %VOICE% is beschikbaar in de modules “HTTP-verzoek verzenden”, “E-mail verzenden” en “Applicatie starten”
API

Integratie met externe programma's

Voice-to-Text kan vanuit externe programma's worden gebruikt, bijvoorbeeld voor het transcriberen van VoIP-gesprekken. Bied de module een .mp3-bestand aan en ontvang het resultaat als tekst, zelfs op operatorwerkstations zonder Xeoma of camera's. Belangrijk: alleen .mp3-bestanden worden ondersteund.

Voorbeeld van een verzoek via de Xeoma API (JSON):

curl -F "audio_file=@speech.mp3" "http://192.168.0.67:10090/api?login=Administrator&password=123&speech_recognition=recognition&model=qwen3-asr-1.7b&ttl=10&language=en"

Waarbij:

  • audio_file=@speech.mp3 — het pad naar het audiobestand op uw computer
  • 192.168.0.67 — het IP-adres van de Xeoma-server
  • 10090 — de poort van de Xeoma-server
  • Administrator / 123 — de gebruikersnaam van de beheerder (altijd Administrator) en het wachtwoord
  • model=… — het herkenningsmodel (zie de onderstaande lijst)
  • language=en — de taal van het transcript. Als deze afwijkt van de werkelijke spraaktaal, wordt het transcript automatisch naar de opgegeven taal vertaald

Voeg >savetext.txt toe na het commando om het resultaat als tekstbestand op te slaan, waarbij savetext.txt de naam van het tekstbestand is.

Herkenningsmodellen voor de API:

Naam Beschrijving API-code
Russisch basis 140 MB tone
Russisch uitgebreid interpunctie, 215 MB giga
Engels basis 70 MB zipformer
Meertalig basis interpunctie, 1 GB, 0.6B parameters qwen3-asr-0.6b
Meertalig uitgebreid interpunctie, 2.2 GB, 1.7B parameters qwen3-asr-1.7b

Lijst van taalcodes

en — Engels, zh — Chinees, de — Duits, es — Spaans, ru — Russisch, ko — Koreaans, fr — Frans, ja — Japans, pt — Portugees, tr — Turks, pl — Pools, ca — Catalaans, nl — Nederlands, ar — Arabisch, sv — Zweeds, it — Italiaans, id — Indonesisch, hi — Hindi, fi — Fins, vi — Vietnamees, he — Hebreeuws, uk — Oekraïens, el — Grieks, ms — Maleis, cs — Tsjechisch, ro — Roemeens, da — Deens, hu — Hongaars, ta — Tamil, no — Noors, th — Thai, ur — Urdu, hr — Kroatisch, bg — Bulgaars, lt — Litouws, la — Latijn, mi — Maori, ml — Malayalam, cy — Welsh, sk — Slowaaks, te — Telugu, fa — Perzisch, lv — Lets, bn — Bengaals, sr — Servisch, az — Azerbeidzjaans, sl — Sloveens, kn — Kannada, et — Ests, mk — Macedonisch, br — Bretons, eu — Baskisch, is — IJslands, hy — Armeens, ne — Nepalees, mn — Mongools, bs — Bosnisch, kk — Kazachs, sq — Albanees, sw — Swahili, gl — Galicisch, mr — Marathi, pa — Punjabi, si — Sinhala, km — Khmer, sn — Shona, yo — Yoruba, so — Somalisch, af — Afrikaans, oc — Occitaans, ka — Georgisch, be — Wit-Russisch, tg — Tadzjieks, sd — Sindhi, gu — Gujarati, am — Amhaars, yi — Jiddisch, lo — Laotiaans, uz — Oezbeeks, fo — Faeröers, ht — Haïtiaans Creools, ps — Pasjtoe, tk — Turkmeens, nn — Nynorsk, mt — Maltees, sa — Sanskriet, lb — Luxemburgs, my — Birmaans, bo — Tibetaans, tl — Tagalog, mg — Malagassisch, as — Assamees, tt — Tataars, haw — Hawaïaans, ln — Lingala, ha — Hausa, ba — Basjkiers, jw — Javaans, su — Soendanees, yue — Kantonees.

Aan de slag

Testen

1
Start Xeoma

Download en start Xeoma. Gebruik de proefversie of activeer een Xeoma Standard/Xeoma Pro-licentie + de aanvullende modulelicentie "Voice-to-text".

2
Camera toevoegen

Voeg handmatig een camera toe of wacht tot Xeoma automatisch camera's in uw netwerk vindt. Voor een aparte microfoon koppelt u de module "Microfoon" en selecteert u de juiste geluidsbron.

3
Module toevoegen

Voeg de module "Voice-to-Text" toe aan de keten, stel een reactie in op trefwoorden of continue spraaktranscriptie, en schakel indien nodig de transcriptie-overlay op het camerabeeld en de opnames in.

4
Reacties instellen

Stel een reactie op de gebeurtenis in — opslaan als CSV, mobiele meldingen of andere acties.

Module-instellingen voor Voice-to-Text in Xeoma
De proefversie kent een aantal beperkingen. Om Voice-to-Text beter te leren kennen, raden wij u aan een gratis demolicentie aan te vragen. Deze biedt onbeperkt toegang tot alle functies, geheel vrijblijvend. Alleen een e-mailadres is vereist. Klik op de onderstaande knop om te beginnen:
Ontvang een gratis
demolicentie
Video

Voice-to-Text: Spraakherkenning in Xeoma

Gratis proefversie

Probeer Xeoma gratis

Voer uw naam en e-mailadres in voor een gratis demolicentie. Geen creditcard vereist.

Ontvang gratis Xeoma-demolicenties per e-mail

Volledige functionaliteit. Direct verzonden.

Wij verzoeken u vriendelijk geen e-mailadressen te gebruiken die persoonsgegevens bevatten en ons op geen enkele andere wijze persoonsgegevens te sturen. Indien u dit toch doet, bevestigt u door het verzenden van dit formulier uw toestemming voor de verwerking van uw persoonsgegevens

Wilt u de module laten aanpassen aan uw wensen?

Heeft u andere wensen?

Sluit de module niet volledig aan bij uw situatie? Wij kunnen de gewenste functies ontwikkelen en als betaald maatwerk aan Xeoma toevoegen. Bekijk details.

Vragen of hulp nodig? Neem contact met ons op! Wij helpen u graag verder

Klaar om te starten?

Test Voice-to-Text met een gratis demolicentie — geen creditcard of persoonsgegevens vereist.