Voice-to-Text
De intelligente spraakherkenningsmodule van Xeoma
De module 'luistert' naar de audiostream van een camera of aparte microfoon, herkent spraak, reageert op trefwoorden en slaat het transcript van gesprekken op in een CSV-rapport. Afhankelijk van uw voorkeuren wordt dit als tekst weergegeven in de live video of het archief. De module kan ook .mp3-bestanden transcriberen, zoals gespreksopnames en trainingsvideo's.

Belangrijk: bètaversie
De module is beschikbaar vanaf Xeoma 24.8.12 en bevindt zich in de bètafase; hierdoor kunnen woorden soms worden overgeslagen of kunnen er lussen ontstaan. Er is geen speciale apparatuur vereist: de audiostream van elke camera of microfoon en een standaard computer met GPU volstaan.
Toepassingsscenario's
Voice-to-Text verbetert de veiligheid in de privésfeer, de openbare ruimte en de commerciële sector, en draagt bij aan de optimalisatie van bedrijfsprocessen.
Zorg voor ouderen
Direct reageren op een hulpkreet of bescherming bieden tegen oplichters.
Elke onderneming
Geautomatiseerde controle van de klantenservicekwaliteit (bijvoorbeeld detectie van scheldwoorden).
Callcenter
Transcriptie van gespreksopnames om naleving van het bedrijfsbeleid en conversiescripts te monitoren.
Stedelijke surveillance
Antiterrorismebeveiliging en herkenning van woorden die op gevaar duiden.
Ouderlijk toezicht
Ondersteuning bij het beschermen van kinderen tegen pesten of communicatie met oplichters.
Politie
Naast bodycams: transcriptie van gesprekken met verdachten en detectie van bedreigingen.
Onderzoek en analytics
Achtergrondverzameling van statistieken voor spraakonderzoek en woordfrequenties.
Marketing
Inzicht krijgen in discussies van klanten over promotiecampagnes, hun reactie op banners, enz.
Filtering en automatisering
Detectie van ongewenste of belangrijke zinnen voor gerichte gesprekscontrole — zonder dat u alles handmatig hoeft te beluisteren.
Voordelen van de Voice-to-Text module
Geen speciale apparatuur vereist
Werkt op standaard computers met vrijwel elke camera en elke videokaart.
Volledig flexibel
Diverse reacties (inclusief eigen programmeerbare acties) en integratie met systemen van derden.
Real-time verwerking
Realtime verwerking van streams zonder vertraging. Draait op uw eigen hardware.
Betaalbare oplossing
De module is verkrijgbaar als aanvulling op de Standard- of Pro-licentie.
Werking

Keten configureren
Omdat de module werkt met een audiostream, is een geluidsbron in de keten vereist.
- Geluidsbron: ingebouwde cameramicrofoon of een aparte USB- of IP-microfoon
- Voorbeeldketen: “Universele camera” – “Voice-to-Text” – “Preview en archief”
- Voor deze module is een aanvullende licentie nodig bovenop een Xeoma Pro- of Standard-licentie

AI-resources downloaden
Klik op het Voice-to-Text-pictogram in de keten om de module-instellingen te openen. Bij het eerste bezoek aan de instellingen start het downloaden van extra resources automatisch. Zodra het bericht “Downloaden bezig” verdwijnt, is alles gereed.
- Extra resources bevatten datasets voor kunstmatige intelligentie en worden op aanvraag gedownload van FelenaSoft-servers
- Resources worden alleen gedownload wanneer nodig — dit houdt de programmaomvang beperkt

Herkenningsmodel en trefwoorden kiezen
Er zijn diverse AI-modellen beschikbaar voor verschillende talen, die variëren in grootte, herkenningskwaliteit en hardwarebelasting. Selecteer in het veld “Spraakherkenningsmodel” de taal van het transcript (de gesproken taal zelf hoeft niet te worden opgegeven) en voer indien nodig trefwoorden voor detectie in het onderstaande veld in. Met de schakelaars “Herkende spraak weergeven tijdens livebeeld” en “Herkende spraak opslaan in ondertitels bij opname/archiefexport” wordt het transcript weergegeven over het livebeeld en in het archief.
- “Trefwoorden voor detectie” — de module reageert uitsluitend op de door u gewenste woorden of zinnen
- Transcript-overlay in live-voorbeeld en in het archief
- “Gegevens opslaan in CSV-rapport” — het transcript wordt als spreadsheetbestand op de schijf opgeslagen
- Koppel een reactie na de module: opname, melding of het verzenden van een commando
- De macro
%VOICE%is beschikbaar in de modules “HTTP-verzoek verzenden”, “E-mail verzenden” en “Applicatie starten”
Integratie met externe programma's
Voice-to-Text kan vanuit externe programma's worden gebruikt, bijvoorbeeld voor het transcriberen van VoIP-gesprekken. Bied de module een .mp3-bestand aan en ontvang het resultaat als tekst, zelfs op operatorwerkstations zonder Xeoma of camera's. Belangrijk: alleen .mp3-bestanden worden ondersteund.
Voorbeeld van een verzoek via de Xeoma API (JSON):
curl -F "audio_file=@speech.mp3" "http://192.168.0.67:10090/api?login=Administrator&password=123&speech_recognition=recognition&model=qwen3-asr-1.7b&ttl=10&language=en"
Waarbij:
audio_file=@speech.mp3— het pad naar het audiobestand op uw computer192.168.0.67— het IP-adres van de Xeoma-server10090— de poort van de Xeoma-serverAdministrator/123— de gebruikersnaam van de beheerder (altijd Administrator) en het wachtwoordmodel=…— het herkenningsmodel (zie de onderstaande lijst)language=en— de taal van het transcript. Als deze afwijkt van de werkelijke spraaktaal, wordt het transcript automatisch naar de opgegeven taal vertaald
Voeg >savetext.txt toe na het commando om het resultaat als tekstbestand op te slaan, waarbij savetext.txt de naam van het tekstbestand is.
Herkenningsmodellen voor de API:
| Naam | Beschrijving | API-code |
|---|---|---|
| Russisch basis | 140 MB | tone |
| Russisch uitgebreid | interpunctie, 215 MB | giga |
| Engels basis | 70 MB | zipformer |
| Meertalig basis | interpunctie, 1 GB, 0.6B parameters | qwen3-asr-0.6b |
| Meertalig uitgebreid | interpunctie, 2.2 GB, 1.7B parameters | qwen3-asr-1.7b |
Lijst van taalcodes
en — Engels, zh — Chinees, de — Duits, es — Spaans, ru — Russisch, ko — Koreaans, fr — Frans, ja — Japans, pt — Portugees, tr — Turks, pl — Pools, ca — Catalaans, nl — Nederlands, ar — Arabisch, sv — Zweeds, it — Italiaans, id — Indonesisch, hi — Hindi, fi — Fins, vi — Vietnamees, he — Hebreeuws, uk — Oekraïens, el — Grieks, ms — Maleis, cs — Tsjechisch, ro — Roemeens, da — Deens, hu — Hongaars, ta — Tamil, no — Noors, th — Thai, ur — Urdu, hr — Kroatisch, bg — Bulgaars, lt — Litouws, la — Latijn, mi — Maori, ml — Malayalam, cy — Welsh, sk — Slowaaks, te — Telugu, fa — Perzisch, lv — Lets, bn — Bengaals, sr — Servisch, az — Azerbeidzjaans, sl — Sloveens, kn — Kannada, et — Ests, mk — Macedonisch, br — Bretons, eu — Baskisch, is — IJslands, hy — Armeens, ne — Nepalees, mn — Mongools, bs — Bosnisch, kk — Kazachs, sq — Albanees, sw — Swahili, gl — Galicisch, mr — Marathi, pa — Punjabi, si — Sinhala, km — Khmer, sn — Shona, yo — Yoruba, so — Somalisch, af — Afrikaans, oc — Occitaans, ka — Georgisch, be — Wit-Russisch, tg — Tadzjieks, sd — Sindhi, gu — Gujarati, am — Amhaars, yi — Jiddisch, lo — Laotiaans, uz — Oezbeeks, fo — Faeröers, ht — Haïtiaans Creools, ps — Pasjtoe, tk — Turkmeens, nn — Nynorsk, mt — Maltees, sa — Sanskriet, lb — Luxemburgs, my — Birmaans, bo — Tibetaans, tl — Tagalog, mg — Malagassisch, as — Assamees, tt — Tataars, haw — Hawaïaans, ln — Lingala, ha — Hausa, ba — Basjkiers, jw — Javaans, su — Soendanees, yue — Kantonees.
Testen
Download en start Xeoma. Gebruik de proefversie of activeer een Xeoma Standard/Xeoma Pro-licentie + de aanvullende modulelicentie "Voice-to-text".
Voeg handmatig een camera toe of wacht tot Xeoma automatisch camera's in uw netwerk vindt. Voor een aparte microfoon koppelt u de module "Microfoon" en selecteert u de juiste geluidsbron.
Voeg de module "Voice-to-Text" toe aan de keten, stel een reactie in op trefwoorden of continue spraaktranscriptie, en schakel indien nodig de transcriptie-overlay op het camerabeeld en de opnames in.
Stel een reactie op de gebeurtenis in — opslaan als CSV, mobiele meldingen of andere acties.
demolicentie
Andere modules voor audiostreams
Deze modules werken zelfstandig of in combinatie met Voice-to-Text.
Selecteer een USB-microfoon of een aparte IP-microfoon als geluidsbron.
Analyseert audiostreams en wordt geactiveerd wanneer het geluidsniveau een ingestelde limiet overschrijdt.
Herkent autoalarmen, huilende kinderen, schoten, geschreeuw en brekend glas.
Voice-to-Text: Spraakherkenning in Xeoma
Probeer Xeoma gratis
Voer uw naam en e-mailadres in voor een gratis demolicentie. Geen creditcard vereist.
Ontvang gratis Xeoma-demolicenties per e-mail
Volledige functionaliteit. Direct verzonden.
Wij verzoeken u vriendelijk geen e-mailadressen te gebruiken die persoonsgegevens bevatten en ons op geen enkele andere wijze persoonsgegevens te sturen. Indien u dit toch doet, bevestigt u door het verzenden van dit formulier uw toestemming voor de verwerking van uw persoonsgegevens
Heeft u andere wensen?
Sluit de module niet volledig aan bij uw situatie? Wij kunnen de gewenste functies ontwikkelen en als betaald maatwerk aan Xeoma toevoegen. Bekijk details.
Vragen of hulp nodig? Neem contact met ons op! Wij helpen u graag verder
Klaar om te starten?
Test Voice-to-Text met een gratis demolicentie — geen creditcard of persoonsgegevens vereist.
