Tale-til-tekst
Xeomas intelligente modul til talegenkendelse
Modulet 'lytter' til lydstrømmen fra et kamera eller en separat mikrofon, genkender tale, reagerer på nøgleord og gemmer transskriptionen af samtaler i en CSV-rapport eller overlægger den som tekst på livevideo/arkiv afhængigt af dine præferencer. Det kan også transskribere .mp3-filer: optagelser af samtaler, træningsvideoer osv.

Vigtigt: beta-version
Modulet er tilgængeligt fra Xeoma 24.8.12 og er i betastadiet, så det i visse tilfælde kan springe ord over eller indeholde gentagelser. Intet specialudstyr er påkrævet: Lydstrømmen fra ethvert kamera eller mikrofon samt en almindelig standardcomputer med GPU er tilstrækkeligt.
Anvendelsesscenarier
Tale-til-tekst forbedrer sikkerheden i privatlivet, byrummet og for borgerne samt i den kommercielle sektor, og bidrager til optimering af forretningsprocesser.
Pleje af ældre
Mulighed for øjeblikkelig reaktion på råb om hjælp eller beskyttelse mod svindlere.
Enhver virksomhed
Automatiseret kvalitetskontrol af kundeservice (f.eks. detektering af bandeord).
Callcenter
Transskription af opkaldsoptagelser for at overvåge overholdelse af virksomhedspolitikker og samtalescripts.
Byovervågning
Kontraterrorsikkerhed og genkendelse af ord, der indikerer fare.
Forældrekontrol
Hjælp til at beskytte børn mod mobning eller kontakt med svindlere.
Politi
Som supplement til bodycams – transskription af samtaler med mistænkte og detektering af trusler.
Forskning og analyse
Baggrundsindsamling af statistik til talestudier og analyse af ordhyppighed.
Marketing
Få indsigt i, om kunder diskuterer en kampagne, deres reaktion på et banner osv.
Filtrering og automatisering
Detektering af uønskede vendinger eller nøgleord til målrettet samtalekontrol – uden at skulle lytte til dem alle.
Fordele ved Tale-til-tekst-modulet
Intet specialudstyr påkrævet
Kører på standardcomputere med næsten ethvert kamera og grafikkort.
Total fleksibilitet
Forskellige reaktioner (inklusive brugerdefinerede) og integration med tredjepartssystemer.
Realtidsdrift
Realtidsbehandling af streams uden forsinkelse. Kører på din egen hardware.
Prisvenlig løsning
Modulet kan købes som tillæg til Standard- eller Pro-licensen.
Sådan fungerer det

Opbyg en kæde
Da modulet arbejder med en lydstrøm, kræves en lydkilde i kæden.
- Lydkilde: en mikrofon indbygget i kameraet eller en separat USB- eller IP-mikrofon
- Eksempel på kæde: “Universal Camera” – “Voice-to-Text” – “Preview and Archive”
- Modulet licenseres som tillæg til en Xeoma Pro- eller Standard-licens

Download AI-ressourcer
Klik på ikonet for Tale-til-tekst i kæden for at åbne modulindstillingerne. Download af ekstra ressourcer starter automatisk, første gang du åbner indstillingerne. Når beskeden "Downloading in progress" (download i gang) forsvinder, er alt klar.
- Ekstra ressourcer indeholder datasæt til kunstig intelligens og downloades efter anmodning fra FelenaSofts servere
- Ressourcer downloades kun efter behov – hvilket holder programstørrelsen nede

Vælg en genkendelsesmodel og nøgleord
Flere AI-modeller er tilgængelige for forskellige sprog og varierer i størrelse, genkendelseskvalitet og hardwarebelastning. I feltet “Speech recognition model” vælges transskriptionssproget (selve talesproget behøver ikke angives), og om nødvendigt kan der angives søgeord til detektion i feltet herunder. Med kontakterne “Display of recognized speech during real-time viewing” og “Save recognized speech in subtitles when recording/exporting the archive” kan du vise transskriptionen som overlay på både live-video og i arkivet.
- “Keywords for detection” — modulet reagerer kun på de specifikke ord eller vendinger, du definerer
- Transskriptions-overlay i live-visning og arkiv
- “Save data in CSV report” — transskriptionen gemmes som en regnearksfil på disken
- Tilknyt en reaktion efter modulet: optagelse, notifikation eller kommandoafsending
- Makroen
%VOICE%er tilgængelig i modulerne “HTTP Request Sender”, “Email Sending” og “Application Runner”
Integration med eksterne programmer
Voice-to-Text kan bruges fra eksterne programmer – f.eks. til transskription af VoIP-samtaler. Send en .mp3-fil til modulet og få resultatet som tekst – selv på operatørarbejdsstationer uden Xeoma eller kameraer. Vigtigt: Kun .mp3-filer understøttes.
Eksempel på anmodning via Xeoma API (JSON):
curl -F "audio_file=@speech.mp3" "http://192.168.0.67:10090/api?login=Administrator&password=123&speech_recognition=recognition&model=qwen3-asr-1.7b&ttl=10&language=en"
Her betyder:
audio_file=@speech.mp3— stien til lydfilen på din computer192.168.0.67— IP-adressen på Xeoma-serveren10090— Xeoma-serverportenAdministrator/123— Administrator-login (altid Administrator) og adgangskodemodel=…— genkendelsesmodellen (se listen nedenfor)language=en— transskriptionssproget. Hvis dette afviger fra det faktiske talesprog, oversættes transskriptionen automatisk til det valgte sprog
Tilføj >savetext.txt efter kommandoen for at gemme resultatet som en tekstfil, hvor savetext.txt er navnet på tekstfilen.
Genkendelsesmodeller til API'et:
| Navn | Beskrivelse | API-kode |
|---|---|---|
| Russisk basic | 140 MB | tone |
| Russisk enhanced | tegnsætning, 215 MB | giga |
| Engelsk basic | 70 MB | zipformer |
| Flersproget basic | tegnsætning, 1 GB, 0,6B parametre | qwen3-asr-0.6b |
| Forbedret flersproget | tegnsætning, 2,2 GB, 1,7B parametre | qwen3-asr-1.7b |
| Gemma4 flersproget grundlæggende | tegnsætning, 2,2 GB, 1,7B parametre | gemma4-e2b |
| Gemma4 forbedret flersproget | tegnsætning, 7 GB, 12B parametre | gemma4-12b |
Liste over sprogkoder
en — engelsk, zh — kinesisk, de — tysk, es — spansk, ru — russisk, ko — koreansk, fr — fransk, ja — japansk, pt — portugisisk, tr — tyrkisk, pl — polsk, ca — catalansk, nl — nederlandsk, ar — arabisk, sv — svensk, it — italiensk, id — indonesisk, hi — hindi, fi — finsk, vi — vietnamesisk, he — hebraisk, uk — ukrainsk, el — græsk, ms — malajisk, cs — tjekkisk, ro — rumænsk, da — dansk, hu — ungarsk, ta — tamilsk, no — norsk, th — thai, ur — urdu, hr — kroatisk, bg — bulgarsk, lt — litauisk, la — latin, mi — maori, ml — malayalam, cy — walisisk, sk — slovakisk, te — telugu, fa — persisk, lv — lettisk, bn — bengalsk, sr — serbisk, az — aserbajdsjansk, sl — slovensk, kn — kannada, et — estisk, mk — makedonsk, br — bretonsk, eu — baskisk, is — islandsk, hy — armensk, ne — nepalesisk, mn — mongolsk, bs — bosnisk, kk — kasakhisk, sq — albansk, sw — swahili, gl — galicisk, mr — marathi, pa — punjabi, si — singalesisk, km — khmer, sn — shona, yo — yoruba, so — somalisk, af — afrikaans, oc — occitansk, ka — georgisk, be — hviderussisk, tg — tadsjikisk, sd — sindhi, gu — gujarati, am — amharisk, yi — jiddisch, lo — lao, uz — usbekisk, fo — færøsk, ht — haitiansk kreol, ps — pashto, tk — turkmensk, nn — nynorsk, mt — maltesisk, sa — sanskrit, lb — luxembourgsk, my — burmesisk, bo — tibetansk, tl — tagalog, mg — malagassisk, as — assamesisk, tt — tatarisk, haw — hawaiiansk, ln — lingala, ha — hausa, ba — basjkirsk, jw — javanesisk, su — sundanesisk, yue — kantonesisk.
Sådan tester du
Download og start Xeoma. Brug prøveversionen, eller aktiver en Xeoma Standard/Xeoma Pro-licens + licens til tillægsmodulet "Voice-to-text".
Tilføj et kamera manuelt, eller vent på, at Xeoma automatisk finder kameraer på dit netværk. For en separat mikrofon skal du tilføje modulet "Microphone" og vælge den relevante lydkilde.
Tilføj modulet "Voice-to-Text" til kæden, opsæt reaktion på nøgleord eller kontinuerlig taletransskription, og aktiver eventuelt transskriptionsoverlay på kamerabilledet og i optagelserne.
Indstil en reaktion på hændelsen — gem til CSV, mobilnotifikationer eller andet.
demolicens
Andre moduler til behandling af lydstrømme
Disse moduler fungerer selvstændigt eller sammen med Voice-to-Text.
Vælg en USB-mikrofon eller en separat IP-mikrofon som lydkilde.
Analyserer lydstrømme og udløses, når lydniveauet overstiger en angivet grænse.
Genkender bilalarmer, grædende børn, skud, skrig og knust glas.
Voice-to-Text: Talegenkendelse i Xeoma
Prøv Xeoma gratis
Indtast navn og e-mail for at få en gratis demolicens. Intet kreditkort påkrævet.
Få gratis Xeoma-demolicenser tilsendt via e-mail
Fuld funktionalitet. Sendes øjeblikkeligt.
Vi opfordrer dig til ikke at anvende e-mails, der indeholder personoplysninger, eller sende os personoplysninger på anden vis. Hvis du alligevel gør det, bekræfter du ved indsendelse af denne formular dit samtykke til behandling af dine personoplysninger
Har du brug for noget andet?
Opfylder modulet ikke helt dine behov? Vi kan udvikle de ønskede funktioner og integrere dem i Xeoma som betalt specialudvikling. Se detaljer.
Har du spørgsmål? Brug for hjælp? Kontakt os! Vi hjælper gerne!
Klar til at komme i gang?
Test Tale-til-tekst med en gratis demolicens – uden krav om kreditkort eller personlige oplysninger.

