AI-drevet lydanalyse

Tale-til-tekst

Xeomas intelligente modul til talegenkendelse

Ikon for Voice-to-Text-modulet Modulet 'lytter' til lydstrømmen fra et kamera eller en separat mikrofon, genkender tale, reagerer på nøgleord og gemmer transskriptionen af samtaler i en CSV-rapport eller overlægger den som tekst på livevideo/arkiv afhængigt af dine præferencer. Det kan også transskribere .mp3-filer: optagelser af samtaler, træningsvideoer osv.

Voice-to-Text: Xeomas intelligente modul til talegenkendelse
90+ transskriptionssprog
CSV rapport gemmes på disken
Live streams og .mp3-filer
AI ekstramodul
Vigtig note: modulet er i beta

Vigtigt: beta-version

Modulet er tilgængeligt fra Xeoma 24.8.12 og er i betastadiet, så det i visse tilfælde kan springe ord over eller indeholde gentagelser. Intet specialudstyr er påkrævet: Lydstrømmen fra ethvert kamera eller mikrofon samt en almindelig standardcomputer med GPU er tilstrækkeligt.

Anvendelsesområder

Anvendelsesscenarier

Tale-til-tekst forbedrer sikkerheden i privatlivet, byrummet og for borgerne samt i den kommercielle sektor, og bidrager til optimering af forretningsprocesser.

Pleje af ældre

Mulighed for øjeblikkelig reaktion på råb om hjælp eller beskyttelse mod svindlere.

Enhver virksomhed

Automatiseret kvalitetskontrol af kundeservice (f.eks. detektering af bandeord).

Callcenter

Transskription af opkaldsoptagelser for at overvåge overholdelse af virksomhedspolitikker og samtalescripts.

Byovervågning

Kontraterrorsikkerhed og genkendelse af ord, der indikerer fare.

Forældrekontrol

Hjælp til at beskytte børn mod mobning eller kontakt med svindlere.

Politi

Som supplement til bodycams – transskription af samtaler med mistænkte og detektering af trusler.

Forskning og analyse

Baggrundsindsamling af statistik til talestudier og analyse af ordhyppighed.

Marketing

Få indsigt i, om kunder diskuterer en kampagne, deres reaktion på et banner osv.

Filtrering og automatisering

Detektering af uønskede vendinger eller nøgleord til målrettet samtalekontrol – uden at skulle lytte til dem alle.

Fordele

Fordele ved Tale-til-tekst-modulet

Intet specialudstyr påkrævet

Kører på standardcomputere med næsten ethvert kamera og grafikkort.

Total fleksibilitet

Forskellige reaktioner (inklusive brugerdefinerede) og integration med tredjepartssystemer.

Realtidsdrift

Realtidsbehandling af streams uden forsinkelse. Kører på din egen hardware.

Prisvenlig løsning

Modulet kan købes som tillæg til Standard- eller Pro-licensen.

Workflow

Sådan fungerer det

Eksempel på en kæde med det intelligente Voice-to-Text-modul
Trin 1

Opbyg en kæde

Da modulet arbejder med en lydstrøm, kræves en lydkilde i kæden.

  • Lydkilde: en mikrofon indbygget i kameraet eller en separat USB- eller IP-mikrofon
  • Eksempel på kæde: “Universal Camera” – “Voice-to-Text” – “Preview and Archive”
  • Modulet licenseres som tillæg til en Xeoma Pro- eller Standard-licens
Download af yderligere AI-ressourcer
Trin 2

Download AI-ressourcer

Klik på ikonet for Tale-til-tekst i kæden for at åbne modulindstillingerne. Download af ekstra ressourcer starter automatisk, første gang du åbner indstillingerne. Når beskeden "Downloading in progress" (download i gang) forsvinder, er alt klar.

  • Ekstra ressourcer indeholder datasæt til kunstig intelligens og downloades efter anmodning fra FelenaSofts servere
  • Ressourcer downloades kun efter behov – hvilket holder programstørrelsen nede
Valg af AI-model og transskriptionssprog
Trin 3

Vælg en genkendelsesmodel og nøgleord

Flere AI-modeller er tilgængelige for forskellige sprog og varierer i størrelse, genkendelseskvalitet og hardwarebelastning. I feltet “Speech recognition model” vælges transskriptionssproget (selve talesproget behøver ikke angives), og om nødvendigt kan der angives søgeord til detektion i feltet herunder. Med kontakterne “Display of recognized speech during real-time viewing” og “Save recognized speech in subtitles when recording/exporting the archive” kan du vise transskriptionen som overlay på både live-video og i arkivet.

  • “Keywords for detection” — modulet reagerer kun på de specifikke ord eller vendinger, du definerer
  • Transskriptions-overlay i live-visning og arkiv
  • “Save data in CSV report” — transskriptionen gemmes som en regnearksfil på disken
  • Tilknyt en reaktion efter modulet: optagelse, notifikation eller kommandoafsending
  • Makroen %VOICE% er tilgængelig i modulerne “HTTP Request Sender”, “Email Sending” og “Application Runner”
API

Integration med eksterne programmer

Voice-to-Text kan bruges fra eksterne programmer – f.eks. til transskription af VoIP-samtaler. Send en .mp3-fil til modulet og få resultatet som tekst – selv på operatørarbejdsstationer uden Xeoma eller kameraer. Vigtigt: Kun .mp3-filer understøttes.

Eksempel på anmodning via Xeoma API (JSON):

curl -F "audio_file=@speech.mp3" "http://192.168.0.67:10090/api?login=Administrator&password=123&speech_recognition=recognition&model=qwen3-asr-1.7b&ttl=10&language=en"

Her betyder:

  • audio_file=@speech.mp3 — stien til lydfilen på din computer
  • 192.168.0.67 — IP-adressen på Xeoma-serveren
  • 10090 — Xeoma-serverporten
  • Administrator / 123 — Administrator-login (altid Administrator) og adgangskode
  • model=… — genkendelsesmodellen (se listen nedenfor)
  • language=en — transskriptionssproget. Hvis dette afviger fra det faktiske talesprog, oversættes transskriptionen automatisk til det valgte sprog

Tilføj >savetext.txt efter kommandoen for at gemme resultatet som en tekstfil, hvor savetext.txt er navnet på tekstfilen.

Genkendelsesmodeller til API'et:

Navn Beskrivelse API-kode
Russisk basic 140 MB tone
Russisk enhanced tegnsætning, 215 MB giga
Engelsk basic 70 MB zipformer
Flersproget basic tegnsætning, 1 GB, 0,6B parametre qwen3-asr-0.6b
Forbedret flersproget tegnsætning, 2,2 GB, 1,7B parametre qwen3-asr-1.7b
Gemma4 flersproget grundlæggende tegnsætning, 2,2 GB, 1,7B parametre gemma4-e2b
Gemma4 forbedret flersproget tegnsætning, 7 GB, 12B parametre gemma4-12b

Liste over sprogkoder

en — engelsk, zh — kinesisk, de — tysk, es — spansk, ru — russisk, ko — koreansk, fr — fransk, ja — japansk, pt — portugisisk, tr — tyrkisk, pl — polsk, ca — catalansk, nl — nederlandsk, ar — arabisk, sv — svensk, it — italiensk, id — indonesisk, hi — hindi, fi — finsk, vi — vietnamesisk, he — hebraisk, uk — ukrainsk, el — græsk, ms — malajisk, cs — tjekkisk, ro — rumænsk, da — dansk, hu — ungarsk, ta — tamilsk, no — norsk, th — thai, ur — urdu, hr — kroatisk, bg — bulgarsk, lt — litauisk, la — latin, mi — maori, ml — malayalam, cy — walisisk, sk — slovakisk, te — telugu, fa — persisk, lv — lettisk, bn — bengalsk, sr — serbisk, az — aserbajdsjansk, sl — slovensk, kn — kannada, et — estisk, mk — makedonsk, br — bretonsk, eu — baskisk, is — islandsk, hy — armensk, ne — nepalesisk, mn — mongolsk, bs — bosnisk, kk — kasakhisk, sq — albansk, sw — swahili, gl — galicisk, mr — marathi, pa — punjabi, si — singalesisk, km — khmer, sn — shona, yo — yoruba, so — somalisk, af — afrikaans, oc — occitansk, ka — georgisk, be — hviderussisk, tg — tadsjikisk, sd — sindhi, gu — gujarati, am — amharisk, yi — jiddisch, lo — lao, uz — usbekisk, fo — færøsk, ht — haitiansk kreol, ps — pashto, tk — turkmensk, nn — nynorsk, mt — maltesisk, sa — sanskrit, lb — luxembourgsk, my — burmesisk, bo — tibetansk, tl — tagalog, mg — malagassisk, as — assamesisk, tt — tatarisk, haw — hawaiiansk, ln — lingala, ha — hausa, ba — basjkirsk, jw — javanesisk, su — sundanesisk, yue — kantonesisk.

Kom godt i gang

Sådan tester du

1
Start Xeoma

Download og start Xeoma. Brug prøveversionen, eller aktiver en Xeoma Standard/Xeoma Pro-licens + licens til tillægsmodulet "Voice-to-text".

2
Tilføj kamera

Tilføj et kamera manuelt, eller vent på, at Xeoma automatisk finder kameraer på dit netværk. For en separat mikrofon skal du tilføje modulet "Microphone" og vælge den relevante lydkilde.

3
Tilføj modulet

Tilføj modulet "Voice-to-Text" til kæden, opsæt reaktion på nøgleord eller kontinuerlig taletransskription, og aktiver eventuelt transskriptionsoverlay på kamerabilledet og i optagelserne.

4
Opsæt reaktioner

Indstil en reaktion på hændelsen — gem til CSV, mobilnotifikationer eller andet.

Indstillinger for Voice-to-Text-modulet i Xeoma
Prøveversionen har visse begrænsninger. For at lære Voice-to-Text bedre at kende anbefaler vi, at du anmoder om en gratis demolicens. Den giver adgang til alle funktioner uden begrænsninger og helt uforpligtende. Du skal blot bruge en e-mailadresse. Klik på knappen nedenfor for at komme i gang:
Få en gratis
demolicens
Video

Voice-to-Text: Talegenkendelse i Xeoma

Gratis prøveperiode

Prøv Xeoma gratis

Indtast navn og e-mail for at få en gratis demolicens. Intet kreditkort påkrævet.

Få gratis Xeoma-demolicenser tilsendt via e-mail

Fuld funktionalitet. Sendes øjeblikkeligt.

Vi opfordrer dig til ikke at anvende e-mails, der indeholder personoplysninger, eller sende os personoplysninger på anden vis. Hvis du alligevel gør det, bekræfter du ved indsendelse af denne formular dit samtykke til behandling af dine personoplysninger

Har du brug for at få modulet tilpasset dine behov?

Har du brug for noget andet?

Opfylder modulet ikke helt dine behov? Vi kan udvikle de ønskede funktioner og integrere dem i Xeoma som betalt specialudvikling. Se detaljer.

Har du spørgsmål? Brug for hjælp? Kontakt os! Vi hjælper gerne!

Klar til at komme i gang?

Test Tale-til-tekst med en gratis demolicens – uden krav om kreditkort eller personlige oplysninger.