Analisi audio basata sull'IA

Trascrizione vocale

Modulo intelligente Xeoma per il riconoscimento vocale

Icona modulo Voice-to-Text Il modulo "ascolta" il flusso audio di una telecamera o di un microfono separato, riconosce il parlato, reagisce a parole chiave e salva la trascrizione delle conversazioni in un report CSV oppure la sovrappone come testo al video live o all'archivio, in base alle preferenze. Può trascrivere anche file .mp3: registrazioni di conversazioni, video formativi, ecc.

Voice-to-Text: il modulo intelligente di Xeoma per il riconoscimento vocale
90+ lingue di trascrizione
CSV report salvato su disco
Live stream e file .mp3
IA modulo aggiuntivo
Nota importante: il modulo è in versione beta

Importante: versione beta

Il modulo è disponibile a partire da Xeoma 24.8.12 ed è in versione beta; pertanto, in alcuni casi potrebbe saltare parole o generare loop. Non è richiesta attrezzatura specializzata: sono sufficienti il flusso audio di qualsiasi telecamera o microfono e un comune PC dotato di GPU.

Casi d'uso

Scenari di applicazione

Voice-to-Text potenzia la sicurezza nella vita privata, urbana e civile, oltre che in ambito commerciale, ottimizzando le operazioni aziendali.

Assistenza agli anziani

Capacità di reagire istantaneamente a una richiesta di aiuto o di proteggerli dalle truffe.

Qualsiasi business

Monitoraggio automatizzato della qualità del servizio clienti (ad esempio, rilevamento di linguaggio offensivo).

Call center

Trascrizione delle registrazioni telefoniche per monitorare la conformità alle policy aziendali e agli script di conversazione.

Videosorveglianza urbana

Sicurezza antiterrorismo e riconoscimento di parole indicative di pericolo.

Parental control

Supporto nella protezione dei minori contro bullismo o tentativi di truffa.

Forze dell'ordine

Oltre alle body cam: trascrizione delle conversazioni con i sospettati e rilevamento delle minacce.

Ricerca e analisi

Raccolta statistica in background per studi linguistici e analisi della frequenza d'uso delle parole.

Marketing

Verifica se i clienti stanno discutendo di una campagna promozionale, la loro reazione a un banner, ecc.

Filtraggio e automazione

Rilevamento di frasi chiave o indesiderate per il controllo mirato delle conversazioni, senza doverle ascoltare tutte.

Vantaggi

Vantaggi del modulo Voice-to-Text

Nessuna attrezzatura speciale richiesta

Funziona su normali PC con quasi tutte le telecamere e schede video.

Massima flessibilità

Varie tipologie di reazione (incluse quelle programmabili dall'utente) e integrazione con sistemi di terze parti.

Elaborazione in tempo reale

Elaborazione dei flussi in tempo reale, senza latenza. Esecuzione sul proprio hardware locale.

Soluzione accessibile

Il modulo può essere acquistato in aggiunta alla licenza Standard o Pro.

Workflow

Come funziona

Esempio di catena con il modulo intelligente Voice-to-Text
Passaggio 1

Creazione della catena

Poiché il modulo elabora un flusso audio, è necessaria una sorgente sonora nella catena.

  • Sorgente sonora: microfono integrato nella telecamera oppure microfono USB o IP separato
  • Esempio di catena: “Telecamera universale” – “Voice-to-Text” – “Anteprima e archivio”
  • Il modulo richiede una licenza aggiuntiva rispetto a Xeoma Pro o Standard
Download risorse IA aggiuntive
Passaggio 2

Download risorse IA

Clicca sull'icona Voice-to-Text nella catena per aprire le impostazioni del modulo. Il download delle risorse aggiuntive si avvierà automaticamente alla prima apertura delle impostazioni. Quando il messaggio “Download in corso” scompare, il sistema è pronto.

  • Le risorse aggiuntive contengono dataset per l'intelligenza artificiale e vengono scaricate su richiesta dai server FelenaSoft
  • Le risorse vengono scaricate solo quando necessario, mantenendo ridotte le dimensioni del programma
Selezione del modello IA e della lingua di trascrizione
Passaggio 3

Scelta del modello di riconoscimento e delle parole chiave

Sono disponibili diversi modelli di IA per varie lingue, che differiscono per dimensioni, qualità del riconoscimento e carico sull'hardware. Nel campo "Modello di riconoscimento vocale", seleziona la lingua della trascrizione (non è necessario specificare la lingua del parlato) e, se necessario, inserisci le parole chiave per il rilevamento nel campo sottostante. Le opzioni "Visualizzazione del parlato riconosciuto durante la visione in tempo reale" e "Salva il parlato riconosciuto nei sottotitoli durante la registrazione/esportazione dell'archivio" consentono di sovrapporre la trascrizione al video live e nell'archivio.

  • "Parole chiave per il rilevamento" — il modulo reagisce solo alle parole o frasi desiderate
  • Sovrapposizione della trascrizione nell'anteprima live e nell'archivio
  • "Salva dati in report CSV" — la trascrizione viene salvata in un file di foglio di calcolo sul disco
  • Configura una reazione a valle del modulo: registrazione, notifica, invio di un comando
  • La macro %VOICE% è disponibile nei moduli "Invio richiesta HTTP", "Invio email" ed "Esecutore applicazioni"
API

Integrazione con programmi esterni

Voice-to-Text può essere utilizzato da programmi esterni, ad esempio per trascrivere conversazioni VoIP. Invia un file .mp3 al modulo e ottieni il risultato in formato testo, anche su postazioni operatore prive di Xeoma o telecamere. Importante: sono supportati solo i file .mp3.

Esempio di richiesta tramite Xeoma API (JSON):

curl -F "audio_file=@speech.mp3" "http://192.168.0.67:10090/api?login=Administrator&password=123&speech_recognition=recognition&model=qwen3-asr-1.7b&ttl=10&language=en"

Dove:

  • audio_file=@speech.mp3 — il percorso del file audio sul computer
  • 192.168.0.67 — l'indirizzo IP del server Xeoma
  • 10090 — la porta del server Xeoma
  • Administrator / 123 — login dell'Amministratore (sempre Administrator) e password
  • model=… — il modello di riconoscimento (consultare l'elenco seguente)
  • language=en — la lingua della trascrizione. Se differisce dalla lingua effettiva del parlato, la trascrizione verrà tradotta automaticamente nella lingua specificata

Per salvare il risultato come file di testo, aggiungere >savetext.txt dopo il comando, dove savetext.txt è il nome del file di testo.

Modelli di riconoscimento per l'API:

Nome Descrizione Codice API
Russian basic 140 MB tone
Russian enhanced punteggiatura, 215 MB giga
English basic 70 MB zipformer
Multilingual basic punteggiatura, 1 GB, 0,6 miliardi di parametri qwen3-asr-0.6b
Multilingue avanzato punteggiatura, 2,2 GB, 1,7 miliardi di parametri qwen3-asr-1.7b
Gemma4 multilingue base punteggiatura, 2,2 GB, 1,7 miliardi di parametri gemma4-e2b
Gemma4 multilingue avanzato punteggiatura, 7 GB, 12 miliardi di parametri gemma4-12b

Elenco dei codici lingua

en — Inglese, zh — Cinese, de — Tedesco, es — Spagnolo, ru — Russo, ko — Coreano, fr — Francese, ja — Giapponese, pt — Portoghese, tr — Turco, pl — Polacco, ca — Catalano, nl — Olandese, ar — Arabo, sv — Svedese, it — Italiano, id — Indonesiano, hi — Hindi, fi — Finlandese, vi — Vietnamita, he — Ebraico, uk — Ucraino, el — Greco, ms — Malese, cs — Ceco, ro — Rumeno, da — Danese, hu — Ungherese, ta — Tamil, no — Norvegese, th — Thailandese, ur — Urdu, hr — Croato, bg — Bulgaro, lt — Lituano, la — Latino, mi — Maori, ml — Malayalam, cy — Gallese, sk — Slovacco, te — Telugu, fa — Persiano, lv — Lettone, bn — Bengalese, sr — Serbo, az — Azero, sl — Sloveno, kn — Kannada, et — Estone, mk — Macedone, br — Bretone, eu — Basco, is — Islandese, hy — Armeno, ne — Nepalese, mn — Mongolo, bs — Bosniaco, kk — Kazako, sq — Albanese, sw — Swahili, gl — Galiziano, mr — Marathi, pa — Punjabi, si — Singalese, km — Khmer, sn — Shona, yo — Yoruba, so — Somalo, af — Afrikaans, oc — Occitano, ka — Georgiano, be — Bielorusso, tg — Tagico, sd — Sindhi, gu — Gujarati, am — Amarico, yi — Yiddish, lo — Lao, uz — Uzbeco, fo — Faroese, ht — Creolo haitiano, ps — Pashto, tk — Turkmeno, nn — Nynorsk, mt — Maltese, sa — Sanscrito, lb — Lussemburghese, my — Birmano, bo — Tibetano, tl — Tagalog, mg — Malgascio, as — Assamese, tt — Tataro, haw — Hawaiano, ln — Lingala, ha — Hausa, ba — Baschiro, jw — Giavanese, su — Sundanese, yue — Cantonese.

Guida rapida

Come testare

1
Avvia Xeoma

Scarica e avvia Xeoma. Utilizza la versione di prova oppure attiva una licenza Xeoma Standard/Xeoma Pro insieme alla licenza del modulo aggiuntivo "Voice-to-Text".

2
Aggiungi una telecamera

Aggiungi una telecamera manualmente o attendi il rilevamento automatico da parte di Xeoma nella rete. Per un microfono esterno, collega il modulo "Microfono" e seleziona la sorgente audio appropriata.

3
Aggiungi il modulo

Aggiungi il modulo "Voice-to-Text" alla catena, configura la reazione a parole chiave o la trascrizione continua del parlato e, se necessario, abilita la sovrapposizione della trascrizione sull'immagine della telecamera e nelle registrazioni.

4
Configura le reazioni

Imposta una reazione all'evento: salvataggio in CSV, notifiche mobili o altro.

Impostazioni del modulo Voice-to-Text in Xeoma
La versione di prova presenta alcune limitazioni. Per valutare al meglio Voice-to-Text, consigliamo di richiedere una licenza demo gratuita. Offre accesso completo a tutte le funzionalità senza limiti né obblighi. È richiesto solo un indirizzo email. Clicca sul pulsante qui sotto per iniziare:
Ottieni una
licenza demo gratuita
Video

Voice-to-Text: riconoscimento vocale in Xeoma

Prova gratuita

Prova Xeoma gratuitamente

Inserisci nome ed email per ricevere una licenza demo gratuita. Nessuna carta di credito richiesta.

Ricevi via email le licenze demo gratuite di Xeoma

Funzionalità complete. Invio istantaneo.

Ti invitiamo a non utilizzare indirizzi email contenenti dati personali e a non inviarci dati personali in alcun altro modo. Qualora lo facessi, inviando questo modulo confermi il tuo consenso al trattamento dei tuoi dati personali

Ti serve un modulo adattato alle tue esigenze?

Hai bisogno di altro?

Il modulo non soddisfa appieno le tue esigenze? Possiamo sviluppare le funzioni necessarie e integrarle in Xeoma come sviluppo personalizzato a pagamento. Dettagli.

Hai domande o ti serve supporto? Contattaci! Saremo lieti di aiutarti!

Pronti a iniziare?

Prova la Trascrizione vocale con una licenza demo gratuita: nessuna carta di credito o dato personale richiesto.