Transcription vocale
Module intelligent Xeoma de reconnaissance vocale
Le module « écoute » le flux audio d'une caméra ou d'un microphone dédié, reconnaît la parole, réagit aux mots-clés et enregistre la transcription des conversations dans un rapport CSV ou l'incruste en texte sur la vidéo en direct ou archivée, selon vos préférences. Il transcrit également les fichiers .mp3 : enregistrements de conversations, vidéos de formation, etc.

Important : version bêta
Disponible à partir de Xeoma 24.8.12, ce module est en version bêta ; il peut donc occasionnellement omettre des mots ou présenter des boucles. Aucun équipement spécialisé n'est requis : le flux audio de n'importe quelle caméra ou microphone et un ordinateur standard doté d'un GPU suffisent.
Scénarios d'application
La Transcription Vocale renforce la sécurité dans les sphères privée, urbaine et commerciale, tout en optimisant les processus métier.
Assistance aux personnes âgées
Réaction instantanée aux appels à l'aide et protection contre les escroqueries.
Tout type d'entreprise
Contrôle automatisé de la qualité du service client (ex. : détection de propos injurieux).
Centre d'appels
Transcription des appels pour vérifier la conformité aux politiques internes et aux scripts de conversation.
Surveillance urbaine
Sécurité antiterroriste et reconnaissance de termes signalant une menace.
Contrôle parental
Protection des enfants contre le harcèlement et les sollicitations frauduleuses.
Police
En complément des caméras-piétons : transcription des échanges avec les suspects et détection de menaces.
Recherche et analyse
Collecte statistique en arrière-plan pour études linguistiques et analyse de fréquence des termes.
Marketing
Vérifier si les clients évoquent une campagne promotionnelle, analyser leur réaction à une bannière, etc.
Filtrage et automatisation
Détection de phrases clés ou indésirables pour un ciblage précis des conversations, sans nécessiter d'écoute exhaustive.
Avantages du module Voice-to-Text
Aucun équipement spécial requis
Compatible avec des ordinateurs standards, la plupart des caméras et cartes graphiques.
Flexibilité totale
Réactions variées (y compris scripts personnalisés) et intégration avec des systèmes tiers.
Traitement en temps réel
Traitement instantané des flux, sans latence. Exécution sur votre propre matériel.
Solution accessible
Ce module s'acquiert en complément d'une licence Standard ou Pro.
Fonctionnement

Créer une chaîne
Ce module traitant un flux audio, une source sonore doit figurer dans la chaîne.
- Source sonore : microphone intégré à la caméra ou microphone USB/IP externe
- Exemple de chaîne : « Caméra universelle » – « Transcription Vocale » – « Prévisualisation et Archive »
- Licence requise en supplément d'une licence Xeoma Pro ou Standard

Télécharger les ressources IA
Cliquez sur l'icône Transcription Vocale dans la chaîne pour ouvrir les paramètres du module. Le téléchargement des ressources complémentaires débute automatiquement lors de la première ouverture. L'installation est terminée lorsque le message « Téléchargement en cours » disparaît.
- Les ressources complémentaires contiennent les données d'intelligence artificielle et sont téléchargées à la demande depuis les serveurs FelenaSoft
- Les ressources ne sont téléchargées qu'en cas de besoin, limitant ainsi l'empreinte logicielle

Choisir un modèle de reconnaissance et des mots-clés
Plusieurs modèles d’IA sont disponibles pour différentes langues, variant en taille, en qualité de reconnaissance et en charge matérielle. Dans le champ « Modèle de reconnaissance vocale », sélectionnez la langue de transcription (la langue parlée n’a pas besoin d’être spécifiée) et, si nécessaire, définissez des mots-clés à détecter dans le champ ci-dessous. Les options « Afficher la parole reconnue lors du visionnage en temps réel » et « Enregistrer la parole reconnue en sous-titres lors de l’enregistrement/exportation de l’archive » permettent de superposer la transcription sur la vidéo en direct et dans l’archive.
- « Mots-clés à détecter » — le module réagit uniquement aux mots ou expressions souhaités
- Superposition de la transcription en prévisualisation directe et dans l'archive
- « Enregistrer les données dans un rapport CSV » — la transcription est enregistrée dans un fichier tableur sur le disque
- Configurez une réaction après le module : enregistrement, notification, envoi d'une commande
- La macro
%VOICE%est disponible dans les modules « Envoi de requête HTTP », « Envoi d’e-mail » et « Exécution d’application »
Intégration avec des programmes externes
La fonction Voice-to-Text peut être utilisée depuis des programmes externes, par exemple pour transcrire des conversations VoIP. Transmettez un fichier .mp3 au module et obtenez le résultat sous forme de texte, même sur des postes opérateurs ne disposant ni de Xeoma ni de caméras. Important : seuls les fichiers .mp3 sont pris en charge.
Exemple de requête via l'API Xeoma (JSON) :
curl -F "audio_file=@speech.mp3" "http://192.168.0.67:10090/api?login=Administrator&password=123&speech_recognition=recognition&model=qwen3-asr-1.7b&ttl=10&language=en"
Où :
audio_file=@speech.mp3— le chemin vers le fichier audio sur votre ordinateur192.168.0.67— l'adresse IP du serveur Xeoma10090— le port du serveur XeomaAdministrator/123— l'identifiant Administrateur (toujours Administrator) et le mot de passemodel=…— le modèle de reconnaissance (voir la liste ci-dessous)language=en— la langue de la transcription. Si elle diffère de la langue parlée, la transcription sera automatiquement traduite dans la langue spécifiée
Pour enregistrer le résultat dans un fichier texte, ajoutez >savetext.txt après la commande, où savetext.txt est le nom du fichier texte.
Modèles de reconnaissance pour l'API :
| Nom | Description | Code API |
|---|---|---|
| Russe standard | 140 Mo | tone |
| Russe avancé | ponctuation, 215 Mo | giga |
| Anglais standard | 70 Mo | zipformer |
| Multilingue standard | ponctuation, 1 Go, 0,6 Md paramètres | qwen3-asr-0.6b |
| Multilingue amélioré | ponctuation, 2,2 Go, 1,7 Md paramètres | qwen3-asr-1.7b |
| Gemma4 multilingue de base | ponctuation, 2,2 Go, 1,7 Md paramètres | gemma4-e2b |
| Gemma4 multilingue amélioré | ponctuation, 7 Go, 12 Md paramètres | gemma4-12b |
Liste des codes de langue
en — Anglais, zh — Chinois, de — Allemand, es — Espagnol, ru — Russe, ko — Coréen, fr — Français, ja — Japonais, pt — Portugais, tr — Turc, pl — Polonais, ca — Catalan, nl — Néerlandais, ar — Arabe, sv — Suédois, it — Italien, id — Indonésien, hi — Hindi, fi — Finnois, vi — Vietnamien, he — Hébreu, uk — Ukrainien, el — Grec, ms — Malais, cs — Tchèque, ro — Roumain, da — Danois, hu — Hongrois, ta — Tamoul, no — Norvégien, th — Thaï, ur — Ourdou, hr — Croate, bg — Bulgare, lt — Lituanien, la — Latin, mi — Maori, ml — Malayalam, cy — Gallois, sk — Slovaque, te — Télougou, fa — Persan, lv — Letton, bn — Bengali, sr — Serbe, az — Azerbaïdjanais, sl — Slovène, kn — Kannada, et — Estonien, mk — Macédonien, br — Breton, eu — Basque, is — Islandais, hy — Arménien, ne — Népalais, mn — Mongol, bs — Bosniaque, kk — Kazakh, sq — Albanais, sw — Swahili, gl — Galicien, mr — Marathi, pa — Pendjabi, si — Cingalais, km — Khmer, sn — Shona, yo — Yoruba, so — Somali, af — Afrikaans, oc — Occitan, ka — Géorgien, be — Biélorusse, tg — Tadjik, sd — Sindhi, gu — Goudjrati, am — Amharique, yi — Yiddish, lo — Lao, uz — Ouzbek, fo — Féroïen, ht — Créole haïtien, ps — Pachto, tk — Turkmène, nn — Nynorsk, mt — Maltais, sa — Sanskrit, lb — Luxembourgeois, my — Birman, bo — Tibétain, tl — Tagalog, mg — Malgache, as — Assamais, tt — Tatar, haw — Hawaïen, ln — Lingala, ha — Haoussa, ba — Bachkir, jw — Javanais, su — Soundanais, yue — Cantonais.
Comment tester
Téléchargez et lancez Xeoma. Utilisez l'édition d'essai ou activez une licence Xeoma Standard/Xeoma Pro ainsi que la licence du module complémentaire « Voice-to-Text ».
Ajoutez une caméra manuellement ou attendez que Xeoma détecte automatiquement les caméras de votre réseau. Pour un microphone externe, connectez le module « Microphone » et sélectionnez la source audio appropriée.
Ajoutez le module « Voice-to-Text » à la chaîne, configurez une réaction aux mots-clés ou la transcription continue de la parole et, si nécessaire, activez l'incrustation de la transcription sur l'image de la caméra et les enregistrements.
Définissez une réaction à l'événement : export CSV, notifications mobiles ou toute autre action.
licence démo gratuite
Autres modules de traitement des flux audio
Ces modules fonctionnent indépendamment ou en combinaison avec Voice-to-Text.
Sélectionnez un microphone USB ou un microphone IP dédié comme source audio.
Analyse les flux audio et se déclenche lorsque le niveau sonore dépasse un seuil défini.
Reconnaît les alarmes de voiture, les pleurs d'enfant, les coups de feu, les cris et le bris de glace.
Voice-to-Text : Reconnaissance vocale dans Xeoma
Essayez Xeoma gratuitement
Saisissez votre nom et votre e-mail pour obtenir une licence démo gratuite. Aucune carte de crédit requise.
Recevoir les licences de démo gratuites Xeoma par e-mail
Toutes les fonctionnalités. Envoi instantané.
Nous vous prions de ne pas utiliser d'adresses e-mail contenant des données personnelles, ni de nous transmettre de données personnelles par tout autre moyen. Si vous le faites néanmoins, en soumettant ce formulaire, vous confirmez votre consentement au traitement de vos données personnelles
Besoin d'autre chose ?
Le module ne correspond pas exactement à vos besoins ? Nous pouvons développer les fonctions requises et les intégrer à Xeoma dans le cadre d'un développement sur mesure. Voir les détails.
Des questions ? Besoin d'aide ? Contactez-nous ! Nous serons ravis de vous aider !
En savoir plus
Prêt à démarrer ?
Testez la transcription vocale avec une licence de démonstration gratuite — sans carte bancaire ni données personnelles requises.

