Analyse audio par IA

Transcription vocale

Module intelligent Xeoma de reconnaissance vocale

Icône du module Voice-to-Text Le module « écoute » le flux audio d'une caméra ou d'un microphone dédié, reconnaît la parole, réagit aux mots-clés et enregistre la transcription des conversations dans un rapport CSV ou l'incruste en texte sur la vidéo en direct ou archivée, selon vos préférences. Il transcrit également les fichiers .mp3 : enregistrements de conversations, vidéos de formation, etc.

Voice-to-Text : le module intelligent de reconnaissance vocale de Xeoma
90+ langues de transcription
CSV rapport enregistré sur disque
Flux en direct et fichiers .mp3
IA module complémentaire
Note importante : le module est en version bêta

Important : version bêta

Disponible à partir de Xeoma 24.8.12, ce module est en version bêta ; il peut donc occasionnellement omettre des mots ou présenter des boucles. Aucun équipement spécialisé n'est requis : le flux audio de n'importe quelle caméra ou microphone et un ordinateur standard doté d'un GPU suffisent.

Cas d'utilisation

Scénarios d'application

La Transcription Vocale renforce la sécurité dans les sphères privée, urbaine et commerciale, tout en optimisant les processus métier.

Assistance aux personnes âgées

Réaction instantanée aux appels à l'aide et protection contre les escroqueries.

Tout type d'entreprise

Contrôle automatisé de la qualité du service client (ex. : détection de propos injurieux).

Centre d'appels

Transcription des appels pour vérifier la conformité aux politiques internes et aux scripts de conversation.

Surveillance urbaine

Sécurité antiterroriste et reconnaissance de termes signalant une menace.

Contrôle parental

Protection des enfants contre le harcèlement et les sollicitations frauduleuses.

Police

En complément des caméras-piétons : transcription des échanges avec les suspects et détection de menaces.

Recherche et analyse

Collecte statistique en arrière-plan pour études linguistiques et analyse de fréquence des termes.

Marketing

Vérifier si les clients évoquent une campagne promotionnelle, analyser leur réaction à une bannière, etc.

Filtrage et automatisation

Détection de phrases clés ou indésirables pour un ciblage précis des conversations, sans nécessiter d'écoute exhaustive.

Avantages

Avantages du module Voice-to-Text

Aucun équipement spécial requis

Compatible avec des ordinateurs standards, la plupart des caméras et cartes graphiques.

Flexibilité totale

Réactions variées (y compris scripts personnalisés) et intégration avec des systèmes tiers.

Traitement en temps réel

Traitement instantané des flux, sans latence. Exécution sur votre propre matériel.

Solution accessible

Ce module s'acquiert en complément d'une licence Standard ou Pro.

Flux de travail

Fonctionnement

Exemple de chaîne avec le module intelligent Voice-to-Text
Étape 1

Créer une chaîne

Ce module traitant un flux audio, une source sonore doit figurer dans la chaîne.

  • Source sonore : microphone intégré à la caméra ou microphone USB/IP externe
  • Exemple de chaîne : « Caméra universelle » – « Transcription Vocale » – « Prévisualisation et Archive »
  • Licence requise en supplément d'une licence Xeoma Pro ou Standard
Téléchargement de ressources IA supplémentaires
Étape 2

Télécharger les ressources IA

Cliquez sur l'icône Transcription Vocale dans la chaîne pour ouvrir les paramètres du module. Le téléchargement des ressources complémentaires débute automatiquement lors de la première ouverture. L'installation est terminée lorsque le message « Téléchargement en cours » disparaît.

  • Les ressources complémentaires contiennent les données d'intelligence artificielle et sont téléchargées à la demande depuis les serveurs FelenaSoft
  • Les ressources ne sont téléchargées qu'en cas de besoin, limitant ainsi l'empreinte logicielle
Sélection du modèle d'IA et de la langue de transcription
Étape 3

Choisir un modèle de reconnaissance et des mots-clés

Plusieurs modèles d’IA sont disponibles pour différentes langues, variant en taille, en qualité de reconnaissance et en charge matérielle. Dans le champ « Modèle de reconnaissance vocale », sélectionnez la langue de transcription (la langue parlée n’a pas besoin d’être spécifiée) et, si nécessaire, définissez des mots-clés à détecter dans le champ ci-dessous. Les options « Afficher la parole reconnue lors du visionnage en temps réel » et « Enregistrer la parole reconnue en sous-titres lors de l’enregistrement/exportation de l’archive » permettent de superposer la transcription sur la vidéo en direct et dans l’archive.

  • « Mots-clés à détecter » — le module réagit uniquement aux mots ou expressions souhaités
  • Superposition de la transcription en prévisualisation directe et dans l'archive
  • « Enregistrer les données dans un rapport CSV » — la transcription est enregistrée dans un fichier tableur sur le disque
  • Configurez une réaction après le module : enregistrement, notification, envoi d'une commande
  • La macro %VOICE% est disponible dans les modules « Envoi de requête HTTP », « Envoi d’e-mail » et « Exécution d’application »
API

Intégration avec des programmes externes

La fonction Voice-to-Text peut être utilisée depuis des programmes externes, par exemple pour transcrire des conversations VoIP. Transmettez un fichier .mp3 au module et obtenez le résultat sous forme de texte, même sur des postes opérateurs ne disposant ni de Xeoma ni de caméras. Important : seuls les fichiers .mp3 sont pris en charge.

Exemple de requête via l'API Xeoma (JSON) :

curl -F "audio_file=@speech.mp3" "http://192.168.0.67:10090/api?login=Administrator&password=123&speech_recognition=recognition&model=qwen3-asr-1.7b&ttl=10&language=en"

Où :

  • audio_file=@speech.mp3 — le chemin vers le fichier audio sur votre ordinateur
  • 192.168.0.67 — l'adresse IP du serveur Xeoma
  • 10090 — le port du serveur Xeoma
  • Administrator / 123 — l'identifiant Administrateur (toujours Administrator) et le mot de passe
  • model=… — le modèle de reconnaissance (voir la liste ci-dessous)
  • language=en — la langue de la transcription. Si elle diffère de la langue parlée, la transcription sera automatiquement traduite dans la langue spécifiée

Pour enregistrer le résultat dans un fichier texte, ajoutez >savetext.txt après la commande, où savetext.txt est le nom du fichier texte.

Modèles de reconnaissance pour l'API :

Nom Description Code API
Russe standard 140 Mo tone
Russe avancé ponctuation, 215 Mo giga
Anglais standard 70 Mo zipformer
Multilingue standard ponctuation, 1 Go, 0,6 Md paramètres qwen3-asr-0.6b
Multilingue amélioré ponctuation, 2,2 Go, 1,7 Md paramètres qwen3-asr-1.7b
Gemma4 multilingue de base ponctuation, 2,2 Go, 1,7 Md paramètres gemma4-e2b
Gemma4 multilingue amélioré ponctuation, 7 Go, 12 Md paramètres gemma4-12b

Liste des codes de langue

en — Anglais, zh — Chinois, de — Allemand, es — Espagnol, ru — Russe, ko — Coréen, fr — Français, ja — Japonais, pt — Portugais, tr — Turc, pl — Polonais, ca — Catalan, nl — Néerlandais, ar — Arabe, sv — Suédois, it — Italien, id — Indonésien, hi — Hindi, fi — Finnois, vi — Vietnamien, he — Hébreu, uk — Ukrainien, el — Grec, ms — Malais, cs — Tchèque, ro — Roumain, da — Danois, hu — Hongrois, ta — Tamoul, no — Norvégien, th — Thaï, ur — Ourdou, hr — Croate, bg — Bulgare, lt — Lituanien, la — Latin, mi — Maori, ml — Malayalam, cy — Gallois, sk — Slovaque, te — Télougou, fa — Persan, lv — Letton, bn — Bengali, sr — Serbe, az — Azerbaïdjanais, sl — Slovène, kn — Kannada, et — Estonien, mk — Macédonien, br — Breton, eu — Basque, is — Islandais, hy — Arménien, ne — Népalais, mn — Mongol, bs — Bosniaque, kk — Kazakh, sq — Albanais, sw — Swahili, gl — Galicien, mr — Marathi, pa — Pendjabi, si — Cingalais, km — Khmer, sn — Shona, yo — Yoruba, so — Somali, af — Afrikaans, oc — Occitan, ka — Géorgien, be — Biélorusse, tg — Tadjik, sd — Sindhi, gu — Goudjrati, am — Amharique, yi — Yiddish, lo — Lao, uz — Ouzbek, fo — Féroïen, ht — Créole haïtien, ps — Pachto, tk — Turkmène, nn — Nynorsk, mt — Maltais, sa — Sanskrit, lb — Luxembourgeois, my — Birman, bo — Tibétain, tl — Tagalog, mg — Malgache, as — Assamais, tt — Tatar, haw — Hawaïen, ln — Lingala, ha — Haoussa, ba — Bachkir, jw — Javanais, su — Soundanais, yue — Cantonais.

Démarrage rapide

Comment tester

1
Lancer Xeoma

Téléchargez et lancez Xeoma. Utilisez l'édition d'essai ou activez une licence Xeoma Standard/Xeoma Pro ainsi que la licence du module complémentaire « Voice-to-Text ».

2
Ajouter une caméra

Ajoutez une caméra manuellement ou attendez que Xeoma détecte automatiquement les caméras de votre réseau. Pour un microphone externe, connectez le module « Microphone » et sélectionnez la source audio appropriée.

3
Ajouter le module

Ajoutez le module « Voice-to-Text » à la chaîne, configurez une réaction aux mots-clés ou la transcription continue de la parole et, si nécessaire, activez l'incrustation de la transcription sur l'image de la caméra et les enregistrements.

4
Configurer les réactions

Définissez une réaction à l'événement : export CSV, notifications mobiles ou toute autre action.

Paramètres du module Voice-to-Text dans Xeoma
L'édition d'essai comporte certaines limitations. Pour mieux découvrir Voice-to-Text, nous vous recommandons de demander une licence de démonstration gratuite. Elle offre un accès complet à toutes les fonctionnalités, sans restriction ni engagement. Seule une adresse e-mail est requise. Cliquez sur le bouton ci-dessous pour commencer :
Obtenir une
licence démo gratuite
Vidéo

Voice-to-Text : Reconnaissance vocale dans Xeoma

Essai gratuit

Essayez Xeoma gratuitement

Saisissez votre nom et votre e-mail pour obtenir une licence démo gratuite. Aucune carte de crédit requise.

Recevoir les licences de démo gratuites Xeoma par e-mail

Toutes les fonctionnalités. Envoi instantané.

Nous vous prions de ne pas utiliser d'adresses e-mail contenant des données personnelles, ni de nous transmettre de données personnelles par tout autre moyen. Si vous le faites néanmoins, en soumettant ce formulaire, vous confirmez votre consentement au traitement de vos données personnelles

Besoin d'adapter le module à vos besoins ?

Besoin d'autre chose ?

Le module ne correspond pas exactement à vos besoins ? Nous pouvons développer les fonctions requises et les intégrer à Xeoma dans le cadre d'un développement sur mesure. Voir les détails.

Des questions ? Besoin d'aide ? Contactez-nous ! Nous serons ravis de vous aider !

Prêt à démarrer ?

Testez la transcription vocale avec une licence de démonstration gratuite — sans carte bancaire ni données personnelles requises.