Ανάλυση ήχου με AI

Μετατροπή Φωνής σε Κείμενο

Η ευφυής ενότητα της Xeoma για αναγνώριση ομιλίας

Εικονίδιο module Voice-to-Text Η ενότητα «ακούει» τη ροή ήχου από κάμερα ή ξεχωριστό μικρόφωνο, αναγνωρίζει την ομιλία, αντιδρά σε λέξεις-κλειδιά και αποθηκεύει τη μεταγραφή των συνομιλιών σε αναφορά CSV ή την εμφανίζει ως κείμενο στο ζωντανό βίντεο/αρχείο, ανάλογα με τις προτιμήσεις σας. Μπορεί επίσης να μεταγράψει αρχεία .mp3: ηχογραφήσεις συνομιλιών, εκπαιδευτικά βίντεο κ.λπ.

Voice-to-Text: Το έξυπνο Module του Xeoma για Αναγνώριση Ομιλίας
90+ γλώσσες μεταγραφής
CSV αποθήκευση αναφοράς στον δίσκο
Ζωντανές ροές και αρχεία .mp3
AI πρόσθετη ενότητα
Σημαντική σημείωση: το module είναι σε στάδιο beta

Σημαντικό: έκδοση beta

Η ενότητα είναι διαθέσιμη από την έκδοση Xeoma 24.8.12 και βρίσκεται σε στάδιο beta, επομένως σε ορισμένες περιπτώσεις ενδέχεται να παραλείψει λέξεις ή να παρουσιάσει επαναλήψεις. Δεν απαιτείται εξειδικευμένος εξοπλισμός: αρκεί η ροή ήχου από οποιαδήποτε κάμερα ή μικρόφωνο και ένας τυπικός υπολογιστής με GPU.

Περιπτώσεις χρήσης

Σενάρια εφαρμογής

Η Μετατροπή Φωνής σε Κείμενο ενισχύει την ασφάλεια στην ιδιωτική ζωή, στο αστικό περιβάλλον και στον εμπορικό τομέα, συμβάλλοντας παράλληλα στη βελτιστοποίηση των επιχειρησιακών λειτουργιών.

Φροντίδα ηλικιωμένων

Δυνατότητα άμεσης αντίδρασης σε κραυγή βοήθειας ή προστασία από απατεώνες.

Οποιαδήποτε επιχείρηση

Αυτοματοποιημένος έλεγχος ποιότητας εξυπηρέτησης πελατών (π.χ. ανίχνευση υβριστικών εκφράσεων).

Κέντρο κλήσεων

Μεταγραφή ηχογραφήσεων κλήσεων για έλεγχο συμμόρφωσης με την πολιτική της εταιρείας και τα σενάρια συνομιλίας.

Αστική επιτήρηση

Αντιτρομοκρατική ασφάλεια και αναγνώριση λέξεων που υποδηλώνουν κίνδυνο.

Γονεϊκός έλεγχος

Υποστήριξη στην προστασία παιδιών από εκφοβισμό ή επικοινωνία με απατεώνες.

Αστυνομία

Συμπληρωματικά στις κάμερες σώματος — μεταγραφή συνομιλιών με υπόπτους και ανίχνευση απειλών.

Έρευνα και ανάλυση

Συλλογή στατιστικών στοιχείων στο παρασκήνιο για μελέτες ομιλίας και συχνότητας χρήσης λέξεων.

Marketing

Εξακρίβωση αν οι πελάτες συζητούν μια προωθητική καμπάνια, η αντίδρασή τους σε banner κ.λπ.

Φιλτράρισμα και αυτοματισμός

Ανίχνευση ανεπιθύμητων φράσεων ή λέξεων-κλειδιών για στοχευμένο έλεγχο συνομιλιών — χωρίς την ανάγκη ακρόασης όλων.

Πλεονεκτήματα

Πλεονεκτήματα της ενότητας Μετατροπή Φωνής σε Κείμενο

Δεν απαιτείται ειδικός εξοπλισμός

Λειτουργεί σε τυπικούς υπολογιστές με σχεδόν οποιαδήποτε κάμερα και κάρτα γραφικών.

Απόλυτη ευελιξία

Πολλαπλές αντιδράσεις (συμπεριλαμβανομένων προσαρμοσμένων προγραμματιζόμενων ενεργειών) και ενσωμάτωση με συστήματα τρίτων.

Λειτουργία σε πραγματικό χρόνο

Άμεση επεξεργασία ροών χωρίς καθυστέρηση. Λειτουργεί στον δικό σας υλικοεξοπλισμό.

Προσιτή λύση

Η ενότητα διατίθεται επιπλέον της άδειας Standard ή Pro.

Ροή εργασίας

Πώς λειτουργεί

Παράδειγμα αλυσίδας με το έξυπνο module Voice-to-Text
Βήμα 1

Δημιουργία αλυσίδας

Καθώς η ενότητα λειτουργεί με ροή ήχου, απαιτείται πηγή ήχου στην αλυσίδα.

  • Πηγή ήχου: ενσωματωμένο μικρόφωνο κάμερας ή ξεχωριστό μικρόφωνο USB ή IP
  • Παράδειγμα αλυσίδας: «Universal Camera» – «Μετατροπή Φωνής σε Κείμενο» – «Προεπισκόπηση και Αρχείο»
  • Η ενότητα παρέχεται με επιπλέον άδεια χρήσης, συμπληρωματικά προς την άδεια Xeoma Pro ή Standard
Λήψη πρόσθετων πόρων AI
Βήμα 2

Λήψη πόρων AI

Κάντε κλικ στο εικονίδιο Μετατροπή Φωνής σε Κείμενο στην αλυσίδα για να ανοίξουν οι ρυθμίσεις της ενότητας. Η λήψη πρόσθετων πόρων θα ξεκινήσει αυτόματα κατά το πρώτο άνοιγμα των ρυθμίσεων. Όταν εξαφανιστεί το μήνυμα «Λήψη σε εξέλιξη», όλα είναι έτοιμα.

  • Οι πρόσθετοι πόροι περιέχουν σύνολα δεδομένων για την τεχνητή νοημοσύνη και λαμβάνονται κατόπιν αιτήματος από τους διακομιστές της Felenasoft
  • Οι πόροι λαμβάνονται μόνο όταν απαιτείται — διατηρώντας έτσι μικρό το μέγεθος του προγράμματος
Επιλογή μοντέλου AI και γλώσσας μεταγραφής
Βήμα 3

Επιλογή μοντέλου αναγνώρισης και λέξεων-κλειδιών

Διατίθενται διάφορα μοντέλα AI για πολλαπλές γλώσσες, τα οποία διαφοροποιούνται ως προς το μέγεθος, την ποιότητα αναγνώρισης και την επιβάρυνση του υλικού. Στο πεδίο «Μοντέλο αναγνώρισης ομιλίας», επιλέξτε τη γλώσσα της απομαγνητοφώνησης (δεν απαιτείται ο καθορισμός της γλώσσας της ίδιας της ομιλίας) και, εφόσον χρειάζεται, ορίστε λέξεις-κλειδιά για ανίχνευση στο παρακάτω πεδίο. Οι επιλογές «Εμφάνιση αναγνωρισμένης ομιλίας κατά την προβολή σε πραγματικό χρόνο» και «Αποθήκευση αναγνωρισμένης ομιλίας σε υπότιτλους κατά την εγγραφή/εξαγωγή αρχείου» σάς δίνουν τη δυνατότητα να προβάλλετε την απομαγνητοφώνηση ως επικάλυψη στη ζωντανή ροή βίντεο και στο αρχείο καταγραφής.

  • «Λέξεις-κλειδιά για ανίχνευση» — η ενότητα ενεργοποιείται μόνο στις λέξεις ή φράσεις που σας ενδιαφέρουν
  • Επικάλυψη απομαγνητοφώνησης στην προεπισκόπηση σε πραγματικό χρόνο και στο αρχείο
  • «Αποθήκευση δεδομένων σε αναφορά CSV» — η απομαγνητοφώνηση αποθηκεύεται σε αρχείο υπολογιστικού φύλλου στον δίσκο
  • Προσθέστε μια αντίδραση μετά την ενότητα: εγγραφή, ειδοποίηση, αποστολή εντολής
  • Η μακροεντολή %VOICE% είναι διαθέσιμη στις ενότητες «Αποστολέας αιτήματος HTTP», «Αποστολή Email» και «Εκτέλεση εφαρμογής»
API

Ενοποίηση με εξωτερικά προγράμματα

Η λειτουργία Voice-to-Text μπορεί να χρησιμοποιηθεί από εξωτερικά προγράμματα — για παράδειγμα, για την απομαγνητοφώνηση συνομιλιών VoIP. Τροφοδοτήστε την ενότητα με ένα αρχείο .mp3 και λάβετε το αποτέλεσμα ως κείμενο — ακόμη και σε σταθμούς εργασίας χειριστών όπου δεν υπάρχει εγκατεστημένο το Xeoma ή κάμερες. Σημαντικό: υποστηρίζονται μόνο αρχεία .mp3.

Παράδειγμα αιτήματος μέσω του Xeoma API (JSON):

curl -F "audio_file=@speech.mp3" "http://192.168.0.67:10090/api?login=Administrator&password=123&speech_recognition=recognition&model=qwen3-asr-1.7b&ttl=10&language=en"

Όπου:

  • audio_file=@speech.mp3 — η διαδρομή προς το ηχητικό αρχείο στον υπολογιστή σας
  • 192.168.0.67 — η διεύθυνση IP του διακομιστή Xeoma
  • 10090 — η θύρα του διακομιστή Xeoma
  • Administrator / 123 — το όνομα χρήστη του Διαχειριστή (πάντα Administrator) και ο κωδικός πρόσβασης
  • model=… — το μοντέλο αναγνώρισης (βλ. τη λίστα παρακάτω)
  • language=en — η γλώσσα της απομαγνητοφώνησης. Εάν διαφέρει από την πραγματική γλώσσα ομιλίας, η απομαγνητοφώνηση θα μεταφραστεί αυτόματα στη γλώσσα που ορίσατε

Για να αποθηκεύσετε το αποτέλεσμα ως αρχείο κειμένου, προσθέστε >savetext.txt μετά την εντολή, όπου το savetext.txt είναι το όνομα του αρχείου κειμένου.

Μοντέλα αναγνώρισης για το API:

Όνομα Περιγραφή Κώδικας API
Ρωσικά βασικά 140 MB tone
Ρωσικά εξελιγμένα στίξη, 215 MB giga
Αγγλικά βασικά 70 MB zipformer
Πολυγλώσσα βασικά στίξη, 1 GB, 0,6B παράμετροι qwen3-asr-0.6b
Πολυγλωσσική βελτιωμένη έκδοση στίξη, 2,2 GB, 1,7B παράμετροι qwen3-asr-1.7b
Gemma4 πολυγλωσσική βασική έκδοση στίξη, 2,2 GB, 1,7B παράμετροι gemma4-e2b
Gemma4 πολυγλωσσική βελτιωμένη έκδοση στίξη, 7 GB, 12B παράμετροι gemma4-12b

Λίστα κωδικών γλωσσών

en — Αγγλικά, zh — Κινεζικά, de — Γερμανικά, es — Ισπανικά, ru — Ρωσικά, ko — Κορεατικά, fr — Γαλλικά, ja — Ιαπωνικά, pt — Πορτογαλικά, tr — Τουρκικά, pl — Πολωνικά, ca — Καταλανικά, nl — Ολλανδικά, ar — Αραβικά, sv — Σουηδικά, it — Ιταλικά, id — Ινδονησιακά, hi — Χίντι, fi — Φινλανδικά, vi — Βιετναμέζικα, he — Εβραϊκά, uk — Ουκρανικά, el — Ελληνικά, ms — Μαλαϊζιανά, cs — Τσεχικά, ro — Ρουμανικά, da — Δανικά, hu — Ουγγρικά, ta — Ταμίλ, no — Νορβηγικά, th — Ταϊλανδικά, ur — Ουρντού, hr — Κροατικά, bg — Βουλγαρικά, lt — Λιθουανικά, la — Λατινικά, mi — Μαορί, ml — Μαλαγιαλάμ, cy — Ουαλικά, sk — Σλοβακικά, te — Τελούγκου, fa — Περσικά, lv — Λετονικά, bn — Μπενγκάλι, sr — Σερβικά, az — Αζερμπαϊτζανικά, sl — Σλοβενικά, kn — Κανάντα, et — Εσθονικά, mk — Μακεδονικά, br — Βρετονικά, eu — Βασκικά, is — Ισλανδικά, hy — Αρμενικά, ne — Νεπαλέζικα, mn — Μογγολικά, bs — Βοσνιακά, kk — Καζακστανικά, sq — Αλβανικά, sw — Σουαχίλι, gl — Γαλικιανά, mr — Μαράθι, pa — Παντζαμπικά, si — Σινχαλεζικά, km — Χμερ, sn — Σόνα, yo — Γιορούμπα, so — Σομαλικά, af — Αφρικάανς, oc — Οξιτανικά, ka — Γεωργιανά, be — Λευκορωσικά, tg — Τατζικικά, sd — Σίντι, gu — Γκουτζαράτι, am — Αμχαρικά, yi — Γίντις, lo — Λαοτιανά, uz — Ουζμπεκικά, fo — Φαροϊκά, ht — Αϊτιανά Κρεολικά, ps — Πάστο, tk — Τουρκμενικά, nn — Νι-Νόρσκ, mt — Μαλτέζικα, sa — Σανσκριτικά, lb — Λουξεμβουργιανά, my — Μιανμαρέζικα, bo — Θιβετιανά, tl — Ταγκαλόγκ, mg — Μαλγασικά, as — Ασαμεζικά, tt — Ταταρικά, haw — Χαβανέζικα, ln — Λινγκάλα, ha — Χάουσα, ba — Μπασκιρικά, jw — Ιαβανεζικά, su — Σουνδανεζικά, yue — Καντονέζικα.

Γρήγορη έναρξη

Πώς να δοκιμάσετε

1
Εκκίνηση Xeoma

Κατεβάστε και εκκινήστε το Xeoma. Χρησιμοποιήστε την δοκιμαστική έκδοση ή ενεργοποιήστε άδεια Xeoma Standard/Xeoma Pro μαζί με άδεια για το πρόσθετο module «Voice-to-text».

2
Προσθήκη κάμερας

Προσθέστε μια κάμερα χειροκίνητα ή περιμένετε το Xeoma να εντοπίσει τις κάμερες στο δίκτυό σας αυτόματα. Για ξεχωριστό μικρόφωνο, συνδέστε το module «Microphone» και επιλέξτε την κατάλληλη πηγή ήχου.

3
Προσθήκη module

Προσθέστε το module «Voice-to-Text» στην αλυσίδα, ρυθμίστε αντίδραση σε λέξεις-κλειδιά ή συνεχή μεταγραφή ομιλίας και, αν χρειάζεται, ενεργοποιήστε την επικάλυψη του κειμένου στην εικόνα της κάμερας και στις εγγραφές.

4
Ρύθμιση αντιδράσεων

Ορίστε μια αντίδραση στο συμβάν — αποθήκευση σε CSV, ειδοποιήσεις σε κινητό ή οποιαδήποτε άλλη.

Ρυθμίσεις module Voice-to-Text στο Xeoma
Η δοκιμαστική έκδοση έχει ορισμένους περιορισμούς. Για να εξερευνήσετε καλύτερα το Voice-to-Text, σας προτείνουμε να ζητήσετε δωρεάν δοκιμαστική άδεια. Παρέχει πλήρη πρόσβαση σε όλες τις λειτουργίες χωρίς περιορισμούς και χωρίς καμία δέσμευση. Απαιτείται μόνο διεύθυνση email. Κάντε κλικ στο παρακάτω κουμπί για να ξεκινήσετε:
Λάβετε δωρεάν
δοκιμαστική άδεια
Video

Voice-to-Text: Αναγνώριση Ομιλίας στο Xeoma

Δωρεάν δοκιμή

Δοκιμάστε το Xeoma δωρεάν

Εισάγετε το όνομα και το email σας για να λάβετε δωρεάν δοκιμαστική άδεια. Δεν απαιτείται πιστωτική κάρτα.

Λήψη δωρεάν δοκιματικών αδειών Xeoma στο email σας

Πλήρης λειτουργικότητα. Άμεση αποστολή.

Σας προτρέπουμε να αποφεύγετε τη χρήση email που περιέχουν προσωπικά δεδομένα, καθώς και την αποστολή τους με οποιονδήποτε άλλο τρόπο. Εάν ωστόσο το κάνετε, υποβάλλοντας αυτή τη φόρμα, επιβεβαιώνετε τη συγκατάθεσή σας για την επεξεργασία των προσωπικών σας δεδομένων

Χρειάζεστε προσαρμογή του module στις ανάγκες σας;

Χρειάζεστε κάτι άλλο;

Το module δεν καλύπτει πλήρως τις ανάγκες σας; Μπορούμε να αναπτύξουμε τις λειτουργίες που χρειάζεστε και να τις ενσωματώσουμε στο Xeoma ως εξατομικευμένη ανάπτυξη. Δείτε λεπτομέρειες.

Έχετε ερωτήσεις; Χρειάζεστε βοήθεια; Επικοινωνήστε μαζί μας! Θα χαρούμε να σας βοηθήσουμε!

Έτοιμοι να ξεκινήσετε;

Δοκιμάστε τη Μετατροπή Φωνής σε Κείμενο με δωρεάν δοκιμαστική άδεια — χωρίς πιστωτική κάρτα και χωρίς προσωπικά δεδομένα.