Sprache-zu-Text
Intelligentes Xeoma-Modul zur Spracherkennung
Das Modul „hört“ den Audiostream einer Kamera oder eines separaten Mikrofons, erkennt Sprache, reagiert auf Schlüsselwörter und speichert das Transkript der Gespräche in einem CSV-Bericht oder blendet es je nach Ihren Einstellungen als Text im Live-Video bzw. Archiv ein. Zudem können .mp3-Dateien transkribiert werden: Gesprächsaufzeichnungen, Schulungsvideos usw.

Wichtig: Beta-Version
Das Modul ist ab Xeoma 24.8.12 verfügbar und befindet sich noch im Beta-Stadium; vereinzelt können Wörter ausgelassen werden oder Wiederholungen auftreten. Spezielle Hardware ist nicht erforderlich: Der Audiostream beliebiger Kameras oder Mikrofone sowie ein handelsüblicher PC mit GPU genügen.
Anwendungsszenarien
Voice-to-Text erhöht die Sicherheit im privaten und öffentlichen Raum sowie im gewerblichen Sektor und optimiert zugleich Geschäftsprozesse.
Seniorenbetreuung
Sofortige Reaktion auf Hilferufe oder Schutz vor Betrugsversuchen.
Alle Unternehmen
Automatisierte Qualitätskontrolle im Kundenservice (z. B. Erkennung von Schimpfwörtern).
Callcenter
Transkription von Gesprächsaufzeichnungen zur Überprüfung der Einhaltung von Unternehmensrichtlinien und Gesprächsleitfäden.
Stadtüberwachung
Terrorismusabwehr und Erkennung gefahrenrelevanter Begriffe.
Kindersicherung
Schutz von Kindern vor Mobbing oder Kommunikation mit Betrügern.
Polizei
Ergänzung zu Bodycams: Transkription von Gesprächen mit Verdächtigen und Erkennung von Drohungen.
Forschung und Analyse
Hintergrunderfassung statistischer Daten für sprachwissenschaftliche Studien und Worthäufigkeiten.
Marketing
Ermitteln, ob Kunden eine Werbekampagne diskutieren oder wie sie auf Banner reagieren.
Filterung und Automatisierung
Erkennung unerwünschter Phrasen oder Schlüsselwörter zur gezielten Gesprächskontrolle – ohne manuelles Abhören aller Aufzeichnungen.
Vorteile des Voice-to-Text-Moduls
Keine Spezialhardware erforderlich
Läuft auf Standard-PCs mit nahezu jeder Kamera und Grafikkarte.
Maximale Flexibilität
Vielfältige Reaktionen (inklusive eigener programmierbarer Logik) und Integration in Drittsysteme.
Echtzeit-Verarbeitung
Latenzfreie Echtzeitverarbeitung von Streams. Betrieb auf eigener Hardware.
Kosteneffiziente Lösung
Das Modul ist zusätzlich zur Standard- oder Pro-Lizenz erhältlich.
Funktionsweise

Kette erstellen
Da das Modul mit einem Audiostream arbeitet, benötigen Sie eine Tonquelle in der Kette.
- Tonquelle: integriertes Kameramikrofon oder ein separates USB- bzw. IP-Mikrofon
- Beispielkette: „Universalkamera“ – „Voice-to-Text“ – „Vorschau und Archiv“
- Das Modul wird zusätzlich zu einer Xeoma Pro- oder Standard-Lizenz lizenziert

KI-Ressourcen herunterladen
Klicken Sie in der Kette auf das Voice-to-Text-Symbol, um die Moduleinstellungen zu öffnen. Beim ersten Öffnen startet automatisch der Download zusätzlicher Ressourcen. Sobald die Meldung „Download läuft“ verschwindet, ist alles bereit.
- Die zusätzlichen Ressourcen enthalten KI-Datensätze und werden bei Bedarf von den FelenaSoft-Servern geladen
- Ressourcen werden nur bei Bedarf geladen, um die Installationsgröße gering zu halten

Erkennungsmodell und Schlüsselwörter wählen
Für verschiedene Sprachen stehen mehrere KI-Modelle zur Verfügung, die sich in Größe, Erkennungsqualität und Hardwareauslastung unterscheiden. Wählen Sie im Feld „Spracherkennungsmodell“ die Sprache des Transkripts (die tatsächlich gesprochene Sprache muss nicht angegeben werden) und definieren Sie bei Bedarf im darunterliegenden Feld Schlüsselwörter für die Detektion. Mit den Schaltern „Erkannte Sprache in der Echtzeitansicht anzeigen“ und „Erkannte Sprache bei Aufnahme/Archivexport als Untertitel speichern“ können Sie das Transkript sowohl im Live-Video als auch im Archiv einblenden.
- „Schlüsselwörter für die Detektion“ – das Modul reagiert ausschließlich auf die von Ihnen festgelegten Wörter oder Phrasen
- Transkript-Overlay in der Live-Vorschau und im Archiv
- „Daten in CSV-Bericht speichern“ — das Transkript wird als Tabellendatei auf der Festplatte gespeichert
- Reaktion nach dem Modul konfigurieren: Aufnahme, Benachrichtigung, Befehl senden
- Das Makro
%VOICE%ist in den Modulen „HTTP-Anfrage senden“, „E-Mail senden“ und „Anwendung ausführen“ verfügbar
Integration mit externen Programmen
Voice-to-Text lässt sich auch aus externen Programmen nutzen – beispielsweise zur Transkription von VoIP-Gesprächen. Übergeben Sie dem Modul einfach eine .mp3-Datei und erhalten Sie das Ergebnis als Text – selbst an Operator-Arbeitsplätzen ohne Xeoma oder Kameras. Wichtig: Es werden nur .mp3-Dateien unterstützt.
Beispiel für eine Anfrage über die Xeoma API (JSON):
curl -F "audio_file=@speech.mp3" "http://192.168.0.67:10090/api?login=Administrator&password=123&speech_recognition=recognition&model=qwen3-asr-1.7b&ttl=10&language=en"
Hierbei gilt:
audio_file=@speech.mp3– Pfad zur Audiodatei auf Ihrem Computer192.168.0.67– IP-Adresse des Xeoma-Servers10090– Port des Xeoma-ServersAdministrator/123– Administrator-Login (immer Administrator) und Passwortmodel=…— Erkennungsmodell (siehe Liste unten)language=en– Sprache des Transkripts. Weicht diese von der tatsächlich gesprochenen Sprache ab, wird das Transkript automatisch in die angegebene Sprache übersetzt
Um das Ergebnis als Textdatei zu speichern, fügen Sie >savetext.txt nach dem Befehl hinzu, wobei savetext.txt der Name der Textdatei ist.
Erkennungsmodelle für die API:
| Name | Beschreibung | API-Code |
|---|---|---|
| Russisch Basic | 140 MB | tone |
| Russisch Enhanced | Interpunktion, 215 MB | giga |
| Englisch Basic | 70 MB | zipformer |
| Multilingual Basic | Interpunktion, 1 GB, 0,6 Mrd. Parameter | qwen3-asr-0.6b |
| Mehrsprachig erweitert | Interpunktion, 2,2 GB, 1,7 Mrd. Parameter | qwen3-asr-1.7b |
| Gemma4 mehrsprachig Basis | Interpunktion, 2,2 GB, 1,7 Mrd. Parameter | gemma4-e2b |
| Gemma4 mehrsprachig erweitert | Interpunktion, 7 GB, 12 Mrd. Parameter | gemma4-12b |
Liste der Sprachcodes
en — Englisch, zh — Chinesisch, de — Deutsch, es — Spanisch, ru — Russisch, ko — Koreanisch, fr — Französisch, ja — Japanisch, pt — Portugiesisch, tr — Türkisch, pl — Polnisch, ca — Katalanisch, nl — Niederländisch, ar — Arabisch, sv — Schwedisch, it — Italienisch, id — Indonesisch, hi — Hindi, fi — Finnisch, vi — Vietnamesisch, he — Hebräisch, uk — Ukrainisch, el — Griechisch, ms — Malaiisch, cs — Tschechisch, ro — Rumänisch, da — Dänisch, hu — Ungarisch, ta — Tamil, no — Norwegisch, th — Thailändisch, ur — Urdu, hr — Kroatisch, bg — Bulgarisch, lt — Litauisch, la — Latein, mi — Maori, ml — Malayalam, cy — Walisisch, sk — Slowakisch, te — Telugu, fa — Persisch, lv — Lettisch, bn — Bengalisch, sr — Serbisch, az — Aserbaidschanisch, sl — Slowenisch, kn — Kannada, et — Estnisch, mk — Mazedonisch, br — Bretonisch, eu — Baskisch, is — Isländisch, hy — Armenisch, ne — Nepalesisch, mn — Mongolisch, bs — Bosnisch, kk — Kasachisch, sq — Albanisch, sw — Swahili, gl — Galicisch, mr — Marathi, pa — Punjabi, si — Singhalesisch, km — Khmer, sn — Shona, yo — Yoruba, so — Somali, af — Afrikaans, oc — Okzitanisch, ka — Georgisch, be — Belarussisch, tg — Tadschikisch, sd — Sindhi, gu — Gujarati, am — Amharisch, yi — Jiddisch, lo — Lao, uz — Usbekisch, fo — Färöisch, ht — Haitianisch-Kreolisch, ps — Paschtu, tk — Turkmenisch, nn — Nynorsk, mt — Maltesisch, sa — Sanskrit, lb — Luxemburgisch, my — Birmanisch, bo — Tibetisch, tl — Tagalog, mg — Malagasy, as — Assamesisch, tt — Tatarisch, haw — Hawaiisch, ln — Lingala, ha — Hausa, ba — Baschkirisch, jw — Javanisch, su — Sundanesisch, yue — Kantonesisch
Testen
Herunterladen und starten Sie Xeoma. Nutzen Sie die Testversion oder aktivieren Sie eine Xeoma Standard/Xeoma Pro Lizenz sowie die Lizenz für das Zusatzmodul „Voice-to-Text“.
Fügen Sie eine Kamera manuell hinzu oder warten Sie, bis Xeoma Kameras in Ihrem Netzwerk automatisch findet. Verbinden Sie für ein separates Mikrofon das Modul „Mikrofon“ und wählen Sie die entsprechende Tonquelle aus.
Fügen Sie das Modul „Voice-to-Text“ zur Kette hinzu, konfigurieren Sie Reaktionen auf Schlüsselwörter oder eine kontinuierliche Sprachtranskription und blenden Sie bei Bedarf das Transkript-Overlay im Kamerabild und in Aufzeichnungen ein.
Legen Sie eine Ereignisreaktion fest – Speicherung als CSV, mobile Benachrichtigungen oder andere Aktionen.
Demo-Lizenz anfordern
Weitere Module zur Verarbeitung von Audiostreams
Diese Module arbeiten eigenständig oder in Kombination mit Voice-to-Text.
Wählen Sie ein USB-Mikrofon oder ein separates IP-Mikrofon als Tonquelle aus.
Analysiert Audiostreams und löst einen Alarm aus, wenn der Geräuschpegel einen festgelegten Grenzwert überschreitet.
Erkennt Autoalarme, Kindergeschrei, Schüsse, Schreie und Glasbruch.
Voice-to-Text: Spracherkennung in Xeoma
Xeoma kostenlos testen
Geben Sie Ihren Namen und Ihre E-Mail-Adresse ein, um eine kostenlose Demo-Lizenz zu erhalten. Keine Kreditkarte erforderlich.
Kostenlose Xeoma-Demo-Lizenzen per E-Mail anfordern
Voller Funktionsumfang. Sofortiger Versand.
Wir bitten Sie, keine E-Mails mit personenbezogenen Daten zu verwenden und uns solche Daten auch nicht auf anderem Wege zu übermitteln. Sollten Sie dies dennoch tun, bestätigen Sie mit dem Absenden dieses Formulars Ihre Einwilligung zur Verarbeitung Ihrer personenbezogenen Daten
Benötigen Sie weitere Unterstützung?
Das Modul entspricht nicht exakt Ihren Anforderungen? Wir entwickeln die benötigten Funktionen und integrieren sie als kostenpflichtige Individualentwicklung in Xeoma. Details ansehen.
Fragen? Benötigen Sie Hilfe? Kontaktieren Sie uns! Wir helfen Ihnen gerne weiter
Bereit zum Start?
Testen Sie Sprache-zu-Text mit einer kostenlosen Demo-Lizenz – keine Kreditkarte und keine personenbezogenen Daten erforderlich.

