KI-gestützte Audioanalyse

Sprache-zu-Text

Intelligentes Xeoma-Modul zur Spracherkennung

Symbol des Voice-to-Text-Moduls Das Modul „hört“ den Audiostream einer Kamera oder eines separaten Mikrofons, erkennt Sprache, reagiert auf Schlüsselwörter und speichert das Transkript der Gespräche in einem CSV-Bericht oder blendet es je nach Ihren Einstellungen als Text im Live-Video bzw. Archiv ein. Zudem können .mp3-Dateien transkribiert werden: Gesprächsaufzeichnungen, Schulungsvideos usw.

Voice-to-Text: Das intelligente Modul von Xeoma zur Spracherkennung
90+ Transkriptionssprachen
CSV- Bericht auf Festplatte gespeichert
Live- Streams und .mp3-Dateien
KI- Zusatzmodul
Wichtiger Hinweis: Das Modul befindet sich in der Beta-Phase

Wichtig: Beta-Version

Das Modul ist ab Xeoma 24.8.12 verfügbar und befindet sich noch im Beta-Stadium; vereinzelt können Wörter ausgelassen werden oder Wiederholungen auftreten. Spezielle Hardware ist nicht erforderlich: Der Audiostream beliebiger Kameras oder Mikrofone sowie ein handelsüblicher PC mit GPU genügen.

Anwendungsfälle

Anwendungsszenarien

Voice-to-Text erhöht die Sicherheit im privaten und öffentlichen Raum sowie im gewerblichen Sektor und optimiert zugleich Geschäftsprozesse.

Seniorenbetreuung

Sofortige Reaktion auf Hilferufe oder Schutz vor Betrugsversuchen.

Alle Unternehmen

Automatisierte Qualitätskontrolle im Kundenservice (z. B. Erkennung von Schimpfwörtern).

Callcenter

Transkription von Gesprächsaufzeichnungen zur Überprüfung der Einhaltung von Unternehmensrichtlinien und Gesprächsleitfäden.

Stadtüberwachung

Terrorismusabwehr und Erkennung gefahrenrelevanter Begriffe.

Kindersicherung

Schutz von Kindern vor Mobbing oder Kommunikation mit Betrügern.

Polizei

Ergänzung zu Bodycams: Transkription von Gesprächen mit Verdächtigen und Erkennung von Drohungen.

Forschung und Analyse

Hintergrunderfassung statistischer Daten für sprachwissenschaftliche Studien und Worthäufigkeiten.

Marketing

Ermitteln, ob Kunden eine Werbekampagne diskutieren oder wie sie auf Banner reagieren.

Filterung und Automatisierung

Erkennung unerwünschter Phrasen oder Schlüsselwörter zur gezielten Gesprächskontrolle – ohne manuelles Abhören aller Aufzeichnungen.

Vorteile

Vorteile des Voice-to-Text-Moduls

Keine Spezialhardware erforderlich

Läuft auf Standard-PCs mit nahezu jeder Kamera und Grafikkarte.

Maximale Flexibilität

Vielfältige Reaktionen (inklusive eigener programmierbarer Logik) und Integration in Drittsysteme.

Echtzeit-Verarbeitung

Latenzfreie Echtzeitverarbeitung von Streams. Betrieb auf eigener Hardware.

Kosteneffiziente Lösung

Das Modul ist zusätzlich zur Standard- oder Pro-Lizenz erhältlich.

Workflow

Funktionsweise

Beispiel einer Kette mit dem intelligenten Voice-to-Text-Modul
Schritt 1

Kette erstellen

Da das Modul mit einem Audiostream arbeitet, benötigen Sie eine Tonquelle in der Kette.

  • Tonquelle: integriertes Kameramikrofon oder ein separates USB- bzw. IP-Mikrofon
  • Beispielkette: „Universalkamera“ – „Voice-to-Text“ – „Vorschau und Archiv“
  • Das Modul wird zusätzlich zu einer Xeoma Pro- oder Standard-Lizenz lizenziert
Herunterladen zusätzlicher KI-Ressourcen
Schritt 2

KI-Ressourcen herunterladen

Klicken Sie in der Kette auf das Voice-to-Text-Symbol, um die Moduleinstellungen zu öffnen. Beim ersten Öffnen startet automatisch der Download zusätzlicher Ressourcen. Sobald die Meldung „Download läuft“ verschwindet, ist alles bereit.

  • Die zusätzlichen Ressourcen enthalten KI-Datensätze und werden bei Bedarf von den FelenaSoft-Servern geladen
  • Ressourcen werden nur bei Bedarf geladen, um die Installationsgröße gering zu halten
Auswahl des KI-Modells und der Transkriptionssprache
Schritt 3

Erkennungsmodell und Schlüsselwörter wählen

Für verschiedene Sprachen stehen mehrere KI-Modelle zur Verfügung, die sich in Größe, Erkennungsqualität und Hardwareauslastung unterscheiden. Wählen Sie im Feld „Spracherkennungsmodell“ die Sprache des Transkripts (die tatsächlich gesprochene Sprache muss nicht angegeben werden) und definieren Sie bei Bedarf im darunterliegenden Feld Schlüsselwörter für die Detektion. Mit den Schaltern „Erkannte Sprache in der Echtzeitansicht anzeigen“ und „Erkannte Sprache bei Aufnahme/Archivexport als Untertitel speichern“ können Sie das Transkript sowohl im Live-Video als auch im Archiv einblenden.

  • „Schlüsselwörter für die Detektion“ – das Modul reagiert ausschließlich auf die von Ihnen festgelegten Wörter oder Phrasen
  • Transkript-Overlay in der Live-Vorschau und im Archiv
  • „Daten in CSV-Bericht speichern“ — das Transkript wird als Tabellendatei auf der Festplatte gespeichert
  • Reaktion nach dem Modul konfigurieren: Aufnahme, Benachrichtigung, Befehl senden
  • Das Makro %VOICE% ist in den Modulen „HTTP-Anfrage senden“, „E-Mail senden“ und „Anwendung ausführen“ verfügbar
API

Integration mit externen Programmen

Voice-to-Text lässt sich auch aus externen Programmen nutzen – beispielsweise zur Transkription von VoIP-Gesprächen. Übergeben Sie dem Modul einfach eine .mp3-Datei und erhalten Sie das Ergebnis als Text – selbst an Operator-Arbeitsplätzen ohne Xeoma oder Kameras. Wichtig: Es werden nur .mp3-Dateien unterstützt.

Beispiel für eine Anfrage über die Xeoma API (JSON):

curl -F "audio_file=@speech.mp3" "http://192.168.0.67:10090/api?login=Administrator&password=123&speech_recognition=recognition&model=qwen3-asr-1.7b&ttl=10&language=en"

Hierbei gilt:

  • audio_file=@speech.mp3 – Pfad zur Audiodatei auf Ihrem Computer
  • 192.168.0.67 – IP-Adresse des Xeoma-Servers
  • 10090 – Port des Xeoma-Servers
  • Administrator / 123 – Administrator-Login (immer Administrator) und Passwort
  • model=… — Erkennungsmodell (siehe Liste unten)
  • language=en – Sprache des Transkripts. Weicht diese von der tatsächlich gesprochenen Sprache ab, wird das Transkript automatisch in die angegebene Sprache übersetzt

Um das Ergebnis als Textdatei zu speichern, fügen Sie >savetext.txt nach dem Befehl hinzu, wobei savetext.txt der Name der Textdatei ist.

Erkennungsmodelle für die API:

Name Beschreibung API-Code
Russisch Basic 140 MB tone
Russisch Enhanced Interpunktion, 215 MB giga
Englisch Basic 70 MB zipformer
Multilingual Basic Interpunktion, 1 GB, 0,6 Mrd. Parameter qwen3-asr-0.6b
Mehrsprachig erweitert Interpunktion, 2,2 GB, 1,7 Mrd. Parameter qwen3-asr-1.7b
Gemma4 mehrsprachig Basis Interpunktion, 2,2 GB, 1,7 Mrd. Parameter gemma4-e2b
Gemma4 mehrsprachig erweitert Interpunktion, 7 GB, 12 Mrd. Parameter gemma4-12b

Liste der Sprachcodes

en — Englisch, zh — Chinesisch, de — Deutsch, es — Spanisch, ru — Russisch, ko — Koreanisch, fr — Französisch, ja — Japanisch, pt — Portugiesisch, tr — Türkisch, pl — Polnisch, ca — Katalanisch, nl — Niederländisch, ar — Arabisch, sv — Schwedisch, it — Italienisch, id — Indonesisch, hi — Hindi, fi — Finnisch, vi — Vietnamesisch, he — Hebräisch, uk — Ukrainisch, el — Griechisch, ms — Malaiisch, cs — Tschechisch, ro — Rumänisch, da — Dänisch, hu — Ungarisch, ta — Tamil, no — Norwegisch, th — Thailändisch, ur — Urdu, hr — Kroatisch, bg — Bulgarisch, lt — Litauisch, la — Latein, mi — Maori, ml — Malayalam, cy — Walisisch, sk — Slowakisch, te — Telugu, fa — Persisch, lv — Lettisch, bn — Bengalisch, sr — Serbisch, az — Aserbaidschanisch, sl — Slowenisch, kn — Kannada, et — Estnisch, mk — Mazedonisch, br — Bretonisch, eu — Baskisch, is — Isländisch, hy — Armenisch, ne — Nepalesisch, mn — Mongolisch, bs — Bosnisch, kk — Kasachisch, sq — Albanisch, sw — Swahili, gl — Galicisch, mr — Marathi, pa — Punjabi, si — Singhalesisch, km — Khmer, sn — Shona, yo — Yoruba, so — Somali, af — Afrikaans, oc — Okzitanisch, ka — Georgisch, be — Belarussisch, tg — Tadschikisch, sd — Sindhi, gu — Gujarati, am — Amharisch, yi — Jiddisch, lo — Lao, uz — Usbekisch, fo — Färöisch, ht — Haitianisch-Kreolisch, ps — Paschtu, tk — Turkmenisch, nn — Nynorsk, mt — Maltesisch, sa — Sanskrit, lb — Luxemburgisch, my — Birmanisch, bo — Tibetisch, tl — Tagalog, mg — Malagasy, as — Assamesisch, tt — Tatarisch, haw — Hawaiisch, ln — Lingala, ha — Hausa, ba — Baschkirisch, jw — Javanisch, su — Sundanesisch, yue — Kantonesisch

Schnellstart

Testen

1
Xeoma starten

Herunterladen und starten Sie Xeoma. Nutzen Sie die Testversion oder aktivieren Sie eine Xeoma Standard/Xeoma Pro Lizenz sowie die Lizenz für das Zusatzmodul „Voice-to-Text“.

2
Kamera hinzufügen

Fügen Sie eine Kamera manuell hinzu oder warten Sie, bis Xeoma Kameras in Ihrem Netzwerk automatisch findet. Verbinden Sie für ein separates Mikrofon das Modul „Mikrofon“ und wählen Sie die entsprechende Tonquelle aus.

3
Modul hinzufügen

Fügen Sie das Modul „Voice-to-Text“ zur Kette hinzu, konfigurieren Sie Reaktionen auf Schlüsselwörter oder eine kontinuierliche Sprachtranskription und blenden Sie bei Bedarf das Transkript-Overlay im Kamerabild und in Aufzeichnungen ein.

4
Reaktionen einrichten

Legen Sie eine Ereignisreaktion fest – Speicherung als CSV, mobile Benachrichtigungen oder andere Aktionen.

Voice-to-Text Moduleinstellungen in Xeoma
Die Testversion unterliegt gewissen Einschränkungen. Um Voice-to-Text umfassend kennenzulernen, empfehlen wir die Beantragung einer kostenlosen Demo-Lizenz. Diese bietet uneingeschränkten Zugriff auf alle Funktionen – ohne Verpflichtungen. Nur eine E-Mail-Adresse ist erforderlich. Klicken Sie auf die folgende Schaltfläche, um zu beginnen:
Kostenlose
Demo-Lizenz anfordern
Video

Voice-to-Text: Spracherkennung in Xeoma

Kostenlose Testversion

Xeoma kostenlos testen

Geben Sie Ihren Namen und Ihre E-Mail-Adresse ein, um eine kostenlose Demo-Lizenz zu erhalten. Keine Kreditkarte erforderlich.

Kostenlose Xeoma-Demo-Lizenzen per E-Mail anfordern

Voller Funktionsumfang. Sofortiger Versand.

Wir bitten Sie, keine E-Mails mit personenbezogenen Daten zu verwenden und uns solche Daten auch nicht auf anderem Wege zu übermitteln. Sollten Sie dies dennoch tun, bestätigen Sie mit dem Absenden dieses Formulars Ihre Einwilligung zur Verarbeitung Ihrer personenbezogenen Daten

Benötigen Sie eine individuelle Modulanpassung?

Benötigen Sie weitere Unterstützung?

Das Modul entspricht nicht exakt Ihren Anforderungen? Wir entwickeln die benötigten Funktionen und integrieren sie als kostenpflichtige Individualentwicklung in Xeoma. Details ansehen.

Fragen? Benötigen Sie Hilfe? Kontaktieren Sie uns! Wir helfen Ihnen gerne weiter

Bereit zum Start?

Testen Sie Sprache-zu-Text mit einer kostenlosen Demo-Lizenz – keine Kreditkarte und keine personenbezogenen Daten erforderlich.