Analityka audio oparta na AI

Transkrypcja mowy na tekst

Inteligentny moduł Xeoma do rozpoznawania mowy

Ikona modułu Voice-to-Text Moduł „słucha” strumienia audio z kamery lub oddzielnego mikrofonu, rozpoznaje mowę, reaguje na słowa kluczowe i zapisuje transkrypcję rozmów w raporcie CSV lub nakłada ją jako tekst na obraz na żywo/archiwum, zależnie od preferencji. Może również transkrybować pliki .mp3: nagrania rozmów, filmy szkoleniowe itp.

Voice-to-Text: inteligentny moduł rozpoznawania mowy w Xeoma
90+ języków transkrypcji
CSV raport zapisywany na dysku
Strumienie na żywo i pliki .mp3
AI moduł dodatkowy
Ważna uwaga: moduł jest w wersji beta

Ważne: wersja beta

Moduł jest dostępny od wersji Xeoma 24.8.12 i znajduje się w fazie beta, dlatego w niektórych przypadkach może pomijać słowa lub generować pętle. Nie wymaga specjalistycznego sprzętu: wystarczy strumień dźwięku z dowolnej kamery lub mikrofonu oraz standardowy komputer z kartą graficzną GPU.

Przykłady użycia

Scenariusze zastosowań

Voice-to-Text podnosi poziom bezpieczeństwa w sferze prywatnej, przestrzeni miejskiej i sektorze komercyjnym, a także wspiera optymalizację procesów biznesowych.

Opieka nad osobami starszymi

Możliwość natychmiastowej reakcji na wołanie o pomoc oraz ochrona przed oszustami.

Każdy biznes

Automatyczna kontrola jakości obsługi klienta (np. wykrywanie wulgaryzmów).

Call center

Transkrypcja nagrań rozmów w celu monitorowania zgodności z polityką firmy i skryptami rozmów.

Monitoring miejski

Bezpieczeństwo antyterrorystyczne i rozpoznawanie słów wskazujących na zagrożenie.

Kontrola rodzicielska

Wsparcie w ochronie dziecka przed przemocą rówieśniczą lub kontaktem z oszustami.

Policja

Oprócz kamer nasobnych – transkrypcja rozmów z podejrzanym i wykrywanie gróźb.

Badania i analityka

Gromadzenie statystyk w tle do badań nad mową i częstotliwością używania słów.

Marketing

Sprawdź, czy klienci omawiają kampanię promocyjną, jaka jest ich reakcja na baner itp.

Filtrowanie i automatyzacja

Wykrywanie niepożądanych lub kluczowych fraz w celu ukierunkowanej kontroli rozmów – bez konieczności odsłuchiwania wszystkich nagrań.

Zalety

Zalety modułu Voice-to-Text

Brak wymogów sprzętowych

Działa na standardowych komputerach z niemal dowolną kamerą i kartą graficzną.

Pełna elastyczność

Różnorodne reakcje (w tym własne, programowalne) oraz integracja z systemami zewnętrznymi.

Praca w czasie rzeczywistym

Przetwarzanie strumieni w czasie rzeczywistym, bez opóźnień. Działa na własnym sprzęcie.

Przystępne rozwiązanie

Moduł można dokupić do licencji Standard lub Pro.

Przepływ pracy

Zasada działania

Przykładowy łańcuch z inteligentnym modułem Voice-to-Text
Krok 1

Budowa łańcucha

Ponieważ moduł przetwarza strumień audio, w łańcuchu musi znaleźć się źródło dźwięku.

  • Źródło dźwięku: mikrofon wbudowany w kamerę lub oddzielny mikrofon USB lub IP
  • Przykładowy łańcuch: „Kamera uniwersalna” – „Voice-to-Text” – „Podgląd i archiwum”
  • Moduł jest licencjonowany dodatkowo do licencji Xeoma Pro lub Standard
Pobieranie dodatkowych zasobów AI
Krok 2

Pobieranie zasobów AI

Kliknij ikonę Voice-to-Text w łańcuchu, aby otworzyć ustawienia modułu. Pobieranie dodatkowych zasobów rozpocznie się automatycznie przy pierwszym otwarciu ustawień. Gdy komunikat „Trwa pobieranie” zniknie, wszystko będzie gotowe.

  • Dodatkowe zasoby zawierają zestawy danych dla sztucznej inteligencji i są pobierane na żądanie z serwerów Felenasoft
  • Zasoby są pobierane tylko wtedy, gdy są potrzebne — dzięki temu rozmiar programu pozostaje niewielki
Wybór modelu AI i języka transkrypcji
Krok 3

Wybór modelu rozpoznawania i słów kluczowych

Dostępne są różne modele AI dla poszczególnych języków, różniące się rozmiarem, dokładnością rozpoznawania oraz obciążeniem sprzętu. W polu „Model rozpoznawania mowy” wybierz język transkrypcji (język mówiony nie musi być wskazywany osobno), a w razie potrzeby zdefiniuj słowa kluczowe do detekcji w polu poniżej. Opcje „Wyświetlanie rozpoznanej mowy podczas podglądu na żywo” oraz „Zapis rozpoznanej mowy w napisach podczas nagrywania/eksportu archiwum” pozwalają na wyświetlanie transkrypcji bezpośrednio na obrazie z kamery oraz w materiałach archiwalnych.

  • „Słowa kluczowe do detekcji” — moduł reaguje wyłącznie na wybrane słowa lub frazy
  • Nakładka transkrypcji w podglądzie na żywo i w archiwum
  • „Zapis danych w raporcie CSV” — transkrypcja jest zapisywana w pliku arkusza kalkulacyjnego na dysku
  • Skonfiguruj reakcję modułu: nagrywanie, powiadomienie, wysłanie polecenia
  • Makro %VOICE% jest dostępne w modułach „Wysyłanie żądań HTTP”, „Wysyłanie e-mail” i „Uruchamianie aplikacji”
API

Integracja z zewnętrznymi programami

Moduł Voice-to-Text można wykorzystywać w zewnętrznych programach — np. do transkrypcji rozmów VoIP. Przekaż plik .mp3 do modułu, aby uzyskać wynik tekstowy — nawet na stanowiskach operatorskich bez zainstalowanego systemu Xeoma ani kamer. Ważne: obsługiwane są wyłącznie pliki .mp3.

Przykład żądania przez API Xeoma (JSON):

curl -F "audio_file=@speech.mp3" "http://192.168.0.67:10090/api?login=Administrator&password=123&speech_recognition=recognition&model=qwen3-asr-1.7b&ttl=10&language=en"

Gdzie:

  • audio_file=@speech.mp3 — ścieżka do pliku audio na komputerze lokalnym
  • 192.168.0.67 — adres IP serwera Xeoma
  • 10090 — port serwera Xeoma
  • Administrator / 123 — login administratora (zawsze Administrator) oraz hasło
  • model=… — model rozpoznawania (zob. lista poniżej)
  • language=en — język transkrypcji. Jeśli różni się od faktycznego języka mowy, transkrypcja zostanie automatycznie przetłumaczona na wskazany język

Aby zapisać wynik jako plik tekstowy, dodaj >savetext.txt po poleceniu, gdzie savetext.txt to nazwa pliku tekstowego.

Modele rozpoznawania dostępne przez API:

Nazwa Opis Kod API
Rosyjski podstawowy 140 MB tone
Rosyjski rozszerzony obsługa interpunkcji, 215 MB giga
Angielski podstawowy 70 MB zipformer
Wielojęzyczny podstawowy interpunkcja, 1 GB, 0,6 mld parametrów qwen3-asr-0.6b
Wielojęzyczny rozszerzony interpunkcja, 2,2 GB, 1,7 mld parametrów qwen3-asr-1.7b
Gemma4 wielojęzyczny podstawowy interpunkcja, 2,2 GB, 1,7 mld parametrów gemma4-e2b
Gemma4 wielojęzyczny rozszerzony interpunkcja, 7 GB, 12 mld parametrów gemma4-12b

Lista kodów języków

en — angielski, zh — chiński, de — niemiecki, es — hiszpański, ru — rosyjski, ko — koreański, fr — francuski, ja — japoński, pt — portugalski, tr — turecki, pl — polski, ca — kataloński, nl — niderlandzki, ar — arabski, sv — szwedzki, it — włoski, id — indonezyjski, hi — hindi, fi — fiński, vi — wietnamski, he — hebrajski, uk — ukraiński, el — grecki, ms — malajski, cs — czeski, ro — rumuński, da — duński, hu — węgierski, ta — tamilski, no — norweski, th — tajski, ur — urdu, hr — chorwacki, bg — bułgarski, lt — litewski, la — łaciński, mi — maoryski, ml — malajalam, cy — walijski, sk — słowacki, te — telugu, fa — perski, lv — łotewski, bn — bengalski, sr — serbski, az — azerski, sl — słoweński, kn — kannada, et — estoński, mk — macedoński, br — bretoński, eu — baskijski, is — islandzki, hy — ormiański, ne — nepalski, mn — mongolski, bs — bośniacki, kk — kazachski, sq — albański, sw — suahili, gl — galicyjski, mr — marathi, pa — pendżabski, si — syngaleski, km — khmerski, sn — shona, yo — joruba, so — somalijski, af — afrikaans, oc — oksytański, ka — gruziński, be — białoruski, tg — tadżycki, sd — sindhi, gu — gudźarati, am — amharski, yi — jidysz, lo — laotański, uz — uzbecki, fo — farerski, ht — kreolski haitański, ps — paszto, tk — turkmeński, nn — nynorsk, mt — maltański, sa — sanskryt, lb — luksemburski, my — birmański, bo — tybetański, tl — tagalski, mg — malgaski, as — asamski, tt — tatarski, haw — hawajski, ln — lingala, ha — hausa, ba — baszkirski, jw — jawajski, su — sundajski, yue — kantoński.

Szybki start

Jak testować

1
Uruchom Xeomę

Pobierz i uruchom Xeoma. Skorzystaj z wersji próbnej lub aktywuj licencję Xeoma Standard/Xeoma Pro oraz licencję na moduł dodatkowy „Voice-to-Text”.

2
Dodaj kamerę

Dodaj kamerę ręcznie lub poczekaj, aż Xeoma automatycznie wykryje kamery w Twojej sieci. W przypadku osobnego mikrofonu dodaj moduł „Mikrofon” i wybierz odpowiednie źródło dźwięku.

3
Dodaj moduł

Dodaj moduł „Voice-to-Text” do łańcucha, skonfiguruj reakcję na słowa kluczowe lub ciągłą transkrypcję mowy, a w razie potrzeby włącz nakładkę z transkrypcją na obrazie z kamery i nagraniach.

4
Skonfiguruj reakcje

Ustaw reakcję na zdarzenie — zapis do pliku CSV, powiadomienia mobilne lub inną akcję.

Ustawienia modułu Voice-to-Text w Xeoma
Wersja próbna ma pewne ograniczenia. Aby lepiej poznać Voice-to-Text, zalecamy zamówienie bezpłatnej licencji demo. Zapewnia ona pełny dostęp do wszystkich funkcji bez zobowiązań. Wymagany jest jedynie adres e-mail. Kliknij poniższy przycisk, aby rozpocząć:
Odbierz bezpłatną
licencję demo
Wideo

Voice-to-Text: Rozpoznawanie mowy w Xeoma

Bezpłatny okres próbny

Wypróbuj Xeoma za darmo

Podaj imię i nazwisko oraz adres e-mail, aby otrzymać bezpłatną licencję demo. Karta kredytowa nie jest wymagana.

Wyślij bezpłatne licencje demo Xeoma na e-mail

Pełna funkcjonalność. Natychmiastowa wysyłka.

Prosimy o nieużywanie adresów e-mail zawierających dane osobowe ani o nieprzesyłanie ich w inny sposób. Jeśli mimo to zostaną one przekazane, wysyłając ten formularz, potwierdzasz zgodę na przetwarzanie swoich danych osobowych

Potrzebujesz modułu dostosowanego do Twoich potrzeb?

Potrzebujesz czegoś innego?

Moduł nie spełnia w pełni Twoich wymagań? Możemy opracować potrzebne funkcje i dodać je do Xeoma w ramach usługi custom development. Zobacz szczegóły.

Masz pytania? Potrzebujesz wsparcia? Skontaktuj się z nami! Chętnie pomożemy!

Gotowy na start?

Przetestuj moduł Transkrypcja mowy na tekst z bezpłatną licencją demo — bez karty kredytowej i podawania danych osobowych.