Transkrypcja mowy na tekst
Inteligentny moduł Xeoma do rozpoznawania mowy
Moduł „słucha” strumienia audio z kamery lub oddzielnego mikrofonu, rozpoznaje mowę, reaguje na słowa kluczowe i zapisuje transkrypcję rozmów w raporcie CSV lub nakłada ją jako tekst na obraz na żywo/archiwum, zależnie od preferencji. Może również transkrybować pliki .mp3: nagrania rozmów, filmy szkoleniowe itp.

Ważne: wersja beta
Moduł jest dostępny od wersji Xeoma 24.8.12 i znajduje się w fazie beta, dlatego w niektórych przypadkach może pomijać słowa lub generować pętle. Nie wymaga specjalistycznego sprzętu: wystarczy strumień dźwięku z dowolnej kamery lub mikrofonu oraz standardowy komputer z kartą graficzną GPU.
Scenariusze zastosowań
Voice-to-Text podnosi poziom bezpieczeństwa w sferze prywatnej, przestrzeni miejskiej i sektorze komercyjnym, a także wspiera optymalizację procesów biznesowych.
Opieka nad osobami starszymi
Możliwość natychmiastowej reakcji na wołanie o pomoc oraz ochrona przed oszustami.
Każdy biznes
Automatyczna kontrola jakości obsługi klienta (np. wykrywanie wulgaryzmów).
Call center
Transkrypcja nagrań rozmów w celu monitorowania zgodności z polityką firmy i skryptami rozmów.
Monitoring miejski
Bezpieczeństwo antyterrorystyczne i rozpoznawanie słów wskazujących na zagrożenie.
Kontrola rodzicielska
Wsparcie w ochronie dziecka przed przemocą rówieśniczą lub kontaktem z oszustami.
Policja
Oprócz kamer nasobnych – transkrypcja rozmów z podejrzanym i wykrywanie gróźb.
Badania i analityka
Gromadzenie statystyk w tle do badań nad mową i częstotliwością używania słów.
Marketing
Sprawdź, czy klienci omawiają kampanię promocyjną, jaka jest ich reakcja na baner itp.
Filtrowanie i automatyzacja
Wykrywanie niepożądanych lub kluczowych fraz w celu ukierunkowanej kontroli rozmów – bez konieczności odsłuchiwania wszystkich nagrań.
Zalety modułu Voice-to-Text
Brak wymogów sprzętowych
Działa na standardowych komputerach z niemal dowolną kamerą i kartą graficzną.
Pełna elastyczność
Różnorodne reakcje (w tym własne, programowalne) oraz integracja z systemami zewnętrznymi.
Praca w czasie rzeczywistym
Przetwarzanie strumieni w czasie rzeczywistym, bez opóźnień. Działa na własnym sprzęcie.
Przystępne rozwiązanie
Moduł można dokupić do licencji Standard lub Pro.
Zasada działania

Budowa łańcucha
Ponieważ moduł przetwarza strumień audio, w łańcuchu musi znaleźć się źródło dźwięku.
- Źródło dźwięku: mikrofon wbudowany w kamerę lub oddzielny mikrofon USB lub IP
- Przykładowy łańcuch: „Kamera uniwersalna” – „Voice-to-Text” – „Podgląd i archiwum”
- Moduł jest licencjonowany dodatkowo do licencji Xeoma Pro lub Standard

Pobieranie zasobów AI
Kliknij ikonę Voice-to-Text w łańcuchu, aby otworzyć ustawienia modułu. Pobieranie dodatkowych zasobów rozpocznie się automatycznie przy pierwszym otwarciu ustawień. Gdy komunikat „Trwa pobieranie” zniknie, wszystko będzie gotowe.
- Dodatkowe zasoby zawierają zestawy danych dla sztucznej inteligencji i są pobierane na żądanie z serwerów Felenasoft
- Zasoby są pobierane tylko wtedy, gdy są potrzebne — dzięki temu rozmiar programu pozostaje niewielki

Wybór modelu rozpoznawania i słów kluczowych
Dostępne są różne modele AI dla poszczególnych języków, różniące się rozmiarem, dokładnością rozpoznawania oraz obciążeniem sprzętu. W polu „Model rozpoznawania mowy” wybierz język transkrypcji (język mówiony nie musi być wskazywany osobno), a w razie potrzeby zdefiniuj słowa kluczowe do detekcji w polu poniżej. Opcje „Wyświetlanie rozpoznanej mowy podczas podglądu na żywo” oraz „Zapis rozpoznanej mowy w napisach podczas nagrywania/eksportu archiwum” pozwalają na wyświetlanie transkrypcji bezpośrednio na obrazie z kamery oraz w materiałach archiwalnych.
- „Słowa kluczowe do detekcji” — moduł reaguje wyłącznie na wybrane słowa lub frazy
- Nakładka transkrypcji w podglądzie na żywo i w archiwum
- „Zapis danych w raporcie CSV” — transkrypcja jest zapisywana w pliku arkusza kalkulacyjnego na dysku
- Skonfiguruj reakcję modułu: nagrywanie, powiadomienie, wysłanie polecenia
- Makro
%VOICE%jest dostępne w modułach „Wysyłanie żądań HTTP”, „Wysyłanie e-mail” i „Uruchamianie aplikacji”
Integracja z zewnętrznymi programami
Moduł Voice-to-Text można wykorzystywać w zewnętrznych programach — np. do transkrypcji rozmów VoIP. Przekaż plik .mp3 do modułu, aby uzyskać wynik tekstowy — nawet na stanowiskach operatorskich bez zainstalowanego systemu Xeoma ani kamer. Ważne: obsługiwane są wyłącznie pliki .mp3.
Przykład żądania przez API Xeoma (JSON):
curl -F "audio_file=@speech.mp3" "http://192.168.0.67:10090/api?login=Administrator&password=123&speech_recognition=recognition&model=qwen3-asr-1.7b&ttl=10&language=en"
Gdzie:
audio_file=@speech.mp3— ścieżka do pliku audio na komputerze lokalnym192.168.0.67— adres IP serwera Xeoma10090— port serwera XeomaAdministrator/123— login administratora (zawsze Administrator) oraz hasłomodel=…— model rozpoznawania (zob. lista poniżej)language=en— język transkrypcji. Jeśli różni się od faktycznego języka mowy, transkrypcja zostanie automatycznie przetłumaczona na wskazany język
Aby zapisać wynik jako plik tekstowy, dodaj >savetext.txt po poleceniu, gdzie savetext.txt to nazwa pliku tekstowego.
Modele rozpoznawania dostępne przez API:
| Nazwa | Opis | Kod API |
|---|---|---|
| Rosyjski podstawowy | 140 MB | tone |
| Rosyjski rozszerzony | obsługa interpunkcji, 215 MB | giga |
| Angielski podstawowy | 70 MB | zipformer |
| Wielojęzyczny podstawowy | interpunkcja, 1 GB, 0,6 mld parametrów | qwen3-asr-0.6b |
| Wielojęzyczny rozszerzony | interpunkcja, 2,2 GB, 1,7 mld parametrów | qwen3-asr-1.7b |
| Gemma4 wielojęzyczny podstawowy | interpunkcja, 2,2 GB, 1,7 mld parametrów | gemma4-e2b |
| Gemma4 wielojęzyczny rozszerzony | interpunkcja, 7 GB, 12 mld parametrów | gemma4-12b |
Lista kodów języków
en — angielski, zh — chiński, de — niemiecki, es — hiszpański, ru — rosyjski, ko — koreański, fr — francuski, ja — japoński, pt — portugalski, tr — turecki, pl — polski, ca — kataloński, nl — niderlandzki, ar — arabski, sv — szwedzki, it — włoski, id — indonezyjski, hi — hindi, fi — fiński, vi — wietnamski, he — hebrajski, uk — ukraiński, el — grecki, ms — malajski, cs — czeski, ro — rumuński, da — duński, hu — węgierski, ta — tamilski, no — norweski, th — tajski, ur — urdu, hr — chorwacki, bg — bułgarski, lt — litewski, la — łaciński, mi — maoryski, ml — malajalam, cy — walijski, sk — słowacki, te — telugu, fa — perski, lv — łotewski, bn — bengalski, sr — serbski, az — azerski, sl — słoweński, kn — kannada, et — estoński, mk — macedoński, br — bretoński, eu — baskijski, is — islandzki, hy — ormiański, ne — nepalski, mn — mongolski, bs — bośniacki, kk — kazachski, sq — albański, sw — suahili, gl — galicyjski, mr — marathi, pa — pendżabski, si — syngaleski, km — khmerski, sn — shona, yo — joruba, so — somalijski, af — afrikaans, oc — oksytański, ka — gruziński, be — białoruski, tg — tadżycki, sd — sindhi, gu — gudźarati, am — amharski, yi — jidysz, lo — laotański, uz — uzbecki, fo — farerski, ht — kreolski haitański, ps — paszto, tk — turkmeński, nn — nynorsk, mt — maltański, sa — sanskryt, lb — luksemburski, my — birmański, bo — tybetański, tl — tagalski, mg — malgaski, as — asamski, tt — tatarski, haw — hawajski, ln — lingala, ha — hausa, ba — baszkirski, jw — jawajski, su — sundajski, yue — kantoński.
Jak testować
Pobierz i uruchom Xeoma. Skorzystaj z wersji próbnej lub aktywuj licencję Xeoma Standard/Xeoma Pro oraz licencję na moduł dodatkowy „Voice-to-Text”.
Dodaj kamerę ręcznie lub poczekaj, aż Xeoma automatycznie wykryje kamery w Twojej sieci. W przypadku osobnego mikrofonu dodaj moduł „Mikrofon” i wybierz odpowiednie źródło dźwięku.
Dodaj moduł „Voice-to-Text” do łańcucha, skonfiguruj reakcję na słowa kluczowe lub ciągłą transkrypcję mowy, a w razie potrzeby włącz nakładkę z transkrypcją na obrazie z kamery i nagraniach.
Ustaw reakcję na zdarzenie — zapis do pliku CSV, powiadomienia mobilne lub inną akcję.
licencję demo
Inne moduły przetwarzające strumień audio
Moduły te działają samodzielnie lub we współpracy z Voice-to-Text.
Wybierz mikrofon USB lub dedykowany mikrofon IP jako źródło dźwięku.
Analizuje strumień audio i wyzwala alarm, gdy poziom dźwięku przekroczy ustalony próg.
Rozpoznaje alarmy samochodowe, płacz dziecka, strzały, krzyki oraz tłuczone szkło.
Voice-to-Text: Rozpoznawanie mowy w Xeoma
Wypróbuj Xeoma za darmo
Podaj imię i nazwisko oraz adres e-mail, aby otrzymać bezpłatną licencję demo. Karta kredytowa nie jest wymagana.
Wyślij bezpłatne licencje demo Xeoma na e-mail
Pełna funkcjonalność. Natychmiastowa wysyłka.
Prosimy o nieużywanie adresów e-mail zawierających dane osobowe ani o nieprzesyłanie ich w inny sposób. Jeśli mimo to zostaną one przekazane, wysyłając ten formularz, potwierdzasz zgodę na przetwarzanie swoich danych osobowych
Potrzebujesz czegoś innego?
Moduł nie spełnia w pełni Twoich wymagań? Możemy opracować potrzebne funkcje i dodać je do Xeoma w ramach usługi custom development. Zobacz szczegóły.
Masz pytania? Potrzebujesz wsparcia? Skontaktuj się z nami! Chętnie pomożemy!
Gotowy na start?
Przetestuj moduł Transkrypcja mowy na tekst z bezpłatną licencją demo — bez karty kredytowej i podawania danych osobowych.

