Глас към текст
Интелигентният модул на Xeoma за разпознаване на реч
Модулът „слуша“ аудиопотока от камера или отделен микрофон, разпознава реч, реагира на ключови думи и запазва транскрипцията на разговорите в CSV отчет или я наслагва като текст върху видеото на живо/архива според вашите предпочитания. Може също да транскрибира .mp3 файлове: записи на разговори, обучителни видеоклипове и др.

Важно: бета версия
Модулът е наличен от версия Xeoma 24.8.12 и е в бета етап, поради което в някои случаи може да пропуска думи или да съдържа повторения. Не се изисква специализирано оборудване: подходящи са аудиопотокът от всяка камера или микрофон и стандартен компютър с GPU.
Сценарии за приложение
Функцията „Глас към текст“ повишава сигурността в личния живот, градската среда и търговската сфера, като същевременно оптимизира бизнес процесите.
Грижа за възрастни хора
Възможност за незабавна реакция при вик за помощ или защита от измамници.
Всеки бизнес
Автоматизиран контрол на качеството на обслужване на клиенти (напр. откриване на нецензурни думи).
Кол-център
Транскрибиране на записани разговори за проверка на съответствието с фирмената политика и скриптовете за комуникация.
Градско наблюдение
Антитерористична сигурност и разпознаване на думи, сигнализиращи за опасност.
Родителски контрол
Помощ при защита на детето от тормоз или комуникация с измамници.
Полиция
Като допълнение към body-worn камерите — транскрибиране на разговори със заподозрени и откриване на заплахи.
Изследвания и анализи
Фоново събиране на статистически данни за езикови изследвания и честота на употреба на думи.
Маркетинг
Проследяване дали клиентите обсъждат промоционална кампания, каква е реакцията им към банер и др.
Филтриране и автоматизация
Откриване на нежелани или ключови фрази за целеви контрол на разговорите — без необходимост от прослушване на всички тях.
Предимства на модула „Глас към текст“
Без нужда от специално оборудване
Работи на стандартни компютри с почти всяка камера и графична карта.
Максимална гъвкавост
Разнообразни реакции (включително персонализирани) и интеграция с външни системи.
Работа в реално време
Обработка на потоци в реално време, без забавяне. Работи на вашия собствен хардуер.
Достъпно решение
Модулът може да бъде закупен като допълнение към лиценз Standard или Pro.
Как работи

Създайте верига
Тъй като модулът работи с аудиопоток, веригата трябва да включва източник на звук.
- Източник на звук: вграден в камерата микрофон или отделен USB/IP микрофон
- Примерна верига: „Universal Camera“ – „Voice-to-Text“ – „Preview and Archive“
- Модулът се лицензира допълнително към лиценз Xeoma Pro или Standard

Изтеглете AI ресурси
Кликнете върху иконата „Глас към текст“ във веригата, за да отворите настройките на модула. Изтеглянето на допълнителните ресурси започва автоматично при първото отваряне на настройките. Когато съобщението „Downloading in progress“ изчезне, всичко е готово.
- Допълнителните ресурси съдържат масиви от данни за изкуствения интелект и се изтеглят при заявка от сървърите на FelenaSoft
- Ресурсите се изтеглят само при нужда — това поддържа малък размер на програмата

Изберете модел за разпознаване и ключови думи
Налични са няколко AI модела за различни езици, различаващи се по размер, качество на разпознаване и натоварване на хардуера. В полето „Модел за разпознаване на реч“ изберете езика на транскрипцията (езикът на самата реч не е необходимо да се посочва) и при нужда задайте ключови думи за откриване в полето по-долу. Опциите „Показване на разпознатата реч при преглед в реално време“ и „Запазване на разпознатата реч в субтитри при запис/експортиране на архива“ позволяват наслагване на транскрипцията върху видеото на живо и в архива.
- „Ключови думи за откриване“ — модулът реагира само на избраните от вас думи или фрази
- Наслагване на транскрипция при преглед на живо и в архива
- „Запазване на данни в CSV отчет“ — транскрипцията се запазва като табличен файл на диска
- Добавете реакция след модула: запис, известие, изпращане на команда
- Макросът
%VOICE%е наличен в модулите „Изпращане на HTTP заявка“, „Изпращане на имейл“ и „Стартиране на приложение“
Интеграция с външни програми
Voice-to-Text може да се използва чрез външни програми — например за транскрибиране на VoIP разговори. Подайте .mp3 файл към модула и получите текстов резултат — дори на операторски работни станции без инсталиран Xeoma или камери. Важно: поддържат се само .mp3 файлове.
Пример за заявка чрез Xeoma API (JSON):
curl -F "audio_file=@speech.mp3" "http://192.168.0.67:10090/api?login=Administrator&password=123&speech_recognition=recognition&model=qwen3-asr-1.7b&ttl=10&language=en"
Където:
audio_file=@speech.mp3— път до аудио файла на вашия компютър192.168.0.67— IP адресът на сървъра Xeoma10090— портът на сървъра XeomaAdministrator/123— потребителско име на администратора (винаги Administrator) и паролаmodel=…— моделът за разпознаване (вижте списъка по-долу)language=en— език на транскрипцията. Ако се различава от действителния език на речта, транскрипцията автоматично ще бъде преведена на посочения език
За да запазите резултата като текстов файл, добавете >savetext.txt след командата, където savetext.txt е името на текстовия файл.
Модели за разпознаване за API:
| Име | Описание | API код |
|---|---|---|
| Базов руски | 140 MB | tone |
| Разширен руски | пунктуация, 215 MB | giga |
| Базов английски | 70 MB | zipformer |
| Базов многоезичен | пунктуация, 1 GB, 0,6 млрд. параметъра | qwen3-asr-0.6b |
| Многоезичен, подобрен | пунктуация, 2,2 GB, 1,7 млрд. параметъра | qwen3-asr-1.7b |
| Gemma4 многоезичен, базов | пунктуация, 2,2 GB, 1,7 млрд. параметъра | gemma4-e2b |
| Gemma4 многоезичен, подобрен | пунктуация, 7 GB, 12 млрд. параметъра | gemma4-12b |
Списък с езикови кодове
en — английски, zh — китайски, de — немски, es — испански, ru — руски, ko — корейски, fr — френски, ja — японски, pt — португалски, tr — турски, pl — полски, ca — каталонски, nl — нидерландски, ar — арабски, sv — шведски, it — италиански, id — индонезийски, hi — хинди, fi — фински, vi — виетнамски, he — иврит, uk — украински, el — гръцки, ms — малайски, cs — чешки, ro — румънски, da — датски, hu — унгарски, ta — тамилски, no — норвежки, th — тайски, ur — урду, hr — хърватски, bg — български, lt — литовски, la — латински, mi — маорски, ml — малаялам, cy — уелски, sk — словашки, te — телугу, fa — персийски, lv — латвийски, bn — бенгалски, sr — сръбски, az — азербайджански, sl — словенски, kn — каннада, et — естонски, mk — македонски, br — бретонски, eu — баски, is — исландски, hy — арменски, ne — непалски, mn — монголски, bs — босненски, kk — казахски, sq — албански, sw — суахили, gl — галисийски, mr — марати, pa — пенджабски, si — синхалски, km — кхмерски, sn — шона, yo — йоруба, so — сомалийски, af — африкаанс, oc — окситански, ka — грузински, be — беларуски, tg — таджикски, sd — синдхи, gu — гуджарати, am — амхарски, yi — идиш, lo — лаоски, uz — узбекски, fo — фарьорски, ht — хаитянски креолски, ps — пущунски, tk — туркменски, nn — нюношк, mt — малтийски, sa — санскрит, lb — люксембургски, my — бирмански, bo — тибетски, tl — тагалог, mg — малагасийски, as — асамски, tt — татарски, haw — хавайски, ln — лингала, ha — хауса, ba — башкирски, jw — явански, su — сундански, yue — кантонски.
Как да тествате
Изтеглете и стартирайте Xeoma. Използвайте пробната версия или активирайте лиценз за Xeoma Standard/Xeoma Pro + лиценз за допълнителния модул „Voice-to-text“.
Добавете камера ръчно или изчакайте Xeoma да открие камерите във вашата мрежа автоматично. За отделен микрофон добавете модула „Microphone“ и изберете съответния източник на звук.
Добавете модула „Voice-to-Text“ към веригата, настройте реакция при ключови думи или непрекъсната транскрипция на реч и, ако е необходимо, активирайте наслагването на транскрипцията върху изображението от камерата и записите.
Задайте реакция при събитие — запис в CSV, мобилни известия или друга.
демо лиценз
Други модули за обработка на аудио потоци
Тези модули работят самостоятелно или заедно с Voice-to-Text.
Изберете USB микрофон или отделен IP микрофон като източник на звук.
Анализира аудио потоци и задейства сигнал, когато нивото на звука надвиши зададения праг.
Разпознава автомобилни аларми, плач на дете, изстрели, викове, счупване на стъкло.
Voice-to-Text: Разпознаване на реч в Xeoma
Изпробвайте Xeoma безплатно
Въведете името и имейла си, за да получите безплатен демо лиценз. Не се изисква кредитна карта.
Получете безплатни демо лицензи за Xeoma по имейл
Пълна функционалност. Изпраща се незабавно.
Препоръчваме да не използвате имейли, съдържащи лични данни, и да не ни изпращате лични данни по друг начин. Ако въпреки това го направите, с изпращането на този формуляр потвърждавате съгласието си за обработка на вашите лични данни
Нуждаете се от нещо друго?
Модулът не покрива напълно вашите изисквания? Можем да разработим необходимите ви функции и да ги интегрираме в Xeoma като платена разработка. Вижте подробностите.
Имате въпроси? Нуждаете се от съдействие? Свържете се с нас! Ще се радваме да помогнем!
Готови ли сте да започнете?
Тествайте „Глас към текст“ с безплатен демо лиценз — не се изисква кредитна карта или лични данни.

