Аудио анализ с AI

Глас към текст

Интелигентният модул на Xeoma за разпознаване на реч

Икона на модула Voice-to-Text Модулът „слуша“ аудиопотока от камера или отделен микрофон, разпознава реч, реагира на ключови думи и запазва транскрипцията на разговорите в CSV отчет или я наслагва като текст върху видеото на живо/архива според вашите предпочитания. Може също да транскрибира .mp3 файлове: записи на разговори, обучителни видеоклипове и др.

Voice-to-Text: Интелигентният модул на Xeoma за разпознаване на реч
90+ езика за транскрибиране
CSV отчет, запазен на диск
Потоци на живо и .mp3 файлове
AI допълнителен модул
Важна бележка: модулът е в бета версия

Важно: бета версия

Модулът е наличен от версия Xeoma 24.8.12 и е в бета етап, поради което в някои случаи може да пропуска думи или да съдържа повторения. Не се изисква специализирано оборудване: подходящи са аудиопотокът от всяка камера или микрофон и стандартен компютър с GPU.

Приложения

Сценарии за приложение

Функцията „Глас към текст“ повишава сигурността в личния живот, градската среда и търговската сфера, като същевременно оптимизира бизнес процесите.

Грижа за възрастни хора

Възможност за незабавна реакция при вик за помощ или защита от измамници.

Всеки бизнес

Автоматизиран контрол на качеството на обслужване на клиенти (напр. откриване на нецензурни думи).

Кол-център

Транскрибиране на записани разговори за проверка на съответствието с фирмената политика и скриптовете за комуникация.

Градско наблюдение

Антитерористична сигурност и разпознаване на думи, сигнализиращи за опасност.

Родителски контрол

Помощ при защита на детето от тормоз или комуникация с измамници.

Полиция

Като допълнение към body-worn камерите — транскрибиране на разговори със заподозрени и откриване на заплахи.

Изследвания и анализи

Фоново събиране на статистически данни за езикови изследвания и честота на употреба на думи.

Маркетинг

Проследяване дали клиентите обсъждат промоционална кампания, каква е реакцията им към банер и др.

Филтриране и автоматизация

Откриване на нежелани или ключови фрази за целеви контрол на разговорите — без необходимост от прослушване на всички тях.

Предимства

Предимства на модула „Глас към текст“

Без нужда от специално оборудване

Работи на стандартни компютри с почти всяка камера и графична карта.

Максимална гъвкавост

Разнообразни реакции (включително персонализирани) и интеграция с външни системи.

Работа в реално време

Обработка на потоци в реално време, без забавяне. Работи на вашия собствен хардуер.

Достъпно решение

Модулът може да бъде закупен като допълнение към лиценз Standard или Pro.

Работен процес

Как работи

Пример за верига с интелигентния модул Voice-to-Text
Стъпка 1

Създайте верига

Тъй като модулът работи с аудиопоток, веригата трябва да включва източник на звук.

  • Източник на звук: вграден в камерата микрофон или отделен USB/IP микрофон
  • Примерна верига: „Universal Camera“ – „Voice-to-Text“ – „Preview and Archive“
  • Модулът се лицензира допълнително към лиценз Xeoma Pro или Standard
Изтегляне на допълнителни AI ресурси
Стъпка 2

Изтеглете AI ресурси

Кликнете върху иконата „Глас към текст“ във веригата, за да отворите настройките на модула. Изтеглянето на допълнителните ресурси започва автоматично при първото отваряне на настройките. Когато съобщението „Downloading in progress“ изчезне, всичко е готово.

  • Допълнителните ресурси съдържат масиви от данни за изкуствения интелект и се изтеглят при заявка от сървърите на FelenaSoft
  • Ресурсите се изтеглят само при нужда — това поддържа малък размер на програмата
Избор на AI модел и език за транскрипция
Стъпка 3

Изберете модел за разпознаване и ключови думи

Налични са няколко AI модела за различни езици, различаващи се по размер, качество на разпознаване и натоварване на хардуера. В полето „Модел за разпознаване на реч“ изберете езика на транскрипцията (езикът на самата реч не е необходимо да се посочва) и при нужда задайте ключови думи за откриване в полето по-долу. Опциите „Показване на разпознатата реч при преглед в реално време“ и „Запазване на разпознатата реч в субтитри при запис/експортиране на архива“ позволяват наслагване на транскрипцията върху видеото на живо и в архива.

  • „Ключови думи за откриване“ — модулът реагира само на избраните от вас думи или фрази
  • Наслагване на транскрипция при преглед на живо и в архива
  • „Запазване на данни в CSV отчет“ — транскрипцията се запазва като табличен файл на диска
  • Добавете реакция след модула: запис, известие, изпращане на команда
  • Макросът %VOICE% е наличен в модулите „Изпращане на HTTP заявка“, „Изпращане на имейл“ и „Стартиране на приложение“
API

Интеграция с външни програми

Voice-to-Text може да се използва чрез външни програми — например за транскрибиране на VoIP разговори. Подайте .mp3 файл към модула и получите текстов резултат — дори на операторски работни станции без инсталиран Xeoma или камери. Важно: поддържат се само .mp3 файлове.

Пример за заявка чрез Xeoma API (JSON):

curl -F "audio_file=@speech.mp3" "http://192.168.0.67:10090/api?login=Administrator&password=123&speech_recognition=recognition&model=qwen3-asr-1.7b&ttl=10&language=en"

Където:

  • audio_file=@speech.mp3 — път до аудио файла на вашия компютър
  • 192.168.0.67 — IP адресът на сървъра Xeoma
  • 10090 — портът на сървъра Xeoma
  • Administrator / 123 — потребителско име на администратора (винаги Administrator) и парола
  • model=… — моделът за разпознаване (вижте списъка по-долу)
  • language=en — език на транскрипцията. Ако се различава от действителния език на речта, транскрипцията автоматично ще бъде преведена на посочения език

За да запазите резултата като текстов файл, добавете >savetext.txt след командата, където savetext.txt е името на текстовия файл.

Модели за разпознаване за API:

Име Описание API код
Базов руски 140 MB tone
Разширен руски пунктуация, 215 MB giga
Базов английски 70 MB zipformer
Базов многоезичен пунктуация, 1 GB, 0,6 млрд. параметъра qwen3-asr-0.6b
Многоезичен, подобрен пунктуация, 2,2 GB, 1,7 млрд. параметъра qwen3-asr-1.7b
Gemma4 многоезичен, базов пунктуация, 2,2 GB, 1,7 млрд. параметъра gemma4-e2b
Gemma4 многоезичен, подобрен пунктуация, 7 GB, 12 млрд. параметъра gemma4-12b

Списък с езикови кодове

en — английски, zh — китайски, de — немски, es — испански, ru — руски, ko — корейски, fr — френски, ja — японски, pt — португалски, tr — турски, pl — полски, ca — каталонски, nl — нидерландски, ar — арабски, sv — шведски, it — италиански, id — индонезийски, hi — хинди, fi — фински, vi — виетнамски, he — иврит, uk — украински, el — гръцки, ms — малайски, cs — чешки, ro — румънски, da — датски, hu — унгарски, ta — тамилски, no — норвежки, th — тайски, ur — урду, hr — хърватски, bg — български, lt — литовски, la — латински, mi — маорски, ml — малаялам, cy — уелски, sk — словашки, te — телугу, fa — персийски, lv — латвийски, bn — бенгалски, sr — сръбски, az — азербайджански, sl — словенски, kn — каннада, et — естонски, mk — македонски, br — бретонски, eu — баски, is — исландски, hy — арменски, ne — непалски, mn — монголски, bs — босненски, kk — казахски, sq — албански, sw — суахили, gl — галисийски, mr — марати, pa — пенджабски, si — синхалски, km — кхмерски, sn — шона, yo — йоруба, so — сомалийски, af — африкаанс, oc — окситански, ka — грузински, be — беларуски, tg — таджикски, sd — синдхи, gu — гуджарати, am — амхарски, yi — идиш, lo — лаоски, uz — узбекски, fo — фарьорски, ht — хаитянски креолски, ps — пущунски, tk — туркменски, nn — нюношк, mt — малтийски, sa — санскрит, lb — люксембургски, my — бирмански, bo — тибетски, tl — тагалог, mg — малагасийски, as — асамски, tt — татарски, haw — хавайски, ln — лингала, ha — хауса, ba — башкирски, jw — явански, su — сундански, yue — кантонски.

Бързо стартиране

Как да тествате

1
Стартирайте Xeoma

Изтеглете и стартирайте Xeoma. Използвайте пробната версия или активирайте лиценз за Xeoma Standard/Xeoma Pro + лиценз за допълнителния модул „Voice-to-text“.

2
Добавяне на камера

Добавете камера ръчно или изчакайте Xeoma да открие камерите във вашата мрежа автоматично. За отделен микрофон добавете модула „Microphone“ и изберете съответния източник на звук.

3
Добавяне на модул

Добавете модула „Voice-to-Text“ към веригата, настройте реакция при ключови думи или непрекъсната транскрипция на реч и, ако е необходимо, активирайте наслагването на транскрипцията върху изображението от камерата и записите.

4
Настройка на реакциите

Задайте реакция при събитие — запис в CSV, мобилни известия или друга.

Настройки на модула Voice-to-Text в Xeoma
Пробната версия има редица ограничения. За да се запознаете по-добре с Voice-to-Text, препоръчваме да заявите безплатен демо лиценз. Той осигурява достъп до всички функции без ограничения и без никакви ангажименти. Изисква се само имейл адрес. Щракнете върху бутона по-долу, за да започнете:
Вземете безплатен
демо лиценз
Видео

Voice-to-Text: Разпознаване на реч в Xeoma

Безплатен пробен период

Изпробвайте Xeoma безплатно

Въведете името и имейла си, за да получите безплатен демо лиценз. Не се изисква кредитна карта.

Получете безплатни демо лицензи за Xeoma по имейл

Пълна функционалност. Изпраща се незабавно.

Препоръчваме да не използвате имейли, съдържащи лични данни, и да не ни изпращате лични данни по друг начин. Ако въпреки това го направите, с изпращането на този формуляр потвърждавате съгласието си за обработка на вашите лични данни

Имате нужда от адаптация на модула според вашите нужди?

Нуждаете се от нещо друго?

Модулът не покрива напълно вашите изисквания? Можем да разработим необходимите ви функции и да ги интегрираме в Xeoma като платена разработка. Вижте подробностите.

Имате въпроси? Нуждаете се от съдействие? Свържете се с нас! Ще се радваме да помогнем!

Готови ли сте да започнете?

Тествайте „Глас към текст“ с безплатен демо лиценз — не се изисква кредитна карта или лични данни.