Говор у текст
Интелигентни Xeoma модул за препознавање говора
Модул „слуша“ аудио стрим са камере или засебног микрофона, препознаје говор, реагује на кључне речи и чува транскрипт разговора у CSV извештају или га приказује као текст преко видео снима уживо/архиве, у зависности од ваших подешавања. Такође може транскрибовати .mp3 датотеке: снимке разговора, едукативне видео материјале итд.

Важно: бета верзија
Модул је доступан од верзије Xeoma 24.8.12 и тренутно је у бета фази, па у неким случајевима може прескочити речи или понављати делове текста. Није потребна специјализована опрема: довољни су звучни стрим са било које камере или микрофона и стандардни рачунар са GPU-ом.
Сценарији примене
Voice-to-Text побољшава безбедност у приватном животу, јавном простору и међу грађанима, као и у комерцијалном сектору, и доприноси оптимизацији пословних процеса.
Брига о старијим особама
Могућност тренутне реакције на позив у помоћ или заштита од превараната.
Сваки посао
Аутоматска контрола квалитета корисничке подршке (на пример, детекција псовки).
Позивни центар
Транскрипција снимака позива ради праћења усклађености са корпоративном политиком и сценаријима разговора.
Градски надзор
Антитерористичка безбедност и препознавање речи које указују на опасност.
Родитељска контрола
Помоћ у заштити детета од вршњачког насиља или комуникације са преварантима.
Полиција
Поред камера на телу — транскрипција разговора са осумњиченим и детекција претњи.
Истраживање и аналитика
Аутоматско прикупљање статистике за лингвистичка истраживања и анализу учесталости речи.
Маркетинг
Сазнајте да ли клијенти разговарају о промотивној кампањи, каква им је реакција на банер итд.
Филтрирање и аутоматизација
Детекција нежељених или кључних фраза за циљану контролу разговора — без потребе за преслушавањем свих снимака.
Предности модула Говор у текст
Није потребна специјална опрема
Ради на стандардним рачунарима са готово било којом камером и графичком картицом.
Потпуна флексибилност
Различите реакције (укључујући сопствене програмабилне) и интеграција са системима трећих страна.
Рад у реалном времену
Обрада стримова у реалном времену, без кашњења. Ради на вашем хардверу.
Приступачно решење
Модул се може купити уз Standard или Pro лиценцу.
Како функционише

Креирајте ланац
Пошто модул обрађује аудио стрим, неопходан вам је извор звука у ланцу.
- Извор звука: микрофон уграђен у камеру или засебан USB или IP микрофон
- Пример ланца: „Universal Camera“ – „Voice-to-Text“ – „Preview and Archive“
- Лиценца за модул се купује додатно уз Xeoma Pro или Standard лиценцу

Преузмите AI ресурсе
Кликните на икону Говор у текст у ланцу да бисте отворили подешавања модула. Преузимање додатних ресурса почеће аутоматски при првом отварању подешавања. Када порука „Downloading in progress“ нестане, све је спремно.
- Додатни ресурси садрже скупове података за вештачку интелигенцију и преузимају се на захтев са Felenasoft сервера
- Ресурси се преузимају само када су потребни — чиме величина програма остаје мала

Изаберите модел препознавања и кључне речи
Доступно је неколико AI модела за различите језике, који се разликују по величини, квалитету препознавања и оптерећењу хардвера. У пољу „Модел за препознавање говора” изаберите језик транскрипта (језик самог говора није потребно наводити) и, по потреби, дефинишите кључне речи за детекцију у пољу испод. Прекидачи „Приказ препознатог говора током прегледа у реалном времену” и „Чување препознатог говора у титловима при снимању/извозу архиве” омогућавају приказ транскрипта преко видео снимка уживо и у архиви.
- „Кључне речи за детекцију” — модул реагује само на речи или фразе које су вам потребне
- Приказ транскрипта у прегледу уживо и у архиви
- „Сачувај податке у CSV извештај” — транскрипт се чува у датотеку табеле на диску
- Додајте реакцију након модула: снимање, обавештење, слање команде
- Макро
%VOICE%је доступан у модулима „Слање HTTP захтева”, „Слање имејла” и „Покретач апликација”
Интеграција са екстерним програмима
Voice-to-Text се може користити из спољних програма — на пример, за транскрипцију VoIP разговора. Проследите .mp3 датотеку модулу и добијте резултат као текст — чак и на радним станицама оператера где Xeoma или камере нису инсталирани. Важно: подржане су само .mp3 датотеке.
Пример захтева путем Xeoma API-ја (JSON):
curl -F "audio_file=@speech.mp3" "http://192.168.0.67:10090/api?login=Administrator&password=123&speech_recognition=recognition&model=qwen3-asr-1.7b&ttl=10&language=en"
Где је:
audio_file=@speech.mp3— путања до аудио датотеке на вашем рачунару192.168.0.67— IP адреса Xeoma сервера10090— порт Xeoma сервераAdministrator/123— Administrator корисничко име (увек Administrator) и лозинкаmodel=…— модел препознавања (погледајте листу испод)language=en— језик транскрипта. Ако се разликује од стварног језика говора, транскрипт ће бити аутоматски преведен на језик који сте навели
Да бисте сачували резултат као текстуалну датотеку, додајте >savetext.txt након команде, где је savetext.txt назив текстуалне датотеке.
Модели препознавања за API:
| Назив | Опис | API код |
|---|---|---|
| Руски основни | 140 MB | tone |
| Руски проширени | интерпункција, 215 MB | giga |
| Енглески основни | 70 MB | zipformer |
| Вишејезични основни | интерпункција, 1 GB, 0,6 милијарди параметара | qwen3-asr-0.6b |
| Вишејезични побољшани модел | интерпункција, 2,2 GB, 1,7 милијарди параметара | qwen3-asr-1.7b |
| Gemma4 вишејезични основни модел | интерпункција, 2,2 GB, 1,7 милијарди параметара | gemma4-e2b |
| Gemma4 вишејезични побољшани модел | интерпункција, 7 GB, 12 милијарди параметара | gemma4-12b |
Списак језичких кодова
en — енглески, zh — кинески, de — немачки, es — шпански, ru — руски, ko — корејски, fr — француски, ja — јапански, pt — португалски, tr — турски, pl — пољски, ca — каталонски, nl — холандски, ar — арапски, sv — шведски, it — италијански, id — индонежански, hi — хинди, fi — фински, vi — вијетнамски, he — хебрејски, uk — украјински, el — грчки, ms — малајски, cs — чешки, ro — румунски, da — дански, hu — мађарски, ta — тамилски, no — норвешки, th — тајландски, ur — урду, hr — хрватски, bg — бугарски, lt — литванијски, la — латински, mi — маорски, ml — малајалам, cy — велшки, sk — словачки, te — телугу, fa — персијски, lv — летонски, bn — бенгалски, sr — српски, az — азербејџански, sl — словеначки, kn — канадски, et — естонски, mk — македонски, br — бретонски, eu — баскијски, is — исландски, hy — јерменски, ne — непалски, mn — монголски, bs — бошњачки, kk — казашки, sq — албански, sw — свахили, gl — галицијски, mr — марати, pa — панџаби, si — синхалски, km — кмерски, sn — шона, yo — јоруба, so — сомалски, af — африканс, oc — окситански, ka — грузијски, be — белоруски, tg — таџички, sd — синдхи, gu — гуџарати, am — амхарски, yi — јидиш, lo — лаоски, uz — узбечки, fo — фарски, ht — хаићански креолски, ps — паштунски, tk — туркменски, nn — нинорск, mt — малтешки, sa — санскрит, lb — луксембуршки, my — бурмански, bo — тибетански, tl — тагалог, mg — малагашки, as — асамски, tt — татарски, haw — хавајски, ln — лингала, ha — хауса, ba — башкирски, jw — јавански, su — сундански, yue — кантонски.
Како тестирати
Преузмите и покрените Xeoma. Користите пробну верзију или активирајте лиценцу за Xeoma Standard/Xeoma Pro + лиценцу за додатни модул „Voice-to-Text“.
Додајте камеру ручно или сачекајте да Xeoma аутоматски пронађе камере у вашој мрежи. За засебан микрофон, повежите модул „Microphone“ и изаберите одговарајући извор звука.
Додајте модул „Voice-to-Text“ у ланац, подесите реакцију на кључне речи или континуирану транскрипцију говора и, по потреби, омогућите приказ транскрипта преко слике са камере и видео-снимака.
Подесите реакцију на догађај — чување у CSV формат, мобилна обавештења или било коју другу радњу.
демо лиценцу
Остали модули за обраду аудио токова
Ови модули функционишу самостално или у комбинацији са Voice-to-Text.
Изаберите USB микрофон или посебан IP микрофон као извор звука.
Анализира аудио токове и активира се када ниво звука пређе задату границу.
Препознаје ауто-аларме, дечји плач, пуцње, вриску и звук разбијања стакла.
Voice-to-Text: Препознавање говора у Xeoma
Испробајте Xeoma бесплатно
Унесите име и имејл адресу да бисте добили бесплатну демо лиценцу. Кредитна картица није потребна.
Примите бесплатне демо лиценце за Xeoma на имејл адресу
Пуна функционалност. Моментална испорука.
Молимо вас да не користите имејл адресе које садрже личне податке, нити да нам шаљете личне податке на било који други начин. Ако то ипак учините, слањем овог обрасца потврђујете свој пристанак на обраду ваших личних података
Потребно вам је нешто друго?
Модул не одговара у потпуности вашим захтевима? Можемо развити функције које су вам потребне и интегрисати их у Xeoma као услугу развоја по наруџбини. Погледајте детаље.
Имате питања? Потребна вам је помоћ? Контактирајте нас! Радо ћемо вам помоћи!
Спремни сте да почнете?
Тестирајте модул „Говор у текст“ уз бесплатну демо лиценцу — без кредитне картице и личних података.

