Распознавание речи
на базе искусственного интеллекта
Модуль прослушивает аудиопоток с камеры или отдельного микрофона, распознаёт речь, реагирует на ключевые слова и
сохраняет расшифровку разговоров в CSV-отчёт или накладывает текст на онлайн видео/в архив — по вашему
выбору. Также умеет расшифровывать .mp3-файлы: записи разговоров, обучающие видео и т. д.
Важно: бета-версия
Модуль доступен начиная с версии 24.8.12 и находится в стадии бета-тестирования: в некоторых случаях возможны зацикливания или пропуски. Не требует специализированного оборудования — подойдёт звук с любой камеры или микрофона и обычный компьютер с видеокартой.
Сценарии применения
«Распознавание речи» помогает повышать безопасность в частной жизни, в городе и в коммерческой сфере, а также оптимизировать бизнес-процессы.
Наблюдение за пожилыми
Возможность вовремя услышать мольбу о помощи или защитить от мошенников.
Любой бизнес
Автоматический контроль качества обслуживания клиентов (например, наличие ненормативной лексики).
Колл-центр
Расшифровка записей звонков для контроля соблюдения протокола и скриптов обслуживания.
Городское наблюдение
Антитеррористическая безопасность и распознавание слов, сулящих опасность.
Родительский контроль
Помощь в защите ребёнка от травли или общения с мошенниками.
Полиция
В дополнение к нательным камерам — расшифровка диалогов с подозреваемым и обнаружение угроз.
Исследование и аналитика
Фоновый сбор статистики по вопросам речи и частотности употребления слов.
Маркетинг
Узнайте, обсуждают ли клиенты рекламную кампанию, и их реакцию на баннер и т. п.
Фильтрация и автоматизация
Обнаружение нежелательных или ключевых фраз для точечного контроля диалогов — без прослушивания всего подряд.
Преимущества модуля
Любое оборудование
Работает на обычном компьютере с практически любыми камерами и любой видеокартой.
Гибкость и многофункциональность
Различные реакции (в т.ч. свои программируемые) и интеграция со сторонними системами.
В режиме реального времени
Работает с потоками без задержек, полностью на вашем оборудовании.
Выгодное решение
Модуль можно приобрести дополнительно к лицензии Standard или Pro.
Как это работает
Постройте цепочку
Модуль показывается в списке только при запуске серверной части на подходящем оборудовании. Поскольку модуль работает со звуком, в цепочке нужен источник аудио.
- Источник звука: микрофон камеры либо отдельный USB- или IP-микрофон
- Пример цепочки: «Универсальная камера» — «Распознавание речи» — «Просмотр и архив»
- Модуль доступен по дополнительной лицензии
Загрузите ресурсы ИИ
Нажмите на иконку «Распознавания речи» в цепочке, чтобы открыть настройки. При первом открытии автоматически начнётся загрузка дополнительных ресурсов. Когда надпись «Идёт загрузка» пропадёт — всё готово.
- Ресурсы содержат массивы данных для ИИ и загружаются по запросу с серверов FelenaSoft
- Ресурсы скачиваются только когда они нужны — так программа остаётся компактной
Выберите модель распознавания и ключевые слова
Доступно несколько моделей ИИ на разных языках, разного размера, качества распознавания и нагрузки на «железо». В поле «Модель распознавания речи» выберите язык расшифровки (язык речи «в кадре» задавать не нужно) и укажите ключевые слова для распознавания, если требуется. С помощью переключателей «Отображение распознанной речи при просмотре в реальном времени» и «Сохранять распознанную речь в субтитрах при записи/экспорте архива» вы можете задать наложение расшифровки на видео онлайн и в архиве.
- «Ключевые слова для распознавания» — реакция только на нужные слова или фразы
- Наложение расшифровки онлайн и в архиве
- «Сохранять данные в CSV-отчёт» — расшифровка пишется в табличный файл на диск
- Подключите после модуля реакцию: запись, уведомление, отправку команды
- Для модулей «Отправка HTTP команд», «Отправка Email», «Запуск приложения» доступен макрос
%VOICE%
Интеграция с внешними программами
«Распознавание речи» можно вызывать из внешних программ — например, для транскрибирования разговоров интернет-телефонии. Отдайте модулю .mp3-файл и получите результат в виде текста — даже там, где нет Xeoma или камер. Поддерживаются только .mp3-файлы.
Пример запроса через API Xeoma (JSON):
curl -F "audio_file=@speech.mp3" "http://192.168.0.67:10090/api?login=Administrator&password=123&speech_recognition=recognition&model=qwen3-asr-1.7b&ttl=10&language=ru"
Где:
audio_file=@speech.mp3— путь до звукового файла на вашем компьютере192.168.0.67— IP-адрес сервера Xeoma10090— порт сервера XeomaAdministrator/123— логин администратора (всегда Administrator) и его парольmodel=…— выбор модели распознавания (см. список ниже)language=ru— язык расшифровки. Если язык речи русский, а указан «en», расшифровка будет переведена на английский
Чтобы сохранить результат в файл, допишите к команде >savetext.txt, где savetext.txt — имя текстового файла.
Модели распознавания для API:
| Название | Описание | Код для API |
|---|---|---|
| Русский базовый | 140 МБ | tone |
| Русский улучшенный | пунктуация, 215 МБ | giga |
| Английский базовый | 70 МБ | zipformer |
| Мультиязычный базовый | пунктуация, 1 ГБ, 0.6 млрд параметров | qwen3-asr-0.6b |
| Мультиязычный улучшенный | пунктуация, 2.2 ГБ, 1.7 млрд параметров | qwen3-asr-1.7b |
Список обозначений языков
en — английский, zh — китайский, de — немецкий, es — испанский, ru — русский, ko — корейский, fr — французский, ja — японский, pt — португальский, tr — турецкий, pl — польский, ca — каталонский, nl — голландский, ar — арабский, sv — шведский, it — итальянский, id — индонезийский, hi — хинди, fi — финский, vi — вьетнамский, he — иврит, uk — украинский, el — греческий, ms — малайский, cs — чешский, ro — румынский, da — датский, hu — венгерский, ta — тамильский, no — норвежский, th — тайский, ur — урду, hr — хорватский, bg — болгарский, lt — литовский, la — латинский, mi — маорийский, ml — малаялам, cy — валлийский, sk — словацкий, te — телугу, fa — персидский, lv — латышский, bn — бенгальский, sr — сербский, az — азербайджанский, sl — словенский, kn — каннада, et — эстонский, mk — македонский, br — бретонский, eu — баскский, is — исландский, hy — армянский, ne — непальский, mn — монгольский, bs — боснийский, kk — казахский, sq — албанский, sw — суахили, gl — галицкий, mr — маратхи, pa — панджаби, si — сингальский, km — кхмерский, sn — шона, yo — йоруба, so — сомали, af — африкаанс, oc — окситанский, ka — грузинский, be — белорусский, tg — таджикский, sd — синдхи, gu — гуджаратский, am — амхарский, yi — идиш, lo — лаосский, uz — узбекский, fo — фарерский, ht — гаитянский креольский, ps — пушту, tk — туркменский, nn — нюнорск, mt — мальтийский, sa — санскрит, lb — люксембургский, my — мьянма, bo — тибетский, tl — тагальский, mg — малагасский, as — ассамский, tt — татарский, haw — гавайский, ln — лингала, ha — хауса, ba — башкирский, jw — яванский, su — сунданский, yue — кантонский диалект.
Как протестировать
Скачайте и запустите Xeoma на машине с подходящим процессором. Используйте Пробный режим или активируйте лицензии (Xeoma Standard или Xeoma Pro + лицензия на модуль «Распознавание речи»).
Добавьте камеру вручную или дождитесь, пока Xeoma найдёт камеры в вашей сети автоматически. Для отдельного микрофона подключите модуль «Микрофон» и выберите источник звука.
Добавьте модуль «Распознавание речи» в цепочку, настройте реакцию на ключевые слова или непрерывную расшифровку речи, при необходимости задайте наложение расшифровки на изображение с камер и записи.
Задайте реакцию на событие — запись в .csv, мобильные уведомления или любую другую.
демо-лицензию
Поддерживаемые процессоры
Модуль показывается в списке и работает только с определёнными процессорами — Intel 64-бит:
- Intel Core, начиная с 4-го поколения (включая 10+)
- Xeon, начиная с 6-го поколения
- Atom серий «C23», «C25», «C27», «C33», «C35», «C37», «C38», «C39», «P59», «Z34», «Z35», «x5-E39», «x5-E8000»
- Intel Xeon E5-24 серии, i5-2450M и i7-2600
Распознавание можно вести на процессоре, но для быстродействия рекомендуется видеокарта (графический адаптер).
Другие модули для работы со звуком
Модули работают самостоятельно или совместно с «Распознаванием речи».
Выбор источника звука — USB-микрофон или отдельный IP-микрофон.
Анализ звуковых потоков и срабатывание при превышении заданного уровня.
Узнаёт сигнализацию авто, плач ребёнка, выстрелы, крики, разбитие стекла.
Распознавание речи в Xeoma
Попробуйте Xeoma бесплатно
Введите адрес электронной почты и имя, чтобы получить бесплатную демо-лицензию. Банковская карта не нужна.
Получить лицензии на адрес электронной почты
Полный функционал. Отправка мгновенно.
Мы призываем вас не использовать адреса электронной почты, содержащие персональные данные, и не присылать нам персональные данные иным способом. Если ваша информация содержит персональные данные, то, отправляя данную форму, вы даёте своё согласие на обработку персональных данных
Нужно что-то ещё?
Модуль не подходит именно для ваших условий? Мы можем добавить нужный функционал в Xeoma по программе платной доработки. Подробнее о программе.
Остались вопросы? Нужна помощь? Пожалуйста, свяжитесь с нами! Мы с радостью поможем.
Готовы начать?
Протестируйте распознавание речи с бесплатной демо-лицензией — без банковской карты и без персональных данных.