Аудиоаналитика с ИИ

Распознавание речи

на базе искусственного интеллекта

Иконка модуля Распознавание речи Модуль прослушивает аудиопоток с камеры или отдельного микрофона, распознаёт речь, реагирует на ключевые слова и сохраняет расшифровку разговоров в CSV-отчёт или накладывает текст на онлайн видео/в архив — по вашему выбору. Также умеет расшифровывать .mp3-файлы: записи разговоров, обучающие видео и т. д.

Интеллектуальный модуль Распознавание речи
90+ языков расшифровки
CSV отчёт на диск
Онлайн и .mp3-файлы
ИИ модуль
Важное примечание: модуль в стадии бета-тестирования

Важно: бета-версия

Модуль доступен начиная с версии 24.8.12 и находится в стадии бета-тестирования: в некоторых случаях возможны зацикливания или пропуски. Не требует специализированного оборудования — подойдёт звук с любой камеры или микрофона и обычный компьютер с видеокартой.

Где применяется

Сценарии применения

«Распознавание речи» помогает повышать безопасность в частной жизни, в городе и в коммерческой сфере, а также оптимизировать бизнес-процессы.

Наблюдение за пожилыми

Возможность вовремя услышать мольбу о помощи или защитить от мошенников.

Любой бизнес

Автоматический контроль качества обслуживания клиентов (например, наличие ненормативной лексики).

Колл-центр

Расшифровка записей звонков для контроля соблюдения протокола и скриптов обслуживания.

Городское наблюдение

Антитеррористическая безопасность и распознавание слов, сулящих опасность.

Родительский контроль

Помощь в защите ребёнка от травли или общения с мошенниками.

Полиция

В дополнение к нательным камерам — расшифровка диалогов с подозреваемым и обнаружение угроз.

Исследование и аналитика

Фоновый сбор статистики по вопросам речи и частотности употребления слов.

Маркетинг

Узнайте, обсуждают ли клиенты рекламную кампанию, и их реакцию на баннер и т. п.

Фильтрация и автоматизация

Обнаружение нежелательных или ключевых фраз для точечного контроля диалогов — без прослушивания всего подряд.

Преимущества

Преимущества модуля

Любое оборудование

Работает на обычном компьютере с практически любыми камерами и любой видеокартой.

Гибкость и многофункциональность

Различные реакции (в т.ч. свои программируемые) и интеграция со сторонними системами.

В режиме реального времени

Работает с потоками без задержек, полностью на вашем оборудовании.

Выгодное решение

Модуль можно приобрести дополнительно к лицензии Standard или Pro.

Принцип работы

Как это работает

Цепочка модулей с Распознаванием речи
Шаг 1

Постройте цепочку

Модуль показывается в списке только при запуске серверной части на подходящем оборудовании. Поскольку модуль работает со звуком, в цепочке нужен источник аудио.

  • Источник звука: микрофон камеры либо отдельный USB- или IP-микрофон
  • Пример цепочки: «Универсальная камера» — «Распознавание речи» — «Просмотр и архив»
  • Модуль доступен по дополнительной лицензии
Загрузка дополнительных ресурсов ИИ
Шаг 2

Загрузите ресурсы ИИ

Нажмите на иконку «Распознавания речи» в цепочке, чтобы открыть настройки. При первом открытии автоматически начнётся загрузка дополнительных ресурсов. Когда надпись «Идёт загрузка» пропадёт — всё готово.

  • Ресурсы содержат массивы данных для ИИ и загружаются по запросу с серверов FelenaSoft
  • Ресурсы скачиваются только когда они нужны — так программа остаётся компактной
Выбор модели ИИ и языка расшифровки
Шаг 3

Выберите модель распознавания и ключевые слова

Доступно несколько моделей ИИ на разных языках, разного размера, качества распознавания и нагрузки на «железо». В поле «Модель распознавания речи» выберите язык расшифровки (язык речи «в кадре» задавать не нужно) и укажите ключевые слова для распознавания, если требуется. С помощью переключателей «Отображение распознанной речи при просмотре в реальном времени» и «Сохранять распознанную речь в субтитрах при записи/экспорте архива» вы можете задать наложение расшифровки на видео онлайн и в архиве.

  • «Ключевые слова для распознавания» — реакция только на нужные слова или фразы
  • Наложение расшифровки онлайн и в архиве
  • «Сохранять данные в CSV-отчёт» — расшифровка пишется в табличный файл на диск
  • Подключите после модуля реакцию: запись, уведомление, отправку команды
  • Для модулей «Отправка HTTP команд», «Отправка Email», «Запуск приложения» доступен макрос %VOICE%
API

Интеграция с внешними программами

«Распознавание речи» можно вызывать из внешних программ — например, для транскрибирования разговоров интернет-телефонии. Отдайте модулю .mp3-файл и получите результат в виде текста — даже там, где нет Xeoma или камер. Поддерживаются только .mp3-файлы.

Пример запроса через API Xeoma (JSON):

curl -F "audio_file=@speech.mp3" "http://192.168.0.67:10090/api?login=Administrator&password=123&speech_recognition=recognition&model=qwen3-asr-1.7b&ttl=10&language=ru"

Где:

  • audio_file=@speech.mp3 — путь до звукового файла на вашем компьютере
  • 192.168.0.67 — IP-адрес сервера Xeoma
  • 10090 — порт сервера Xeoma
  • Administrator / 123 — логин администратора (всегда Administrator) и его пароль
  • model=… — выбор модели распознавания (см. список ниже)
  • language=ru — язык расшифровки. Если язык речи русский, а указан «en», расшифровка будет переведена на английский

Чтобы сохранить результат в файл, допишите к команде >savetext.txt, где savetext.txt — имя текстового файла.

Модели распознавания для API:

Название Описание Код для API
Русский базовый140 МБtone
Русский улучшенныйпунктуация, 215 МБgiga
Английский базовый70 МБzipformer
Мультиязычный базовыйпунктуация, 1 ГБ, 0.6 млрд параметровqwen3-asr-0.6b
Мультиязычный улучшенныйпунктуация, 2.2 ГБ, 1.7 млрд параметровqwen3-asr-1.7b

Список обозначений языков

en — английский, zh — китайский, de — немецкий, es — испанский, ru — русский, ko — корейский, fr — французский, ja — японский, pt — португальский, tr — турецкий, pl — польский, ca — каталонский, nl — голландский, ar — арабский, sv — шведский, it — итальянский, id — индонезийский, hi — хинди, fi — финский, vi — вьетнамский, he — иврит, uk — украинский, el — греческий, ms — малайский, cs — чешский, ro — румынский, da — датский, hu — венгерский, ta — тамильский, no — норвежский, th — тайский, ur — урду, hr — хорватский, bg — болгарский, lt — литовский, la — латинский, mi — маорийский, ml — малаялам, cy — валлийский, sk — словацкий, te — телугу, fa — персидский, lv — латышский, bn — бенгальский, sr — сербский, az — азербайджанский, sl — словенский, kn — каннада, et — эстонский, mk — македонский, br — бретонский, eu — баскский, is — исландский, hy — армянский, ne — непальский, mn — монгольский, bs — боснийский, kk — казахский, sq — албанский, sw — суахили, gl — галицкий, mr — маратхи, pa — панджаби, si — сингальский, km — кхмерский, sn — шона, yo — йоруба, so — сомали, af — африкаанс, oc — окситанский, ka — грузинский, be — белорусский, tg — таджикский, sd — синдхи, gu — гуджаратский, am — амхарский, yi — идиш, lo — лаосский, uz — узбекский, fo — фарерский, ht — гаитянский креольский, ps — пушту, tk — туркменский, nn — нюнорск, mt — мальтийский, sa — санскрит, lb — люксембургский, my — мьянма, bo — тибетский, tl — тагальский, mg — малагасский, as — ассамский, tt — татарский, haw — гавайский, ln — лингала, ha — хауса, ba — башкирский, jw — яванский, su — сунданский, yue — кантонский диалект.

Быстрый старт

Как протестировать

1
Запустите Xeoma

Скачайте и запустите Xeoma на машине с подходящим процессором. Используйте Пробный режим или активируйте лицензии (Xeoma Standard или Xeoma Pro + лицензия на модуль «Распознавание речи»).

2
Добавьте камеру

Добавьте камеру вручную или дождитесь, пока Xeoma найдёт камеры в вашей сети автоматически. Для отдельного микрофона подключите модуль «Микрофон» и выберите источник звука.

3
Добавьте модуль

Добавьте модуль «Распознавание речи» в цепочку, настройте реакцию на ключевые слова или непрерывную расшифровку речи, при необходимости задайте наложение расшифровки на изображение с камер и записи.

4
Настройте реакции

Задайте реакцию на событие — запись в .csv, мобильные уведомления или любую другую.

Настройки модуля Распознавание речи в Xeoma
Пробная редакция имеет ряд ограничений. Для более полноценного знакомства с Распознаванием речи рекомендуем запросить бесплатную демо-лицензию. Она открывает доступ ко всем функциям без ограничений без каких-либо обязательств. Нужен только адрес почты. Нажмите кнопку ниже, чтобы начать:
Получить бесплатную
демо-лицензию
Ограничения по поддерживаемым процессорам

Поддерживаемые процессоры

Модуль показывается в списке и работает только с определёнными процессорами — Intel 64-бит:

  • Intel Core, начиная с 4-го поколения (включая 10+)
  • Xeon, начиная с 6-го поколения
  • Atom серий «C23», «C25», «C27», «C33», «C35», «C37», «C38», «C39», «P59», «Z34», «Z35», «x5-E39», «x5-E8000»
  • Intel Xeon E5-24 серии, i5-2450M и i7-2600

Распознавание можно вести на процессоре, но для быстродействия рекомендуется видеокарта (графический адаптер).

Видео

Распознавание речи в Xeoma

Бесплатный тест

Попробуйте Xeoma бесплатно

Введите адрес электронной почты и имя, чтобы получить бесплатную демо-лицензию. Банковская карта не нужна.

Получить лицензии на адрес электронной почты

Полный функционал. Отправка мгновенно.

Мы призываем вас не использовать адреса электронной почты, содержащие персональные данные, и не присылать нам персональные данные иным способом. Если ваша информация содержит персональные данные, то, отправляя данную форму, вы даёте своё согласие на обработку персональных данных

Нужна доработка модуля под ваши условия?

Нужно что-то ещё?

Модуль не подходит именно для ваших условий? Мы можем добавить нужный функционал в Xeoma по программе платной доработки. Подробнее о программе.

Остались вопросы? Нужна помощь? Пожалуйста, свяжитесь с нами! Мы с радостью поможем.

Готовы начать?

Протестируйте распознавание речи с бесплатной демо-лицензией — без банковской карты и без персональных данных.