Речевая аналитика в системах видеонаблюдения: распознавание речи, реакция на ключевые слова, транскрипция
Речевая аналитика выводит видеонаблюдение за рамки визуального контроля, дополняя анализ видеопотока разбором звукового потока, то есть того, что произносится в зоне действия камеры. Речевая аналитика в программе для видеонаблюдения Xeoma поддерживает реагирование на ключевые слова и фразы, перевод речи в текст и автоматический перевод расшифровки на выбранный язык, что расширяет возможности контроля персонала, клиентского сервиса и безопасности. В этой статье разберём, чем речевая аналитика отличается от акустического мониторинга, как настроить реакцию на ключевые слова, как выполнить расшифровку разговоров, как работает автоматический перевод и какие микрофоны обеспечивают максимальное качество распознавания.
Что такое речевая аналитика и чем она отличается от акустического мониторинга?
Речевая аналитика — это технология автоматического анализа человеческой речи, то есть распознавания произнесённых слов. В отличие от акустического мониторинга, который реагирует на типы звуков (выстрел, крик, плач, разбитие стекла), речевая аналитика работает с содержанием сказанного — с тем, что именно говорят люди в зоне действия микрофона.
В программе для видеонаблюдения Xeoma речевая аналитика реализована модулем «Речевая аналитика» (прежнее название — «Распознавание речи»), построенным на современных языковых моделях. Модуль решает три основные задачи: реагирует на ключевые слова и фразы, записывает речь в текст и переводит иностранную речь на выбранный язык. Такой подход продолжает логику акустического мониторинга, но выводит анализ аудиопотока на новый смысловой уровень.
Как настроить реакцию на ключевые слова и фразы?
Реакция на ключевые слова настраивается вводом целевых слов и фраз в параметрах модуля «Речевая аналитика»: при их обнаружении система переходит в режим «Пропускает», то есть запускает последующие модули цепочки — реакции, дополнительные фильтры или уведомления. Это позволяет привязать конкретное действие к произнесённой фразе без постоянного участия оператора.
Например, если задать слово «скидка», а следом за модулем «Речевая аналитика» подключить модуль «Отправка Email» с прикреплением видеофрагмента, Xeoma будет фиксировать покупателей, интересующихся акциями. Механизм одинаково применим для
- позитивной аналитики (контроль того, что кассир следует скрипту и предлагает акционные товары каждому посетителю),
- негативных сценариев (выявление слов, запрещённых корпоративной политикой).
Как выполнить расшифровку разговоров и перевести речь в текст?
Расшифровка разговоров — это автоматический перевод речи в текст с его сохранением в файл табличного формата CSV. Ещё одна особенность речевой аналитики в программе для видеонаблюдения Xeoma в том, что функция расшифровки доступна как для звука, поступающего с камер и микрофонов объекта в реальном времени, так и для готовых аудиозаписей.
Обработка сторонних записей разговоров возможна в Xeoma для файлов в формате .mp3 и реализуется через команды JSON API, доступные вместе с модулем: в этом случае добавлять модуль в цепочку не требуется — достаточно работающего сервера Xeoma с активированной лицензией Xeoma Pro. Такой режим удобен для пакетной расшифровки архивов звонков и разговоров, записанных сторонними системами, — например, IP-телефонией.
Как работает автоматический перевод расшифровки речи?
Автоматический перевод расшифровки выполняется при использовании мультиязычных моделей распознавания — моделей, понимающих несколько языков. В начале работы с такими моделями в речевой аналитике программы для видеонаблюдения Xeoma предлагается указать язык, на котором преимущественно ведётся речь. Это повышает качество, поскольку модель не тратит ресурсы на определение языка и сосредотачивается на самой расшифровке, при сомнении подбирая наиболее вероятный для этого языка вариант.
При этом выбор основного языка не ограничивает систему: если прозвучит речь на иностранном языке, она также будет обработана — в этом случае вы получите расшифровку текста на выбранном основном языке.
Какие микрофоны обеспечат максимальное качество распознавания?
В среднем, обычный разговор укладывается в диапазон от 250 до 4000 герц, однако для чёткого различения высокочастотных согласных требуется 8000 герц (8 килогерц). Для оцифровки частота записи должна быть минимум вдвое выше самой высокой частоты сигнала, то есть 16 кГц. Таким образом, максимальное качество речевой аналитики достигается при записи звука с частотой не ниже 16 кГц. Более высокая частота не нужна: модель речевой аналитики Xeoma работает именно с этой частотой.
Далее рассмотрим два типовых сценария применения и требования к оборудованию для каждого из них.
Сценарий 1: распознавание речи в реальном времени (торговля, фармацевтика и т.п.)
Для эффективного распознавания речи в помещении микрофон должен чётко отделять голос от эха (реверберации) и фонового шума. Поскольку речевую аналитику зачастую совмещают с другими задачами видеонаблюдения, рассмотрим два наиболее реалистичных варианта: отдельный направленный IP-микрофон и микрофон, встроенный в камеру.
Вариант 1: отдельный микрофон.
| Параметр | Рекомендация |
|---|---|
| Тип микрофона | Активный электретный (со встроенным мини-усилителем), выносной, подключается в аудиовход камеры; питание (обычно 12 В) по тому же кабелю, что и звук |
| Диаграмма направленности | Суперкардиоидная («пушка») или двунаправленная («восьмёрка») — ловит звук в узком коридоре между собеседниками, игнорируя шум сбоку |
| Дальность до источника звука | Не более 1,5–2 м (свыше 2 м качество падает) |
| Частотный диапазон | От 100 до 8000–10 000 Гц |
| Шумоподавление / АРУ | Желательна аппаратная АРУ с ручной подстройкой (винт на корпусе) — выравнивает громкость тихого и громкого собеседников |
| Аудиокодек | AAC или MP2L2 [0.5.25]; G.711 не рекомендуется (снижение до 8 кГц) |
| Частота дискретизации | 16 кГц (16 000 Гц) |
| Канальность | Моно; разделение по ролям — программно, по тембру и громкости голосов |
Совет: При подключении активного микрофона в настройках IP-камеры необходимо переключить тип аудиовхода с Mic In на Line In (Линейный вход).
Совет: Для соединения выносного микрофона с камерой должен использоваться только экранированный кабель (или экранированная витая пара FTP), чтобы избежать электрических наводок и гула от торгового оборудования.
Вариант 2: микрофон, встроенный в камеру.
| Параметр | Рекомендация |
|---|---|
| Тип микрофона | Встроенный всенаправленный микрофон повышенной чувствительности |
| Диаграмма направленности | Всенаправленная |
| Дальность до источника звука | Не более 1,5–2 м; камера монтируется над кассовой зоной или на стене за спиной сотрудника |
| Частотный диапазон | От 100 до 8000–10 000 Гц |
| Шумоподавление / АРУ | Аппаратное шумоподавление отключено или на минимуме |
| Аудиокодек | AAC или MP2L2 [0.5.25]; G.711 не рекомендуется (снижение до 8 кГц) |
| Частота дискретизации | 16 кГц (16 000 Гц) |
| Канальность | Моно; разделение по ролям — программно, по тембру и громкости голосов |
| Примеры моделей | Hikvision DS-2CD21xx (индекс -IS); Dahua DH-IPC-HDBWxxxx (индексы -AS или -SA) |
Сценарий 2: запись разговоров операторов для последующей расшифровки (колл-центр)
Основное требование при ведении записи разговоров для их последующей расшифровки — отсечь голоса соседних операторов в офисе и записать диалог в два независимых канала. Рекомендуется профессиональная USB-гарнитура для бизнеса.
Требования к оборудованию для записи разговоров операторов
| Параметр | Рекомендация |
|---|---|
| Тип устройства | Профессиональная USB-гарнитура для бизнеса |
| Тип микрофона | Направленный (кардиоидный) с активным шумоподавлением (Noise-Cancelling) для фильтрации офисного гула |
| Частотный диапазон | От 100 до 8000 Гц или выше (поддержка HD Voice / Wideband Audio) |
| Тип подключения | Цифровой USB; аналоговые разъёмы не рекомендуются (могут провоцировать наводки и шипение материнской платы) |
| Аудиокодек на линии | G.722 или Opus |
| Формат файла | MP3 с битрейтом не ниже 64–96 kbps |
| Частота дискретизации | 16 кГц (выше — возможно, но не требуется) |
| Канальность | Стерео (разделение ролей по каналам) |
| Примеры брендов | Jabra, Poly/Plantronics, EPOS |
Примечание: сервер телефонии (IP-АТС) принимает поток в кодеках G.722 или Opus и сохраняет его в промежуточный формат WAV (PCM). Для последующей отправки в речевую аналитику этот файл конвертируется в MP3 с битрейтом не ниже 64–96 kbps (стерео).
Заключение
Речевая аналитика Xeoma расширяет возможности видеонаблюдения, добавляя к анализу изображения работу с содержанием разговорной речи. Продолжая дело акустического мониторинга — распознавания типов звуков — она применяет технологии искусственного интеллекта для более широкого спектра задач: от реагирования на ключевые слова и фразы до расшифровки разговоров и их перевода с иностранного языка. Модуль прост в настройке и нетребователен к оборудованию, а гибкая привязка к цепочке модулей и поддержка JSON API позволяют встроить его как в реальный контроль клиентского сервиса и безопасности, так и в пакетную обработку архивных аудиозаписей.
Последнее обновление: 9 июля 2026
Читайте также:
Часто задаваемые вопросы о программе Xeoma
Полное руководство пользователя Xeoma
Детектор объектов