人工智能驱动的音频分析

语音转文字

Xeoma 语音识别智能模块

Voice-to-Text 模块图标 该模块可“监听”来自摄像机或独立麦克风的音频流,识别语音并响应关键词。您可根据偏好,将对话转录内容保存为 CSV 报告,或以文本形式叠加在实时视频/录像画面上。此外,它还支持转录 .mp3 文件(如对话录音、培训视频等)。

Voice-to-Text:Xeoma 智能语音识别模块
90+ 种转录语言
CSV 报告已保存至磁盘
实时 视频流及 .mp3 文件
AI 扩展模块
重要提示:本模块目前处于 Beta 测试阶段

重要提示:Beta 版

该模块自 Xeoma 24.8.12 版本起提供,目前处于 Beta 测试阶段,偶有漏词或循环现象。无需专用设备:任何摄像机或麦克风音频流,配合搭载 GPU 的普通商用电脑即可运行。

应用场景

应用场景

语音转文本技术有助于提升个人、城市及商业领域的安全性,并助力业务运营优化。

老年人看护

即时响应求救信号,或防范针对老年人的诈骗行为。

各类企业

自动监控客户服务质量(例如检测辱骂性语言)。

呼叫中心

转录通话录音,以核查公司政策执行情况及话术合规性。

城市监控

反恐安防及危险关键词识别。

家长控制

协助保护儿童免受欺凌,或识别其与诈骗者的沟通。

警方

除执法记录仪外,还可转录与嫌疑人的对话并检测威胁性言论。

研究与分析

后台采集统计数据,用于语音研究及词频分析。

市场营销

洞察客户是否正在讨论促销活动及其对广告的反应等。

过滤与自动化

检测非预期短语或关键词,实现针对性对话监控,无需逐一人工收听。

优势

语音转文本模块优势

无需专用设备

兼容几乎所有摄像机和显卡,可在普通电脑上运行。

极高灵活性

支持多种响应方式(包括自定义编程响应),并可集成第三方系统。

实时处理

实时处理视频流,零延迟。支持本地硬件部署。

经济高效的方案

该模块可作为 Standard 或 Pro 许可证的附加组件购买。

工作流程

工作原理

含 Voice-to-Text 智能模块的链条示例
第一步

构建处理链

由于该模块处理音频流,因此处理链中必须包含音频源。

  • 音频源:摄像机内置麦克风,或独立的 USB/IP 麦克风
  • 处理链示例:“通用摄像机” – “语音转文本” – “预览与存档”
  • 该模块需在 Xeoma Pro 或 Standard 许可证基础上额外授权
下载额外的人工智能资源
第二步

下载 AI 资源包

点击处理链中的“语音转文本”图标打开模块设置。首次打开时,系统将自动下载附加资源。当“正在下载”提示消失后,即表示准备就绪。

  • 附加资源包含人工智能数据集,按需从 FelenaSoft 服务器下载
  • 资源仅在需要时下载,以保持软件体积精简
选择人工智能模型和转写语言
第三步

选择识别模型和关键词

系统提供多种适用于不同语言的人工智能模型,其模型大小、识别质量及硬件负载各有差异。在“语音识别模型”字段中选择转录语言(无需指定实际语音语言),如有需要,可在下方字段中设置检测关键词。通过“实时预览时显示识别语音”和“录像/导出归档时将识别语音保存为字幕”开关,您可以在实时画面及归档视频中叠加转录文本。

  • “检测关键词” — 模块仅对您指定的词语或短语做出响应
  • 在实时预览及归档中叠加转录文本
  • “将数据保存至 CSV 报告” — 转录内容将保存为磁盘上的电子表格文件
  • 在模块后配置联动动作:录像、通知、发送命令
  • %VOICE% 宏适用于“HTTP 请求发送器”、“邮件发送”及“应用程序启动器”模块
API

与第三方程序集成

外部程序可调用语音转文本功能 — 例如用于转录 VoIP 通话。只需向模块提供 .mp3 文件即可获取文本结果 — 即使操作员工作站未安装 Xeoma 或未连接摄像机亦可使用。重要提示:仅支持 .mp3 文件。

通过 Xeoma API (JSON) 发起请求的示例:

curl -F "audio_file=@speech.mp3" "http://192.168.0.67:10090/api?login=Administrator&password=123&speech_recognition=recognition&model=qwen3-asr-1.7b&ttl=10&language=en"

其中:

  • audio_file=@speech.mp3 — 本地计算机上音频文件的路径
  • 192.168.0.67 — Xeoma 服务器的 IP 地址
  • 10090 — Xeoma 服务器端口
  • Administrator / 123 — 管理员账号(固定为 Administrator)及密码
  • model=… — 识别模型(见下方列表)
  • language=en — 转录语言。若与实际语音语言不一致,转录内容将自动翻译为您指定的语言

若需将结果保存为文本文件,请在命令后添加 >savetext.txt,其中 savetext.txt 为文本文件名。

API 识别模型:

名称 说明 API 代码
俄语基础版 140 MB tone
俄语增强版 支持标点,215 MB giga
英语基础版 70 MB zipformer
多语言基础版 标点符号,1 GB,6亿参数 qwen3-asr-0.6b
多语言增强版 标点符号,2.2 GB,17亿参数 qwen3-asr-1.7b
Gemma4 多语言基础版 标点符号,2.2 GB,17亿参数 gemma4-e2b
Gemma4 多语言增强版 标点符号,7 GB,120亿参数 gemma4-12b

语言代码列表

en — 英语、zh — 中文、de — 德语、es — 西班牙语、ru — 俄语、ko — 韩语、fr — 法语、ja — 日语、pt — 葡萄牙语、tr — 土耳其语、pl — 波兰语、ca — 加泰罗尼亚语、nl — 荷兰语、ar — 阿拉伯语、sv — 瑞典语、it — 意大利语、id — 印尼语、hi — 印地语、fi — 芬兰语、vi — 越南语、he — 希伯来语、uk — 乌克兰语、el — 希腊语、ms — 马来语、cs — 捷克语、ro — 罗马尼亚语、da — 丹麦语、hu — 匈牙利语、ta — 泰米尔语、no — 挪威语、th — 泰语、ur — 乌尔都语、hr — 克罗地亚语、bg — 保加利亚语、lt — 立陶宛语、la — 拉丁语、mi — 毛利语、ml — 马拉雅拉姆语、cy — 威尔士语、sk — 斯洛伐克语、te — 泰卢固语、fa — 波斯语、lv — 拉脱维亚语、bn — 孟加拉语、sr — 塞尔维亚语、az — 阿塞拜疆语、sl — 斯洛文尼亚语、kn — 卡纳达语、et — 爱沙尼亚语、mk — 马其顿语、br — 布列塔尼语、eu — 巴斯克语、is — 冰岛语、hy — 亚美尼亚语、ne — 尼泊尔语、mn — 蒙古语、bs — 波斯尼亚语、kk — 哈萨克语、sq — 阿尔巴尼亚语、sw — 斯瓦希里语、gl — 加利西亚语、mr — 马拉地语、pa — 旁遮普语、si — 僧伽罗语、km — 高棉语、sn — 绍纳语、yo — 约鲁巴语、so — 索马里语、af — 南非荷兰语、oc — 奥克语、ka — 格鲁吉亚语、be — 白俄罗斯语、tg — 塔吉克语、sd — 信德语、gu — 古吉拉特语、am — 阿姆哈拉语、yi — 意第绪语、lo — 老挝语、uz — 乌兹别克语、fo — 法罗语、ht — 海地克里奥尔语、ps — 普什图语、tk — 土库曼语、nn — 新挪威语、mt — 马耳他语、sa — 梵语、lb — 卢森堡语、my — 缅甸语、bo — 藏语、tl — 他加禄语、mg — 马达加斯加语、as — 阿萨姆语、tt — 鞑靼语、haw — 夏威夷语、ln — 林加拉语、ha — 豪萨语、ba — 巴什基尔语、jw — 爪哇语、su — 巽他语、yue — 粤语

快速入门

如何测试

1
启动 Xeoma

下载并启动 Xeoma。使用试用版,或激活 Xeoma Standard/Xeoma Pro 许可证及“Voice-to-text”附加模块许可证。

2
添加摄像机

手动添加摄像机,或等待 Xeoma 自动发现网络中的摄像机。如需使用独立麦克风,请连接“Microphone”模块并选择相应的音频源。

3
添加模块

将“Voice-to-Text”模块添加到处理链中,设置关键词触发或连续语音转写响应;如有需要,可在摄像机画面和录像上启用转写文本叠加显示。

4
设置响应

设置事件响应方式——保存至 CSV、移动端通知或其他操作。

Xeoma 中的 Voice-to-Text 模块设置
试用版存在若干功能限制。为充分体验 Voice-to-Text,建议您申请免费演示许可证。该许可证可无限制访问所有功能,无任何附加义务,仅需提供电子邮箱即可。点击下方按钮立即开始:
获取免费
演示许可证
视频

Voice-to-Text:Xeoma 中的语音识别

免费试用

免费试用 Xeoma

输入您的姓名和电子邮件以获取免费演示许可证。无需信用卡。

将 Xeoma 免费演示许可证发送至邮箱

完整功能。立即发送。

请勿在邮件正文中包含个人数据,或通过其他任何方式向我们发送个人数据。如您仍需发送,提交此表单即表示您确认同意我们处理您的个人数据

需要根据您的需求定制模块?

还需要其他帮助吗?

现有模块无法满足您的需求?我们可以为您定制开发所需功能,并以付费定制服务的形式集成到 Xeoma 中。查看详情。

有疑问?需要帮助?请联系我们! 我们很乐意为您提供帮助!

立即开始?

获取免费演示许可证,体验“语音转文字”功能——无需信用卡,无需提供个人信息。