重要提示:Beta 版
该模块自 Xeoma 24.8.12 版本起提供,目前处于 Beta 测试阶段,偶有漏词或循环现象。无需专用设备:任何摄像机或麦克风音频流,配合搭载 GPU 的普通商用电脑即可运行。
应用场景
语音转文本技术有助于提升个人、城市及商业领域的安全性,并助力业务运营优化。
老年人看护
即时响应求救信号,或防范针对老年人的诈骗行为。
各类企业
自动监控客户服务质量(例如检测辱骂性语言)。
呼叫中心
转录通话录音,以核查公司政策执行情况及话术合规性。
城市监控
反恐安防及危险关键词识别。
家长控制
协助保护儿童免受欺凌,或识别其与诈骗者的沟通。
警方
除执法记录仪外,还可转录与嫌疑人的对话并检测威胁性言论。
研究与分析
后台采集统计数据,用于语音研究及词频分析。
市场营销
洞察客户是否正在讨论促销活动及其对广告的反应等。
过滤与自动化
检测非预期短语或关键词,实现针对性对话监控,无需逐一人工收听。
语音转文本模块优势
无需专用设备
兼容几乎所有摄像机和显卡,可在普通电脑上运行。
极高灵活性
支持多种响应方式(包括自定义编程响应),并可集成第三方系统。
实时处理
实时处理视频流,零延迟。支持本地硬件部署。
经济高效的方案
该模块可作为 Standard 或 Pro 许可证的附加组件购买。
工作原理

构建处理链
由于该模块处理音频流,因此处理链中必须包含音频源。
- 音频源:摄像机内置麦克风,或独立的 USB/IP 麦克风
- 处理链示例:“通用摄像机” – “语音转文本” – “预览与存档”
- 该模块需在 Xeoma Pro 或 Standard 许可证基础上额外授权

下载 AI 资源包
点击处理链中的“语音转文本”图标打开模块设置。首次打开时,系统将自动下载附加资源。当“正在下载”提示消失后,即表示准备就绪。
- 附加资源包含人工智能数据集,按需从 FelenaSoft 服务器下载
- 资源仅在需要时下载,以保持软件体积精简

选择识别模型和关键词
系统提供多种适用于不同语言的人工智能模型,其模型大小、识别质量及硬件负载各有差异。在“语音识别模型”字段中选择转录语言(无需指定实际语音语言),如有需要,可在下方字段中设置检测关键词。通过“实时预览时显示识别语音”和“录像/导出归档时将识别语音保存为字幕”开关,您可以在实时画面及归档视频中叠加转录文本。
- “检测关键词” — 模块仅对您指定的词语或短语做出响应
- 在实时预览及归档中叠加转录文本
- “将数据保存至 CSV 报告” — 转录内容将保存为磁盘上的电子表格文件
- 在模块后配置联动动作:录像、通知、发送命令
%VOICE%宏适用于“HTTP 请求发送器”、“邮件发送”及“应用程序启动器”模块
与第三方程序集成
外部程序可调用语音转文本功能 — 例如用于转录 VoIP 通话。只需向模块提供 .mp3 文件即可获取文本结果 — 即使操作员工作站未安装 Xeoma 或未连接摄像机亦可使用。重要提示:仅支持 .mp3 文件。
curl -F "audio_file=@speech.mp3" "http://192.168.0.67:10090/api?login=Administrator&password=123&speech_recognition=recognition&model=qwen3-asr-1.7b&ttl=10&language=en"
其中:
audio_file=@speech.mp3— 本地计算机上音频文件的路径192.168.0.67— Xeoma 服务器的 IP 地址10090— Xeoma 服务器端口Administrator/123— 管理员账号(固定为 Administrator)及密码model=…— 识别模型(见下方列表)language=en— 转录语言。若与实际语音语言不一致,转录内容将自动翻译为您指定的语言
若需将结果保存为文本文件,请在命令后添加 >savetext.txt,其中 savetext.txt 为文本文件名。
API 识别模型:
| 名称 | 说明 | API 代码 |
|---|---|---|
| 俄语基础版 | 140 MB | tone |
| 俄语增强版 | 支持标点,215 MB | giga |
| 英语基础版 | 70 MB | zipformer |
| 多语言基础版 | 标点符号,1 GB,6亿参数 | qwen3-asr-0.6b |
| 多语言增强版 | 标点符号,2.2 GB,17亿参数 | qwen3-asr-1.7b |
| Gemma4 多语言基础版 | 标点符号,2.2 GB,17亿参数 | gemma4-e2b |
| Gemma4 多语言增强版 | 标点符号,7 GB,120亿参数 | gemma4-12b |
语言代码列表
en — 英语、zh — 中文、de — 德语、es — 西班牙语、ru — 俄语、ko — 韩语、fr — 法语、ja — 日语、pt — 葡萄牙语、tr — 土耳其语、pl — 波兰语、ca — 加泰罗尼亚语、nl — 荷兰语、ar — 阿拉伯语、sv — 瑞典语、it — 意大利语、id — 印尼语、hi — 印地语、fi — 芬兰语、vi — 越南语、he — 希伯来语、uk — 乌克兰语、el — 希腊语、ms — 马来语、cs — 捷克语、ro — 罗马尼亚语、da — 丹麦语、hu — 匈牙利语、ta — 泰米尔语、no — 挪威语、th — 泰语、ur — 乌尔都语、hr — 克罗地亚语、bg — 保加利亚语、lt — 立陶宛语、la — 拉丁语、mi — 毛利语、ml — 马拉雅拉姆语、cy — 威尔士语、sk — 斯洛伐克语、te — 泰卢固语、fa — 波斯语、lv — 拉脱维亚语、bn — 孟加拉语、sr — 塞尔维亚语、az — 阿塞拜疆语、sl — 斯洛文尼亚语、kn — 卡纳达语、et — 爱沙尼亚语、mk — 马其顿语、br — 布列塔尼语、eu — 巴斯克语、is — 冰岛语、hy — 亚美尼亚语、ne — 尼泊尔语、mn — 蒙古语、bs — 波斯尼亚语、kk — 哈萨克语、sq — 阿尔巴尼亚语、sw — 斯瓦希里语、gl — 加利西亚语、mr — 马拉地语、pa — 旁遮普语、si — 僧伽罗语、km — 高棉语、sn — 绍纳语、yo — 约鲁巴语、so — 索马里语、af — 南非荷兰语、oc — 奥克语、ka — 格鲁吉亚语、be — 白俄罗斯语、tg — 塔吉克语、sd — 信德语、gu — 古吉拉特语、am — 阿姆哈拉语、yi — 意第绪语、lo — 老挝语、uz — 乌兹别克语、fo — 法罗语、ht — 海地克里奥尔语、ps — 普什图语、tk — 土库曼语、nn — 新挪威语、mt — 马耳他语、sa — 梵语、lb — 卢森堡语、my — 缅甸语、bo — 藏语、tl — 他加禄语、mg — 马达加斯加语、as — 阿萨姆语、tt — 鞑靼语、haw — 夏威夷语、ln — 林加拉语、ha — 豪萨语、ba — 巴什基尔语、jw — 爪哇语、su — 巽他语、yue — 粤语
如何测试
演示许可证
其他处理音频流的模块
这些模块可独立运行,也可与 Voice-to-Text 协同工作。
Voice-to-Text:Xeoma 中的语音识别
免费试用 Xeoma
输入您的姓名和电子邮件以获取免费演示许可证。无需信用卡。


