AI 驅動音訊分析

語音轉文字

Xeoma 語音辨識智慧模組

語音轉文字模組圖示 此模組會「監聽」來自攝影機或獨立麥克風的音訊串流,辨識語音並對關鍵字做出反應。您可依偏好設定,將對話逐字稿儲存為 CSV 報告,或以文字疊加於即時影像與錄影檔中。此外,它也支援轉錄 .mp3 檔案,如對話錄音、教學影片等。

語音轉文字:Xeoma 語音識別智慧模組
90+ 種轉錄語言
CSV 報告儲存至磁碟
即時 串流與 .mp3 檔案
AI 擴充模組
重要提示:該模組目前處於 Beta 測試階段

重要:Beta 版本

此模組適用於 Xeoma 24.8.12 及以上版本,目前處於 Beta 測試階段,偶有漏字或重複處理之情形。無需專用設備:任何攝影機或麥克風的音訊串流,搭配配備 GPU 的一般市售電腦即可運行。

應用案例

應用場景

語音轉文字能強化私生活、城市管理及公民安全,同時提升商業領域的運作效率並優化業務流程。

長者照護

即時回應求救聲響,或防止長者遭受詐騙。

各類企業

自動化監控客戶服務品質(例如:偵測辱罵字詞)。

客服中心

將通話錄音轉錄為文字,以監控是否符合公司政策與對話腳本。

城市監控

反恐維安及辨識具潛在危險意圖之關鍵字。

家長監護

協助保護孩童免於霸凌或遭詐騙者誘騙。

警方

除隨身攝影機外,亦可轉錄嫌疑人對話並偵測威脅性言語。

研究與分析

背景收集統計數據,供語音相關研究與詞頻分析使用。

行銷

掌握客戶是否討論促銷活動及其對廣告看板的反應等資訊。

過濾與自動化

針對特定對話進行關鍵字或不當用語偵測,無需逐一聆聽所有錄音。

優勢

語音轉文字模組優勢

無需專用硬體

可在配備幾乎任何攝影機與顯示卡的普通電腦上運行。

高度靈活

支援多種觸發反應(含自訂程式化反應)並可整合第三方系統。

即時處理

串流即時處理零延遲,完全在您的自有硬體上運行。

高性價比解決方案

此模組可作為 Standard 或 Pro 授權的附加組件購買。

工作流程

運作原理

使用語音轉文字智慧模組的鏈結範例
步驟 1

建立鏈結

由於此模組處理音訊串流,鏈結中必須包含聲音來源。

  • 聲音來源:攝影機內建麥克風,或獨立 USB / IP 麥克風
  • 鏈結範例:「通用攝影機」–「語音轉文字」–「預覽與封存」
  • 此模組需在 Xeoma Pro 或 Standard 授權之外額外取得授權
下載額外人工智慧資源
步驟 2

下載 AI 資源

點擊鏈結中的語音轉文字圖示以開啟模組設定。首次開啟時將自動下載附加資源,待「下載中」訊息消失即表示準備就緒。

  • 附加資源包含人工智慧所需的資料集,將視需求從 Felenasoft 伺服器下載
  • 資源僅在需要時下載,以維持程式輕量化
選擇人工智慧模型與轉錄語言
步驟 3

選擇辨識模型與關鍵字

系統提供多種適用於不同語言的人工智慧模型,其模型大小、辨識品質與硬體負載各異。請在「語音辨識模型」欄位中選擇逐字稿語言(無需指定實際語音語言),如有需要,可在下方欄位設定偵測關鍵字。透過「即時檢視時顯示辨識語音」與「錄影/匯出封存檔時將辨識語音存為字幕」開關,即可將逐字稿疊加於即時影像及封存紀錄中。

  • 「偵測關鍵字」— 模組僅對您指定的單字或片語做出反應
  • 即時預覽與封存中的逐字稿疊加
  • 「儲存資料至 CSV 報告」— 逐字稿將儲存至磁碟中的試算表檔案
  • 在模組後設定觸發動作:錄影、通知或傳送指令
  • %VOICE% 巨集適用於「HTTP 請求傳送」、「電子郵件傳送」及「應用程式執行器」模組
API

與外部程式整合

外部程式亦可調用「語音轉文字」功能 — 例如轉錄 VoIP 通話內容。只需將 .mp3 檔案傳送至模組即可取得文字結果 — 即使在未安裝 Xeoma 或無攝影機的操作員工作站上也能運作。重要:僅支援 .mp3 檔案。

透過 Xeoma API (JSON) 傳送請求的範例:

curl -F "audio_file=@speech.mp3" "http://192.168.0.67:10090/api?login=Administrator&password=123&speech_recognition=recognition&model=qwen3-asr-1.7b&ttl=10&language=en"

參數說明:

  • audio_file=@speech.mp3 — 本機音訊檔案路徑
  • 192.168.0.67 — Xeoma 伺服器 IP 位址
  • 10090 — Xeoma 伺服器連接埠
  • Administrator / 123 — 管理員登入名稱(固定為 Administrator)及密碼
  • model=… — 辨識模型(參閱下方列表)
  • language=en — 逐字稿語言。若與實際語音語言不同,逐字稿將自動翻譯為您指定的語言

若要將結果儲存為文字檔,請在指令後加上 >savetext.txt,其中 savetext.txt 為文字檔案名稱。

API 辨識模型:

名稱 說明 API 代碼
俄語基礎版 140 MB tone
俄語增強版 含標點符號,215 MB giga
英語基礎版 70 MB zipformer
多語言基礎版 標點符號、1 GB、6 億個參數 qwen3-asr-0.6b
多語言增強版 標點符號、2.2 GB、17 億個參數 qwen3-asr-1.7b
Gemma4 多語言基礎版 標點符號、2.2 GB、17 億個參數 gemma4-e2b
Gemma4 多語言增強版 標點符號、7 GB、120 億個參數 gemma4-12b

語言代碼清單

en — 英語、zh — 中文、de — 德語、es — 西班牙語、ru — 俄語、ko — 韓語、fr — 法語、ja — 日語、pt — 葡萄牙語、tr — 土耳其語、pl — 波蘭語、ca — 加泰隆尼亞語、nl — 荷蘭語、ar — 阿拉伯語、sv — 瑞典語、it — 義大利語、id — 印尼語、hi — 印地語、fi — 芬蘭語、vi — 越南語、he — 希伯來語、uk — 烏克蘭語、el — 希臘語、ms — 馬來語、cs — 捷克語、ro — 羅馬尼亞語、da — 丹麥語、hu — 匈牙利語、ta — 坦米爾語、no — 挪威語、th — 泰語、ur — 烏都語、hr — 克羅埃西亞語、bg — 保加利亞語、lt — 立陶宛語、la — 拉丁語、mi — 毛利語、ml — 馬拉雅拉姆語、cy — 威爾斯語、sk — 斯洛伐克語、te — 泰盧固語、fa — 波斯語、lv — 拉脫維亞語、bn — 孟加拉語、sr — 塞爾維亞語、az — 亞塞拜然語、sl — 斯洛維尼亞語、kn — 康納達語、et — 愛沙尼亞語、mk — 馬其頓語、br — 布列塔尼語、eu — 巴斯克語、is — 冰島語、hy — 亞美尼亞語、ne — 尼泊爾語、mn — 蒙古語、bs — 波士尼亞語、kk — 哈薩克語、sq — 阿爾巴尼亞語、sw — 史瓦希利語、gl — 加利西亞語、mr — 馬拉提語、pa — 旁遮普語、si — 僧伽羅語、km — 高棉語、sn — 紹納語、yo — 約魯巴語、so — 索馬利語、af — 南非荷蘭語、oc — 奧克語、ka — 喬治亞語、be — 白俄羅斯語、tg — 塔吉克語、sd — 信德語、gu — 古吉拉特語、am — 阿姆哈拉語、yi — 意第緒語、lo — 寮語、uz — 烏茲別克語、fo — 法羅語、ht — 海地克里奧爾語、ps — 普什圖語、tk — 土庫曼語、nn — 新挪威語、mt — 馬耳他語、sa — 梵語、lb — 盧森堡語、my — 緬甸語、bo — 藏語、tl — 他加祿語、mg — 馬達加斯加語、as — 阿薩姆語、tt — 韃靼語、haw — 夏威夷語、ln — 林加拉語、ha — 豪薩語、ba — 巴什基爾語、jw — 爪哇語、su — 巽他語、yue — 粵語。

快速入門

如何測試

1
啟動 Xeoma

下載並啟動 Xeoma。使用試用版或啟用 Xeoma Standard/Xeoma Pro 授權以及「語音轉文字」附加模組授權。

2
新增攝影機

手動新增攝影機,或等待 Xeoma 自動搜尋網路中的攝影機。若要使用獨立麥克風,請連接「麥克風」模組並選擇適當的音源。

3
新增模組

將「語音轉文字」模組加入鏈結,設定關鍵字觸發反應或連續語音轉錄,並視需求在攝影機畫面與錄影檔上啟用轉錄文字疊加顯示。

4
設定反應

設定事件觸發反應 — 例如儲存為 CSV、行動裝置通知或其他方式。

Xeoma 語音轉文字模組設定
試用版設有多項限制。為深入體驗語音轉文字功能,建議您申請免費展示授權。此授權可讓您無限制使用所有功能且無需承擔任何義務,僅需提供電子郵件地址即可。請點擊下方按鈕開始:
獲取免費
演示授權
影片

語音轉文字:Xeoma 語音辨識

免費試用

免費試用 Xeoma

輸入您的姓名和電子郵件以獲取免費演示授權。無需信用卡。

將 Xeoma 免費展示授權傳送至電子郵件信箱

完整功能。立即發送。

強烈建議您避免使用包含個人資料的電子郵件,或以任何其他形式向我們傳送個人資料。若您仍選擇這麼做,提交此表單即表示您確認同意我們處理您的個人資料

需要根據您的需求調整模組?

您還需要其他協助嗎?

現有模組無法完全滿足您的需求?我們可以為您開發所需功能,並以付費客製化開發的方式整合至 Xeoma。查看詳情。

有疑問?需要協助?請與我們聯繫!我們很樂意為您提供服務!

準備好開始了嗎?

使用免費試用授權測試「語音轉文字」——無需信用卡,也無需提供個人資料。