인공지능(AI) 기반 오디오 분석

음성-텍스트 변환

제오마 Xeoma의 음성 인식 지능형 모듈

Voice-to-Text 모듈 아이콘 이 모듈은 카메라 또는 별도 마이크의 오디오 스트림을 '청취'하여 음성을 인식하고 키워드에 반응합니다. 설정에 따라 대화 내용을 CSV 리포트로 저장하거나 라이브 영상 및 아카이브에 텍스트로 오버레이할 수 있습니다. 또한 대화 녹음, 교육 영상 등 .mp3 파일의 텍스트 변환도 지원합니다.

음성-텍스트 변환: 제오마 Xeoma의 지능형 음성 인식 모듈
90개 이상 텍스트 변환 언어 지원
CSV 리포트 디스크 저장
라이브 스트림 및 .mp3 파일
AI 추가 모듈
중요 참고 사항: 본 모듈은 베타 버전입니다

중요: 베타 버전

본 모듈은 제오마 Xeoma 24.8.12 버전부터 제공되는 베타 버전으로, 경우에 따라 단어 누락이나 반복 오류가 발생할 수 있습니다. 별도의 전용 장비는 필요하지 않으며, 카메라나 마이크의 오디오 스트림과 GPU가 탑재된 일반 PC만으로 충분히 사용할 수 있습니다.

활용 사례

적용 시나리오

음성-텍스트 변환 기능은 개인 및 공공 안전을 강화하고 상업 분야에서의 보안 수준을 높이며, 비즈니스 운영 최적화에도 기여합니다.

노인 케어

긴급 구조 요청에 즉각 대응하거나 보이스피싱 등의 사기 범죄로부터 보호할 수 있습니다.

모든 비즈니스

고객 서비스 품질 자동 관리 (예: 비속어 탐지)

콜센터

통화 녹음 텍스트 변환을 통한 사내 규정 및 상담 스크립트 준수 여부 모니터링

도시 감시

대테러 보안 강화 및 위험 키워드 인식

자녀 보호

학교 폭력 예방 및 사기꾼 접촉 차단 지원

경찰

바디캠과 연동하여 용의자와의 대화 내용을 텍스트로 변환하고 위협 요소를 탐지합니다.

연구 및 분석

음성 관련 연구 및 어휘 사용 빈도 분석을 위한 백그라운드 통계 수집

마케팅

고객의 프로모션 캠페인 언급 여부, 배너 광고 반응 등 파악

필터링 및 자동화

모든 대화를 직접 청취하지 않고도 특정 문구 또는 핵심 키워드 탐지를 통해 대화를 선별적으로 모니터링할 수 있습니다.

장점

음성-텍스트 변환 모듈의 주요 강점

특수 장비 불필요

거의 모든 카메라 및 그래픽 카드가 장착된 일반 PC에서 작동합니다.

뛰어난 유연성

사용자 지정 프로그래밍 가능한 반응을 포함한 다양한 동작 설정 및 타사 시스템 연동 지원

실시간 처리

지연 없이 스트림을 실시간 처리하며, 자체 하드웨어에서 구동됩니다.

경제적인 솔루션

Standard 또는 Pro 라이선스에 추가하여 구매할 수 있습니다.

워크플로우

작동 방식

음성 - 텍스트 변환 지능형 모듈이 적용된 체인 샘플
1단계

체인 구성

본 모듈은 오디오 스트림을 처리하므로 체인에 사운드 소스가 포함되어야 합니다.

  • 사운드 소스: 카메라 내장 마이크 또는 별도 USB/IP 마이크
  • 체인 예시: “범용 카메라” – “음성-텍스트 변환” – “미리보기 및 아카이브”
  • 본 모듈은 제오마 Xeoma Pro 또는 Standard 라이선스에 추가로 적용되는 라이선스입니다
추가 AI 리소스 다운로드
2단계

AI 리소스 다운로드

체인에서 음성-텍스트 변환 아이콘을 클릭하면 모듈 설정 창이 열립니다. 설정 창을 처음 열면 추가 리소스 다운로드가 자동으로 시작되며, "다운로드 진행 중" 메시지가 사라지면 준비가 완료됩니다.

  • 추가 리소스에는 인공지능(AI) 데이터 세트가 포함되어 있으며, 페레나소프트 Felenasoft 서버에서 요청 시에만 다운로드됩니다
  • 리소스는 필요할 때만 다운로드되므로 프로그램 용량을 최소화할 수 있습니다
AI 모델 및 전사 언어 선택
3단계

인식 모델 및 키워드 선택

다양한 언어를 지원하는 여러 인공지능(AI) 모델이 제공되며, 모델별로 크기, 인식 정확도 및 하드웨어 부하 수준이 상이합니다. “음성 인식 모델” 필드에서 전사 언어를 선택하고(실제 음성 언어는 별도 지정 불필요), 필요시 아래 필드에 탐지할 키워드를 입력하십시오. “실시간 보기 중 인식된 음성 표시” 및 “녹화/아카이브 내보내기 시 인식된 음성을 자막으로 저장” 스위치를 활성화하면 라이브 영상과 아카이브에 전사 텍스트를 오버레이할 수 있습니다.

  • “탐지 키워드” — 모듈이 지정한 단어나 문구에만 반응하도록 설정합니다
  • 라이브 미리보기 및 아카이브의 전사 텍스트 오버레이
  • “CSV 보고서에 데이터 저장” — 전사 내용을 디스크의 스프레드시트 파일로 저장합니다
  • 모듈 후속 동작 연결: 녹화, 알림, 명령 전송
  • %VOICE% 매크로는 “HTTP 요청 전송”, “이메일 전송” 및 “애플리케이션 실행” 모듈에서 사용할 수 있습니다
API

외부 프로그램 연동

Voice-to-Text는 외부 프로그램에서도 활용 가능합니다. 예를 들어 VoIP 통화 내용을 전사할 때 .mp3 파일을 모듈에 전달하면, 제오마 Xeoma나 카메라가 없는 상담원 워크스테이션에서도 텍스트 결과를 얻을 수 있습니다. 중요: .mp3 파일만 지원됩니다.

제오마 Xeoma API(JSON) 요청 예시:

curl -F "audio_file=@speech.mp3" "http://192.168.0.67:10090/api?login=Administrator&password=123&speech_recognition=recognition&model=qwen3-asr-1.7b&ttl=10&language=en"

구성 요소 설명:

  • audio_file=@speech.mp3 — 컴퓨터 내 오디오 파일 경로
  • 192.168.0.67 — 제오마 Xeoma 서버 IP 주소
  • 10090 — 제오마 Xeoma 서버 포트
  • Administrator / 123 — 관리자 로그인 아이디(항상 Administrator) 및 비밀번호
  • model=… — 인식 모델 (아래 목록 참조)
  • language=en — 전사 결과 언어입니다. 실제 음성 언어와 다를 경우, 전사 결과가 지정한 언어로 자동 번역됩니다

결과를 텍스트 파일로 저장하려면 명령어 뒤에 >savetext.txt를 추가하십시오. 여기서 savetext.txt는 저장될 텍스트 파일 이름입니다.

API용 인식 모델:

이름 설명 API 코드
러시아어 기본 140 MB tone
러시아어 확장 문장 부호 포함, 215 MB giga
영어 기본 70 MB zipformer
다국어 기본 구두점, 1 GB, 0.6B 파라미터 qwen3-asr-0.6b
다국어 지원 강화 모델 구두점, 2.2 GB, 1.7B 파라미터 qwen3-asr-1.7b
Gemma4 다국어 기본 모델 구두점, 2.2 GB, 1.7B 파라미터 gemma4-e2b
Gemma4 다국어 강화 모델 구두점, 7 GB, 12B 파라미터 gemma4-12b

언어 코드 목록

en — 영어, zh — 중국어, de — 독일어, es — 스페인어, ru — 러시아어, ko — 한국어, fr — 프랑스어, ja — 일본어, pt — 포르투갈어, tr — 튀르키예어, pl — 폴란드어, ca — 카탈루냐어, nl — 네덜란드어, ar — 아랍어, sv — 스웨덴어, it — 이탈리아어, id — 인도네시아어, hi — 힌디어, fi — 핀란드어, vi — 베트남어, he — 히브리어, uk — 우크라이나어, el — 그리스어, ms — 말레이어, cs — 체코어, ro — 루마니아어, da — 덴마크어, hu — 헝가리어, ta — 타밀어, no — 노르웨이어, th — 태국어, ur — 우르두어, hr — 크로아티아어, bg — 불가리아어, lt — 리투아니아어, la — 라틴어, mi — 마오리어, ml — 말라얄람어, cy — 웨일스어, sk — 슬로바키아어, te — 텔루구어, fa — 페르시아어, lv — 라트비아어, bn — 벵골어, sr — 세르비아어, az — 아제르바이잔어, sl — 슬로베니아어, kn — 칸나다어, et — 에스토니아어, mk — 마케도니아어, br — 브르타뉴어, eu — 바스크어, is — 아이슬란드어, hy — 아르메니아어, ne — 네팔어, mn — 몽골어, bs — 보스니아어, kk — 카자흐어, sq — 알바니아어, sw — 스와힐리어, gl — 갈리시아어, mr — 마라티어, pa — 펀잡어, si — 싱할라어, km — 크메르어, sn — 쇼나어, yo — 요루바어, so — 소말리어, af — 아프리칸스어, oc — 오크어, ka — 조지아어, be — 벨라루스어, tg — 타지크어, sd — 신디어, gu — 구자라트어, am — 암하라어, yi — 이디시어, lo — 라오어, uz — 우즈베크어, fo — 페로어, ht — 아이티 크레올어, ps — 파슈토어, tk — 투르크멘어, nn — 뉘노르스크어, mt — 몰타어, sa — 산스크리트어, lb — 룩셈부르크어, my — 미얀마어, bo — 티베트어, tl — 타갈로그어, mg — 말라가시어, as — 아삼어, tt — 타타르어, haw — 하와이어, ln — 링갈라어, ha — 하우사어, ba — 바시키르어, jw — 자바어, su — 순다어, yue — 광둥어.

빠른 시작

테스트 방법

1
제오마 Xeoma 실행

다운로드 후 제오마를 실행하십시오. 평가판을 사용하거나 제오마 Standard/제오마 Pro 라이선스 및 'Voice-to-Text' 추가 모듈 라이선스를 활성화하십시오.

2
카메라 추가

카메라를 수동으로 추가하거나 제오마가 네트워크에서 카메라를 자동으로 찾을 때까지 기다리십시오. 별도 마이크를 사용하려면 'Microphone' 모듈을 연결하고 적절한 오디오 소스를 선택하십시오.

3
모듈 추가

체인에 'Voice-to-Text' 모듈을 추가하고 키워드 또는 연속 음성 전사에 대한 반응을 설정하십시오. 필요한 경우 카메라 영상 및 녹화본에 전사 텍스트 오버레이를 활성화할 수 있습니다.

4
반응 설정

이벤트 발생 시 반응을 설정하십시오. CSV 저장, 모바일 알림 전송 등 다양한 옵션을 선택할 수 있습니다.

Xeoma Voice-to-Text 모듈 설정
평가판에는 일부 기능 제한이 있습니다. Voice-to-Text 기능을 충분히 검토하시려면 무료 데모 라이선스를 신청해 보시길 권장합니다. 이메일 주소만 입력하면 어떠한 의무 사항 없이 모든 기능을 제한 없이 사용해 볼 수 있습니다. 시작하려면 아래 버튼을 클릭하십시오
무료
데모 라이선스 받기
비디오

Voice-to-Text: 제오마의 음성 인식 기능

무료 체험

제오마 무료 체험하기

이름과 이메일을 입력하여 무료 데모 라이선스를 받으십시오. 신용카드 정보는 필요하지 않습니다.

이메일로 제오마 무료 데모 라이선스 받기

모든 기능 제공. 즉시 전송됩니다.

개인정보가 포함된 이메일 사용이나 기타 방식으로 개인정보를 전송하지 마시기 바랍니다. 그럼에도 정보를 제출하시는 경우, 본 양식 제출을 통해 귀하의 개인정보 처리에 동의한 것으로 간주됩니다

요구 사항에 맞춘 모듈 최적화가 필요하십니까?

추가로 필요한 점이 있으십니까?

기존 모듈이 요구 사항을 충족하지 못하십니까? 필요한 기능을 개발하여 제오마에 유료 맞춤 개발 형태로 추가해 드릴 수 있습니다. 자세히 보기.

궁금한 점이나 도움이 필요하신가요? 문의해 주십시오! 신속하게 도와드리겠습니다

지금 시작해 보세요

무료 데모 라이선스로 음성-텍스트 변환을 테스트해 보세요 — 신용카드 등록이나 개인정보 입력 없이 바로 이용 가능합니다.