การวิเคราะห์เสียงด้วยปัญญาประดิษฐ์ (AI)

แปลงเสียงเป็นข้อความ

โมดูลอัจฉริยะของ Xeoma สำหรับการจดจำเสียงพูด

ไอคอนโมดูล Voice-to-Text โมดูลนี้ 'รับฟัง' สตรีมเสียงจากกล้องหรือไมโครโฟนแยกต่างหาก เพื่อรู้จำเสียงพูด ตอบสนองต่อคำสำคัญ และบันทึกบทถอดความการสนทนาในรายงาน CSV หรือแสดงข้อความซ้อนทับบนวิดีโอสด/คลังวิดีโอตามที่คุณกำหนด นอกจากนี้ยังสามารถถอดความไฟล์ .mp3 ได้ เช่น บันทึกการสนทนา วิดีโออบรม และอื่นๆ

Voice-to-Text: โมดูลอัจฉริยะสำหรับจดจำคำพูดของ Xeoma
90+ ภาษาที่รองรับการถอดความ
CSV บันทึกรายงานลงดิสก์
สตรีมสด และไฟล์ .mp3
AI โมดูลเสริม
หมายเหตุสำคัญ: โมดูลนี้อยู่ในเวอร์ชันเบต้า

ข้อควรทราบ: เวอร์ชันเบต้า

โมดูลนี้พร้อมใช้งานตั้งแต่ Xeoma 24.8.12 และอยู่ในสถานะเบต้า ดังนั้นในบางกรณีอาจข้ามคำหรือเกิดการวนซ้ำ ไม่จำเป็นต้องใช้อุปกรณ์พิเศษ: ใช้สตรีมเสียงจากกล้องหรือไมโครโฟนใดก็ได้ ร่วมกับคอมพิวเตอร์ทั่วไปที่มี GPU

กรณีการใช้งาน

รูปแบบการใช้งาน

ระบบแปลงเสียงเป็นข้อความช่วยยกระดับความปลอดภัยทั้งในชีวิตส่วนตัว ความปลอดภัยสาธารณะ และภาคธุรกิจ พร้อมทั้งเพิ่มประสิทธิภาพการดำเนินงาน

การดูแลผู้สูงอายุ

ความสามารถในการตอบสนองต่อเสียงร้องขอความช่วยเหลือได้ทันที หรือปกป้องพวกเขาจากมิจฉาชีพ

ทุกประเภทธุรกิจ

ควบคุมคุณภาพการบริการลูกค้าโดยอัตโนมัติ (เช่น ตรวจจับคำหยาบคาย)

ศูนย์บริการลูกค้า

ถอดความบันทึกการโทรเพื่อตรวจสอบการปฏิบัติตามนโยบายบริษัทและสคริปต์การสนทนา

การเฝ้าระวังเมือง

การรักษาความปลอดภัยต่อต้านการก่อการร้าย และการรู้จำคำที่บ่งบอกถึงภัยคุกคาม

การควบคุมโดยผู้ปกครอง

ช่วยปกป้องเด็กจากการถูกกลั่นแกล้งหรือการติดต่อกับมิจฉาชีพ

ตำรวจ

นอกเหนือจากกล้องติดตัวเจ้าหน้าที่ ยังสามารถถอดความการสนทนากับผู้ต้องสงสัยและตรวจจับภัยคุกคามได้

การวิจัยและการวิเคราะห์

รวบรวมข้อมูลสถิติพื้นฐานสำหรับการศึกษาด้านภาษาและความถี่ในการใช้คำ

การตลาด

ติดตามว่าลูกค้ากำลังพูดถึงแคมเปญโปรโมชันหรือมีปฏิกิริยาต่อป้ายโฆษณาอย่างไร

การกรองและระบบอัตโนมัติ

ตรวจจับวลีที่ไม่ต้องการหรือคำสำคัญเพื่อควบคุมการสนทนาแบบเจาะจง โดยไม่ต้องฟังการสนทนาทั้งหมด

จุดเด่น

จุดเด่นของโมดูลแปลงเสียงเป็นข้อความ

ไม่ต้องใช้อุปกรณ์พิเศษ

ทำงานได้บนคอมพิวเตอร์ทั่วไป รองรับกล้องและการ์ดจอเกือบทุกรุ่น

ยืดหยุ่นสูง

รองรับการตอบสนองหลากหลายรูปแบบ (รวมถึงการกำหนดค่าเอง) และผสานรวมกับระบบภายนอกได้

ทำงานแบบเรียลไทม์

ประมวลผลสตรีมได้ทันทีโดยไม่มีความหน่วง ทำงานบนฮาร์ดแวร์ของคุณเอง

โซลูชันที่คุ้มค่า

สามารถซื้อโมดูลนี้เพิ่มเติมจากไลเซนส์ Standard หรือ Pro ได้

ขั้นตอนการทำงาน

หลักการทำงาน

ตัวอย่าง Chain ที่ใช้โมดูลอัจฉริยะ Voice-to-Text
ขั้นตอนที่ 1

สร้างสายการทำงาน (Chain)

เนื่องจากโมดูลทำงานกับสตรีมเสียง คุณจึงต้องมีแหล่งกำเนิดเสียงในสายการทำงาน

  • แหล่งกำเนิดเสียง: ไมโครโฟนในตัวกล้อง หรือไมโครโฟน USB หรือ IP แยกต่างหาก
  • ตัวอย่างสายการทำงาน: “Universal Camera” – “Voice-to-Text” – “Preview and Archive”
  • โมดูลนี้ต้องซื้อไลเซนส์เพิ่มเติม จากไลเซนส์ Xeoma Pro หรือ Standard
การดาวน์โหลดทรัพยากร AI เพิ่มเติม
ขั้นตอนที่ 2

ดาวน์โหลดทรัพยากร AI

คลิกไอคอน Voice-to-Text ในเชนเพื่อเปิดการตั้งค่าโมดูล ระบบจะเริ่มดาวน์โหลดทรัพยากรเพิ่มเติมโดยอัตโนมัติเมื่อเปิดการตั้งค่าครั้งแรก เมื่อข้อความ “Downloading in progress” หายไป แสดงว่าพร้อมใช้งาน

  • ทรัพยากรเพิ่มเติมประกอบด้วยชุดข้อมูลสำหรับ AI ซึ่งจะดาวน์โหลดตามคำขอจากเซิร์ฟเวอร์ FelenaSoft
  • ดาวน์โหลดทรัพยากรเมื่อจำเป็นเท่านั้น เพื่อให้ขนาดโปรแกรมเล็กที่สุด
การเลือกโมเดล AI และภาษาในการถอดความ
ขั้นตอนที่ 3

เลือกโมเดลการรู้จำเสียงพูดและคำสำคัญ

มีโมเดล AI ให้เลือกใช้หลายรุ่นตามภาษาที่แตกต่างกัน โดยมีความแตกต่างด้านขนาด คุณภาพการรู้จำ และภาระการทำงานของฮาร์ดแวร์ ในช่อง “Speech recognition model” ให้เลือกภาษาของบทถอดความ (ไม่จำเป็นต้องระบุภาษาของคำพูดจริง) และหากจำเป็น สามารถระบุคำสำคัญสำหรับการตรวจจับในช่องด้านล่างได้ สวิตช์ “Display of recognized speech during real-time viewing” และ “Save recognized speech in subtitles when recording/exporting the archive” ช่วยให้คุณแสดงบทถอดความซ้อนทับบนวิดีโอแบบเรียลไทม์และในไฟล์บันทึกย้อนหลังได้

  • “Keywords for detection” — โมดูลจะตอบสนองเฉพาะคำหรือวลีที่คุณต้องการเท่านั้น
  • แสดงบทถอดความซ้อนทับทั้งในตัวอย่างสดและไฟล์บันทึกย้อนหลัง
  • “Save data in CSV report” — บันทึกบทถอดความลงในไฟล์สเปรดชีตบนดิสก์
  • กำหนดการตอบสนองหลังการทำงานของโมดูล: บันทึก, แจ้งเตือน, ส่งคำสั่ง
  • มาโคร %VOICE% สามารถใช้งานได้ในโมดูล “HTTP Request Sender”, “Email Sending” และ “Application Runner”
API

การรวมระบบกับโปรแกรมภายนอก

Voice-to-Text ใช้งานผ่านโปรแกรมภายนอกได้ เช่น การถอดความการสนทนา VoIP เพียงส่งไฟล์ .mp3 ไปยังโมดูลเพื่อรับผลลัพธ์เป็นข้อความ แม้บนเวิร์กสเตชันของผู้ปฏิบัติงานที่ไม่มี Xeoma หรือกล้องติดตั้งอยู่ก็ตาม สำคัญ: รองรับเฉพาะไฟล์ .mp3 เท่านั้น

ตัวอย่างการส่งคำขอผ่าน Xeoma API (JSON):

curl -F "audio_file=@speech.mp3" "http://192.168.0.67:10090/api?login=Administrator&password=123&speech_recognition=recognition&model=qwen3-asr-1.7b&ttl=10&language=en"

คำอธิบาย:

  • audio_file=@speech.mp3 — เส้นทางไปยังไฟล์เสียงในคอมพิวเตอร์ของคุณ
  • 192.168.0.67 — ที่อยู่ IP ของเซิร์ฟเวอร์ Xeoma
  • 10090 — พอร์ตของเซิร์ฟเวอร์ Xeoma
  • Administrator / 123 — ชื่อผู้ใช้ Administrator (ต้องเป็น Administrator เสมอ) และรหัสผ่าน
  • model=… — โมเดลการรู้จำ (ดูรายการด้านล่าง)
  • language=en — ภาษาของบทถอดความ หากแตกต่างจากภาษาที่พูดจริง บทถอดความจะถูกแปลเป็นภาษาที่คุณระบุโดยอัตโนมัติ

หากต้องการบันทึกผลลัพธ์เป็นไฟล์ข้อความ ให้เพิ่ม >savetext.txt ต่อท้ายคำสั่ง โดยที่ savetext.txt คือชื่อไฟล์ข้อความ

โมเดลการรู้จำสำหรับ API:

ชื่อ คำอธิบาย รหัส API
Russian basic 140 MB tone
Russian enhanced รวมเครื่องหมายวรรคตอน, 215 MB giga
English basic 70 MB zipformer
Multilingual basic เครื่องหมายวรรคตอน, 1 GB, 0.6 พันล้านพารามิเตอร์ qwen3-asr-0.6b
รองรับหลายภาษา (รุ่นปรับปรุง) เครื่องหมายวรรคตอน, 2.2 GB, 1.7 พันล้านพารามิเตอร์ qwen3-asr-1.7b
Gemma4 รองรับหลายภาษา (รุ่นพื้นฐาน) เครื่องหมายวรรคตอน, 2.2 GB, 1.7 พันล้านพารามิเตอร์ gemma4-e2b
Gemma4 รองรับหลายภาษา (รุ่นปรับปรุง) เครื่องหมายวรรคตอน, 7 GB, 12 พันล้านพารามิเตอร์ gemma4-12b

รายการรหัสภาษา

en — อังกฤษ, zh — จีน, de — เยอรมัน, es — สเปน, ru — รัสเซีย, ko — เกาหลี, fr — ฝรั่งเศส, ja — ญี่ปุ่น, pt — โปรตุเกส, tr — ตุรกี, pl — โปแลนด์, ca — กาตาลา, nl — ดัตช์, ar — อาหรับ, sv — สวีเดน, it — อิตาลี, id — อินโดนีเซีย, hi — ฮินดี, fi — ฟินแลนด์, vi — เวียดนาม, he — ฮีบรู, uk — ยูเครน, el — กรีก, ms — มลายู, cs — เช็ก, ro — โรมาเนีย, da — เดนมาร์ก, hu — ฮังการี, ta — ทมิฬ, no — นอร์เวย์, th — ไทย, ur — อูรดู, hr — โครเอเชีย, bg — บัลแกเรีย, lt — ลิทัวเนีย, la — ละติน, mi — เมารี, ml — มาลายาลัม, cy — เวลส์, sk — สโลวัก, te — เตลูกู, fa — เปอร์เซีย, lv — ลัตเวีย, bn — เบงกาลี, sr — เซอร์เบีย, az — อาเซอร์ไบจาน, sl — สโลวีเนีย, kn — กันนาดา, et — เอสโตเนีย, mk — มาซิโดเนีย, br — เบรอตง, eu — บาสก์, is — ไอซ์แลนด์, hy — อาร์เมเนีย, ne — เนปาล, mn — มองโกเลีย, bs — บอสเนีย, kk — คาซัคสถาน, sq — แอลเบเนีย, sw — สวาฮีลี, gl — กาลิเซีย, mr — มราฐี, pa — ปัญจาบ, si — สิงหล, km — เขมร, sn — โชนา, yo — โยรูบา, so — โซมาลี, af — แอฟริกานส์, oc — อ็อกซิตัน, ka — จอร์เจีย, be — เบลารุส, tg — ทาจิก, sd — สินธี, gu — คุชราต, am — อัมฮารา, yi — ยิดดิช, lo — ลาว, uz — อุซเบก, fo — แฟโร, ht — ครีโอลเฮติ, ps — พัชโต, tk — เติร์กเมน, nn — นือนอชก์, mt — มอลตา, sa — สันสกฤต, lb — ลักเซมเบิร์ก, my — พม่า, bo — ทิเบต, tl — ตากาล็อก, mg — มาลากาซี, as — อัสสัม, tt — ตาตาร์, haw — ฮาวาย, ln — ลิงกาลา, ha — เฮาซา, ba — บัชคีร์, jw — ชวา, su — ซุนดา, yue — กวางตุ้ง

เริ่มต้นใช้งาน

วิธีการทดสอบ

1
เริ่มใช้งาน Xeoma

ดาวน์โหลด และเปิดใช้งาน Xeoma ใช้ เวอร์ชันทดลอง หรือเปิดใช้งานไลเซนส์ Xeoma Standard/Xeoma Pro พร้อมไลเซนส์โมดูลเสริม “Voice-to-text”

2
เพิ่มกล้อง

เพิ่มกล้องด้วยตนเองหรือรอให้ Xeoma ค้นหากล้องในเครือข่ายของคุณโดยอัตโนมัติ หากใช้ไมโครโฟนแยกต่างหาก ให้เชื่อมต่อโมดูล “Microphone” แล้วเลือกแหล่งเสียงที่ต้องการ

3
เพิ่มโมดูล

เพิ่มโมดูล “Voice-to-Text” ลงในเชน ตั้งค่าการตอบสนองต่อคำสำคัญหรือการถอดความเสียงแบบต่อเนื่อง และหากจำเป็น สามารถเปิดใช้งานการแสดงข้อความทับบนภาพจากกล้องและวิดีโอบันทึกได้

4
ตั้งค่าการตอบสนอง

ตั้งค่าการตอบสนองต่อเหตุการณ์ เช่น บันทึกเป็น CSV, แจ้งเตือนผ่านมือถือ หรืออื่นๆ

การตั้งค่าโมดูล Voice-to-Text ใน Xeoma
เวอร์ชันทดลองมีข้อจำกัดบางประการ เพื่อให้คุณสัมผัสความสามารถของ Voice-to-Text ได้อย่างเต็มที่ เราขอแนะนำให้ขอรับไลเซนส์เดโมฟรี ซึ่งมอบสิทธิ์เข้าถึงฟีเจอร์ทั้งหมดโดยไม่มีข้อจำกัดหรือข้อผูกมัดใดๆ ใช้เพียงที่อยู่อีเมลเท่านั้น คลิกปุ่มด้านล่างเพื่อเริ่มต้น:
รับฟรี
ไลเซนส์เดโม
วิดีโอ

Voice-to-Text: การจดจำเสียงพูดใน Xeoma

ทดลองใช้ฟรี

ทดลองใช้ Xeoma ฟรี

กรอกชื่อและอีเมลของคุณเพื่อรับไลเซนส์เดโมฟรี ไม่ต้องใช้บัตรเครดิต

รับไลเซนส์เดโมฟรีของ Xeoma ทางอีเมล

ใช้งานได้เต็มรูปแบบ ส่งให้ทันที

กรุณาหลีกเลี่ยงการใช้อีเมลที่มีข้อมูลส่วนบุคคล หรือส่งข้อมูลส่วนบุคคลผ่านช่องทางอื่น หากท่านยังคงดำเนินการดังกล่าว การส่งแบบฟอร์มนี้ถือว่า ท่านยืนยันความยินยอม ในการประมวลผลข้อมูลส่วนบุคคลของท่าน

ต้องการปรับแต่งโมดูลให้ตรงตามความต้องการของคุณหรือไม่?

ต้องการข้อมูลด้านอื่นเพิ่มเติมหรือไม่?

โมดูลปัจจุบันยังไม่ตอบโจทย์การใช้งานของคุณ? เราสามารถพัฒนาฟังก์ชันที่คุณต้องการและเพิ่มเข้าไปใน Xeoma ในฐานะบริการพัฒนาซอฟต์แวร์แบบชำระเงิน ดูรายละเอียด

มีคำถามหรือต้องการความช่วยเหลือ? ติดต่อเราได้เลย! เรายินดีให้บริการ

พร้อมเริ่มต้นใช้งานหรือยัง?

ทดสอบการแปลงเสียงเป็นข้อความด้วยใบอนุญาตทดลองใช้ฟรี — ไม่ต้องใช้บัตรเครดิตหรือข้อมูลส่วนตัว