Analítica de audio con IA

Voz a Texto

Módulo inteligente de reconocimiento de voz de Xeoma

Icono del módulo Voice-to-Text El módulo «escucha» el flujo de audio de una cámara o micrófono independiente, reconoce el habla, reacciona a palabras clave y guarda la transcripción en un informe CSV o la superpone como texto en el video en vivo o grabado, según sus preferencias. También transcribe archivos .mp3: grabaciones de conversaciones, videos de capacitación, etc.

Voice-to-Text: Módulo inteligente de Xeoma para reconocimiento de voz
90+ idiomas de transcripción
Informe CSV guardado en disco
Flujos en vivo y archivos .mp3
IA módulo adicional
Nota importante: el módulo está en fase beta

Importante: versión beta

El módulo está disponible desde Xeoma 24.8.12 y se encuentra en fase beta, por lo que en algunos casos podría omitir palabras o presentar repeticiones. No requiere equipo especializado: basta con el flujo de audio de cualquier cámara o micrófono y una computadora estándar con GPU.

Casos de uso

Escenarios de aplicación

Voz a Texto mejora la seguridad en el ámbito privado, urbano y comercial, además de optimizar las operaciones empresariales.

Cuidado de adultos mayores

Reacción instantánea a pedidos de auxilio o protección contra estafadores.

Cualquier negocio

Control automatizado de la calidad del servicio al cliente (por ejemplo, detección de lenguaje ofensivo).

Call center

Transcripción de llamadas para supervisar el cumplimiento de políticas corporativas y guiones de conversación.

Vigilancia urbana

Seguridad antiterrorista y reconocimiento de palabras que indiquen peligro.

Control parental

Protección infantil contra acoso escolar o comunicación con estafadores.

Policía

Complemento para cámaras corporales: transcripción de conversaciones con un sospechoso y detección de amenazas.

Investigación y analítica

Recopilación de estadísticas en segundo plano para estudios lingüísticos y frecuencia de uso de palabras.

Marketing

Detecte si los clientes comentan una campaña promocional, su reacción ante un banner, etc.

Filtrado y automatización

Detección de frases no deseadas o palabras clave para monitorear conversaciones específicas sin necesidad de escucharlas todas.

Ventajas

Ventajas del módulo Voz a Texto

No requiere equipo especial

Funciona en computadoras estándar con prácticamente cualquier cámara y tarjeta gráfica.

Máxima flexibilidad

Diversas reacciones (incluidas las programables por el usuario) e integración con sistemas de terceros.

Funcionamiento en tiempo real

Procesamiento de flujos al instante, sin latencia. Ejecución en hardware propio.

Solución asequible

El módulo se adquiere como complemento a la licencia Standard o Pro.

Flujo de trabajo

Cómo funciona

Ejemplo de una cadena con el módulo inteligente Voice-to-Text
Paso 1

Crear una cadena

Dado que el módulo procesa un flujo de audio, se requiere una fuente de sonido en la cadena.

  • Fuente de sonido: micrófono integrado en la cámara, o micrófono USB o IP independiente
  • Ejemplo de cadena: “Cámara Universal” – “Voz a Texto” – “Vista previa y Archivo”
  • Este módulo requiere una licencia adicional a la de Xeoma Pro o Standard
Descarga de recursos adicionales de IA
Paso 2

Descargar recursos de IA

Haga clic en el icono de Voz a Texto en la cadena para abrir la configuración del módulo. La descarga de recursos adicionales iniciará automáticamente al abrir la configuración por primera vez. Cuando el mensaje “Descargando...” desaparezca, todo estará listo.

  • Los recursos adicionales contienen conjuntos de datos para inteligencia artificial y se descargan bajo demanda desde los servidores de Felenasoft
  • Los recursos se descargan solo cuando son necesarios, lo que mantiene reducido el tamaño del programa
Elección del modelo de IA y del idioma de transcripción
Paso 3

Seleccionar un modelo de reconocimiento y palabras clave

Existen diversos modelos de IA disponibles para diferentes idiomas, que varían en tamaño, calidad de reconocimiento y carga de hardware. En el campo “Modelo de reconocimiento de voz”, seleccione el idioma de la transcripción (no es necesario especificar el idioma del habla) y, si es necesario, defina palabras clave para la detección en el campo inferior. Los interruptores “Mostrar voz reconocida durante la vista en tiempo real” y “Guardar voz reconocida en subtítulos al grabar/exportar el archivo” permiten superponer la transcripción en el video en vivo y en el archivo.

  • “Palabras clave para detección”: el módulo reacciona solo a las palabras o frases que usted necesite
  • Superposición de transcripción en vista previa en vivo y en el archivo
  • “Guardar datos en informe CSV”: la transcripción se guarda en un archivo de hoja de cálculo en el disco
  • Vincule una reacción posterior al módulo: grabación, notificación o envío de comando
  • La macro %VOICE% está disponible en los módulos “Emisor de solicitudes HTTP”, “Envío de correo electrónico” y “Ejecutor de aplicaciones”
API

Integración con programas externos

Voice-to-Text puede utilizarse desde programas externos; por ejemplo, para transcribir conversaciones VoIP. Proporcione un archivo .mp3 al módulo y obtenga el resultado en texto, incluso en estaciones de operador sin Xeoma ni cámaras. Importante: solo se admiten archivos .mp3.

Ejemplo de solicitud mediante la API de Xeoma (JSON):

curl -F "audio_file=@speech.mp3" "http://192.168.0.67:10090/api?login=Administrator&password=123&speech_recognition=recognition&model=qwen3-asr-1.7b&ttl=10&language=en"

Donde:

  • audio_file=@speech.mp3: ruta al archivo de audio en su equipo
  • 192.168.0.67: la dirección IP del servidor Xeoma
  • 10090: el puerto del servidor Xeoma
  • Administrator / 123: credenciales de inicio de sesión del administrador (siempre Administrator) y contraseña
  • model=…: modelo de reconocimiento (consulte la lista a continuación)
  • language=en: idioma de la transcripción. Si difiere del idioma real del habla, la transcripción se traducirá automáticamente al idioma especificado

Para guardar el resultado como archivo de texto, agregue >savetext.txt después del comando, donde savetext.txt es el nombre del archivo de texto.

Modelos de reconocimiento para la API:

Nombre Descripción Código API
Ruso básico 140 MB tone
Ruso avanzado puntuación, 215 MB giga
Inglés básico 70 MB zipformer
Multilingüe básico puntuación, 1 GB, 0.6B de parámetros qwen3-asr-0.6b
Multilingüe avanzado puntuación, 2.2 GB, 1.7B de parámetros qwen3-asr-1.7b

Lista de códigos de idioma

en — inglés, zh — chino, de — alemán, es — español, ru — ruso, ko — coreano, fr — francés, ja — japonés, pt — portugués, tr — turco, pl — polaco, ca — catalán, nl — neerlandés, ar — árabe, sv — sueco, it — italiano, id — indonesio, hi — hindi, fi — finés, vi — vietnamita, he — hebreo, uk — ucraniano, el — griego, ms — malayo, cs — checo, ro — rumano, da — danés, hu — húngaro, ta — tamil, no — noruego, th — tailandés, ur — urdu, hr — croata, bg — búlgaro, lt — lituano, la — latín, mi — maorí, ml — malayalam, cy — galés, sk — eslovaco, te — telugu, fa — persa, lv — letón, bn — bengalí, sr — serbio, az — azerí, sl — esloveno, kn — canarés, et — estonio, mk — macedonio, br — bretón, eu — euskera, is — islandés, hy — armenio, ne — nepalí, mn — mongol, bs — bosnio, kk — kazajo, sq — albanés, sw — suajili, gl — gallego, mr — maratí, pa — panyabí, si — cingalés, km — jemer, sn — shona, yo — yoruba, so — somalí, af — afrikáans, oc — occitano, ka — georgiano, be — bielorruso, tg — tayiko, sd — sindhi, gu — guyaratí, am — amárico, yi — yidis, lo — laosiano, uz — uzbeko, fo — feroés, ht — criollo haitiano, ps — pastún, tk — turcomano, nn — nynorsk, mt — maltés, sa — sánscrito, lb — luxemburgués, my — birmano, bo — tibetano, tl — tagalo, mg — malgache, as — asamés, tt — tártaro, haw — hawaiano, ln — lingala, ha — hausa, ba — baskir, jw — javanés, su — sundanés, yue — cantonés.

Inicio rápido

Cómo probar

1
Iniciar Xeoma

Descargue e inicie Xeoma. Use la edición de prueba o active una licencia de Xeoma Standard/Xeoma Pro junto con la licencia del módulo adicional “Voice-to-text”.

2
Agregar cámara

Agregue una cámara manualmente o espere a que Xeoma detecte las cámaras en su red automáticamente. Para un micrófono externo, conecte el módulo “Microphone” y seleccione la fuente de audio correspondiente.

3
Agregar el módulo

Agregue el módulo “Voice-to-Text” a la cadena, configure una reacción ante palabras clave o la transcripción continua del habla y, si es necesario, habilite la superposición de la transcripción en la imagen de la cámara y en las grabaciones.

4
Configurar reacciones

Configure una reacción al evento: guardar en CSV, notificaciones móviles u otra acción.

Configuración del módulo Voice-to-Text en Xeoma
La edición de prueba tiene ciertas limitaciones. Para explorar Voice-to-Text a fondo, recomendamos solicitar una licencia demo gratuita. Esta otorga acceso a todas las funciones sin restricciones ni compromisos. Solo se requiere una dirección de correo electrónico. Haga clic en el botón a continuación para comenzar:
Obtener una
licencia demo gratuita
Video

Voice-to-Text: Reconocimiento de voz en Xeoma

Prueba gratuita

Pruebe Xeoma gratis

Ingrese su nombre y correo electrónico para obtener una licencia demo gratuita. No requiere tarjeta de crédito.

Recibir licencias demo gratuitas de Xeoma por correo electrónico

Funcionalidad completa. Envío instantáneo.

Le rogamos evitar el uso de direcciones de correo que contengan datos personales, así como enviarnos dicha información por cualquier otro medio. Si aun así lo hace, al enviar este formulario usted confirma su consentimiento para el tratamiento de sus datos personales

¿Necesita adaptar el módulo a sus necesidades?

¿Necesita algo más?

¿El módulo no se ajusta por completo a sus requisitos? Podemos desarrollar las funciones que necesite e integrarlas en Xeoma como desarrollo personalizado. Ver detalles.

¿Tiene preguntas o necesita asistencia? ¡Contáctenos! ¡Con gusto le ayudaremos!

¿Listo para comenzar?

Pruebe Voice-to-Text con una licencia demo gratuita; no se requiere tarjeta de crédito ni datos personales.