Voz a Texto
Módulo inteligente de reconocimiento de voz de Xeoma
El módulo «escucha» el flujo de audio de una cámara o micrófono independiente, reconoce el habla, reacciona a palabras clave y guarda la transcripción en un informe CSV o la superpone como texto en el video en vivo o grabado, según sus preferencias. También transcribe archivos .mp3: grabaciones de conversaciones, videos de capacitación, etc.

Importante: versión beta
El módulo está disponible desde Xeoma 24.8.12 y se encuentra en fase beta, por lo que en algunos casos podría omitir palabras o presentar repeticiones. No requiere equipo especializado: basta con el flujo de audio de cualquier cámara o micrófono y una computadora estándar con GPU.
Escenarios de aplicación
Voz a Texto mejora la seguridad en el ámbito privado, urbano y comercial, además de optimizar las operaciones empresariales.
Cuidado de adultos mayores
Reacción instantánea a pedidos de auxilio o protección contra estafadores.
Cualquier negocio
Control automatizado de la calidad del servicio al cliente (por ejemplo, detección de lenguaje ofensivo).
Call center
Transcripción de llamadas para supervisar el cumplimiento de políticas corporativas y guiones de conversación.
Vigilancia urbana
Seguridad antiterrorista y reconocimiento de palabras que indiquen peligro.
Control parental
Protección infantil contra acoso escolar o comunicación con estafadores.
Policía
Complemento para cámaras corporales: transcripción de conversaciones con un sospechoso y detección de amenazas.
Investigación y analítica
Recopilación de estadísticas en segundo plano para estudios lingüísticos y frecuencia de uso de palabras.
Marketing
Detecte si los clientes comentan una campaña promocional, su reacción ante un banner, etc.
Filtrado y automatización
Detección de frases no deseadas o palabras clave para monitorear conversaciones específicas sin necesidad de escucharlas todas.
Ventajas del módulo Voz a Texto
No requiere equipo especial
Funciona en computadoras estándar con prácticamente cualquier cámara y tarjeta gráfica.
Máxima flexibilidad
Diversas reacciones (incluidas las programables por el usuario) e integración con sistemas de terceros.
Funcionamiento en tiempo real
Procesamiento de flujos al instante, sin latencia. Ejecución en hardware propio.
Solución asequible
El módulo se adquiere como complemento a la licencia Standard o Pro.
Cómo funciona

Crear una cadena
Dado que el módulo procesa un flujo de audio, se requiere una fuente de sonido en la cadena.
- Fuente de sonido: micrófono integrado en la cámara, o micrófono USB o IP independiente
- Ejemplo de cadena: “Cámara Universal” – “Voz a Texto” – “Vista previa y Archivo”
- Este módulo requiere una licencia adicional a la de Xeoma Pro o Standard

Descargar recursos de IA
Haga clic en el icono de Voz a Texto en la cadena para abrir la configuración del módulo. La descarga de recursos adicionales iniciará automáticamente al abrir la configuración por primera vez. Cuando el mensaje “Descargando...” desaparezca, todo estará listo.
- Los recursos adicionales contienen conjuntos de datos para inteligencia artificial y se descargan bajo demanda desde los servidores de Felenasoft
- Los recursos se descargan solo cuando son necesarios, lo que mantiene reducido el tamaño del programa

Seleccionar un modelo de reconocimiento y palabras clave
Existen diversos modelos de IA disponibles para diferentes idiomas, que varían en tamaño, calidad de reconocimiento y carga de hardware. En el campo “Modelo de reconocimiento de voz”, seleccione el idioma de la transcripción (no es necesario especificar el idioma del habla) y, si es necesario, defina palabras clave para la detección en el campo inferior. Los interruptores “Mostrar voz reconocida durante la vista en tiempo real” y “Guardar voz reconocida en subtítulos al grabar/exportar el archivo” permiten superponer la transcripción en el video en vivo y en el archivo.
- “Palabras clave para detección”: el módulo reacciona solo a las palabras o frases que usted necesite
- Superposición de transcripción en vista previa en vivo y en el archivo
- “Guardar datos en informe CSV”: la transcripción se guarda en un archivo de hoja de cálculo en el disco
- Vincule una reacción posterior al módulo: grabación, notificación o envío de comando
- La macro
%VOICE%está disponible en los módulos “Emisor de solicitudes HTTP”, “Envío de correo electrónico” y “Ejecutor de aplicaciones”
Integración con programas externos
Voice-to-Text puede utilizarse desde programas externos; por ejemplo, para transcribir conversaciones VoIP. Proporcione un archivo .mp3 al módulo y obtenga el resultado en texto, incluso en estaciones de operador sin Xeoma ni cámaras. Importante: solo se admiten archivos .mp3.
Ejemplo de solicitud mediante la API de Xeoma (JSON):
curl -F "audio_file=@speech.mp3" "http://192.168.0.67:10090/api?login=Administrator&password=123&speech_recognition=recognition&model=qwen3-asr-1.7b&ttl=10&language=en"
Donde:
audio_file=@speech.mp3: ruta al archivo de audio en su equipo192.168.0.67: la dirección IP del servidor Xeoma10090: el puerto del servidor XeomaAdministrator/123: credenciales de inicio de sesión del administrador (siempre Administrator) y contraseñamodel=…: modelo de reconocimiento (consulte la lista a continuación)language=en: idioma de la transcripción. Si difiere del idioma real del habla, la transcripción se traducirá automáticamente al idioma especificado
Para guardar el resultado como archivo de texto, agregue >savetext.txt después del comando, donde savetext.txt es el nombre del archivo de texto.
Modelos de reconocimiento para la API:
| Nombre | Descripción | Código API |
|---|---|---|
| Ruso básico | 140 MB | tone |
| Ruso avanzado | puntuación, 215 MB | giga |
| Inglés básico | 70 MB | zipformer |
| Multilingüe básico | puntuación, 1 GB, 0.6B de parámetros | qwen3-asr-0.6b |
| Multilingüe avanzado | puntuación, 2.2 GB, 1.7B de parámetros | qwen3-asr-1.7b |
Lista de códigos de idioma
en — inglés, zh — chino, de — alemán, es — español, ru — ruso, ko — coreano, fr — francés, ja — japonés, pt — portugués, tr — turco, pl — polaco, ca — catalán, nl — neerlandés, ar — árabe, sv — sueco, it — italiano, id — indonesio, hi — hindi, fi — finés, vi — vietnamita, he — hebreo, uk — ucraniano, el — griego, ms — malayo, cs — checo, ro — rumano, da — danés, hu — húngaro, ta — tamil, no — noruego, th — tailandés, ur — urdu, hr — croata, bg — búlgaro, lt — lituano, la — latín, mi — maorí, ml — malayalam, cy — galés, sk — eslovaco, te — telugu, fa — persa, lv — letón, bn — bengalí, sr — serbio, az — azerí, sl — esloveno, kn — canarés, et — estonio, mk — macedonio, br — bretón, eu — euskera, is — islandés, hy — armenio, ne — nepalí, mn — mongol, bs — bosnio, kk — kazajo, sq — albanés, sw — suajili, gl — gallego, mr — maratí, pa — panyabí, si — cingalés, km — jemer, sn — shona, yo — yoruba, so — somalí, af — afrikáans, oc — occitano, ka — georgiano, be — bielorruso, tg — tayiko, sd — sindhi, gu — guyaratí, am — amárico, yi — yidis, lo — laosiano, uz — uzbeko, fo — feroés, ht — criollo haitiano, ps — pastún, tk — turcomano, nn — nynorsk, mt — maltés, sa — sánscrito, lb — luxemburgués, my — birmano, bo — tibetano, tl — tagalo, mg — malgache, as — asamés, tt — tártaro, haw — hawaiano, ln — lingala, ha — hausa, ba — baskir, jw — javanés, su — sundanés, yue — cantonés.
Cómo probar
Descargue e inicie Xeoma. Use la edición de prueba o active una licencia de Xeoma Standard/Xeoma Pro junto con la licencia del módulo adicional “Voice-to-text”.
Agregue una cámara manualmente o espere a que Xeoma detecte las cámaras en su red automáticamente. Para un micrófono externo, conecte el módulo “Microphone” y seleccione la fuente de audio correspondiente.
Agregue el módulo “Voice-to-Text” a la cadena, configure una reacción ante palabras clave o la transcripción continua del habla y, si es necesario, habilite la superposición de la transcripción en la imagen de la cámara y en las grabaciones.
Configure una reacción al evento: guardar en CSV, notificaciones móviles u otra acción.
licencia demo gratuita
Otros módulos que procesan flujos de audio
Estos módulos funcionan de forma independiente o junto con Voice-to-Text.
Seleccione un micrófono USB o un micrófono IP externo como fuente de audio.
Analiza flujos de audio y se activa cuando el nivel de sonido supera un límite establecido.
Reconoce alarmas de vehículos, llanto de niños, disparos, gritos y vidrios rotos.
Voice-to-Text: Reconocimiento de voz en Xeoma
Pruebe Xeoma gratis
Ingrese su nombre y correo electrónico para obtener una licencia demo gratuita. No requiere tarjeta de crédito.
Recibir licencias demo gratuitas de Xeoma por correo electrónico
Funcionalidad completa. Envío instantáneo.
Le rogamos evitar el uso de direcciones de correo que contengan datos personales, así como enviarnos dicha información por cualquier otro medio. Si aun así lo hace, al enviar este formulario usted confirma su consentimiento para el tratamiento de sus datos personales
¿Necesita algo más?
¿El módulo no se ajusta por completo a sus requisitos? Podemos desarrollar las funciones que necesite e integrarlas en Xeoma como desarrollo personalizado. Ver detalles.
¿Tiene preguntas o necesita asistencia? ¡Contáctenos! ¡Con gusto le ayudaremos!
¿Listo para comenzar?
Pruebe Voice-to-Text con una licencia demo gratuita; no se requiere tarjeta de crédito ni datos personales.
