Voz para Texto
Módulo inteligente de reconhecimento de fala da Xeoma
O módulo "ouve" o fluxo de áudio de uma câmera ou microfone independente, reconhece a fala, reage a palavras-chave e salva a transcrição das conversas em um relatório CSV ou a sobrepõe como texto no vídeo ao vivo/arquivo, conforme suas preferências. Também transcreve arquivos .mp3: gravações de conversas, vídeos de treinamento, etc.

Importante: versão beta
O módulo está disponível a partir da versão Xeoma 24.8.12 e encontra-se em fase beta; portanto, em alguns casos, pode omitir palavras ou apresentar loops. Não é necessário equipamento especializado: o fluxo de áudio de qualquer câmera ou microfone e um computador comum com GPU são suficientes.
Cenários de aplicação
O Voz para Texto aprimora a segurança na vida privada, na gestão urbana e dos cidadãos, bem como na esfera comercial, contribuindo para a otimização das operações de negócios.
Cuidados com idosos
Capacidade de reagir instantaneamente a pedidos de socorro ou proteger contra golpistas.
Qualquer negócio
Controle automatizado da qualidade do atendimento ao cliente (por exemplo, detecção de palavrões).
Call center
Transcrição de gravações de chamadas para monitorar a conformidade com as políticas da empresa e os roteiros de conversa.
Vigilância urbana
Segurança antiterrorismo e reconhecimento de palavras que indiquem perigo.
Controle parental
Auxílio na proteção de crianças contra bullying ou contato com golpistas.
Polícia
Além de câmeras corporais — transcrição de conversas com suspeitos e detecção de ameaças.
Pesquisa e análise
Coleta de estatísticas em segundo plano para estudos de fala e frequência de uso de palavras.
Marketing
Descubra se os clientes estão comentando sobre uma campanha promocional, sua reação a um banner, etc.
Filtragem e automação
Detecção de frases indesejadas ou palavras-chave para controle direcionado de conversas — sem a necessidade de ouvi-las integralmente.
Vantagens do módulo Voz para Texto
Sem necessidade de equipamento especial
Funciona em computadores comuns com praticamente qualquer câmera e placa de vídeo.
Flexibilidade total
Diversas reações (incluindo personalizadas) e integração com sistemas de terceiros.
Operação em tempo real
Processamento de fluxos em tempo real, sem latência. Executado em seu próprio hardware.
Solução acessível
O módulo pode ser adquirido como complemento às licenças Standard ou Pro.
Como funciona

Monte a cadeia
Como o módulo opera com fluxo de áudio, é necessária uma fonte de som na cadeia.
- Fonte de som: microfone integrado à câmera ou microfone USB ou IP independente
- Exemplo de cadeia: “Câmera Universal” – “Voz para Texto” – “Visualização e Arquivo”
- O módulo é licenciado adicionalmente à licença Xeoma Pro ou Standard

Baixe os recursos de IA
Clique no ícone Voz para Texto na cadeia para abrir as configurações do módulo. O download dos recursos adicionais começará automaticamente ao abrir as configurações pela primeira vez. Quando a mensagem “Download em andamento” desaparecer, tudo estará pronto.
- Os recursos adicionais contêm conjuntos de dados para inteligência artificial e são baixados sob demanda dos servidores da Felenasoft
- Os recursos são baixados apenas quando necessários — isso mantém o tamanho do programa reduzido

Escolha um modelo de reconhecimento e palavras-chave
Vários modelos de IA estão disponíveis para diferentes idiomas, variando em tamanho, qualidade de reconhecimento e carga no hardware. No campo “Modelo de reconhecimento de fala”, selecione o idioma da transcrição (não é necessário especificar o idioma da fala em si) e, se necessário, defina palavras-chave para detecção no campo abaixo. As opções “Exibir fala reconhecida durante a visualização em tempo real” e “Salvar fala reconhecida em legendas ao gravar/exportar o arquivo” permitem sobrepor a transcrição ao vídeo ao vivo e no arquivo.
- “Palavras-chave para detecção” — o módulo reage apenas às palavras ou frases desejadas
- Sobreposição de transcrição na pré-visualização ao vivo e no arquivo
- “Salvar dados em relatório CSV” — a transcrição é salva em um arquivo de planilha no disco
- Configure uma reação após o módulo: gravação, notificação, envio de comando
- A macro
%VOICE%está disponível nos módulos “Envio de Requisição HTTP”, “Envio de E-mail” e “Executor de Aplicativos”
Integração com programas externos
O Voice-to-Text pode ser utilizado por programas externos — por exemplo, para transcrever conversas VoIP. Envie um arquivo .mp3 para o módulo e obtenha o resultado em texto — mesmo em estações de operador sem câmeras ou Xeoma. Importante: apenas arquivos .mp3 são suportados.
Exemplo de solicitação via API do Xeoma (JSON):
curl -F "audio_file=@speech.mp3" "http://192.168.0.67:10090/api?login=Administrator&password=123&speech_recognition=recognition&model=qwen3-asr-1.7b&ttl=10&language=en"
Onde:
audio_file=@speech.mp3— o caminho do arquivo de áudio no seu computador192.168.0.67— o endereço IP do servidor Xeoma10090— a porta do servidor XeomaAdministrator/123— login do administrador (sempre Administrator) e senhamodel=…— o modelo de reconhecimento (veja a lista abaixo)language=en— idioma da transcrição. Se for diferente do idioma real da fala, a transcrição será traduzida automaticamente para o idioma especificado
Para salvar o resultado como um arquivo de texto, adicione >savetext.txt após o comando, onde savetext.txt é o nome do arquivo de texto.
Modelos de reconhecimento para a API:
| Nome | Descrição | Código da API |
|---|---|---|
| Russo básico | 140 MB | tone |
| Russo aprimorado | pontuação, 215 MB | giga |
| Inglês básico | 70 MB | zipformer |
| Multilíngue básico | pontuação, 1 GB, 0.6B parâmetros | qwen3-asr-0.6b |
| Multilíngue aprimorado | pontuação, 2.2 GB, 1.7B parâmetros | qwen3-asr-1.7b |
Lista de códigos de idiomas
en — inglês, zh — chinês, de — alemão, es — espanhol, ru — russo, ko — coreano, fr — francês, ja — japonês, pt — português, tr — turco, pl — polonês, ca — catalão, nl — holandês, ar — árabe, sv — sueco, it — italiano, id — indonésio, hi — híndi, fi — finlandês, vi — vietnamita, he — hebraico, uk — ucraniano, el — grego, ms — malaio, cs — tcheco, ro — romeno, da — dinamarquês, hu — húngaro, ta — tâmil, no — norueguês, th — tailandês, ur — urdu, hr — croata, bg — búlgaro, lt — lituano, la — latim, mi — maori, ml — malaiala, cy — galês, sk — eslovaco, te — telugu, fa — persa, lv — letão, bn — bengali, sr — sérvio, az — azerbaijano, sl — esloveno, kn — canarim, et — estoniano, mk — macedônio, br — bretão, eu — basco, is — islandês, hy — armênio, ne — nepalês, mn — mongol, bs — bósnio, kk — cazaque, sq — albanês, sw — suaíli, gl — galego, mr — marata, pa — panjabi, si — cingalês, km — khmer, sn — shona, yo — iorubá, so — somali, af — africâner, oc — occitano, ka — georgiano, be — bielorrusso, tg — tadjique, sd — sindi, gu — guzerate, am — amárico, yi — iídiche, lo — laosiano, uz — uzbeque, fo — feroês, ht — crioulo haitiano, ps — pashto, tk — turcomeno, nn — nynorsk, mt — maltês, sa — sânscrito, lb — luxemburguês, my — birmanês, bo — tibetano, tl — tagalo, mg — malgaxe, as — assamês, tt — tártaro, haw — havaiano, ln — lingala, ha — hauçá, ba — bashkir, jw — javanês, su — sundanês, yue — cantonês.
Como testar
Baixe e inicie o Xeoma. Use a edição de teste ou ative uma licença do Xeoma Standard/Xeoma Pro + a licença do módulo adicional “Voice-to-Text”.
Adicione uma câmera manualmente ou aguarde o Xeoma encontrar câmeras em sua rede automaticamente. Para usar um microfone separado, conecte o módulo “Microfone” e selecione a fonte de áudio apropriada.
Adicione o módulo “Voice-to-Text” à cadeia, configure uma reação para palavras-chave ou transcrição contínua de fala e, se necessário, ative a sobreposição da transcrição na imagem da câmera e nas gravações.
Defina uma reação ao evento — salvar em CSV, notificações móveis ou outra ação.
licença demo gratuita
Outros módulos que processam fluxos de áudio
Estes módulos funcionam individualmente ou em conjunto com o Voice-to-Text.
Selecione um microfone USB ou um microfone IP dedicado como fonte de áudio.
Analisa fluxos de áudio e dispara quando o nível de som ultrapassa um limite definido.
Reconhece alarmes de carros, choro de criança, tiros, gritos e vidro quebrando.
Voice-to-Text: Reconhecimento de Fala no Xeoma
Teste o Xeoma gratuitamente
Insira seu nome e e-mail para obter uma licença de demonstração gratuita. Não é necessário cartão de crédito.
Receber licenças de demonstração gratuitas do Xeoma por e-mail
Funcionalidade completa. Envio instantâneo.
Recomendamos não utilizar endereços de e-mail que contenham dados pessoais nem nos enviar dados pessoais por outros meios. Caso o faça, ao enviar este formulário, você confirma seu consentimento para o tratamento de seus dados pessoais
Precisa de algo mais?
O módulo não atende totalmente aos seus requisitos? Podemos desenvolver as funções necessárias e integrá-las ao Xeoma como desenvolvimento personalizado pago. Ver detalhes.
Tem dúvidas? Precisa de ajuda? Entre em contato conosco! Teremos prazer em ajudar!
Pronto para começar?
Teste o Voice-to-Text com uma licença de demonstração gratuita — sem necessidade de cartão de crédito ou dados pessoais.
