Análise de áudio com IA

Voz para Texto

Módulo inteligente de reconhecimento de fala da Xeoma

Ícone do módulo Voice-to-Text O módulo "ouve" o fluxo de áudio de uma câmera ou microfone independente, reconhece a fala, reage a palavras-chave e salva a transcrição das conversas em um relatório CSV ou a sobrepõe como texto no vídeo ao vivo/arquivo, conforme suas preferências. Também transcreve arquivos .mp3: gravações de conversas, vídeos de treinamento, etc.

Voice-to-Text: módulo inteligente de reconhecimento de fala do Xeoma
90+ idiomas de transcrição
Relatório CSV salvo em disco
Fluxos ao vivo e arquivos .mp3
IA módulo adicional
Nota importante: o módulo está em beta

Importante: versão beta

O módulo está disponível a partir da versão Xeoma 24.8.12 e encontra-se em fase beta; portanto, em alguns casos, pode omitir palavras ou apresentar loops. Não é necessário equipamento especializado: o fluxo de áudio de qualquer câmera ou microfone e um computador comum com GPU são suficientes.

Casos de uso

Cenários de aplicação

O Voz para Texto aprimora a segurança na vida privada, na gestão urbana e dos cidadãos, bem como na esfera comercial, contribuindo para a otimização das operações de negócios.

Cuidados com idosos

Capacidade de reagir instantaneamente a pedidos de socorro ou proteger contra golpistas.

Qualquer negócio

Controle automatizado da qualidade do atendimento ao cliente (por exemplo, detecção de palavrões).

Call center

Transcrição de gravações de chamadas para monitorar a conformidade com as políticas da empresa e os roteiros de conversa.

Vigilância urbana

Segurança antiterrorismo e reconhecimento de palavras que indiquem perigo.

Controle parental

Auxílio na proteção de crianças contra bullying ou contato com golpistas.

Polícia

Além de câmeras corporais — transcrição de conversas com suspeitos e detecção de ameaças.

Pesquisa e análise

Coleta de estatísticas em segundo plano para estudos de fala e frequência de uso de palavras.

Marketing

Descubra se os clientes estão comentando sobre uma campanha promocional, sua reação a um banner, etc.

Filtragem e automação

Detecção de frases indesejadas ou palavras-chave para controle direcionado de conversas — sem a necessidade de ouvi-las integralmente.

Vantagens

Vantagens do módulo Voz para Texto

Sem necessidade de equipamento especial

Funciona em computadores comuns com praticamente qualquer câmera e placa de vídeo.

Flexibilidade total

Diversas reações (incluindo personalizadas) e integração com sistemas de terceiros.

Operação em tempo real

Processamento de fluxos em tempo real, sem latência. Executado em seu próprio hardware.

Solução acessível

O módulo pode ser adquirido como complemento às licenças Standard ou Pro.

Fluxo de trabalho

Como funciona

Exemplo de cadeia com o módulo inteligente Voice-to-Text
Passo 1

Monte a cadeia

Como o módulo opera com fluxo de áudio, é necessária uma fonte de som na cadeia.

  • Fonte de som: microfone integrado à câmera ou microfone USB ou IP independente
  • Exemplo de cadeia: “Câmera Universal” – “Voz para Texto” – “Visualização e Arquivo”
  • O módulo é licenciado adicionalmente à licença Xeoma Pro ou Standard
Baixando recursos adicionais de IA
Passo 2

Baixe os recursos de IA

Clique no ícone Voz para Texto na cadeia para abrir as configurações do módulo. O download dos recursos adicionais começará automaticamente ao abrir as configurações pela primeira vez. Quando a mensagem “Download em andamento” desaparecer, tudo estará pronto.

  • Os recursos adicionais contêm conjuntos de dados para inteligência artificial e são baixados sob demanda dos servidores da Felenasoft
  • Os recursos são baixados apenas quando necessários — isso mantém o tamanho do programa reduzido
Escolhendo o modelo de IA e o idioma de transcrição
Passo 3

Escolha um modelo de reconhecimento e palavras-chave

Vários modelos de IA estão disponíveis para diferentes idiomas, variando em tamanho, qualidade de reconhecimento e carga no hardware. No campo “Modelo de reconhecimento de fala”, selecione o idioma da transcrição (não é necessário especificar o idioma da fala em si) e, se necessário, defina palavras-chave para detecção no campo abaixo. As opções “Exibir fala reconhecida durante a visualização em tempo real” e “Salvar fala reconhecida em legendas ao gravar/exportar o arquivo” permitem sobrepor a transcrição ao vídeo ao vivo e no arquivo.

  • “Palavras-chave para detecção” — o módulo reage apenas às palavras ou frases desejadas
  • Sobreposição de transcrição na pré-visualização ao vivo e no arquivo
  • “Salvar dados em relatório CSV” — a transcrição é salva em um arquivo de planilha no disco
  • Configure uma reação após o módulo: gravação, notificação, envio de comando
  • A macro %VOICE% está disponível nos módulos “Envio de Requisição HTTP”, “Envio de E-mail” e “Executor de Aplicativos”
API

Integração com programas externos

O Voice-to-Text pode ser utilizado por programas externos — por exemplo, para transcrever conversas VoIP. Envie um arquivo .mp3 para o módulo e obtenha o resultado em texto — mesmo em estações de operador sem câmeras ou Xeoma. Importante: apenas arquivos .mp3 são suportados.

Exemplo de solicitação via API do Xeoma (JSON):

curl -F "audio_file=@speech.mp3" "http://192.168.0.67:10090/api?login=Administrator&password=123&speech_recognition=recognition&model=qwen3-asr-1.7b&ttl=10&language=en"

Onde:

  • audio_file=@speech.mp3 — o caminho do arquivo de áudio no seu computador
  • 192.168.0.67 — o endereço IP do servidor Xeoma
  • 10090 — a porta do servidor Xeoma
  • Administrator / 123 — login do administrador (sempre Administrator) e senha
  • model=… — o modelo de reconhecimento (veja a lista abaixo)
  • language=en — idioma da transcrição. Se for diferente do idioma real da fala, a transcrição será traduzida automaticamente para o idioma especificado

Para salvar o resultado como um arquivo de texto, adicione >savetext.txt após o comando, onde savetext.txt é o nome do arquivo de texto.

Modelos de reconhecimento para a API:

Nome Descrição Código da API
Russo básico 140 MB tone
Russo aprimorado pontuação, 215 MB giga
Inglês básico 70 MB zipformer
Multilíngue básico pontuação, 1 GB, 0.6B parâmetros qwen3-asr-0.6b
Multilíngue aprimorado pontuação, 2.2 GB, 1.7B parâmetros qwen3-asr-1.7b

Lista de códigos de idiomas

en — inglês, zh — chinês, de — alemão, es — espanhol, ru — russo, ko — coreano, fr — francês, ja — japonês, pt — português, tr — turco, pl — polonês, ca — catalão, nl — holandês, ar — árabe, sv — sueco, it — italiano, id — indonésio, hi — híndi, fi — finlandês, vi — vietnamita, he — hebraico, uk — ucraniano, el — grego, ms — malaio, cs — tcheco, ro — romeno, da — dinamarquês, hu — húngaro, ta — tâmil, no — norueguês, th — tailandês, ur — urdu, hr — croata, bg — búlgaro, lt — lituano, la — latim, mi — maori, ml — malaiala, cy — galês, sk — eslovaco, te — telugu, fa — persa, lv — letão, bn — bengali, sr — sérvio, az — azerbaijano, sl — esloveno, kn — canarim, et — estoniano, mk — macedônio, br — bretão, eu — basco, is — islandês, hy — armênio, ne — nepalês, mn — mongol, bs — bósnio, kk — cazaque, sq — albanês, sw — suaíli, gl — galego, mr — marata, pa — panjabi, si — cingalês, km — khmer, sn — shona, yo — iorubá, so — somali, af — africâner, oc — occitano, ka — georgiano, be — bielorrusso, tg — tadjique, sd — sindi, gu — guzerate, am — amárico, yi — iídiche, lo — laosiano, uz — uzbeque, fo — feroês, ht — crioulo haitiano, ps — pashto, tk — turcomeno, nn — nynorsk, mt — maltês, sa — sânscrito, lb — luxemburguês, my — birmanês, bo — tibetano, tl — tagalo, mg — malgaxe, as — assamês, tt — tártaro, haw — havaiano, ln — lingala, ha — hauçá, ba — bashkir, jw — javanês, su — sundanês, yue — cantonês.

Início rápido

Como testar

1
Inicie o Xeoma

Baixe e inicie o Xeoma. Use a edição de teste ou ative uma licença do Xeoma Standard/Xeoma Pro + a licença do módulo adicional “Voice-to-Text”.

2
Adicionar câmera

Adicione uma câmera manualmente ou aguarde o Xeoma encontrar câmeras em sua rede automaticamente. Para usar um microfone separado, conecte o módulo “Microfone” e selecione a fonte de áudio apropriada.

3
Adicionar módulo

Adicione o módulo “Voice-to-Text” à cadeia, configure uma reação para palavras-chave ou transcrição contínua de fala e, se necessário, ative a sobreposição da transcrição na imagem da câmera e nas gravações.

4
Configurar reações

Defina uma reação ao evento — salvar em CSV, notificações móveis ou outra ação.

Configurações do módulo Voice-to-Text no Xeoma
A edição de teste possui algumas limitações. Para conhecer melhor o Voice-to-Text, recomendamos solicitar uma licença de demonstração gratuita. Ela oferece acesso a todos os recursos sem limitações e sem compromisso. Basta informar um endereço de e-mail. Clique no botão abaixo para começar:
Obter licença
licença demo gratuita
Vídeo

Voice-to-Text: Reconhecimento de Fala no Xeoma

Teste grátis

Teste o Xeoma gratuitamente

Insira seu nome e e-mail para obter uma licença de demonstração gratuita. Não é necessário cartão de crédito.

Receber licenças de demonstração gratuitas do Xeoma por e-mail

Funcionalidade completa. Envio instantâneo.

Recomendamos não utilizar endereços de e-mail que contenham dados pessoais nem nos enviar dados pessoais por outros meios. Caso o faça, ao enviar este formulário, você confirma seu consentimento para o tratamento de seus dados pessoais

Precisa do módulo adaptado às suas necessidades?

Precisa de algo mais?

O módulo não atende totalmente aos seus requisitos? Podemos desenvolver as funções necessárias e integrá-las ao Xeoma como desenvolvimento personalizado pago. Ver detalhes.

Tem dúvidas? Precisa de ajuda? Entre em contato conosco! Teremos prazer em ajudar!

Pronto para começar?

Teste o Voice-to-Text com uma licença de demonstração gratuita — sem necessidade de cartão de crédito ou dados pessoais.