Voz para texto sem o áudio sair de casa.
O serviço de transcrição do ecossistema Gwan Cloud. Whisper rodando 100% na nossa infraestrutura: qualquer aplicação envia um áudio — nota de voz do WhatsApp, gravação de reunião, arquivo de vídeo — e recebe o texto com idioma detectado e timestamps. Sem API paga, sem dado em nuvem de terceiro.
Uma chamada HTTP multipart ou uma mensagem na fila — o serviço decodifica qualquer formato que o ffmpeg conheça e devolve JSON estruturado.
Upload multipart, URL (MinIO presigned) ou mensagem na fila stt.jobs.requests. Ogg, mp3, wav, m4a, vídeo — tanto faz.
Whisper (faster-whisper/CTranslate2) roda no servidor com filtro de voz. Modelos do Hugging Face cacheados localmente.
Texto completo + idioma detectado com confiança + segmentos com timestamps — por palavra, se você pedir.
Resposta síncrona no HTTP ou publicada em stt.jobs.results / fila replyTo com o seu jobId.
O Gwan STT é infraestrutura compartilhada: qualquer aplicação da
gwan-network
consome sem sair do servidor.
Nenhum áudio vai para API externa. Processamento e modelos vivem no nosso servidor — o áudio é descartado após a transcrição.
Síncrono: POST /api/transcribe na rede interna. Assíncrono: publique na fila RabbitMQ e receba o resultado com correlação por jobId.
Leads que respondem por áudio no WhatsApp têm a mensagem transcrita na conversa — o bot entende e responde ao conteúdo real, inclusive pedido falado de atendimento humano.
Áudio é o formato favorito de muita gente no WhatsApp — e o que todo bot de texto ignora. Com transcrição local, ele vira dado útil sem custo por minuto e sem mandar a voz do seu cliente para fora.
Nota de voz vira "[Áudio]" na conversa. O bot não entende, o lead espera, o produtor precisa ouvir um por um.
A fala vira texto na thread em segundos, com idioma e timestamps. Automação, busca e histórico funcionam sobre o que foi dito.