Gwan STT
Áudio in. Texto out.

Gwan STT

Voz para texto sem o áudio sair de casa.

O serviço de transcrição do ecossistema Gwan Cloud. Whisper rodando 100% na nossa infraestrutura: qualquer aplicação envia um áudio — nota de voz do WhatsApp, gravação de reunião, arquivo de vídeo — e recebe o texto com idioma detectado e timestamps. Sem API paga, sem dado em nuvem de terceiro.

100% local (LGPD-friendly) HTTP + fila RabbitMQ Timestamps por palavra
Fluxo em uma chamada

O áudio entra, o texto sai. O resto é problema nosso.

Uma chamada HTTP multipart ou uma mensagem na fila — o serviço decodifica qualquer formato que o ffmpeg conheça e devolve JSON estruturado.

01

Envie

Upload multipart, URL (MinIO presigned) ou mensagem na fila stt.jobs.requests. Ogg, mp3, wav, m4a, vídeo — tanto faz.

02

Transcreva

Whisper (faster-whisper/CTranslate2) roda no servidor com filtro de voz. Modelos do Hugging Face cacheados localmente.

03

Estruture

Texto completo + idioma detectado com confiança + segmentos com timestamps — por palavra, se você pedir.

04

Integre

Resposta síncrona no HTTP ou publicada em stt.jobs.results / fila replyTo com o seu jobId.

Feito para o ecossistema

Um serviço, todos os apps.

O Gwan STT é infraestrutura compartilhada: qualquer aplicação da gwan-network consome sem sair do servidor.

🔒

Privacidade por arquitetura

Nenhum áudio vai para API externa. Processamento e modelos vivem no nosso servidor — o áudio é descartado após a transcrição.

🔌

Dois jeitos de chamar

Síncrono: POST /api/transcribe na rede interna. Assíncrono: publique na fila RabbitMQ e receba o resultado com correlação por jobId.

🤖

Já em produção no Gwan Booker

Leads que respondem por áudio no WhatsApp têm a mensagem transcrita na conversa — o bot entende e responde ao conteúdo real, inclusive pedido falado de atendimento humano.

O valor real é nenhum áudio ficar sem resposta.

Áudio é o formato favorito de muita gente no WhatsApp — e o que todo bot de texto ignora. Com transcrição local, ele vira dado útil sem custo por minuto e sem mandar a voz do seu cliente para fora.

Antes

Nota de voz vira "[Áudio]" na conversa. O bot não entende, o lead espera, o produtor precisa ouvir um por um.

Depois

A fala vira texto na thread em segundos, com idioma e timestamps. Automação, busca e histórico funcionam sobre o que foi dito.

Pronto para usar

Grave, envie e veja seu áudio virar texto agora.

Abrir página de teste API online · Whisper local