← Voltar para artigos
IAPrivacidade

flow-st8: voice to text local e privado — sem assinatura, sem print da sua tela

7 minLucas Mattos
Ilustração do artigo: flow-st8: voice to text local e privado — sem assinatura, sem print da sua tela

Tudo começou num workshop com o Leandro Rezende, do UX Unicórnio. Ele usava uma ferramenta de voice to text que mudava completamente a forma de interagir com IA. Você fala em vez de digitar — e isso muda tudo quando você está montando uma spec longa e detalhada para um agente. A ideia foi imediata: experimentei, assinei o período de teste de uma ferramenta conhecida do mercado, e a mudança foi real. Sem a fricção do teclado no meio, os prompts ficaram mais completos, mais fiéis ao que eu realmente estava pensando. O trabalho ficou muito mais ágil. Quando o teste acabou, a pergunta foi simples: por que pagar?

O problema com as alternativas

Antes de construir qualquer coisa, fui entender o que existia. Várias ferramentas de voice to text do mercado tiram prints constantes da sua tela enquanto você fala. O argumento é "dar contexto" para a transcrição (Context Awareness). O que não fica claro na instalação é que esses screenshots estão sendo enviados para servidores externos.

Na prática: você está montando uma spec confidencial, trabalhando num projeto sigiloso, redigindo uma proposta — e a ferramenta está fotografando sua tela em loop e mandando para a nuvem. Uma escolha de design, digamos, bem peculiar. Felizmente, após fortes críticas da comunidade, o "opt-in para treinamento" dessas ferramentas não vem mais marcado como padrão.

Além da privacidade, tinha o consumo de memória. Usando essas ferramentas de forma constante, o consumo chegava a 700–800 MB — para algo que fica aberto o dia todo em background, isso é uma escolha de vida bastante questionável.

O que é o flow-st8

O flow-st8 é minha versão local do que eu precisava: um software de ditado por voz para Windows, offline, sem assinatura. Pressiona Ctrl+Win, fala, pressiona de novo — o texto é transcrito pelo Whisper (open source da OpenAI) e colado onde o cursor estiver. Funciona em qualquer app: Claude, GPT, Slack, e-mail, documentos.

O que ele não faz — e isso importa: não tira print da sua tela; não envia áudio para servidor externo; não exige assinatura nem internet; não guarda nada fora da sua máquina.

O que ele faz: transcrição local com Whisper OpenAI; 200–300 MB de consumo de memória em uso constante; GPU NVIDIA: transcrição em ~1s | sem GPU: modelos leves disponíveis; filtragem de silêncio automática via VAD — sem cortes no meio da fala. Para quem não tem GPU dedicada, o flow-st8 oferece vários modelos Whisper — do tiny (39 MB, rápido) ao large-v3-turbo (qualidade excelente). Você calibra conforme seu hardware.

Os números que importam

Três meses de uso intenso com agentes de IA: fala é ~3x mais rápida que digitação; specs que levavam 20–30 minutos para digitar ficam prontas em 8–10 minutos de fala + revisão; consumo de memória: 200–300 MB vs. 700–800 MB das alternativas comerciais; custo mensal: R$ 0.

O ganho principal não é velocidade — é qualidade de pensamento. Quando você não está preocupado com digitar, fala o que realmente está pensando: todos os detalhes, conexões, nuances. A spec fica melhor. O output do agente fica melhor.

Spec-Driven Development com voz

O uso que mais transformou meu dia a dia é na construção de specs para agentes de IA. No Spec-Driven Development, a qualidade da spec define a qualidade do resultado. Quanto mais precisa, contextualizada e detalhada, melhor o agente performa. O problema é que specs boas são longas — e digitar specs longas é onde a maioria das pessoas corta caminho.

Com voice to text local, esse trade-off desaparece. Você fala a spec completa, itera em voz, refina em tempo real. O ciclo ficou muito mais rápido do que qualquer método de digitação.

E saber que nada está saindo da máquina muda a disposição para usar sem filtro. Você fala com mais liberdade quando sabe que ninguém está ouvindo — nem fotografando.

Sobre durar — ou não

Vale ser honesto: as interfaces de IA estão adicionando input de voz nativo aos poucos. O Claude tem, o GPT tem, outros vão ter. Quando isso for universal, o flow-st8 perde boa parte do argumento.

Por enquanto, ainda faz sentido — terminais, IDEs, chats de código como o Cursor, e-mail, qualquer lugar fora das interfaces de IA. A utilidade existe hoje, é real, e não custou muito tempo para construir.

Quando deixar de fazer sentido, ele muda ou para. Tudo bem. Isso é o que diferencia uma ferramenta construída com consciência de uma construída com ego: você não precisa defender ela para sempre. Só precisa que ela valha o tempo que você investiu — e esse já valeu.

O que aprendi construindo isso

Não criei do zero como gênio solitário. Vi o problema, usei a solução de outra pessoa, entendi o que estava por baixo, e construí a versão que resolvia o que me incomodava: privacidade, consumo de memória e custo zero.

A forma mais honesta de inovar: partir de algo que funciona, entender por que funciona, e melhorar o que importa para você. O repositório é público e documentado. Se você usa Windows, trabalha com agentes de IA e ficou levemente perturbado com a parte dos screenshots — provavelmente vai se reconhecer nessa história.

→ github.com/luckmattos/flow-st8

Outros artigos: