Speech To Markdown

Aplicativo macOS/iOS gratuito e open source que converte fala em documentos Markdown estruturados em tempo real via AI local

Relatório detalhado

  • Speech To Markdown é um aplicativo macOS/iOS gratuito e de código aberto criado pelo desenvolvedor independente Igor Steblii. O conceito central é "Fale, obtenha Markdown limpo, processamento 100% local". Ele usa reconhecimento de fala Whisper local + estruturação LLM local em tempo real para converter diretamente o conteúdo falado em documentos Markdown bem formatados. Em um ambiente de mercado onde os produtos concorrentes geralmente cobram uma taxa anual de US$ 144 e dependem da nuvem, o Speech To Markdown oferece um caminho diferenciado para usuários de tecnologia sensíveis à privacidade, com as triplas vantagens de ser totalmente gratuito, 100% offline e de código-fonte aberto. O produto está atualmente em estágio inicial (v0.2.0) e a popularidade da comunidade ainda não foi formada, mas a lógica subjacente e a direção da experiência do usuário foram reconhecidas.

  • Speech To Markdown (abreviadamente stmd) foi desenvolvido pelo desenvolvedor independente Igor Steblii (GitHub: xajik). Igor é um desenvolvedor full-stack. Ele revelou no LinkedIn que sua motivação imediata para desenvolver este aplicativo foi: "Os resultados de conversar com Gemini foram ficando cada vez piores, e finalmente desisti e voltei a digitar. A entrada de voz é realmente mais rápida do que a digitação, mas o verdadeiro desafio não é a velocidade, mas a estrutura - é difícil organizar seus pensamentos enquanto se discute improvisadamente processos complexos, produtos ou requisitos técnicos." O processo de desenvolvimento do aplicativo começou em 2025. Ele foi inicialmente iterado no GitHub sob o nome VoiceToMarkdown e evoluiu através de quatro versões: 0.0.4→0.0.8→0.1.0→0.1.1. Em 10 de julho de 2026, o projeto foi renomeado para SpeechToMarkdown e a versão v0.2.0 foi lançada. Ao mesmo tempo, a versão iOS do SpeechToMarkdown está disponível na App Store, com suporte para iPhone 15 Pro e superior. A partir de agora, o repositório GitHub tem 41 commits, 2 contribuidores (incluindo a contribuição assistida por Claude AI) e o aplicativo App Store tem apenas 3,1 MB. O posicionamento do Speech To Markdown é muito claro: não é um produto de consumo de massa, mas uma ferramenta de eficiência para usuários técnicos, desenvolvedores e usuários pesados ​​do Markdown. Ele não busca cobertura multiplataforma ou funções de sincronização em nuvem, mas atinge o máximo em profundidade, precisão e privacidade dentro do ecossistema Apple.

  • Speech To Markdown oferece duas versões - versão desktop macOS e versão móvel iOS. Os dois conjuntos de pilhas de tecnologia são diferentes, mas a experiência é a mesma. Vamos falar primeiro sobre a versão desktop do macOS. Opera na barra de menu e pode ser invocado a qualquer momento através da tecla de atalho ⌘⌥] - o modo "ditado global" é ativado em qualquer aplicativo e o texto Markdown transcrito é inserido diretamente na posição atual do cursor após falar. Esse método de “injeção global” rompe as barreiras de entrada de todos os aplicativos e você pode usá-lo em terminais, navegadores, Slack e VS Code à vontade. Além do ditado global, há também o "modo agente" - uma janela do editor Markdown em tempo real. Quando você fala, sua voz é primeiro transcrita em texto por Whisper.cpp (armazenada em buffer a cada 4 segundos) e depois enviada ao LLM local para processamento estruturado. Os resultados são transmitidos para o editor e o que você vê é o que obtém. A versão móvel do iOS seguiu um caminho técnico completamente diferente. Ele não depende de nenhum servidor LLM externo, mas chama o SpeechAnalyzer integrado de dispositivos Apple para reconhecimento de fala e Apple Foundation Models para formatação. Isso significa que ele não tem configuração, nenhuma dependência e até suporta o modo avião. Desde o lançamento da App Store, os usuários só precisam fazer o download e utilizá-la. Nenhum registro, nenhuma configuração e nenhuma conexão de rede são necessários. O mais notável são seus três modos de funcionamento. O modo de formato é um modo de ditado livre. O que você disser será enviado ao LLM para reconstruir todo o documento em tempo real - todo o novo conteúdo é enviado ao modelo junto com o conteúdo existente para garantir consistência global. O modo de edição trata a voz como instruções em vez de conteúdo, como "Alterar a legenda para Notas Semanais" e "Converter esta lista em uma tabela" - selecione o texto e fale a instrução, e o modelo altera apenas a parte selecionada. O modo Anexar é um modo de aceleração projetado para documentos longos. Apenas as três últimas frases mais o novo conteúdo são enviadas ao LLM, e o atraso não aumenta com o comprimento do documento. O formato de saída suporta Markdown, texto simples e HTML, que pode ser alterado a qualquer momento durante a sessão, e as configurações são mantidas nas inicializações. Todas as sessões são salvas automaticamente e a transcrição original está sempre disponível com um clique.Em termos de comparação competitiva de produtos, Typeless (US$ 144/ano, processamento em nuvem) e Wispr Flow (US$ 144/ano, processamento em nuvem) fornecem uma experiência multiplataforma mais madura, mas ambos são assinaturas pagas e dependem da nuvem. Trace (compra única de £ 9,99, apenas macOS) é mais profissional na transcrição de reuniões e separação de alto-falantes, mas carece de recursos de estruturação em tempo real. v2md (a partir de US$ 14,49/ano, offline no iOS) é o concorrente mais próximo, mas seu modelo de cobrança e posicionamento são controversos. O Speech To Markdown não tem rivais nas quatro dimensões de "completamente gratuito + código aberto + 100% offline + suporte nativo ao Markdown".

  • Atualmente, o Speech To Markdown é totalmente gratuito, sem compras no aplicativo, sem assinaturas e sem anúncios. A versão iOS está disponível na App Store e a versão macOS é distribuída via GitHub. O código é de código aberto no GitHub e qualquer pessoa pode baixá-lo, compilá-lo e modificá-lo gratuitamente. Este modelo é extremamente raro entre produtos similares. Typeless tem uma taxa anual de $ 144, Wispr Flow tem uma taxa anual de $ 144, Brain Dump tem uma taxa anual de $ 44,99 e v2md tem uma taxa anual de $ 14,49– $ 35,99. O único que é quase gratuito é o Trace (compra única de £ 9,99), mas a funcionalidade é completamente diferente. Igor não divulgou planos futuros de monetização, mas pode-se especular que ele poderá alcançar sustentabilidade de longo prazo por meio de patrocínio (como GitHub Sponsors) ou serviços adicionais (como sincronização em nuvem, versão de equipe). Atualmente, o stmd não tem avaliações suficientes na App Store para exibir uma classificação, e o número de estrelas no GitHub também está em sua infância. Mas esta ferramenta mostra um caminho de software diferente da assinatura SaaS: pequena, mas bonita, gratuita e de código aberto, e orientada para a tecnologia.

  • Como o Speech To Markdown está na App Store há pouco tempo, ele ainda não acumulou avaliações de usuários suficientes. Mas já existem algumas vozes na comunidade de desenvolvedores. Igor publicou um artigo intitulado "From Brain Dump to Markdown: Structure Ideas as You Speak" no DEV.to, ditando o artigo inteiro usando stmd como demonstração. Também há usuários iniciais no LinkedIn que disseram: "A experiência é inesperadamente boa - acabei de dizer algo casualmente e isso não apenas o converteu em texto, mas também o organizou diretamente em Markdown para mim e o dividiu automaticamente em 1, 2 e 3 pontos claros."

  • Atualmente, este aplicativo recebeu muito pouca exposição na mídia do setor, sem relatos da grande mídia de tecnologia, como TechCrunch e The Verge. Mas na comunidade de ferramentas para desenvolvedores, sites de navegação de ferramentas como thistools.app e gunbark.dev o escolheram e avaliaram favoravelmente. A revisão de thistools.app afirma: "A lógica subjacente desta arquitetura é muito clara - o áudio é transcrito e armazenado em buffer pelo Whisper.cpp em seções de cerca de 4 segundos e, quando acumula cerca de 30 palavras, é enviado para o LLM e os resultados são transmitidos para o editor. Este design atinge um bom equilíbrio entre latência e consistência global." Em termos de cenário de produtos competitivos, o mercado está se expandindo rapidamente. Typeless acaba de receber uma nova rodada de atenção em julho de 2026. Wispr Flow arrecadou US$ 81 milhões e está avaliado em US$ 700 milhões. A faixa de discurso → texto estruturado está mudando de “um brinquedo para poucas pessoas” para “uma infraestrutura que todos precisam”. Speech To Markdown é gratuito e de código aberto. Embora seja difícil formar concorrência comercial no curto prazo, possui um nicho de mercado sólido no círculo técnico e grupos de usuários sensíveis à privacidade.

  • Como uma ferramenta gratuita de código aberto, o maior risco que o Speech To Markdown enfrenta não é a concorrência comercial, mas a energia do desenvolvedor e a sustentabilidade do projeto. Projetos de desenvolvedores independentes geralmente seguem a trajetória de “início entusiasmado → iteração rápida → estagnação lenta”. Se Igor não puder continuar investindo em manutenção, o stmd poderá gradualmente se tornar inativo, como muitos projetos excelentes de código aberto. Outro risco são as limitações de hardware. A versão iOS requer iOS 26+ e um dispositivo Apple Intelligence (iPhone 15 Pro e superior), o que exclui um grande número de usuários existentes. A versão macOS exige que os usuários instalem o Whisper.cpp e o servidor LLM local por conta própria, o que tem um limite mais alto para usuários não técnicos. No ecossistema chinês, esse limite é particularmente proeminente - a interface do aplicativo suporta apenas o inglês e quase não há análises ou tutoriais em chinês nas principais plataformas da China (Zhihu, Xiaohongshu, Bilibili, CSDN, etc.), o que é um gargalo significativo no crescimento do usuário.

  • O Speech To Markdown é mais adequado para três tipos de pessoas: primeiro, usuários técnicos e desenvolvedores que estão dispostos a gastar tempo configurando o LLM local em troca de uso gratuito ilimitado e a mais alta garantia de privacidade; segundo, usuários frequentes de bibliotecas de notas Markdown, como Obsidian, que precisam de um método de entrada de ditado eficiente; terceiro, usuários que são extremamente sensíveis à privacidade dos dados e esperam que os dados de voz nunca saiam do dispositivo. As pessoas que não são adequadas incluem: consumidores comuns que procuram uma experiência pronta para uso (recomenda-se Typeless ou Wispr Flow), usuários que precisam de sincronização multiplataforma de vários dispositivos e usuários que procuram transcrição de reuniões e funções de separação de alto-falantes (Trace é recomendado).

  • Speech To Markdown é um novo player notável no campo do Speech-to-Markdown. Escolheu um caminho anti-mainstream – sem dinheiro, sem Internet, sem utilização pronta a usar – mas precisamente por isso preencheu uma lacuna real. O desenvolvedor independente Igor Steblii usou um conjunto de soluções técnicas requintadas (Sussurro local + LLM local + três modos de trabalho) para provar que a fala em texto estruturado pode ser extremamente privada e totalmente gratuita. Para os usuários-alvo, pode não ser um produto maduro, mas está definitivamente na direção certa.

Avaliações de usuários

  • avatar
    Robin749
    Descobri um gargalo: a captação de voz em ambientes barulhentos não é boa, já que usa o microfone embutido do Mac. Conectando um microfone externo melhora bastante.

  • avatar
    冯明
    A precisão do reconhecimento de voz em chinês é melhor que o esperado, o modelo Whisper lida bem com chinês. Mas a formatação Markdown de saída tende a usar convenções do inglês, e a tipografia chinesa ocasionalmente precisa de ajuste manual.

  • avatar
    狗狗112
    Comparado ao Wispr Flow, não tem sincronização multiplataforma e recursos de limpeza AI, mas ganha por ser completamente gratuito e manter os dados no dispositivo. Depende da prioridade de cada um.

  • avatar
    ElizabethJenkinsX455
    Gostaria que suportasse Android, mas pela arquitetura depender dos frameworks da Apple, provavelmente não vai acontecer tão cedo.

  • avatar
    陈丹丹
    A saída em streaming do editor em tempo real é legal. Ver o texto aparecer linha por linha enquanto você fala dá a sensação de estar escrevendo código (risos).

  • avatar
    SHernandezQ
    89 votos no Product Hunt, posição 15. Muito bom para um projeto gratuito de código aberto recém-lançado. Espero que continue evoluindo.

  • avatar
    黄云鹏
    Testei a versão iOS em um avião. O modo avião funciona perfeitamente, os dados não vão para a nuvem, uma alegria para quem viaja muito.

  • avatar
    TCastilloJr
    O desenvolvedor Igor escreveu um artigo inteiro usando esta ferramenta no DEV.to como demonstração. Um caso interessante de «comer a própria ração».

  • avatar
    TheXavierScott
    Seria perfeito se pudesse adicionar separação de falantes no futuro. Agora só pode ser usado por uma pessoa, cenários de reuniões com várias pessoas ainda não estão cobertos.

  • avatar
    EDort
    Pessoal, para a versão macOS escolhi Qwen 3.5 27B 4bit ao configurar o LLM local, rodando com omlx, a velocidade é decente. Alguém já testou Gemma 3? O que acharam?

  • avatar
    realEmaRikstad_x
    Usei v2md por alguns meses. Ver este sair completamente gratuito é surpreendente. Pode não ter funções tão completas quanto v2md, mas como código aberto o potencial é enorme.

  • avatar
    DebraFosterSr
    A configuração da tecla de atalho para ditado global é boa, não conflita com Alfred ou Raycast. Mas na primeira inicialização requer permissões de microfone e acessibilidade, o que pode assustar iniciantes.

  • avatar
    Natalie_Ward_77
    A compreensão de linguagem natural dos comandos no modo de edição ainda não é estável, mas considerando que é um produto inicial gratuito e de código aberto, já é impressionante.

  • avatar
    Jessica_Kelly_20227
    Testei durante uma reunião. Simplesmente ditei as atas verbalmente e ele converteu em Markdown estruturado. Muito mais eficiente que anotar manualmente.

  • avatar
    jcmbo8rhv777
    Depois de comparar várias ferramentas de voz para Markdown, esta é a que melhor equilibra privacidade e funcionalidade. Sem registro, sem internet, sem pagamento — o que mais pedir?

  • avatar
    LaurenCruzSr
    Três formatos de saída muito práticos: Markdown para documentação, texto puro para anotações rápidas e HTML para pré-visualização direta. A alternância entre eles é suave.

  • avatar
    TerryRiveraJr
    Testei Gemma 3 e Qwen 3.5. Pessoalmente, sinto que a qualidade de formatação do Qwen é melhor, enquanto a Gemma ganha em velocidade.

  • avatar
    crazyswan128
    Olhei o código fonte no GitHub. A qualidade do código do Igor é boa. Mas o projeto ainda está em estágio inicial, apenas 41 commits, estou um pouco preocupado se a manutenção vai continuar.

  • avatar
    itjpsxl6
    Testei o modo Edit. Dizer 'mude o subtítulo para Weekly Notes' realmente funcionou — uma experiência de edição sem teclado que parece mágica. Mas a precisão ainda tem espaço para melhoria, instruções complexas às vezes não são compreendidas.

  • avatar
    Donald.GrayZ383
    O modo Append é incrivelmente útil. Ao escrever documentos longos, a latência não aumenta com o crescimento do conteúdo — apenas anexa o novo conteúdo. Um design muito inteligente.

  • avatar
    JohanMortensen
    Comparado ao Typeless, este ganha por ser totalmente gratuito e processar dados localmente. Mas a experiência pronta para usar do Typeless é melhor. Cada um escolhe o que precisa.

  • avatar
    孔飞梅
    Baixei a versão iOS, surpreso com os 3.1 MB. Mas requer iOS 26 e iPhone 15 Pro ou superior — meu 14 Pro foi precisamente excluído. Choro.

  • avatar
    DylanHicks_99
    Baixei e testei a versão macOS. O processo de configuração tem uma curva de aprendizado para usuários comuns — precisa instalar whisper.cpp e um LLM local primeiro. Mas depois de configurado, a experiência é incrível: fale e saia Markdown estruturado diretamente, e o atalho global de ditado funciona em qualquer app.

  • avatar
    ticklishswan803
    Estava procurando uma solução de entrada por voz para o Obsidian, esta gera arquivos .md diretamente. Combinação perfeita. Gratuito e código aberto, incrível.

  • avatar
    CAhil
    Vi o Speech To Markdown no Product Hunt. Gratuito e open source, tenho que apoiar. Olhei o repositório GitHub, a arquitetura é clara: Whisper local para transcrição, LLM local para saída estruturada, os dados nunca saem da máquina. Esse nível de privacidade supera as soluções em nuvem.