Speech To Markdown

App macOS/iOS gratuite et open source convertissant la parole en documents Markdown structurés en temps réel via l'IA locale

Rapport détaillé

  • Speech To Markdown est une application macOS/iOS gratuite et open source créée par le développeur indépendant Igor Steblii. Le concept de base est « Parlez, obtenez du Markdown propre, un traitement 100 % local ». Il utilise la reconnaissance vocale locale Whisper + la structuration locale en temps réel LLM pour convertir directement le contenu parlé en documents Markdown bien formatés. Dans un environnement de marché où les produits concurrents facturent généralement des frais annuels de 144 $ et s'appuient sur le cloud, Speech To Markdown offre une voie différenciée aux utilisateurs de technologies sensibles à la confidentialité avec le triple avantage d'être entièrement gratuit, 100 % hors ligne et d'avoir un code open source. Le produit en est actuellement à ses débuts (v0.2.0) et la popularité de la communauté n'est pas encore formée, mais la logique sous-jacente et l'orientation de l'expérience utilisateur ont été reconnues.

  • Speech To Markdown (stmd en abrégé) a été développé par le développeur indépendant Igor Steblii (GitHub : xajik). Igor est un développeur full-stack. Il a révélé sur LinkedIn que sa motivation immédiate pour développer cette application était la suivante : "Les résultats en discutant avec Gemini sont devenus de pire en pire, et ont finalement abandonné et sont revenus à la saisie au clavier. La saisie vocale est en effet plus rapide que la saisie au clavier, mais le véritable défi n'est pas la vitesse, mais la structure - il est difficile d'organiser vos pensées tout en discutant de manière impromptue de processus, de produits ou d'exigences techniques complexes." Le processus de développement de l'application a débuté en 2025. Elle a été initialement itérée sur GitHub sous le nom VoiceToMarkdown et a évolué à travers quatre versions : 0.0.4→0.0.8→0.1.0→0.1.1. Le 10 juillet 2026, le projet a été renommé SpeechToMarkdown et la version v0.2.0 a été publiée. Parallèlement, la version iOS de SpeechToMarkdown est disponible sur l'App Store, prenant en charge l'iPhone 15 Pro et supérieur. À l'heure actuelle, le référentiel GitHub compte 41 commits, 2 contributeurs (dont la contribution assistée de Claude AI) et l'application App Store ne fait que 3,1 Mo. Le positionnement de Speech To Markdown est très clair : il ne s’agit pas d’un produit grand public, mais d’un outil efficace destiné aux utilisateurs techniques, aux développeurs et aux gros utilisateurs de Markdown. Il ne poursuit pas de fonctions de couverture multiplateforme ou de synchronisation cloud, mais atteint le summum en termes de profondeur, de précision et de confidentialité au sein de l'écosystème Apple.

  • Speech To Markdown propose deux versions : la version de bureau macOS et la version mobile iOS. Les deux ensembles de piles technologiques sont différents mais l’expérience est la même. Parlons d’abord de la version de bureau de macOS. Il fonctionne dans la barre de menu et peut être invoqué à tout moment via la touche de raccourci ⌘⌥] - le mode "dictée globale" est activé dans n'importe quelle application et le texte Markdown transcrit est directement saisi à la position actuelle du curseur après avoir prononcé. Cette méthode « d'injection globale » brise les barrières d'entrée de toutes les applications et vous pouvez l'utiliser à volonté dans les terminaux, les navigateurs, Slack et VS Code. En plus de la dictée globale, il existe également un « mode agent » - une fenêtre d'édition Markdown en temps réel. Lorsque vous parlez, votre voix est d'abord transcrite en texte par murmure.cpp (mise en mémoire tampon toutes les 4 secondes), puis envoyée au LLM local pour un traitement structuré. Les résultats sont diffusés dans l'éditeur et ce que vous voyez est ce que vous obtenez. La version mobile iOS a emprunté une voie technique complètement différente. Il ne s'appuie sur aucun serveur LLM externe, mais fait appel au SpeechAnalyzer intégré des appareils Apple pour la reconnaissance vocale et aux modèles Apple Foundation pour le formatage. Cela signifie qu'il n'a aucune configuration, aucune dépendance et prend même en charge le mode avion. Depuis le lancement de l'App Store, les utilisateurs n'ont qu'à le télécharger et à l'utiliser. Aucune inscription, aucun paramètre et aucune connexion réseau ne sont requis. Le plus remarquable, ce sont ses trois modes de fonctionnement. Le mode Format est un mode de dictée gratuit. Ce que vous dites sera envoyé à LLM pour reconstruire l'intégralité du document en temps réel - tout nouveau contenu est envoyé au modèle avec le contenu existant pour garantir une cohérence globale. Le mode Édition traite la voix comme des instructions plutôt que comme du contenu, comme « Changer le sous-titre en Notes hebdomadaires » et « Convertir cette liste en tableau » - sélectionnez le texte et prononcez l'instruction, et le modèle ne modifie que la partie sélectionnée. Le mode Ajouter est un mode d’accélération conçu pour les documents longs. Seules les trois dernières phrases ainsi que le nouveau contenu sont envoyés à LLM, et le délai n'augmente pas avec la longueur du document. Le format de sortie prend en charge Markdown, le texte brut et HTML, qui peuvent être modifiés à tout moment au cours de la session, et les paramètres sont conservés lors des démarrages. Toutes les sessions sont automatiquement enregistrées et la transcription originale est toujours disponible en un seul clic.En termes de comparaison de produits concurrents, Typeless (144 $/an, traitement cloud) et Wispr Flow (144 $/an, traitement cloud) offrent une expérience multiplateforme plus mature, mais ce sont tous deux des abonnements payants et s'appuient sur le cloud. Trace (achat unique de 9,99 £, macOS uniquement) est plus professionnel dans la transcription et la séparation des locuteurs, mais manque de capacités de structuration en temps réel. v2md (à partir de 14,49 $/an, hors ligne sur iOS) est le concurrent le plus proche, mais son modèle de recharge et son positionnement sont controversés. Speech To Markdown n'a pas de rivaux dans les quatre dimensions « entièrement gratuit + open source + 100 % hors ligne + support natif de Markdown ».

  • Speech To Markdown est actuellement entièrement gratuit, sans achats intégrés, sans abonnement et sans publicité. La version iOS est disponible sur l'App Store et la version macOS est distribuée via GitHub. Le code est open source sur GitHub et tout le monde peut le télécharger, le compiler et le modifier librement. Ce modèle est extrêmement rare parmi les produits similaires. Typeless a des frais annuels de 144 $, Wispr Flow a des frais annuels de 144 $, Brain Dump a des frais annuels de 44,99 $ et v2md a des frais annuels de 14,49 $ à 35,99 $. Le seul qui est presque gratuit est Trace (achat unique de 9,99 £), mais la fonctionnalité est complètement différente. Igor n'a pas divulgué ses futurs projets de monétisation, mais on peut supposer qu'il pourrait atteindre une durabilité à long terme grâce au parrainage (tel que les sponsors GitHub) ou à des services supplémentaires (tels que la synchronisation cloud, la version d'équipe). Actuellement, stmd n’a pas suffisamment d’avis sur l’App Store pour afficher une note, et le nombre d’étoiles sur GitHub en est également à ses balbutiements. Mais cet outil montre un chemin logiciel différent de l'abonnement SaaS : petit mais beau, gratuit et open source, et axé sur la technologie.

  • Étant donné que Speech To Markdown n’est sur l’App Store que depuis peu de temps, il n’a pas encore accumulé suffisamment d’avis d’utilisateurs. Mais il y a déjà quelques voix dans la communauté des développeurs. Igor a publié un article intitulé « From Brain Dump to Markdown : Structure Ideas as You Speak » sur DEV.to, dictant l'intégralité de l'article en utilisant stmd comme démonstration. Il y a aussi des utilisateurs de départ sur LinkedIn qui ont déclaré : « L'expérience est étonnamment bonne - j'ai juste dit quelque chose avec désinvolture, et cela l'a non seulement converti en texte, mais l'a également directement organisé en Markdown pour moi et l'a automatiquement divisé en 1, 2 et 3 points clairs. »

  • Actuellement, cette application a reçu très peu de visibilité dans les médias du secteur, et aucun rapport n'a été publié dans les médias technologiques grand public tels que TechCrunch et The Verge. Mais dans la communauté des outils de développement, des sites de navigation d'outils tels que thistools.app et gunbark.dev l'ont repris et l'ont évalué favorablement. L'examen de thistools.app indique : « La logique sous-jacente de cette architecture est très claire : l'audio est transcrit et mis en mémoire tampon par murmur.cpp par sections d'environ 4 secondes, et lorsqu'il accumule environ 30 mots, il est envoyé à LLM et les résultats sont transmis à l'éditeur. Cette conception permet d'obtenir un bon équilibre entre latence et cohérence globale. En termes de paysage de produits concurrentiels, le marché se développe rapidement. Typeless vient de recevoir une nouvelle attention en juillet 2026. Wispr Flow a levé 81 millions de dollars et est évalué à 700 millions de dollars. La piste discours → texte structuré passe d'« un jouet pour quelques personnes » à « une infrastructure dont tout le monde a besoin ». Speech To Markdown est gratuit et open source. Bien qu'il soit difficile de former une concurrence commerciale à court terme, il dispose d'un marché de niche solide dans le secteur technique et dans les groupes d'utilisateurs sensibles à la vie privée.

  • En tant qu'outil open source gratuit, le plus grand risque auquel Speech To Markdown est confronté n'est pas la concurrence commerciale, mais l'énergie des développeurs et la durabilité des projets. Les projets des développeurs indépendants suivent souvent la trajectoire « démarrage enthousiaste → itération rapide → stagnation lente ». Si Igor ne peut pas continuer à investir dans la maintenance, stmd pourrait progressivement devenir inactif, comme de nombreux excellents projets open source. Un autre risque concerne les limitations matérielles. La version iOS nécessite iOS 26+ et un appareil Apple Intelligence (iPhone 15 Pro et supérieur), ce qui exclut un grand nombre d'utilisateurs existants. La version macOS oblige les utilisateurs à installer eux-mêmes Whisper.cpp et le serveur LLM local, ce qui a un seuil plus élevé pour les utilisateurs non techniques. Dans l'écosystème chinois, ce seuil est particulièrement important : l'interface de l'application ne prend en charge que l'anglais et il n'y a presque pas de critiques ou de tutoriels en chinois sur les principales plateformes chinoises (Zhihu, Xiaohongshu, Bilibili, CSDN, etc.), ce qui constitue un goulot d'étranglement important pour la croissance des utilisateurs.

  • Speech To Markdown convient le mieux à trois types de personnes : premièrement, les utilisateurs techniques et les développeurs qui sont prêts à passer du temps à configurer LLM local en échange d'une utilisation gratuite illimitée et de la plus haute garantie de confidentialité ; deuxièmement, les gros utilisateurs de bibliothèques de notes Markdown telles que Obsidian, qui ont besoin d'une méthode de saisie de dictée efficace ; troisièmement, les utilisateurs extrêmement sensibles à la confidentialité des données et espérant que les données vocales ne quittent jamais l'appareil. Les personnes qui ne conviennent pas incluent : les consommateurs ordinaires à la recherche d'une expérience prête à l'emploi (Typeless ou Wispr Flow est recommandé), les utilisateurs qui ont besoin d'une synchronisation multi-plateforme et multi-appareils et les utilisateurs qui recherchent des fonctions de transcription de réunion et de séparation des haut-parleurs (Trace est recommandé).

  • Speech To Markdown est un nouvel acteur remarquable dans le domaine du Speech-to-Markdown. Il a choisi une voie anti-mainstream – pas d’argent, pas d’Internet, pas d’utilisation originale – mais c’est précisément pour cette raison qu’il a comblé une véritable lacune. Le développeur indépendant Igor Steblii a utilisé un ensemble de solutions techniques exquises (murmure local + LLM local + trois modes de travail) pour prouver que la parole sur un texte structuré peut être extrêmement privée et totalement gratuite. Pour les utilisateurs cibles, ce n’est peut-être pas un produit mature, mais il va certainement dans la bonne direction.

Avis des utilisateurs

  • avatar
    Robin749
    J'ai découvert un goulot d'étranglement : la capture vocale dans les environnements bruyants n'est pas terrible, car elle utilise le micro intégré du Mac. Brancher un micro externe améliore nettement les choses.

  • avatar
    冯明
    La précision de la reconnaissance vocale chinoise est meilleure que prévu, le modèle Whisper gère bien le chinois. Mais le formatage Markdown de sortie suit les conventions anglaises, et la typographie chinoise nécessite parfois un ajustement manuel.

  • avatar
    狗狗112
    Comparé à Wispr Flow, il manque la synchronisation multiplateforme et les fonctions de nettoyage IA, mais il gagne par son caractère totalement gratuit et ses données qui restent sur l'appareil. Chacun ses priorités.

  • avatar
    ElizabethJenkinsX455
    J'aimerais qu'il supporte Android, mais vu que l'architecture dépend des frameworks Apple, ça n'arrivera probablement pas de sitôt.

  • avatar
    陈丹丹
    La sortie en streaming de l'éditeur en temps réel est sympa. Voir le texte apparaître ligne par ligne pendant qu'on parle donne l'impression d'écrire du code (rires).

  • avatar
    SHernandezQ
    89 votes sur Product Hunt, classé 15e. Pas mal pour un projet gratuit open source tout juste lancé. J'espère qu'il continuera d'évoluer.

  • avatar
    黄云鹏
    J'ai essayé la version iOS dans un avion. Le mode avion fonctionne parfaitement, les données ne vont pas dans le cloud, un vrai bonheur pour les voyageurs fréquents.

  • avatar
    TCastilloJr
    Le développeur Igor a écrit un article entier avec cet outil sur DEV.to pour le démontrer. Un cas intéressant de « manger sa propre nourriture pour chien ».

  • avatar
    TheXavierScott
    Ce serait parfait si la séparation des locuteurs pouvait être ajoutée à l'avenir. Actuellement, une seule personne peut l'utiliser, les scénarios de réunions à plusieurs ne sont pas encore couverts.

  • avatar
    EDort
    Les gars, pour la version macOS j'ai choisi Qwen 3.5 27B 4bit pour configurer le LLM local, avec omlx, la vitesse est correcte. Quelqu'un a essayé Gemma 3 ? Ça donne quoi ?

  • avatar
    realEmaRikstad_x
    J'ai utilisé v2md pendant quelques mois. Voir celui-ci sortir complètement gratuit est surprenant. Ses fonctionnalités ne sont peut-être pas aussi complètes que v2md, mais en tant qu'open source, le potentiel est énorme.

  • avatar
    DebraFosterSr
    Le réglage du raccourci de dictée globale est correct, il n'entre pas en conflit avec Alfred ou Raycast. Mais au premier lancement, il nécessite des autorisations de microphone et d'accessibilité, ce qui peut rebuter les débutants.

  • avatar
    Natalie_Ward_77
    La compréhension du langage naturel des commandes en mode édition n'est pas encore assez stable, mais pour un produit gratuit et open source en phase initiale, c'est déjà impressionnant.

  • avatar
    Jessica_Kelly_20227
    Je l'ai essayé pendant une réunion. J'ai simplement dicté le compte-rendu verbalement et il l'a converti en Markdown structuré. Bien plus efficace que de prendre des notes manuellement.

  • avatar
    jcmbo8rhv777
    Après avoir comparé plusieurs outils de conversion voix vers Markdown, celui-ci offre le meilleur équilibre entre confidentialité et fonctionnalités. Pas d'inscription, pas de connexion, pas de paiement — que demander de plus ?

  • avatar
    LaurenCruzSr
    Trois formats de sortie très pratiques : Markdown pour la documentation, texte brut pour les notes rapides et HTML pour l'aperçu direct. La bascule entre eux est fluide.

  • avatar
    TerryRiveraJr
    J'ai essayé Gemma 3 et Qwen 3.5. Personnellement, je trouve que la qualité de formatage de Qwen est meilleure, tandis que Gemma l'emporte en rapidité.

  • avatar
    crazyswan128
    J'ai regardé le code source sur GitHub. La qualité du code d'Igor est bonne. Mais le projet est encore à un stade précoce, seulement 41 commits, je m'inquiète un peu de la continuité de la maintenance.

  • avatar
    itjpsxl6
    J'ai essayé le mode Edit. Dire « change le sous-titre en Weekly Notes » a vraiment fonctionné — une expérience d'édition sans clavier qui semble magique. Mais la précision peut encore être améliorée, les instructions complexes sont parfois mal comprises.

  • avatar
    Donald.GrayZ383
    Le mode Append est incroyablement utile. Lors de l'écriture de longs documents, la latence n'augmente pas avec la croissance du contenu — il ajoute simplement le nouveau contenu. Une conception très intelligente.

  • avatar
    JohanMortensen
    Comparé à Typeless, celui-ci gagne car il est entièrement gratuit et traite les données localement. Mais l'expérience clé en main de Typeless est meilleure. Chacun ses besoins.

  • avatar
    孔飞梅
    J'ai téléchargé la version iOS, étonné par la taille de 3.1 Mo. Mais elle nécessite iOS 26 et iPhone 15 Pro ou supérieur — mon 14 Pro est précisément exclu. Je pleure.

  • avatar
    DylanHicks_99
    Téléchargé et essayé la version macOS. La configuration demande un certain niveau pour les utilisateurs normaux — il faut d'abord installer whisper.cpp et un LLM local. Mais une fois configuré, l'expérience est incroyable : parlez et obtenez du Markdown structuré directement, et le raccourci de dictée global fonctionne dans n'importe quelle app.

  • avatar
    ticklishswan803
    Je cherchais depuis longtemps une solution de saisie vocale pour Obsidian, celle-ci génère directement des fichiers .md. Correspondance parfaite. Gratuit et open source, génial.

  • avatar
    CAhil
    J'ai vu Speech To Markdown sur Product Hunt. Gratuit et open source, faut soutenir. Regardé le repo GitHub, l'architecture est claire : Whisper local pour la transcription, LLM local pour la sortie structurée, les données ne quittent jamais la machine. Ce niveau de confidentialité surpasse largement les solutions cloud.