Speech To Markdown
Kostenlose Open-Source-macOS/iOS-App, die Sprache mit lokaler KI in Markdown-Dokumente umwandelt
Ausführlicher Bericht
-
Speech To Markdown ist eine kostenlose Open-Source-MacOS/iOS-Anwendung, die vom unabhängigen Entwickler Igor Steblii erstellt wurde. Das Kernkonzept lautet: „Sprechen Sie, erhalten Sie sauberen Markdown, 100 % lokale Verarbeitung.“ Es nutzt lokale Whisper-Spracherkennung + lokale LLM-Echtzeitstrukturierung, um gesprochene Inhalte direkt in gut formatierte Markdown-Dokumente umzuwandeln. In einem Marktumfeld, in dem konkurrierende Produkte im Allgemeinen eine Jahresgebühr von 144 US-Dollar verlangen und auf die Cloud angewiesen sind, bietet Speech To Markdown einen differenzierten Weg für datenschutzsensible Technologienutzer mit den dreifachen Vorteilen: völlig kostenlos, 100 % offline und Open-Source-Code. Das Produkt befindet sich derzeit in einem frühen Stadium (v0.2.0) und die Popularität in der Community hat sich noch nicht herausgebildet, aber die zugrunde liegende Logik und die Richtung des Benutzererlebnisses wurden erkannt.
-
Speech To Markdown (kurz stmd) wurde vom unabhängigen Entwickler Igor Steblii (GitHub: xajik) entwickelt. Igor ist ein Full-Stack-Entwickler. Auf LinkedIn verriet er, dass seine unmittelbare Motivation für die Entwicklung dieser Anwendung folgende war: „Die Ergebnisse des Gesprächs mit Gemini wurden immer schlechter, und schließlich gaben wir auf und widmeten uns wieder dem Tippen. Die Spracheingabe ist tatsächlich schneller als das Tippen, aber die eigentliche Herausforderung ist nicht die Geschwindigkeit, sondern die Struktur – es ist schwierig, die Gedanken zu ordnen, während man spontan komplexe Prozesse, Produkte oder technische Anforderungen bespricht.“ Der Entwicklungsprozess der Anwendung begann im Jahr 2025. Sie wurde zunächst auf GitHub unter dem Namen VoiceToMarkdown iteriert und hat sich über vier Versionen weiterentwickelt: 0.0.4→0.0.8→0.1.0→0.1.1. Am 10. Juli 2026 wurde das Projekt in SpeechToMarkdown umbenannt und Version v0.2.0 veröffentlicht. Gleichzeitig ist die iOS-Version von SpeechToMarkdown im App Store verfügbar und unterstützt iPhone 15 Pro und höher. Derzeit verfügt das GitHub-Repository über 41 Commits, 2 Mitwirkende (einschließlich des von Claude AI unterstützten Beitrags) und die App Store-Anwendung ist nur 3,1 MB groß. Die Positionierung von Speech To Markdown ist sehr klar: Es handelt sich nicht um ein Massenkonsumprodukt, sondern um ein Effizienztool für technische Benutzer, Entwickler und starke Markdown-Benutzer. Es strebt keine plattformübergreifende Abdeckung oder Cloud-Synchronisierungsfunktionen an, sondern erreicht ein Höchstmaß an Tiefe, Genauigkeit und Datenschutz innerhalb des Apple-Ökosystems.
-
Speech To Markdown bietet zwei Versionen – die macOS-Desktopversion und die iOS-Mobilversion. Die beiden Sätze von Technologie-Stacks sind unterschiedlich, aber das Erlebnis ist das gleiche. Lassen Sie uns zunächst über die macOS-Desktopversion sprechen. Es funktioniert in der Menüleiste und kann jederzeit über die Tastenkombination ⌘⌥] aufgerufen werden – der Modus „Globales Diktat“ wird in jeder Anwendung aktiviert und der transkribierte Markdown-Text wird nach dem Sprechen direkt an der aktuellen Cursorposition eingegeben. Diese „globale Injektion“-Methode durchbricht die Eingabebarrieren aller Apps und kann nach Belieben in Terminals, Browsern, Slack und VS Code verwendet werden. Zusätzlich zum globalen Diktat gibt es auch den „Agentenmodus“ – ein Echtzeit-Markdown-Editorfenster. Wenn Sie sprechen, wird Ihre Stimme zunächst von whisper.cpp in Text umgewandelt (alle 4 Sekunden gepuffert) und dann zur strukturierten Verarbeitung an das lokale LLM gesendet. Die Ergebnisse werden in den Editor gestreamt und Sie erhalten das, was Sie sehen. Die iOS-Mobilversion hat einen völlig anderen technischen Weg eingeschlagen. Es ist nicht auf einen externen LLM-Server angewiesen, sondern ruft den integrierten SpeechAnalyzer von Apple-Geräten für die Spracherkennung und Apple Foundation Models für die Formatierung auf. Das bedeutet, dass es keine Konfiguration und keine Abhängigkeiten hat und sogar den Flugmodus unterstützt. Seit der Einführung des App Store müssen Benutzer ihn nur noch herunterladen und verwenden. Es sind keine Registrierung, keine Einstellungen und keine Netzwerkverbindung erforderlich. Das Bemerkenswerteste sind die drei Arbeitsmodi. Der Formatmodus ist ein kostenloser Diktiermodus. Ihre Angaben werden an LLM gesendet, um das gesamte Dokument in Echtzeit zu rekonstruieren. Alle neuen Inhalte werden zusammen mit den vorhandenen Inhalten an das Modell gesendet, um die globale Konsistenz sicherzustellen. Der Bearbeitungsmodus behandelt Sprache als Anweisungen und nicht als Inhalt, wie zum Beispiel „Ändern Sie den Untertitel in wöchentliche Notizen“ und „Konvertieren Sie diese Liste in eine Tabelle“ – wählen Sie den Text aus und sprechen Sie die Anweisung, und das Modell ändert nur den ausgewählten Teil. Der Anhängemodus ist ein Beschleunigungsmodus, der für lange Dokumente entwickelt wurde. An LLM werden nur die letzten drei Sätze plus neue Inhalte gesendet und die Verzögerung erhöht sich nicht mit der Länge des Dokuments. Das Ausgabeformat unterstützt Markdown, Nur-Text und HTML, die jederzeit während der Sitzung umgeschaltet werden können, und die Einstellungen bleiben über alle Starts hinweg erhalten. Alle Sitzungen werden automatisch gespeichert und das Originaltranskript ist immer mit einem Klick verfügbar.Im Vergleich zu Wettbewerbsprodukten bieten Typeless (144 US-Dollar/Jahr, Cloud-Verarbeitung) und Wispr Flow (144 US-Dollar/Jahr, Cloud-Verarbeitung) ein ausgereifteres plattformübergreifendes Erlebnis, aber beide sind kostenpflichtige Abonnements und basieren auf der Cloud. Trace (einmaliger Kauf für 9,99 £, nur macOS) ist professioneller in Bezug auf Transkription und Sprechertrennung, verfügt jedoch nicht über Funktionen zur Strukturierung in Echtzeit. v2md (ab 14,49 $/Jahr, offline auf iOS) ist der größte Konkurrent, aber sein Lademodell und seine Positionierung sind umstritten. Speech To Markdown hat in den vier Dimensionen „völlig kostenlos + Open Source + 100 % offline + native Markdown-Unterstützung“ keine Konkurrenz.
-
Speech To Markdown ist derzeit völlig kostenlos, ohne In-App-Käufe, ohne Abonnements und ohne Werbung. Die iOS-Version ist im App Store erhältlich und die macOS-Version wird über GitHub vertrieben. Der Code ist Open Source auf GitHub und jeder kann ihn kostenlos herunterladen, kompilieren und ändern. Dieses Modell ist unter ähnlichen Produkten äußerst selten. Typeless hat eine Jahresgebühr von 144 US-Dollar, Wispr Flow hat eine Jahresgebühr von 144 US-Dollar, Brain Dump hat eine Jahresgebühr von 44,99 US-Dollar und v2md hat eine Jahresgebühr von 14,49 bis 35,99 US-Dollar. Das Einzige, das annähernd kostenlos ist, ist Trace (einmaliger Kauf für 9,99 £), aber die Funktionalität ist völlig anders. Igor hat zukünftige Monetarisierungspläne nicht bekannt gegeben, aber es kann spekuliert werden, dass er durch Sponsoring (wie GitHub-Sponsoren) oder zusätzliche Dienste (wie Cloud-Synchronisierung, Teamversion) langfristige Nachhaltigkeit erreichen könnte. Derzeit verfügt stmd nicht über genügend Rezensionen im App Store, um eine Bewertung anzuzeigen, und auch die Anzahl der Sterne auf GitHub steckt noch in den Kinderschuhen. Aber dieses Tool zeigt einen Software-Pfad, der sich vom SaaS-Abonnement unterscheidet: klein, aber fein, kostenlos und Open Source und technologiegetrieben.
-
Da Speech To Markdown erst seit kurzer Zeit im App Store erhältlich ist, hat es noch nicht genügend Nutzerbewertungen gesammelt. Doch es gibt bereits einige Stimmen in der Entwickler-Community. Igor hat auf DEV.to einen Artikel mit dem Titel „From Brain Dump to Markdown: Structure Ideas as You Speak“ veröffentlicht und den gesamten Artikel mit stmd als Demonstration diktiert. Es gibt auch Seed-Benutzer auf LinkedIn, die sagen: „Die Erfahrung ist unerwartet gut – ich habe nur etwas beiläufig gesagt, und es hat es nicht nur in Text umgewandelt, sondern es für mich auch direkt in Markdown organisiert und es automatisch in klare 1, 2 und 3 Punkte aufgeteilt.“
-
Derzeit hat diese App in den Branchenmedien nur sehr wenig Beachtung gefunden, und es gibt keine Berichte von Mainstream-Technologiemedien wie TechCrunch und The Verge. Aber in der Entwicklertools-Community haben Tool-Navigationsseiten wie thistools.app und gunbark.dev es aufgegriffen und positiv bewertet. In der Rezension von thistools.app heißt es: „Die zugrunde liegende Logik dieser Architektur ist sehr klar – das Audio wird von whisper.cpp in Abschnitten von etwa 4 Sekunden transkribiert und gepuffert, und wenn es sich auf etwa 30 Wörter ansammelt, wird es an LLM gesendet und die Ergebnisse werden an den Editor gestreamt. Dieses Design erreicht eine gute Balance zwischen Latenz und globaler Konsistenz.“ Was die wettbewerbsfähige Produktlandschaft angeht, wächst der Markt schnell. Typeless hat im Juli 2026 gerade eine neue Runde Aufmerksamkeit erhalten. Wispr Flow hat 81 Millionen US-Dollar eingesammelt und wird mit 700 Millionen US-Dollar bewertet. Der Bereich Sprache → strukturierter Text wandelt sich von „einem Spielzeug für ein paar Leute“ zu „einer Infrastruktur, die jeder braucht“. Speech To Markdown ist kostenlos und Open Source. Obwohl es kurzfristig schwierig ist, kommerziellen Wettbewerb zu schaffen, verfügt es über einen soliden Nischenmarkt im technischen Bereich und in datenschutzsensiblen Benutzergruppen.
-
Als kostenloses Open-Source-Tool ist das größte Risiko für Speech To Markdown nicht der kommerzielle Wettbewerb, sondern die Energie der Entwickler und die Nachhaltigkeit des Projekts. Unabhängige Entwicklerprojekte folgen oft dem Schema „begeisterter Start → schnelle Iteration → langsame Stagnation“. Wenn Igor nicht weiter in die Wartung investieren kann, könnte stmd wie viele hervorragende Open-Source-Projekte nach und nach inaktiv werden. Ein weiteres Risiko sind Hardwareeinschränkungen. Die iOS-Version erfordert iOS 26+ und ein Apple Intelligence-Gerät (iPhone 15 Pro und höher), was eine große Anzahl bestehender Benutzer ausschließt. Bei der macOS-Version müssen Benutzer whisper.cpp und den lokalen LLM-Server selbst installieren, was für technisch nicht versierte Benutzer einen höheren Schwellenwert hat. Im chinesischen Ökosystem ist dieser Schwellenwert besonders ausgeprägt: Die Anwendungsoberfläche unterstützt nur Englisch und auf Chinas Mainstream-Plattformen (Zhihu, Xiaohongshu, Bilibili, CSDN usw.) gibt es fast keine chinesischen Rezensionen oder Tutorials, was einen erheblichen Engpass beim Benutzerwachstum darstellt.
-
Speech To Markdown eignet sich am besten für drei Arten von Menschen: Erstens für technisch versierte Benutzer und Entwickler, die bereit sind, im Gegenzug für unbegrenzte kostenlose Nutzung und höchste Datenschutzgarantie Zeit in die Konfiguration von lokalem LLM zu investieren; zweitens, starke Benutzer von Markdown-Notizbibliotheken wie Obsidian, die eine effiziente Diktiereingabemethode benötigen; Drittens, Benutzer, die äußerst sensibel auf den Datenschutz achten und hoffen, dass Sprachdaten niemals das Gerät verlassen. Zu den Personen, die nicht geeignet sind, gehören: normale Verbraucher, die ein sofort einsatzbereites Erlebnis suchen (Typeless oder Wispr Flow wird empfohlen), Benutzer, die eine plattformübergreifende Synchronisierung mehrerer Geräte benötigen, und Benutzer, die nach Transkriptions- und Sprechertrennungsfunktionen für Besprechungen suchen (Trace wird empfohlen).
-
Speech To Markdown ist ein bemerkenswerter neuer Player im Speech-to-Markdown-Bereich. Es hat einen Anti-Mainstream-Weg gewählt – kein Geld, kein Internet, keine Out-of-the-Box-Nutzung –, aber gerade dadurch eine echte Lücke geschlossen. Der unabhängige Entwickler Igor Steblii nutzte eine Reihe exquisiter technischer Lösungen (lokales Whisper + lokales LLM + drei Arbeitsmodi), um zu beweisen, dass Sprache in strukturierten Text äußerst privat und völlig kostenlos sein kann. Für die Zielgruppe ist es vielleicht kein ausgereiftes Produkt, aber es geht definitiv in die richtige Richtung.
Nutzerbewertungen
-
Robin749—Ein Engpass entdeckt: Die Sprachaufnahme in lauten Umgebungen ist nicht gut, da das eingebaute Mac-Mikrofon verwendet wird. Mit einem externen Mikrofon wird es viel besser. -
冯明—Die Erkennungsgenauigkeit für Chinesisch ist besser als erwartet – das Whisper-Modell verarbeitet Chinesisch gut. Die Markdown-Ausgabe orientiert sich jedoch an englischen Konventionen, und das chinesische Layout erfordert gelegentlich manuelle Anpassungen. -
狗狗112—Im Vergleich zu Wispr Flow fehlen plattformübergreifende Synchronisation und KI-Bereinigungsfunktionen, punktet aber mit völliger Kostenfreiheit und lokalen Daten. Kommt auf die eigenen Prioritäten an. -
ElizabethJenkinsX455—Ich wünschte, es würde Android unterstützen, aber da die Architektur von Apple-Frameworks abhängt, wird das wohl kurzfristig nichts. -
陈丹丹—Die Streaming-Ausgabe des Echtzeit-Editors ist cool. Zuzusehen, wie der Text Zeile für Zeile erscheint, während man spricht, fühlt sich an, als würde man selbst Code schreiben (lol). -
SHernandezQ—89 Stimmen auf Product Hunt, Platz 15. Ziemlich gut für ein frisch veröffentlichtes kostenloses Open-Source-Projekt. Hoffentlich wird es weiterentwickelt. -
黄云鹏—Habe die iOS-Version im Flugzeug ausprobiert. Flugmodus funktioniert einwandfrei – Daten gehen nicht in die Cloud, ein Grund zur Freude für Vielreisende. -
TCastilloJr—Entwickler Igor hat einen ganzen Artikel mit diesem Tool auf DEV.to geschrieben, als Demonstration. Ein interessanter Fall von «Eigenlob stimmt doch». -
TheXavierScott—Wäre perfekt, wenn in Zukunft eine Sprechertrennung hinzugefügt werden könnte. Jetzt kann nur eine Person es nutzen, Mehrpersonen-Besprechungsszenarien sind noch nicht abgedeckt. -
EDort—Leute, für die macOS-Version habe ich Qwen 3.5 27B 4bit beim Einrichten des lokalen LLM gewählt, läuft mit omlx, die Geschwindigkeit ist in Ordnung. Hat jemand Gemma 3 ausprobiert? Wie ist es? -
realEmaRikstad_x—Habe v2md ein paar Monate genutzt. Zu sehen, dass dieses hier völlig kostenlos herauskommt, ist überraschend. Die Funktionen sind vielleicht noch nicht so umfangreich wie bei v2md, aber als Open Source ist das Potenzial riesig. -
DebraFosterSr—Die globale Diktat-Tastenkombination ist gut eingestellt, kein Konflikt mit Alfred oder Raycast. Beim ersten Start werden jedoch Mikrofon- und Bedienungshilfen-Berechtigungen benötigt, was Anfänger abschrecken könnte. -
Natalie_Ward_77—Das Verständnis natürlicher Sprache im Bearbeitungsmodus ist noch nicht stabil genug, aber für ein kostenloses Open-Source-Frühprodukt ist es bereits beeindruckend. -
Jessica_Kelly_20227—Habe es in einer Besprechung ausprobiert. Einfach das Besprechungsprotokoll diktiert und es wurde in strukturiertes Markdown umgewandelt. Viel effizienter als manuelles Notieren. -
jcmbo8rhv777—Nach dem Vergleich mehrerer Sprach-zu-Markdown-Tools hat dieses die beste Balance zwischen Datenschutz und Funktionalität. Keine Registrierung, kein Internet, keine Zahlung – was will man mehr? -
LaurenCruzSr—Drei Ausgabeformate sind sehr praktisch: Markdown für Dokumentation, Klartext für Notizen und HTML für die direkte Vorschau. Das Umschalten ist flüssig. -
TerryRiveraJr—Habe Gemma 3 und Qwen 3.5 ausprobiert. Persönlich finde ich die Formatierungsqualität von Qwen besser, während Gemma bei der Geschwindigkeit gewinnt. -
crazyswan128—Habe mir den Quellcode auf GitHub angesehen. Igors Codequalität ist gut. Aber das Projekt ist noch früh, nur 41 Commits — ich bin etwas besorgt, ob die Wartung durchgehalten wird. -
itjpsxl6—Habe den Bearbeitungsmodus ausprobiert. «Ändere den Untertitel in Weekly Notes» zu sagen hat tatsächlich funktioniert – eine tastaturlose Bearbeitungserfahrung, die sich magisch anfühlt. Die Genauigkeit kann aber noch verbessert werden, komplexe Anweisungen werden manchmal nicht verstanden. -
Donald.GrayZ383—Der Append-Modus ist unglaublich nützlich. Beim Schreiben langer Dokumente steigt die Latenz nicht mit wachsendem Inhalt – es wird nur neuer Inhalt angehängt. Ein sehr kluges Design. -
JohanMortensen—Im Vergleich zu Typeless gewinnt dieses hier, weil es völlig kostenlos ist und Daten lokal verarbeitet. Aber Typeless' Out-of-the-Box-Erfahrung ist besser. Jedem das Seine. -
孔飞梅—Habe die iOS-Version heruntergeladen, überrascht von den 3,1 MB. Aber es erfordert iOS 26 und iPhone 15 Pro oder höher – mein 14 Pro ist genau ausgeschlossen. Ich weine. -
DylanHicks_99—Hab die macOS-Version runtergeladen und getestet. Die Einrichtung hat eine Hürde für normale Nutzer — zuerst müssen whisper.cpp und ein lokales LLM installiert werden. Aber einmal konfiguriert, ist die Erfahrung unglaublich: sprechen und strukturiertes Markdown kommt direkt raus, die globale Diktier-Tastenkombination funktioniert in jeder App. -
ticklishswan803—Habe lange nach einer Sprach-Eingabelösung für Obsidian gesucht – diese gibt direkt .md-Dateien aus. Perfekte Kombination. Kostenlos und Open Source – grossartig. -
CAhil—Speech To Markdown auf Product Hunt gesehen. Kostenlos und Open Source, muss man unterstützen. Hab ins GitHub-Repo geschaut, die Architektur ist klar: lokales Whisper für Transkription, lokales LLM für strukturierte Ausgabe, Daten verlassen nie den Rechner. Dieses Datenschutzniveau übertrumpft die Cloud-Lösungen bei weitem.