Speech To Markdown

Aplikasi macOS/iOS gratis open source yang mengubah ucapan menjadi dokumen Markdown via AI lokal

Laporan mendalam

  • Speech To Markdown adalah aplikasi macOS/iOS sumber terbuka dan gratis yang dibuat oleh pengembang independen Igor Steblii. Konsep intinya adalah "Bicaralah, dapatkan penurunan harga yang bersih, 100% pemrosesan lokal." Ini menggunakan pengenalan ucapan Whisper lokal + penataan LLM lokal secara real-time untuk secara langsung mengubah konten lisan menjadi dokumen Markdown yang diformat dengan baik. Dalam lingkungan pasar di mana produk pesaing umumnya mengenakan biaya tahunan sebesar $144 dan mengandalkan cloud, Speech To Markdown memberikan jalur berbeda bagi pengguna teknologi yang sensitif terhadap privasi dengan tiga keuntungan yaitu sepenuhnya gratis, 100% offline, dan kode sumber terbuka. Produk saat ini masih dalam tahap awal (v0.2.0) dan popularitas komunitas belum terbentuk, namun logika yang mendasari dan arah pengalaman pengguna telah dikenali.

  • Speech To Markdown (disingkat stmd) dikembangkan oleh pengembang independen Igor Steblii (GitHub: xajik). Igor adalah pengembang tumpukan penuh. Dia mengungkapkan di LinkedIn bahwa motivasi langsungnya untuk mengembangkan aplikasi ini adalah: "Hasil berbicara dengan Gemini menjadi semakin buruk, dan akhirnya menyerah dan kembali mengetik. Input suara memang lebih cepat daripada mengetik, tetapi tantangan sebenarnya bukanlah kecepatan, tetapi struktur - sulit untuk mengatur pikiran Anda saat mendiskusikan proses, produk, atau persyaratan teknis yang kompleks secara dadakan." Proses pengembangan aplikasi dimulai pada tahun 2025. Awalnya diulang di GitHub dengan nama VoiceToMarkdown dan telah berkembang melalui empat versi: 0.0.4→0.0.8→0.1.0→0.1.1. Pada 10 Juli 2026, proyek ini berganti nama menjadi SpeechToMarkdown dan versi v0.2.0 dirilis. Pada saat yang sama, SpeechToMarkdown versi iOS tersedia di App Store, mendukung iPhone 15 Pro dan yang lebih baru. Saat ini repositori GitHub memiliki 41 commit, 2 kontributor (termasuk kontribusi bantuan Claude AI), dan aplikasi App Store hanya berukuran 3,1 MB. Penempatan Speech To Markdown sangat jelas: ini bukan produk konsumen massal, tetapi alat efisiensi untuk pengguna teknis, pengembang, dan pengguna berat Markdown. Ini tidak mengejar cakupan lintas platform atau fungsi sinkronisasi cloud, tetapi mencapai kedalaman, akurasi, dan privasi tertinggi dalam ekosistem Apple.

  • Speech To Markdown menyediakan dua versi - versi desktop macOS dan versi seluler iOS. Kedua rangkaian tumpukan teknologi ini berbeda tetapi pengalamannya sama. Mari kita bicara tentang versi desktop macOS terlebih dahulu. Ini beroperasi di bilah menu dan dapat dipanggil kapan saja melalui tombol pintas ⌘⌥] - mode "dikte global" diaktifkan di aplikasi apa pun dan teks penurunan harga yang ditranskripsi langsung dimasukkan pada posisi kursor saat ini setelah berbicara. Metode "injeksi global" ini menerobos hambatan masukan semua aplikasi, dan Anda dapat menggunakannya di terminal, browser, Slack, dan VS Code sesuka hati. Selain dikte global, ada juga "mode agen" - jendela editor penurunan harga secara real-time. Saat Anda berbicara, suara Anda pertama-tama ditranskripsi menjadi teks oleh berbisik.cpp (di-buffer setiap 4 detik), dan kemudian dikirim ke LLM lokal untuk pemrosesan terstruktur. Hasilnya dialirkan ke editor, dan apa yang Anda lihat itulah yang Anda dapatkan. Versi seluler iOS telah mengambil jalur teknis yang sangat berbeda. Itu tidak bergantung pada server LLM eksternal apa pun, tetapi memanggil SpeechAnalyzer bawaan perangkat Apple untuk pengenalan ucapan dan Model Yayasan Apple untuk pemformatan. Artinya, ia tidak memiliki konfigurasi, tidak ada ketergantungan, dan bahkan mendukung mode pesawat. Sejak peluncuran App Store, pengguna hanya perlu mengunduh dan menggunakannya. Tidak diperlukan registrasi, pengaturan, dan koneksi jaringan. Hal yang paling penting adalah tiga mode kerjanya. Mode format adalah mode dikte gratis. Apa yang Anda katakan akan dikirim ke LLM untuk merekonstruksi seluruh dokumen secara real time - semua konten baru dikirim ke model bersama dengan konten yang ada untuk memastikan konsistensi global. Mode edit memperlakukan suara sebagai instruksi, bukan konten, seperti "Ubah subtitle menjadi Catatan Mingguan" dan "Ubah daftar ini menjadi tabel" - pilih teks dan ucapkan instruksi, dan model hanya mengubah bagian yang dipilih. Mode penambahan adalah mode akselerasi yang dirancang untuk dokumen panjang. Hanya tiga kalimat terakhir ditambah konten baru yang dikirim ke LLM, dan penundaan tidak bertambah seiring dengan panjang dokumen. Format output mendukung Penurunan harga, teks biasa, dan HTML, yang dapat diubah kapan saja selama sesi, dan pengaturannya dipertahankan di seluruh startup. Semua sesi disimpan secara otomatis dan transkrip asli selalu tersedia dengan satu klik.Dalam hal perbandingan produk yang kompetitif, Typeless ($144/tahun, pemrosesan cloud) dan Wispr Flow ($144/tahun, pemrosesan cloud) memberikan pengalaman lintas platform yang lebih matang, namun keduanya merupakan langganan berbayar dan mengandalkan cloud. Trace (pembelian satu kali senilai £9,99, khusus macOS) lebih profesional dalam memenuhi transkripsi dan pemisahan speaker, tetapi tidak memiliki kemampuan penataan waktu nyata. v2md (mulai dari $14,49/tahun, offline di iOS) adalah pesaing terdekat, tetapi model pengisian daya dan posisinya masih kontroversial. Speech To Markdown tidak memiliki saingan dalam empat dimensi "sepenuhnya gratis + open source + 100% offline + dukungan Markdown asli".

  • Speech To Markdown saat ini sepenuhnya gratis, tanpa pembelian dalam aplikasi, tanpa langganan, dan tanpa iklan. Versi iOS tersedia di App Store, dan versi macOS didistribusikan melalui GitHub. Kode ini bersifat open source di GitHub dan siapa pun dapat dengan bebas mengunduh, mengkompilasi, dan memodifikasinya. Model ini sangat jarang ditemukan di antara produk sejenis. Typeless memiliki biaya tahunan sebesar $144, Wispr Flow memiliki biaya tahunan sebesar $144, Brain Dump memiliki biaya tahunan sebesar $44,99, dan v2md memiliki biaya tahunan sebesar $14,49–$35,99. Satu-satunya yang hampir gratis adalah Trace (pembelian satu kali £9,99), tetapi fungsinya sangat berbeda. Igor tidak mengungkapkan rencana monetisasi di masa depan, namun ada spekulasi bahwa ia dapat mencapai keberlanjutan jangka panjang melalui sponsorship (seperti Sponsor GitHub) atau layanan tambahan (seperti sinkronisasi cloud, versi tim). Saat ini stmd tidak memiliki cukup ulasan di App Store untuk menampilkan peringkat, dan jumlah bintang di GitHub juga masih dalam tahap awal. Namun alat ini menunjukkan jalur perangkat lunak yang berbeda dari langganan SaaS: kecil namun indah, gratis dan sumber terbuka, serta berbasis teknologi.

  • Karena Speech To Markdown hanya ada di App Store untuk waktu yang singkat, ulasan pengguna belum cukup dikumpulkan. Namun sudah ada beberapa suara di komunitas pengembang. Igor menerbitkan artikel berjudul "From Brain Dump to Markdown: Structure Ideas as You Speak" di DEV.to, mendiktekan keseluruhan artikel menggunakan stmd sebagai demonstrasi. Ada juga pengguna awal di LinkedIn yang mengatakan, "Pengalaman ini ternyata bagus - Saya hanya mengatakan sesuatu dengan santai, dan tidak hanya mengubahnya menjadi teks, tetapi juga langsung mengaturnya ke dalam Markdown untuk saya dan secara otomatis membaginya menjadi poin 1, 2, dan 3 yang jelas."

  • Saat ini, aplikasi ini hanya mendapat sedikit paparan di media industri, dan tidak ada laporan dari media teknologi arus utama seperti TechCrunch dan The Verge. Namun dalam komunitas alat pengembang, situs navigasi alat seperti thistools.app dan gunbark.dev telah mengambilnya dan mengulasnya dengan baik. Tinjauan terhadap thistools.app menyatakan: "Logika yang mendasari arsitektur ini sangat jelas - audio ditranskripsi dan di-buffer oleh Whisper.cpp dalam waktu sekitar 4 detik, dan ketika terakumulasi sekitar 30 kata, audio tersebut dikirim ke LLM, dan hasilnya dialirkan ke editor. Desain ini mencapai keseimbangan yang baik antara latensi dan konsistensi global." Dalam hal lanskap produk yang kompetitif, pasar berkembang pesat. Typeless baru saja mendapat perhatian baru pada Juli 2026. Wispr Flow telah mengumpulkan $81 juta dan bernilai $700 juta. Pidato → jalur teks terstruktur berubah dari "mainan untuk beberapa orang" menjadi "infrastruktur yang dibutuhkan semua orang". Speech To Markdown gratis dan bersumber terbuka. Meskipun sulit untuk membentuk persaingan komersial dalam jangka pendek, perusahaan ini memiliki ceruk pasar yang kuat di kalangan teknis dan kelompok pengguna yang sensitif terhadap privasi.

  • Sebagai alat sumber terbuka gratis, risiko terbesar yang dihadapi Speech To Markdown bukanlah persaingan komersial, namun energi pengembang dan keberlanjutan proyek. Proyek pengembang independen sering kali mengikuti lintasan "awal yang antusias → iterasi yang cepat → stagnasi yang lambat". Jika Igor tidak dapat terus berinvestasi dalam pemeliharaan, stmd mungkin secara bertahap menjadi tidak aktif seperti banyak proyek sumber terbuka yang bagus. Risiko lainnya adalah keterbatasan perangkat keras. Versi iOS memerlukan iOS 26+ dan perangkat Apple Intelligence (iPhone 15 Pro dan lebih tinggi), yang mengecualikan sejumlah besar pengguna yang sudah ada. Versi macOS mengharuskan pengguna untuk menginstal sendiri Whisper.cpp dan server LLM lokal, yang memiliki ambang batas lebih tinggi untuk pengguna non-teknis. Di ekosistem Tiongkok, ambang batas ini sangat menonjol - antarmuka aplikasi hanya mendukung bahasa Inggris, dan hampir tidak ada ulasan atau tutorial berbahasa Mandarin di platform utama Tiongkok (Zhihu, Xiaohongshu, Bilibili, CSDN, dll.), yang merupakan hambatan pertumbuhan pengguna yang signifikan.

  • Speech To Markdown paling cocok untuk tiga tipe orang: pertama, pengguna teknis dan pengembang yang bersedia meluangkan waktu untuk mengonfigurasi LLM lokal dengan imbalan penggunaan gratis tanpa batas dan jaminan privasi tertinggi; kedua, pengguna berat perpustakaan catatan Markdown seperti Obsidian, yang membutuhkan metode masukan dikte yang efisien; ketiga, pengguna yang sangat sensitif terhadap privasi data dan berharap data suara tidak pernah keluar dari perangkat. Orang yang tidak cocok meliputi: konsumen biasa yang mencari pengalaman out-of-the-box (disarankan Typeless atau Wispr Flow), pengguna yang memerlukan sinkronisasi multi-perangkat lintas platform, dan pengguna yang mencari transkripsi rapat dan fungsi pemisahan speaker (disarankan Trace).

  • Speech To Markdown adalah pemain baru yang penting dalam bidang pidato-ke-Markdown. Mereka memilih jalur yang anti-mainstream – tidak ada uang, tidak ada internet, tidak ada penggunaan out-of-the-box – namun justru karena itulah mereka mengisi kesenjangan yang nyata. Pengembang independen Igor Steblii menggunakan serangkaian solusi teknis yang sangat bagus (Bisikan lokal + LLM lokal + tiga mode kerja) untuk membuktikan bahwa ucapan ke teks terstruktur bisa menjadi sangat pribadi dan sepenuhnya gratis. Untuk pengguna target, ini mungkin bukan produk yang matang, tapi sudah pasti berada di arah yang benar.

Ulasan pengguna

  • avatar
    Robin749
    Temui bottleneck — penangkapan suara di lingkungan bising kurang bagus, soalnya pakai mikrofon bawaan Mac. Pakai mikrofon eksternal jadi jauh lebih baik.

  • avatar
    冯明
    Akurasi pengenalan suara Mandarin lebih baik dari dugaan, pakai model Whisper yang handle Mandarin dengan baik. Tapi format Markdown output condong ke kebiasaan Inggris, tata letak Mandarin kadang perlu penyesuaian manual.

  • avatar
    狗狗112
    Dibanding Wispr Flow, kurang sinkronisasi lintas platform dan fitur pembersihan AI, tapi unggul karena gratis total dan data tetap di perangkat. Tergantung prioritas masing-masing.

  • avatar
    ElizabethJenkinsX455
    Andai support Android, tapi arsitekturnya bergantung framework Apple, sepertinya dalam waktu dekat belum ada.

  • avatar
    陈丹丹
    Output streaming dari editor real-time keren banget. Ngomong sambil liat teks muncul baris per baris, kayak lagi nulis kode sendiri (wkwk).

  • avatar
    SHernandezQ
    89 suara di Product Hunt, peringkat 15. Cukup bagus untuk proyek open source gratis yang baru dirilis. Semoga terus berkembang.

  • avatar
    黄云鹏
    Coba versi iOS di pesawat. Mode pesawat jalan sempurna, data nggak ke cloud, ini bikin senang yang sering bepergian.

  • avatar
    TCastilloJr
    Developer Igor nulis artikel lengkap pake tool ini di DEV.to buat demo. Contoh menarik dari eat your own dog food.

  • avatar
    TheXavierScott
    Akan sempurna kalau nanti bisa ditambah fitur pemisah pembicara. Sekarang cuma bisa dipakai satu orang, skenario rapat banyak orang belum tercover.

  • avatar
    EDort
    Gaes, versi macOS pas konfigurasi LLM lokal saya pilih Qwen 3.5 27B 4bit, pakai omlx, kecepatannya lumayan. Ada yang udah coba Gemma 3? Gimana hasilnya?

  • avatar
    realEmaRikstad_x
    Pakai v2md beberapa bulan. Lihat yang ini gratis total agak kaget. Fiturnya mungkin belum selengkap v2md, tapi sebagai open source potensinya besar.

  • avatar
    DebraFosterSr
    Pengaturan shortcut dikte global oke, nggak bentrok dengan Alfred atau Raycast. Tapi pertama kali jalan butuh izin mikrofon dan aksesibilitas, yang mungkin bikin pemula mundur.

  • avatar
    Natalie_Ward_77
    Pemahaman bahasa alami di mode edit belum cukup stabil, tapi mengingat ini produk open source gratis tahap awal, sudah cukup impressive.

  • avatar
    Jessica_Kelly_20227
    Coba pas rapat. Tinggal dikte notulen rapat, langsung dikonversi jadi Markdown terstruktur. Lebih efisien daripada catat manual.

  • avatar
    jcmbo8rhv777
    Setelah bandingin beberapa tool speech-to-Markdown, ini yang paling seimbang antara privasi dan fungsi. Nggak perlu daftar, nggak perlu online, nggak bayar — mau apa lagi?

  • avatar
    LaurenCruzSr
    Tiga format output sangat praktis: Markdown buat dokumentasi, teks biasa buat catatan cepat, HTML buat pratinjau langsung. Berpindah antar format juga mulus.

  • avatar
    TerryRiveraJr
    Coba Gemma 3 dan Qwen 3.5. Saya rasa kualitas format Qwen lebih baik, Gemma unggul di kecepatan.

  • avatar
    crazyswan128
    Lihat source code di GitHub. Kualitas kode Igor bagus. Tapi proyeknya masih awal, cuma 41 commit, agak khawatir perawatannya bisa lanjut nggak.

  • avatar
    itjpsxl6
    Coba mode Edit. Bilang 'ubah subjudul jadi Weekly Notes' beneran berubah — pengalaman edit tanpa keyboard terasa ajaib. Tapi akurasi masih perlu ditingkatkan, instruksi kompleks kadang nggak dipahami.

  • avatar
    Donald.GrayZ383
    Mode Append sangat berguna. Nulis dokumen panjang, latensi nggak bertambah seiring konten makin banyak — cuma nambah konten baru. Desain yang sangat cerdas.

  • avatar
    JohanMortensen
    Dibanding Typeless, ini menang karena gratis total dan proses data lokal. Tapi pengalaman siap pakai Typeless memang lebih baik. Sesuai kebutuhan masing-masing.

  • avatar
    孔飞梅
    Download versi iOS, kaget ukurannya cuma 3.1 MB. Tapi butuh iOS 26 dan iPhone 15 Pro ke atas — 14 Pro saya kegepong. Nangis.

  • avatar
    DylanHicks_99
    Download dan coba versi macOS. Proses konfigurasi memang ada hambatan untuk pengguna biasa — harus instal whisper.cpp dan LLM lokal dulu. Tapi setelah dikonfigurasi, pengalamannya luar biasa: bicara langsung dapat Markdown terstruktur, dan pintasan dikte global berfungsi di aplikasi mana pun.

  • avatar
    ticklishswan803
    Udah lama cari solusi input suara buat Obsidian, ini langsung output .md. Cocok banget. Gratis open source, keren.

  • avatar
    CAhil
    Lihat Speech To Markdown di Product Hunt. Gratis dan open source, harus dukung. Lihat repo GitHub, arsitekturnya jelas: Whisper lokal untuk transkripsi, LLM lokal untuk output terstruktur, data tidak pernah meninggalkan mesin. Level privasi ini jauh mengungguli solusi cloud.