Speech To Markdown
App macOS/iOS mã nguồn mở miễn phí chuyển giọng nói thành tài liệu Markdown qua AI cục bộ
Báo cáo chuyên sâu
-
Speech To Markdown là một ứng dụng macOS/iOS mã nguồn mở và miễn phí được tạo bởi nhà phát triển độc lập Igor Steblii. Khái niệm cốt lõi là "Nói, nhận Markdown rõ ràng, xử lý cục bộ 100%". Nó sử dụng tính năng nhận dạng giọng nói Whisper cục bộ + cấu trúc thời gian thực LLM cục bộ để chuyển đổi trực tiếp nội dung giọng nói thành tài liệu Markdown được định dạng tốt. Trong môi trường thị trường nơi các sản phẩm cạnh tranh thường tính phí hàng năm là 144 USD và dựa vào đám mây, Speech To Markdown cung cấp một lộ trình khác biệt cho những người dùng công nghệ quan tâm đến quyền riêng tư với ba ưu điểm là hoàn toàn miễn phí, ngoại tuyến 100% và mã nguồn mở. Sản phẩm hiện đang ở giai đoạn đầu (v0.2.0) và mức độ phổ biến của cộng đồng vẫn chưa hình thành, nhưng logic cơ bản và hướng trải nghiệm người dùng đã được công nhận.
-
Speech To Markdown (viết tắt là stmd) được phát triển bởi nhà phát triển độc lập Igor Steblii (GitHub: xajik). Igor là một nhà phát triển full-stack. Anh tiết lộ trên LinkedIn rằng động lực trước mắt của anh để phát triển ứng dụng này là: "Kết quả của việc nói chuyện với Gemini ngày càng tệ hơn, cuối cùng phải bỏ cuộc và quay lại gõ phím. Nhập bằng giọng nói thực sự nhanh hơn gõ, nhưng thách thức thực sự không phải là tốc độ mà là cấu trúc - rất khó để sắp xếp suy nghĩ của bạn trong khi ngẫu hứng thảo luận về các quy trình, sản phẩm hoặc yêu cầu kỹ thuật phức tạp." Quá trình phát triển ứng dụng bắt đầu vào năm 2025. Ban đầu, nó được lặp lại trên GitHub với tên VoiceToMarkdown và đã phát triển qua bốn phiên bản: 0.0.4→0.0.8→0.1.0→0.1.1. Vào ngày 10 tháng 7 năm 2026, dự án được đổi tên thành SpeechToMarkdown và phiên bản v0.2.0 được phát hành. Đồng thời, phiên bản iOS của SpeechToMarkdown đã có mặt trên App Store, hỗ trợ iPhone 15 Pro trở lên. Tính đến thời điểm hiện tại, kho lưu trữ GitHub có 41 cam kết, 2 người đóng góp (bao gồm cả đóng góp hỗ trợ của Claude AI) và ứng dụng App Store chỉ có dung lượng 3,1 MB. Định vị của Speech To Markdown rất rõ ràng: nó không phải là một sản phẩm tiêu dùng đại chúng mà là một công cụ hiệu quả dành cho người dùng kỹ thuật, nhà phát triển và người dùng Markdown nặng. Nó không theo đuổi các chức năng bao phủ đa nền tảng hoặc đồng bộ hóa đám mây, nhưng đạt được độ sâu, độ chính xác và quyền riêng tư cao nhất trong hệ sinh thái Apple.
-
Speech To Markdown cung cấp hai phiên bản - phiên bản máy tính để bàn macOS và phiên bản di động iOS. Hai bộ ngăn xếp công nghệ khác nhau nhưng trải nghiệm thì giống nhau. Trước tiên hãy nói về phiên bản máy tính để bàn macOS. Nó hoạt động trong thanh menu và có thể được gọi bất cứ lúc nào thông qua phím tắt ⌘⌥] - chế độ "đọc chính tả chung" được kích hoạt trong bất kỳ ứng dụng nào và văn bản Markdown đã phiên âm được nhập trực tiếp vào vị trí con trỏ hiện tại sau khi nói. Phương pháp "chèn toàn cầu" này vượt qua các rào cản đầu vào của tất cả các ứng dụng và bạn có thể sử dụng nó trong thiết bị đầu cuối, trình duyệt, Slack và VS Code theo ý muốn. Ngoài tính năng đọc chính tả chung, còn có "chế độ tác nhân" - cửa sổ soạn thảo Markdown thời gian thực. Khi bạn nói, giọng nói của bạn trước tiên được phiên âm thành văn bản bởi thì thầm.cpp (được đệm 4 giây một lần), sau đó được gửi đến LLM cục bộ để xử lý có cấu trúc. Kết quả được truyền trực tiếp vào trình chỉnh sửa và những gì bạn thấy là những gì bạn nhận được. Phiên bản di động iOS đã đi theo một con đường kỹ thuật hoàn toàn khác. Nó không dựa vào bất kỳ máy chủ LLM bên ngoài nào mà gọi SpeechAnalyzer tích hợp sẵn của các thiết bị Apple để nhận dạng giọng nói và Apple Foundation Models để định dạng. Điều này có nghĩa là nó không có cấu hình, không phụ thuộc và thậm chí còn hỗ trợ chế độ trên máy bay. Kể từ khi App Store ra mắt, người dùng chỉ cần tải về và sử dụng. Không cần đăng ký, không cần cài đặt và không cần kết nối mạng. Điều đáng chú ý nhất là ba chế độ làm việc của nó. Chế độ định dạng là chế độ đọc chính tả miễn phí. Những gì bạn nói sẽ được gửi đến LLM để xây dựng lại toàn bộ tài liệu theo thời gian thực - tất cả nội dung mới được gửi đến mô hình cùng với nội dung hiện có để đảm bảo tính nhất quán toàn cầu. Chế độ chỉnh sửa coi giọng nói là hướng dẫn chứ không phải nội dung, chẳng hạn như "Thay đổi phụ đề thành Ghi chú hàng tuần" và "Chuyển danh sách này thành bảng" - chọn văn bản và đọc hướng dẫn và mô hình chỉ thay đổi phần đã chọn. Chế độ chắp thêm là chế độ tăng tốc được thiết kế cho các tài liệu dài. Chỉ ba câu cuối cùng cộng với nội dung mới được gửi tới LLM và độ trễ không tăng theo độ dài của tài liệu. Định dạng đầu ra hỗ trợ Markdown, văn bản thuần túy và HTML, có thể được chuyển đổi bất kỳ lúc nào trong phiên và các cài đặt được giữ lại trong suốt quá trình khởi động. Tất cả các phiên được lưu tự động và bản ghi gốc luôn có sẵn chỉ bằng một cú nhấp chuột.Về mặt so sánh sản phẩm cạnh tranh, Typeless ($144/năm, xử lý đám mây) và Wispr Flow ($144/năm, xử lý đám mây) mang lại trải nghiệm đa nền tảng hoàn thiện hơn, nhưng cả hai đều là đăng ký trả phí và dựa trên đám mây. Trace (mua một lần £9,99, chỉ dành cho macOS) chuyên nghiệp hơn trong việc phiên âm cuộc họp và tách loa nhưng thiếu khả năng cấu trúc thời gian thực. v2md (bắt đầu từ $14,49/năm, ngoại tuyến trên iOS) là đối thủ cạnh tranh gần nhất, nhưng mô hình tính phí và định vị của nó đang gây tranh cãi. Speech To Markdown không có đối thủ trong bốn khía cạnh "hoàn toàn miễn phí + nguồn mở + 100% ngoại tuyến + hỗ trợ Markdown gốc".
-
Speech To Markdown hiện hoàn toàn miễn phí, không mua hàng trong ứng dụng, không đăng ký và không có quảng cáo. Phiên bản iOS có sẵn trên App Store và phiên bản macOS được phân phối qua GitHub. Mã này là mã nguồn mở trên GitHub và bất kỳ ai cũng có thể tự do tải xuống, biên dịch và sửa đổi nó. Model này cực kỳ hiếm trong số các sản phẩm tương tự. Typeless có phí hàng năm là 144 USD, Wispr Flow có phí hàng năm là 144 USD, Brain Dump có phí hàng năm là 44,99 USD và v2md có phí hàng năm là 14,49–35,99 USD. Ứng dụng duy nhất gần như miễn phí là Trace (mua một lần với giá £9,99), nhưng chức năng thì hoàn toàn khác. Igor không tiết lộ kế hoạch kiếm tiền trong tương lai, nhưng có thể suy đoán rằng anh ấy có thể đạt được sự bền vững lâu dài thông qua tài trợ (như Nhà tài trợ GitHub) hoặc các dịch vụ bổ sung (như đồng bộ hóa đám mây, phiên bản nhóm). Hiện tại stmd chưa có đủ đánh giá trên App Store để hiển thị xếp hạng, đồng thời số sao trên GitHub cũng ở mức sơ khai. Nhưng công cụ này cho thấy một đường dẫn phần mềm khác với đăng ký SaaS: nhỏ nhưng đẹp, nguồn mở và miễn phí và dựa trên công nghệ.
-
Vì Speech To Markdown chỉ mới xuất hiện trên App Store được một thời gian ngắn nên nó vẫn chưa tích lũy đủ đánh giá của người dùng. Nhưng đã có một số tiếng nói trong cộng đồng nhà phát triển. Igor đã xuất bản một bài báo có tiêu đề "Từ Brain Dump đến Markdown: Ý tưởng cấu trúc khi bạn nói" trên DEV.to, đưa ra toàn bộ bài viết bằng cách sử dụng stmd làm minh họa. Cũng có những người dùng hạt giống trên LinkedIn cho biết: "Trải nghiệm tốt đến không ngờ - tôi chỉ thản nhiên nói điều gì đó và nó không chỉ chuyển nó thành văn bản mà còn trực tiếp sắp xếp thành Markdown cho tôi và tự động chia thành 1, 2 và 3 điểm rõ ràng."
-
Hiện tại, ứng dụng này nhận được rất ít sự xuất hiện trên các phương tiện truyền thông trong ngành và không có báo cáo nào từ các phương tiện truyền thông công nghệ chính thống như TechCrunch và The Verge. Nhưng trong cộng đồng công cụ dành cho nhà phát triển, các trang web điều hướng công cụ như thistools.app và gunbark.dev đã chọn nó và đánh giá nó một cách thuận lợi. Đánh giá của thistools.app cho biết: "Logic cơ bản của kiến trúc này rất rõ ràng - âm thanh được sao chép và lưu vào bộ nhớ đệm bởi Whisper.cpp trong các phần khoảng 4 giây và khi tích lũy khoảng 30 từ, nó sẽ được gửi đến LLM và kết quả được truyền đến trình chỉnh sửa. Thiết kế này đạt được sự cân bằng tốt giữa độ trễ và tính nhất quán toàn cầu." Xét về bối cảnh sản phẩm cạnh tranh, thị trường đang mở rộng nhanh chóng. Typeless vừa nhận được một đợt chú ý mới vào tháng 7 năm 2026. Wispr Flow đã huy động được 81 triệu USD và được định giá 700 triệu USD. Bài phát biểu → văn bản có cấu trúc đang thay đổi từ "đồ chơi cho một số người" thành "cơ sở hạ tầng mà mọi người đều cần". Speech To Markdown là nguồn mở và miễn phí. Mặc dù khó có thể hình thành cạnh tranh thương mại trong thời gian ngắn nhưng nó có một thị trường thích hợp vững chắc trong giới kỹ thuật và các nhóm người dùng nhạy cảm về quyền riêng tư.
-
Là một công cụ nguồn mở miễn phí, rủi ro lớn nhất mà Speech To Markdown phải đối mặt không phải là cạnh tranh thương mại mà là năng lượng của nhà phát triển và tính bền vững của dự án. Các dự án của nhà phát triển độc lập thường đi theo quỹ đạo "khởi đầu nhiệt tình → lặp lại nhanh → trì trệ chậm". Nếu Igor không thể tiếp tục đầu tư vào bảo trì, stmd có thể dần dần ngừng hoạt động giống như nhiều dự án nguồn mở xuất sắc. Một rủi ro khác là những hạn chế về phần cứng. Phiên bản iOS yêu cầu iOS 26+ và thiết bị Apple Intelligence (iPhone 15 Pro trở lên), loại trừ một số lượng lớn người dùng hiện tại. Phiên bản macOS yêu cầu người dùng phải tự cài đặt thì thầm.cpp và máy chủ LLM cục bộ, có ngưỡng cao hơn đối với người dùng không rành về kỹ thuật. Trong hệ sinh thái Trung Quốc, ngưỡng này đặc biệt nổi bật - giao diện ứng dụng chỉ hỗ trợ tiếng Anh và hầu như không có đánh giá hoặc hướng dẫn bằng tiếng Trung trên các nền tảng chính thống của Trung Quốc (Zhihu, Xiaohongshu, Bilibili, CSDN, v.v.), đây là một nút thắt đáng kể về tăng trưởng người dùng.
-
Speech To Markdown phù hợp nhất với ba loại người: thứ nhất, người dùng kỹ thuật và nhà phát triển sẵn sàng dành thời gian định cấu hình LLM cục bộ để đổi lấy quyền sử dụng miễn phí không giới hạn và đảm bảo quyền riêng tư cao nhất; thứ hai, những người sử dụng nhiều thư viện ghi chú Markdown như Obsidian, những người cần một phương thức nhập chính tả hiệu quả; thứ ba, những người dùng cực kỳ nhạy cảm với quyền riêng tư dữ liệu và hy vọng rằng dữ liệu giọng nói sẽ không bao giờ rời khỏi thiết bị. Những người không phù hợp bao gồm: người tiêu dùng thông thường đang tìm kiếm trải nghiệm vượt trội (khuyên dùng Typeless hoặc Wispr Flow), người dùng cần đồng bộ hóa đa thiết bị đa nền tảng và người dùng đang tìm kiếm chức năng phiên âm cuộc họp và tách người phát ngôn (khuyên dùng Trace).
-
Speech To Markdown là một người chơi mới đáng chú ý trong lĩnh vực chuyển lời nói sang Markdown. Nó đã chọn một con đường đi ngược dòng chính thống - không tiền, không Internet, không sử dụng ngay lập tức - nhưng chính vì điều này mà nó đã lấp đầy một khoảng trống thực sự. Nhà phát triển độc lập Igor Steblii đã sử dụng một bộ giải pháp kỹ thuật tinh tế (Thì thầm cục bộ + LLM cục bộ + ba chế độ làm việc) để chứng minh rằng lời nói trong văn bản có cấu trúc có thể cực kỳ riêng tư và hoàn toàn miễn phí. Đối với người dùng mục tiêu, nó có thể chưa phải là một sản phẩm trưởng thành nhưng chắc chắn nó đang đi đúng hướng.
Đánh giá của người dùng
-
Robin749—Phát hiện một nút thắt — thu âm trong môi trường ồn ào không tốt lắm, vì dùng mic tích hợp của Mac. Cắm mic ngoài sẽ khá hơn nhiều. -
冯明—Độ chính xác nhận dạng tiếng Trung tốt hơn mong đợi, mô hình Whisper xử lý tiếng Trung tốt. Nhưng định dạng Markdown đầu ra nghiêng về thói quen tiếng Anh, cách sắp chữ tiếng Trung thỉnh thoảng cần chỉnh tay. -
狗狗112—So với Wispr Flow, thiếu đồng bộ đa nền tảng và tính năng dọn dẹp AI, nhưng thắng ở chỗ hoàn toàn miễn phí và dữ liệu không ra khỏi thiết bị. Tùy ưu tiên mỗi người. -
ElizabethJenkinsX455—Ước gì hỗ trợ Android, nhưng coi kiến trúc phụ thuộc framework của Apple, chắc trong thời gian tới khó. -
陈丹丹—Output streaming của trình soạn thảo thời gian thực rất hay. Vừa nói vừa thấy chữ hiện ra từng dòng, cảm giác như đang tự viết code vậy (cười). -
SHernandezQ—89 phiếu trên Product Hunt, hạng 15. Khá tốt cho một dự án mã nguồn mở miễn phí mới ra mắt. Hy vọng sẽ tiếp tục phát triển. -
黄云鹏—Thử bản iOS trên máy bay. Chế độ máy bay hoạt động hoàn hảo, dữ liệu không lên đám mây, dân công tác mê tít. -
TCastilloJr—Developer Igor đã viết cả một bài báo bằng công cụ này trên DEV.to để minh họa. Một case study eat your own dog food thú vị. -
TheXavierScott—Sẽ hoàn hảo nếu sau này thêm tính năng tách người nói. Giờ chỉ một người dùng được, kịch bản họp nhiều người chưa cover được. -
EDort—Mọi người ơi, bản macOS khi cấu hình LLM local tôi chọn Qwen 3.5 27B 4bit, chạy bằng omlx, tốc độ khá ổn. Ai đã thử Gemma 3 chưa? Hiệu quả thế nào? -
realEmaRikstad_x—Dùng v2md vài tháng. Thấy cái này ra mắt miễn phí hoàn toàn khá bất ngờ. Tính năng có thể chưa hoàn thiện bằng v2md, nhưng là mã nguồn mở thì tiềm năng rất lớn. -
DebraFosterSr—Phím tắt đọc chính tả toàn cục cài tốt, không xung đột với Alfred hay Raycast. Nhưng lần đầu khởi động cần cấp quyền mic và trợ năng, có thể làm newbie ngại. -
Natalie_Ward_77—Khả năng hiểu ngôn ngữ tự nhiên trong chế độ chỉnh sửa chưa đủ ổn định, nhưng xét là sản phẩm mã nguồn mở miễn phí giai đoạn đầu thì đã rất ấn tượng. -
Jessica_Kelly_20227—Thử trong cuộc họp. Chỉ cần đọc biên bản bằng lời nói là nó chuyển thành Markdown có cấu trúc. Hiệu quả hơn ghi chép tay rất nhiều. -
jcmbo8rhv777—Sau khi so sánh vài tool speech-to-Markdown, cái này cân bằng tốt nhất giữa quyền riêng tư và chức năng. Không cần đăng ký, không cần mạng, không trả phí — còn đòi gì hơn? -
LaurenCruzSr—Ba định dạng đầu ra rất thực tế: Markdown viết tài liệu, text thuần ghi tốc ký, HTML xem trước trực tiếp. Chuyển đổi giữa chúng cũng mượt. -
TerryRiveraJr—Thử Gemma 3 và Qwen 3.5. Cá nhân tôi thấy chất lượng định dạng của Qwen tốt hơn, Gemma thắng ở tốc độ. -
crazyswan128—Xem source code trên GitHub. Chất lượng code của Igor tốt. Nhưng dự án còn sớm, chỉ 41 commit, hơi lo về việc bảo trì sau này. -
itjpsxl6—Thử chế độ Edit. Nói 'đổi phụ đề thành Weekly Notes' nó sửa thật — trải nghiệm chỉnh sửa không cần bàn phím khá kỳ diệu. Nhưng độ chính xác còn cần cải thiện, chỉ thị phức tạp đôi khi bị hiểu sai. -
Donald.GrayZ383—Chế độ Append cực kỳ hữu ích. Khi viết tài liệu dài, độ trễ không tăng theo nội dung — chỉ thêm nội dung mới. Thiết kế rất thông minh. -
JohanMortensen—So với Typeless, cái này thắng ở chỗ hoàn toàn miễn phí và xử lý dữ liệu cục bộ. Nhưng trải nghiệm dùng ngay của Typeless quả thực tốt hơn. Mỗi người một nhu cầu. -
孔飞梅—Tải bản iOS về, bất ngờ vì dung lượng chỉ 3.1 MB. Nhưng yêu cầu iOS 26 và iPhone 15 Pro trở lên — 14 Pro của tôi bị loại thẳng. Khóc. -
DylanHicks_99—Tải và thử bản macOS. Quá trình cấu hình hơi khó với người dùng thông thường — phải cài whisper.cpp và LLM cục bộ trước. Nhưng cấu hình xong thì trải nghiệm tuyệt vời: nói là ra Markdown có cấu trúc ngay, phím tắt đọc chính tả toàn cục hoạt động trong mọi ứng dụng. -
ticklishswan803—Đang tìm giải pháp nhập giọng nói cho Obsidian, cái này xuất thẳng file .md. Kết hợp hoàn hảo. Mã nguồn mở miễn phí, tuyệt vời. -
CAhil—Thấy Speech To Markdown trên Product Hunt. Miễn phí mã nguồn mở, phải ủng hộ thôi. Xem repo GitHub, kiến trúc rất rõ ràng: Whisper cục bộ cho phiên âm, LLM cục bộ cho đầu ra có cấu trúc, dữ liệu không bao giờ rời khỏi máy. Mức độ riêng tư này vượt xa các giải pháp đám mây.