Speech To Markdown

一款完全免费开源的 macOS/iOS 应用,通过本地 AI 将口述内容实时转化为结构化 Markdown 文档

深度报告

  • Speech To Markdown 是一款由独立开发者 Igor Steblii 打造的免费开源 macOS/iOS 应用,核心理念是「说话,获得干净的 Markdown,100% 本地处理」。它通过本地 Whisper 语音识别 + 本地 LLM 实时结构化,将口述内容直接转化为格式规整的 Markdown 文档。在竞品普遍年费 $144 且依赖云端的市场环境下,Speech To Markdown 以完全免费、100% 离线、开源代码的三重优势,为隐私敏感的技术用户提供了一条差异化路径。目前产品处于早期阶段(v0.2.0),社区热度尚未形成,但底层逻辑和用户体验方向已得到认可。

  • Speech To Markdown(简称 stmd)由独立开发者 Igor Steblii(GitHub: xajik)开发。Igor 是一名全栈开发者,在 LinkedIn 上透露,他开发这款应用的直接动机是:「对着 Gemini 说话,结果越来越差,最后放弃又回去打字了。语音输入确实比打字快,但真正的挑战不是速度,而是结构——你很难在即兴讨论复杂流程、产品或技术需求时同时组织好思路。」 该应用的开发历程始于 2025 年,最初以 VoiceToMarkdown 为名在 GitHub 上迭代,经历了 0.0.4→0.0.8→0.1.0→0.1.1 四个版本的演进。2026 年 7 月 10 日,项目更名为 SpeechToMarkdown 并发布 v0.2.0 版本。同时,iOS 版 SpeechToMarkdown 上架 App Store,支持 iPhone 15 Pro 及以上机型。截至目前,GitHub 仓库有 41 次提交、2 位贡献者(包含 Claude AI 辅助贡献),App Store 应用仅 3.1 MB。 Speech To Markdown 的定位非常明确:它不是一个大众消费者产品,而是一个面向技术用户、开发者、Markdown 重度用户的效率工具。它不追求跨平台覆盖或云同步功能,而是在 Apple 生态内做到深度、精准和隐私极致。

  • Speech To Markdown 提供双版本——macOS 桌面版和 iOS 移动版,两套技术栈不同但体验一致。 先说 macOS 桌面版。它运作在菜单栏中,可以通过快捷键 ⌘⌥] 随时唤起「全局听写」模式——在任何应用中激活,说话后转录的 Markdown 文本直接输入当前光标位置。这种「全局注入」的方式打通了所有 App 的输入壁垒,你可以在终端、浏览器、Slack、VS Code 里随意使用。除了全局听写,还有「代理模式」——一个实时 Markdown 编辑器窗口,你说话时语音先由 whisper.cpp 转录为文字(每 4 秒一段缓冲),再发送给本地 LLM 进行结构化处理,结果流式写入编辑器,所见即所得。 iOS 移动版则走了一条完全不同的技术路线。它不依赖任何外部 LLM 服务器,而是调用 Apple 设备内置的 SpeechAnalyzer 做语音识别、Apple Foundation Models 做格式化处理。这意味着它零配置、零依赖、甚至支持飞行模式。App Store 上架以来,用户只需下载即可使用,无需注册、无需设置、无需网络连接。 最值得关注的是它的三种工作模式。Format 模式是自由口述模式,你说的话会发给 LLM 实时重构整个文档——所有新内容连同已有内容一起发给模型,确保全局一致性。Edit 模式则把语音当作指令而非内容,比如「把副标题改成 Weekly Notes」「把这个列表转成表格」——选中文本后说出指令,模型只改动选中部分。Append 模式是为长文档设计的加速模式,只发送最后 3 个句子加新内容给 LLM,延迟不随文档长度增长。 输出格式支持 Markdown、纯文本和 HTML 三种,可在会话中随时切换,设置会跨启动保留。所有会话自动保存,原始转录始终一键可查。 竞品对比方面,Typeless($144/年,云端处理)和 Wispr Flow($144/年,云端处理)提供了更成熟的跨平台体验,但它们都是付费订阅制且依赖云端。Trace(£9.99 一次性买断,仅 macOS)在会议转录和说话人分离上更专业,但缺少实时结构化能力。v2md($14.49/年起,iOS 端离线)是最接近的竞品,但收费模式和定位争议较大。Speech To Markdown 在「完全免费 + 开源 + 100% 离线 + Markdown 原生支持」这四个维度上至今没有对手。

  • Speech To Markdown 目前完全免费,无任何内购、无订阅、无广告。iOS 版在 App Store 上架,macOS 版通过 GitHub 分发。代码以开源形式公开在 GitHub 上,任何人都可以自由下载、编译和修改。 这一模式在同类产品中极为罕见。Typeless 年费 $144,Wispr Flow 年费 $144,Brain Dump 年费 $44.99,v2md 年费 $14.49–$35.99。唯一接近免费的是 Trace(£9.99 一次性买断),但功能定位完全不同。Igor 没有透露未来的变现计划,但可以推测,他可能通过赞助(如 GitHub Sponsors)或附加服务(如云同步、团队版)来实现长期可持续。 目前 stmd 在 App Store 上尚未获得足够评价以显示评分,GitHub 的 Star 数也处于起步阶段。但这款工具展示了一条不同于 SaaS 订阅制的软件路径:小而美、免费开源、技术驱动。

  • 由于 Speech To Markdown 在 App Store 上架时间尚短,尚未积累足够用户评价。 但在开发者社区中,已有一些声音。Igor 在 DEV.to 上发表了题为《From Brain Dump to Markdown: Structure Ideas as You Speak》的文章,用 stmd 口述撰写了整篇文章作为演示。LinkedIn 上也有种子用户表示「体验出乎意料地好——我只是随口说了一段话,它不仅转成了文字,还直接帮我整理成 Markdown 并自动拆成清晰的 1、2、3 点」。

  • 目前这款应用在行业媒体中的曝光极少,没有 TechCrunch、The Verge 等主流科技媒体的报道。但在开发者工具社区,thistools.app 和 gunbark.dev 等工具导航网站已将其收录并给出正面评价。thistools.app 的评价指出:「这套架构的底层逻辑很清晰——音频由 whisper.cpp 以约 4 秒为一段转录并缓冲,当累积约 30 个单词时发送给 LLM,结果流式写入编辑器。这种设计在延迟和全局一致性之间取得了不错的平衡。」 在竞品格局层面,市场正在快速膨胀。Typeless 在 2026 年 7 月刚获得新一轮关注,Wispr Flow 已融资 $81M、估值 $7 亿。语音→结构文本这条赛道正在从「少数人的玩具」变成「每个人都需要的基础设施」。Speech To Markdown 以免费开源的姿态切入,虽然短期内难以形成商业竞争,但在技术圈和隐私敏感用户群体中有一个稳固的利基市场。

  • 作为一款免费开源工具,Speech To Markdown 面临的最大风险不是商业竞争,而是开发者精力和项目可持续性。独立开发者项目常见「热情启动→快速迭代→缓慢停滞」的轨迹。如果 Igor 无法持续投入维护,stmd 可能会像许多优秀的开源项目一样逐渐失活。 另一个风险是硬件限制。iOS 版需要 iOS 26+ 和 Apple Intelligence 设备(iPhone 15 Pro 及以上),这排除了大量存量用户。macOS 版则需要用户自行安装 whisper.cpp 和本地 LLM 服务器,对非技术用户的门槛较高。在中文生态中,这个门槛尤其突出——应用界面仅支持英语,在中国主流平台(知乎、小红书、B 站、CSDN 等)上几乎没有任何中文评测或教程,这是一个显著的用户增长瓶颈。

  • Speech To Markdown 最适合三类人:一是技术用户和开发者,愿意花时间配置本地 LLM,换来无限制免费使用和最高隐私保障;二是 Obsidian 等 Markdown 笔记库的重度用户,需要一种高效的口述输入方式;三是对数据隐私极端敏感的用户,希望语音数据绝对不离开设备。 不适合的人群包括:期待开箱即用体验的普通消费者(建议用 Typeless 或 Wispr Flow)、需要跨平台多设备同步的用户、以及追求会议转录和说话人分离功能的用户(建议用 Trace)。

  • Speech To Markdown 是语音转 Markdown 领域一个值得关注的新玩家。它选择了一条反主流的路——不收钱、不联网、不开箱即用——但恰恰因此填补了一个真实存在的空白。独立开发者 Igor Steblii 用一套精巧的技术方案(本地 Whisper + 本地 LLM + 三种工作模式),证明了语音到结构化文本这件事可以做到极致隐私且完全免费。对于目标用户而言,它可能不是一个成熟的产品,但绝对是一个对的方向。

用户评论

  • 头像
    Robin749
    发现一个瓶颈——在嘈杂环境中拾音效果不太行,毕竟用的是 Mac 自带麦克风。接个外置麦克风会好很多。

  • 头像
    冯明
    中文语音识别的准确率比预期好,用的 whisper 模型对中文支持不错。但输出的 Markdown 格式化风格偏英文习惯,中文排版偶尔需要手动调一下。

  • 头像
    狗狗112
    跟 Wispr Flow 比的话,少了跨平台同步和 AI 清理功能,但胜在完全免费且数据不出设备。看个人取舍了。

  • 头像
    ElizabethJenkinsX455
    如果能支持 Android 就好了,但看了下架构依赖 Apple 的框架,估计短期内没戏。

  • 头像
    陈丹丹
    那个实时编辑器的流式输出很带感,说话的时候看着文字一行行出现,有种自己在写代码的错觉(笑)。

  • 头像
    SHernandezQ
    Product Hunt 上 89 票排名第 15,对于一个刚发布的免费开源项目来说表现不错。希望能持续迭代。

  • 头像
    黄云鹏
    试了一下在飞机上用 iOS 版,飞行模式完全没问题,数据不走云端这一点出差党狂喜。

  • 头像
    TCastilloJr
    开发者 Igor 在 DEV.to 上用这个工具写了一整篇文章来演示,挺有意思的 eat your own dog food 案例。

  • 头像
    TheXavierScott
    要是以后能加个说话人分离功能就完美了,现在只能一个人用,多人会议的场景还覆盖不了。

  • 头像
    EDort
    大佬们,macOS 版配置本地 LLM 的时候选的 Qwen3.5 27B 4bit,omlx 跑的,速度还不错。有人试过用 Gemma 3 吗?效果咋样?

  • 头像
    realEmaRikstad_x
    v2md 用了几个月,看到这个上来就是全免费还挺意外的。可能功能还没 v2md 那么完善,但开源的潜力大。

  • 头像
    DebraFosterSr
    全局听写的快捷键设置得不错,跟 Alfred 和 Raycast 不冲突。不过第一次启动还需要麦克风和辅助功能权限,这个对小白可能有点劝退。

  • 头像
    Natalie_Ward_77
    编辑模式下指令的自然语言理解还不够稳定,但考虑到是免费开源的初期产品,已经很惊喜了。

  • 头像
    Jessica_Kelly_20227
    开会的时候试了一下,直接口述会议纪要,转完就是结构化的 Markdown,比手动记笔记效率高太多了。

  • 头像
    jcmbo8rhv777
    对比了一圈语音转 Markdown 工具,这个是在隐私和功能之间平衡得最好的。不用注册、不联网、不付费,还要啥自行车。

  • 头像
    LaurenCruzSr
    三个输出格式很实用,Markdown 写文档、纯文本记速记、HTML 直接预览,切换还很流畅。

  • 头像
    TerryRiveraJr
    试了 Gemma 3 和 Qwen3.5,个人感觉 Qwen 的格式化质量更好一些,Gemma 胜在速度快。

  • 头像
    crazyswan128
    GitHub 上看了源码,Igor 的代码质量不错。不过项目还比较初期,只有 41 次提交,有点担心后续维护能不能跟上。

  • 头像
    itjpsxl6
    试了 Edit 模式,说「把副标题改成 Weekly Notes」真的就改了,免键盘编辑的体验很神奇。不过精度还有提升空间,复杂指令有时理解不对。

  • 头像
    Donald.GrayZ383
    Append 模式太好用了,写长文档的时候延迟不会随着内容变长而增加,只追加新内容,这个设计很聪明。

  • 头像
    JohanMortensen
    跟 Typeless 比的话,这个胜在完全免费而且数据本地处理。不过 Typeless 开箱即用的体验确实更好,各取所需吧。

  • 头像
    孔飞梅
    iOS 版下载了,3.1 MB 的体积惊到我了。不过要 iOS 26 + iPhone 15 Pro 以上,我的 14 Pro 被精准排除,哭了。

  • 头像
    DylanHicks_99
    下载试了一下 macOS 版,配置过程对普通用户确实有门槛,得先装 whisper.cpp 和本地 LLM。但配好之后体验是真的爽,说话直接出结构化 Markdown,全局听写快捷键在任意应用里都能用。

  • 头像
    ticklishswan803
    一直在找 Obsidian 的语音输入方案,这个直接输出 .md 文件完美匹配。免费开源太香了。

  • 头像
    CAhil
    Product Hunt 上看到了 Speech To Markdown,免费开源的东西必须支持一下。看了一下 GitHub 仓库,架构思路很清楚,本地 Whisper 做转写、本地 LLM 结构化输出,数据完全不离机,这个隐私级别甩那些云端方案几条街。