Speech To Markdown

完全無料・オープンソースの macOS/iOS アプリ。ローカル AI で音声をリアルタイムに構造化 Markdown に変換

詳細レポート

  • Speech To Markdown は、独立した開発者 Igor Steblii によって作成された無料のオープンソース macOS/iOS アプリケーションです。中心となるコンセプトは、「話す、クリーンな Markdown を取得する、100% ローカル処理」です。ローカルの Whisper 音声認識 + ローカル LLM リアルタイム構造化を使用して、話されたコンテンツを適切にフォーマットされた Markdown ドキュメントに直接変換します。競合製品が一般に年間 144 ドルの年会費を請求し、クラウドに依存する市場環境において、Speech To Markdown は、完全に無料、100% オフライン、オープン ソース コードという 3 つの利点を備え、プライバシーに敏感なテクノロジ ユーザーに差別化されたパスを提供します。この製品は現在初期段階 (v0.2.0) にあり、コミュニティでの人気はまだ形成されていませんが、基礎となるロジックとユーザー エクスペリエンスの方向性は認識されています。

  • Speech To Markdown (略して stmd) は、独立した開発者 Igor Steblii (GitHub: xajik) によって開発されました。 Igor はフルスタック開発者です。同氏は LinkedIn で、このアプリケーションを開発した直接の動機は「ジェミニとの会話の結果はますます悪くなり、ついには諦めてタイピングに戻りました。確かに音声入力はタイピングより速いですが、本当の課題はスピードではなく構造です。複雑なプロセス、製品、技術的要件について即興で議論しながら考えをまとめるのは難しいのです。」と明かしました。 このアプリケーションの開発プロセスは 2025 年に始まりました。最初は VoiceToMarkdown という名前で GitHub 上で反復され、0.0.4→0.0.8→0.1.0→0.1.1 の 4 つのバージョンを経て進化しました。 2026 年 7 月 10 日に、プロジェクトの名前が SpeechToMarkdown に変更され、バージョン v0.2.0 がリリースされました。同時に、iOS バージョンの SpeechToMarkdown が App Store で入手可能になり、iPhone 15 Pro 以降をサポートします。現時点で、GitHub リポジトリには 41 のコミット、2 人の寄稿者 (Claude AI 支援による寄稿を含む) があり、App Store アプリケーションはわずか 3.1 MB です。 Speech To Markdown の位置付けは非常に明確です。これは大衆消費者向けの製品ではなく、技術ユーザー、開発者、および Markdown のヘビー ユーザーのための効率化ツールです。クロスプラットフォームのカバレッジやクラウド同期機能は追求しませんが、Apple エコシステム内で究極の深さ、正確さ、プライバシーを実現します。

  • Speech To Markdown には、macOS デスクトップ バージョンと iOS モバイル バージョンの 2 つのバージョンが提供されます。 2 つのテクノロジー スタックは異なりますが、エクスペリエンスは同じです。 まずは macOS デスクトップ版について話しましょう。これはメニュー バーで操作し、ショートカット キー ⌘⌥] を使用していつでも呼び出すことができます。「グローバル ディクテーション」モードはどのアプリケーションでも有効になり、書き起こされた Markdown テキストは、発話後に現在のカーソル位置に直接入力されます。この「グローバル インジェクション」メソッドは、すべてのアプリの入力障壁を突破し、ターミナル、ブラウザ、Slack、VS Code で自由に使用できます。グローバル ディクテーションに加えて、リアルタイムの Markdown エディタ ウィンドウである「エージェント モード」もあります。あなたが話すと、あなたの声はまず Whisper.cpp によってテキストに変換され (4 秒ごとにバッファリングされます)、次に構造化処理のためにローカル LLM に送信されます。結果はエディタにストリーミングされ、表示されるものがそのまま得られます。 iOS モバイル版は、まったく異なる技術的ルートを採用しています。外部 LLM サーバーには依存しませんが、音声認識には Apple デバイスの組み込み SpeechAnalyzer を呼び出し、フォーマットには Apple Foundation Models を呼び出します。これは、設定や依存関係がゼロで、機内モードもサポートしていることを意味します。 App Storeの開設以来、ユーザーはダウンロードして使用するだけで済みます。登録、設定、ネットワーク接続は必要ありません。 最も注目すべき点は、その 3 つの動作モードです。フォーマットモードはフリーディクテーションモードです。発言内容は LLM に送信され、ドキュメント全体がリアルタイムで再構築されます。グローバルな一貫性を確保するために、すべての新しいコンテンツが既存のコンテンツとともにモデルに送信されます。編集モードでは、「サブタイトルをウィークリーノートに変更する」や「このリストを表に変換する」など、コンテンツではなく音声を指示として扱います。テキストを選択して指示を読み上げると、モデルは選択された部分のみを変更します。追加モードは、長いドキュメント用に設計された高速化モードです。最後の 3 文と新しいコンテンツのみが LLM に送信され、ドキュメントの長さによって遅延が増加することはありません。 出力形式はマークダウン、プレーン テキスト、HTML をサポートしており、セッション中にいつでも切り替えることができ、設定は起動後も保持されます。すべてのセッションは自動的に保存され、元のトランスクリプトはワンクリックでいつでも利用できます。競合製品の比較に関しては、Typeless (年額 144 ドル、クラウド処理) と Wispr Flow (年額 144 ドル、クラウド処理) は、より成熟したクロスプラットフォーム エクスペリエンスを提供しますが、どちらも有料サブスクリプションであり、クラウドに依存しています。 Trace (9.99 ポンドの買い切り、macOS のみ) は、会議の文字起こしと話者の分離においてより専門的ですが、リアルタイムの構造化機能が欠けています。 v2md (年額 14.49 ドルから、iOS ではオフライン) が最も近い競合製品ですが、その課金モデルと位置付けについては議論の余地があります。 Speech To Markdown には、「完全無料 + オープンソース + 100% オフライン + ネイティブ Markdown サポート」という 4 つの側面において競合するものはありません。

  • Speech To Markdown は現在完全に無料で、アプリ内購入、サブスクリプション、広告はありません。 iOS版はApp Storeで、macOS版はGitHub経由で配布されます。コードは GitHub 上のオープンソースであり、誰でも自由にダウンロード、コンパイル、変更できます。 類似商品の中でも非常に珍しいモデルです。 Typeless の年会費は 144 ドル、Wispr Flow の年会費は 144 ドル、Brain Dump の年会費は 44.99 ドル、v2md の年会費は 14.49 ~ 35.99 ドルです。唯一無料に近いのは Trace (9.99 ポンドの買い切り版) ですが、機能はまったく異なります。 Igor 氏は将来の収益化計画については明らかにしていませんが、スポンサーシップ (GitHub スポンサーなど) や追加サービス (クラウド同期、チーム版など) を通じて長期的な持続可能性を達成する可能性があると推測できます。 現在、stmd には評価を表示できるほどのレビューが App Store になく、GitHub 上の星の数も初期段階にあります。しかし、このツールは、SaaS サブスクリプションとは異なるソフトウェア パスを示しています。小さいながらも美しく、無料でオープンソースで、テクノロジー主導です。

  • Speech To Markdown は App Store に登場してからまだ日が浅いため、まだ十分なユーザー レビューが蓄積されていません。 しかし、開発者コミュニティではすでにいくつかの声が上がっています。 Igor は、「From Brain Dump to Markdown: Structure Ideas as You Speak」というタイトルの記事を DEV.to に公開し、デモンストレーションとして stmd を使用して記事全体を口述筆記しました。 LinkedIn のシード ユーザーからは、「エクスペリエンスは思いのほか良いです。私が何気なく言っただけで、それがテキストに変換されるだけでなく、直接 Markdown に整理され、明確な 1、2、3 のポイントに自動的に分割されます。」という声もありました。

  • 現在、このアプリは業界メディアでほとんど露出されておらず、TechCrunch や The Verge などの主流テクノロジー メディアからの報道もありません。しかし、開発者ツール コミュニティでは、thistools.app や Gunbark.dev などのツール ナビゲーション サイトがこれを取り上げ、好意的にレビューしています。 thistools.app のレビューでは、次のように述べられています。「このアーキテクチャの基礎となるロジックは非常に明確です。音声は、whisper.cpp によって約 4 秒のセクションで書き起こされ、バッファリングされ、約 30 単語が蓄積されると、LLM に送信され、結果がエディタにストリーミングされます。この設計は、レイテンシとグローバルな一貫性の間で適切なバランスを実現しています。」 競争力のある製品環境という点では、市場は急速に拡大しています。 Typeless は 2026 年 7 月に新たな注目を集めたばかりです。Wispr Flow は 8,100 万ドルを調達し、評価額は 7 億ドルです。スピーチ→構造化テキストトラックは「一部の人のためのおもちゃ」から「誰もが必要とするインフラ」に変わりつつあります。 Speech To Markdown は無料のオープンソースです。短期的に商業的な競争を形成することは困難ですが、技術界やプライバシーに敏感なユーザーグループにおいて確固たるニッチ市場を持っています。

  • 無料のオープンソース ツールとして、Speech To Markdown が直面する最大のリスクは商業的な競争ではなく、開発者のエネルギーとプロジェクトの持続可能性です。独立系開発者プロジェクトは、多くの場合、「熱心な開始 → 急速な反復 → ゆっくりとした停滞」という軌跡をたどります。 Igor がメンテナンスへの投資を継続できない場合、多くの優れたオープンソース プロジェクトと同様に、stmd は徐々に非アクティブになる可能性があります。 もう 1 つのリスクはハードウェアの制限です。 iOS バージョンには iOS 26 以降と Apple Intelligence デバイス (iPhone 15 Pro 以降) が必要ですが、これにより多くの既存ユーザーが除外されます。 macOS バージョンでは、ユーザーは自分で Whisper.cpp とローカル LLM サーバーをインストールする必要がありますが、技術者以外のユーザーにとっては敷居が高くなります。中国のエコシステムでは、このしきい値は特に顕著です。アプリケーション インターフェイスは英語のみをサポートし、中国の主流プラットフォーム (Zhihu、Xiaohongshu、Bilibili、CSDN など) には中国語のレビューやチュートリアルがほとんどなく、これがユーザー増加の重大なボトルネックとなっています。

  • Speech To Markdown は、次の 3 つのタイプの人々に最適です。1 つは、無制限の無料使用と最高のプライバシー保証と引き換えに、ローカル LLM の構成に時間を費やすことを厭わない技術ユーザーと開発者です。 2 つ目は、Obsidian などの Markdown ノート ライブラリのヘビー ユーザーであり、効率的なディクテーション入力方法を必要としています。 3 番目は、データのプライバシーに非常に敏感で、音声データがデバイスから流出しないことを望んでいるユーザーです。 適さない人としては、すぐに使えるエクスペリエンスを求める一般消費者 (Typeless または Wispr Flow が推奨)、クロスプラットフォームのマルチデバイス同期が必要なユーザー、会議の文字起こしや話者分離機能を探しているユーザー (Trace が推奨) が挙げられます。

  • Speech To Markdown は、Speech-to-Markdown 分野における注目すべき新しいプレーヤーです。お金もインターネットも、すぐに使える使い方もしないという、反主流の道を選択しましたが、まさにそれがあったからこそ、本当のギャップを埋めることができたのです。独立系開発者の Igor Steblii は、一連の優れた技術ソリューション (ローカル Whisper + ローカル LLM + 3 つの作業モード) を使用して、構造化テキストへの音声変換が極めてプライベートで完全に無料であることを証明しました。ターゲットユーザーにとってはまだ成熟した製品ではないかもしれないが、正しい方向に向かっているのは間違いない。

ユーザーレビュー

  • アイコン
    Robin749
    ボトルネックを発見しました—騒がしい環境での音声拾いがイマイチです。Mac内蔵マイクを使っているためで、外部マイクを繋げばかなり改善します。

  • アイコン
    冯明
    中国語音声認識の精度は予想以上に良く、使われているWhisperモデルは中国語をしっかり処理できます。ただし出力のMarkdown書式は英語の習慣に寄っていて、中国語の組版はたまに手動調整が必要です。

  • アイコン
    狗狗112
    Wispr Flowと比べると、クロスプラットフォーム同期とAIクリーンアップ機能がありませんが、完全無料でデータが端末から出ない点が勝っています。好み次第ですね。

  • アイコン
    ElizabethJenkinsX455
    Androidに対応してほしいところですが、アーキテクチャを見るにAppleのフレームワークに依存しているので、短期間では難しそうですね。

  • アイコン
    陈丹丹
    リアルタイムエディタのストリーミング出力がかっこいい。話していると文字が一行ずつ現れて、自分がコードを書いているような錯覚に陥ります(笑)。

  • アイコン
    SHernandezQ
    Product Huntで89票、ランキング15位。リリースされたばかりの無料オープンソースプロジェクトとしては良い成果です。継続的な改善に期待します。

  • アイコン
    黄云鹏
    飛行機の中でiOS版を試しました。機内モードで全く問題なく動作し、データがクラウドに行かないので出張者には嬉しい限りです。

  • アイコン
    TCastilloJr
    開発者のIgorがDEV.toでこのツールを使って記事を丸ごと書き、デモとして公開しました。自分で自分のツールを使う面白い事例です。

  • アイコン
    TheXavierScott
    将来話者分離機能が追加されれば完璧です。今は一人でしか使えず、複数人会議のシナリオはまだカバーできていません。

  • アイコン
    EDort
    皆さん、macOS版でローカルLLMを設定する際にQwen3.5 27B 4bitを選び、omlxで動かしていますが速度は悪くないです。Gemma 3を試した人はいますか?どうですか?

  • アイコン
    realEmaRikstad_x
    v2mdを数ヶ月使っていました。これが完全無料で登場したのは意外です。機能はまだv2mdほど充実していないかもしれませんが、オープンソースの可能性は大きいです。

  • アイコン
    DebraFosterSr
    グローバルディクテーションのショートカットキー設定は良くて、AlfredやRaycastと競合しません。ただし初回起動時にマイクとアクセシビリティの許可が必要で、初心者にはハードルが高いかもしれません。

  • アイコン
    Natalie_Ward_77
    編集モードの自然言語理解はまだ安定していませんが、無料オープンソースの初期製品であることを考えると、十分驚きです。

  • アイコン
    Jessica_Kelly_20227
    会議中に試してみました。口頭で議事録を話すだけで構造化されたMarkdownに変換してくれます。手動でメモを取るよりはるかに効率的です。

  • アイコン
    jcmbo8rhv777
    いくつかの音声→Markdownツールを比較しましたが、これがプライバシーと機能のバランスが最も優れています。登録不要、オフライン、無料——これ以上何を求めるでしょうか。

  • アイコン
    LaurenCruzSr
    3つの出力形式がとても実用的です。Markdownは文書作成、プレーンテキストは速記、HTMLは直接プレビューと、切り替えもスムーズです。

  • アイコン
    TerryRiveraJr
    Gemma 3とQwen3.5を試しました。個人的にはQwenのフォーマット品質の方が良く、Gemmaはスピードで勝っています。

  • アイコン
    crazyswan128
    GitHubでソースコードを見ました。Igorのコード品質は良いです。ただしプロジェクトはまだ初期段階でコミット数が41しかなく、今後のメンテナンスが続くか少し心配です。

  • アイコン
    itjpsxl6
    編集モードを試しました。「副題をWeekly Notesに変更して」と言ったら本当に変更されました。キーボード不要の編集体験は不思議な感じです。ただし精度はまだ改善の余地があり、複雑な指示はたまに理解されません。

  • アイコン
    Donald.GrayZ383
    追加モードが非常に便利です。長い文書を書くとき、内容が長くなっても遅延が増えず、新しい内容だけが追加されます。とても賢い設計です。

  • アイコン
    JohanMortensen
    Typeless と比べると、これは完全無料でデータをローカル処理できる点が勝っている。ただ Typeless の方が開箱即用の体験は確かに良い。それぞれに合った選択だ。

  • アイコン
    孔飞梅
    iOS版をダウンロードしました。3.1MBのサイズに驚きました。しかしiOS 26以上かつiPhone 15 Pro以上が必要で、私の14 Proは見事に除外されました。泣きます。

  • アイコン
    DylanHicks_99
    macOS 版をダウンロードして試した。一般ユーザーには設定の敷居が高いのは確かで、whisper.cpp とローカル LLM を先にインストールする必要がある。でも設定が終われば体験は最高。話すと直接構造化 Markdown が出力され、グローバルディクテーションのショートカットはどのアプリでも使える。

  • アイコン
    ticklishswan803
    ずっとObsidianの音声入力ソリューションを探していましたが、これは直接.mdファイルを出力してくれます。完璧なマッチです。無料オープンソースで最高です。

  • アイコン
    CAhil
    Product Hunt で Speech To Markdown を見かけた。無料でオープンソース、応援しないと。GitHub リポジトリを見たが、アーキテクチャは明快。ローカルの Whisper で文字起こし、ローカルの LLM で構造化出力、データは完全にマシン内に留まる。このプライバシーレベルはクラウド方式を圧倒している。