Speech To Markdown

Бесплатное приложение macOS/iOS с открытым кодом, преобразующее речь в Markdown через локальный ИИ

Подробный отчёт

  • Speech To Markdown — это бесплатное приложение для macOS/iOS с открытым исходным кодом, созданное независимым разработчиком Игорем Стеблием. Основная концепция — «Говори, получай чистый Markdown, 100% локальная обработка». Он использует локальное распознавание речи Whisper + локальное структурирование LLM в реальном времени для прямого преобразования устного контента в хорошо отформатированные документы Markdown. В рыночной среде, где конкурирующие продукты обычно взимают ежегодную плату в размере 144 долларов США и полагаются на облако, Speech To Markdown предоставляет дифференцированный путь для пользователей технологий, чувствительных к конфиденциальности, с тремя преимуществами: полная бесплатность, 100% автономный режим и открытый исходный код. В настоящее время продукт находится на ранней стадии (v0.2.0), и популярность среди сообщества еще не сформировалась, но основная логика и направление взаимодействия с пользователем уже признаны.

  • Speech To Markdown (сокращенно stmd) был разработан независимым разработчиком Игорем Стеблием (GitHub: xajik). Игорь — Full-Stack разработчик. В LinkedIn он рассказал, что его непосредственной мотивацией для разработки этого приложения было: «Результаты общения с Gemini становились все хуже и хуже, и, наконец, он сдался и вернулся к набору текста. Голосовой ввод действительно быстрее, чем набор текста, но настоящая проблема заключается не в скорости, а в структуре: трудно организовать свои мысли во время импровизированного обсуждения сложных процессов, продуктов или технических требований». Процесс разработки приложения начался в 2025 году. Первоначально оно было воспроизведено на GitHub под названием VoiceToMarkdown и прошло четыре версии: 0.0.4→0.0.8→0.1.0→0.1.1. 10 июля 2026 года проект был переименован в SpeechToMarkdown и выпущена версия v0.2.0. В то же время в App Store доступна версия SpeechToMarkdown для iOS, поддерживающая iPhone 15 Pro и новее. На данный момент в репозитории GitHub имеется 41 коммит, 2 участника (включая вклад Клода с помощью искусственного интеллекта), а размер приложения App Store составляет всего 3,1 МБ. Позиционирование Speech To Markdown очень четкое: это не массовый потребительский продукт, а инструмент повышения эффективности для технических пользователей, разработчиков и активных пользователей Markdown. Он не преследует цели кросс-платформенного покрытия или функций облачной синхронизации, но обеспечивает максимальную глубину, точность и конфиденциальность в экосистеме Apple.

  • Speech To Markdown предоставляет две версии: настольную версию для macOS и мобильную версию для iOS. Два набора стеков технологий различны, но опыт один и тот же. Давайте сначала поговорим о настольной версии macOS. Он работает в строке меню и может быть вызван в любой момент с помощью сочетания клавиш ⌘⌥] — режим «глобальной диктовки» активируется в любом приложении, и расшифрованный текст Markdown вводится непосредственно в текущую позицию курсора после произнесения. Этот метод «глобального внедрения» преодолевает барьеры ввода всех приложений, и вы можете использовать его в терминалах, браузерах, Slack и VS Code по своему желанию. Помимо глобального диктанта, есть еще «режим агента» — окно редактора Markdown в реальном времени. Когда вы говорите, ваш голос сначала транскрибируется в текст с помощью vanilla cpp (буферизируется каждые 4 секунды), а затем отправляется в местный LLM для структурированной обработки. Результаты передаются в редактор, и вы получаете то, что видите. Мобильная версия iOS пошла по совершенно иному техническому пути. Он не использует какой-либо внешний LLM-сервер, а вызывает встроенный SpeechAnalyzer устройств Apple для распознавания речи и модели Apple Foundation для форматирования. Это означает, что у него нет конфигурации, нет зависимостей и даже поддерживается режим полета. С момента запуска App Store пользователям нужно только скачать и использовать его. Никакой регистрации, никаких настроек и подключения к сети не требуется. Самое примечательное – это три режима работы. Режим «Формат» — это режим свободной диктовки. То, что вы скажете, будет отправлено в LLM для восстановления всего документа в режиме реального времени — весь новый контент отправляется в модель вместе с существующим контентом, чтобы обеспечить глобальную согласованность. В режиме редактирования голос воспринимается как инструкции, а не как содержимое, например «Изменить подзаголовок на еженедельные заметки» и «Преобразовать этот список в таблицу» — выберите текст и произнесите инструкцию, а модель меняет только выбранную часть. Режим добавления — это режим ускорения, предназначенный для длинных документов. В LLM отправляются только последние три предложения плюс новый контент, и задержка не увеличивается с увеличением длины документа. Выходной формат поддерживает Markdown, обычный текст и HTML, которые можно переключать в любой момент во время сеанса, а настройки сохраняются при запуске. Все сеансы автоматически сохраняются, а исходная стенограмма всегда доступна одним щелчком мыши.С точки зрения сравнения продуктов с конкурентами, Typeless (144 доллара в год, облачная обработка) и Wispr Flow (144 доллара в год, облачная обработка) обеспечивают более зрелый кроссплатформенный опыт, но оба они представляют собой платную подписку и полагаются на облако. Trace (разовый выкуп за 9,99 фунтов стерлингов, только для macOS) более профессионально справляется с транскрипцией и разделением говорящих, но ему не хватает возможностей структурирования в реальном времени. v2md (от $14,49 в год, в автономном режиме на iOS) — ближайший конкурент, но его модель оплаты и позиционирование вызывают споры. Speech To Markdown не имеет конкурентов в четырех измерениях: «полностью бесплатно + открытый исходный код + 100% автономный режим + встроенная поддержка Markdown».

  • Speech To Markdown в настоящее время полностью бесплатен, без покупок в приложении, подписок и рекламы. Версия для iOS доступна в App Store, а версия для macOS распространяется через GitHub. Код с открытым исходным кодом доступен на GitHub, и каждый может свободно скачать, скомпилировать и изменить его. Данная модель встречается крайне редко среди подобных товаров. Ежегодная плата Typeless составляет 144 доллара США, годовая плата Wispr Flow составляет 144 доллара США, годовая плата Brain Dump составляет 44,99 доллара США, а годовая плата v2md составляет 14,49–35,99 доллара США. Единственный, который почти бесплатен, — это Trace (разовая покупка за 9,99 фунтов стерлингов), но функциональность совершенно другая. Игорь не раскрыл планы по монетизации на будущее, но можно предположить, что он сможет добиться долгосрочной устойчивости за счет спонсорства (например, спонсоров GitHub) или дополнительных услуг (например, облачной синхронизации, командной версии). В настоящее время у stmd недостаточно отзывов в App Store для отображения рейтинга, а количество звезд на GitHub также находится в зачаточном состоянии. Но этот инструмент показывает путь к программному обеспечению, который отличается от подписки SaaS: небольшой, но красивый, бесплатный, с открытым исходным кодом и основанный на технологиях.

  • Поскольку Speech To Markdown присутствует в App Store совсем недавно, оно еще не собрало достаточного количества отзывов пользователей. Но в сообществе разработчиков уже есть голоса. Игорь опубликовал статью под названием «От Brain Dump to Markdown: Структурируйте идеи, как вы говорите» на DEV.to, продиктовав всю статью, используя stmd в качестве демонстрации. В LinkedIn также есть начальные пользователи, которые сказали: «Опыт оказался неожиданно хорошим — я просто случайно сказал что-то, и он не только преобразовал это в текст, но и напрямую организовал для меня Markdown и автоматически разделил это на четкие 1, 2 и 3 пункта».

  • В настоящее время это приложение мало освещается в отраслевых СМИ, при этом отсутствуют сообщения от ведущих технологических СМИ, таких как TechCrunch и The Verge. Но в сообществе разработчиков инструментов сайты навигации по инструментам, такие как thistools.app и Gunbark.dev, подхватили его и дали положительную оценку. В обзоре thistools.app говорится: «Основная логика этой архитектуры очень ясна — звук транскрибируется и буферизуется с помощью vanilla cpp секциями по 4 секунды, а когда он накапливает около 30 слов, он отправляется в LLM, а результаты передаются в редактор. Такая конструкция обеспечивает хороший баланс между задержкой и глобальной согласованностью». С точки зрения конкурентной среды, рынок быстро расширяется. Typeless только что получил новый раунд внимания в июле 2026 года. Wispr Flow привлекла 81 миллион долларов и оценивается в 700 миллионов долларов. Трек речи → структурированный текст превращается из «игрушки для нескольких человек» в «инфраструктуру, которая нужна всем». Speech To Markdown бесплатен и имеет открытый исходный код. Хотя в краткосрочной перспективе сложно сформировать коммерческую конкуренцию, у него есть прочная рыночная ниша в технических кругах и группах пользователей, чувствительных к конфиденциальности.

  • Как бесплатный инструмент с открытым исходным кодом, самый большой риск, с которым сталкивается Speech To Markdown, — это не коммерческая конкуренция, а энергия разработчиков и устойчивость проекта. Проекты независимых разработчиков часто следуют траектории «энтузиастный старт → быстрая итерация → медленная стагнация». Если Игорь не сможет продолжать инвестировать в поддержку, stmd может постепенно стать неактивным, как и многие отличные проекты с открытым исходным кодом. Другой риск — аппаратные ограничения. Для версии iOS требуется iOS 26+ и устройство Apple Intelligence (iPhone 15 Pro и новее), что исключает большое количество существующих пользователей. Версия для macOS требует, чтобы пользователи самостоятельно установили quiet.cpp и локальный сервер LLM, что имеет более высокий порог для нетехнических пользователей. В китайской экосистеме этот порог особенно заметен — интерфейс приложения поддерживает только английский язык, а на основных китайских платформах (Zhihu, Xiaohongshu, Bilibili, CSDN и т. д.) практически нет обзоров и руководств на китайском языке, что является существенным узким местом для роста числа пользователей.

  • Speech To Markdown наиболее подходит трем типам людей: во-первых, техническим пользователям и разработчикам, которые готовы потратить время на настройку локального LLM в обмен на неограниченное бесплатное использование и высочайшую гарантию конфиденциальности; во-вторых, активные пользователи библиотек заметок Markdown, таких как Obsidian, которым нужен эффективный метод ввода под диктовку; в-третьих, пользователи, которые крайне трепетно ​​относятся к конфиденциальности данных и надеются, что голосовые данные никогда не покинут устройство. К неподходящим пользователям относятся: обычные потребители, которым нужны нестандартные возможности (рекомендуется Typeless или Wispr Flow), пользователи, которым требуется межплатформенная синхронизация нескольких устройств, а также пользователи, которым нужны функции транскрипции собраний и разделения говорящих (рекомендуется Trace).

  • Speech To Markdown — примечательный новый игрок в области преобразования речи в Markdown. Оно выбрало антимейнстримный путь – ни денег, ни Интернета, ни нестандартного использования – но именно благодаря этому оно заполнило настоящий пробел. Независимый разработчик Игорь Стеблий использовал набор изысканных технических решений (локальный Whisper + локальный LLM + три режима работы), чтобы доказать, что речь в структурированном тексте может быть предельно конфиденциальной и совершенно бесплатной. Для целевых пользователей это может быть незрелый продукт, но он определенно движется в правильном направлении.

Отзывы пользователей

  • аватар
    Robin749
    Обнаружил узкое место — захват голоса в шумной среде не очень хорош, так как используется встроенный микрофон Mac. Подключение внешнего микрофона значительно улучшает ситуацию.

  • аватар
    冯明
    Точность распознавания китайской речи выше ожидаемого — модель Whisper хорошо обрабатывает китайский. Но выходное форматирование Markdown ориентировано на английские стандарты, и китайская типографика иногда требует ручной правки.

  • аватар
    狗狗112
    По сравнению с Wispr Flow не хватает кроссплатформенной синхронизации и AI-очистки, но выигрывает за счёт полной бесплатности и хранения данных на устройстве. Каждый выбирает по своим приоритетам.

  • аватар
    ElizabethJenkinsX455
    Хотелось бы поддержки Android, но судя по архитектуре, она зависит от фреймворков Apple, так что в ближайшее время этого не случится.

  • аватар
    陈丹丹
    Потоковый вывод редактора в реальном времени — круто. Наблюдать, как текст появляется строка за строкой, пока говоришь, создаёт ощущение, будто сам пишешь код (смеётся).

  • аватар
    SHernandezQ
    89 голосов на Product Hunt, 15-е место. Неплохо для только что выпущенного бесплатного open-source проекта. Надеюсь на продолжение развития.

  • аватар
    黄云鹏
    Попробовал iOS-версию в самолёте. Авиарежим работает отлично — данные не уходят в облако, что радует часто путешествующих.

  • аватар
    TCastilloJr
    Разработчик Igor написал целую статью с помощью этого инструмента на DEV.to в качестве демонстрации. Интересный пример «ешь свой собственный корм».

  • аватар
    TheXavierScott
    Было бы идеально, если бы в будущем добавили разделение говорящих. Сейчас может использовать только один человек, сценарии многопользовательских встреч пока не охвачены.

  • аватар
    EDort
    Народ, для macOS-версии при настройке локальной LLM я выбрал Qwen 3.5 27B 4bit, работает на omlx, скорость нормальная. Кто-нибудь пробовал Gemma 3? Как оно?

  • аватар
    realEmaRikstad_x
    Пользовался v2md несколько месяцев. Видеть, что этот выходит полностью бесплатным — удивительно. Возможно, функции ещё не так полны, как у v2md, но как open source потенциал огромен.

  • аватар
    DebraFosterSr
    Настройка глобальной горячей клавиши диктовки хороша, не конфликтует с Alfred или Raycast. Но первый запуск требует разрешений на микрофон и специальные возможности, что может отпугнуть новичков.

  • аватар
    Natalie_Ward_77
    Понимание естественного языка команд в режиме редактирования пока нестабильно, но учитывая, что это бесплатный open-source продукт на ранней стадии, это уже впечатляет.

  • аватар
    Jessica_Kelly_20227
    Попробовал во время встречи. Просто продиктовал протокол встречи устно, и он преобразовал его в структурированный Markdown. Гораздо эффективнее ручного конспектирования.

  • аватар
    jcmbo8rhv777
    Сравнив несколько инструментов преобразования речи в Markdown, этот предлагает лучший баланс между конфиденциальностью и функциональностью. Без регистрации, без интернета, без оплаты — что ещё нужно?

  • аватар
    LaurenCruzSr
    Три формата вывода очень практичны: Markdown для документации, обычный текст для быстрых заметок и HTML для прямого предпросмотра. Переключение между ними плавное.

  • аватар
    TerryRiveraJr
    Попробовал Gemma 3 и Qwen 3.5. Лично я считаю, что качество форматирования у Qwen лучше, а Gemma выигрывает в скорости.

  • аватар
    crazyswan128
    Посмотрел исходный код на GitHub. Качество кода у Igor хорошее. Но проект ещё на ранней стадии, всего 41 коммит — немного беспокоюсь, будет ли поддерживаться дальше.

  • аватар
    itjpsxl6
    Попробовал режим редактирования. Сказать «измени подзаголовок на Weekly Notes» действительно сработало — опыт редактирования без клавиатуры, кажущийся волшебным. Но точность ещё можно улучшить, сложные инструкции иногда не понимаются.

  • аватар
    Donald.GrayZ383
    Режим Append невероятно полезен. При написании длинных документов задержка не увеличивается с ростом содержимого — просто добавляется новый контент. Очень умное решение.

  • аватар
    JohanMortensen
    По сравнению с Typeless, этот выигрывает тем, что полностью бесплатен и обрабатывает данные локально. Но у Typeless опыт готового решения лучше. Каждому своё.

  • аватар
    孔飞梅
    Скачал iOS-версию, удивлён размером 3,1 МБ. Но требуется iOS 26 и iPhone 15 Pro и выше — мой 14 Pro точно исключён. Плачу.

  • аватар
    DylanHicks_99
    Скачал и попробовал версию для macOS. Процесс настройки требует определённых знаний для обычных пользователей — сначала нужно установить whisper.cpp и локальную LLM. Но после настройки опыт потрясающий: говорите и получаете структурированный Markdown напрямую, а глобальная горячая клавиша диктовки работает в любом приложении.

  • аватар
    ticklishswan803
    Долго искал решение для голосового ввода в Obsidian, а это напрямую создаёт .md-файлы. Идеальное совпадение. Бесплатно и с открытым кодом — здорово.

  • аватар
    CAhil
    Увидел Speech To Markdown на Product Hunt. Бесплатно и с открытым исходным кодом, надо поддержать. Посмотрел репозиторий GitHub, архитектура понятна: локальный Whisper для транскрипции, локальная LLM для структурированного вывода, данные никогда не покидают машину. Такой уровень конфиденциальности на голову выше облачных решений.