Speech To Markdown
완전 무료 오픈소스 macOS/iOS 앱, 로컬 AI를 통해 음성을 실시간으로 구조화된 Markdown 문서로 변환
심층 리포트
-
Speech To Markdown은 독립 개발자 Igor Steblii가 만든 무료 오픈 소스 macOS/iOS 애플리케이션입니다. 핵심 개념은 "말하고, 깨끗한 마크다운을 받고, 100% 로컬 처리"입니다. 로컬 Whisper 음성 인식 + 로컬 LLM 실시간 구조화를 사용하여 음성 콘텐츠를 올바른 형식의 마크다운 문서로 직접 변환합니다. 경쟁 제품이 일반적으로 연간 144달러의 요금을 부과하고 클라우드에 의존하는 시장 환경에서 Speech To Markdown은 완전 무료, 100% 오프라인 및 오픈 소스 코드라는 세 가지 장점을 통해 개인 정보 보호에 민감한 기술 사용자에게 차별화된 경로를 제공합니다. 현재 제품은 초기 단계(v0.2.0)이고 커뮤니티의 인지도가 아직 형성되지 않았지만, 기본 로직과 사용자 경험 방향은 인정되었습니다.
-
Speech To Markdown(줄여서 stmd)은 독립 개발자 Igor Steblii(GitHub: xajik)가 개발했습니다. Igor는 풀스택 개발자입니다. 그는 LinkedIn에서 이 애플리케이션을 개발하게 된 즉각적인 동기가 다음과 같다고 밝혔습니다. "Gemini와 대화한 결과가 점점 더 나빠졌고 결국 포기하고 다시 입력으로 돌아갔습니다. 음성 입력은 실제로 입력보다 빠르지만 실제 과제는 속도가 아니라 구조입니다. 복잡한 프로세스, 제품 또는 기술 요구 사항을 즉석에서 논의하는 동안 생각을 정리하기가 어렵습니다." 애플리케이션 개발 프로세스는 2025년에 시작되었습니다. 처음에는 VoiceToMarkdown이라는 이름으로 GitHub에서 반복되었으며 0.0.4→0.0.8→0.1.0→0.1.1의 네 가지 버전으로 발전했습니다. 2026년 7월 10일에 프로젝트 이름이 SpeechToMarkdown으로 바뀌고 버전 v0.2.0이 출시되었습니다. 동시에 SpeechToMarkdown의 iOS 버전은 iPhone 15 Pro 이상을 지원하는 App Store에서 사용할 수 있습니다. 현재 GitHub 저장소에는 41개의 커밋과 2명의 기여자(Claude AI 지원 기여 포함)가 있으며 App Store 애플리케이션은 3.1MB에 불과합니다. Speech To Markdown의 포지셔닝은 매우 명확합니다. 이는 대량 소비자 제품이 아니라 기술 사용자, 개발자 및 Markdown을 많이 사용하는 사용자를 위한 효율성 도구입니다. 크로스 플랫폼 적용 범위나 클라우드 동기화 기능을 추구하지 않지만 Apple 생태계 내에서 최고의 깊이, 정확성 및 개인 정보 보호를 달성합니다.
-
Speech To Markdown은 macOS 데스크톱 버전과 iOS 모바일 버전의 두 가지 버전을 제공합니다. 두 가지 기술 스택 세트는 서로 다르지만 경험은 동일합니다. 먼저 macOS 데스크톱 버전에 대해 이야기해 보겠습니다. 메뉴 표시줄에서 작동하며 단축키 ⌘⌥]를 통해 언제든지 호출할 수 있습니다. "전역 받아쓰기" 모드는 모든 애플리케이션에서 활성화되며, 말한 후 기록된 마크다운 텍스트가 현재 커서 위치에 직접 입력됩니다. 이 "전역 주입" 방식은 모든 앱의 입력 장벽을 뛰어넘어 터미널, 브라우저, Slack, VS Code에서 마음대로 사용할 수 있습니다. 전역 받아쓰기 외에도 실시간 Markdown 편집기 창인 "에이전트 모드"도 있습니다. 말할 때 목소리는 먼저 Whisper.cpp를 통해 텍스트로 변환된 다음(4초마다 버퍼링됨) 구조화된 처리를 위해 로컬 LLM으로 전송됩니다. 결과는 편집기로 스트리밍되며, 보이는 대로 결과가 나옵니다. iOS 모바일 버전은 완전히 다른 기술적 경로를 취했습니다. 외부 LLM 서버에 의존하지 않지만 음성 인식을 위해 Apple 장치에 내장된 SpeechAnalyzer를 호출하고 포맷을 위해 Apple Foundation Models를 호출합니다. 이는 구성이 없고 종속성이 없으며 비행기 모드도 지원한다는 의미입니다. App Store 출시 이후 사용자는 다운로드하여 사용하기만 하면 됩니다. 등록, 설정, 네트워크 연결이 필요하지 않습니다. 가장 주목할만한 점은 세 가지 작업 모드입니다. 서식 모드는 무료 받아쓰기 모드입니다. 귀하가 말하는 내용은 전체 문서를 실시간으로 재구성하기 위해 LLM으로 전송됩니다. 모든 새로운 콘텐츠는 글로벌 일관성을 보장하기 위해 기존 콘텐츠와 함께 모델로 전송됩니다. 편집 모드에서는 "자막을 주간 노트로 변경" 및 "이 목록을 표로 변환"과 같이 음성을 내용이 아닌 지침으로 처리합니다. 텍스트를 선택하고 지침을 말하면 모델은 선택한 부분만 변경합니다. 추가 모드는 긴 문서용으로 설계된 가속 모드입니다. 마지막 세 문장과 새 콘텐츠만 LLM으로 전송되며 문서 길이에 따라 지연 시간이 늘어나지 않습니다. 출력 형식은 Markdown, 일반 텍스트 및 HTML을 지원하며 세션 중 언제든지 전환할 수 있으며 설정은 시작 시에도 유지됩니다. 모든 세션은 자동으로 저장되며 한 번의 클릭으로 언제든지 원본 스크립트를 사용할 수 있습니다.경쟁 제품 비교 측면에서 Typeless(연간 144달러, 클라우드 처리)와 Wispr Flow(연간 144달러, 클라우드 처리)는 보다 성숙한 크로스 플랫폼 경험을 제공하지만 둘 다 유료 구독이며 클라우드에 의존합니다. Trace(£9.99 일회성 구매, macOS만 해당)는 회의 녹음 및 화자 분리에 더 전문적이지만 실시간 구조화 기능이 부족합니다. v2md(연 14.49달러부터 시작, iOS 오프라인)가 가장 가까운 경쟁자이지만 충전 모델과 포지셔닝은 논란의 여지가 있습니다. Speech To Markdown은 "완전 무료 + 오픈 소스 + 100% 오프라인 + 기본 Markdown 지원"이라는 4가지 차원에서 경쟁자가 없습니다.
-
Speech To Markdown은 현재 인앱 구매, 구독, 광고 없이 완전 무료입니다. iOS 버전은 App Store에서 다운로드할 수 있으며, macOS 버전은 GitHub를 통해 배포됩니다. 코드는 GitHub의 오픈 소스이며 누구나 자유롭게 다운로드, 컴파일 및 수정할 수 있습니다. 이 모델은 유사 제품 중에서는 극히 드뭅니다. Typeless의 연회비는 $144, Wispr Flow의 연회비는 $144, Brain Dump의 연회비는 $44.99, v2md의 연회비는 $14.49~$35.99입니다. 무료에 가까운 유일한 제품은 Trace(£9.99 일회성 구매)이지만 기능은 완전히 다릅니다. Igor는 향후 수익화 계획을 공개하지 않았지만 후원(GitHub 후원 등)이나 추가 서비스(클라우드 동기화, 팀 버전 등)를 통해 장기적인 지속 가능성을 달성할 수 있을 것으로 추측할 수 있습니다. 현재 stmd는 App Store에 등급을 표시할 만큼 충분한 리뷰가 없으며 GitHub의 별 수도 초기 단계입니다. 하지만 이 도구는 SaaS 구독과 다른 소프트웨어 경로, 즉 작지만 아름답고 무료 오픈 소스이며 기술 중심이라는 것을 보여줍니다.
-
Speech To Markdown은 App Store에 출시된 지 얼마 되지 않았기 때문에 아직 충분한 사용자 리뷰가 축적되지 않았습니다. 그러나 개발자 커뮤니티에는 이미 일부 목소리가 있습니다. Igor는 DEV.to에 "뇌 덤프에서 마크다운까지: 말하는 대로 아이디어 구조화"라는 제목의 기사를 게시하여 stmd를 데모로 사용하여 전체 기사를 받아쓰게 했습니다. 링크드인에 "의외로 좋은 경험이 있었다. 그냥 아무렇지도 않게 말했는데, 텍스트로 변환해 줄 뿐만 아니라 마크다운으로 바로 정리해주고 자동으로 클리어 1, 2, 3포인트로 나눠준다"고 말하는 시드 유저도 있다.
-
현재 이 앱은 TechCrunch 및 The Verge와 같은 주류 기술 미디어의 보고 없이 업계 미디어에 거의 노출되지 않았습니다. 그러나 개발자 도구 커뮤니티에서는 thistools.app 및 gunbark.dev와 같은 도구 탐색 사이트가 이를 선택하고 호평을 받았습니다. thistools.app의 리뷰에는 다음과 같이 명시되어 있습니다. "이 아키텍처의 기본 논리는 매우 명확합니다. 오디오는 약 4초의 섹션으로 속삭임.cpp에 의해 기록 및 버퍼링되며, 약 30단어가 누적되면 LLM으로 전송되고 결과는 편집기로 스트리밍됩니다. 이 디자인은 대기 시간과 전역 일관성 사이의 적절한 균형을 달성합니다." 경쟁적인 제품 환경 측면에서 시장은 빠르게 확대되고 있습니다. Typeless는 2026년 7월에 새로운 관심을 받았습니다. Wispr Flow는 8,100만 달러를 모금했으며 가치는 7억 달러로 평가됩니다. 음성 → 구조화된 텍스트 트랙이 "소수인을 위한 장난감"에서 "모두에게 필요한 인프라"로 바뀌고 있습니다. Speech To Markdown은 무료이며 오픈 소스입니다. 단기적으로 상업적인 경쟁을 형성하기는 어렵지만 기술계와 개인 정보 보호에 민감한 사용자 그룹에서는 탄탄한 틈새 시장을 보유하고 있습니다.
-
무료 오픈 소스 도구로서 Speech To Markdown이 직면하는 가장 큰 위험은 상업적 경쟁이 아니라 개발자 에너지와 프로젝트 지속 가능성입니다. 독립 개발자 프로젝트는 '열정적인 시작 → 빠른 반복 → 느린 침체'의 궤적을 따르는 경우가 많습니다. Igor가 유지 관리에 계속 투자할 수 없다면 stmd는 많은 우수한 오픈 소스 프로젝트처럼 점차 비활성화될 수 있습니다. 또 다른 위험은 하드웨어 제한입니다. iOS 버전에는 iOS 26+와 Apple Intelligence 기기(iPhone 15 Pro 이상)가 필요하므로 기존 사용자가 다수 제외됩니다. macOS 버전에서는 사용자가 속삭임.cpp 및 로컬 LLM 서버를 직접 설치해야 하며, 이는 기술 지식이 없는 사용자에게는 더 높은 임계값이 있습니다. 중국 생태계에서는 이 임계값이 특히 두드러집니다. 애플리케이션 인터페이스는 영어만 지원하고 중국의 주류 플랫폼(Zhihu, Xiaohongshu, Bilibili, CSDN 등)에는 중국어 리뷰나 튜토리얼이 거의 없어 상당한 사용자 성장 병목 현상이 발생합니다.
-
Speech To Markdown은 세 가지 유형의 사람들에게 가장 적합합니다. 첫째, 무제한 무료 사용 및 최고의 개인 정보 보호 보장을 대가로 로컬 LLM을 구성하는 데 시간을 할애하려는 기술 사용자 및 개발자입니다. 둘째, 효율적인 받아쓰기 입력 방법이 필요한 Obsidian과 같은 Markdown 노트 라이브러리를 많이 사용하는 사용자입니다. 셋째, 데이터 개인정보 보호에 극도로 민감하고 음성 데이터가 기기 외부로 유출되지 않기를 바라는 사용자입니다. 적합하지 않은 사람으로는 바로 사용 가능한 경험을 원하는 일반 소비자(Typeless 또는 Wispr Flow 권장), 크로스 플랫폼 다중 장치 동기화가 필요한 사용자, 회의 녹음 및 화자 분리 기능(Trace 권장)을 원하는 사용자가 있습니다.
-
Speech To Markdown은 Speech-to-Markdown 분야에서 주목할만한 새로운 플레이어입니다. 돈도 없고, 인터넷도 없고, 기성품 사용도 없는 반주류적 길을 선택했지만 바로 이 때문에 실질적인 격차가 메워졌습니다. 독립 개발자 Igor Steblii는 정교한 기술 솔루션 세트(로컬 위스퍼 + 로컬 LLM + 세 가지 작업 모드)를 사용하여 구조화된 텍스트에 대한 음성이 극도로 비공개적이고 완전히 무료일 수 있음을 증명했습니다. 대상 사용자에게는 성숙한 제품이 아닐 수도 있지만 확실히 올바른 방향으로 가고 있습니다.
사용자 리뷰
-
Robin749—병목점을 발견했습니다—시끄러운 환경에서 음성 픽업이 별로입니다. Mac 내장 마이크를 사용하기 때문이며, 외장 마이크를 연결하면 훨씬 나아집니다. -
冯明—중국어 음성 인식 정확도는 예상보다 좋고, 사용된 Whisper 모델은 중국어를 잘 처리합니다. 다만 출력되는 Markdown 형식이 영어 습관에 치우쳐 있어 중국어 조판이 가끔 수동 조정이 필요합니다. -
狗狗112—Wispr Flow와 비교하면 크로스플랫폼 동기화와 AI 정리 기능이 없지만, 완전 무료에 데이터가 기기에 남는다는 점에서 우위입니다. 취향에 따라 선택하시면 됩니다. -
ElizabethJenkinsX455—Android를 지원했으면 좋겠는데, 아키텍처를 보니 Apple 프레임워크에 의존하고 있어서 단기간内에는 어려울 것 같습니다. -
陈丹丹—실시간 편집기의 스트리밍 출력이 멋집니다. 말할 때 글자가 한 줄씩 나타나 마치 자신이 코드를 쓰고 있는 듯한 착각이 듭니다(웃음). -
SHernandezQ—Product Hunt에서 89표, 순위 15위. 막 출시된 무료 오픈소스 프로젝트로서 꽤 괜찮은 성적입니다. 지속적인 발전을 기대합니다. -
黄云鹏—비행기에서 iOS 버전을 시험해봤습니다. 비행기 모드에서 완벽하게 작동하고, 데이터가 클라우드로 가지 않아서 출장이 많은 사람에게는 반가운 소식입니다. -
TCastilloJr—개발자 Igor가 DEV.to에서 이 도구를 사용해 전체 기사를 작성하고 데모로 보여줬습니다. 자신이 만든 도구를 스스로 사용하는 재미있는 사례입니다. -
TheXavierScott—향후 화자 분리 기능이 추가되면 완벽할 텐데요. 지금은 한 사람만 사용 가능해서 다자간 회의 시나리오는 아직 커버되지 않았습니다. -
EDort—여러분, macOS 버전에서 로컬 LLM 설정할 때 Qwen3.5 27B 4bit를 선택하고 omlx로 돌리고 있는데 속도가 괜찮습니다. Gemma 3 써보신 분 계신가요? 어떠신가요? -
realEmaRikstad_x—v2md를 몇 달 사용했습니다. 이게 완전 무료로 나온 건 의외입니다. 기능이 아직 v2md만큼 완성되지는 않았을 수 있지만, 오픈소스로서의 잠재력은 큽니다. -
DebraFosterSr—전역 받아쓰기 단축키 설정이 괜찮아서 Alfred나 Raycast와 충돌하지 않습니다. 하지만 처음 실행 시 마이크와 손쉬운 사용 권한이 필요해서 초보자에게는 진입 장벽이 될 수 있습니다. -
Natalie_Ward_77—편집 모드의 자연어 명령 이해는 아직 충분히 안정적이지 않지만, 무료 오픈소스 초기 제품임을 감안하면 이미 놀랍습니다. -
Jessica_Kelly_20227—회의 중에 시도해봤습니다. 구두로 회의록을 말하기만 하면 구조화된 Markdown으로 변환해줍니다. 수동으로 메모하는 것보다 훨씬 효율적입니다. -
jcmbo8rhv777—여러 음성→Markdown 도구를 비교해봤는데, 이게 프라이버시와 기능 사이에서 가장 균형이 좋습니다. 회원가입 불필요, 오프라인, 무료——더 바랄 게 뭐가 있겠어요. -
LaurenCruzSr—세 가지 출력 형식이 매우 실용적입니다. Markdown은 문서 작성, 일반 텍스트는 속기, HTML은 바로 미리보기 용도로 전환도 부드럽습니다. -
TerryRiveraJr—Gemma 3와 Qwen3.5를 써봤습니다. 개인적으로 Qwen의 포맷팅 품질이 더 좋았고, Gemma는 속도가 더 빨랐습니다. -
crazyswan128—GitHub에서 소스 코드를 봤습니다. Igor의 코드 품질은 괜찮습니다. 하지만 프로젝트가 아직 초기 단계로 커밋이 41개밖에 없어서, 향후 유지보수가 계속될지 조금 걱정됩니다. -
itjpsxl6—Edit 모드를 시험해봤습니다. '부제목을 Weekly Notes로 바꿔줘'라고 말하자 실제로 변경됐습니다. 키보드 없는 편집 경험이 신기합니다. 하지만 정밀도는 아직 개선 여지가 있고, 복잡한 명령은 가끔 이해하지 못합니다. -
Donald.GrayZ383—Append 모드가 매우 유용합니다. 긴 문서를 쓸 때 내용이 길어져도 지연 시간이 증가하지 않고 새 내용만 추가됩니다. 정말 똑똑한 설계입니다. -
JohanMortensen—Typeless랑 비교하면, 이건 완전 무료에 데이터를 로컬에서 처리한다는 점이 장점이에요. 하지만 Typeless의 개봉 즉시 사용 경험이 확실히 더 좋아요. 각자 필요한 걸 선택하면 되죠. -
孔飞梅—iOS 버전을 다운로드했습니다. 3.1MB 크기에 놀랐습니다. 하지만 iOS 26 이상에 iPhone 15 Pro 이상이 필요해서 제 14 Pro는 정확히 제외됐습니다. 泣きます。 -
DylanHicks_99—macOS 버전 다운받아서 써봤는데요, 일반 사용자한테는 설정 과정이 확실히 진입 장벽이 있어요. whisper.cpp랑 로컬 LLM을 먼저 설치해야 하거든요. 하지만 설정 끝나면 경험이 진짜 끝내줘요. 말하면 바로 구조화된 Markdown이 나오고, 전역 받아쓰기 단축키가 어떤 앱에서든 작동해요. -
ticklishswan803—계속 Obsidian용 음성 입력 솔루션을 찾고 있었는데, 이건 바로 .md 파일을 출력해줍니다. 완벽한 매치입니다. 무료 오픈소스라 정말 좋습니다. -
CAhil—Product Hunt에서 Speech To Markdown을 봤어요. 무료 오픈소스, 응원해야죠. GitHub 저장소 봤는데 아키텍처가 명확하더라고요. 로컬 Whisper로 전사하고 로컬 LLM으로 구조화 출력, 데이터가 절대 기계 밖으로 나가지 않아요. 이 프라이버시 수준은 클라우드 방식들을 완전히 압도해요.