Speech To Markdown

تطبيق macOS/iOS مجاني ومفتوح المصدر يحول الكلام إلى مستندات Markdown في الوقت الفعلي عبر الذكاء الاصطناعي المحلي

تقرير معمّق

  • Speech To Markdown هو تطبيق مجاني ومفتوح المصدر لنظام التشغيل macOS/iOS تم إنشاؤه بواسطة المطور المستقل Igor Steblii. المفهوم الأساسي هو "تحدث، واحصل على تخفيض واضح، ومعالجة محلية بنسبة 100%." يستخدم التعرف على الكلام Whisper المحلي + هيكلة LLM المحلية في الوقت الفعلي لتحويل المحتوى المنطوق مباشرةً إلى مستندات Markdown جيدة التنسيق. في بيئة السوق حيث تتقاضى المنتجات المنافسة عمومًا رسومًا سنوية قدرها 144 دولارًا وتعتمد على السحابة، يوفر Speech To Markdown مسارًا مختلفًا لمستخدمي التكنولوجيا الحساسة للخصوصية مع المزايا الثلاثية المتمثلة في كونها مجانية تمامًا، وغير متصلة بالإنترنت بنسبة 100٪، وكود مفتوح المصدر. المنتج حاليًا في المرحلة المبكرة (الإصدار 0.2.0) ولم تتشكل شعبية المجتمع بعد، ولكن تم التعرف على المنطق الأساسي واتجاه تجربة المستخدم.

  • تم تطوير Speech To Markdown (stmd للاختصار) بواسطة المطور المستقل Igor Steblii (GitHub: xajik). إيغور هو مطور مكدس كامل. وكشف على موقع LinkedIn أن دافعه المباشر لتطوير هذا التطبيق كان: "أصبحت نتائج التحدث إلى الجوزاء أسوأ فأسوأ، وأخيراً استسلمت وعادت إلى الكتابة. إن الإدخال الصوتي أسرع بالفعل من الكتابة، لكن التحدي الحقيقي ليس السرعة، بل البنية - من الصعب تنظيم أفكارك أثناء مناقشة العمليات أو المنتجات أو المتطلبات الفنية المعقدة بشكل مرتجل." بدأت عملية تطوير التطبيق في عام 2025. وتم تكراره في البداية على GitHub تحت اسم VoiceToMarkdown وتطور من خلال أربعة إصدارات: 0.0.4→0.0.8→0.1.0→0.1.1. في 10 يوليو 2026، تمت إعادة تسمية المشروع إلى SpeechToMarkdown وتم إصدار الإصدار v0.2.0. وفي الوقت نفسه، يتوفر إصدار iOS من SpeechToMarkdown على متجر التطبيقات، ويدعم iPhone 15 Pro والإصدارات الأحدث. اعتبارًا من الآن، يحتوي مستودع GitHub على 41 التزامًا ومساهمين (بما في ذلك المساهمة المدعومة من Claude AI)، ويبلغ حجم تطبيق App Store 3.1 ميغابايت فقط. إن موضع Speech To Markdown واضح جدًا: فهو ليس منتجًا استهلاكيًا جماعيًا، ولكنه أداة كفاءة للمستخدمين التقنيين والمطورين ومستخدمي Markdown بكثافة. إنها لا تسعى إلى تغطية الأنظمة الأساسية أو وظائف المزامنة السحابية، ولكنها تحقق أقصى درجات العمق والدقة والخصوصية داخل نظام Apple البيئي.

  • يوفر Speech To Markdown نسختين - إصدار سطح المكتب لنظام التشغيل macOS وإصدار iOS للجوال. تختلف مجموعتا مجموعات التكنولوجيا ولكن التجربة هي نفسها. لنتحدث عن إصدار سطح المكتب لنظام التشغيل MacOS أولاً. إنه يعمل في شريط القائمة ويمكن استدعاؤه في أي وقت من خلال مفتاح الاختصار ⌘⌥] - يتم تنشيط وضع "الإملاء العام" في أي تطبيق ويتم إدخال نص Markdown المكتوب مباشرة في موضع المؤشر الحالي بعد التحدث. تخترق طريقة "الحقن الشامل" هذه حواجز الإدخال لجميع التطبيقات، ويمكنك استخدامها في المحطات الطرفية والمتصفحات وSlack وVS Code حسب الرغبة. بالإضافة إلى الإملاء العالمي، هناك أيضًا "وضع الوكيل" - نافذة محرر Markdown في الوقت الفعلي. عندما تتحدث، يتم أولاً نسخ صوتك إلى نص بواسطة whisper.cpp (يتم تخزينه مؤقتًا كل 4 ثوانٍ)، ثم يتم إرساله إلى LLM المحلي للمعالجة المنظمة. يتم بث النتائج إلى المحرر، وما تراه هو ما تحصل عليه. اتخذت نسخة iOS المحمولة مسارًا تقنيًا مختلفًا تمامًا. وهو لا يعتمد على أي خادم LLM خارجي، ولكنه يستدعي SpeechAnalyzer المدمج في أجهزة Apple للتعرف على الكلام ونماذج Apple Foundation للتنسيق. وهذا يعني أنه لا يحتوي على أي تكوينات أو أي تبعيات، بل إنه يدعم وضع الطائرة. منذ إطلاق متجر التطبيقات، يحتاج المستخدمون فقط إلى تنزيله واستخدامه. لا يلزم التسجيل ولا الإعدادات ولا اتصال بالشبكة. والشيء الأكثر جدارة بالملاحظة هو أوضاع العمل الثلاثة. وضع التنسيق هو وضع الإملاء المجاني. سيتم إرسال ما تقوله إلى LLM لإعادة بناء المستند بأكمله في الوقت الفعلي - يتم إرسال كل المحتوى الجديد إلى النموذج إلى جانب المحتوى الحالي لضمان الاتساق العالمي. يتعامل وضع التحرير مع الصوت باعتباره تعليمات وليس محتوى، مثل "تغيير العنوان الفرعي إلى ملاحظات أسبوعية" و"تحويل هذه القائمة إلى جدول" - حدد النص ونطق التعليمات، وسيقوم النموذج بتغيير الجزء المحدد فقط. وضع الإلحاق هو وضع تسريع مصمم للمستندات الطويلة. يتم إرسال الجمل الثلاث الأخيرة فقط بالإضافة إلى المحتوى الجديد إلى LLM، ولا يزيد التأخير مع طول المستند. يدعم تنسيق الإخراج Markdown والنص العادي وHTML، والتي يمكن تبديلها في أي وقت أثناء الجلسة، ويتم الاحتفاظ بالإعدادات عبر الشركات الناشئة. يتم حفظ جميع الجلسات تلقائيًا ويكون النص الأصلي متاحًا دائمًا بنقرة واحدة.فيما يتعلق بمقارنة المنتجات التنافسية، يوفر Typeless (144 دولارًا سنويًا، معالجة سحابية) وWispr Flow (144 دولارًا سنويًا، معالجة سحابية) تجربة أكثر نضجًا عبر الأنظمة الأساسية، لكن كلاهما اشتراكات مدفوعة ويعتمدان على السحابة. يعد Trace (شراء لمرة واحدة بقيمة 9.99 جنيهًا إسترلينيًا، لنظام التشغيل macOS فقط) أكثر احترافًا في تلبية متطلبات النسخ وفصل السماعات، ولكنه يفتقر إلى إمكانات الهيكلة في الوقت الفعلي. يعد v2md (يبدأ بسعر 14.49 دولارًا سنويًا، وغير متصل بالإنترنت على نظام التشغيل iOS) هو أقرب المنافسين، لكن نموذج الشحن الخاص به وموقعه مثيران للجدل. لا يوجد منافسين لـ Speech To Markdown في الأبعاد الأربعة "مجاني تمامًا + مفتوح المصدر + 100% دون اتصال بالإنترنت + دعم Markdown الأصلي".

  • أصبح تطبيق Speech To Markdown مجانيًا تمامًا حاليًا، بدون عمليات شراء داخل التطبيق، أو اشتراكات، أو إعلانات. يتوفر إصدار iOS على متجر التطبيقات، ويتم توزيع إصدار macOS عبر GitHub. الكود مفتوح المصدر على GitHub ويمكن لأي شخص تنزيله وتجميعه وتعديله بحرية. هذا النموذج نادر للغاية بين المنتجات المماثلة. تبلغ رسوم Typeless السنوية 144 دولارًا أمريكيًا، وWispr Flow رسومًا سنوية قدرها 144 دولارًا أمريكيًا، وBrain Dump رسومًا سنوية قدرها 44.99 دولارًا أمريكيًا، وv2md رسومًا سنوية تتراوح بين 14.49 دولارًا أمريكيًا و35.99 دولارًا أمريكيًا. الأداة الوحيدة القريبة من المجانية هي Trace (شراء لمرة واحدة بقيمة 9.99 جنيهًا إسترلينيًا)، لكن الوظيفة مختلفة تمامًا. لم يكشف إيجور عن خطط تحقيق الدخل المستقبلية، ولكن يمكن التكهن بأنه قد يحقق استدامة طويلة المدى من خلال الرعاية (مثل رعاة GitHub) أو خدمات إضافية (مثل المزامنة السحابية، وإصدار الفريق). حاليًا، لا يوجد لدى stmd ما يكفي من المراجعات على متجر التطبيقات لعرض التقييم، كما أن عدد النجوم على GitHub أيضًا في بداياته. لكن هذه الأداة تعرض مسارًا برمجيًا مختلفًا عن اشتراك SaaS: صغير ولكنه جميل ومجاني ومفتوح المصدر ومعتمد على التكنولوجيا.

  • نظرًا لأن تطبيق Speech To Markdown موجود في متجر التطبيقات لفترة قصيرة فقط، فإنه لم يجمع حتى الآن ما يكفي من مراجعات المستخدمين. ولكن هناك بالفعل بعض الأصوات في مجتمع المطورين. نشر إيغور مقالًا بعنوان "من تفريغ الدماغ إلى تخفيض السعر: هيكلة الأفكار أثناء حديثك" على موقع DEV.to، حيث أملى المقالة بأكملها باستخدام stmd كعرض توضيحي. هناك أيضًا مستخدمون أوليون على LinkedIn قالوا: "التجربة جيدة بشكل غير متوقع - لقد قلت شيئًا عرضًا، ولم يحوله إلى نص فحسب، بل قام أيضًا بتنظيمه مباشرة في Markdown بالنسبة لي وتقسيمه تلقائيًا إلى نقاط واضحة 1 و 2 و 3."

  • في الوقت الحالي، لم يحظ هذا التطبيق إلا بقدر قليل جدًا من الظهور في وسائل الإعلام الصناعية، مع عدم وجود تقارير من وسائل الإعلام التكنولوجية الرئيسية مثل TechCrunch وThe Verge. ولكن في مجتمع أدوات المطورين، قامت مواقع التنقل الخاصة بالأدوات مثل thistools.app وgunbark.dev بتبنيها ومراجعتها بشكل إيجابي. تنص مراجعة thistools.app على ما يلي: "المنطق الأساسي لهذه البنية واضح جدًا - يتم نسخ الصوت وتخزينه مؤقتًا بواسطة whisper.cpp في أقسام تبلغ حوالي 4 ثوانٍ، وعندما يتراكم حوالي 30 كلمة، يتم إرساله إلى LLM، ويتم بث النتائج إلى المحرر. يحقق هذا التصميم توازنًا جيدًا بين زمن الوصول والاتساق العالمي." وفيما يتعلق بالمشهد التنافسي للمنتجات، فإن السوق يتوسع بسرعة. تلقت Typeless للتو جولة جديدة من الاهتمام في يوليو 2026. وقد جمعت Wispr Flow 81 مليون دولار وتقدر قيمتها بـ 700 مليون دولار. يتغير مسار الكلام → النص المنظم من "لعبة لعدد قليل من الأشخاص" إلى "بنية تحتية يحتاجها الجميع." Speech To Markdown مجاني ومفتوح المصدر. وعلى الرغم من صعوبة تشكيل منافسة تجارية على المدى القصير، إلا أنها تتمتع بسوق متخصصة قوية في الدائرة التقنية ومجموعات المستخدمين الحساسة للخصوصية.

  • باعتبارها أداة مجانية مفتوحة المصدر، فإن أكبر خطر يواجهه Speech To Markdown ليس المنافسة التجارية، بل طاقة المطورين واستدامة المشروع. غالبًا ما تتبع مشاريع التطوير المستقلة مسار "البداية الحماسية ← التكرار السريع ← الركود البطيء". إذا لم يتمكن Igor من الاستمرار في الاستثمار في الصيانة، فقد يصبح stmd غير نشط تدريجيًا مثل العديد من المشاريع الممتازة مفتوحة المصدر. الخطر الآخر هو قيود الأجهزة. يتطلب إصدار iOS نظام التشغيل iOS 26+ وجهاز Apple Intelligence (iPhone 15 Pro والإصدارات الأحدث)، مما يستثني عددًا كبيرًا من المستخدمين الحاليين. يتطلب إصدار macOS من المستخدمين تثبيت whisper.cpp وخادم LLM المحلي بأنفسهم، وهو ما له حد أعلى للمستخدمين غير التقنيين. في النظام البيئي الصيني، تكون هذه العتبة بارزة بشكل خاص - واجهة التطبيق تدعم اللغة الإنجليزية فقط، ولا توجد تقريبًا أي مراجعات أو برامج تعليمية باللغة الصينية على المنصات الرئيسية في الصين (Zhihu، وXiaohongshu، وBilibili، وCSDN، وما إلى ذلك)، وهو ما يمثل عنق الزجاجة الكبير لنمو المستخدم.

  • يعد Speech To Markdown أكثر ملاءمة لثلاثة أنواع من الأشخاص: أولاً، المستخدمين التقنيين والمطورين الذين يرغبون في قضاء الوقت في تكوين LLM المحلي مقابل الاستخدام المجاني غير المحدود وأعلى ضمان للخصوصية؛ ثانيًا، المستخدمون بكثرة لمكتبات الملاحظات Markdown مثل Obsidian، الذين يحتاجون إلى طريقة إدخال إملاء فعالة؛ ثالثًا، المستخدمون الذين لديهم حساسية شديدة تجاه خصوصية البيانات ويأملون ألا تخرج البيانات الصوتية من الجهاز أبدًا. الأشخاص غير المناسبين يشملون: المستهلكين العاديين الذين يبحثون عن تجربة خارج الصندوق (يوصى باستخدام Typeless أو Wispr Flow)، والمستخدمين الذين يحتاجون إلى مزامنة متعددة الأجهزة عبر الأنظمة الأساسية، والمستخدمين الذين يبحثون عن وظائف نسخ الاجتماعات وفصل المتحدثين (يوصى بالتتبع).

  • يعد Speech To Markdown لاعبًا جديدًا جديرًا بالملاحظة في مجال تحويل الكلام إلى Markdown. لقد اختارت مساراً مناهضاً للتيار السائد ـ فلا مال، ولا إنترنت، ولا استخدام خارج الصندوق ـ ولكن لهذا السبب على وجه التحديد نجحت في سد فجوة حقيقية. استخدم المطور المستقل إيجور ستيبلي مجموعة من الحلول التقنية الرائعة (Whisper المحلي + LLM المحلي + ثلاثة أوضاع عمل) لإثبات أن التحدث إلى النص المنظم يمكن أن يكون خاصًا للغاية ومجانيًا تمامًا. بالنسبة للمستخدمين المستهدفين، قد لا يكون منتجًا ناضجًا، ولكنه بالتأكيد في الاتجاه الصحيح.

مراجعات المستخدمين

  • الصورة الرمزية
    Robin749
    اكتشفت عنق زجاجة — التقاط الصوت في البيئات المزعجة ليس جيدًا، لأنه يستخدم ميكروفون Mac المدمج. توصيل ميكروفون خارجي يحسن الأمور كثيرًا.

  • الصورة الرمزية
    冯明
    دقة التعرف على الكلام بالصينية أفضل من المتوقع، نموذج Whisper يعالج الصينية بشكل جيد. لكن تنسيق Markdown الناتج يميل إلى العادات الإنجليزية، والتنسيق الصيني يحتاج أحيانًا إلى تعديل يدوي.

  • الصورة الرمزية
    狗狗112
    بالمقارنة مع Wispr Flow، يفتقر إلى المزامنة عبر المنصات وميزات التنظيف بالذكاء الاصطناعي، لكنه يتفوق بكونه مجانيًا تمامًا وتبقى البيانات على الجهاز. حسب الأولويات الشخصية.

  • الصورة الرمزية
    ElizabethJenkinsX455
    أتمنى لو يدعم Android، ولكن بالنظر إلى أن البنية تعتمد على أطر Apple، فمن المحتمل ألا يحدث ذلك قريبًا.

  • الصورة الرمزية
    陈丹丹
    الإخراج المتدفق من المحرر الفوري رائع. مشاهدة النص يظهر سطرًا تلو الآخر أثناء التحدث تشعر وكأنك تكتب كودًا بنفسك (يضحك).

  • الصورة الرمزية
    SHernandezQ
    89 صوتًا على Product Hunt، المرتبة 15. أداء جيد لمشروع مجاني مفتوح المصدر تم إطلاقه حديثًا. أتمنى أن يستمر في التطور.

  • الصورة الرمزية
    黄云鹏
    جربت نسخة iOS على متن طائرة. وضع الطيران يعمل بشكل مثالي، البيانات لا تذهب إلى السحابة، هذا رائع للمسافرين الدائمين.

  • الصورة الرمزية
    TCastilloJr
    المطور Igor كتب مقالًا كاملاً باستخدام هذه الأداة على DEV.to كعرض توضيحي. حالة مثيرة لـ«أكل طعام الكلاب الخاص بك».

  • الصورة الرمزية
    TheXavierScott
    سيكون مثاليًا إذا أمكن إضافة فصل المتحدثين في المستقبل. الآن يمكن لشخص واحد فقط استخدامه، سيناريوهات الاجتماعات متعددة الأشخاص غير مغطاة بعد.

  • الصورة الرمزية
    EDort
    يا جماعة، لنسخة macOS اخترت Qwen 3.5 27B 4bit عند تكوين LLM المحلي، يعمل مع omlx، السرعة مقبولة. هل جرب أحدكم Gemma 3؟ كيف كانت؟

  • الصورة الرمزية
    realEmaRikstad_x
    استخدمت v2md لعدة أشهر. رؤية هذا يأتي مجانيًا بالكامل أمر مفاجئ. قد لا تكون الميزات مكتملة مثل v2md بعد، لكن كمصدر مفتوح الإمكانات هائلة.

  • الصورة الرمزية
    DebraFosterSr
    إعداد اختصار الإملاء العام جيد، لا يتعارض مع Alfred أو Raycast. لكن التشغيل الأول يتطلب أذونات الميكروفون وإمكانية الوصول، مما قد يردع المبتدئين.

  • الصورة الرمزية
    Natalie_Ward_77
    فهم اللغة الطبيعية للأوامر في وضع التحرير ليس مستقرًا بما يكفي، لكن بالنظر إلى أنه منتج مجاني مفتوح المصدر في مرحلة مبكرة، فهو مذهل بالفعل.

  • الصورة الرمزية
    Jessica_Kelly_20227
    جربته أثناء اجتماع. فقط أمليت محضر الاجتماع شفهيًا وحوّله إلى Markdown منظم. أكثر كفاءة بكثير من تدوين الملاحظات يدويًا.

  • الصورة الرمزية
    jcmbo8rhv777
    بعد مقارنة عدة أدوات لتحويل الصوت إلى Markdown، هذا هو الأفضل في التوازن بين الخصوصية والوظائف. بدون تسجيل، بدون إنترنت، بدون دفع — ماذا تريد أكثر؟

  • الصورة الرمزية
    LaurenCruzSr
    ثلاثة تنسيقات إخراج عملية جدًا: Markdown للتوثيق، نص عادي للملاحظات السريعة، وHTML للمعاينة المباشرة. التبديل بينها سلس.

  • الصورة الرمزية
    TerryRiveraJr
    جربت Gemma 3 و Qwen 3.5. شخصيًا، أشعر أن جودة تنسيق Qwen أفضل، بينما Gemma تتفوق في السرعة.

  • الصورة الرمزية
    crazyswan128
    نظرت إلى الكود المصدري على GitHub. جودة كود Igor جيدة. لكن المشروع لا يزال في مرحلة مبكرة، 41 commit فقط، أقلق قليلاً من استمرار الصيانة.

  • الصورة الرمزية
    itjpsxl6
    جربت وضع التحرير. قول 'غير العنوان الفرعي إلى Weekly Notes' عمل بالفعل — تجربة تحرير بدون لوحة مفاتيح تشعرك بالسحر. لكن الدقة لا تزال بحاجة للتحسين، التعليمات المعقدة أحيانًا لا تُفهم.

  • الصورة الرمزية
    Donald.GrayZ383
    وضع الإلحاق مفيد بشكل لا يصدق. عند كتابة مستندات طويلة، لا يزيد زمن الاستجابة مع نمو المحتوى — بل يضيف محتوى جديدًا فقط. تصميم ذكي جدًا.

  • الصورة الرمزية
    JohanMortensen
    بالمقارنة مع Typeless، هذا يفوز بكونه مجانيًا تمامًا ويعالج البيانات محليًا. لكن تجربة الجاهزية الفورية لـ Typeless أفضل. كل شخص وما يناسبه.

  • الصورة الرمزية
    孔飞梅
    حمّلت نسخة iOS، مندهش من حجم 3.1 MB. لكنها تتطلب iOS 26 و iPhone 15 Pro أو أحدث — هاتفي 14 Pro مستبعد تمامًا. أبكي.

  • الصورة الرمزية
    DylanHicks_99
    قمت بتحميل وتجربة إصدار macOS. عملية التكوين لها منحنى تعلم للمستخدمين العاديين — يجب تثبيت whisper.cpp و LLM محلي أولاً. لكن بمجرد التهيئة، التجربة مذهلة: تتحدث ويخرج Markdown منظم مباشرة، واختصار الإملاء العام يعمل في أي تطبيق.

  • الصورة الرمزية
    ticklishswan803
    كنت أبحث عن حل لإدخال الصوت لـ Obsidian، وهذا يخرج ملفات .md مباشرة. تطابق مثالي. مجاني ومفتوح المصدر، رائع.

  • الصورة الرمزية
    CAhil
    رأيت Speech To Markdown على Product Hunt. مجاني ومفتوح المصدر، يجب دعمه. نظرت إلى مستودع GitHub، الهندسة المعمارية واضحة: Whisper محلي للنسخ، LLM محلي للإخراج المهيكل، البيانات لا تغادر الجهاز أبدًا. مستوى الخصوصية هذا يتفوق بكثير على الحلول السحابية.