Speech To Markdown
Una aplicación macOS/iOS gratuita y de código abierto que convierte voz en documentos Markdown estructurados en tiempo real mediante AI local
Informe detallado
-
Speech To Markdown es una aplicación macOS/iOS gratuita y de código abierto creada por el desarrollador independiente Igor Steblii. El concepto central es "Hablar, obtener Markdown limpio, procesamiento 100% local". Utiliza reconocimiento de voz local Whisper + estructuración local LLM en tiempo real para convertir directamente contenido hablado en documentos Markdown bien formateados. En un entorno de mercado donde los productos de la competencia generalmente cobran una tarifa anual de $144 y dependen de la nube, Speech To Markdown ofrece un camino diferenciado para los usuarios de tecnología sensibles a la privacidad con la triple ventaja de ser completamente gratuito, 100% fuera de línea y de código fuente abierto. El producto se encuentra actualmente en la etapa inicial (v0.2.0) y la popularidad de la comunidad aún no se ha formado, pero se ha reconocido la lógica subyacente y la dirección de la experiencia del usuario.
-
Speech To Markdown (stmd para abreviar) fue desarrollado por el desarrollador independiente Igor Steblii (GitHub: xajik). Igor es un desarrollador full-stack. Reveló en LinkedIn que su motivación inmediata para desarrollar esta aplicación fue: "Los resultados de hablar con Gemini fueron cada vez peores, y finalmente se dio por vencido y volvió a escribir. La entrada de voz es de hecho más rápida que escribir, pero el verdadero desafío no es la velocidad, sino la estructura: es difícil organizar sus pensamientos mientras se discuten improvisadamente procesos complejos, productos o requisitos técnicos". El proceso de desarrollo de la aplicación comenzó en 2025. Inicialmente se repitió en GitHub con el nombre VoiceToMarkdown y ha evolucionado a través de cuatro versiones: 0.0.4→0.0.8→0.1.0→0.1.1. El 10 de julio de 2026, el proyecto pasó a llamarse SpeechToMarkdown y se lanzó la versión v0.2.0. Al mismo tiempo, la versión iOS de SpeechToMarkdown está disponible en la App Store y es compatible con iPhone 15 Pro y superiores. A partir de ahora, el repositorio de GitHub tiene 41 confirmaciones, 2 contribuyentes (incluida la contribución asistida por Claude AI) y la aplicación App Store tiene solo 3,1 MB. El posicionamiento de Speech To Markdown es muy claro: no es un producto de consumo masivo, sino una herramienta de eficiencia para usuarios técnicos, desarrolladores y usuarios habituales de Markdown. No persigue cobertura multiplataforma ni funciones de sincronización en la nube, pero logra lo último en profundidad, precisión y privacidad dentro del ecosistema de Apple.
-
Speech To Markdown ofrece dos versiones: la versión de escritorio macOS y la versión móvil iOS. Los dos conjuntos de tecnologías son diferentes pero la experiencia es la misma. Hablemos primero de la versión de escritorio de macOS. Opera en la barra de menú y se puede invocar en cualquier momento a través de la tecla de acceso directo ⌘⌥] - el modo de "dictado global" se activa en cualquier aplicación y el texto Markdown transcrito se ingresa directamente en la posición actual del cursor después de hablar. Este método de "inyección global" rompe las barreras de entrada de todas las aplicaciones y puede usarlo en terminales, navegadores, Slack y VS Code a voluntad. Además del dictado global, también existe el "modo agente", una ventana del editor Markdown en tiempo real. Cuando habla, su voz primero se transcribe en texto mediante Whisper.cpp (almacenada en un búfer cada 4 segundos) y luego se envía al LLM local para su procesamiento estructurado. Los resultados se transmiten al editor y lo que ves es lo que obtienes. La versión móvil de iOS ha tomado un camino técnico completamente diferente. No depende de ningún servidor LLM externo, sino que llama al SpeechAnalyzer integrado de los dispositivos Apple para el reconocimiento de voz y a los Apple Foundation Models para el formateo. Esto significa que no tiene configuración, cero dependencias e incluso admite el modo avión. Desde el lanzamiento de la App Store, los usuarios sólo necesitan descargarla y utilizarla. No se requiere registro, configuración ni conexión de red. Lo más destacable son sus tres modos de trabajo. El modo de formato es un modo de dictado gratuito. Lo que diga se enviará a LLM para reconstruir el documento completo en tiempo real: todo el contenido nuevo se envía al modelo junto con el contenido existente para garantizar la coherencia global. El modo de edición trata la voz como instrucciones en lugar de contenido, como "Cambiar el subtítulo a Notas semanales" y "Convertir esta lista en una tabla": seleccione el texto y diga la instrucción, y el modelo solo cambia la parte seleccionada. El modo anexar es un modo de aceleración diseñado para documentos largos. Solo las últimas tres oraciones más el contenido nuevo se envían a LLM y la demora no aumenta con la longitud del documento. El formato de salida admite Markdown, texto sin formato y HTML, que se pueden cambiar en cualquier momento durante la sesión, y la configuración se conserva durante los inicios. Todas las sesiones se guardan automáticamente y la transcripción original siempre está disponible con un solo clic.En términos de comparación de productos competitivos, Typeless ($144/año, procesamiento en la nube) y Wispr Flow ($144/año, procesamiento en la nube) brindan una experiencia multiplataforma más madura, pero ambas son suscripciones pagas y dependen de la nube. Trace (compra única de £ 9,99, solo macOS) es más profesional en la transcripción de reuniones y la separación de oradores, pero carece de capacidades de estructuración en tiempo real. v2md (a partir de 14,49 dólares al año, sin conexión en iOS) es el competidor más cercano, pero su modelo de carga y su posicionamiento son controvertidos. Speech To Markdown no tiene rivales en las cuatro dimensiones de "completamente gratis + código abierto + 100% fuera de línea + soporte nativo para Markdown".
-
Actualmente, Speech To Markdown es completamente gratuito, sin compras dentro de la aplicación, sin suscripciones ni anuncios. La versión de iOS está disponible en la App Store y la versión de macOS se distribuye a través de GitHub. El código es de código abierto en GitHub y cualquiera puede descargarlo, compilarlo y modificarlo libremente. Este modelo es extremadamente raro entre productos similares. Typeless tiene una tarifa anual de $144, Wispr Flow tiene una tarifa anual de $144, Brain Dump tiene una tarifa anual de $44,99 y v2md tiene una tarifa anual de $14,49 a $35,99. El único que es casi gratuito es Trace (compra única de £ 9,99), pero la funcionalidad es completamente diferente. Igor no reveló planes futuros de monetización, pero se puede especular que puede lograr la sostenibilidad a largo plazo mediante patrocinio (como GitHub Sponsors) o servicios adicionales (como sincronización en la nube, versión en equipo). Actualmente, stmd no tiene suficientes reseñas en la App Store para mostrar una calificación, y la cantidad de estrellas en GitHub también está en su infancia. Pero esta herramienta muestra un camino de software que es diferente de la suscripción SaaS: pequeña pero hermosa, gratuita y de código abierto, e impulsada por la tecnología.
-
Dado que Speech To Markdown lleva poco tiempo en la App Store, aún no ha acumulado suficientes reseñas de usuarios. Pero ya hay algunas voces en la comunidad de desarrolladores. Igor publicó un artículo titulado "De Brain Dump a Markdown: estructura las ideas mientras hablas" en DEV.to, dictando el artículo completo usando stmd como demostración. También hay usuarios iniciales en LinkedIn que dijeron: "La experiencia es inesperadamente buena: dije algo casualmente y no solo lo convirtió en texto, sino que también lo organizó directamente en Markdown para mí y lo dividió automáticamente en 1, 2 y 3 puntos claros".
-
Actualmente, esta aplicación ha recibido muy poca exposición en los medios de la industria, sin informes de los principales medios tecnológicos como TechCrunch y The Verge. Pero en la comunidad de herramientas para desarrolladores, los sitios de navegación de herramientas como thistools.app y gunbark.dev lo han recogido y lo han revisado favorablemente. La revisión de thistools.app afirma: "La lógica subyacente de esta arquitectura es muy clara: el audio se transcribe y almacena en el búfer de Whisper.cpp en secciones de aproximadamente 4 segundos, y cuando acumula unas 30 palabras, se envía a LLM y los resultados se transmiten al editor. Este diseño logra un buen equilibrio entre latencia y coherencia global". En términos de panorama de productos competitivos, el mercado se está expandiendo rápidamente. Typeless acaba de recibir una nueva ronda de atención en julio de 2026. Wispr Flow ha recaudado 81 millones de dólares y está valorado en 700 millones de dólares. La pista de discurso → texto estructurado está cambiando de "un juguete para unas pocas personas" a "una infraestructura que todos necesitan". Speech To Markdown es gratuito y de código abierto. Aunque es difícil formar competencia comercial en el corto plazo, tiene un nicho de mercado sólido en el círculo técnico y grupos de usuarios sensibles a la privacidad.
-
Como herramienta gratuita de código abierto, el mayor riesgo que enfrenta Speech To Markdown no es la competencia comercial, sino la energía de los desarrolladores y la sostenibilidad del proyecto. Los proyectos de desarrolladores independientes a menudo siguen la trayectoria de "inicio entusiasta → iteración rápida → estancamiento lento". Si Igor no puede seguir invirtiendo en mantenimiento, stmd puede volverse inactivo gradualmente como muchos proyectos excelentes de código abierto. Otro riesgo son las limitaciones de hardware. La versión de iOS requiere iOS 26+ y un dispositivo Apple Intelligence (iPhone 15 Pro y superior), lo que excluye a una gran cantidad de usuarios existentes. La versión macOS requiere que los usuarios instalen susurro.cpp y el servidor LLM local por sí mismos, que tiene un umbral más alto para usuarios no técnicos. En el ecosistema chino, este umbral es particularmente prominente: la interfaz de la aplicación solo admite inglés y casi no hay revisiones o tutoriales en chino en las principales plataformas de China (Zhihu, Xiaohongshu, Bilibili, CSDN, etc.), lo que constituye un importante cuello de botella para el crecimiento de usuarios.
-
Speech To Markdown es más adecuado para tres tipos de personas: primero, usuarios técnicos y desarrolladores que están dispuestos a dedicar tiempo a configurar LLM local a cambio de un uso gratuito ilimitado y la máxima garantía de privacidad; en segundo lugar, los usuarios habituales de bibliotecas de notas Markdown como Obsidian, que necesitan un método de entrada de dictado eficiente; tercero, los usuarios que son extremadamente sensibles a la privacidad de los datos y esperan que los datos de voz nunca abandonen el dispositivo. Las personas que no son adecuadas incluyen: consumidores comunes que buscan una experiencia lista para usar (se recomienda Typeless o Wispr Flow), usuarios que necesitan sincronización multiplataforma y múltiples dispositivos y usuarios que buscan funciones de transcripción de reuniones y separación de oradores (se recomienda Trace).
-
Speech To Markdown es un nuevo actor notable en el campo de Speech to Markdown. Eligió un camino anti-mainstream (sin dinero, sin Internet, sin uso inmediato), pero precisamente por eso llenó un vacío real. El desarrollador independiente Igor Steblii utilizó un conjunto de soluciones técnicas exquisitas (Whisper local + LLM local + tres modos de trabajo) para demostrar que la conversión de voz a texto estructurado puede ser extremadamente privada y completamente gratuita. Para los usuarios objetivo, puede que no sea un producto maduro, pero definitivamente va en la dirección correcta.
Reseñas de usuarios
-
Robin749—Descubrí un cuello de botella: la captura de voz en entornos ruidosos no es muy buena, ya que usa el micrófono incorporado del Mac. Conectando un micrófono externo mejora mucho. -
冯明—La precisión del reconocimiento de voz en chino es mejor de lo esperado, el modelo Whisper maneja bien el chino. Pero el formato Markdown de salida tiende a usar convenciones del inglés, y la tipografía china requiere ajuste manual ocasionalmente. -
狗狗112—Comparado con Wispr Flow, carece de sincronización multiplataforma y funciones de limpieza AI, pero gana por ser completamente gratuito y mantener los datos en el dispositivo. Según las prioridades de cada uno. -
ElizabethJenkinsX455—Ojalá soportara Android, pero viendo que la arquitectura depende de los frameworks de Apple, probablemente no tendrá soporte a corto plazo. -
陈丹丹—La salida en streaming del editor en tiempo real mola. Ver el texto aparecer línea por línea mientras hablas da la sensación de estar escribiendo código (risas). -
SHernandezQ—89 votos en Product Hunt, puesto 15. Bastante bien para un proyecto gratuito de código abierto recién lanzado. Espero que siga evolucionando. -
黄云鹏—Probé la versión iOS en un avión. El modo avión funciona perfectamente, los datos no van a la nube, una maravilla para los viajeros frecuentes. -
TCastilloJr—El desarrollador Igor escribió un artículo completo usando esta herramienta en DEV.to como demostración. Un caso interesante de «comer tu propia comida para perros». -
TheXavierScott—Sería perfecto si en el futuro añadieran separación de hablantes. Ahora solo puede usarlo una persona, los escenarios de reuniones con varias personas aún no están cubiertos. -
EDort—Compañeros, para la versión macOS elegí Qwen 3.5 27B 4bit al configurar el LLM local, corriendo con omlx, la velocidad es decente. ¿Alguien ha probado Gemma 3? ¿Qué tal? -
realEmaRikstad_x—Usé v2md durante unos meses. Ver que este sale completamente gratis es sorprendente. Puede que las funciones no sean tan completas como v2md, pero como código abierto el potencial es enorme. -
DebraFosterSr—La configuración de la tecla de acceso directo de dictado global está bien, no entra en conflicto con Alfred o Raycast. Pero al primer inicio requiere permisos de micrófono y accesibilidad, lo que puede desanimar a los principiantes. -
Natalie_Ward_77—La comprensión del lenguaje natural de los comandos en modo de edición aún no es estable, pero considerando que es un producto inicial gratuito y de código abierto, ya es sorprendente. -
Jessica_Kelly_20227—Lo probé durante una reunión. Simplemente dicté las notas de la reunión verbalmente y las convirtió en Markdown estructurado. Mucho más eficiente que tomar notas manualmente. -
jcmbo8rhv777—Después de comparar varias herramientas de voz a Markdown, esta es la que mejor equilibra privacidad y funcionalidad. Sin registro, sin conexión, sin pago, ¿qué más se puede pedir? -
LaurenCruzSr—Tres formatos de salida muy prácticos: Markdown para documentación, texto plano para tomar notas rápidas y HTML para vista previa directa. Cambiar entre ellos es fluido. -
TerryRiveraJr—Probé Gemma 3 y Qwen 3.5. Personalmente, siento que la calidad del formato de Qwen es mejor, mientras que Gemma gana en velocidad. -
crazyswan128—Miré el código fuente en GitHub. La calidad del código de Igor es buena. Pero el proyecto aún está en etapa inicial, solo 41 commits, me preocupa un poco si el mantenimiento podrá continuar. -
itjpsxl6—Probé el modo Edit. Decir 'cambia el subtítulo a Weekly Notes' realmente funcionó — una experiencia de edición sin teclado que se siente mágica. Pero la precisión aún tiene margen de mejora, las instrucciones complejas a veces no se entienden. -
Donald.GrayZ383—El modo Append es increíblemente útil. Al escribir documentos largos, la latencia no aumenta a medida que el contenido crece, solo añade contenido nuevo. Un diseño muy inteligente. -
JohanMortensen—Comparado con Typeless, este gana por ser completamente gratuito y procesar datos localmente. Pero la experiencia lista para usar de Typeless es mejor. Cada uno escoge lo que necesita. -
孔飞梅—Descargué la versión iOS, me sorprendió el tamaño de 3.1 MB. Pero requiere iOS 26 y iPhone 15 Pro o superior — mi 14 Pro queda excluido precisamente. Lloro. -
DylanHicks_99—Descargué y probé la versión de macOS. El proceso de configuración tiene una curva de aprendizaje para usuarios normales — hay que instalar whisper.cpp y un LLM local primero. Pero una vez configurado, la experiencia es increíble: hablas y sale Markdown estructurado directamente, y el atajo global de dictado funciona en cualquier app. -
ticklishswan803—Llevaba tiempo buscando una solución de entrada de voz para Obsidian, esta genera archivos .md directamente. Combinación perfecta. Gratis y de código abierto, increíble. -
CAhil—Vi Speech To Markdown en Product Hunt. Gratis y código abierto, hay que apoyarlo. Miré el repositorio de GitHub, la arquitectura es clara: Whisper local para transcripción, LLM local para salida estructurada, los datos nunca salen de la máquina. Este nivel de privacidad supera con creces a las soluciones en la nube.