Heard

Capa de voz para macOS que convierte la salida de terminal de Claude Code, Codex y Cursor en resúmenes de voz inteligentes

Informe detallado

  • Heard es una capa de voz de macOS diseñada para flujos de trabajo de agentes de programación de IA. Conecta Claude Code, OpenAI Codex y Cursor para convertir la salida del terminal en resúmenes de voz inteligentes. Se lanzó en Product Hunt el 25 de julio de 2026 y ocupó el primer lugar ese día (339 votos, 91 comentarios). Es de código abierto (Apache-2.0) y gratuito para particulares. La idea central es "transmitir con criterio", no simplemente convertir texto en voz, sino distinguir lo que se debe decir y lo que se debe omitir.

  • Kelly (@itskellysun), el fundador de Heard, dijo esto en Product Hunt: "Todos han estado tratando de hacer que sea más fácil hablar con el agente durante los últimos dos años: entrada de voz, mejores indicaciones, mejor contexto. Pero nadie está haciendo la otra mitad. La respuesta del agente sigue siendo un texto desplazándose que tienes que sentarte y mirar. Heard es esa mitad". A juzgar por la línea de tiempo, Heard lanzó una versión inicial en la comunidad ya el 1 de mayo de 2026 y luego entró en el campo de visión de los medios tecnológicos ingleses como AI Untethered. Después de su lanzamiento oficial en Product Hunt el 25 de julio, recibió 339 votos y 91 comentarios, ubicándose en primer lugar ese día. En la actualidad, el producto se encuentra en la etapa inicial de rápido crecimiento y no hay ningún informe especial de los medios tecnológicos chinos (36Kr, Minority, etc.). Vale la pena señalar que el nombre de dominio listening.app actualmente apunta a un producto de tecnología de audífonos completamente diferente, y actualmente se accede principalmente a la entrada del sitio web oficial de Heard a través de la página Product Hunt. El producto utiliza un demonio Python con comunicación por socket Unix, el motor TTS admite ElevenLabs (nube) y Kokoro (local) y utiliza Claude Haiku 4.5 para manejar la reescritura de personalidad.

  • El mecanismo central de Heard es el "informe crítico", que es un sistema de toma de decisiones de dos capas. La primera capa se llama señales duras: solicitudes de permiso, fallas en las llamadas a herramientas, finalización de ejecución: estas siempre activan transmisiones de voz. La segunda capa es la capa consciente del contexto: rastrea el historial de conversaciones, determina qué contenido vale la pena decir y omite información redundante. El producto proporciona tres modos de monitoreo. El modo copiloto le brinda indicaciones breves mientras trabaja sin leerlas palabra por palabra; El modo complementario proporciona instrucciones de voz más completas cuando estás lejos de la pantalla; El modo de enfoque permanece en silencio y sólo habla cuando se requiere su intervención (aprobación, bloqueo, fracaso). El procesamiento paralelo de múltiples agentes es el atractivo único de Heard. Cuando se ejecutan varias sesiones de IA (Claude Code, Codex, Cursor) al mismo tiempo, Heard no tiene cinco terminales superpuestos entre sí, sino que se resume a nivel de proyecto, y cada agente utiliza un sonido diferente, lo que permite distinguir de oído quién está haciendo qué. La función de emparejamiento del teléfono móvil (Heard Power) se completa mediante un código QR de un solo uso. Después del emparejamiento, podrás escuchar la transmisión en tiempo real incluso cuando la pantalla esté bloqueada. También admite mantener presionado o hacer clic para hablar y enviar instrucciones al agente inteligente. El emparejamiento del alcance y el desemparejamiento automático garantizan la seguridad. El sistema de personalidad por voz también es muy sofisticado. Hay cuatro personalidades incorporadas: Aria (tranquila y directa), Friday (brillante y vivaz), Jarvis (tranquilo e ingenioso, por defecto) y Atlas (dramático). También puedes personalizar tu personalidad utilizando archivos Markdown. En términos de privacidad, el motor central es Apache-2.0 de código abierto y totalmente autohospedado de forma nativa. El estado de la sesión solo se almacena en la memoria y el disco locales, no en la red. El teléfono móvil sólo transmite audio y no transmite el estado de la sesión.

  • Heard tiene tres niveles de precios. El plan gratuito es permanentemente gratuito e incluye voces nativas de Kokoro, inteligencia artificial y teclas de voz integradas, personalidades personalizadas y teclas de acceso rápido, y está basado en un motor de código abierto. El plan Pro cuesta $ 12 por mes (se paga anualmente) y ofrece voz administrada y LLM (no es necesario configurarlo usted mismo), informes durante todo el día, personalidades premium (Atlas y Friday) y sincronización en la nube entre Mac. El plan Power cuesta $24 por mes (pago anualmente) e incluye todas las funciones de Pro plus Heard mobile, reconocimiento de voz optimizado por código y capacidades de agente de redirección y aprobación de voz. Los planes de hosting requieren macOS 13 o superior. Esta estrategia de precios es más razonable: la versión gratuita permite a los desarrolladores individuales probarla y evaluarla a bajo costo, la versión Pro resuelve las necesidades de los usuarios que no quieren jugar con la configuración de API por sí mismos y la versión Power está dirigida a usuarios habituales y escenarios de oficinas móviles.

  • Los comentarios de la comunidad de Product Hunt han sido en general positivos. El usuario Wes Carlson comentó: "Ejecutar el agente en paralelo hace que la separación de señales duras y el conocimiento del contexto se sienta como una opción de diseño central en lugar de simplemente una característica de notificación". Dogan Akbulut dijo: "Siempre extraño el momento en que el agente espera las solicitudes de permiso, perdiendo 20 minutos. Me encanta este modo casi silencioso". Noctis Leonard cree que el control Verbosity y el resumen a nivel de proyecto son la infraestructura adecuada para trabajar en paralelo. Muchos usuarios también hicieron buenas preguntas. A Gal Dayan le preocupa cómo Heard decide qué vale la pena decir cuando varios agentes paralelos ejecutan diferentes tareas. Otros preguntaron sobre el mecanismo de interrupción de la voz, la ubicación de almacenamiento del estado de la conversación, etc. El fundador respondió a estos problemas técnicos en el área de comentarios y fue bastante sincero.

  • En términos de medios tecnológicos ingleses, AI Untethered informó por primera vez sobre Heard el 1 de mayo, citando al fundador: "La parte más difícil no es TTS, sino decidir qué no decir". daily.dev también hizo una introducción después del lanzamiento de PH, centrándose en los principios técnicos del sistema de toma de decisiones de dos capas. Los agregadores de herramientas como AIToolly y AIDeckly brindan funciones completas e información sobre precios. Desde la perspectiva de la industria, Heard llena un vacío que se pasa por alto. La mayoría de las herramientas de programación de IA se centran únicamente en la “entrada”: cómo el usuario habla con el agente. La cuestión de cómo el agente lo "envía" al usuario nunca se ha tomado en serio. Es este problema de salida el que Heard decidió resolver. En el contexto de la creciente popularidad de los agentes de programación de IA, de hecho existe una demanda de esta dirección de "interacción humano-computadora en la que el audio es lo primero". Sin embargo, actualmente hay casi cero informes de los medios chinos sobre Heard. Esto puede estar relacionado con el hecho de que el producto sólo se difunde en la comunidad inglesa y el nombre de dominio del sitio web oficial apunta a otro producto.

  • Actualmente no existen disputas importantes ni riesgos legales para Heard. Pero hay varios problemas potenciales a los que vale la pena prestar atención. La primera es la separación del posicionamiento del producto y el nombre de dominio: Hear.app apunta a la tecnología de audífonos en lugar de productos de capa de voz de IA, lo que puede causar confusión en el usuario y también afectar la adquisición de tráfico natural. En segundo lugar, existe una presión competitiva sobre el producto: se ha lanzado el modo de voz/Claude Code oficial de Anthropic, y también se siguen desarrollando alternativas de código abierto como VoiceMode MCP. Heard necesita establecer barreras técnicas suficientes. El tercero es el precio. El plan Power de 24 dólares no es caro en el campo de las herramientas de inteligencia artificial, pero si los principales productos de la competencia son de código abierto y gratuitos, debe seguir demostrando el valor único de las funciones pagas.

  • Heard es más adecuado para tres tipos de personas. La primera categoría son los desarrolladores individuales que utilizan Claude Code o Codex a diario, especialmente aquellos que no quieren estar atados a una terminal todo el tiempo. La segunda categoría son los desarrolladores que trabajan en escenarios remotos o móviles y pueden utilizar su tiempo de desplazamiento y caminata para seguir el progreso del agente. La tercera categoría son los usuarios habituales que ejecutan varios agentes al mismo tiempo y necesitan un resumen a nivel de proyecto en lugar de alternar entre varios terminales. Las personas que no son adecuadas incluyen: desarrolladores que usan Windows o Linux (aún no es compatible, pero se han confirmado planes oficiales multiplataforma), desarrolladores que no necesitan comentarios de voz y usuarios que usan agentes de programación de IA con menos frecuencia. Si no necesita la experiencia nativa de macOS, VoiceMode MCP o el modo de voz integrado de Claude Code se pueden utilizar como alternativa.

  • Heard resuelve un problema real pero que fácilmente se pasa por alto: la experiencia del lado de salida de los agentes programados con IA. El diseño del producto está pensado en profundidad, desde la toma de decisiones de dos capas consciente de la señal/contexto hasta el timbre independiente de múltiples agentes, y la comprensión del flujo de trabajo real se puede ver en cada punto de función. El núcleo de código abierto y la estrategia de precios de tres niveles también brindan a los usuarios opciones flexibles. El tiempo de lanzamiento del producto es corto (solo 2 días) y los desarrollos posteriores merecen atención, especialmente el soporte multiplataforma y la promoción de la comunidad china.

Reseñas de usuarios

  • avatar
    Cynthia_RodriguezII
    La función de procesamiento paralelo multiagente es un salvavidas. Antes saltaba entre cuatro ventanas de terminal y me volvía loco. Ahora cada agente habla con una voz distinta y sé quién hace qué hasta con los ojos cerrados.

  • avatar
    LUphi
    Acabo de probar el modo Companion de Heard. Me fui a por un café mientras escuchaba a Codex refactorizando en segundo plano aquel viejo proyecto mío. Al volver, el código estaba listo y hasta los tests pasaban. Qué sensación tan buena.

  • avatar
    TendermintTina54
    El modo Focus es mi favorito. No parlotea sin parar: solo habla cuando hay un error o necesita mi aprobación. Antes, con Claude Code, perdía veinte minutos por no ver un aviso de permisos; ya no me pasa.

  • avatar
    Anthony.Rogers58
    Probé el emparejamiento con el móvil: un escaneo de código QR y listo. Con la pantalla bloqueada se siguen oyendo los anuncios, e incluso puedes mantener pulsado para hablar y darle órdenes al Agent. Seguir el progreso mientras paseas por la calle: la tecnología cambia la vida.

  • avatar
    Diane_Price_77
    Open source con Apache-2.0 más un plan gratuito: sinceridad al máximo. La voz local de Kokoro no es tan natural como ElevenLabs, pero poder ejecutarla a coste cero ya es un chollo.

  • avatar
    Logan216
    Que Heard convierta la salida del Agent en voz es la dirección correcta. Todos están ocupados con la entrada de voz y nadie se ocupa del lado de la salida. El fundador tiene razón: el Agent sigue respondiendo con texto que se desplaza y tienes que quedarte sentado mirándolo.

  • avatar
    谢秀
    Número 1 en PH ese mismo día con 330 votos: la demanda existe de verdad. El sector de herramientas para desarrolladores está saturadísimo; llegar al primer puesto no es fácil.

  • avatar
    梅花_15
    Ayer antes de salir del trabajo lancé tres Agents a la vez con tareas distintas: Claude Code refactorizando la API del backend, Codex escribiendo componentes de front-end y Cursor corriendo tests. Heard anunciaba el progreso de cada uno con tres voces diferentes: la personalidad Aria explicaba la parte de la API con especial claridad y Friday narraba el avance del front-end con tono alegre, imposible confundirlos. A mitad de camino, un Agent se quedó atascado en una aprobación de permisos y el modo Focus me mandó al instante un aviso de voz; pulsé aprobar y siguió. Al final, de camino a casa escuché en el móvil el resto de los anuncios, y al abrir el ordenador en casa las tres tareas estaban terminadas. Una experiencia que antes ni podía imaginar.

  • avatar
    Nancy8552024
    Las cuatro personalidades de voz tienen cada una su encanto. Probé Friday y su estilo desenfadado realmente encaja con sesiones largas de programación. El diseño abierto de personalizar la personalidad con Markdown también tiene mucha idea.

  • avatar
    DWhite_Pro509
    El plan Pro cuesta 12 dólares al mes, con voz y LLM alojados, sin tener que configurar tu propia API. Para quien no quiere complicarse sale a cuenta, pero yo primero usaré la versión gratuita una temporada.

  • avatar
    goldenmouse658
    Lo que más me llegó fue la frase «lo más difícil no es el TTS, sino decidir qué no decir». Restar es mucho más difícil que sumar, y Heard filtra el ruido realmente bien: no convierte toda la salida de la terminal en voz, sino que selecciona con criterio.

  • avatar
    郝玉梅
    Leí la discusión en Product Hunt y las respuestas del fundador a las preguntas técnicas fueron muy francas. El estado de sesión se guarda en memoria y disco locales, y al móvil solo llega audio, nunca el estado. Ese diseño de privacidad es de fiar.

  • avatar
    NSullivan
    Vengo del proyecto open source claude_voice. La experiencia de Heard es muchísimo mejor; no son productos del mismo nivel. Han logrado de verdad eso de «anuncios con criterio», no una simple lectura TTS. Además, la arquitectura de Heard es más ligera: el enfoque de daemon Python más socket Unix es mucho más elegante que montar un servicio Node solo para TTS, y consume menos recursos.

  • avatar
    AustinMorales168224
    El plan Power a 24 dólares al mes es un pelín caro, pero incluye el móvil y la aprobación por voz. Alguien como yo, que está siempre fuera, realmente lo necesita; probaré un mes a ver si vale la pena. Si la experiencia en el móvil es lo bastante buena, el precio en realidad es aceptable.

  • avatar
    Ryan_StephensJr5
    Tengo una duda: si dos Agents en paralelo informan uno de que la migración tuvo éxito y otro de que los tests fallaron, ¿cómo resume Heard resultados tan contradictorios? Vi la respuesta del fundador en PH: usan un mecanismo de reasoning-pass override; primero lanzar, luego optimizar.

  • avatar
    AnnMendozaII
    La arquitectura de Heard con daemon en Python y socket Unix es bastante ligera y consume pocos recursos. Mucho más limpia que esas soluciones envueltas en Electron. Usar Claude Haiku 4.5 para reescribir la personalidad también es un uso muy creativo.

  • avatar
    CHOKM0F
    Los desarrolladores dicen que en el futuro habrá soporte para Linux y Windows; genial. Mi máquina principal es un Mac, pero cuando uso Windows de vez en cuando también necesito poder usarlo.

  • avatar
    钱建晴
    Hoy lo probé en una cafetería ruidosa y Heard seguía anunciando con claridad. El ruido ambiente molestaba un poco, pero la voz era lo bastante fuerte: con los AirPods puestos se oía perfectamente.

  • avatar
    TheHelenaVergara
    En modo Co-pilot interviene de vez en cuando mientras trabajas, sin cortar el hilo de pensamiento. Es como tener a un compañero al lado que te susurra «los tests pasaron» o «ahí hay un error, échale un vistazo». El equilibrio está clavado.

  • avatar
    KrinHarper
    Pasé un día entero con Heard mientras Claude Code refactorizaba una base de código, y la experiencia superó las expectativas. No solo escucho el progreso, sino que me avisa a tiempo cuando el Agent se atasca y necesita mi decisión. Comparado con vigilar la terminal a ojo como antes, la eficiencia ha subido mucho. El núcleo open source más tres niveles de precios también dan al usuario suficiente margen de elección.

  • avatar
    春雨_5
    Llevaba tiempo esperando una herramienta que convirtiera la salida del Agent en voz, y por fin alguien la ha hecho. Aunque me preocupa un poco que el dominio heard.app apunte a un producto de tecnología auditiva que no tiene nada que ver con este Heard; puede confundir. Espero que el equipo resuelva pronto el tema del dominio.

  • avatar
    梅花40
    Si usas el TTS en la nube de ElevenLabs, el resultado es realmente muy natural. Pero el Kokoro local también cumple y te ahorras el coste de la API. Cada opción tiene sus pros y contras.

  • avatar
    流年393
    El autoalojamiento es una maravilla: todo corre en local y ni el código ni los datos salen de la máquina. Para proyectos con requisitos de cumplimiento, este diseño de arquitectura es muy importante. Que el móvil solo transmita audio y no el estado también da tranquilidad.

  • avatar
    TerryGonzalezQ8
    Se nota la presión competitiva: el modo /voice oficial de Claude Code de Anthropic ya está disponible y VoiceMode MCP también avanza. Espero que Heard mantenga su ventaja técnica y no lo aplasten los grandes. Dicho esto, Heard hace anuncios de voz en el lado de salida, mientras que lo oficial es entrada de voz: son pistas distintas, más complementarias que competitivas.

  • avatar
    nty8ahuejt
    Después de instalarlo puedes cambiar de modo desde la barra de menús, sin reiniciar ni teclear comandos. Este diseño de interacción es muy de Mac. Como usuario del ecosistema Apple, me resulta comodísimo.

  • avatar
    8domk0e_i3j
    Un detalle: el control de Verbosity de Heard permite ajustar con precisión cuánto se anuncia, desde una narración completa hasta solo los errores. Al trabajar en paralelo, un resumen a nivel de proyecto es muchísimo mejor que escuchar cinco terminales superponiéndose. Recomiendo a todo desarrollador que use Claude Code que lo pruebe.

  • avatar
    夏明
    Estos días he estado usando Heard junto con Cursor para escribir front-end y es una gozada. Ajusto estilos mientras escucho al Agent informar de su estado, sin cambiar de pantalla todo el rato. La productividad ha subido bastante, sobre todo porque ya no tengo que esperar de brazos cruzados mientras corren los tests.

  • avatar
    LucaKumar
    La falta de soporte para Windows y Linux es sin duda un punto débil. Espero que el plan multiplataforma de la hoja de ruta llegue pronto; si no, los compañeros del equipo que usan sistemas distintos no podrán usarlo de forma unificada.