Heard
Couche vocale pour macOS qui transforme la sortie terminal de Claude Code, Codex et Cursor en résumés vocaux intelligents
Rapport détaillé
-
Heard est une couche vocale macOS conçue pour les flux de travail des agents de programmation IA. Il connecte Claude Code, OpenAI Codex et Cursor pour convertir la sortie du terminal en résumés vocaux intelligents. Il a été lancé sur Product Hunt le 25 juillet 2026 et s'est classé premier ce jour-là (339 votes, 91 commentaires). Il est open source (Apache-2.0) et gratuit pour les particuliers. L'idée centrale est de "diffuser avec jugement" - pas simplement en convertissant le texte en parole, mais en distinguant ce qui doit être dit et ce qui doit être ignoré.
-
Kelly (@itskellysun), la fondatrice de Heard, a déclaré ceci sur Product Hunt : « Tout le monde essaie de faciliter la conversation avec l'agent depuis deux ans – saisie vocale, meilleures invites, meilleur contexte. À en juger par la chronologie, Heard a publié une première version dans la communauté dès le 1er mai 2026, puis est entré dans le champ de vision des médias technologiques anglais tels que AI Untethered. Après son lancement officiel sur Product Hunt le 25 juillet, il a reçu 339 votes et 91 commentaires, se classant premier ce jour-là. À l'heure actuelle, le produit en est aux premiers stades d'une croissance rapide et il n'y a pas de reportage spécial de la part des médias technologiques chinois (36Kr, Minority, etc.). Il convient de noter que le nom de domaine entendu.app pointe actuellement vers un produit technologique d’aide auditive complètement différent, et que l’entrée du site officiel de Heard est actuellement principalement accessible via la page Product Hunt. Le produit utilise un démon Python avec communication socket Unix, le moteur TTS prend en charge ElevenLabs (cloud) et Kokoro (local) et utilise Claude Haiku 4.5 pour gérer la réécriture de personnalité.
-
Le mécanisme central de Heard est le « rapport de jugement », qui est un système de prise de décision à deux niveaux. La première couche est appelée signaux durs : demandes d'autorisation, échecs d'appel d'outil, exécutions terminées - ceux-ci déclenchent toujours des diffusions vocales. La deuxième couche est la couche contextuelle : elle suit l'historique des conversations, détermine quel contenu mérite d'être dit et ignore les informations redondantes. Le produit propose trois modes de surveillance. Le mode copilote vous donne de courtes invites pendant que vous travaillez sans les lire textuellement ; Le mode Compagnon fournit un briefing vocal plus complet lorsque vous êtes loin de l'écran ; Le mode Focus reste silencieux et ne parle que lorsque votre intervention est requise (approbation, blocage, échec). Le traitement parallèle multi-agents est l’argument de vente unique de Heard. Lorsque plusieurs sessions d'IA (Claude Code, Codex, Cursor) s'exécutent en même temps, Heard n'a pas cinq terminaux superposés les uns aux autres, mais est résumé au niveau du projet, et chaque agent utilise un son différent, permettant de distinguer qui fait quoi à l'oreille. La fonction d'appairage du téléphone mobile (Heard Power) s'effectue via un code QR à usage unique. Après l'appairage, vous pouvez écouter la diffusion en temps réel même lorsque l'écran est verrouillé. Il prend également en charge le maintien du bouton enfoncé ou le clic pour parler afin d'envoyer des instructions à l'agent intelligent. L'appairage de l'oscilloscope et le dissociation automatique assurent la sécurité. Le système de personnalité vocale est également très sophistiqué. Il existe quatre personnalités intégrées : Aria (calme et directe), Friday (lumineux et vif), Jarvis (calme et spirituel, par défaut) et Atlas (dramatique). Vous pouvez également personnaliser votre personnalité à l'aide de fichiers Markdown. En termes de confidentialité, le moteur principal est open source Apache-2.0 et entièrement auto-hébergé de manière native. L'état de la session est uniquement stocké dans la mémoire locale et sur le disque, pas sur le réseau. Le téléphone mobile transmet uniquement l'audio et ne transmet pas l'état de la session.
-
Heard propose trois niveaux de tarification. Le plan Free est gratuit en permanence et comprend des voix Kokoro natives, des touches vocales et IA intégrées, des personnalités et des raccourcis clavier personnalisés, et est basé sur un moteur open source. Le forfait Pro coûte 12 $ par mois (payé annuellement) et propose une voix et un LLM gérés (aucune configuration requise vous-même), des rapports toute la journée, des personnalités premium (Atlas et vendredi) et une synchronisation cloud entre Mac. Le plan Power coûte 24 $ par mois (payé annuellement) et comprend toutes les fonctionnalités de Pro plus Heard mobile, une reconnaissance vocale optimisée par code et des capacités d'approbation vocale et d'agent de redirection. Les plans d'hébergement nécessitent macOS 13 ou supérieur. Cette stratégie tarifaire est plus raisonnable : la version gratuite permet aux développeurs individuels d'essayer de l'évaluer à faible coût, la version Pro répond aux besoins des utilisateurs qui ne veulent pas manipuler eux-mêmes la configuration de l'API, et la version Power est destinée aux gros utilisateurs et aux scénarios de bureau mobile.
-
Les commentaires de la communauté Product Hunt ont été globalement positifs. L'utilisateur Wes Carlson a commenté : "L'exécution de l'agent en parallèle donne l'impression que la séparation des signaux concrets et de la prise en compte du contexte est un choix de conception principal plutôt qu'une simple fonctionnalité de notification." Dogan Akbulut a déclaré : « Le moment où l'agent attend les invites d'autorisation me manque toujours, ce qui me fait perdre 20 minutes. J'adore ce mode quasi silencieux. Noctis Leonard estime que le bouton Verbosity et le résumé au niveau du projet constituent la bonne infrastructure pour travailler en parallèle. De nombreux utilisateurs ont également posé de bonnes questions. Gal Dayan s'intéresse à la façon dont Heard décide de ce qui vaut la peine d'être dit lorsque plusieurs agents parallèles exécutent des tâches différentes. D'autres ont posé des questions sur le mécanisme d'interruption de la voix, l'emplacement de stockage de l'état de la conversation, etc. Le fondateur a répondu à ces problèmes techniques dans la zone de commentaires et a été très franc.
-
En ce qui concerne les médias technologiques anglais, AI Untethered a rendu compte pour la première fois de Heard le 1er mai, citant le fondateur : "Le plus difficile n'est pas le TTS, mais de décider ce qu'il ne faut pas dire." daily.dev a également fait une introduction après la sortie de PH, en se concentrant sur les principes techniques du système décisionnel à deux niveaux. Les agrégateurs d'outils comme AIToolly et AIDeckly fournissent des fonctionnalités complètes et des informations sur les prix. Du point de vue de l’industrie, Heard comble une lacune négligée. La plupart des outils de programmation d'IA se concentrent uniquement sur la « saisie », c'est-à-dire la façon dont l'utilisateur parle à l'agent. La question de savoir comment l'agent le « transmet » à l'utilisateur n'a jamais été prise au sérieux. C’est ce problème de sortie que Heard a choisi de résoudre. Dans le contexte de la popularité croissante des agents de programmation d'IA, il existe en effet une demande pour cette direction « l'interaction homme-machine axée sur l'audio ». Cependant, il n’existe actuellement presque aucun reportage dans les médias chinois sur Heard. Cela peut être lié au fait que le produit n'est diffusé que dans la communauté anglophone et que le nom de domaine du site officiel pointe vers un autre produit.
-
Il n’existe actuellement aucun litige important ni risque juridique pour Heard. Mais il existe plusieurs problèmes potentiels auxquels il convient de prêter attention. Le premier est la séparation du positionnement du produit et du nom de domaine – entendu.app pointe vers la technologie des aides auditives plutôt que vers les produits de couche vocale IA, ce qui peut semer la confusion chez les utilisateurs et également affecter l'acquisition naturelle du trafic. Deuxièmement, il existe une pression concurrentielle sur les produits : le mode officiel Claude Code/voix d'Anthropic a été lancé, et des alternatives open source telles que VoiceMode MCP continuent également de se développer. Heard doit établir des barrières techniques suffisantes. Le troisième est la tarification. Le forfait Power à 24 $ n'est pas cher dans le domaine des outils d'IA, mais si les principaux produits concurrents sont open source et gratuits, il doit continuer à prouver la valeur unique des fonctions payantes.
-
Heard convient mieux à trois types de personnes. La première catégorie est constituée de développeurs individuels qui utilisent quotidiennement Claude Code ou Codex, notamment ceux qui ne souhaitent pas être liés à un terminal en permanence. La deuxième catégorie est constituée de développeurs qui travaillent dans des scénarios distants ou mobiles et peuvent utiliser leur temps de trajet et de marche pour suivre la progression de l'agent. La troisième catégorie est constituée des gros utilisateurs qui exécutent plusieurs agents en même temps et qui ont besoin d'un résumé au niveau du projet plutôt que de basculer entre différents terminaux. Les personnes qui ne conviennent pas incluent : les développeurs utilisant Windows ou Linux (pas encore pris en charge, mais les plans multiplateformes officiels ont été confirmés), les développeurs qui n'ont pas besoin de retour vocal et les utilisateurs qui utilisent moins fréquemment les agents de programmation d'IA. Si vous n’avez pas besoin de l’expérience macOS native, VoiceMode MCP ou le mode /voix intégré de Claude Code peut être utilisé comme alternative.
-
Heard résout un problème réel mais facilement négligé : l’expérience côté sortie des agents programmés par l’IA. La conception du produit est réfléchie en profondeur, depuis la prise de décision à deux niveaux sensible au signal/contexte jusqu'au timbre indépendant multi-agents, et la compréhension du flux de travail réel peut être vue dans chaque point fonctionnel. La stratégie de tarification de base open source et à trois niveaux offre également aux utilisateurs des choix flexibles. Le délai de sortie du produit est court (seulement 2 jours) et les développements ultérieurs méritent l'attention, notamment le support multiplateforme et la promotion de la communauté chinoise.
Avis des utilisateurs
-
Cynthia_RodriguezII—Le traitement parallèle multi-agents, c'est une bouée de sauvetage. Avant, je jonglais entre quatre fenêtres de terminal, j'en devenais fou. Maintenant chaque agent parle avec une voix différente, je sais qui fait quoi les yeux fermés. -
LUphi—Je viens d'essayer le mode Companion de Heard. Parti me chercher un café, j'écoutais Codex refactoriser mon vieux projet en arrière-plan. En revenant, le code était corrigé et même les tests passaient. Quelle sensation géniale. -
TendermintTina54—Le mode Focus est mon préféré. Il ne jacasse pas en continu : il ne parle qu'en cas d'erreur ou quand il faut mon approbation. Avant, avec Claude Code, je perdais souvent vingt minutes parce que je n'avais pas vu l'invite de permission ; c'est fini. -
Anthony.Rogers58—J'ai testé l'appairage avec le téléphone : un scan de QR code et c'est appairé. Écran verrouillé, on entend encore les annonces, et on peut même maintenir pour parler et envoyer des consignes à l'Agent. Suivre la progression en se promenant dehors — la technologie change la vie. -
Diane_Price_77—Open source Apache-2.0 plus une offre gratuite : sincérité maximale. La voix locale Kokoro n'est pas aussi naturelle qu'ElevenLabs, mais pouvoir la faire tourner à coût zéro, c'est déjà très appréciable. -
Logan216—Heard transforme la sortie de l'Agent en voix, et cette direction est tellement juste. Tout le monde s'affaire sur l'entrée vocale, personne ne s'occupe du côté sortie. Le fondateur a raison : l'Agent répond toujours en texte qui défile, et il faut rester assis à le fixer. -
谢秀—Numéro 1 sur PH le jour même avec 330 votes : la demande existe bel et bien. Le secteur des outils développeurs est ultra-concurrentiel, décrocher la première place n'est pas facile. -
梅花_15—Hier avant de partir du travail, j'ai lancé trois Agents en même temps sur des tâches différentes — Claude Code refactorisait l'API backend, Codex écrivait des composants front-end, Cursor faisait tourner les tests. Heard annonçait la progression de chacun avec trois voix différentes : la personnalité Aria était particulièrement claire sur la partie API, et Friday racontait l'avancement du front-end d'un ton léger, impossible de les confondre. En cours de route, un Agent s'est bloqué sur une approbation de permission, et le mode Focus a aussitôt envoyé une alerte vocale ; j'ai appuyé sur approuver et c'est reparti. Au final, j'ai écouté le reste des annonces sur mon téléphone en rentrant, et en ouvrant l'ordinateur à la maison, les trois tâches étaient terminées. Une expérience que je n'aurais même pas osé imaginer avant. -
Nancy8552024—Les quatre personnalités vocales ont chacune leur caractère. J'ai essayé Friday : son style enjoué convient vraiment aux longues sessions de programmation. Le design ouvert qui permet de personnaliser la personnalité en Markdown est aussi bien pensé. -
DWhite_Pro509—Le forfait Pro est à 12 dollars par mois, avec voix et LLM hébergés, pas besoin de configurer sa propre API. Pour ceux qui ne veulent pas bricoler, c'est rentable, mais je vais d'abord rester un moment sur la version gratuite. -
goldenmouse658—Ce qui m'a le plus touché, c'est la phrase « le plus dur n'est pas le TTS, c'est de décider ce qu'il ne faut pas dire ». Soustraire est bien plus difficile qu'ajouter, et Heard filtre vraiment bien le bruit : il ne transforme pas toute la sortie du terminal en voix, il sélectionne avec discernement. -
郝玉梅—J'ai lu la discussion sur Product Hunt : les réponses du fondateur aux questions techniques étaient très franches. L'état de session reste en mémoire et sur disque en local, et le téléphone ne reçoit que l'audio, jamais l'état. Ce design de confidentialité est fiable. -
NSullivan—Je viens du projet open source claude_voice. L'expérience de Heard est bien meilleure, ce n'est pas le même niveau de produit. Ils ont vraiment réussi les « annonces avec discernement », pas une simple lecture TTS. Et l'architecture de Heard est plus légère : le daemon Python avec socket Unix est bien plus élégant que de faire tourner un service Node juste pour du TTS, avec une empreinte plus faible. -
AustinMorales168224—Le forfait Power à 24 dollars par mois est un peu cher, mais il inclut le mobile et l'approbation vocale. Quelqu'un comme moi, souvent en déplacement, en a vraiment besoin ; je vais tester un mois pour voir si ça vaut le coup. Si l'expérience mobile est assez bonne, ce prix est en fait acceptable. -
Ryan_StephensJr5—Une question : si deux Agents en parallèle rapportent des résultats contradictoires — l'un annonce que la migration a réussi, l'autre que les tests ont échoué —, comment Heard résume-t-il ça ? J'ai vu la réponse du fondateur sur PH : ils utilisent un mécanisme de reasoning-pass override. Livrer d'abord, optimiser ensuite. -
AnnMendozaII—L'architecture de Heard, daemon Python plus socket Unix, est plutôt légère et consomme peu de ressources. Bien plus propre que ces solutions emballées dans Electron. Utiliser Claude Haiku 4.5 pour réécrire la personnalité, c'est aussi très créatif. -
CHOKM0F—Les développeurs disent que Linux et Windows seront pris en charge à l'avenir, tant mieux. Ma machine principale est un Mac, mais quand j'utilise Windows de temps en temps, il faut que ça marche aussi. -
钱建晴—J'ai essayé aujourd'hui dans un café bruyant, et Heard annonçait toujours très clairement. Le bruit ambiant gênait un peu, mais la voix était assez forte : avec des AirPods, on entend parfaitement. -
TheHelenaVergara—En mode Co-pilot, il glisse un mot de temps en temps pendant que vous travaillez, sans casser le fil de la pensée. C'est comme un collègue assis à côté qui vous souffle « les tests sont passés » ou « il y a une erreur là-bas, jette un œil ». Le dosage est parfait. -
KrinHarper—J'ai fait tourner Claude Code toute une journée sur une refonte de code avec Heard, et l'expérience a dépassé mes attentes. Non seulement j'entends la progression, mais il me prévient à temps quand l'Agent bloque et attend ma décision. Comparé à l'époque où je surveillais le terminal à l'œil nu, l'efficacité a bien progressé. Le cœur open source et les trois niveaux de tarification laissent aussi assez de choix aux utilisateurs. -
春雨_5—J'attendais depuis longtemps un outil qui transforme la sortie de l'Agent en voix, et quelqu'un l'a enfin fait. Ce qui m'inquiète un peu, c'est que le domaine heard.app pointe vers un produit de technologie auditive qui n'a rien à voir avec ce Heard — ça peut prêter à confusion. J'espère que l'équipe réglera vite cette question de domaine. -
梅花40—Avec le TTS cloud d'ElevenLabs, le rendu est effectivement très naturel. Mais le Kokoro local suffit largement et économise les frais d'API. Chacun ses compromis. -
流年393—L'auto-hébergement, c'est top : tout tourne en local, le code et les données ne quittent pas la machine. Pour les projets soumis à des exigences de conformité, cette architecture compte beaucoup. Le fait que le mobile ne transmette que l'audio et jamais l'état est aussi rassurant. -
TerryGonzalezQ8—La pression concurrentielle est là : le mode /voice officiel de Claude Code d'Anthropic est déjà sorti, et VoiceMode MCP progresse aussi. J'espère que Heard gardera son avance technique et ne se fera pas écraser par les géants. Cela dit, Heard fait de l'annonce vocale côté sortie, alors que l'officiel fait de l'entrée vocale : ce sont des pistes différentes, plus complémentaires que concurrentes. -
nty8ahuejt—Une fois installé, on change de mode directement depuis la barre de menus, sans redémarrer ni taper de commande. Ce design d'interaction est très Mac. En tant qu'utilisateur de l'écosystème Apple, je trouve ça très confortable. -
8domk0e_i3j—Un détail : le bouton Verbosity de Heard permet de régler finement la quantité d'annonces, du commentaire complet jusqu'aux erreurs seulement. En travail parallèle, un résumé au niveau du projet vaut bien mieux que d'écouter cinq terminaux se superposer. Je conseille à tout développeur qui utilise Claude Code d'essayer. -
夏明—Ces derniers jours, j'utilise Heard avec Cursor pour écrire du front-end, et c'est un vrai plaisir. J'ajuste les styles tout en écoutant l'Agent rapporter son état, sans faire des allers-retours entre les écrans. La productivité a bien augmenté, surtout que je n'ai plus à attendre les bras croisés pendant les tests. -
LucaKumar—L'absence de prise en charge de Windows et Linux est clairement un point faible. J'espère que le plan multiplateforme de la feuille de route se concrétisera vite, sinon les collègues de l'équipe qui utilisent des systèmes différents ne pourront pas s'aligner dessus.