Heard
Camada de voz para macOS que transforma a saída de terminal do Claude Code, Codex e Cursor em resumos de voz inteligentes
Relatório detalhado
-
Heard é uma camada de fala do macOS projetada para fluxos de trabalho de agentes de programação de IA. Ele conecta Claude Code, OpenAI Codex e Cursor para converter a saída do terminal em resumos de fala inteligentes. Foi lançado no Product Hunt em 25 de julho de 2026 e ficou em primeiro lugar no dia (339 votos, 91 comentários). É de código aberto (Apache-2.0) e gratuito para indivíduos. A ideia central é “transmitir com julgamento” – não simplesmente converter texto em fala, mas distinguir o que deve ser dito e o que deve ser ignorado.
-
Kelly (@itskellysun), o fundador da Heard, disse isso no Product Hunt: "Todo mundo tem tentado facilitar a conversa com o agente nos últimos dois anos - entrada de voz, melhores prompts, melhor contexto. Mas ninguém está fazendo a outra metade. A resposta do agente ainda é rolar o texto que você precisa sentar e olhar. Heard é essa metade." A julgar pela linha do tempo, Heard lançou uma versão inicial na comunidade já em 1º de maio de 2026 e, em seguida, entrou no campo de visão da mídia tecnológica inglesa, como AI Untethered. Após o lançamento oficial no Product Hunt em 25 de julho, recebeu 339 votos e 91 comentários, ficando em primeiro lugar naquele dia. Atualmente, o produto está na fase inicial de rápido crescimento e não há nenhum relatório especial da mídia tecnológica chinesa (36Kr, Minoria, etc.). É importante notar que o nome de domínio listen.app atualmente aponta para um produto de tecnologia de aparelho auditivo completamente diferente, e a entrada real do site oficial da Heard é atualmente acessada principalmente através da página Product Hunt. O produto usa um daemon Python com comunicação de soquete Unix, o mecanismo TTS suporta ElevenLabs (nuvem) e Kokoro (local) e usa Claude Haiku 4.5 para lidar com a reescrita de personalidade.
-
O mecanismo central de Heard é o "relatório de julgamento", que é um sistema de tomada de decisão de duas camadas. A primeira camada é chamada de sinais físicos: solicitações de permissão, falhas de chamadas de ferramentas, conclusões de execução - sempre acionam transmissões de voz. A segunda camada é a camada sensível ao contexto: ela rastreia o histórico de conversas, determina qual conteúdo vale a pena ser dito e ignora informações redundantes. O produto oferece três modos de monitoramento. O modo copiloto fornece avisos curtos enquanto você trabalha, sem lê-los literalmente; O modo Companion fornece instruções de voz mais completas quando você está longe da tela; O modo Focus permanece silencioso e só fala quando sua intervenção é necessária (aprovação, bloqueio, falha). O processamento paralelo multiagente é o ponto de venda exclusivo da Heard. Quando várias sessões de IA (Claude Code, Codex, Cursor) estão sendo executadas ao mesmo tempo, Heard não possui cinco terminais sobrepostos, mas é resumido no nível do projeto, e cada agente usa um som diferente, permitindo distinguir quem está fazendo o quê de ouvido. A função de emparelhamento do telefone móvel (Heard Power) é concluída através de um código QR único. Após o emparelhamento, você poderá ouvir a transmissão em tempo real mesmo quando a tela estiver bloqueada. Ele também suporta pressionar e segurar ou clicar para falar para enviar instruções ao agente inteligente. O emparelhamento do escopo e o desemparelhamento automático garantem a segurança. O sistema de personalidade de voz também é muito sofisticado. Existem quatro personalidades integradas: Aria (calma e direta), Friday (brilhante e animada), Jarvis (calmo e espirituoso, padrão) e Atlas (dramático). Você também pode personalizar sua personalidade usando arquivos Markdown. Em termos de privacidade, o mecanismo principal é de código aberto Apache-2.0 e totalmente auto-hospedado de forma nativa. O estado da sessão é armazenado apenas na memória local e no disco, e não na rede. O celular transmite apenas áudio e não transmite o status da sessão.
-
Heard tem três níveis de preços. O plano Gratuito é permanentemente gratuito e inclui vozes nativas de Kokoro, IA integrada e teclas de voz, personalidades personalizadas e teclas de atalho, e é baseado em um mecanismo de código aberto. O plano Pro custa US $ 12 por mês (pago anualmente) e oferece voz gerenciada e LLM (nenhuma configuração necessária), relatórios durante todo o dia, personalidades premium (Atlas e sexta-feira) e sincronização em nuvem entre Mac. O plano Power custa US$ 24 por mês (pago anualmente) e inclui todos os recursos do Pro plus Heard mobile, reconhecimento de fala otimizado por código e aprovação de voz e recursos de agente de redirecionamento. Os planos de hospedagem exigem macOS 13 ou superior. Esta estratégia de preços é mais razoável: a versão gratuita permite que desenvolvedores individuais experimentem e avaliem com baixo custo, a versão Pro atende às necessidades dos usuários que não querem mexer sozinhos na configuração da API e a versão Power é voltada para usuários pesados e cenários de escritório móvel.
-
O feedback da comunidade Product Hunt foi geralmente positivo. O usuário Wes Carlson comentou: "Executar o agente em paralelo faz com que a separação de sinais físicos e o reconhecimento de contexto pareçam uma escolha central de design, em vez de apenas um recurso de notificação." Dogan Akbulut disse: "Sempre sinto falta do momento em que o agente está aguardando solicitações de permissão, perdendo 20 minutos. Adoro esse modo quase silencioso." Noctis Leonard acredita que o botão Verbosidade e o resumo em nível de projeto são a infraestrutura certa para trabalhar em paralelo. Muitos usuários também fizeram boas perguntas. Gal Dayan está preocupada em saber como Heard decide o que vale a pena dizer quando vários agentes paralelos estão executando tarefas diferentes. Outros perguntaram sobre o mecanismo de interrupção de voz, o local de armazenamento do status da conversa, etc. O fundador respondeu a essas questões técnicas na área de comentários e foi bastante sincero.
-
Em termos de mídia tecnológica inglesa, AI Untethered relatou pela primeira vez sobre Heard em 1º de maio, citando o fundador: “A parte mais difícil não é o TTS, mas decidir o que não dizer”. daily.dev também fez uma introdução após o lançamento do PH, com foco nos princípios técnicos do sistema de tomada de decisão de duas camadas. Agregadores de ferramentas como AIToolly e AIDeckly fornecem recursos completos e informações sobre preços. Do ponto de vista da indústria, Heard preenche uma lacuna negligenciada. A maioria das ferramentas de programação de IA concentra-se apenas na “entrada” – como o usuário fala com o agente. A questão de como o agente “envia” isso para o usuário nunca foi levada a sério. Foi esse problema de saída que Heard escolheu resolver. No contexto da crescente popularidade dos agentes de programação de IA, há de fato uma demanda por essa direção de “interação homem-computador que prioriza o áudio”. No entanto, atualmente não há quase nenhuma reportagem na mídia chinesa sobre Heard. Isso pode estar relacionado ao fato de o produto ser difundido apenas na comunidade inglesa e o nome de domínio do site oficial apontar para outro produto.
-
Atualmente não há disputas significativas ou riscos legais para Heard. Mas existem vários problemas potenciais aos quais vale a pena prestar atenção. A primeira é a separação entre o posicionamento do produto e o nome de domínio - listen.app aponta para tecnologia de aparelhos auditivos em vez de produtos de camada de voz de IA, o que pode causar confusão ao usuário e também afetar a aquisição natural de tráfego. Em segundo lugar, há pressão competitiva sobre o produto: o modo oficial Claude Code/voz da Anthropic foi lançado, e alternativas de código aberto, como o VoiceMode MCP, também continuam a se desenvolver. Heard precisa estabelecer barreiras técnicas suficientes. O terceiro é o preço. O plano Power de US$ 24 não é caro no campo das ferramentas de IA, mas se os principais produtos concorrentes forem de código aberto e gratuitos, ele precisa continuar a provar o valor único das funções pagas.
-
Heard é mais adequado para três tipos de pessoas. A primeira categoria são os desenvolvedores individuais que usam Claude Code ou Codex diariamente, especialmente aqueles que não querem ficar presos a um terminal o tempo todo. A segunda categoria são os desenvolvedores que trabalham em cenários remotos ou móveis e podem usar seu tempo de deslocamento e caminhada para acompanhar o progresso do agente. A terceira categoria são os usuários pesados que executam vários agentes ao mesmo tempo e precisam de um resumo no nível do projeto, em vez de alternar entre vários terminais. As pessoas que não são adequadas incluem: desenvolvedores que usam Windows ou Linux (ainda sem suporte, mas os planos oficiais de plataforma cruzada foram confirmados), desenvolvedores que não precisam de feedback de voz e usuários que usam agentes de programação de IA com menos frequência. Se você não precisa da experiência nativa do macOS, o VoiceMode MCP ou o modo /voice integrado do Claude Code pode ser usado como alternativa.
-
Heard resolve um problema real, mas facilmente esquecido: a experiência do lado da saída dos agentes programados por IA. O design do produto é pensado em profundidade, desde a tomada de decisão em duas camadas com reconhecimento de sinal/contexto até o timbre independente de multiagentes, e a compreensão do fluxo de trabalho real pode ser vista em cada ponto de função. O núcleo de código aberto e a estratégia de preços de três níveis também oferecem aos usuários opções flexíveis. O tempo de lançamento do produto é curto (apenas 2 dias), e os desenvolvimentos subsequentes merecem atenção, especialmente o suporte multiplataforma e a promoção da comunidade chinesa.
Avaliações de usuários
-
Cynthia_RodriguezII—O processamento paralelo multiagente é um salva-vidas. Antes eu alternava entre quatro janelas de terminal e ficava maluco. Agora cada agente fala com uma voz diferente e, de olhos fechados, sei quem está fazendo o quê. -
LUphi—Acabei de testar o modo Companion do Heard. Saí da mesa para pegar um café ouvindo o Codex refatorar aquele projeto antigo em segundo plano. Quando voltei, o código estava pronto e até os testes passaram. Que sensação boa. -
TendermintTina54—O modo Focus é meu favorito. Não fica tagarelando o tempo todo — só fala quando dá erro ou quando precisa da minha aprovação. Antes, com o Claude Code, eu perdia vinte minutos à toa por não ver um aviso de permissão; agora não mais. -
Anthony.Rogers58—Testei o pareamento com o celular: um scan de QR code e pronto. Com a tela bloqueada ainda dá para ouvir os anúncios, e dá até para segurar e falar para mandar comandos ao Agent. Acompanhar o progresso enquanto caminho na rua — a tecnologia muda a vida. -
Diane_Price_77—Open source Apache-2.0 mais plano gratuito: sinceridade nota dez. A voz local do Kokoro não é tão natural quanto a ElevenLabs, mas rodar a custo zero já é uma baita vantagem. -
Logan216—O Heard transformar a saída do Agent em voz é a direção certíssima. Todo mundo está ocupado com entrada de voz e ninguém cuida do lado da saída. O fundador tem razão: o Agent ainda responde em texto rolando, e você precisa ficar sentado olhando. -
谢秀—Primeiro lugar no PH no mesmo dia, com 330 votos — prova de que a demanda existe mesmo. O segmento de ferramentas para desenvolvedores é competitivo demais; chegar ao topo não é fácil. -
梅花_15—Ontem, antes de sair do trabalho, rodei três Agents ao mesmo tempo em tarefas diferentes — Claude Code refatorando a API do backend, Codex escrevendo componentes de front-end e Cursor rodando testes. O Heard anunciava o progresso de cada um com três vozes diferentes: a personalidade Aria explicava a parte da API com clareza especial, e a Friday narrava o avanço do front-end num tom animado — impossível confundir. No meio do caminho, um Agent travou numa aprovação de permissão e o modo Focus mandou na hora um aviso de voz; toquei em aprovar e ele continuou. No fim, ouvi o resto dos anúncios no celular a caminho de casa, e quando abri o computador, as três tarefas estavam concluídas. Uma experiência que antes eu nem conseguia imaginar. -
Nancy8552024—As quatro personalidades de voz têm cada uma seu charme. Testei a Friday, e o estilo leve realmente combina com longas sessões de programação. O design aberto de personalizar a personalidade com Markdown também é bem pensado. -
DWhite_Pro509—O plano Pro custa 12 dólares por mês, com voz e LLM hospedados, sem precisar configurar sua própria API. Para quem não quer se complicar, compensa bastante, mas eu vou rodar a versão gratuita por um tempo primeiro. -
goldenmouse658—O que mais me tocou foi a frase "o mais difícil não é o TTS, é decidir o que não dizer". Subtrair é muito mais difícil que somar, e o Heard filtra o ruído muito bem: não transforma toda a saída do terminal em voz, ele seleciona com discernimento. -
郝玉梅—Li a discussão no Product Hunt e as respostas do fundador às perguntas técnicas foram bem francas. O estado da sessão fica na memória e no disco locais, e o celular recebe apenas áudio, nunca o estado. Esse design de privacidade é confiável. -
NSullivan—Migrei do projeto open source claude_voice. A experiência do Heard é muito melhor — nem é produto do mesmo nível. Eles realmente entregaram os "anúncios com discernimento", não é só leitura TTS simples. Além disso, a arquitetura do Heard é mais leve: a abordagem de daemon Python com socket Unix é muito mais elegante do que rodar um serviço Node só para TTS, e consome menos recursos. -
AustinMorales168224—O plano Power a 24 dólares por mês é um pouco salgado, mas inclui o mobile e a aprovação por voz. Para alguém como eu, que vive na rua, é realmente necessário; vou testar por um mês para ver se vale. Se a experiência no celular for boa o bastante, o preço até que é aceitável. -
Ryan_StephensJr5—Uma dúvida: se dois Agents em paralelo reportarem resultados contraditórios — um diz que a migração deu certo, o outro que os testes falharam —, como o Heard resume isso? Vi a resposta do fundador no PH: usam um mecanismo de reasoning-pass override; lançar primeiro, otimizar depois. -
AnnMendozaII—A arquitetura do Heard com daemon Python e socket Unix é bem leve, com baixo consumo de recursos. Muito mais limpa que aquelas soluções embrulhadas em Electron. Usar o Claude Haiku 4.5 para reescrever a personalidade também é bem criativo. -
CHOKM0F—Os desenvolvedores disseram que vão dar suporte a Linux e Windows no futuro — ótimo. Minha máquina principal é um Mac, mas quando uso Windows de vez em quando também preciso que funcione. -
钱建晴—Hoje testei num café barulhento e o Heard continuou anunciando com clareza. O som ambiente atrapalhava um pouco, mas a voz em si era alta o suficiente — com AirPods dava para ouvir perfeitamente. -
TheHelenaVergara—No modo Co-pilot ele solta um comentário de vez em quando enquanto você trabalha, sem interromper o raciocínio. É como ter um colega do lado dizendo baixinho "os testes passaram" ou "tem um erro ali, dá uma olhada". A dosagem está no ponto certo. -
KrinHarper—Rodei o Claude Code refatorando uma base de código o dia inteiro com o Heard, e a experiência superou as expectativas. Além de ouvir o progresso, ele me avisa na hora quando o Agent trava e precisa da minha decisão. Comparado a vigiar o terminal no olho como antes, a eficiência subiu bastante. O núcleo open source com três faixas de preço também dá bastante escolha ao usuário. -
春雨_5—Sempre esperei uma ferramenta que transformasse a saída do Agent em voz, e finalmente alguém fez. Só me preocupa um pouco o domínio heard.app apontar para um produto de tecnologia auditiva que não tem nada a ver com este Heard — pode confundir as pessoas. Espero que a equipe resolva logo a questão do domínio. -
梅花40—Se usar o TTS na nuvem da ElevenLabs, o resultado é realmente muito natural. Mas o Kokoro local também dá conta e economiza o custo de API. Cada um com seus trade-offs. -
流年393—Self-hosting é excelente: tudo roda localmente, código e dados não saem da máquina. Para projetos com exigências de compliance, esse desenho de arquitetura é muito importante. A abordagem do celular de transmitir apenas áudio, sem estado, também tranquiliza. -
TerryGonzalezQ8—A pressão competitiva é visível: o modo /voice oficial do Claude Code da Anthropic já saiu, e o VoiceMode MCP também está evoluindo. Espero que o Heard mantenha sua vantagem técnica e não seja esmagado pelas gigantes. Dito isso, o Heard faz anúncios de voz no lado da saída, enquanto o recurso oficial é entrada de voz — são trilhas diferentes, mais complementares do que concorrentes. -
nty8ahuejt—Depois de instalar, dá para trocar de modo direto na barra de menus, sem reiniciar nem digitar comandos. Esse design de interação é bem estilo Mac. Como usuário do ecossistema Apple, acho muito confortável. -
8domk0e_i3j—Um detalhe: o botão de Verbosity do Heard permite ajustar com precisão o volume de anúncios, desde a narração completa até apenas os erros. Trabalhando em paralelo, um resumo no nível do projeto é muito melhor do que ouvir cinco terminais se sobrepondo. Recomendo que todo desenvolvedor que usa Claude Code experimente. -
夏明—Nestes últimos dias usei o Heard junto com o Cursor para escrever front-end, e é ótimo. Ajusto estilos enquanto ouço o Agent reportar o status, sem ficar alternando de tela. A produtividade subiu bastante, principalmente porque não preciso mais ficar esperando à toa enquanto os testes rodam. -
LucaKumar—A falta de suporte a Windows e Linux é de fato um ponto fraco. Espero que o plano multiplataforma do roadmap saia logo do papel; senão, os colegas da equipe que usam sistemas diferentes não conseguem padronizar o uso.