Heard
macOS 语音层,将 Claude Code、Codex 和 Cursor 的终端输出转化为智能语音摘要
深度报告
-
Heard 是一个 macOS 语音层,专为 AI 编程智能体工作流设计。它连接 Claude Code、OpenAI Codex 和 Cursor,把终端输出转化为智能语音摘要。2026 年 7 月 25 日在 Product Hunt 上线即拿下当日第一(339 票、91 条评论),开源(Apache-2.0),个人免费。核心思路是「有判断力地播报」——不是简单地把文本转语音,而是区分什么该说、什么该跳过。
-
Heard 的创始人 Kelly(@itskellysun)在 Product Hunt 上这样说:「过去两年大家都在努力让跟智能体说话变得更容易——语音输入、更好的提示、更好的上下文。但没人做另一半。智能体的回答仍然是滚动的文本,你必须坐着盯着看。Heard 就是那一半。」 从时间线来看,Heard 最早在 2026 年 5 月 1 日就在社区发布了早期版本,接着进入了 AI Untethered 等英文科技媒体的视野。7 月 25 日正式登陆 Product Hunt 后获得了 339 票和 91 条评论,当天排名第一。目前产品处于早期快速增长阶段,还没有中文科技媒体(36氪、少数派等)的专门报道。 值得注意的是,heard.app 这个域名当前指向的是一款完全不同的助听技术产品,Heard 的实际官网入口目前主要是通过 Product Hunt 页面访问。产品采用 Python 守护进程配合 Unix socket 通信,TTS 引擎支持 ElevenLabs(云端)和 Kokoro(本地),并用 Claude Haiku 4.5 处理人格改写。
-
Heard 的核心机制是「有判断力的播报」,也就是两层决策系统。第一层叫硬信号:权限请求、工具调用失败、运行完成——这些始终触发语音播报。第二层是上下文感知层:跟踪会话历史,判断哪些内容值得说出口,跳过冗余信息。 产品提供三种监听模式。Co-pilot(副驾驶)模式在你工作时给出简短提示,不会逐字播报;Companion(伴侣)模式在你离开屏幕时提供更完整的语音简报;Focus(专注)模式保持静默,只在需要你干预时(审批、阻塞、失败)才发声。 多智能体并行处理是 Heard 的独特卖点。当多个 AI 会话(Claude Code、Codex、Cursor)同时运行时,Heard 不是让五个终端互相叠加,而是在项目级别做汇总,每个智能体使用不同的声音,让你凭耳朵就能区分谁在做什么。 手机配对功能(Heard Power)通过一次性二维码完成。配对后锁屏状态也能实时收听播报,还支持按住或点击说话来向智能体发送指令。作用域配对和自动解除配对保证了安全性。 语音人格系统也做得挺讲究。内置四种人格:Aria(冷静直接)、Friday(轻快活泼)、Jarvis(沉稳诙谐,默认)、Atlas(戏剧化)。你也可以用 Markdown 文件自定义人格。 在隐私方面,核心引擎是 Apache-2.0 开源且可完全本地自托管。会话状态仅存储在本地内存和磁盘,不经过网络。手机端仅传输音频,不传输会话状态。
-
Heard 采用三层定价。Free 方案永久免费,包含本地 Kokoro 语音、自带 AI 和语音密钥、自定义人格和热键,基于开源引擎。Pro 方案每月 12 美元(年付),提供托管语音和 LLM(无需自行配置)、全天播报、高级人格(Atlas 和 Friday)以及跨 Mac 云同步。Power 方案每月 24 美元(年付),包含 Pro 所有功能,再加上 Heard 手机端、代码优化的语音识别以及语音审批和重定向智能体功能。托管方案要求 macOS 13 或更高版本。 这种定价策略比较合理:免费版让个人开发者能低成本试用和评估,Pro 版解决了不想自己折腾 API 配置的用户需求,Power 版则针对重度用户和移动办公场景。
-
Product Hunt 社区的反馈整体积极。用户 Wes Carlson 评价:「并行运行智能体使得硬信号与上下文感知的分割感觉像是核心设计选择,而不仅仅是一个通知功能。」Dogan Akbulut 说:「我总是错过智能体在等待权限提示的时刻,白白浪费 20 分钟。喜欢这种接近静默的模式。」Noctis Leonard 认为 Verbosity 旋钮和项目级摘要是并行工作的正确基础设施。 也有不少用户提出了很好的问题。Gal Dayan 关心当几个并行智能体分别跑不同任务时,Heard 如何决定什么值得说出口。还有人询问语音打断机制、会话状态的存储位置等。创始人在评论区回应了这些技术问题,态度挺坦诚。
-
英文科技媒体方面,AI Untethered 最早在 5 月 1 日就报道了 Heard,引用了创始人的话:「最难的部分不是 TTS,而是决定什么不该说。」daily.dev 在 PH 发布后也做了介绍,聚焦于两层决策系统的技术原理。AIToolly 和 AIDeckly 等工具聚合站提供了完整的功能和定价信息。 从行业角度看,Heard 填补了一个被忽略的空白。大多数 AI 编程工具只关注「输入」——用户怎么跟智能体说话。智能体怎么「输出」给用户这个问题,一直没被认真对待。Heard 选择解决的就是这个输出端问题。在 AI 编程智能体日益普及的背景下,这种「音频优先的人机交互」方向确实有需求。 不过目前 Heard 的中文媒体报道几乎为零,这可能跟产品只在英文社区传播、以及官网域名指向另一个产品有一定关系。
-
目前 Heard 还没有出现明显的争议或法律风险。但有几个潜在问题值得关注。首先是产品定位和域名的割裂——heard.app 指向助听技术而不是 AI 语音层产品,这可能造成用户困惑,也会影响自然流量获取。其次是竞品压力:Anthropic 官方的 Claude Code /voice 模式已经上线,VoiceMode MCP 等开源替代方案也在持续发展,Heard 需要建立足够的技术壁垒。第三是定价方面,24 美元的 Power 方案在 AI 工具领域不算贵,但如果主要竞品都是开源免费的,需要持续证明付费功能的独特价值。
-
Heard 最适合三类人。第一类是日常使用 Claude Code 或 Codex 的个人开发者,特别是不想一直被绑在终端前面的人。第二类是在远程或移动场景中工作的开发者,可以利用通勤、散步的时间跟进智能体的进度。第三类是同时跑多个智能体的重度用户,需要项目级汇总而不是各个终端来回切换。 不太适合的人群包括:使用 Windows 或 Linux 的开发者(暂不支持,但官方已确认跨平台计划)、不需要语音反馈的开发者、以及对 AI 编程智能体使用频率较低的用户。 如果不需要 macOS 原生体验,VoiceMode MCP 或 Claude Code 自带的 /voice 模式可以作为替代方案。
-
Heard 解决了一个真实但容易被忽视的问题——AI 编程智能体的输出端体验。产品设计思考得比较深入,从硬信号/上下文感知的两层决策到多智能体独立音色,每个功能点都能看到对实际工作流的理解。开源核心、三层定价的策略也给了用户灵活的选择空间。产品发布时间很短(仅 2 天),后续发展值得关注,尤其是跨平台支持和中文社区的推广。
用户评论
-
Cynthia_RodriguezII—多智能体并行处理这个功能真是救命。以前四个终端窗口来回切,头都大了。现在每个 Agent 用不同的声音说话,闭着眼睛都知道谁在干嘛。 -
LUphi—刚试了 Heard 的 Companion 模式,离开工位去倒咖啡,全程听着 Codex 在后台帮我重构那个老项目。回来一看代码都改好了,连测试都过了。这感觉太爽了。 -
TendermintTina54—Focus 模式是我最喜欢的。不会一直唠叨,只有出错或者需要我批准的时候才说话。之前用 Claude Code 经常因为没看到权限提示白白等二十分钟,现在不会了。 -
Anthony.Rogers58—手机配对功能试了一下,QR 码一扫就配对上了。锁屏状态下还能听到播报,甚至可以按住说话给 Agent 发指令。在外面散步也能跟进度,科技改变生活。 -
Diane_Price_77—开源 Apache-2.0 加免费方案,诚意满分。本地 Kokoro 语音虽然没 ElevenLabs 那么自然,但零成本能跑起来已经很香了。 -
Logan216—Heard 把 Agent 的输出转成语音,这个方向太对了。大家都忙着做语音输入,没人管输出端。创始人说得对,Agent 回答的仍然是滚动的文本,你必须坐着盯着看。 -
谢秀—当天 PH 第一,330 票,说明需求确实存在。开发者工具这个赛道太卷了,能拿到第一不容易。 -
梅花_15—昨天下班前同时跑了三个 Agent 做不同事情——Claude Code 重构后端 API、Codex 写前端组件、Cursor 跑测试。Heard 用三种不同的声音播报各自进度,Aria 人格讲 API 那部分特别清晰,Friday 人格播前端进度的时候语气轻快,完全不会搞混。中途有个 Agent 卡在权限审批上,Focus 模式立刻切了条语音过来提醒,我点了批准继续跑。最后在回家路上掏出手机听完了全部播报,到家打开电脑一看,三个任务全完成了。这种体验以前想都不敢想。 -
Nancy8552024—四个语音人格各有特色,我试了 Friday,轻快的风格确实适合长时间编程。用 Markdown 自定义人格这个开放设计也很有想法。 -
DWhite_Pro509—Pro 方案 12 美元一个月,托管语音和 LLM 不用自己配 API。对于不想折腾的人来说挺划算的,但我先用免费版跑一阵再说。 -
goldenmouse658—最打动我的是那句「最难的不是 TTS,而是决定什么不该说」。做减法比做加法难多了,Heard 在过滤噪音这块做得确实不错,不是简单把终端输出全部转成语音,而是有判断力地筛选。 -
郝玉梅—看了 Product Hunt 上的讨论,创始人对技术问题的回复很坦诚。会话状态存在本地内存和磁盘,手机端只传音频不传状态,这个隐私设计很靠谱。 -
NSullivan—我是从 claude_voice 那个开源项目转过来的。Heard 的体验好太多了,不是一个级别的产品。人家是真把「有判断力的播报」做出来了,不只是简单的 TTS 朗读。而且 Heard 的架构设计更轻量,Python daemon 加 Unix socket 的方案比那些跑个 Node 服务来做 TTS 的优雅太多了,资源占用也小。 -
AustinMorales168224—Power 方案 24 美元月付有点小贵,但包含了移动端和语音审批功能。我这种经常在外面跑的人确实需要,先试用一个月看看值不值。如果手机端体验足够好,这个价其实也能接受。 -
Ryan_StephensJr5—有个疑问,如果两个并行 Agent 一个报告迁移成功、另一个测试失败,Heard 怎么汇总这种矛盾的结果?看到了创始人在 PH 上的回复,用的是 reasoning-pass override 机制,先发货后优化。 -
AnnMendozaII—Heard 的 Python daemon 加 Unix socket 架构挺轻量的,资源占用不大。比那些 Electron 套壳的方案清爽多了。Claude Haiku 4.5 做人格改写这个用法也很有创意。 -
CHOKM0F—听开发者说未来会支持 Linux 和 Windows,那太好了。我现在主力机是 Mac,但偶尔用 Windows 的时候也得能用上啊。 -
钱建晴—今天在嘈杂的咖啡馆试了一下,Heard 还是播报得很清楚。虽然环境音有点干扰,但语音本身够响亮,戴着 AirPods 完全能听清。 -
TheHelenaVergara—Co-pilot 模式工作的时候偶尔插一句,不会打断思路。就像有个同事坐在旁边轻声提醒你「测试通过了」「那边有个报错你看看」。这个度掌握得刚刚好。 -
KrinHarper—用 Heard 跑了一整天 Claude Code 重构代码库,体验超出预期。不仅能听到进度,还能在 Agent 卡住需要我决策的时候及时提醒。对比之前靠肉眼盯终端的模式,效率提升了不少。开源核心加三层定价也给了用户足够的选择空间。 -
春雨_5—一直在等一个能把 Agent 输出变成声音的工具,终于有人做了。不过我有点担心 heard.app 那个域名指向的是助听技术产品,跟这个 Heard 不是一回事,会让人困惑。希望团队能尽快解决好域名问题。 -
梅花40—如果用 ElevenLabs 的云端 TTS,效果确实很自然。不过本地 Kokoro 也够用了,省了 API 费用。各有取舍吧。 -
流年393—自托管很香,全部本地运行,代码和数据不出机器。对于有合规要求的项目来说,这个架构设计很重要。手机端仅传音频不传状态的方案也让人放心。 -
TerryGonzalezQ8—看到了竞品压力,Anthropic 官方 Claude Code /voice 模式已经上了,VoiceMode MCP 也在发展。希望 Heard 能保持技术优势,别被大厂卷死了。不过话说回来,Heard 做的是输出端语音播报,跟官方的语音输入是不同赛道,互补大于竞争吧。 -
nty8ahuejt—装好之后从菜单栏就能切模式,不用重启不用敲命令,这交互设计挺 mac 的。苹果生态用户表示很舒服。 -
8domk0e_i3j—说个细节,Heard 的 Verbosity 旋钮可以精细调节播报量,从完整解说一路调到只报错误。并行工作的时候项目级摘要比听五个终端互相叠加强太多了。建议每个用 Claude Code 的开发者都试试。 -
夏明—这两天用 Heard 配合 Cursor 写前端,很爽。一边调样式一边听 Agent 汇报状态,不用来回切屏幕。生产效率提升了不少,特别是跑测试的时候不用干等了。 -
LucaKumar—不支持 Windows 和 Linux 确实是短板,希望路线图上的跨平台计划能快点落地。不然团队里用不同系统的同事就没法统一用了。