Heard
macOS 語音層,將 Claude Code、Codex 和 Cursor 的終端輸出轉化為智慧語音摘要
深度報告
-
Heard 是一個 macOS 語音層,專為 AI 程式設計智慧體工作流設計。它連線 Claude Code、OpenAI Codex 和 Cursor,把終端輸出轉化為智慧語音摘要。2026 年 7 月 25 日在 Product Hunt 上線即拿下當日第一(339 票、91 條評論),開源(Apache-2.0),個人免費。核心思路是「有判斷力地播報」——不是簡單地把文字轉語音,而是區分什麼該說、什麼該跳過。
-
Heard 的創始人 Kelly(@itskellysun)在 Product Hunt 上這樣說:「過去兩年大家都在努力讓跟智慧體說話變得更容易——語音輸入、更好的提示、更好的上下文。但沒人做另一半。智慧體的回答仍然是滾動的文字,你必須坐著盯著看。Heard 就是那一半。」 從時間線來看,Heard 最早在 2026 年 5 月 1 日就在社群釋出了早期版本,接著進入了 AI Untethered 等英文科技媒體的視野。7 月 25 日正式登陸 Product Hunt 後獲得了 339 票和 91 條評論,當天排名第一。目前產品處於早期快速增長階段,還沒有中文科技媒體(36氪、少數派等)的專門報道。 值得注意的是,heard.app 這個域名當前指向的是一款完全不同的助聽技術產品,Heard 的實際官網入口目前主要是透過 Product Hunt 頁面訪問。產品採用 Python 守護程序配合 Unix socket 通訊,TTS 引擎支援 ElevenLabs(雲端)和 Kokoro(本地),並用 Claude Haiku 4.5 處理人格改寫。
-
Heard 的核心機制是「有判斷力的播報」,也就是兩層決策系統。第一層叫硬訊號:許可權請求、工具呼叫失敗、執行完成——這些始終觸發語音播報。第二層是上下文感知層:跟蹤會話歷史,判斷哪些內容值得說出口,跳過冗餘資訊。 產品提供三種監聽模式。Co-pilot(副駕駛)模式在你工作時給出簡短提示,不會逐字播報;Companion(伴侶)模式在你離開螢幕時提供更完整的語音簡報;Focus(專注)模式保持靜默,只在需要你干預時(審批、阻塞、失敗)才發聲。 多智慧體並行處理是 Heard 的獨特賣點。當多個 AI 會話(Claude Code、Codex、Cursor)同時執行時,Heard 不是讓五個終端互相疊加,而是在專案級別做彙總,每個智慧體使用不同的聲音,讓你憑耳朵就能區分誰在做什麼。 手機配對功能(Heard Power)透過一次性二維碼完成。配對後鎖屏狀態也能實時收聽播報,還支援按住或點選說話來向智慧體傳送指令。作用域配對和自動解除配對保證了安全性。 語音人格系統也做得挺講究。內建四種人格:Aria(冷靜直接)、Friday(輕快活潑)、Jarvis(沉穩詼諧,預設)、Atlas(戲劇化)。你也可以用 Markdown 檔案自定義人格。 在隱私方面,核心引擎是 Apache-2.0 開源且可完全本地自託管。會話狀態僅儲存在本地記憶體和磁碟,不經過網路。手機端僅傳輸音訊,不傳輸會話狀態。
-
Heard 採用三層定價。Free 方案永久免費,包含本地 Kokoro 語音、自帶 AI 和語音金鑰、自定義人格和熱鍵,基於開源引擎。Pro 方案每月 12 美元(年付),提供託管語音和 LLM(無需自行配置)、全天播報、高階人格(Atlas 和 Friday)以及跨 Mac 雲同步。Power 方案每月 24 美元(年付),包含 Pro 所有功能,再加上 Heard 手機端、程式碼最佳化的語音識別以及語音審批和重定向智慧體功能。託管方案要求 macOS 13 或更高版本。 這種定價策略比較合理:免費版讓個人開發者能低成本試用和評估,Pro 版解決了不想自己折騰 API 配置的使用者需求,Power 版則針對重度使用者和移動辦公場景。
-
Product Hunt 社群的反饋整體積極。使用者 Wes Carlson 評價:「並行執行智慧體使得硬訊號與上下文感知的分割感覺像是核心設計選擇,而不僅僅是一個通知功能。」Dogan Akbulut 說:「我總是錯過智慧體在等待許可權提示的時刻,白白浪費 20 分鐘。喜歡這種接近靜默的模式。」Noctis Leonard 認為 Verbosity 旋鈕和專案級摘要是並行工作的正確基礎設施。 也有不少使用者提出了很好的問題。Gal Dayan 關心當幾個並行智慧體分別跑不同任務時,Heard 如何決定什麼值得說出口。還有人詢問語音打斷機制、會話狀態的儲存位置等。創始人在評論區回應了這些技術問題,態度挺坦誠。
-
英文科技媒體方面,AI Untethered 最早在 5 月 1 日就報道了 Heard,引用了創始人的話:「最難的部分不是 TTS,而是決定什麼不該說。」daily.dev 在 PH 釋出後也做了介紹,聚焦於兩層決策系統的技術原理。AIToolly 和 AIDeckly 等工具聚合站提供了完整的功能和定價資訊。 從行業角度看,Heard 填補了一個被忽略的空白。大多數 AI 程式設計工具只關注「輸入」——使用者怎麼跟智慧體說話。智慧體怎麼「輸出」給使用者這個問題,一直沒被認真對待。Heard 選擇解決的就是這個輸出端問題。在 AI 程式設計智慧體日益普及的背景下,這種「音訊優先的人機互動」方向確實有需求。 不過目前 Heard 的中文媒體報道幾乎為零,這可能跟產品只在英文社群傳播、以及官網域名指向另一個產品有一定關係。
-
目前 Heard 還沒有出現明顯的爭議或法律風險。但有幾個潛在問題值得關注。首先是產品定位和域名的割裂——heard.app 指向助聽技術而不是 AI 語音層產品,這可能造成使用者困惑,也會影響自然流量獲取。其次是競品壓力:Anthropic 官方的 Claude Code /voice 模式已經上線,VoiceMode MCP 等開源替代方案也在持續發展,Heard 需要建立足夠的技術壁壘。第三是定價方面,24 美元的 Power 方案在 AI 工具領域不算貴,但如果主要競品都是開源免費的,需要持續證明付費功能的獨特價值。
-
Heard 最適合三類人。第一類是日常使用 Claude Code 或 Codex 的個人開發者,特別是不想一直被綁在終端前面的人。第二類是在遠端或移動場景中工作的開發者,可以利用通勤、散步的時間跟進智慧體的進度。第三類是同時跑多個智慧體的重度使用者,需要專案級彙總而不是各個終端來回切換。 不太適合的人群包括:使用 Windows 或 Linux 的開發者(暫不支援,但官方已確認跨平臺計劃)、不需要語音反饋的開發者、以及對 AI 程式設計智慧體使用頻率較低的使用者。 如果不需要 macOS 原生體驗,VoiceMode MCP 或 Claude Code 自帶的 /voice 模式可以作為替代方案。
-
Heard 解決了一個真實但容易被忽視的問題——AI 程式設計智慧體的輸出端體驗。產品設計思考得比較深入,從硬訊號/上下文感知的兩層決策到多智慧體獨立音色,每個功能點都能看到對實際工作流的理解。開源核心、三層定價的策略也給了使用者靈活的選擇空間。產品釋出時間很短(僅 2 天),後續發展值得關注,尤其是跨平臺支援和中文社群的推廣。
使用者評論
-
Cynthia_RodriguezII—多智慧體並行處理這個功能真是救命。以前四個終端視窗來回切,頭都大了。現在每個 Agent 用不同的聲音說話,閉著眼睛都知道誰在幹嘛。 -
LUphi—剛試了 Heard 的 Companion 模式,離開工位去倒咖啡,全程聽著 Codex 在後臺幫我重構那個老專案。回來一看程式碼都改好了,連測試都過了。這感覺太爽了。 -
TendermintTina54—Focus 模式是我最喜歡的。不會一直嘮叨,只有出錯或者需要我批准的時候才說話。之前用 Claude Code 經常因為沒看到許可權提示白白等二十分鐘,現在不會了。 -
Anthony.Rogers58—手機配對功能試了一下,QR 碼一掃就配對上了。鎖屏狀態下還能聽到播報,甚至可以按住說話給 Agent 發指令。在外面散步也能跟進度,科技改變生活。 -
Diane_Price_77—開源 Apache-2.0 加免費方案,誠意滿分。本地 Kokoro 語音雖然沒 ElevenLabs 那麼自然,但零成本能跑起來已經很香了。 -
Logan216—Heard 把 Agent 的輸出轉成語音,這個方向太對了。大家都忙著做語音輸入,沒人管輸出端。創始人說得對,Agent 回答的仍然是滾動的文字,你必須坐著盯著看。 -
謝秀—當天 PH 第一,330 票,說明需求確實存在。開發者工具這個賽道太捲了,能拿到第一不容易。 -
梅花_15—昨天下班前同時跑了三個 Agent 做不同事情——Claude Code 重構後端 API、Codex 寫前端元件、Cursor 跑測試。Heard 用三種不同的聲音播報各自進度,Aria 人格講 API 那部分特別清晰,Friday 人格播前端進度的時候語氣輕快,完全不會搞混。中途有個 Agent 卡在許可權審批上,Focus 模式立刻切了條語音過來提醒,我點了批准繼續跑。最後在回家路上掏出手機聽完了全部播報,到家開啟電腦一看,三個任務全完成了。這種體驗以前想都不敢想。 -
Nancy8552024—四個語音人格各有特色,我試了 Friday,輕快的風格確實適合長時間程式設計。用 Markdown 自定義人格這個開放設計也很有想法。 -
DWhite_Pro509—Pro 方案 12 美元一個月,託管語音和 LLM 不用自己配 API。對於不想折騰的人來說挺划算的,但我先用免費版跑一陣再說。 -
goldenmouse658—最打動我的是那句「最難的不是 TTS,而是決定什麼不該說」。做減法比做加法難多了,Heard 在過濾噪音這塊做得確實不錯,不是簡單把終端輸出全部轉成語音,而是有判斷力地篩選。 -
郝玉梅—看了 Product Hunt 上的討論,創始人對技術問題的回覆很坦誠。會話狀態存在本地記憶體和磁碟,手機端只傳音訊不傳狀態,這個隱私設計很靠譜。 -
NSullivan—我是從 claude_voice 那個開源專案轉過來的。Heard 的體驗好太多了,不是一個級別的產品。人家是真把「有判斷力的播報」做出來了,不只是簡單的 TTS 朗讀。而且 Heard 的架構設計更輕量,Python daemon 加 Unix socket 的方案比那些跑個 Node 服務來做 TTS 的優雅太多了,資源佔用也小。 -
AustinMorales168224—Power 方案 24 美元月付有點小貴,但包含了移動端和語音審批功能。我這種經常在外面跑的人確實需要,先試用一個月看看值不值。如果手機端體驗足夠好,這個價其實也能接受。 -
Ryan_StephensJr5—有個疑問,如果兩個並行 Agent 一個報告遷移成功、另一個測試失敗,Heard 怎麼彙總這種矛盾的結果?看到了創始人在 PH 上的回覆,用的是 reasoning-pass override 機制,先發貨後最佳化。 -
AnnMendozaII—Heard 的 Python daemon 加 Unix socket 架構挺輕量的,資源佔用不大。比那些 Electron 套殼的方案清爽多了。Claude Haiku 4.5 做人格改寫這個用法也很有創意。 -
CHOKM0F—聽開發者說未來會支援 Linux 和 Windows,那太好了。我現在主力機是 Mac,但偶爾用 Windows 的時候也得能用上啊。 -
錢建晴—今天在嘈雜的咖啡館試了一下,Heard 還是播報得很清楚。雖然環境音有點干擾,但語音本身夠響亮,戴著 AirPods 完全能聽清。 -
TheHelenaVergara—Co-pilot 模式工作的時候偶爾插一句,不會打斷思路。就像有個同事坐在旁邊輕聲提醒你「測試透過了」「那邊有個報錯你看看」。這個度掌握得剛剛好。 -
KrinHarper—用 Heard 跑了一整天 Claude Code 重構程式碼庫,體驗超出預期。不僅能聽到進度,還能在 Agent 卡住需要我決策的時候及時提醒。對比之前靠肉眼盯終端的模式,效率提升了不少。開源核心加三層定價也給了使用者足夠的選擇空間。 -
春雨_5—一直在等一個能把 Agent 輸出變成聲音的工具,終於有人做了。不過我有點擔心 heard.app 那個域名指向的是助聽技術產品,跟這個 Heard 不是一回事,會讓人困惑。希望團隊能儘快解決好域名問題。 -
梅花40—如果用 ElevenLabs 的雲端 TTS,效果確實很自然。不過本地 Kokoro 也夠用了,省了 API 費用。各有取捨吧。 -
流年393—自託管很香,全部本地執行,程式碼和資料不出機器。對於有合規要求的專案來說,這個架構設計很重要。手機端僅傳音訊不傳狀態的方案也讓人放心。 -
TerryGonzalezQ8—看到了競品壓力,Anthropic 官方 Claude Code /voice 模式已經上了,VoiceMode MCP 也在發展。希望 Heard 能保持技術優勢,別被大廠卷死了。不過話說回來,Heard 做的是輸出端語音播報,跟官方的語音輸入是不同賽道,互補大於競爭吧。 -
nty8ahuejt—裝好之後從選單欄就能切模式,不用重啟不用敲命令,這互動設計挺 mac 的。蘋果生態使用者表示很舒服。 -
8domk0e_i3j—說個細節,Heard 的 Verbosity 旋鈕可以精細調節播報量,從完整解說一路調到只報錯誤。並行工作的時候專案級摘要比聽五個終端互相疊加強太多了。建議每個用 Claude Code 的開發者都試試。 -
夏明—這兩天用 Heard 配合 Cursor 寫前端,很爽。一邊調樣式一邊聽 Agent 彙報狀態,不用來回切螢幕。生產效率提升了不少,特別是跑測試的時候不用幹等了。 -
LucaKumar—不支援 Windows 和 Linux 確實是短板,希望路線圖上的跨平臺計劃能快點落地。不然團隊裡用不同系統的同事就沒法統一用了。