Heard
macOS向け音声レイヤー。Claude Code・Codex・Cursorのターミナル出力をインテリジェントな音声サマリーに変換
詳細レポート
-
Heard は、AI プログラミング エージェント ワークフロー用に設計された macOS 音声レイヤーです。 Claude Code、OpenAI Codex、および Cursor を接続して、端末出力をインテリジェントな音声要約に変換します。これは、2026 年 7 月 25 日に Product Hunt で公開され、その日に 1 位にランクされました (339 票、91 コメント)。これはオープンソース (Apache-2.0) であり、個人には無料です。中心となるアイデアは、単にテキストを音声に変換するのではなく、何を話すべきか、何をスキップすべきかを区別する「判断を伴う放送」です。
-
Heard の創設者である Kelly (@itskellysun) は、Product Hunt で次のように述べています。「過去 2 年間、誰もがエージェントとの会話を容易にするために、音声入力、より良いプロンプト、より良いコンテキストを実現しようと努めてきました。しかし、残りの半分をやっている人はいません。エージェントの答えは依然として、座って見つめなければならないテキストのスクロールです。Heard はその半分です。」 タイムラインから判断すると、ハードは 2026 年 5 月 1 日に初期バージョンをコミュニティでリリースし、その後、AI Untethered などの英国のテクノロジー メディアの視野に入ってきました。 7 月 25 日に Product Hunt で正式にリリースされると、339 票と 91 件のコメントを獲得し、その日のうちに 1 位にランクされました。現時点ではこの製品は急成長の初期段階にあり、中国のテクノロジーメディア(36Kr、Minoityなど)による特別な報道はありません。 注目に値するのは、ドメイン名 Heard.app は現在、まったく異なる補聴器技術製品を指しており、Heard の実際の公式 Web サイトの入り口は現在、主に Product Hunt ページからアクセスされているということです。この製品は、Unix ソケット通信を備えた Python デーモンを使用し、TTS エンジンは Celebrities (クラウド) と Kokoro (ローカル) をサポートし、Claude Haiku 4.5 を使用して人格の書き換えを処理します。
-
ハードの中核となる仕組みは、二層の意思決定システムである「判断レポート」です。最初の層はハード信号と呼ばれ、許可リクエスト、ツール呼び出しの失敗、実行の完了など、これらは常に音声ブロードキャストをトリガーします。 2 番目の層はコンテキスト認識層です。会話履歴を追跡し、どの内容が言う価値があるかを判断し、冗長な情報をスキップします。 この製品には 3 つの監視モードが用意されています。副操縦士モードでは、作業中に逐語的に読まなくても短いプロンプトが表示されます。コンパニオン モードでは、画面から離れているときに、より完全な音声ブリーフィングが提供されます。フォーカス モードは沈黙したままで、介入が必要な場合 (承認、ブロック、失敗) にのみ音声を発します。 マルチエージェントの並列処理は、Heard のユニークなセールス ポイントです。複数の AI セッション (Claude Code、Codex、Cursor) が同時に実行されている場合、Heard は 5 台の端末を重ね合わせるのではなく、プロジェクト レベルでまとめられ、各エージェントが異なる音を使用するため、誰が何をしているかを耳で区別できます。 携帯電話のペアリング機能(Heard Power)はワンタイムQRコードで完了します。ペアリング後は、画面がロックされている状態でもリアルタイムで放送を聞くことができます。また、長押しまたはクリックして発話し、スマート エージェントに指示を送信することもできます。スコープのペアリングと自動ペアリング解除により、セキュリティが確保されます。 音声パーソナリティ システムも非常に洗練されています。アリア (冷静かつ率直)、フライデー (明るく活発)、ジャービス (冷静で機知に富んだ、デフォルト)、アトラス (ドラマティック) の 4 つの内蔵パーソナリティがあります。 Markdown ファイルを使用して個性をカスタマイズすることもできます。 プライバシーの観点からは、コア エンジンは Apache-2.0 オープン ソースであり、完全にネイティブで自己ホストされています。セッション状態はローカル メモリとディスクにのみ保存され、ネットワーク上には保存されません。携帯電話は音声のみを送信し、セッション ステータスは送信しません。
-
ハードには 3 段階の価格設定があります。 Free プランは永続的に無料で、ネイティブの Kokoro 音声、組み込み AI および音声キー、カスタム パーソナリティおよびホットキーが含まれており、オープンソース エンジンに基づいています。 Pro プランは月額 12 ドル (年払い) で、マネージド音声と LLM (自分で設定する必要はありません)、終日レポート、プレミアム パーソナリティ (Atlas と Friday)、および Mac 間のクラウド同期を提供します。 Power プランの料金は月額 24 ドル (年払い) で、Pro plus Heard モバイルのすべての機能、コード最適化音声認識、音声承認およびリダイレクト エージェント機能が含まれています。ホスティング プランには macOS 13 以降が必要です。 この価格設定戦略はより合理的です。無料版は個人の開発者が低コストで試用して評価することができ、Pro 版は自分で API 設定をいじりたくないユーザーのニーズを解決し、Power 版はヘビー ユーザーとモバイル オフィスのシナリオを対象としています。
-
Product Hunt コミュニティからのフィードバックは全体的に好意的です。ユーザーの Wes Carlson は、「エージェントを並行して実行すると、ハード信号とコンテキスト認識の分離が、単なる通知機能ではなく、中核的な設計上の選択のように感じられます。」とコメントしました。ドーガン・アクブルット氏は、「エージェントが許可のプロンプトを待っている瞬間をいつも逃してしまい、20 分を無駄にしてしまいます。このほぼ無音のモードが気に入っています。」と述べました。 Noctis Leonard は、Verbosity ノブとプロジェクト レベルの概要が並行して作業するための適切なインフラストラクチャであると信じています。 多くのユーザーからも良い質問が寄せられました。 Gal Dayan 氏は、複数の並行エージェントが異なるタスクを実行している場合に、Heard が言うべきことをどのように判断するかに関心を持っています。音声中断メカニズムや会話ステータスの保存場所などについて質問する人もいます。創設者はこれらの技術的な問題に対してコメント エリアで非常に率直に答えました。
-
英語のテクノロジーメディアに関して言えば、AI Untethered は 5 月 1 日にハードを初めて報じ、「最も難しいのは TTS ではなく、何を言ってはいけないかを決めることだ」という創設者の言葉を引用した。 daily.dev も PH のリリース後に、2 層の意思決定システムの技術原則に焦点を当てた紹介を行いました。 AIToolly や AIDeckly などのツール アグリゲーターは、完全な機能と価格情報を提供します。 業界の観点から見ると、ハードは見落とされていたギャップを埋めてくれます。ほとんどの AI プログラミング ツールは、「入力」、つまりユーザーがエージェントにどのように話すかのみに焦点を当てています。エージェントがそれをユーザーにどのように「出力」するかという問題は、これまで真剣に考慮されていませんでした。ハードが解決することを選んだのは、この出力の問題です。 AI プログラミング エージェントの人気が高まる中、この「オーディオ ファーストの人間とコンピューターの対話」の方向性が確かに求められています。 しかし、現在、ハードに関する中国メディアの報道はほぼゼロだ。これは、この製品が英語のコミュニティでのみ普及しており、公式 Web サイトのドメイン名が別の製品を指しているという事実に関連している可能性があります。
-
現在、ハードには重大な紛争や法的リスクはありません。しかし、注意を払う価値のある潜在的な問題がいくつかあります。 1 つ目は、製品の位置付けとドメイン名の分離です。heared.app は AI 音声レイヤー製品ではなく補聴器テクノロジーを指しているため、ユーザーの混乱を引き起こし、自然なトラフィックの獲得にも影響を与える可能性があります。第 2 に、製品の競争圧力があります。Anthropic の公式クロード コード/音声モードが開始され、VoiceMode MCP などのオープンソースの代替品も開発が続けられています。ハードは十分な技術的障壁を確立する必要がある。 3つ目は価格設定です。 24 ドルの Power プランは AI ツールの分野では高価ではありませんが、主要な競合製品がオープンソースで無料の場合、有料機能の独自の価値を証明し続ける必要があります。
-
Heard は 3 つのタイプの人に最適です。最初のカテゴリは、Claude Code または Codex を日常的に使用する個人の開発者、特に常に端末に縛られたくない人です。 2 番目のカテゴリは、リモートまたはモバイル シナリオで作業し、通勤時間や徒歩時間を利用してエージェントの進捗状況を追跡できる開発者です。 3 番目のカテゴリは、複数のエージェントを同時に実行し、さまざまな端末間を行き来するのではなく、プロジェクト レベルの概要を必要とするヘビー ユーザーです。 適さない人には、Windows または Linux を使用している開発者 (まだサポートされていませんが、公式のクロスプラットフォーム計画が確認されています)、音声フィードバックを必要としない開発者、および AI プログラミング エージェントの使用頻度が低いユーザーが含まれます。 ネイティブ macOS エクスペリエンスが必要ない場合は、VoiceMode MCP または Claude Code の組み込み /voice モードを代替として使用できます。
-
ハードは、AI でプログラムされたエージェントの出力側のエクスペリエンスという、現実的だが見落とされがちな問題を解決します。製品設計は、ハードな信号/コンテキストを意識した 2 層の意思決定からマルチエージェントに依存しない音色に至るまで徹底的に検討されており、実際のワークフローの理解があらゆる機能ポイントで確認できます。オープンソースのコアと 3 段階の価格戦略により、ユーザーは柔軟な選択肢を得ることができます。製品のリリース期間は短く (わずか 2 日)、その後の開発、特にクロスプラットフォームのサポートと中国語コミュニティの促進は注目に値します。
ユーザーレビュー
-
Cynthia_RodriguezII—マルチエージェント並列処理は本当に救世主。以前は4つのターミナルを行き来して頭がパンクしそうだった。今は各エージェントが違う声で話すから、目を閉じていても誰が何をやっているか分かる。 -
LUphi—Heard の Companion モードを試したところ。コーヒーを取りに席を離れている間、Codex がバックグラウンドで古いプロジェクトをリファクタリングしているのをずっと聞いていた。戻ってきたらコードは直っていてテストまで通っていた。この感覚は最高すぎる。 -
TendermintTina54—Focusモードが一番のお気に入りです。ずっとしゃべり続けるのではなく、エラーが出たときや承認が必要なときだけ話します。以前はClaude Codeで権限プロンプトを見逃して20分も無駄に待つことがよくありましたが、今はもうありません。 -
Anthony.Rogers58—スマホのペアリング機能を試しましたが、QRコードをスキャンするだけで即ペアリング完了。ロック画面の状態でも読み上げが聞こえるし、長押しで話してAgentに指示を送ることもできます。外を散歩しながら進捗を追える。テクノロジーは生活を変えますね。 -
Diane_Price_77—オープンソースのApache-2.0に無料プランまで、誠意満点です。ローカルのKokoro音声はElevenLabsほど自然ではありませんが、ゼロコストで動かせるだけで十分ありがたいです。 -
Logan216—HeardがAgentの出力を音声に変換する、この方向性は完全に正しい。みんな音声入力を作るのに忙しくて、出力側は誰も手をつけていませんでした。創業者の言うとおり、Agentの回答は依然としてスクロールするテキストで、座ってじっと見ていなければなりません。 -
谢秀—当日のPH 1位、330票。ニーズが確実に存在する証拠です。開発者ツールの分野は競争が激しすぎるので、1位を取るのは簡単ではありません。 -
梅花_15—昨日退勤前に3つのAgentを同時に走らせて別々の仕事をさせました——Claude CodeでバックエンドAPIのリファクタリング、Codexでフロントエンドコンポーネントの作成、Cursorでテスト実行。Heardは3種類の異なる声でそれぞれの進捗を読み上げてくれて、AriaパーソナリティのAPIパートは特にクリアで、Fridayパーソナリティがフロントエンドの進捗を軽快な口調で伝えてくれて、まったく混同しません。途中で1つのAgentが権限承認で止まったときは、Focusモードがすぐに音声で知らせてくれて、承認をタップして続行。最後は帰り道にスマホで残りの読み上げを聞き終え、家でPCを開いたら3つのタスクがすべて完了していました。こんな体験、以前は想像もできませんでした。 -
Nancy8552024—4つの音声パーソナリティはそれぞれ個性的です。Fridayを試しましたが、軽快なスタイルは確かに長時間のプログラミングに向いています。Markdownでパーソナリティをカスタマイズできるオープンな設計もよく考えられています。 -
DWhite_Pro509—Proプランは月12ドルで、ホスティングされた音声とLLMが付いてくるので自分でAPIを設定する必要がありません。いじりたくない人にはお得ですが、私はまず無料版でしばらく走らせてみます。 -
goldenmouse658—一番心に響いたのは「最も難しいのはTTSではなく、何を言わないかを決めること」という言葉です。引き算は足し算よりずっと難しい。Heardはノイズのフィルタリングが本当によくできていて、ターミナル出力を全部音声にするのではなく、判断力を持って選別しています。 -
郝玉梅—Product Huntの議論を見ましたが、創業者の技術的な質問への回答はとても誠実でした。セッション状態はローカルのメモリとディスクに保存され、スマホ側には音声のみ送信し状態は送らない。このプライバシー設計は信頼できます。 -
NSullivan—私はオープンソースのclaude_voiceプロジェクトから乗り換えました。Heardの体験のほうがはるかに良く、まったく別次元の製品です。「判断力のある読み上げ」を本当に実現していて、単なるTTSの朗読ではありません。しかもHeardのアーキテクチャはより軽量で、Pythonデーモン+UnixソケットのアプローチはTTSのためにNodeサービスを立てる類のものよりずっとエレガントで、リソース消費も小さいです。 -
AustinMorales168224—Powerプランの月額24ドルは少し高めですが、モバイル対応と音声承認機能が含まれています。私のように外出が多い人間には確かに必要なので、まず1か月試して価値があるか見てみます。スマホ側の体験が十分良ければ、この価格でも受け入れられます。 -
Ryan_StephensJr5—疑問がひとつ。並行する2つのAgentのうち、一方が移行成功、もう一方がテスト失敗を報告した場合、Heardはこの矛盾する結果をどうまとめるのでしょう?PHで創業者の返信を見ました。reasoning-pass overrideという仕組みを使っていて、まず出荷して後から最適化する方針だそうです。 -
AnnMendozaII—HeardのPythonデーモン+Unixソケットというアーキテクチャはかなり軽量で、リソース消費も少ない。Electronでラップした類のソリューションよりずっとスッキリしています。Claude Haiku 4.5でパーソナリティの書き換えをするという使い方も創意的ですね。 -
CHOKM0F—開発者が将来LinuxとWindowsをサポートすると言っていて、それは嬉しい。今のメインマシンはMacですが、たまにWindowsを使うときにも使えないと困りますから。 -
钱建晴—今日、騒がしいカフェで試してみましたが、Heardの読み上げははっきり聞こえました。環境音の干渉は少しあるものの、音声自体が十分に大きく、AirPodsを着けていれば完全に聞き取れます。 -
TheHelenaVergara—Co-pilotモードは作業中にたまに一言添えてくれる程度で、思考を中断させません。まるで隣に座っている同僚が「テスト通ったよ」「あっちでエラー出てるから見て」と小声で教えてくれるような感じ。この加減が絶妙です。 -
KrinHarper—Heardを使ってClaude Codeでコードベースのリファクタリングを丸一日回しましたが、体験は期待以上でした。進捗が聞こえるだけでなく、Agentが行き詰まって私の判断が必要なときにすぐ知らせてくれます。以前の目でターミナルを見張るやり方と比べて、効率がかなり上がりました。オープンソースのコアと3段階の料金プランで、ユーザーに十分な選択肢があるのも良いです。 -
春雨_5—Agentの出力を音声に変えるツールをずっと待っていましたが、ついに作ってくれる人が現れました。ただ少し心配なのは、heard.appというドメインが補聴技術の製品を指していて、このHeardとは別物だということ。混乱を招きそうです。チームには早くドメイン問題を解決してほしいです。 -
梅花40—ElevenLabsのクラウドTTSを使えば確かにとても自然です。でもローカルのKokoroでも十分使えて、APIコストの節約になります。それぞれ一長一短ですね。 -
流年393—セルフホストは最高です。すべてローカルで動作し、コードとデータがマシンから出ません。コンプライアンス要件のあるプロジェクトにとって、このアーキテクチャ設計は非常に重要です。スマホ側は音声のみ送信し状態は送らないという方針も安心できます。 -
TerryGonzalezQ8—競合のプレッシャーが見えてきました。Anthropic公式のClaude Code /voiceモードはすでにリリースされ、VoiceMode MCPも発展中です。Heardには技術的優位性を保ってほしい、大手に潰されないでほしいですね。とはいえ、Heardがやっているのは出力側の音声読み上げで、公式の音声入力とは別のレーンなので、競争より補完の関係でしょう。 -
nty8ahuejt—インストール後はメニューバーからモードを切り替えられて、再起動もコマンド入力も不要。この操作設計はいかにもMacらしい。Appleエコシステムのユーザーとしてはとても快適です。 -
8domk0e_i3j—細かい点ですが、HeardのVerbosityノブは読み上げ量を細かく調整でき、フル解説からエラーのみまで一気に絞れます。並行作業のとき、プロジェクトレベルの要約は5つのターミナルが重なって聞こえるよりはるかに優れています。Claude Codeを使っている開発者全員に試してほしいですね。 -
夏明—ここ数日、HeardをCursorと組み合わせてフロントエンドを書いていますが、とても快適です。スタイルを調整しながらAgentのステータス報告を聞けるので、画面を行ったり来たり切り替える必要がありません。生産性がかなり上がりました。特にテスト実行中にただ待つ必要がなくなったのが大きいです。 -
LucaKumar—WindowsとLinuxに対応していないのは確かに弱点ですね。ロードマップにあるクロスプラットフォーム計画が早く実現してほしい。そうでないと、チーム内で異なるOSを使う同僚たちと統一して使えません。