Heard

Lapisan suara untuk macOS yang mengubah keluaran terminal Claude Code, Codex, dan Cursor menjadi ringkasan suara cerdas

Laporan mendalam

  • Heard adalah lapisan ucapan macOS yang dirancang untuk alur kerja agen pemrograman AI. Ini menghubungkan Claude Code, OpenAI Codex, dan Cursor untuk mengubah keluaran terminal menjadi ringkasan ucapan yang cerdas. Diluncurkan di Product Hunt pada 25 Juli 2026 dan menduduki peringkat pertama pada hari itu (339 suara, 91 komentar). Ini adalah open source (Apache-2.0) dan gratis untuk individu. Ide intinya adalah untuk "menyiarkan dengan penilaian" - tidak sekadar mengubah teks menjadi ucapan, namun membedakan apa yang harus dikatakan dan apa yang harus dilewati.

  • Kelly (@itskellysun), pendiri Heard, mengatakan hal ini di Product Hunt: "Semua orang telah berusaha mempermudah berbicara dengan agen selama dua tahun terakhir - masukan suara, perintah yang lebih baik, konteks yang lebih baik. Namun tidak ada yang melakukan separuh lainnya. Jawaban agen masih berupa teks bergulir yang harus Anda duduki dan lihat. Dengarlah separuhnya." Dilihat dari timeline, Heard merilis versi awal di komunitas pada awal 1 Mei 2026, dan kemudian memasuki bidang visi media teknologi Inggris seperti AI Untethered. Setelah diluncurkan secara resmi di Product Hunt pada tanggal 25 Juli, ia menerima 339 suara dan 91 komentar, menduduki peringkat pertama pada hari itu. Saat ini, produk tersebut berada dalam tahap awal pertumbuhan pesat, dan belum ada laporan khusus dari media teknologi Tiongkok (36Kr, Minoritas, dll.). Perlu dicatat bahwa nama domain yang didengar.app saat ini menunjuk ke produk teknologi alat bantu dengar yang sama sekali berbeda, dan pintu masuk situs web resmi Heard saat ini sebagian besar diakses melalui halaman Perburuan Produk. Produk ini menggunakan daemon Python dengan komunikasi soket Unix, mesin TTS mendukung ElevenLabs (cloud) dan Kokoro (lokal), dan menggunakan Claude Haiku 4.5 untuk menangani penulisan ulang kepribadian.

  • Mekanisme inti Heard adalah "pelaporan yang menghakimi", yang merupakan sistem pengambilan keputusan dua lapis. Lapisan pertama disebut sinyal keras: permintaan izin, kegagalan panggilan alat, penyelesaian proses - ini selalu memicu siaran suara. Lapisan kedua adalah lapisan sadar konteks: lapisan ini melacak riwayat percakapan, menentukan konten apa yang pantas untuk disampaikan, dan melewatkan informasi yang berlebihan. Produk ini menyediakan tiga mode pemantauan. Mode co-pilot memberi Anda petunjuk singkat saat Anda bekerja tanpa membacanya kata demi kata; Mode pendamping memberikan pengarahan suara yang lebih lengkap saat Anda jauh dari layar; Mode fokus tetap senyap dan hanya berbicara saat intervensi Anda diperlukan (persetujuan, pemblokiran, kegagalan). Pemrosesan paralel multi-agen adalah nilai jual unik Heard. Ketika beberapa sesi AI (Claude Code, Codex, Cursor) berjalan pada saat yang sama, Heard tidak memiliki lima terminal yang ditumpangkan satu sama lain, tetapi diringkas di tingkat proyek, dan setiap agen menggunakan suara yang berbeda, memungkinkan Anda membedakan siapa yang melakukan apa dengan telinga. Fungsi pemasangan ponsel (Heard Power) diselesaikan melalui kode QR satu kali. Setelah memasangkan, Anda dapat mendengarkan siaran secara real time meskipun layar terkunci. Ini juga mendukung menekan dan menahan atau mengklik untuk berbicara untuk mengirim instruksi ke agen pintar. Pemasangan lingkup dan pelepasan pasangan otomatis memastikan keamanan. Sistem kepribadian suaranya juga sangat canggih. Ada empat kepribadian bawaan: Aria (tenang dan lugas), Friday (cerah dan lincah), Jarvis (tenang dan jenaka, default), dan Atlas (dramatis). Anda juga dapat menyesuaikan kepribadian Anda menggunakan file Markdown. Dalam hal privasi, mesin intinya adalah Apache-2.0 open source dan sepenuhnya di-hosting sendiri. Status sesi hanya disimpan di memori dan disk lokal, bukan di seluruh jaringan. Ponsel hanya mengirimkan audio dan tidak mengirimkan status sesi.

  • Heard memiliki tiga tingkatan harga. Paket Gratis gratis secara permanen dan mencakup suara asli Kokoro, AI dan tombol suara bawaan, kepribadian khusus dan tombol pintas, serta didasarkan pada mesin sumber terbuka. Paket Pro berharga $12 per bulan (dibayar setiap tahun) dan menawarkan suara terkelola dan LLM (Anda tidak memerlukan konfigurasi apa pun), pelaporan sepanjang hari, kepribadian premium (Atlas dan Friday), dan sinkronisasi cloud lintas-Mac. Paket Power berharga $24 per bulan (dibayar setiap tahun) dan mencakup semua fitur seluler Pro plus Heard, pengenalan ucapan yang dioptimalkan kode, serta persetujuan suara dan kemampuan agen pengalihan. Paket hosting memerlukan macOS 13 atau lebih tinggi. Strategi penetapan harga ini lebih masuk akal: versi gratis memungkinkan pengembang individu untuk mencoba dan mengevaluasinya dengan biaya rendah, versi Pro memenuhi kebutuhan pengguna yang tidak ingin mengutak-atik konfigurasi API sendiri, dan versi Power ditujukan untuk skenario pengguna berat dan mobile office.

  • Masukan dari komunitas Product Hunt secara keseluruhan positif. Pengguna Wes Carlson berkomentar: "Menjalankan agen secara paralel membuat pemisahan sinyal keras dan kesadaran konteks terasa seperti pilihan desain inti, bukan sekadar fitur notifikasi." Dogan Akbulut berkata: "Saya selalu merindukan momen ketika agen sedang menunggu perintah izin, membuang waktu 20 menit. Saya suka mode nyaris senyap ini." Noctis Leonard percaya bahwa tombol Verbositas dan ringkasan tingkat proyek adalah infrastruktur yang tepat untuk bekerja secara paralel. Banyak pengguna juga mengajukan pertanyaan bagus. Gal Dayan prihatin dengan cara Heard memutuskan apa yang pantas dikatakan ketika beberapa agen paralel menjalankan tugas berbeda. Yang lain bertanya tentang mekanisme interupsi suara, lokasi penyimpanan status percakapan, dll. Pendiri menanggapi masalah teknis ini di area komentar dan cukup jujur.

  • Dalam kaitannya dengan media teknologi Inggris, AI Untethered pertama kali melaporkan di Heard pada tanggal 1 Mei, mengutip pendirinya: "Bagian tersulit bukanlah TTS, tetapi memutuskan apa yang tidak boleh dikatakan." daily.dev juga melakukan pengenalan setelah rilis PH, dengan fokus pada prinsip teknis sistem pengambilan keputusan dua lapis. Agregator alat seperti AIToolly dan AIDeckly menyediakan fitur lengkap dan informasi harga. Dari perspektif industri, Heard mengisi kesenjangan yang terabaikan. Sebagian besar alat pemrograman AI hanya berfokus pada “input”—cara pengguna berbicara kepada agen. Pertanyaan tentang bagaimana agen "mengeluarkannya" kepada pengguna tidak pernah ditanggapi dengan serius. Masalah keluaran inilah yang dipilih Heard untuk dipecahkan. Dalam konteks semakin populernya agen pemrograman AI, memang ada permintaan untuk arah "interaksi manusia-komputer yang mengutamakan audio". Namun, saat ini hampir tidak ada pemberitaan media Tiongkok tentang Heard. Hal ini mungkin disebabkan oleh fakta bahwa produk tersebut hanya tersebar di komunitas Inggris dan nama domain situs resminya menunjuk ke produk lain.

  • Saat ini tidak ada perselisihan atau risiko hukum yang signifikan bagi Heard. Namun ada beberapa masalah potensial yang perlu diperhatikan. Yang pertama adalah pemisahan pemosisian produk dan nama domain - pendengaran.app mengacu pada teknologi alat bantu dengar, bukan produk lapisan suara AI, yang dapat menyebabkan kebingungan pengguna dan juga memengaruhi perolehan lalu lintas alami. Kedua, ada tekanan produk yang kompetitif: Kode Claude/mode suara resmi Anthropic telah diluncurkan, dan alternatif sumber terbuka seperti VoiceMode MCP juga terus berkembang. Heard perlu menetapkan hambatan teknis yang memadai. Yang ketiga adalah penetapan harga. Paket Daya senilai $24 tidaklah mahal di bidang alat AI, namun jika produk pesaing utama adalah sumber terbuka dan gratis, paket ini perlu terus membuktikan nilai unik dari fungsi berbayar.

  • Heard paling cocok untuk tiga tipe orang. Kategori pertama adalah pengembang individu yang menggunakan Claude Code atau Codex setiap hari, terutama mereka yang tidak ingin selalu terikat pada terminal. Kategori kedua adalah pengembang yang bekerja dalam skenario jarak jauh atau seluler dan dapat menggunakan waktu perjalanan dan berjalan kaki mereka untuk mengikuti kemajuan agen. Kategori ketiga adalah pengguna berat yang menjalankan banyak agen pada saat yang sama dan memerlukan ringkasan tingkat proyek daripada berpindah-pindah antar terminal yang berbeda. Orang-orang yang tidak cocok meliputi: pengembang yang menggunakan Windows atau Linux (belum didukung, tetapi rencana lintas platform resmi telah dikonfirmasi), pengembang yang tidak memerlukan umpan balik suara, dan pengguna yang lebih jarang menggunakan agen pemrograman AI. Jika Anda tidak memerlukan pengalaman macOS asli, mode /suara bawaan VoiceMode MCP atau Claude Code dapat digunakan sebagai alternatif.

  • Heard memecahkan masalah nyata namun mudah diabaikan—pengalaman sisi keluaran dari agen yang diprogram AI. Desain produk dipikirkan secara mendalam, mulai dari pengambilan keputusan dua lapis yang sadar sinyal/konteks hingga timbre independen multi-agen, dan pemahaman tentang alur kerja sebenarnya dapat dilihat di setiap titik fungsi. Strategi harga inti open source dan tiga tingkat juga memberikan pilihan yang fleksibel kepada pengguna. Waktu rilis produk yang singkat (hanya 2 hari), dan perkembangan selanjutnya patut mendapat perhatian, terutama dukungan lintas platform dan promosi komunitas Tiongkok.

Ulasan pengguna

  • avatar
    Cynthia_RodriguezII
    Fitur pemrosesan paralel multi-agen ini benar-benar penyelamat. Dulu bolak-balik empat jendela terminal sampai pusing. Sekarang tiap agen bicara dengan suara berbeda, merem pun saya tahu siapa sedang mengerjakan apa.

  • avatar
    LUphi
    Baru saja mencoba mode Companion dari Heard. Saya tinggal ke pantry ambil kopi sambil mendengarkan Codex me-refactor proyek lama saya di latar belakang. Begitu kembali, kodenya sudah beres, tesnya pun lolos. Rasanya luar biasa.

  • avatar
    TendermintTina54
    Mode Focus paling saya suka. Tidak cerewet terus-menerus, hanya bicara saat ada error atau butuh persetujuan saya. Dulu pakai Claude Code sering menunggu dua puluh menit sia-sia karena tidak melihat prompt izin, sekarang tidak lagi.

  • avatar
    Anthony.Rogers58
    Fitur pemasangan ponsel saya coba, sekali pindai kode QR langsung terhubung. Dalam keadaan layar terkunci pun pengumuman tetap terdengar, bahkan bisa tahan-bicara untuk mengirim perintah ke Agent. Jalan-jalan di luar pun bisa mengikuti progres, teknologi mengubah hidup.

  • avatar
    Diane_Price_77
    Open source Apache-2.0 plus paket gratis, nilai ketulusannya penuh. Suara Kokoro lokal memang tidak senatural ElevenLabs, tapi bisa jalan tanpa biaya saja sudah sangat menggiurkan.

  • avatar
    Logan216
    Heard mengubah keluaran Agent menjadi suara, arah ini tepat sekali. Semua orang sibuk bikin input suara, tak ada yang mengurus sisi keluaran. Pendirinya benar: jawaban Agent tetap berupa teks yang menggulung, dan kamu harus duduk menatapnya terus.

  • avatar
    谢秀
    Hari itu juga nomor 1 di PH dengan 330 vote, artinya kebutuhan itu memang nyata. Arena alat developer sudah sangat sesak, bisa juara satu itu tidak gampang.

  • avatar
    梅花_15
    Kemarin sebelum pulang kerja saya menjalankan tiga Agent sekaligus untuk pekerjaan berbeda — Claude Code merefaktor API backend, Codex menulis komponen front-end, Cursor menjalankan tes. Heard melaporkan progres masing-masing dengan tiga suara berbeda: persona Aria menjelaskan bagian API dengan sangat jelas, persona Friday membawakan progres front-end dengan nada riang, sama sekali tidak tertukar. Di tengah jalan ada Agent yang tersangkut persetujuan izin, mode Focus langsung mengirim pesan suara mengingatkan; saya tekan setujui dan lanjut jalan. Akhirnya dalam perjalanan pulang saya menghabiskan sisa laporannya lewat ponsel, sampai rumah buka komputer, ketiga tugas sudah selesai semua. Pengalaman seperti ini dulu bahkan tak berani saya bayangkan.

  • avatar
    Nancy8552024
    Empat persona suara masing-masing punya ciri khas. Saya coba Friday, gaya ringannya memang cocok untuk sesi coding panjang. Desain terbuka kustomisasi persona lewat Markdown juga penuh ide.

  • avatar
    DWhite_Pro509
    Paket Pro 12 dolar per bulan, suara dan LLM sudah di-hosting, tak perlu mengatur API sendiri. Buat yang malas ribet ini cukup ekonomis, tapi saya mau jalan pakai versi gratis dulu beberapa waktu.

  • avatar
    goldenmouse658
    Yang paling menyentuh saya adalah kalimat "yang tersulit bukan TTS, melainkan memutuskan apa yang tidak perlu dikatakan". Mengurangi jauh lebih sulit daripada menambah, dan Heard menyaring kebisingan dengan sangat baik — bukan sekadar mengubah semua keluaran terminal jadi suara, tapi memilah dengan penilaian.

  • avatar
    郝玉梅
    Saya baca diskusi di Product Hunt, balasan pendirinya atas pertanyaan teknis sangat jujur. Status sesi disimpan di memori dan disk lokal, ponsel hanya menerima audio tanpa state; desain privasi ini bisa diandalkan.

  • avatar
    NSullivan
    Saya pindahan dari proyek open source claude_voice. Pengalaman Heard jauh lebih baik, levelnya beda. Mereka benar-benar mewujudkan "pengumuman yang punya penilaian", bukan sekadar pembacaan TTS. Lagi pula arsitektur Heard lebih ringan, pendekatan daemon Python plus Unix socket jauh lebih elegan daripada menjalankan layanan Node hanya untuk TTS, konsumsi sumber dayanya pun kecil.

  • avatar
    AustinMorales168224
    Paket Power 24 dolar per bulan agak mahal, tapi sudah termasuk fitur mobile dan persetujuan suara. Orang seperti saya yang sering di luar memang butuh; coba dulu sebulan lihat sepadan atau tidak. Kalau pengalaman di ponsel cukup bagus, harga segitu sebenarnya masih bisa diterima.

  • avatar
    Ryan_StephensJr5
    Ada satu pertanyaan: kalau dua Agent paralel melapor hasil yang bertentangan — satu bilang migrasi sukses, satu lagi bilang tes gagal — bagaimana Heard merangkumnya? Saya lihat balasan pendirinya di PH, mereka pakai mekanisme reasoning-pass override; rilis dulu, optimalkan belakangan.

  • avatar
    AnnMendozaII
    Arsitektur Heard dengan daemon Python plus Unix socket cukup ringan, pemakaian sumber dayanya kecil. Jauh lebih bersih daripada solusi bungkus Electron. Memakai Claude Haiku 4.5 untuk menulis ulang persona juga ide yang kreatif.

  • avatar
    CHOKM0F
    Dengar-dengar developer bilang ke depannya akan mendukung Linux dan Windows, bagus sekali. Mesin utama saya Mac, tapi sesekali saat pakai Windows juga harus tetap bisa dipakai dong.

  • avatar
    钱建晴
    Hari ini saya coba di kafe yang berisik, pengumuman Heard tetap terdengar jelas. Suara lingkungan memang sedikit mengganggu, tapi suaranya sendiri cukup lantang; pakai AirPods masih terdengar jernih.

  • avatar
    TheHelenaVergara
    Mode Co-pilot sesekali menyela sepatah kata saat bekerja, tanpa memutus alur pikiran. Rasanya seperti ada rekan kerja duduk di sebelah yang berbisik "tesnya lulus" atau "di sana ada error, coba lihat". Takarannya pas sekali.

  • avatar
    KrinHarper
    Seharian penuh saya menjalankan Claude Code merefaktor codebase dengan Heard, pengalamannya melebihi ekspektasi. Bukan cuma bisa mendengar progres, ia juga mengingatkan tepat waktu saat Agent macet dan butuh keputusan saya. Dibanding dulu memelototi terminal, efisiensinya naik banyak. Inti open source plus tiga tingkat harga juga memberi pengguna cukup banyak pilihan.

  • avatar
    春雨_5
    Saya sudah lama menunggu alat yang mengubah keluaran Agent jadi suara, akhirnya ada yang membuatnya. Tapi saya agak khawatir domain heard.app itu mengarah ke produk teknologi alat bantu dengar, bukan Heard yang ini — bisa bikin bingung. Semoga tim segera membereskan masalah domainnya.

  • avatar
    梅花40
    Kalau pakai TTS cloud ElevenLabs, hasilnya memang sangat natural. Tapi Kokoro lokal juga sudah cukup dan menghemat biaya API. Masing-masing ada plus minusnya.

  • avatar
    流年393
    Self-hosting benar-benar mantap, semuanya berjalan lokal, kode dan data tidak keluar dari mesin. Untuk proyek dengan tuntutan kepatuhan, desain arsitektur ini sangat penting. Skema ponsel yang hanya mengirim audio tanpa state juga bikin tenang.

  • avatar
    TerryGonzalezQ8
    Tekanan kompetitor mulai terlihat: mode /voice resmi Claude Code dari Anthropic sudah rilis, VoiceMode MCP juga berkembang. Semoga Heard bisa mempertahankan keunggulan teknisnya dan tidak digilas pemain besar. Tapi ya, Heard menggarap pengumuman suara di sisi keluaran, sedangkan fitur resmi adalah input suara — jalurnya beda, lebih saling melengkapi daripada bersaing.

  • avatar
    nty8ahuejt
    Setelah terpasang, mode bisa diganti langsung dari menu bar, tanpa restart tanpa mengetik perintah. Desain interaksinya sangat khas Mac. Sebagai pengguna ekosistem Apple, ini terasa nyaman sekali.

  • avatar
    8domk0e_i3j
    Satu detail: kenop Verbosity di Heard bisa mengatur jumlah pengumuman secara halus, dari narasi lengkap sampai hanya melaporkan error. Saat bekerja paralel, ringkasan tingkat proyek jauh lebih baik daripada mendengar lima terminal saling bertumpuk. Saya sarankan setiap developer pengguna Claude Code mencobanya.

  • avatar
    夏明
    Beberapa hari ini saya pakai Heard bersama Cursor untuk menulis front-end, rasanya menyenangkan sekali. Sambil menyetel style, saya mendengarkan Agent melaporkan statusnya, tak perlu bolak-balik ganti layar. Produktivitas naik cukup banyak, apalagi saat menjalankan tes tidak perlu menunggu bengong lagi.

  • avatar
    LucaKumar
    Tidak mendukung Windows dan Linux memang jadi kelemahan. Semoga rencana lintas platform di roadmap segera terwujud, kalau tidak, rekan satu tim yang memakai sistem berbeda tidak bisa memakainya secara seragam.