Heard

Lớp giọng nói cho macOS, biến đầu ra terminal của Claude Code, Codex và Cursor thành bản tóm tắt giọng nói thông minh

Báo cáo chuyên sâu

  • Heard là lớp giọng nói macOS được thiết kế cho quy trình làm việc của tác nhân lập trình AI. Nó kết nối Claude Code, OpenAI Codex và Cursor để chuyển đổi đầu ra đầu cuối thành bản tóm tắt giọng nói thông minh. Nó được ra mắt trên Product Hunt vào ngày 25 tháng 7 năm 2026 và đứng đầu trong ngày (339 phiếu bầu, 91 bình luận). Nó là mã nguồn mở (Apache-2.0) và miễn phí cho các cá nhân. Ý tưởng cốt lõi là "phát sóng có phán đoán" - không chỉ đơn giản là chuyển văn bản thành lời nói mà còn phân biệt những gì nên nói và những gì nên bỏ qua.

  • Kelly (@itskellysun), người sáng lập Heard, đã nói điều này trên Product Hunt: "Mọi người đã cố gắng làm cho việc nói chuyện với đại lý trở nên dễ dàng hơn trong hai năm qua - nhập liệu bằng giọng nói, lời nhắc tốt hơn, ngữ cảnh tốt hơn. Nhưng không ai làm nửa còn lại. Câu trả lời của đại lý vẫn là cuộn văn bản mà bạn phải ngồi và nhìn chằm chằm vào. Nghe nói là một nửa đó." Đánh giá theo dòng thời gian, Heard đã phát hành phiên bản đầu tiên trong cộng đồng sớm nhất là vào ngày 1 tháng 5 năm 2026, sau đó bước vào lĩnh vực tầm nhìn của các phương tiện truyền thông công nghệ tiếng Anh như AI Untethered. Sau khi chính thức ra mắt trên Product Hunt vào ngày 25/7, nó đã nhận được 339 lượt bình chọn và 91 bình luận, đứng đầu trong ngày hôm đó. Hiện tại, sản phẩm đang trong giai đoạn đầu tăng trưởng nhanh và chưa có báo cáo đặc biệt nào của giới truyền thông công nghệ Trung Quốc (36Kr, Minority, v.v.). Điều đáng chú ý là tên miền listen.app hiện trỏ đến một sản phẩm công nghệ máy trợ thính hoàn toàn khác và lối vào trang web chính thức thực tế của Heard hiện chủ yếu được truy cập thông qua trang Product Hunt. Sản phẩm sử dụng daemon Python với giao tiếp socket Unix, công cụ TTS hỗ trợ ElevenLabs (đám mây) và Kokoro (cục bộ) và sử dụng Claude Haiku 4.5 để xử lý việc viết lại cá tính.

  • Cơ chế cốt lõi của Heard là "báo cáo phán đoán", là hệ thống ra quyết định hai lớp. Lớp đầu tiên được gọi là tín hiệu cứng: yêu cầu cấp phép, lỗi gọi công cụ, hoàn thành chạy - những tín hiệu này luôn kích hoạt chương trình phát giọng nói. Lớp thứ hai là lớp nhận biết ngữ cảnh: nó theo dõi lịch sử hội thoại, xác định nội dung nào đáng nói và bỏ qua thông tin dư thừa. Sản phẩm cung cấp ba chế độ giám sát. Chế độ đồng thí điểm cung cấp cho bạn những lời nhắc ngắn trong khi bạn làm việc mà không cần đọc nguyên văn; Chế độ đồng hành cung cấp bản tóm tắt bằng giọng nói đầy đủ hơn khi bạn rời khỏi màn hình; Chế độ lấy nét vẫn im lặng và chỉ lên tiếng khi cần sự can thiệp của bạn (phê duyệt, chặn, không thành công). Xử lý song song đa tác nhân là điểm bán hàng độc nhất của Heard. Khi nhiều phiên AI (Claude Code, Codex, Cursor) chạy cùng lúc, Heard không có năm thiết bị đầu cuối xếp chồng lên nhau mà được tóm tắt ở cấp dự án và mỗi tác nhân sử dụng một âm thanh khác nhau, cho phép bạn phân biệt ai đang làm gì bằng tai. Chức năng ghép nối điện thoại di động (Heard Power) được hoàn thành thông qua mã QR một lần. Sau khi ghép nối, bạn có thể nghe chương trình phát sóng trong thời gian thực ngay cả khi màn hình bị khóa. Nó cũng hỗ trợ nhấn và giữ hoặc nhấp để nói để gửi hướng dẫn đến tác nhân thông minh. Ghép nối phạm vi và hủy ghép nối tự động đảm bảo an ninh. Hệ thống giọng nói cá tính cũng rất tinh tế. Có bốn tính cách tích hợp: Aria (điềm tĩnh và thẳng thắn), Thứ Sáu (tươi sáng và sôi nổi), Jarvis (điềm tĩnh và hóm hỉnh, mặc định) và Atlas (kịch tính). Bạn cũng có thể tùy chỉnh cá tính của mình bằng cách sử dụng các tệp Markdown. Về quyền riêng tư, công cụ cốt lõi là nguồn mở Apache-2.0 và tự lưu trữ hoàn toàn nguyên bản. Trạng thái phiên chỉ được lưu trữ trong bộ nhớ và đĩa cục bộ chứ không phải trên mạng. Điện thoại di động chỉ truyền âm thanh và không truyền trạng thái phiên.

  • Heard có ba mức giá. Gói Miễn phí hoàn toàn miễn phí và bao gồm giọng nói Kokoro gốc, AI và phím thoại tích hợp, các tính cách và phím nóng tùy chỉnh, đồng thời dựa trên một công cụ nguồn mở. Gói Pro có giá 12 USD mỗi tháng (trả hàng năm) và cung cấp giọng nói được quản lý và LLM (không yêu cầu cấu hình), báo cáo cả ngày, tính cách cao cấp (Atlas và Thứ Sáu) cũng như đồng bộ hóa đám mây trên nhiều máy Mac. Gói Power có giá 24 USD mỗi tháng (trả hàng năm) và bao gồm tất cả các tính năng của Pro plus Heard dành cho thiết bị di động, nhận dạng giọng nói được tối ưu hóa bằng mã cũng như các khả năng của tác nhân chuyển hướng và phê duyệt giọng nói. Các gói lưu trữ yêu cầu macOS 13 trở lên. Chiến lược định giá này hợp lý hơn: phiên bản miễn phí cho phép các nhà phát triển cá nhân dùng thử và đánh giá nó với chi phí thấp, phiên bản Pro giải quyết nhu cầu của những người dùng không muốn tự mình cấu hình API và phiên bản Power nhắm đến người dùng nặng và các kịch bản văn phòng di động.

  • Phản hồi từ cộng đồng Product Hunt nhìn chung là tích cực. Người dùng Wes Carlson nhận xét: "Việc chạy song song tác nhân khiến việc phân tách tín hiệu cứng và nhận thức ngữ cảnh giống như một lựa chọn thiết kế cốt lõi thay vì chỉ là một tính năng thông báo." Dogan Akbulut cho biết: "Tôi luôn nhớ khoảnh khắc người đại diện đang chờ nhắc nhở cấp phép, lãng phí 20 phút. Thích chế độ gần như im lặng này." Noctis Leonard tin rằng núm Tính chi tiết và bản tóm tắt cấp dự án là cơ sở hạ tầng phù hợp để làm việc song song. Nhiều người dùng cũng đặt câu hỏi hay. Gal Dayan quan tâm đến việc Heard quyết định điều gì đáng nói khi một số đặc vụ song song đang thực hiện các nhiệm vụ khác nhau. Những người khác hỏi về cơ chế ngắt giọng nói, vị trí lưu trữ trạng thái cuộc trò chuyện, v.v. Người sáng lập đã trả lời những vấn đề kỹ thuật này trong phần bình luận và khá thẳng thắn.

  • Về phương tiện truyền thông công nghệ tiếng Anh, AI Untethered lần đầu tiên đưa tin về Heard vào ngày 1/5, trích lời người sáng lập: “Phần khó nhất không phải là TTS, mà là quyết định những gì không nên nói”. daily.dev cũng đã giới thiệu sau khi phát hành PH, tập trung vào các nguyên tắc kỹ thuật của hệ thống ra quyết định hai lớp. Các công cụ tổng hợp công cụ như AIToolly và AIDeckly cung cấp đầy đủ các tính năng và thông tin về giá. Từ góc độ ngành, Heard lấp đầy khoảng trống bị bỏ qua. Hầu hết các công cụ lập trình AI chỉ tập trung vào “đầu vào”—cách người dùng nói chuyện với tác nhân. Câu hỏi làm thế nào tác nhân “xuất” nó ra cho người dùng chưa bao giờ được xem xét nghiêm túc. Chính vấn đề đầu ra này đã được Heard chọn giải quyết. Trong bối cảnh các tác nhân lập trình AI ngày càng phổ biến, thực sự có nhu cầu về hướng “tương tác giữa người và máy tính bằng âm thanh đầu tiên”. Tuy nhiên, hiện tại gần như không có báo cáo nào của phương tiện truyền thông Trung Quốc về Heard. Điều này có thể liên quan đến việc sản phẩm chỉ được lan truyền trong cộng đồng người Anh và tên miền trang web chính thức trỏ đến một sản phẩm khác.

  • Hiện tại không có tranh chấp hoặc rủi ro pháp lý đáng kể nào đối với Heard. Nhưng có một số vấn đề tiềm ẩn đáng chú ý. Đầu tiên là sự tách biệt giữa định vị sản phẩm và tên miền - Heard.app hướng đến công nghệ trợ thính hơn là các sản phẩm lớp giọng nói AI, điều này có thể gây nhầm lẫn cho người dùng và cũng ảnh hưởng đến việc thu được lưu lượng truy cập tự nhiên. Thứ hai, có áp lực cạnh tranh về sản phẩm: Chế độ giọng nói/Mã Claude chính thức của Anthropic đã được ra mắt và các lựa chọn thay thế nguồn mở như VoiceMode MCP cũng đang tiếp tục phát triển. Nghe nói cần thiết lập đủ rào cản kỹ thuật. Thứ ba là giá cả. Gói Power 24 USD không đắt trong lĩnh vực công cụ AI, nhưng nếu các sản phẩm cạnh tranh chính là nguồn mở và miễn phí, thì nó cần tiếp tục chứng minh giá trị độc đáo của các chức năng trả phí.

  • Nghe nói là phù hợp nhất với ba loại người. Loại đầu tiên là các nhà phát triển cá nhân sử dụng Claude Code hoặc Codex hàng ngày, đặc biệt là những người không muốn lúc nào cũng bị ràng buộc với thiết bị đầu cuối. Loại thứ hai là các nhà phát triển làm việc trong các tình huống từ xa hoặc di động và có thể sử dụng thời gian đi lại và đi bộ của họ để theo dõi tiến trình của nhân viên. Loại thứ ba là những người dùng nhiều chạy nhiều tác nhân cùng lúc và cần tóm tắt ở cấp dự án thay vì chuyển đổi qua lại giữa các thiết bị đầu cuối khác nhau. Những người không phù hợp bao gồm: nhà phát triển sử dụng Windows hoặc Linux (chưa được hỗ trợ, nhưng kế hoạch đa nền tảng chính thức đã được xác nhận), nhà phát triển không cần phản hồi bằng giọng nói và người dùng ít sử dụng tác nhân lập trình AI hơn. Nếu bạn không cần trải nghiệm macOS gốc, bạn có thể sử dụng chế độ giọng nói / tích hợp sẵn của VoiceMode MCP hoặc Claude Code để thay thế.

  • Heard giải quyết được một vấn đề thực tế nhưng dễ bị bỏ qua—trải nghiệm đầu ra của các tác nhân được lập trình bằng AI. Thiết kế sản phẩm được cân nhắc kỹ lưỡng, từ việc ra quyết định hai lớp theo tín hiệu cứng/nhận biết ngữ cảnh đến âm sắc độc lập của nhiều tác nhân và có thể thấy được sự hiểu biết về quy trình làm việc thực tế ở mọi điểm chức năng. Chiến lược định giá lõi và ba tầng nguồn mở cũng mang đến cho người dùng những lựa chọn linh hoạt. Thời gian phát hành sản phẩm ngắn (chỉ 2 ngày) và những phát triển tiếp theo rất đáng được quan tâm, đặc biệt là hỗ trợ đa nền tảng và quảng bá cộng đồng Trung Quốc.

Đánh giá của người dùng

  • ảnh đại diện
    Cynthia_RodriguezII
    Tính năng đa tác tử xử lý song song đúng là cứu tinh. Trước đây chuyển qua lại bốn cửa sổ terminal, đầu óc muốn nổ tung. Giờ mỗi Agent nói bằng một giọng khác nhau, nhắm mắt cũng biết ai đang làm gì.

  • ảnh đại diện
    LUphi
    Vừa thử chế độ Companion của Heard. Rời bàn đi lấy cà phê, suốt quãng đó vẫn nghe Codex chạy nền tái cấu trúc cái dự án cũ giúp tôi. Quay lại thì code đã sửa xong, test cũng pass luôn. Cảm giác này đã thật.

  • ảnh đại diện
    TendermintTina54
    Chế độ Focus là thứ tôi thích nhất. Không lải nhải suốt, chỉ lên tiếng khi có lỗi hoặc cần tôi phê duyệt. Trước đây dùng Claude Code hay phí hai mươi phút chờ suông vì không thấy lời nhắc cấp quyền, giờ thì không còn nữa.

  • ảnh đại diện
    Anthony.Rogers58
    Thử tính năng ghép nối điện thoại, quét mã QR một cái là kết nối xong. Màn hình khóa vẫn nghe được thông báo, thậm chí có thể giữ nút để nói và gửi lệnh cho Agent. Đi dạo ngoài đường vẫn theo dõi được tiến độ, công nghệ thay đổi cuộc sống.

  • ảnh đại diện
    Diane_Price_77
    Mã nguồn mở Apache-2.0 cộng gói miễn phí, độ chân thành trọn điểm. Giọng Kokoro cục bộ tuy không tự nhiên bằng ElevenLabs, nhưng chạy được với chi phí bằng không là đã quá hời rồi.

  • ảnh đại diện
    Logan216
    Heard biến đầu ra của Agent thành giọng nói, hướng đi này quá chuẩn. Ai cũng mải làm nhập liệu giọng nói, chẳng ai lo đầu ra. Nhà sáng lập nói đúng: câu trả lời của Agent vẫn là văn bản cuộn dài, bạn buộc phải ngồi dán mắt vào đó.

  • ảnh đại diện
    谢秀
    Ngay hôm đó đứng nhất PH với 330 phiếu, chứng tỏ nhu cầu thực sự tồn tại. Mảng công cụ cho lập trình viên cạnh tranh khốc liệt, giành được vị trí số một không dễ đâu.

  • ảnh đại diện
    梅花_15
    Hôm qua trước giờ tan làm tôi chạy đồng thời ba Agent làm ba việc khác nhau — Claude Code tái cấu trúc API backend, Codex viết component front-end, Cursor chạy test. Heard dùng ba giọng khác nhau đọc tiến độ từng cái: giọng Aria nói phần API đặc biệt rõ ràng, giọng Friday báo tiến độ front-end với tông vui tươi, hoàn toàn không lẫn lộn. Giữa chừng có một Agent kẹt ở bước phê duyệt quyền, chế độ Focus lập tức gửi một thông báo giọng nói nhắc nhở, tôi bấm phê duyệt là chạy tiếp. Cuối cùng trên đường về nhà tôi mở điện thoại nghe nốt các thông báo, về tới nhà mở máy tính lên thì cả ba nhiệm vụ đều xong. Trải nghiệm kiểu này trước đây có mơ cũng không dám nghĩ.

  • ảnh đại diện
    Nancy8552024
    Bốn tính cách giọng nói mỗi cái một vẻ. Tôi thử Friday, phong cách nhẹ nhàng vui tươi đúng là hợp với những buổi lập trình dài. Thiết kế mở cho tùy chỉnh tính cách bằng Markdown cũng rất có ý tưởng.

  • ảnh đại diện
    DWhite_Pro509
    Gói Pro 12 đô một tháng, giọng nói và LLM được host sẵn, không phải tự cấu hình API. Với người ngại vọc vạch thì khá hời, nhưng tôi cứ dùng bản miễn phí một thời gian đã.

  • ảnh đại diện
    goldenmouse658
    Điều chạm tới tôi nhất là câu "khó nhất không phải TTS, mà là quyết định điều gì không nên nói". Làm phép trừ khó hơn phép cộng nhiều, và Heard lọc nhiễu thực sự tốt, không phải đơn giản chuyển toàn bộ đầu ra terminal thành giọng nói, mà chọn lọc có óc phán đoán.

  • ảnh đại diện
    郝玉梅
    Đọc thảo luận trên Product Hunt, nhà sáng lập trả lời các câu hỏi kỹ thuật rất thẳng thắn. Trạng thái phiên lưu trong bộ nhớ và ổ đĩa cục bộ, điện thoại chỉ nhận âm thanh không nhận trạng thái, thiết kế quyền riêng tư này rất đáng tin.

  • ảnh đại diện
    NSullivan
    Tôi chuyển từ dự án mã nguồn mở claude_voice sang. Trải nghiệm của Heard tốt hơn nhiều, không cùng đẳng cấp sản phẩm. Người ta thực sự làm được "thông báo có óc phán đoán", chứ không chỉ đọc TTS đơn thuần. Hơn nữa kiến trúc của Heard nhẹ hơn, phương án Python daemon cộng Unix socket thanh lịch hơn hẳn kiểu chạy cả một dịch vụ Node chỉ để làm TTS, chiếm tài nguyên cũng ít.

  • ảnh đại diện
    AustinMorales168224
    Gói Power 24 đô một tháng hơi chát, nhưng bao gồm tính năng di động và phê duyệt bằng giọng nói. Người hay chạy ngoài đường như tôi đúng là cần, cứ dùng thử một tháng xem có đáng không đã. Nếu trải nghiệm trên điện thoại đủ tốt thì mức giá này thật ra cũng chấp nhận được.

  • ảnh đại diện
    Ryan_StephensJr5
    Có một thắc mắc: nếu hai Agent chạy song song, một báo di chuyển dữ liệu thành công, một báo test thất bại, Heard tổng hợp kết quả mâu thuẫn này thế nào? Đã thấy nhà sáng lập trả lời trên PH, họ dùng cơ chế reasoning-pass override, cứ giao hàng trước rồi tối ưu sau.

  • ảnh đại diện
    AnnMendozaII
    Kiến trúc Python daemon cộng Unix socket của Heard khá gọn nhẹ, chiếm ít tài nguyên. Sạch sẽ hơn hẳn mấy giải pháp bọc Electron. Cách dùng Claude Haiku 4.5 để viết lại tính cách giọng nói cũng rất sáng tạo.

  • ảnh đại diện
    CHOKM0F
    Nghe nhà phát triển nói sau này sẽ hỗ trợ Linux và Windows, thế thì tốt quá. Máy chính của tôi là Mac, nhưng thỉnh thoảng dùng Windows cũng phải dùng được chứ.

  • ảnh đại diện
    钱建晴
    Hôm nay thử ở quán cà phê ồn ào, Heard vẫn đọc thông báo rất rõ. Tiếng ồn xung quanh có hơi nhiễu, nhưng giọng nói đủ to, đeo AirPods là nghe rõ hoàn toàn.

  • ảnh đại diện
    TheHelenaVergara
    Chế độ Co-pilot thỉnh thoảng chen một câu khi đang làm việc, không làm đứt mạch suy nghĩ. Giống như có đồng nghiệp ngồi cạnh khẽ nhắc "test qua rồi đấy", "bên kia có lỗi, xem thử đi". Liều lượng được cân chỉnh vừa khéo.

  • ảnh đại diện
    KrinHarper
    Dùng Heard chạy Claude Code tái cấu trúc codebase cả một ngày, trải nghiệm vượt mong đợi. Không chỉ nghe được tiến độ, nó còn nhắc kịp thời khi Agent bị kẹt cần tôi quyết định. So với kiểu căng mắt nhìn terminal trước đây, hiệu suất tăng lên nhiều. Lõi mã nguồn mở cộng ba mức giá cũng cho người dùng đủ không gian lựa chọn.

  • ảnh đại diện
    春雨_5
    Tôi đợi mãi một công cụ biến đầu ra của Agent thành giọng nói, cuối cùng cũng có người làm. Nhưng hơi lo là tên miền heard.app lại trỏ tới một sản phẩm công nghệ trợ thính, chẳng liên quan gì tới Heard này, dễ khiến người ta nhầm lẫn. Mong đội ngũ sớm giải quyết vấn đề tên miền.

  • ảnh đại diện
    梅花40
    Nếu dùng TTS đám mây của ElevenLabs thì hiệu quả quả thật rất tự nhiên. Nhưng Kokoro chạy cục bộ cũng đủ dùng, lại tiết kiệm phí API. Mỗi lựa chọn có cái được cái mất.

  • ảnh đại diện
    流年393
    Tự host quá ngon, mọi thứ chạy cục bộ, mã nguồn và dữ liệu không rời khỏi máy. Với các dự án có yêu cầu tuân thủ, thiết kế kiến trúc này rất quan trọng. Phương án điện thoại chỉ truyền âm thanh không truyền trạng thái cũng khiến người ta yên tâm.

  • ảnh đại diện
    TerryGonzalezQ8
    Áp lực cạnh tranh đã hiện rõ: chế độ /voice chính thức của Claude Code từ Anthropic đã ra mắt, VoiceMode MCP cũng đang phát triển. Mong Heard giữ được lợi thế kỹ thuật, đừng bị các ông lớn đè bẹp. Nhưng nói đi cũng phải nói lại, Heard làm thông báo giọng nói ở đầu ra, còn tính năng chính thức là nhập liệu bằng giọng nói — hai đường đua khác nhau, bổ trợ nhiều hơn là cạnh tranh.

  • ảnh đại diện
    nty8ahuejt
    Cài xong là có thể chuyển chế độ ngay từ thanh menu, không cần khởi động lại, không cần gõ lệnh. Thiết kế tương tác này rất chuẩn Mac. Người dùng hệ sinh thái Apple như tôi thấy rất thoải mái.

  • ảnh đại diện
    8domk0e_i3j
    Nói một chi tiết nhỏ: núm Verbosity của Heard cho phép tinh chỉnh lượng thông báo, từ tường thuật đầy đủ cho đến chỉ báo lỗi. Khi làm việc song song, bản tóm tắt cấp dự án tốt hơn hẳn việc nghe năm terminal chồng chéo lên nhau. Khuyên mọi lập trình viên dùng Claude Code nên thử.

  • ảnh đại diện
    夏明
    Mấy hôm nay tôi dùng Heard kết hợp Cursor để viết front-end, rất đã. Vừa chỉnh style vừa nghe Agent báo cáo trạng thái, không phải chuyển màn hình qua lại. Năng suất tăng lên đáng kể, nhất là lúc chạy test không còn phải ngồi chờ suông nữa.

  • ảnh đại diện
    LucaKumar
    Không hỗ trợ Windows và Linux đúng là một điểm yếu. Mong kế hoạch đa nền tảng trong lộ trình sớm thành hiện thực, nếu không thì đồng nghiệp trong nhóm dùng hệ điều hành khác nhau sẽ không thể dùng thống nhất được.