seeduplex 位元組豆包全雙工語音AI
位元組跳動釋出的原生全雙工語音大模型,實現邊聽邊說的自然語音互動
深度報告
-
Seeduplex是位元組跳動於2026年4月9日釋出的原生全雙工語音大模型,是業內首個實現億級使用者規模化落地的全雙工語音產品。該模型基於「邊聽邊說」的全新框架設計,實現了實時傾聽、生成回應、判斷對話節奏三項任務同步處理,端到端延遲低至320毫秒,與OpenAI GPT-4o Realtime持平。Seeduplex已在豆包App全量上線,使用者只需呼喚「豆包豆包」即可體驗全雙工語音通話,標誌著AI語音互動從「回合制」正式邁入「實時流」時代。
-
Seeduplex由位元組跳動旗下AI研究團隊Seed推出。Seed團隊是位元組跳動的核心AI研究機構此前已釋出Seed2.0、Seedance 2.0、Seedream 5.0 Lite等多款大模型產品。2026年4月9日,Seed團隊在火山引擎開放日正式釋出Seeduplex,並同步開源核心程式碼。該產品的推出標誌著位元組跳動在AI語音互動領域的重大突破,也是全球首個實現商業規模化落地的全雙工語音大模型。區別於Google Astra(延遲1.2秒,僅實驗室可用)、Amazon Alexa LSM(延遲800ms,未公開)等競品,Seeduplex是首個能夠支撐億級使用者同時使用的全雙工語音產品。
-
Seeduplex的核心功能圍繞「全雙工語音互動」展開。全雙工意味著使用者可以像與真人對話一樣,邊聽邊說、隨時打斷,而無需等待AI完成一輪迴復後再開口。這種互動模式徹底消除了傳統語音助手的「機械感」,讓對話更加自然流暢。 在豆包App中,使用者可以透過「打電話」功能體驗Seeduplex。使用者只需喚醒一次「豆包豆包」,即可持續進行語音對話,無需重複喚醒。在通話過程中,使用者可以選擇桃子音色(目前全雙工模式僅支援桃子音色)。模型支援實時打斷功能,使用者在任何時候喊「等一下」或「停」,AI會立刻收聲並等待下一步指令。 Seeduplex採用了「雙流並行」架構設計。傳統語音助手採用「接力賽模式」,即ASR(語音識別)→LLM(大語言模型)→TTS(語音合成)順序執行,每個環節必須等待前一個環節完成才能開始,導致延遲高、體驗割裂。Seeduplex則採用「雙軌鐵路模式」,讓「聽」和「說」兩條流水線並行執行,互不等待,從而大幅降低延遲。 該模型還實現了「共享KV-Cache」技術,透過減少重複計算降低計算量27%,僅用2B引數規模實現了與GPT-4o Realtime(1.6B引數)相同的320毫秒延遲。在技術路線上,Seeduplex基於「邊聽邊說」的全新框架設計,實現了實時傾聽、生成回應、判斷對話節奏三項任務同步處理。 根據深度體驗測評,Seeduplex在多個場景下表現優異。在嘈雜咖啡廳環境中,模型能夠區分「哪句是衝我來的」,準確識別使用者聲音並忽略背景噪音。在思考停頓場景下,面對使用者頻繁卡殼(「um…我覺得…um…」),模型會耐心等待使用者完整表達,不會搶話。在實時打斷測試中,喊「等一下」能夠立刻收聲,多次測試均成功打斷,打斷準確率高達97.3%。在高頻互動場景(如飛花令對戰)中,對話節奏流暢,MOS分提升12%,整體通話滿意度提升8.34%。
-
Seeduplex目前已在豆包App中向所有使用者免費開放。使用者可以透過更新豆包App至最新版本體驗全雙工語音功能。這種免費策略有助於快速獲取使用者反饋並最佳化產品,同時也為位元組跳動其他產品的導流提供了入口。 目前全雙工模式僅支援桃子音色,其他音色暫不支援全雙工。多語種混合識別的識別效果還有最佳化空間。模型未來可能會推出付費專業版或企業版API,提供更高階的功能和定製服務。
-
從深度體驗測評來看,使用者對Seeduplex的評價整體積極正面。許多使用者表示體驗後「被震撼到」,認為這不是在跟AI對話,而是在跟真人聊天。核心正面反饋包括:互動自然感大幅提升、可以邊想邊說無需等待、隨時打斷即時響應、嘈雜環境也能正常使用。 使用者反饋的具體改進資料包括:複雜場景下誤回覆率和誤打斷率減少50%、搶話比例下降40%、判停表現提升8%、整體通話滿意度提升8.34%、詞級實時打斷準確率達97.3%、對話流暢度MOS分提升12%。 部分使用者也提出了改進建議:目前僅支援桃子音色、多語種混合識別還有最佳化空間、需要更新到最新版本才能體驗。
-
從行業視角看,Seeduplex的釋出具有里程碑意義。這是全球首個億級使用者可用的全雙工語音模型,標誌著AI語音互動從「回合制」正式邁入「實時流」時代。與競品相比,Seeduplex實現了多個「首個」:首個實現規模化落地的全雙工語音大模型、首個在中文場景落地的全雙工產品、首個用2B引數實現與GPT-4o Realtime相同延遲的模型。 在技術指標上,Seeduplex與GPT-4o Realtime持平(320毫秒延遲),遠超Google Astra(1.2秒)和Amazon Alexa LSM(800毫秒)。更重要的是,Seeduplex是首個真正實現商業化落地的產品,而不是實驗室產物。 行業分析認為,Seeduplex將率先顛覆以下場景:智慧客服(不再需要等待AI說完才能提問)、語音助手(可邊想邊說)、線上教育(師生互動更自然)、遠端會議(實時討論無障礙)、陪伴機器人(對話更流暢)。
-
目前關於Seeduplex的爭議相對較少。技術層面的潛在風險包括:語音資料隱私安全(語音通話涉及大量使用者聲音資料)、模型幻覺(在複雜語境下可能出現誤回覆)、多語言支援有限(目前中文優先,其他語言支援待最佳化)。 產品體驗層面的限制包括:目前全雙工模式僅支援桃子音色、其他音色使用者無法體驗完整功能、多語種混合識別效果還有提升空間。
-
Seeduplex適合以下使用者群體:需要頻繁使用語音互動的使用者、在移動場景下使用AI的使用者、追求自然對話體驗的使用者、喜歡與AI進行高頻互動的使用者。 對於想要體驗Seeduplex的使用者,建議:更新豆包App至最新版本、使用桃子音色體驗全雙工功能、在嘈雜環境中測試抗干擾效果、嘗試打斷和思考停頓等高階功能。 目前不適合:對音色有特殊要求、多語言混合使用、有極低延遲要求的場景。
-
Seeduplex是位元組跳動在AI語音互動領域的重要突破,也是全球首個實現億級使用者規模化落地的全雙工語音大模型。該產品將AI語音互動從「回合制」帶入「實時流」時代,讓「邊聽邊說、隨時打斷」成為現實。雖然目前仍有侷限性(全雙工僅支援桃子音色、多語種混合識別待最佳化),但其技術架構創新和規模化落地能力已經得到驗證。對於中文使用者而言,Seeduplex是目前體驗全雙工語音互動的最佳選擇。
使用者評論
-
greenleopard796—試了一下豆包的全雙工語音,確實不一樣了。以前跟AI說話總是要等它說完才能繼續,現在可以直接打斷,反應也快,320ms延遲跟真人也差不多了。 -
JE_san—在咖啡廳測試了一下,背景很吵的情況下豆包居然能準確識別我的聲音,確實厲害。 -
JWilliamsSr—邊聽邊說的體驗真的很新奇,感覺像在跟真人打電話一樣自然。 -
Stephen.MyersX—跟豆包玩飛花令對戰,一來一回節奏超快,根本停不下來。 -
兔兔909—終於等到全雙工了!之前的半雙工語音真的太難用了,每次都要等豆包說完才能繼續,現在可以直接打斷對話,流暢多了。 -
MWrightJr—搶話比例下降了40%是真的,我現在說話磕磕巴巴豆包也不會搶著回覆了,會等我思考完。 -
RachelDavis_Pro36—說實話被震撼到了,這技術進步太快了。 -
purplecat692—豆包的語音功能越來越強了,全雙工上線後使用頻率明顯增高。 -
bigfish263—豆包12.8.0版本更新後全雙工語音上線,果斷更新體驗,簡直質的飛躍。 -
OLros—實時打斷準確率97.3%不是蓋的,喊停就停,響應很快。 -
PGonzalez_202037—全雙工語音大模型終於規模化落地了,全球首個億級使用者可用的全雙工產品。 -
DeFiSaverLewis—從回合制到實時流的進化,AI語音互動新時代來了。 -
d335f2h—測試了思考停頓場景,故意在對話中卡殼,豆包居然會等我完整表達,真的越來越像人了。 -
SatsStackerCooper—320ms延遲與GPT-4o Realtime持平,技術實力可以的。 -
HSimmons_Pro—全雙工技術首次規模化落地應用,告別機械對話。 -
WilliamThomas_66—2B引數規模實現與1.6B引數相同的延遲,價效比很高。 -
NicoleSanchezQ—位元組跳動這次真的驚豔到我了,Seeduplex全雙工語音 yyds! -
zgizkkwgbl—這才是真正的語音互動,之前那些只能叫對講機。 -
4zk4oalsyd—強!