深度報告
-
Vidu S1 是生數科技在 2026 全球數字經濟大會上(7 月 3 日)正式釋出的實時互動影片基礎模型,把 AI 影片從「離線生成一段成片」推進到「持續線上、邊聊邊生成」的實時互動形態。它的核心指標是 540P(960×540)、穩態 25FPS、峰值 42FPS,端到端延遲普遍壓到 3 秒以內,支援語音實時控制角色動作、單張圖即時建立數字人、無限時長連續互動。截至目前它已開放小規模線上內測與 API 商用接入,主要面向情感陪伴、虛擬偶像、互動直播、線上教育、車載助手等場景。
-
生數科技由清華大學朱軍教授創立,是國內較早專注「通用世界模型」路線的 AI 影片公司,旗下 Vidu 系列此前已憑圖生影片、多主體一致性、參考生影片等功能在創作者圈子裡站穩腳跟。Vidu S1 由朱軍帶隊的 00 後博士生張金濤擔任研發負責人完成全鏈路開發,定位為通用世界模型在「實時互動式生成」方向上的關鍵落子。2026 年 7 月 3 日釋出當天,生數科技還入選了北京軟體和資訊服務業協會「2025 年北京市數字經濟標杆企業」中的新模式新應用標杆企業,同期也有頭部車企宣佈其 2026 款旗艦車型將首發搭載 Vidu S1 車載定製版。
-
Vidu S1 最大的變化是互動正規化。傳統影片大模型是「提交請求 → 等待生成 → 播放結果」的離線流程,而 S1 改成了「實時語音輸入 → 逐幀生成 → 持續播放 → 持續響應」。模型在播放當前幀的同時已經在計算後續幀,新語音指令可以即時注入後續生成,讓畫面隨對話實時變化。 在角色建立上,S1 把門檻砍到極低:使用者只需上傳一張參考圖(真人、動漫、萌寵、遊戲角色均可),模型當場理解身份、外觀與視覺風格,實時生成同步的口型、表情、眼神、手勢和肢體動作,無需建模、繫結、口型適配或角色專屬訓練。聲音層面支援系統音色或錄製自己的聲音做定製,保證視覺身份與發聲身份一致。 實測裡,語音控制行為是最受關注也最有落差的能力。簡單指令如「舉起左手」「推眼鏡」「撩頭髮」多數能流暢完成,複合指令(如左手整理頭髮、右手整理衣襟、雙手比心)能勉強做到但不夠到位;而轉身、跳舞、下蹲等連續大幅動作,系統層面似乎被限制,角色只會小幅晃動,被使用者調侃「嘴上答應得積極,身體只象徵性晃兩下」。延遲客觀存在——講完一句往往要停頓一下角色才回應,放在影片生成裡算快,放進視訊通話就顯得明顯,且角色一直盯著你容易讓人有壓迫感。
-
S1 的實時互動按生成時長扣費。公開資料顯示 API 計費約為 3 積分 / 2 秒,每 6 秒扣除一次、按 2 秒週期向上取整,新使用者贈送 1000 點免費試用積分(約合 11 分鐘實時互動),可體驗完整 API、所有聲音與語言。積分單價約 0.03125,折算約 2.8 元 / 分鐘,一小時約 168 元;內測階段也有每日基礎免費互動時長(帶水印、有限幀率、不可商用)。企業側提供專屬 SLA 套餐,可購高併發、去水印、42FPS 全開許可權及定製角色 / 聲音克隆接入。目前沒有固定月度會員,按實際互動時長消耗積分。
-
正面聲音集中在「零門檻」和「像真人」。不少體驗者認為單圖建角色、語音驅動全維行為、無限時長連續對話這三點是代際優勢,聊一整晚也不會狀態閃退,口型能跟上、記憶能延續前文對話,做 AI 陪伴和虛擬偶像很有「活人感」。有測試者搭建的「高冷學霸」數字人講題效果好、互動暖,能記住前面聊過的內容並在後續小結。 負面反饋則集中在真實感和延遲。多家媒體實測指出,複雜動作會糊弄、角色描述和實際行為脫節、錄製自己的聲音偶發不生效而隨機切聲線;半雙工體驗(類似對講機,你說一句它一句,打斷它不會閉嘴)被拿來和豆包等純語音產品對比,認為 10 秒級延遲在「人機戀陪伴」場景裡太前現代。網易雷科技一篇體驗文標題直接寫「問題比想象的要多」,點名延遲大、動作寫死、體型和動作不匹配、表情激動時牙齒臉頰偶爾不協調。
-
行業普遍把 S1 視為影片生成賽道從「生成質量競爭」轉向「實時互動競爭」的標誌性產品。相比 HeyGen、D-ID、Synthesia 等以離線數字人見長的競品,S1 在互動深度和持續能力上有代際優勢,尤其適合需要「真人感」的陪伴、直播和 NPC 場景;但在 4K 影視級畫質、精確面部特徵調整上仍是短板,離線長片製作反而不如 HeyGen / Synthesia 的更高解析度與精細編輯。技術側,它依託生數自研的 TurboDiffusion 推理加速框架與 TurboServe 流式部署引擎,疊加 SageAttention、SLA、SpargeAttention 等注意力最佳化與模型量化,才在消費級顯示卡上把實時影片生成的延遲壓到及格線。有評論將其與同期 MaineCoon Chat Mode 並列,認為實時影片數字人產品整體還處在「前現代」階段,但方向明確。
-
主要爭議集中在體驗預期管理:官方宣傳的「語義感知、意圖理解、對應安撫反應」與實測存在落差,語音控制行為在複雜指令上不穩定,容易讓使用者產生「被忽悠」感。半雙工、較高延遲在陪伴場景的體感短板,也引發「虛擬陪伴是否真的 ready」的討論。此外,540P 解析度對需要高畫質出鏡的電商直播、影視宣發仍是硬限制;角色細節可控性不如 3D 建模方案,也意味著它在高精度專業製作上暫時讓位。
-
它適合:想低成本做專屬數字人的個人創作者、需要 24 小時線上的直播團隊、做 NPC 實時互動的遊戲開發者、需要品牌數字人客服的企業,以及想快速驗證實時陪伴 / 教育產品的團隊。不太適合:追求 4K 影視級畫質的專業影視製作、需要複雜多人物大場景或 3D 高精度建模的專案。 使用建議上,個人創作者先用免費額度測試動作與聲音匹配度,再決定是否商用;電商、教育等商用團隊直接走企業 API 套餐更穩。替代方案方面,純語音陪伴可選豆包等低延遲產品,離線數字人短片製作可選 HeyGen、Synthesia。
-
Vidu S1 把 AI 影片從「拍一段短片」變成「開一通實時數字人通話」,單圖零訓練、語音驅動全維行為、無限時長互動三點確實構成代際差異,但延遲、動作可控性與真實感仍是它走向大眾陪伴前必須跨過的坎。
使用者評論
-
BillyBaker_2023—單圖就能捏數字人,門檻真的低。 -
龍昊—540P 畫質確實糊,拿它當視訊通話還行,當正經出片就別想了。 -
錢怡鳳—簡單指令「舉手」很順,複合指令就勉強,複雜動作直接糊弄。 -
郭丹丹—體驗下來延遲是真不小,你說完一句它還要愣一下才開口。放進影片生成算快,可一旦當成視訊通話,這種停頓就特別出戏。 -
傅彤晨—我錄了自己的聲音想做定製音色,結果完全沒生效,畫面裡隨機切男女聲,看著相當詭異,這點希望能修。 -
Patrick.Gray—讓它「我心情不好」它會做安撫動作,理論上感知情緒挺酷,但實際跟官方宣傳的理想狀態還有落差,別指望太智慧。 -
Virginia.Bell00702—算了一筆賬有點勸退:實時互動按 2 秒扣 3 積分,折算差不多 2.8 元一分鐘,一小時就是一百六。我前後砸了兩千多積分、一千多秒連線才把整套多模態閉環評測跑完,個人玩玩免費額度夠了,但真要拿來做電商直播或者陪伴,長尾成本得先算清楚,不然幾分鐘就燒沒了。建議商用團隊直接走企業 API 套餐,別拿免費額度硬扛。 -
AXmoo—用自動化指令碼接了 API 跑壓測,預設角色庫從最早 6 個擴到 11 個,迭代速度挺猛。兩組長時對話下來畫面基本釘在 25 幀、零抖動,聊久了臉也沒漂,工程穩定性確實比想象中穩。我用 Claude 一個多小時就跑通了接入,連哈蘭德和沃齊尼亞都拉來做了中英文壓測。就是接入要啃文件加阿里雲 ARTC SDK,對純小白來說門檻不低,但願意折騰的程式設計師基本一天能上手。 -
JRogersZ—消費級顯示卡就能跑 540P 實時生成這點很香,小團隊和個人創作者不用堆 A100 也能落地,本地部署門檻被砍了一大截。 -
ticklishgorilla525—跟 HeyGen、D-ID 比的話,S1 在互動深度和持續對話上確實是代際領先,但 540P 解析度擺在那,正經影視級製作還是得靠離線方案,定位要分清楚。