Vidu S1

生数科技发布的实时交互视频基础模型,支持语音实时控制角色、单图建数字人、无限时长连续互动

詳細レポート

  • Vidu S1 は、2026 年世界デジタル経済会議 (7 月 3 日) で Shengshu Technology によって正式に発表されたリアルタイム インタラクティブ ビデオ基本モデルです。 AI ビデオを「完全なビデオのオフライン生成」から「継続的なオンライン、チャットと生成」のリアルタイム インタラクティブ形式に進化させます。その中心となるインジケーターは 540P (960×540)、定常状態 25FPS、ピーク 42FPS です。エンドツーエンドの遅延は通常 3 秒未満に短縮されます。キャラクターのアクションのリアルタイム音声制御、1 枚の写真でのデジタル人物の即時作成、無制限の継続的なインタラクションをサポートします。これまでのところ、主に感情的な交友関係、バーチャルアイドル、インタラクティブなライブブロードキャスト、オンライン教育、車内アシスタントなどのシナリオを対象に、小規模なオンライン内部テストとAPI商用アクセスをオープンしている。

  • Shengshu Technology は清華大学の Zhu Jun 教授によって設立されました。同社は、「ユニバーサルワールドモデル」路線に焦点を当てた、中国で最も初期のAIビデオ企業の1つです。同社の Vidu シリーズは、グラフィック ビデオ、複数の被写体の一貫性、リファレンス ビデオなどの機能により、クリエイター サークルに確固たる地位を確立してきました。 Vidu S1 は、Zhu Jun が率いる 2000 年代以降の博士課程学生、Zhang Jintao によってフルリンク開発を完了するための研究開発ディレクターとして開発され、一般的な世界モデルの「リアルタイム インタラクティブ生成」の方向における重要なステップとして位置付けられました。 2026年7月3日のリリース当日、Shengshu Technologyは北京ソフトウェア情報サービス産業協会の「2025年北京デジタル経済ベンチマーク企業」の新モデルと新アプリケーションのベンチマーク企業にも選ばれた。同時に、大手自動車会社は、2026年の主力モデルにVidu S1のカスタマイズ版を初めて搭載すると発表した。

  • Vidu S1 の最大の変更はインタラクション パラダイムです。従来の大規模ビデオモデルは「リクエスト送信→生成待ち→再生結果」というオフライン処理だったが、S1は「リアルタイム音声入力→フレーム単位生成→連続再生→連続応答」に変更された。モデルは現在のフレームの再生中にすでに後続のフレームを計算しており、新しい音声コマンドを後続の世代に即座に挿入できるため、会話に合わせてリアルタイムで画像を変更できます。 キャラクター作成に関しては、S1 はしきい値を非常に低いレベルにカットします。ユーザーは参照画像 (現実の人物、アニメーション、かわいいペット、またはゲームのキャラクター) をアップロードするだけで、モデルはその場でアイデンティティ、外観、ビジュアル スタイルを理解し、モデリング、バインド、口の形状の適応、またはキャラクター固有のトレーニングを必要とせずに、同期した口の形状、表情、目、ジェスチャー、体の動きをリアルタイムで生成します。サウンドレベルでは、システムの音色やカスタマイズのための自分の声の録音をサポートし、視覚的なアイデンティティがボーカルのアイデンティティと一貫していることを保証します。 実際のテストでは、音声制御の動作が最も注目を集め、最もギャップが大きい能力です。 「左手を上げる」「メガネを押す」「髪をかき乱す」などの簡単なコマンドは、ほとんどスムーズに完了できます。複合コマンド(左手で髪を整える、右手で服を整える、心臓と手を比較するなど)は最低限実行できますが、十分ではありません。ただし、回る、踊る、しゃがむなどの連続した大きな動作はシステムレベルで制限されているようで、キャラクターがわずかに揺れる程度です。ユーザーは「口はポジティブであることを約束しているのに、体は象徴的に2回しか震えない」と嘲笑した。遅延は客観的に存在します。文を書き終えた後、キャラクターは応答する前にしばらく停止する必要があることがよくあります。ビデオ生成に使用すると高速ですが、ビデオ通話に使用すると明らかになります。さらに、常にあなたを見つめているキャラクターは、人々に圧迫感を与えやすいです。

  • S1 のリアルタイム インタラクションは、生成時間に基づいて課金されます。公開情報によると、API の課金は約 3 ポイント/2 秒で、6 秒ごとに差し引かれ、2 秒周期で切り上げられます。新規ユーザーには 1,000 の無料トライアル ポイント (約 11 分間のリアルタイム インタラクション) が与えられ、完全な API、すべてのサウンド、言語を体験できます。ポイントの単価は約0.03125で、1分あたり約2.8元、1時間あたり約168元に相当します。内部テスト段階では、毎日の基本的な無料インタラクション時間もあります (ウォーターマークあり、制限されたフレーム レート、商用利用不可)。企業側は、高同時実行性、透かし除去、42FPS のフル権限、カスタマイズされたキャラクター/音声クローン作成アクセスを購入できる独自の SLA パッケージを提供します。現在、固定の月額会員制はなく、実際のインタラクション時間に応じてポイントが消費されます。

  • 肯定的な声は「敷居ゼロ」と「本物の人間のよう」に焦点を当てています。多くの経験者は、1 枚の絵でキャラクターを作成すること、音声によるフル次元の動作、無制限の継続的な対話の 3 つの点が世代の利点であると考えています。一晩中チャットしてもステータスは消えず、口の形は維持され、記憶は前の会話を継続できます。 AIのコンパニオンであり、バーチャルアイドルであることには「生きている感」がある。テスターである「冷酷な学者マスター」を構築したデジタル担当者は、講義が上手で、温かいやりとりがあり、前に議論されたことを覚えていて、後でそれを要約することができました。 否定的なフィードバックはリアリズムと遅延に焦点を当てました。複数のメディアによる実際のテストでは、複雑な動きが混乱する可能性があり、キャラクターの説明が実際の行動から切り離され、自分の声の録音が時々機能せず、音声のセリフがランダムにカットされることが指摘されています。半二重エクスペリエンス (トランシーバーに似ており、何かを話しかけると、中断しても黙りません) は、Doubao などの純粋な音声製品と比較されています。 「人間と機械の愛の交際」シナリオでは 10 秒の遅延は現代的すぎると考えられています。 NetEase Lei Technology の体験記事のタイトルには、「予想以上に問題が多い」と直接書かれています。点呼の遅れが大きく、動きが死ぬほど引き込まれ、体型と動きが一致せず、表情が興奮したときに歯と頬が時々一致しない。

  • 業界では一般に、S1 がビデオ生成の軌道を「制作品質の競争」から「リアルタイム インタラクションの競争」に移行させた画期的な製品であると見なされています。 HeyGen、D-ID、Synthesia などのオフラインのデジタル ピープルを得意とする競合製品と比較して、S1 はインタラクションの深さと持続的な機能の点で世代的な利点があり、特に「現実の感覚」が必要なコンパニオンシップ、ライブ ブロードキャスト、NPC シーンに適しています。ただし、4K 映画やテレビレベルの画質と正確な顔の特徴の調整にはまだ欠点があります。オフラインの長編映画制作は、HeyGen/Synthesia の高解像度と精細な編集ほど優れたものではありません。技術面では、Shengshu が自社開発した TurboDiffusion 推論加速フレームワークと TurboServe ストリーミング デプロイメント エンジンに依存し、SageAttendant、SLA、SpargeAttendant などのアテンションの最適化とモデルの定量化を重ね合わせて、コンシューマ グレードのグラフィックス カードの合格ラインまでのリアルタイム ビデオ生成の遅延を削減します。一部のコメントでは、これを同時期のメインクーン チャット モードと並べて、全体的なリアルタイム ビデオ デジタル ヒューマン製品がまだ「前近代的」段階にあると信じていますが、方向性は明確です。

  • 主な論争は、エクスペリエンスの期待の管理に焦点を当てています。公式に宣伝されている「意味的認識、意図の理解、およびそれに対応する快適な反応」と実際のテストの間にはギャップがあります。複雑な指示では音声制御の動作が不安定になるため、ユーザーは簡単に「だまされている」と感じる可能性があります。半二重の体性感覚の欠点とコンパニオン シーンでの遅延の増加も、「仮想コンパニオンが本当に準備ができているのか」という議論を引き起こしました。さらに、高解像度の表示が必要な電子商取引のライブブロードキャストや映画やテレビのプロモーションでは、540P 解像度が依然として厳しい制限となっています。キャラクターの詳細は 3D モデリング ソリューションほど制御可能ではありません。これは、高精度のプロによる制作に一時的に道を譲ったことも意味します。

  • 低コストで独占的なデジタル担当者になりたい個人クリエイター、24 時間オンラインでいられる必要があるライブ ブロードキャスト チーム、リアルタイムで NPC と対話したいゲーム開発者、顧客サービスのためにブランドのデジタル担当者を必要とする企業、リアルタイムのコンパニオン/教育製品を迅速に検証したいチームに適しています。適さない用途: 4K 映画やテレビの品質を追求するプロの映画やテレビ制作、複雑なマルチキャラクター シーンや 3D 高精度モデリングを必要とするプロジェクト。 使用上の推奨事項に関しては、個人のクリエイターは、商業的に使用するかどうかを決定する前に、まず無料のクレジットを使用してアクションとサウンドの一致をテストする必要があります。電子商取引や教育などの商用チームにとっては、エンタープライズ API パッケージを直接使用する方が安定しています。代替手段としては、純粋な音声コンパニオンには Doubao などの低遅延製品が利用でき、オフラインのデジタル ヒューマン ショート フィルム制作には HeyGen や Synthesia が利用できます。

  • Vidu S1 は、AI ビデオを「短いビデオの撮影」から「リアルタイムのデジタル ヒューマン コールの開始」に変換します。単一の画像に対するゼロトレーニング、音声主導のフル次元の動作、および無制限の時間のインタラクションは、世代の違いを構成します。しかし、遅延、アクションの制御性、リアリズムは、大衆の共感を得る前にまだ克服しなければならないハードルです。

ユーザーレビュー

  • 头像
    BillyBaker_2023
    写真だけで人をつねることができるので、本当に敷居が低いです。

  • 头像
    龙昊
    540Pの画質は確かにぼやけています。ビデオ通話に使用するのは問題ありませんが、本格的な映画制作に使用することは考えないでください。

  • 头像
    钱怡凤
    「手を上げる」という単純なコマンドはスムーズですが、複合コマンドはほとんどなく、複雑な動きは混乱するだけです。

  • 头像
    郭丹丹
    経験上、遅延は実際には小さくありません。話し終わると、少しの間呆然としてから話し始めます。ビデオを生成するのは速いですが、ビデオ通話として使用すると、この種の一時停止が特に煩わしくなります。

  • 头像
    傅彤晨
    自分の声を録音してサウンドをカスタマイズしたかったのですが、まったく機能しませんでした。男性と女性の声がランダムに画面に切り込まれており、非常に奇妙に見えました。これが修正されることを願っています。

  • 头像
    Patrick.Gray
    「機嫌が悪い」と言うと、なだめるような動きをしてくれます。感情を察知するのは理論的にはクールですが、実際には役人が掲げる理想の状態とはまだギャップがあるので、あまり賢いことは期待しないでください。

  • 头像
    Virginia.Bell00702
    計算した後、私は少し思いとどまりました。リアルタイム インタラクションでは 2 秒間 3 ポイントが減点されます。これは 1 分あたり約 2.8 元、1 時間あたり 160 元に相当します。マルチモーダル閉ループ評価全体を完了するために、2,000 ポイント以上と 1,000 秒以上の接続を費やしました。個人利用には無料割り当てで十分ですが、電子商取引のライブブロードキャストやコンパニオンシップに本当に使用したい場合は、最初にロングテールコストを計算する必要があります。そうしないと、数分で使い切ってしまいます。商用チームは、無料割り当てを使用する代わりに、エンタープライズ API パッケージを直接採用することをお勧めします。

  • 头像
    AXmoo
    自動スクリプトを使用して API に接続し、ストレス テストを実行しました。デフォルトのロール ライブラリは初期の 6 から 11 に拡張され、反復速度は非常に高速になりました。 2 つのグループが長い会話を行った後、画面は基本的にジッターなしの 25 フレームに固定されました。長時間おしゃべりしていても顔色は変わりませんでした。エンジニアリングの安定性は確かに予想よりも安定しています。クロードを使用すると、1 時間以上で接続が完了しました。ハーランドとウォズニアックに中国語と英語でストレステストをしてもらうこともしました。これにアクセスするには、ドキュメントを読み、Alibaba Cloud ARTC SDK を追加する必要があります。純粋な初心者にとって敷居は低くありませんが、努力する意欲のあるプログラマーであれば基本的には 1 日で始めることができます。

  • 头像
    JRogersZ
    コンシューマーグレードのグラフィックス カードが 540P リアルタイム生成を実行できるのは素晴らしいことです。小規模なチームや個人のクリエイターは、A100 を積み重ねることなく始めることができ、ローカル展開の敷居が大幅に下がりました。

  • 头像
    ticklishgorilla525
    HeyGen や D-ID と比較すると、S1 は確かにインタラクションの深さと継続的な対話において世代のリーダーですが、解像度が 540P であるため、本格的な映画やテレビレベルの制作は依然としてオフライン ソリューションに依存する必要があり、ポジショニングを明確に定義する必要があります。