Gemini Omni Flash

Google DeepMind の任意モーダル入力、会話型編集を備えたネイティブ マルチモーダル ビデオ生成モデル

詳細レポート

  • Gemini Omni Flash は、Google DeepMind が「Omni」モデル ファミリーで発売した最初の製品です。これは、2026 年 5 月 19 日の Google I/O 2026 でリリースされました。Gemini の推論機能とネイティブ マルチモーダル生成を組み合わせ、テキスト、画像、オーディオ、ビデオの任意の組み合わせを入力として受け入れ、同期されたネイティブ オーディオを含む 720p ビデオを出力します。他の Wensheng ビデオ ツールと比べて際立っているのは、「会話型マルチラウンド編集」です。自然言語を使用して文ごとに編集すると、画像内の文字、光と影、シーンの記憶が一貫して保持されます。 Gemini App、Google Flow、YouTube Shorts を通じて消費者に提供され、2026 年 6 月 30 日には開発者向けのパブリック ベータ API もオープンしました。

  • Omni は、Gemini を「完全にネイティブでマルチモーダル」にする Google の取り組みにおける重要なステップです。公式声明は「ビデオを始めとして、あらゆる入力からあらゆるものを作成する」です。ビデオは実装される最初の出力形式にすぎず、将来的には画像や音声などのあらゆるモードに拡張される予定です。ファミリの位置付けという点では、Omni Flash は軽量、高速、安価なモデルであり、そのベンチマークはフラッグシップの Veo 3.1 ではなく、独自の Veo 3.1 Fast です。ロードマップでは明らかに、より強力な Omni Pro がまだ残っています。モデルは、JAX および ML Pathways を使用して Google TPU によってトレーニングされ、アーキテクチャはトランスフォーマーに基づくネイティブ マルチモーダル モデルです。 リリースのリズムに関しては、コンシューマー版は5月19日にGemini AppとYouTubeでローンチされ、開発者パブリックベータAPI(モデルIDはgemini-omni-flash-preview)は6月30日にGemini API、Google AI Studio、Vertex AIを通じてローンチされる予定です。DeepMindは7月5日頃に公式モデルカードをリリースしましたが、これまでのところ正式な評価スコアは公開しておらず、APIが開発者と企業顧客に公開されるまでベンチマークは残されています。

  • 核となるゲームプレイは「any-to-any」です。ある推論では、テキスト プロンプト、参照画像 (最大約 7 枚)、ビデオ、および音声が混合され、統一された理解の後に一貫したビデオが生成されます。現在の出力は 720p、3 ~ 10 秒の 24fps クリップで、16:9、9:16、1:1 の比率をサポートしており、オーディオは後合成ではなく、画像と同じパスでネイティブに生成され、話し言葉、効果音、BGM は自然に同期されます。 最も注目すべき機能は、Interactions API 上で実行される会話型編集です。これは、previous_interaction_id フィールドに依存して、前のラウンドの結果を次のラウンドにリンクします。ビデオを再アップロードする必要はありません。 「背景を暖かいキッチンに変更する」または「キャラクターを動かさずにズームアップする」だけです。モデルは移動したくないパーツを保持し、名前を付けたパーツのみを変更します。これにより、キーフレーム タイムラインをチャットにドラッグすることから「編集」が行われます。これが、Runway、Pika、Kling などのツールと比較した最大の違いです。 Googleはまた、「最初にNano Banana 2 Liteを使用して静止フレームを生成し、次にそれをOmni Flashに渡して移動する」という画像からビデオへのパイプラインをデモンストレーションするために、3つのリミックス可能なデモアプリ(Anywhere、Space Lift、Omni Product Studio)を作成しました。各ビデオには、Gemini アプリ、Chrome、検索で確認できる目に見えない SynthID 電子透かしが付いています。

  • 消費者側では、Gemini Omni Flash は Google AI Plus、Pro、Ultra の加入者 (Gemini App および Google Flow 経由) に無料で、YouTube Shorts と YouTube Create も 18 歳以上のユーザーには無料です。 Googleは2026年6月にAI Plusの月額料金を7.99米ドルから4.99米ドルに値下げするが、Proは19.99米ドルのままで、Ultraは100米ドルと200米ドルの2段階に分けられる。 Flow の月間ポイント プールは Plus 200、Pro 1000、Ultra 10,000 ~ 25,000 です。 開発者 API には無料のファイルはなく、ビデオの秒数に基づいて課金されます。720p は約 0.10 米ドル/秒、トークンに換算されます。ビデオ出力は 17.50 米ドル/100 万トークン、入力 (テキスト/画像/オーディオ/ビデオ) は 1.50 米ドル/100 万トークン、720p は 1 秒あたり約 5792 出力トークンです。入力付きの 8 秒クリップの料金は約 0.85 ドルです。 Google Flow では、Omni Flash の 1 世代で 4s=15、6s=20、8s=25、10s=30 ポイントが消費され、動画の編集とアップロードには一律 40 ポイントがかかります。公式 API 入口チャネルは、AI Studio と Vertex AI の 2 つだけです。 2 つの SDK と認証システムには互換性がありません。エンタープライズ展開の開始には 30 ~ 60 分かかります。

  • 利用したことのあるクリエイターは総じて「画質」よりも「編集サイクル」に驚きを感じています。 Gemini アプリでは、レンズの変更、背景の変更、オブジェクトの追加に自然言語が使用されており、文字の一貫性が非常によく維持されています。あるレビューによると、2 回連続の編集を行った後、同じ赤いダウン ジャケット、同じ顔、同じ髪のディテールが、異なる照明を使用した新しいシーンにきれいに継続されました。既存の素材を放り込んで、人の意見に従って変えて、納得がいくまで変えていく。このワークフローは、「満足できない場合にセクション全体をやり直す」よりも大幅に優れていると考えられます。 否定的なフィードバックがいくつかの場所に集中していました。 1 つ目は割り当てと制限です。コミュニティの多くの人々が、生成の数と期間が厳しいことに不満を抱いていました。わずか 5 つのビデオを生成しただけでクォータが枯渇し、Pro モードと Flash モードが使用できなくなったと報告する人もいます。次に、間違った編集も世代クレジットを消費します。慎重にテストすると、予想よりも早く燃えやすくなります。第三に、セキュリティフィルタリングが厳しすぎるため、一部のブラウザや携帯電話ではビデオがフリーズして再生できないというユーザビリティのバグがあります。

  • サードパーティの Arena ブラインド テストでは、Omni Flash テキストベースのビデオが 1527 の Elo スコアで 1 位にランクされ、Tusheng Video が 1475 Elo と Byte Seedance 2.0 で 1 位にランクされ、上限が大幅に引き上げられました。ただし、Google 自体は公式のベンチマークを発表したことがないため、「数値的リーダーシップ」は現在主にコミュニティによるブラインド テストによってサポートされており、メディアは一般にこれについて留保しています。 業界のより冷静な判断は、Omni Flash は「高速で安価なビデオ ファイル」であり、Google の最良のビデオ モデルではないということです。同じステージで比較した後、本格的な AI ビデオ ユーザーは、複雑な動き、戦闘、物理的一貫性の点で、まだ Seedance 2.0 に遅れをとっていると考えています。ジェンガ レンガはどこからともなく消えたり変形したり、ターニング ポイントで理由もなくボールが跳ね上がったり、物理学は厳密に解決されているというよりも「見た目は合理的」です。その価値は「最も美しいショットをゼロから生成する」ことではなく、「既存のクリップに基づいて制御可能な反復」というワークフローにあります。

  • 最初に矢面に立たされるのは、ディープフェイク性とコンテンツの信頼性です。このモデルは実際のカメラに近いビデオを生成できるため、SynthID などの AI 識別子が必須になっています。議論はすぐに映画やテレビ業界、VFX、プリビズ、さらにはロボット シミュレーションの分野にまで広がりました。それがクリエイティブなツールなのか、それともビデオエコシステムをさらに汚染するのか、二極化しています。 地域およびコンプライアンスの制限にも注目する価値があります。公式文書には、アップロードされたビデオの編集機能は欧州経済領域、スイス、英国では利用できず、米国の一部の州も除外されていると記載されています。未成年者を含む画像は、上記の地域にアップロードすることを禁止されています。企業アクセスにはさまざまなルールがあります。個人アカウントには Google AI パッケージが必要で、職場または学校のアカウントはワークスペース認証の要件を満たしている必要があります。多数の企業ユーザーがリリース期間中にロックアウトされます。 もう 1 つのタイプのリスクは、模倣と混乱です。市場には公式の APK、ログイン ポータル、またはデスクトップ クライアントはありません。 「geminiomni apk」や「ダウンロード」などの検索では不法占拠サイトが表示されます。 2026 年 7 月初旬の時点で、モデル名検索のトップページに少なくとも 1 つの非公式ドメイン名がランクインしています。さらに、このモデル カードの 3 つの既知の欠点 (マルチステップ編集の一貫性、複雑なモーション シーン、画面内の正確なテキスト) はまだ解決されておらず、中国語、日本語、その他のテキストのレンダリングが特に弱いです。

  • 既存のビデオに基づいて環境、カメラの位置、スタイルを変更し、被写体を変更しないようにしたい場合は、現時点では Omni Flash が最も便利なオプションです。 「1 つのシーンと 1 つの意味をすぐに実装できる」短いビデオ、製品のデモンストレーション、ポピュラーな科学の説明に特に適しています。 Nano Banana 2 Lite と組み合わせて使用​​すると、「最初に静止フレーム、次に移動」パイプラインを作成すると、素晴らしい体験が得られます。 最も見事なショット、強力な動画品質、またはゼロからの長い物語を追求する場合は、Seedance 2.0、Kling 3.0、および Veo 3.1 が多くのスタイルでさらに安定しています。製品、SaaS、または運用パイプラインに取り組み、バックエンド API に接続したいチームは、現在、Gemini API / Vertex AI のパブリック ベータ チャネルが成熟するまで待つことしかできず、正式にサポートされている統合パスはありません。本格的なクリエイターは、ボリュームを増やす前にまずウルトラ レベルを選択し、「失敗も差し引かれる」という試行錯誤のコストを確保しておくことをお勧めします。

  • Gemini Omni Flash は画質の限界ではないかもしれませんが、ビデオ生成を「プロンプトを書き、結果を待ち、満足できない場合はやり直し」から「素材を投入し、変更について話し合い、満足するまで変更する」まで進歩させます。この方向性は正しく、クリエイターの悩みの種を的確に突いています。フラッシュは前菜のようなものです。 Omni Proが画像と音声出力を備えて完成したとき、Omniファミリーに代表されるパラダイムシフトが本格的に始まります。

ユーザーレビュー

  • 头像
    KarenLongK
    もう後戻りはできません。編集プロセスは書き換えられています。

  • 头像
    JJones007
    生成された品質は実用的で見栄えも良いですが、一度に長編映画になることを期待せず、断片に分割してください。

  • 头像
    OMitchellQ5
    この API には無料版がなく、1 秒あたり 0.10 米ドルがかかり、8 秒のクリップは 1 ドル近くかかります。開発者は AI Studio または Vertex を使用する必要があります。

  • 头像
    JJimenezJr
    無料! YouTube ショートは直接再生されます。

  • 头像
    Ann.GutierrezX
    欧州連合と英国では、アップロードされた動画を編集することはできず、未成年者が含まれる写真も禁止されています。地域制限はかなり面倒です。

  • 头像
    LydiaThomas_202318
    ナノ・バナナの弟、ビデオ版。

  • 头像
    silverzebra287
    冒頭のヴァイオリニストの3連続編集は本当に素晴らしい。ステージからストリートシーン、肩越しショットまで、同じ人物、同じピアノ、そして姿勢が変わっていない。ただし、複数のラウンドを繰り返すと、一貫性が変化し始めます。 One reviewer ran 22 prompts and came to a similar conclusion: short clips are strong in iteration, but long narratives, dense text, and repeated major changes cannot be sustained.専門的な編集ソフトウェアとして使用しないでください。

  • 头像
    LaurenJames
    同じステージで Seedance 2.0 と比較した結果、結論は非常に現実的です。最も美しいショットを最初から生成するには、Seedance の方が安定しています。 but if you need to change the background, camera position, and style based on existing materials, Omni Flash's conversational editing is unique.戦闘シーンでは依然としてシーダンスが勝者であり、オムニの格闘技の動きは遅く、飛沫はぼやけています。したがって、神話ではなく、位置付けを明確にしてください。

  • 头像
    AdamMadsen
    1週間使ってみて一番実感したのは、オムニフラッシュが「変わる動画」をチャットにしてくれるということです。私はストリート写真をアップロードし、「背景をビーチの夕日に変更して、さらにズームしてみましょう」と言いました。実際には変更されましたが、キャラクターはまだ同じです。ただし、指示は非常に正確に書かれなければなりません。一度「暖かい光の角度」を見逃してしまい、日没から深夜まで一気にジャンプしてしまいました。この経験は、調子の悪いスポーツカーを運転しているようなものでした。新鮮でしたが、道路状況を自分で把握する必要がありました。

  • 头像
    syrl3e
    Google Flow で使用するのは、Gemini アプリよりもはるかに正式です。 Flow は、参照ビデオをアップロードし、クリップを切り取り、再生成する前に素材の使用権を確認できるプロジェクト ワークベンチです。継続的な反復に適しています。アプリの入り口は軽量のテスト領域に似ており、頻度と可用性は地域のサブスクリプションによって影響されます。商用プロジェクトを行う場合は、素材の使用権の表示に注意し、著作権の境界を事前に確認してください。

  • 头像
    Janet.Turner_Pro
    本格的なクリエイターは、割り当て量に注意する必要があります。 Google は、1 日あたりのメッセージ数をコンピューティング能力の消費量に変更しました。オムニ ビデオは特に割り当て量が多くなります。 1 ~ 2 時間集中的に使用すると、5 時間のクールダウンが発生します。良いニュースは、その後緊急事態が解除され、失敗したリクエストに対してクォータが差し引かれなくなることです。使用量ダッシュボードと従量課金制の AI ポイントも追加されました。ただし、無料版は基本的に YouTube ショートに限定されます。

  • 头像
    Amber.Scott36947
    物理的な一貫性により、車は横転し、ボールは曲がり角で意味もなく跳ね上がり、ジェンガのブロックがどこからともなく消えてしまうこともあります。世界モデルとは言われていますが、実際は見た目は合理的で、実際に方程式を解くわけではありません。

  • 头像
    DylanMurray369
    吹き替えとナレーションの同期が時々半拍遅いこともあり、1つのモデルに多機能が詰め込まれすぎており、音楽や音声放送は専用モデルほど鮮明ではありません。

  • 头像
    TIkra
    もう、Omni Flash の会話型編集には戻れません。

  • 头像
    DebraRodriguez27
    アリーナブラインドテストでは、Liwen Sheng Video が 1,527 Elo で 1 位、Tusheng Video が 1,475 Elo と Seedance 2.0 で 1 位となりました。このスコアは確かに上限を引き上げていますが、Google 自体は公式のベンチマークをリリースしていないため、現在リードは主にコミュニティのブラインドテストによってサポートされています。

  • 头像
    Lisa_Powell369
    画像の鮮明さには問題ありませんが、よりデジタル的に読み取られ、十分に映画的ではなく、速い動きはまだ少し壊れています。

  • 头像
    Jean_Baker369
    SynthID のウォーターマークは表示されません。 AIによって生成されたかどうかはGeminiアプリやChromeで確認できます。少なくともディープフェイク部分にはマークが付いています。

  • 头像
    JMendozaII
    ウォートン社のイーサン・モリック氏は、「ラッコ、スピリット航空、シェイクスピアのピザ作りロボット」などの複雑なプロンプトをテストに使用し、スムーズな移行と高度なコマンド順守を実現しました。彼自身も、真にスマートなモデルはビデオを直接読み込むことができ、より創造的なスペースを確保できると述べており、私もそれに同意します。

  • 头像
    孔昊
    短いビデオの生成には Pro 割り当ての 3 分の 1 が消費され、毎回変更するとさらに半分の費用がかかりますが、これでは十分ではありません。

  • 头像
    墨染255
    本人の顔は直接ボール状にぼかされ、背中を数えることしかできなかった。この安全機構は保守的すぎました。

  • 头像
    Adam.Stewart_668
    10 秒の上限は短いコンテンツに適しています。いくつかの段落に分割して、さまざまな冒頭部分をすばやく試してみると、スムーズに機能します。

  • 头像
    SThompson_Plus
    一度失敗すると、5時間のノルマが燃え尽きてしまいます。このバグは当時多くの人に迷惑をかけましたが、後に Google が修正しました。

  • 头像
    Michelle.ThompsonZ
    ストーリーボードも自動的に追加されます。カットシーンも書かなかったし、リズムも途切れてしまった。短編映画はとても実践的です。

  • 头像
    PRper
    AI Plus は月額 4.99 ドルとなり、以前よりも安くなり、参入障壁が低くなりました。