AIツール2026年8月更新

Gemini Omni Flashとは?1.1でGA・最大40秒に|料金・使い方・Veoとの違いを完全解説【2026年8月最新】

公開日: 2026/07/04
更新日: 2026/08/28
Gemini Omni Flashとは?1.1でGA・最大40秒に|料金・使い方・Veoとの違いを完全解説【2026年8月最新】

この記事のポイント

Gemini Omni Flashとは、Googleの会話型動画生成AI。Gemini Omni 1.1 FlashのGAでシーン延長による最大40秒・360p〜4K対応・1秒0.03〜0.30ドルの解像度別料金に進化。機能・料金・使い方・Veo 3.1との違いを公式情報ベースで解説します。

Gemini Omni Flashは、Googleが提供する「会話しながら動画を作り、会話しながら直す」マルチモーダルAIです。2026年8月27日に後継の Gemini Omni 1.1 Flash が一般提供(GA)となり、シーン延長で累計最大40秒、360p〜4Kの解像度指定、1秒あたり0.03〜0.30ドルの解像度別料金に対応しました。

テキスト・画像・音声・動画を1つの指示でまとめて理解し、音声付きの動画を出力します。従来の動画生成AIのように「気に入らなければ全部作り直し」ではなく、「照明だけ夕方に」「背景だけオフィスに」といった部分修正を対話で積み重ねられるのが本質的な違いです。

この記事でわかること

  • Gemini Omni Flashの正体と、Gemini Omniファミリーでの位置づけ
  • 2026年8月27日の 1.1 Flash(GA)で新しくできるようになったこと
  • 解像度×動画長で実額がわかる料金表と、Veo 3.1シリーズとの価格比較
  • 「360pで試作 → 720pで選抜 → 1080p/4Kで仕上げ」というコストを抑える作り方
  • 10秒×4回の延長で40秒動画を作る具体的な手順
  • 旧モデル gemini-omni-flash-preview の2026年9月30日廃止への対応チェックリスト
  • 日本から使うときの制約(日本語音声の品質・地域制限・提供チャネル)
  • こんな方におすすめ/おすすめしないケース

動画生成AIを自社サービスに組み込みたい開発者・プロダクト担当者、広告やSNS向けの短尺動画を安く量産したいクリエイター、そしてGeminiアプリで手軽に動画を作りたい個人の方を想定しています。

なお、料金・仕様・提供範囲は変更されることがあります。数値は公式ドキュメント・公式ブログをもとに整理しており、公式テキストで確認しきれていない箇所はその旨を明記しています。発注や実装の前には公式ページで最新の値を確認してください。

Gemini Omni Flashとは ― 会話で動画を作り、会話で直すGoogleのAI

Gemini Omniファミリーの生成メディアモデルを紹介するGoogle公式ビジュアル

出典: Google 公式ブログ

Gemini Omni Flashは、Google DeepMindの「any-to-any(任意の入力→任意の出力)」マルチモーダルモデルファミリーGemini Omniのうち、高速な動画生成・会話型動画編集に特化したモデルです。モデルカードでは「ネイティブなマルチモーダル対応を持つTransformerベースのモデル」と説明されており、テキスト・視覚・動画・音声を同時に処理します。

登場から一般提供までの流れは次のとおりです。

時期

出来事

2026年5月

Google I/O 2026 で Gemini Omni ファミリーを発表

2026年6月30日

Gemini API / Google AI Studio / Gemini Enterprise Agent Platform でプレビュー提供開始(gemini-omni-flash-preview)

2026年7月

Google Vids に搭載(テキストによる動画編集・パーソナルアバター)。日本向けは7月23日

2026年8月27日

Gemini Omni 1.1 Flash を一般提供(GA)でリリース。シーン延長・始終点フレーム指定・360pドラフト・1080p/4Kアップスケール・動画リファレンスを追加

2026年9月30日(予定)

旧 gemini-omni-flash-preview を廃止

現在の基本スペックは以下のとおりです。

項目

内容

開発元

Google / Google DeepMind

安定版モデルID

gemini-omni-1.1-flash

旧プレビューID

gemini-omni-flash-preview(2026年9月30日 廃止予定)

ステータス

Gemini API / Google AI Studio では GA。Gemini Enterprise Agent Platform 側のドキュメントは「Preview」表記のため要確認

入力

テキスト・画像・音声・動画

出力

音声付き動画(音声をネイティブに同時生成)

コンテキストウィンドウ

1,048,576 トークン

1回の生成

3〜10秒

動画長の上限

シーン延長で累計最大40秒

解像度

360p / 720p(既定)/ 1080p(アップスケール)/ 4K(アップスケール)

フレームレート

24 FPS

アスペクト比

16:9(既定・横)/9:16(縦)

参照画像

最大7枚

参照動画

最大3クリップ(各3秒以内)

音声リファレンス

非対応

電子透かし

全出力に SynthID(不可視・機械検出可能)

似た名前で「Gemini Omni」という総称も使われますが、実際にAPIで指定して動画を生成できるモデルの実体がこの Flash 系です。ファミリー全体の考え方や発表当初の位置づけはGemini Omniの概要記事で、Geminiというブランド全体の全体像はGeminiとは何かの解説で整理しています。

Gemini Omni 1.1 Flashで何ができるようになったか(2026年8月27日GA)

2026年8月27日のアップデートは、単なるバージョン番号の更新ではなく使い方そのものが変わる規模でした。従来版(6月30日のプレビュー)との差分は次のとおりです。

論点

旧 gemini-omni-flash-preview

新 gemini-omni-1.1-flash

提供ステータス

プレビュー

一般提供(GA)

動画長

最大10秒

1ターン10秒/延長で累計最大40秒

シーン延長

非対応

対応(10秒単位・直前最大10秒を参照)

始点/終点フレーム指定

なし

対応(2枚の画像の間を補間生成)

解像度

720p

360p / 720p / 1080p / 4K

料金

720pの1秒0.10ドルのみ

解像度別(0.03〜0.30ドル/秒)

動画リファレンス

実質使えない扱い

正式機能(最大3クリップ×3秒)

提供先

Gemini API / AI Studio / Enterprise

左記に加え Google Flow・Geminiアプリ・Google Vids へ展開

1. シーン延長で最大40秒まで伸ばせる

最も大きい変更がシーン延長(scene extension)です。生成済みのクリップの末尾に10秒単位で映像を継ぎ足していけるようになり、累計で最大40秒の動画を組み立てられます。

重要なのは参照範囲です。従来型の延長機能は「最後の1フレーム(1秒)」だけを手がかりに続きを描くものが多く、キャラクターの顔や照明がじわじわ変わっていく問題がありました。1.1 Flash は直前の最大10秒分の映像を解析して続きを生成するため、人物の同一性・照明・物語の流れを保ちやすくなっています。

ただし延長できるのは末尾への追記のみです。冒頭に足したり、クリップの途中に別カットを差し込んだりはできません。

2. 始点と終点のフレームを指定して、間を自動生成できる

image_to_video タスクで最初のフレームと最後のフレームの2枚を渡すと、その間の連続したモーションをモデルが補間して生成します。

これが効くのは次のような場面です。

  • 部屋の入口から窓際まで、カメラを一直線にスイープさせたい
  • 商品のロングショットからクローズアップへズームでつなぎたい
  • 開始画像と終了画像を同じにして、切れ目のないループ動画を作りたい
  • カットAとカットBのあいだに、破綻のないトランジションを挟みたい

「どう動かすか」を言葉で説明しきるのは難しい一方、始点と終点の絵は用意しやすいことが多いため、カメラワークの制御手段として実用的です。

3. 360pの軽量プレビューで試作 → 採用カットだけ高解像度化

resolution パラメータで 360p / 720p(既定)/ 1080p / 4K を指定できるようになりました。公式ブログでは360pは720p比で最大60%高速・コストは3分の1と説明されています。

これにより、次のような段階的なワークフローが成立します。

  1. 360pでプロンプトや構図の案を大量に回す(絵コンテ・当たり出し)
  2. 有望な案だけ720pで作り直し、演技・音声を確認する
  3. 最終的に採用する1本だけ1080p / 4Kに上げて納品する

なお 1080p と 4K はネイティブ生成ではなくアップスケールである点は公式ドキュメントにも明記されています。ネイティブ4K撮影素材と同等のディテール量を期待するのではなく、「配信要件を満たすための解像度合わせ」と捉えるのが実態に近い理解です。

4. 動画リファレンスが正式機能に

最大3クリップ(各3秒以内)の動画を入力に含め、そのビジュアルコンテキストやキャラクターの見た目を引き継いだ新しいクリップを生成できます。プレビュー段階では「受け付けるがモデルが正しく処理できない」と注記されていた機能が、正式に使えるようになりました。

5. 提供チャネルの拡大

Gemini API(Google AI Studio)と Gemini Enterprise Agent Platform に加え、Google Flow・Geminiアプリでも1.1の機能が使えるようになっています。エンタープライズ側の導入形態についてはGemini Enterprise Agent Platformの解説を参照してください。

また、Google Workspaceの動画作成ツール Google Vids への搭載は2026年7月に発表済みで、テキストによる動画編集や自分の見た目・声を模したパーソナルアバター生成が使えます。Workspace側のAI機能全体像はWorkspace Intelligenceの解説にまとめています。Adobe Firefly など外部のクリエイティブツールへの統合も進んでおり、Adobe側のGoogleモデル連携の流れはAdobe Firefly Image 5の記事が参考になります。

Gemini Omni Flashでできること(主要機能)

会話型編集を支えるGemini APIの公式イメージ

出典: Gemini API 公式ドキュメント

1.1で追加された機能に加え、初期から続く中核機能もあわせて押さえておくと全体像がつかめます。

会話型編集(conversational editing)

Gemini Omni Flash最大の売りです。従来の動画生成AIは、気に入らない箇所があればプロンプトを書き直して丸ごと生成し直すのが基本でした。すると照明も構図も人物の顔もすべて変わってしまい、「照明だけ夕方にしたい」という局所的な要望が通りません。

Gemini Omni Flashは Interactions API でこれを解決します。

  1. まずクリップを1本生成する
  2. そのクリップに紐づく「interaction ID(会話の続き番号のようなもの)」が返ってくる
  3. 次の指示で、そのIDを previous_interaction_id として渡す
  4. 前のクリップの文脈を保ったまま、指定した部分だけを変更できる

「作り直し」ではなく「対話で微修正」ができるため、クライアント確認と修正を繰り返す実務のリズムと相性が良い設計です。画像モデルとチェーン接続して「画像を作る → その画像から動画を起こす」という流れも組めます。組み合わせる画像側のモデルについてはNano Banana 2 Liteの解説が参考になります。

マルチモーダル統合入力とキャラクター一貫性

テキスト、画像(最大7枚)、動画(最大3クリップ×3秒)、音声を1つの指示にまとめて渡せます。参照画像にタグを付けて被写体を指定できるため、「同じ人物・同じ画風で複数カットを揃える」用途に向きます。

[0-3s] 主人公が扉を開ける のようにタイムコード構文でイベントの発生タイミングを指定することも可能です。

音声のネイティブ同時生成

ナレーション・効果音・環境音・BGMを、映像と一体で同時生成します。後付けのTTSを合成しているのではないため、口の動きや動作と音のタイミングが揃いやすいのが利点です。音声同時生成を売りにする他社モデルとの比較はMiniMax H3(Hailuo 3.0)の解説でも触れています。

物理法則・世界知識を踏まえた推論

重力・運動・流体といった物理の直感的な理解に加え、歴史・科学・文化的文脈の知識を使って「次に何が起きるべきか」を組み立てます。プロンプトを単に絵にするのではなく、辻褄の合う動きを構成する点が、推論モデルを統合したGemini Omniの設計思想です。推論モデル側の性能感を知りたい場合はGemini 3.1 Proの解説もあわせてどうぞ。

SynthIDによる来歴検証

全生成動画に、視聴者には知覚できないが機械的に検出可能な SynthID電子透かしが自動付与されます。Geminiアプリ・ChromeのGemini・Google検索で「Gemini Omniが生成した動画かどうか」を検証できます。

Gemini Omni Flashの料金 ― 解像度別の実額シミュレーション

料金は Gemini API の従量課金で、無料枠はありません。公式Pricingのトークン建て表記は次のとおりです。

  • 入力(テキスト/画像/動画/音声): 100万トークンあたり 1.50ドル
  • 出力(テキスト): 100万トークンあたり 9.00ドル
  • 出力(動画): 100万トークンあたり 17.50ドル

720pの動画1秒がおよそ5,792トークンに換算されるため、実質的に720pで1秒あたり約0.10ドルになります。「1秒0.10ドル」という数字はこの720p基準の値であり、1.1では解像度によって単価が変わる点に注意してください。

解像度 × 動画長の実額マトリクス

解像度

1秒あたり

10秒

20秒

40秒(延長上限)

360p(ドラフト)

約$0.03

約$0.30

約$0.60

約$1.20

720p(既定)

約$0.10

約$1.00

約$2.00

約$4.00

1080p(アップスケール)

約$0.15

約$1.50

約$3.00

約$6.00

4K(アップスケール)

約$0.30

約$3.00

約$6.00

約$12.00

※延長で伸ばした分も生成秒数として課金される前提での概算です。解像度別の秒単価は公式ブログの料金表および複数のテック媒体の報道で一致していますが、ai.google.dev のPricingページのテキスト部分は720p換算での記載が中心です。発注前に公式Pricingページで最新の数値を確認してください。

Veo 3.1シリーズとの価格比較

モデル

360p

720p

1080p

4K

Gemini Omni 1.1 Flash

$0.03

$0.10

$0.15

$0.30

Veo 3.1 Standard

—

$0.40

$0.40

$0.60

Veo 3.1 Fast

—

$0.10

$0.12

$0.30

Veo 3.1 Lite

—

$0.05

$0.08

非対応

720pではVeo 3.1 Fastと同額、4Kでも同額です。1080pだけはVeo 3.1 Fast($0.12)よりわずかに高くなります。一方で360pという安い入口を持つのはOmni 1.1 Flashだけで、ここがコスト設計上の武器になります。

「360p試作 → 720p選抜 → 1080p納品」のコスト比較

実務での使い方を、実額で比べてみます。前提は「20案から1本の40秒動画を作る」ケースです。

工程

解像度

本数×秒数

概算コスト

① 案出し

360p

20本 × 10秒

約$6.00

② 選抜・演技確認

720p

5本 × 10秒

約$5.00

③ 本番(10秒×4回の延長)

1080p

1本 × 40秒

約$6.00

合計

—

—

約$17.00

これを最初から720pだけで回すと、①だけで約$20.00かかり、②③を合わせると合計は約$29.00になります。案出しを360pに逃がすだけで4割前後の削減になる計算です。試行回数が多い企画ほど効果が大きくなります。

コンシューマ向け(サブスク経由)の使い方

APIを使わない導線もあります。

経路

条件

Geminiアプリ「動画を作成」

Google AIプラン(Plus / Pro / Ultra)への加入が必要。シーン延長も展開済み

Google Flow

AI Plus / Pro / Ultra 加入者。プランごとの月間クレジット制

Google Vids(Workspace)

有料Workspaceアカウント。18歳以上かつ主要言語設定が英語のユーザー限定

YouTube Shorts / YouTube Create

無料提供。ただし対象地域・言語が限定される

Gemini Enterprise Agent Platform

API経由でエンタープライズ提供

Google AIプランの月額は改定が入っており、日本語媒体の報道と公式表示で数値が一致しない例が見られました。金額はGoogle AIプランの公式ページで直接確認することをおすすめします。

Gemini Omni Flashの使い方 ― APIとアプリの2つの導線

個人向けの入り口となるGoogle FlowのAIクリエイティブスタジオ公式イメージ

出典: Google Flow 公式サイト

開発者・組み込み用途(API)

  1. Google AI Studio または Gemini API でアクセスを有効化する
  2. モデルIDに gemini-omni-1.1-flash を指定する
  3. resolution パラメータで解像度(360p / 720p / 1080p / 4K)を指定する
  4. テキスト・参照画像・参照動画などの入力を渡してクリップを生成する
  5. 会話型編集をする場合は、返ってきたinteraction IDを previous_interaction_id として次の呼び出しに渡す
  6. 生成された音声付きMP4を受け取る(サイズが大きい場合はURI、小さい場合はBase64で返却)

fal.ai・Runware・WaveSpeed などサードパーティ経由のAPIアクセスも提供されており、Google直の従量課金以外の選択肢もあります。

40秒動画を作る具体的な手順(10秒×4回)

シーン延長を使った長尺化は、次の流れになります。

  1. カット1を生成する(3〜10秒)。まずは360pで構図と演技を確定させる
  2. 生成結果に対して extend タスクを実行し、+10秒を継ぎ足す(直前10秒を参照して続きを描く)
  3. 同じ要領で3回目・4回目の延長を行い、累計40秒まで積み上げる
  4. 全体の流れが固まったら、同じプロンプト設計で720p以上に上げて仕上げる
  5. 必要なら1080p / 4Kへアップスケールして書き出す

途中で「ここだけ照明を変えたい」という要望が出た場合は、延長ではなく会話型編集で該当クリップを修正します。延長は末尾追記のみなので、途中に新しいカットを挿し込みたいときは別クリップを生成して編集ソフト側でつなぐ判断になります。

個人・クリエイティブ用途(アプリ)

コードを書かずに使いたい場合は、Geminiアプリ・Google Flow・Google Vids・YouTube Shorts/Createが入り口です。自然言語で指示するだけで動画を作り、会話しながら仕上げられます。Geminiアプリのコンシューマ向け動画生成は、従来のVeo 3.1からGemini Omniへ置き換わったと複数の日本語媒体が報じており、公式ヘルプでもモデル名として「Gemini Omni」が記載されています。

他の動画生成AIも含めて横断的に選びたい方は、AI動画生成ツールおすすめ比較が全体地図として使えます。

旧プレビューモデルの廃止(2026年9月30日)への対応

すでに gemini-omni-flash-preview で実装している場合、2026年9月30日の廃止は実務上のリスクです。日本語の解説記事でこの点に触れているものはまだ少ないため、あらためて確認しておくべき項目を挙げます。

確認項目

対応内容

モデルID

コード・設定ファイル内の gemini-omni-flash-preview を gemini-omni-1.1-flash に置換

解像度指定

既定が720pのまま動くか確認。コスト削減が狙えるなら試作系の処理を360pへ

出力の互換性

同じプロンプトでも絵の傾向が変わり得るため、主要ユースケースで回帰確認

料金試算

解像度別単価に切り替わるため、月次コストの見積もりを引き直す

新機能の活用

延長・始終点フレーム指定を使うと既存の後処理(動画連結など)が不要になる可能性

提供ステータス

Gemini APIはGAだが、Gemini Enterprise Agent Platform側は「Preview」表記のため、契約要件がある場合は個別確認

移行そのものはモデルID差し替えで済むケースが多い一方、出力の傾向が変わる可能性があるため、9月30日ぎりぎりではなく余裕を持った検証が現実的です。

Gemini Omni Flashでできないこと・制約

GAになっても消えていない制約があります。導入判断に直結するものは次のとおりです。

制約

内容

1回の生成

3〜10秒。長尺は延長で積み上げる方式

延長の上限

累計40秒まで。それ以上は不可

延長の方向

末尾への追記のみ。冒頭追加・途中挿入は非対応

1080p / 4K

ネイティブ生成ではなくアップスケール

編集用の入力動画

編集・延長に使うアップロード動画は10秒以下

音声リファレンス

アップロード非対応。特定の声色を指定することはできない

音声の改変

モデルカードで「speech manipulation は安全性検証のため制限中」と明記

YouTube動画

ソース素材として使用不可

一貫性

モデルカードが「編集時の一貫性維持」「複雑なモーション」「動画内テキストの正確な生成」を既知の弱点として明示

言語

英語は完全サポート。他言語は評価済みだが結果にばらつきあり

地域

EEA・スイス・英国・米国の一部州では、アップロード動画の編集・延長が利用不可(モデル生成動画のマルチターン生成は全地域可)

年齢

Geminiアプリの動画生成は18歳未満は利用不可。Google Vidsも18歳以上

無料枠

APIに無料枠なし

とくに実務で効いてくるのは、1080p / 4Kがアップスケールである点と、アップロードした実写素材の編集が一部地域で使えない点です。前者は「4Kで納品できる」ことと「4K相当の情報量がある」ことを混同しないための重要な区別、後者はEU圏に拠点や制作パートナーを持つ企業には運用上の分岐点になります。

セキュリティ・ガバナンス面

  • 全生成動画に SynthID が自動付与され、来歴検証が可能
  • モデルカード記載の安全策として、事前学習時の合成キャプション付与、本番段階のフィルタリング、音声改変機能の制限が挙げられている
  • GoogleのGenerative AI Prohibited Use Policyにより、違法行為・セキュリティ侵害・露骨な性的コンテンツ・偽情報生成への組み込みは禁止
  • Geminiアプリのヘルプでは、他人を欺く/嫌がらせ・危害を加える目的の生成と共有、第三者の著作権・プライバシー権の侵害が明示的に禁止されている

生成AIを業務利用する際の一般的な注意点は生成AIのセキュリティ解説にまとめています。

日本から使うときの注意点

論点

現時点の状況

日本語プロンプト

入力は可能。ただし公式サポートの中心は英語で、他言語は結果にばらつきがあるとされる

日本語音声

発音・イントネーションは発展途上との実測報告が多い。ナレーションを日本語で使う場合は要検証

Google Vids

主要言語設定が英語のユーザー限定のため、日本語UI環境では使えない

YouTube Shorts / Create の無料提供

対象地域・言語が限定。日本語環境は対象外との報告があるが公式に確認できていないため、実機で確認するのが確実

生成の待ち時間

進行が止まったように見えても裏では処理が続いていることがあり、ページ再読み込みで解決するという報告がある

日本語ナレーションを前提とする案件では、映像はOmni Flashで生成し、音声は別途日本語TTSや人の吹き込みで差し替える運用が現実解になりやすい状況です。

Veo 3.1・他社モデルとの違い

Gemini・Veoなどを試せるGoogle AI Studioの公式イメージ

出典: Google AI Studio 公式サイト

Veo 3.1との使い分け

比較ポイント

Gemini Omni 1.1 Flash

Veo 3.1 Fast

位置づけ

any-to-anyマルチモーダル。推論レイヤーを統合

動画生成に特化した専用モデル

会話型編集

対応(Interactions APIで部分編集)

生成中心

入力の統合理解

テキスト・画像・音声・動画を同時に理解

プロンプト+参照が中心

動画長

10秒/延長で累計40秒

モデル・構成による

音声

ネイティブに同時生成

構成による

360p

対応($0.03/秒)

非対応

720p料金

$0.10/秒

$0.10/秒

1080p料金

$0.15/秒

$0.12/秒

4K料金

$0.30/秒

$0.30/秒

同じ720pなら価格は同等です。判断のポイントは価格ではなく作り方にあります。一発の生成品質を追い込みたい、あるいは1080p中心で数を出すならVeo 3.1系、素材を組み合わせて対話で詰めたい・試作を安く大量に回したい・40秒までつなぎたいならGemini Omni 1.1 Flashという整理になります。

他社モデルとの位置関係

第三者評価では、2026年7月時点のArtificial Analysisによる音声付きText-to-VideoのブラインドEloで Gemini Omni Flash が首位(Elo 1,240)と報告され、LMArenaのText-to-Video Arenaでも上位につけたと報じられています。一方、同じArtificial Analysisの別集計では Seedance 2.0 がT2V・I2Vともに上位という結果も出ており、アリーナや指標によって順位は入れ替わります。独立系のテストでは「人物モーションの一貫性ではKling系に劣る」「環境の忠実度ではSora系に劣る」という指摘もあります。

繰り返し語られている総評は、「生の画質・物理表現ではSeedance系が強く、Omni Flashは生成と編集がひと続きになったワークフローで強い」というものです。競合の多くが「生成ツール」であるのに対し、Omni Flashは「生成もできる編集ツール」として設計されている点が構造的な違いです。

比較したい観点

参考記事

画質・物理表現で競合する最有力モデル

Seedance 2.5の解説

音声同時生成・秒単価の比較

MiniMax H3(Hailuo 3.0)の解説

プロ向け編集ワークフローとの比較

Runway Gen-4の解説

Sora終了後の乗り換え先を探している

Sora代替ツール比較

アニメ・特定用途に特化したい

AnimeGenの解説

こんな人におすすめ

  • 短尺動画を大量に、安く作りたいチーム。360pドラフトで案を回せるため、試行錯誤のコストが下がる
  • 10〜40秒のSNS・広告クリップを量産したい人。延長機能で尺の選択肢が広がった
  • 生成後に「照明だけ」「背景だけ」を対話で直したい人。会話型編集が最も刺さる用途
  • 同じキャラ・同じ画風で複数カットを揃えたいクリエイター。参照画像7枚・参照動画3クリップが使える
  • カメラワークを絵で指定したい人。始点・終点フレームの補間でスイープやズームを制御できる
  • 自社サービスに動画生成を組み込みたい開発者。GA化により本番投入の前提が整った
  • Google・Geminiエコシステムをすでに使っており、SynthIDによる来歴検証を重視する組織

おすすめしない人

  • 40秒を超える尺を1つのモデル内で完結させたい人。上限は累計40秒
  • クリップの途中に別カットを挿入する編集を前提にしている人。延長は末尾追記のみ
  • ネイティブ4K相当の情報量が必要な映像制作。1080p・4Kはアップスケール
  • 日本語ナレーションの品質を最優先する案件。音声は別工程で差し替える前提が必要
  • 特定の声色を指定したい人。音声リファレンスのアップロードは非対応
  • EEA・スイス・英国・米国一部州で、実写のアップロード素材を編集したい人。地域制限に該当する
  • 無料で試したい人。APIに無料枠はなく、アプリ経由でも有料プランが必要な導線が中心

これらに当てはまる場合は、Veo 3.1系や他社の動画生成AIとの併用・比較で判断するのが現実的です。ツールの選定を一から整理したい場合はAI動画生成ツールおすすめ比較から入ると全体像がつかめます。

よくある質問(FAQ)

Q. gemini-omni-flash-preview はいつまで使えますか?

A. 2026年9月30日に廃止される予定です。安定版の gemini-omni-1.1-flash へ切り替える必要があります。モデルIDの差し替え自体は軽微ですが、出力の傾向が変わる可能性があるため、主要ユースケースでの再検証をおすすめします。

Q. 40秒より長い動画は作れませんか?

A. モデル単体では累計40秒が上限です。それ以上の尺が必要な場合は、40秒以内のシーンを複数生成し、編集ソフトでつなぐ運用になります。

Q. 4Kで出力すれば高品質になりますか?

A. 4Kと1080pはアップスケールによる出力です。配信先の解像度要件を満たす目的には有効ですが、ネイティブ4Kと同じディテール量が得られるわけではありません。品質は720pまでの生成段階で作り込むのが基本です。

Q. いちばん安く試す方法は?

A. APIなら360p(1秒あたり約0.03ドル)です。10秒で約0.30ドルなので、20案出しても$6程度に収まります。コードを書かない場合は、Google AIプラン加入者向けのGeminiアプリやGoogle Flowが入り口になります。

Q. 日本語のプロンプトでも使えますか?

A. 入力自体はできますが、公式のサポート中心は英語で、他言語は結果にばらつきがあるとされています。とくに日本語音声の発音は発展途上との実測報告があるため、ナレーションを含む用途では出力を確認したうえで採用してください。

Q. VeoとGemini Omni Flashはどちらを選ぶべきですか?

A. 720pの秒単価は同じなので、価格では決まりません。一発生成の品質を追い込むならVeo 3.1系、素材を組み合わせて対話で仕上げる・試作を安く回す・40秒までつなぐならGemini Omni 1.1 Flashが向きます。

Q. 生成した動画がAI製だとわかりますか?

A. 全動画にSynthID電子透かしが自動付与されます。視聴者には知覚できませんが、Geminiアプリ・ChromeのGemini・Google検索で機械的に検証できます。

まとめ

Gemini Omni Flashは、テキスト・画像・音声・動画をまとめて理解し、会話しながら動画を作って直せるGoogleのマルチモーダルAIです。2026年8月27日に Gemini Omni 1.1 Flash として一般提供が始まり、シーン延長による累計最大40秒、始点・終点フレームの補間、360p〜4Kの解像度指定と解像度別料金という3点で、使い方の幅が大きく広がりました。

コスト面での要点は明快です。720pの1秒0.10ドルは据え置きですが、360p(1秒0.03ドル)という安い試作レーンが増えたことで、「安く大量に案を出し、選んだものだけ高解像度で仕上げる」運用ができるようになりました。20案から40秒動画1本を作るケースでは、全工程を720pで回すより4割前後コストを抑えられる計算になります。

一方で、40秒という上限、末尾追記のみの延長、1080p・4Kがアップスケールである点、日本語音声の品質、地域による編集制限といった制約は残っています。すでにプレビュー版で実装している場合は、2026年9月30日の廃止に向けた移行も忘れてはいけない作業です。

仕様と料金は今後も更新されます。導入判断の前にはGemini API公式ドキュメント、公式Pricing、およびGemini Omni 1.1 Flashの発表ブログで最新情報を確認してください。

このツールを自社の毎月の業務に組み込むと何が変わるか、ご提案します

業務を1つ送る

この記事の著者

AI革命

AI革命

編集部

AI革命株式会社の編集部です。最新のAI技術動向から実践的な導入事例まで、企業のデジタル変革に役立つ情報をお届けしています。豊富な経験と専門知識を活かし、読者の皆様にとって価値のあるコンテンツを制作しています。

経理・事務作業・開発を、AI革命にまとめて任せられます

ご相談は無料です。オンラインで完結します