Gemini Omni 1.1 Flash完全レビュー:機能、料金&API
Googleは動画モデルの更新にそれほど時間をかけませんでした。Gemini Omni Flashが登場したのは6月のことでしたが、8月下旬にはGoogle DeepMindがすでにGemini Omni 1.1 Flashをリリースしていました。これは初代に対する多くの不満を解消したバージョンです。より長いシーン、本格的なフレームコントロール、完成したクリップにお金を払う前にアイデアを試すためのより安価な方法。それが簡単な要約です。
しかし、実際に乗り換える価値があるか、そもそもワークフローを構築する価値があるかは、1秒あたりの料金、編集機能が実際にどの程度機能するか、そしてVeoやSoraと比べてどこがまだ及ばないかといった点にかかっています。このレビューでは、そのあたりを掘り下げていきます。
パート1. Gemini Omni 1.1 Flashとは何か、何ができるのか?
Gemini Omni 1.1 Flashの概要とリリース日
gemini-omni-flash-previewエンドポイントは、6月に初代モデルとともに展開され、Gemini Omni 1.1 Flashのリリースに伴い2026年8月27日に廃止されます。APIのモデルIDはgemini-omni-1.1-flashです。Googleは、旧プレビューエンドポイントを2026年9月30日まで残すとしていますが、そのエンドポイントで開発を続ける人にとっては、期限が決めづらい状況となっています。
これはマルチモーダルモデルであり、テキスト、画像、音声、動画を入力として受け付けます。また、単純なワンショット生成呼び出しではなく、GoogleのInteractions APIを使用します。
生成される動画はすべて、効果音、環境音、セリフ、効果音が同期されており、音楽を自分で追加しなければならない無音動画ではありません。16:9または9:16のアスペクト比で、360p、720p、1080p、4Kに対応しています。ただし、1080pと4Kは厳密には「アップスケール」であり、ネイティブレンダリングではありません。
AI動画生成におけるGemini Omni 1.1 Flashの新機能
初代Omni Flashの基本機能はほぼ変わっていません。テキストから動画、画像から動画、参照動画、会話型編集です。違いは、結果に対して行使できるコントロールの量です。
- 前のシーンの最後のフレームだけを参照するのではなく、続きの生成時に最大10秒前までの映像を読み取るようになりました。シーン拡張は最大10秒の過去の映像を読み取るため、続きは従来バージョンよりもはるかにぎくしゃくしなくなります。
- クリップは10秒単位で最大40秒まで延長できるようになりました。初代の一律10秒制限とは対照的です。
- ファースト&ラストフレーム補間では、最初の画像と最後の画像を指定すると、モデルがその間を補間して滑らかなトランジションを生成します。オービット(周回)、ズーム、タイムラプスショットに適しています。
- 新しい360pドラフトモードは、価格が約3分の1、速度が60%向上しており、フル品質でレンダリングする時間をかける前にアイデアをテストできます。
- 静止画像に加えて、短い動画クリップも参照として受け付けられるようになり、ショット間でのキャラクターやモーションスタイルの引き継ぎがより確実になりました。
これらはいずれも、Omniを完全に新しい製品にするものではありません。初回リリース以来人々が求めてきた、音声で自然に動画を生成・編集するというコンセプトは同じで、ディテールが追加されただけです。
パート2. Gemini Omni 1.1 Flashの使い方
Google AI StudioでGemini Omni 1.1 Flashを使用する方法
コードを書かずに試してみたいだけなら、Google AI Studioが最も簡単な入り口です。
AI Studioを開き、モデルリストからGemini Omni 1.1 Flashを選択し、プロンプトを入力するか、参照画像またはクリップをアップロードします。
Googleは、曖昧な一言ではなく、シーン、カメラの動き、照明を具体的に指定することを推奨しています。モデルはそれらの詳細を頼りにショットの物理とフレーミングを補完するためです。
ドラフトが返ってきたら、再生成したり、別の解像度を指定したり、そのままフォローアップのプロンプトで編集に移行したりできます。
Gemini Omni 1.1 Flashは動画編集と延長をどのように処理するのか?
ここでInteractions APIの存在価値が発揮されます。長いプロンプトを1本書いて出力が合うことを祈るのではなく、クリップを生成してから、それに話しかけるように編集します。背景を入れ替える、時間帯を変える、キャラクターをカメラの方を向かせる。モデルは要求された変更だけを適用し、ショットの他の部分には触れません。何かがおかしいたびにゼロから再生成するより、はるかに壊れにくい仕組みです。
延長も同じ会話型の方法で機能します。既存のクリップをモデルに指定すると、モデルは単一のフレームではなく最大10秒の映像を読み取るため、続きはシーンをリセットせず、照明、キャラクターの位置、モーションの一貫性を保ちます。これらを十分につなぎ合わせれば、累計40秒の上限まで構築できます。
パート3. Gemini Omni 1.1 Flash APIの料金と使い方
Gemini Omni 1.1 Flash APIのモデルIDとは?
安定版のモデルIDはgemini-omni-1.1-flashで、Gemini APIとGoogle AI Studioで利用できます。Googleはまた、内部ツールを構築するチーム向けに、Gemini Enterprise Agent Platform内でPreviewとしてもリストアップしており、AI Plus、Pro、UltraサブスクリプションのユーザーにはGoogle Flowにも表示されます。
Gemini Omni 1.1 Flash APIの使い方
基本的な流れは、インタラクションエンドポイントへの1回の呼び出しです。テキストプロンプト(オプションで画像、音声クリップ、参照動画)と希望の解像度を渡すと、モデルは生成された動画をbase64エンコードされたデータとして返します。そこから先は、プロンプト全体を再送信するのではなく、同じセッションを参照し、希望する変更を平易な言葉で記述する、もう1回のインタラクション呼び出しで結果を調整します。
Gemini Omni 1.1 Flash APIの料金は?
料金はGoogleの標準トークンモデルに基づいており、動画は一律料金ではなく解像度ごとに課金されます:
- 入力(テキスト、画像、動画、音声、すべて同じ方法で課金):$1.50/100万トークン
- テキスト出力:$9.00/100万トークン
- 動画出力:$17.50/100万トークン、720pは1秒あたり5,792トークンで課金
1秒あたりで計算すると、おおよそ次のようになります:
- 360pドラフト:1秒あたり約$0.03
- 720p:1秒あたり約$0.10
- 1080p:1秒あたり約$0.15
- 4K:1秒あたり約$0.30
つまり、720pの10秒クリップは1ドル近くかかり、同じクリップを先に360pでドラフトすると約30セントです。無料枠もバッチ割引もないため、最終レンダリングにコミットする前に多くのプロンプトをテストする場合、ドラフト→アップスケールのワークフローは実際に利用する価値があります。
Gemini Omni 1.1 Flash APIの制限は?
このモデルの上に本格的なものを構築する前に、知っておく価値のある実際的な制限がいくつかあります:
- 1回の生成は依然として10秒が上限です。それより長いものは、合計40秒まで延長をつなぎ合わせる必要があります。
- 1080pと4Kは、ベースレンダリングのアップスケールとして生成され、その解像度でネイティブ生成されるわけではありません。
- シーン拡張は最大10秒の過去の映像からコンテキストを取得するため、その範囲を超えると連続性がずれる可能性があります。
- Google自身のモデルカードも、複雑なモーション、複数ステップの編集、画面上のテキストの正確さは、結果に一貫性が生まれにくい領域であることを率直に認めています。
パート4. Gemini Omni 1.1 Flashは以前のGeminiモデルより優れているのか?
Gemini Omni 1.1 Flash vs Gemini Omni Flash
初代Omni Flashから1.1への飛躍は、主に生の品質というよりコントロールに関するものです。初版は10秒が上限で、延長の仕組みも特定の終了フレームを設定する方法もなかったため、Google自身のドキュメントも、シーン拡張やラストフレームコントロールが必要な場合はVeoを勧めていました。1.1ではそれらの機能が直接Omniに組み込まれました。累計40秒のシーン、ファースト&ラストフレーム補間、プロトタイピング用のより安価な360pプランです。720pの料金は変わっていないため、同じ表向きの料金でより多くの機能を得られることになります。
Gemini Omni 1.1 Flash vs 他のAI動画生成モデル
他の競合と比べた場合、Omni 1.1の最大の差別化要因は依然として、Interactions APIに組み込まれた会話型のマルチターン編集です。ほとんどの競合モデルは生成と編集を2つの別々のツールとして扱っています。Veo 3.1はGoogleのもう1つの選択肢であり、一部のレガシーパイプラインでは依然として選ばれていますが、Omniはこのアップデートでその差を大きく縮めました。SoraやKlingタイプのモデルと比較すると、Omniのネイティブオーディオトラックと参照動画対応は、後から映像と音声をつなぎ合わせるのではなく、1回で使えるクリップを手に入れたい人にとって優位性があります。Googleは、Omni 1.1がText-to-Video Arenaリーダーボードでトップスコアを獲得したと主張していますが、これはGoogle自身の数値であり、第三者による検証はされていません。
Gemini Omni 1.1 Flashは使う価値があるのか?
反復的なクリエイティブ作業、広告、SNS用クリップ、手早いコンセプト動画を行う人にとって、ドラフト→アップスケールの料金体系と会話型編集は、これを目新しさではなく真に実用的なツールにしています。開発者には、明確で解像度ベースのコスト構造と、旧プレビューエンドポイントからの文書化された移行パスが提供されます。荒削りな部分はGoogle自身が認めているものと同じです。複雑なシーンではモーションが依然として不安定になり、動画内にレンダリングされたテキストも常に信頼できるとは限りません。短く反復的なクリップを中心としたユースケースなら、価格に見合う価値があります。最初から長尺でネイティブな4K出力が必要なら、それに応じて期待値を調整する必要があります。
パート5. プロのヒント:Gemini Omni 1.1 FlashのAI動画を8Kに高画質化する方法
なぜ生成後にAI動画を高画質化すべきなのか?
出力オプションとして4Kが挙げられていても、その解像度は元のレンダリングのアップスケールであり、ネイティブな4K撮影ではありません。つまり、細かいディテール、肌の質感、髪、生地、背景要素はまだ少しソフト(輪郭が甘い)に見えることがあり、圧縮アーティファクトやかすかなノイズは、クリップを大きな画面で見たり編集タイムラインに取り込んだりすると現れやすくなります。特に顔は、AI生成中に鮮明さを失いやすい部分の1つです。モデルはディテールを記録するのではなく予測しているからです。
HitPaw VikPeaでGemini Omni 1.1 Flashの動画を8Kにアップスケールする方法
ここで、専用の動画高画質化ツールがワークフローにおける存在価値を発揮します。HitPaw VikPea AI動画高画質化ツールは、AI生成かどうかにかかわらず、このような映像を取り込み、生成モデルが残しがちな問題(ソフトなディテール、ノイズ、アーティファクト、不安定な顔のレンダリング)をクリーンアップしながら8Kまで引き上げるために作られています。
HitPaw VikPeaの主な機能
- AI動画修復:破損した、傷んだ、または低品質の動画ファイルを修正できます。
- AI一般修復モデル:720p未満の低解像度動画を、古い映画やVHSテープを含め、ディテールと明瞭さを高めて復元します。
- 動画カラー化:白黒映像を自然に復元・カラー化します。
- 動画4K/8K化:低解像度動画を4Kや8KにAIアップスケール
- エクスポートの解像度を自由に選択:4Kから8Kまで自由に動画を書き出せます。
- 簡単な操作画面:初心者から専門家まで使いやすいインターフェース。
こうした特徴により、HitPaw VikPeaは高度な解像度に対応する際の優れた選択肢となります。
HitPaw VikPeaで動画を8K解像度にアップグレードする方法
ステップ1:インストールとダウンロード
公式ウェブサイトにアクセスし、HitPaw VikPeaをダウンロードします。インストール後、アプリケーションを起動し、必要に応じてログインします。
ステップ2:映像をビデオ高画質化ツールに取り込む
左パネルをクリックしてビデオ高画質化ツールモジュールを開きます。アイコンを押して、動画ファイルをインターフェースにインポートします。
ステップ3:適切なAIモデルを使用する
全体に高画質化を適用する汎用モデルに加えて、特定の高画質化ニーズに応じて動画に適用できる複数の専門モデルがあります。
UHD Restoration Modelなどの他のモデルを適用すると、高解像度の720p動画の品質をさらに向上させ、視認性を高め、シャープネスを復元できます。
プレビュー時間(3秒または5秒)を選択します。動画の一部の要素だけを改善したい場合は、Cutツールを使用します。出力解像度と形式を設定します。
ヒント:どのモデルを使えばよいかわからない場合は、AI Pilotを使用してください。ビデオを自動的に検査し、最も適切な高画質化を提案します。
ステップ4:プレビューして保存
必要な調整をすべて行った後、Previewをクリックして、動画のビフォー・アフターの結果を比較します。これにより、仕上げる前に元のバージョンと高画質化後のバージョンの違いを明確に確認できます。
ステップ5:書き出しまたはクラウドエクスポート
プレビューに満足したら、エクスポートまたはクラウドエクスポートを選択して動画を保存します。驚くほど鮮明な高画質化動画をお楽しみください。
Gemini Omni 1.1 Flashに関する質問
2026年8月27日にリリースされたGoogleの一般提供版の動画生成・編集モデルで、テキスト、画像、音声、動画を入力として受け付け、同期されたオーディオ付きの短いクリップを生成します。さらに、会話型編集とシーン拡張をサポートしています。
いいえ。有料のGemini APIプランでのみ利用可能で、動画生成の無料枠はありません。Google AI Plus、Pro、Ultraのサブスクライバーは、直接のAPI課金ではなく、プランのクレジットを使用してGoogle Flow経由でアクセスできます。
テキストから動画、画像から動画、画像または短いクリップを使用した参照動画、ファースト&ラストフレーム補間、累計40秒までのシーン拡張に対応しており、すべて自然言語によるマルチターンの会話で編集できます。
動画出力は$17.50/100万トークンで課金され、360pで1秒あたり約$0.03、720pで$0.10、1080pで$0.15、4Kで$0.30になります。テキスト、画像、音声、動画にわたる入力は、一律$1.50/100万トークンです。
1.1では、40秒のシーン拡張(一律10秒の上限に対して)、ファースト&ラストフレーム補間、360pドラフトプラン、4K出力が追加されました。これらはすべて、初代モデルがリリース時に欠いていた機能です。
結論
Gemini Omni 1.1 Flashは、再発明というより、初回リリース後に人々が実際に求めたものへの修正です。より長いシーン、本格的なフレームコントロール、完成したレンダリングに実際の費用をかける前にアイデアを試すための安価な方法です。マルチモーダル入力、ネイティブオーディオ、Interactions APIによる会話型編集は、依然としてその有用性の基盤であり、新しいドラフト→アップスケールの料金体系は、実験をはるかに気軽なものにしています。
ここでの4K出力もネイティブ撮影ではなくアップスケールであるため、完成したクリップを後からHitPaw VikPeaに通すことは、動画を最終的にどこかに出す前に、ディテールをシャープにし、ノイズを抑え、顔をクリーンアップする簡単な方法です。
コメントを残す
HitPaw の記事にレビューを作成しましょう