
2026/08/28 2:06
Gemini Omni 1.1 フラッシュ
RSS: https://news.ycombinator.com/rss
要約▶
Japanese Translation:
Google は、Gemini API、Google AI Studio およびエンタープライズ向けに Agent Platform API を通じて生成型動画の機能を提供し、また Google Flow に登録されている Google AI Plus、Pro、Ultra 購読者にも直接グローバルにアクセス可能となる、AI 動画スイートの転換的なアップデートである Gemini Omni 1.1 Flash をリリースしました。最も顕著な向上点は、モデルが視覚的な一貫性を維持する仕組みにあります;以前は 1 秒だけだった先行文脈を分析対象として 10 秒に拡張し、ユーザーが動画を一貫して延長することで、最大 40 秒までの再生でもぎこちなさのないスムーズな体験を実現しています。さらにワークフローの加速のために、開発者はプロトタイプ作成などを目的とした高速プレビュー生成が可能で、360p 解像度のものについては従来の約 1/3 のコストで最大 60% 高速化されています。また、システムはスタートフレームとエンドフレーム間の滑らかな遷移をサポートしており、最初期/最後期フレーム間補間技術を用いてジャンプカットを防止します。これらの機能は、Gemini API を介したグローバルな即時アクセスならびに Google Flow への直接登録により利用可能です。その結果、クリエイティブプロフェッショナルやエンタープライズは、編集を最小限で済ませられる高品質な 1080p または 4K の動画資産を生成することでプロセスを合理化でき、既存のビジネスパイプラインに生成型 AI を効果的に統合できます。
本文
Google DeepMind、生成型動画制作機能を大幅強化「Gemini Omni 1.1 Flash」を公開
Google DeepMind は、開発者向けに新しいクリエイティブ制御機能と生成型動画機能を搭載した**「Gemini Omni 1.1 Flash」**を導入しました。このアップデートにより、Google AI Studio や Gemini API を通じてプロフェッショナルな動画制作の実現が容易になり、生成型ワークフローの高速化と高品質化が進みます。
🌟 メインの新機能概要
- シーン延伸機能: 既存の動画からシームレスに続きを生成可能。
- キーフレーム制御: 開始・終了フレーム指定により、滑らかなカメラ動きや複雑な遷移を実現。
- 高速プロトタイピング: 360p レゾリューションでの軽量プレビュー作成が可能。
- 高解像度出力: プロフェッショナルレベルの1080p または 4Kアップスケーリング対応。
- 動画リファレンス活用: マルチモーダル入力に対応し、最大 3 秒分の動画を参照可能。
🎬 シーン延伸機能で物語を延長
既存の動画からシームレスな続きを生成します。モデルは以前利用した最多 10 秒分の前後コンテキスト(文脈)を分析し、従来の数秒からのみに依存していた制約から解放されました。
- 利点:
- 視覚的な整合性と物語の忠実性が向上
- より長い物語構築や新しいクリエイティブ展開が可能
- 対応範囲:
- 動画は 10 秒単位で延伸可能
- 累積最大長さ 40 秒まで対応
コード例:Gemini API を使ったシーン延伸
from google import genai client = genai.Client() interaction = client.interactions.create( model="gemini-omni-1.1-flash", previous_interaction_id=previous_video_interaction.id, input=[ {"type": "text", "text": "Continue the scene."} ], response_format={ "resolution": "360p", }, )
🎥 開始フレームと終了フレームを指定して遷移を制御
ショットの開始・終了フレームを指定し、スムーズな遷移やカメラ動き(オービット、ズームなど)を実現します。複雑なカメラワークやシームレスなループクリップの制作に適しています。
プロンプト例:シームレスなワンショット構成
プロンプト 1:
ベージュのスーツを着たドラマーがグランドホールで演奏するクローズアップから始まり、カメラがパニックパンしてサイドへ切り替わる。白い衣装のバレエダンサーと古いサキソフォーン奏者の演奏風景が明らかになる。ジャンプカットなしの 1 つの連続したショット。
プロンプト 2:
カメラがテレビ画面へとズームインし、冒頭と同じ女性が映っている。シームレスな動画。ジャンプカットなしの 1 つの連続したショット。
⚡ 360p で効率的な動画草案を作成
標準の 720p に比べて、最大 60% の高速化を実現し、かつ費用は約1/3に抑えられます。
- 用途:
- 開発者プラットフォームでの高速プロトタイピング
- ストーリーボードのイテレーション
- 迅速なレンダリング
- (注:最大 60% の高速化は、360p と 720p のシステムスループットに基づいています)
プロンプト例:軽量プレビュー作成
虹色の海洋硅藻の顕微鏡的視点。複雑でガラスのようなケイ酸塩の殻と対称性。色合いは火山琥珀からターコイズ、紫へと変化。暗背景に対して小さな繊細な構造が発光。高忠実度科学画像、シャープなディテール、有機構造、マクロ写真術。動画全体を通して顕微鏡レンズ効果を維持してください。
🖥️ 最大 4K リゾリューションまでのアップスケーリング
プロフェッショナル制作に対応した高解像度(1080p または4K)出力を生成できます。
プロンプト例:4K アップスケーリング
- パターン A: 泳いでいる魚を追うショット
- パターン B: 森から飛び出し、空気を嗅ぐ小さなリスが画面右へ去る様子
- パターン C(映画仕立てマクロクローズアップ):
デリケートな枝に生えた鮮やかなオレンジ色のニホンカエデの葉。やわらかくリズミカルな秋の風に揺れ、光が半透明の葉を通して差し込んで温かみのある発光効果を生む。浅いフォーミングレンジ、幻想的なボケ背景、ハイパーディテールテクスチャ、フォトリアリスティック、4K。
🎞️ マルチモーダル入力に動画リファレンスを追加
シーン作成時に最大3 秒の動画をリファレンスとして参照し、視覚的文脈やキャラクターの一貫性を維持できます。
プロンプト例:複数のダンス動画を統合
アップロードされた 3 つのダンサーの動画を使用し、提供された画像のキャラクターに置き換えてください。各ダンサーは個別にダンスを演じさせ、大きな開放的な空間で一緒に踊らせます。
- ドッグキャラクター (
):dog.pngのクラシックダンスdance3.mp4- オクタパスキャラクター (
):octo.pngのヒップホップダンスdance1.mp4- ベアキャラクター (
):bear.pngのブレイクダンス 最終結果はシーンカットなしの 1 つの連続したショットであるべきです。dance2.mp4
💡 開発者向け活用アイデアと導入方法
構築に使えるインスピレーションとなるアイデア
これらの新機能をカスタムツールやクリエイティブワークフローに組み込むことで、独自の制作手法を確立できます。
実環境での活用事例
Agent Platform API を通じて Gemini Omni Flash を用い、実際の制作現場を推進している顧客の事例や動画も参照可能です。
今日から構築を開始する方法
Google Omni 1.1 Flash は以下のプラットフォームで利用可能です。
| プラットフォーム | 利用方法 |
|---|---|
| Google AI Studio | Google AI Studio 内で直接試用・構築開始可能。 |
| Gemini エンタープライズ | エージェントプラットフォーム API を経由して直接利用。エンタープライズ組織向け。 |
| 公式ドキュメント | シーン延伸、動画リファレンス、アップスケーリングの統合方法を学ぶためのレシピ・ガイドあり。 |
| Google AI プラス/プロ | グローバル Google Flow で利用可能。シーン延伸機能はグローバルな所有サブスクライバー全員向け。 |
開発者ドキュメントやプロンプトガイドを参照し、アプリケーションへの機能を組み込み、次世代の動画制作を開始してください。