Gemini Omni 1.1 フラッシュ

2026/08/28 2:06

Gemini Omni 1.1 フラッシュ

RSS: https://news.ycombinator.com/rss

要約

Japanese Translation:

Google は、Gemini API、Google AI Studio およびエンタープライズ向けに Agent Platform API を通じて生成型動画の機能を提供し、また Google Flow に登録されている Google AI Plus、Pro、Ultra 購読者にも直接グローバルにアクセス可能となる、AI 動画スイートの転換的なアップデートである Gemini Omni 1.1 Flash をリリースしました。最も顕著な向上点は、モデルが視覚的な一貫性を維持する仕組みにあります;以前は 1 秒だけだった先行文脈を分析対象として 10 秒に拡張し、ユーザーが動画を一貫して延長することで、最大 40 秒までの再生でもぎこちなさのないスムーズな体験を実現しています。さらにワークフローの加速のために、開発者はプロトタイプ作成などを目的とした高速プレビュー生成が可能で、360p 解像度のものについては従来の約 1/3 のコストで最大 60% 高速化されています。また、システムはスタートフレームとエンドフレーム間の滑らかな遷移をサポートしており、最初期/最後期フレーム間補間技術を用いてジャンプカットを防止します。これらの機能は、Gemini API を介したグローバルな即時アクセスならびに Google Flow への直接登録により利用可能です。その結果、クリエイティブプロフェッショナルやエンタープライズは、編集を最小限で済ませられる高品質な 1080p または 4K の動画資産を生成することでプロセスを合理化でき、既存のビジネスパイプラインに生成型 AI を効果的に統合できます。

本文

Google DeepMind、生成型動画制作機能を大幅強化「Gemini Omni 1.1 Flash」を公開

Google DeepMind は、開発者向けに新しいクリエイティブ制御機能と生成型動画機能を搭載した**「Gemini Omni 1.1 Flash」**を導入しました。このアップデートにより、Google AI Studio や Gemini API を通じてプロフェッショナルな動画制作の実現が容易になり、生成型ワークフローの高速化と高品質化が進みます。

🌟 メインの新機能概要

  • シーン延伸機能: 既存の動画からシームレスに続きを生成可能。
  • キーフレーム制御: 開始・終了フレーム指定により、滑らかなカメラ動きや複雑な遷移を実現。
  • 高速プロトタイピング: 360p レゾリューションでの軽量プレビュー作成が可能。
  • 高解像度出力: プロフェッショナルレベルの1080p または 4Kアップスケーリング対応。
  • 動画リファレンス活用: マルチモーダル入力に対応し、最大 3 秒分の動画を参照可能。

🎬 シーン延伸機能で物語を延長

既存の動画からシームレスな続きを生成します。モデルは以前利用した最多 10 秒分の前後コンテキスト(文脈)を分析し、従来の数秒からのみに依存していた制約から解放されました。

  • 利点:
    • 視覚的な整合性と物語の忠実性が向上
    • より長い物語構築や新しいクリエイティブ展開が可能
  • 対応範囲:
    • 動画は 10 秒単位で延伸可能
    • 累積最大長さ 40 秒まで対応

コード例:Gemini API を使ったシーン延伸

from google import genai

client = genai.Client()
interaction = client.interactions.create(
    model="gemini-omni-1.1-flash",
    previous_interaction_id=previous_video_interaction.id,
    input=[
        {"type": "text", "text": "Continue the scene."}
    ],
    response_format={
        "resolution": "360p",
    },
)

🎥 開始フレームと終了フレームを指定して遷移を制御

ショットの開始・終了フレームを指定し、スムーズな遷移やカメラ動き(オービット、ズームなど)を実現します。複雑なカメラワークやシームレスなループクリップの制作に適しています。

プロンプト例:シームレスなワンショット構成

プロンプト 1:

ベージュのスーツを着たドラマーがグランドホールで演奏するクローズアップから始まり、カメラがパニックパンしてサイドへ切り替わる。白い衣装のバレエダンサーと古いサキソフォーン奏者の演奏風景が明らかになる。ジャンプカットなしの 1 つの連続したショット。

プロンプト 2:

カメラがテレビ画面へとズームインし、冒頭と同じ女性が映っている。シームレスな動画。ジャンプカットなしの 1 つの連続したショット。


⚡ 360p で効率的な動画草案を作成

標準の 720p に比べて、最大 60% の高速化を実現し、かつ費用は約1/3に抑えられます。

  • 用途:
    • 開発者プラットフォームでの高速プロトタイピング
    • ストーリーボードのイテレーション
    • 迅速なレンダリング
  • (注:最大 60% の高速化は、360p と 720p のシステムスループットに基づいています)

プロンプト例:軽量プレビュー作成

虹色の海洋硅藻の顕微鏡的視点。複雑でガラスのようなケイ酸塩の殻と対称性。色合いは火山琥珀からターコイズ、紫へと変化。暗背景に対して小さな繊細な構造が発光。高忠実度科学画像、シャープなディテール、有機構造、マクロ写真術。動画全体を通して顕微鏡レンズ効果を維持してください。


🖥️ 最大 4K リゾリューションまでのアップスケーリング

プロフェッショナル制作に対応した高解像度(1080p または4K)出力を生成できます。

プロンプト例:4K アップスケーリング

  • パターン A: 泳いでいる魚を追うショット
  • パターン B: 森から飛び出し、空気を嗅ぐ小さなリスが画面右へ去る様子
  • パターン C(映画仕立てマクロクローズアップ):

    デリケートな枝に生えた鮮やかなオレンジ色のニホンカエデの葉。やわらかくリズミカルな秋の風に揺れ、光が半透明の葉を通して差し込んで温かみのある発光効果を生む。浅いフォーミングレンジ、幻想的なボケ背景、ハイパーディテールテクスチャ、フォトリアリスティック、4K


🎞️ マルチモーダル入力に動画リファレンスを追加

シーン作成時に最大3 秒の動画をリファレンスとして参照し、視覚的文脈やキャラクターの一貫性を維持できます。

プロンプト例:複数のダンス動画を統合

アップロードされた 3 つのダンサーの動画を使用し、提供された画像のキャラクターに置き換えてください。各ダンサーは個別にダンスを演じさせ、大きな開放的な空間で一緒に踊らせます。

  • ドッグキャラクター (
    dog.png
    ):
    dance3.mp4
    のクラシックダンス
  • オクタパスキャラクター (
    octo.png
    ):
    dance1.mp4
    のヒップホップダンス
  • ベアキャラクター (
    bear.png
    ):
    dance2.mp4
    のブレイクダンス 最終結果はシーンカットなしの 1 つの連続したショットであるべきです。

💡 開発者向け活用アイデアと導入方法

構築に使えるインスピレーションとなるアイデア

これらの新機能をカスタムツールやクリエイティブワークフローに組み込むことで、独自の制作手法を確立できます。

実環境での活用事例

Agent Platform API を通じて Gemini Omni Flash を用い、実際の制作現場を推進している顧客の事例や動画も参照可能です。

今日から構築を開始する方法

Google Omni 1.1 Flash は以下のプラットフォームで利用可能です。

プラットフォーム利用方法
Google AI StudioGoogle AI Studio 内で直接試用・構築開始可能。
Gemini エンタープライズエージェントプラットフォーム API を経由して直接利用。エンタープライズ組織向け。
公式ドキュメントシーン延伸、動画リファレンス、アップスケーリングの統合方法を学ぶためのレシピ・ガイドあり。
Google AI プラス/プログローバル Google Flow で利用可能。シーン延伸機能はグローバルな所有サブスクライバー全員向け

開発者ドキュメントやプロンプトガイドを参照し、アプリケーションへの機能を組み込み、次世代の動画制作を開始してください。

同じ日のほかのニュース

一覧に戻る →

2026/08/28 2:17

1.1.1.1 の DNS キャッシュ最適化でメモリ使用量を 100TB 削減

## Japanese Translation: Big Pineapple は、5 つの主要なストレージ最適化によりパーエントリーフッタープリントを 50% 以上削減したことで、DNS インフラストラクチャを大幅に革新することに成功しました。`Vec` と `String` フィールドをボックスポインタに置換し、レコードセクションを単一のリストへ統合し、不要なオーナーフィールドを除去し、大きな列挙型バリアントをボックス化してパディングを削減し、レコードを連続的なワイヤフォーマットバッファに格納することで、膨大な量の無駄なヒープ容量を排除しました。これらの改善は、特に 1 クライアントネットワークにつき複数の照会バージョンをキャッシュする必要がある ECS クライアントサブネット(ECS)照会を処理する場所にとって極めて重要です。2026 年 5 月 18 日から 7 月 6 日までのプロダクションロールアウト後、システムは劇的な効率向上を達成しました:平均居住メモリは 9.3 GB から 5.3 GB に低下し(p99 使用量の 43% 削減)、実質的に Gen 13 サーバー 130 機以上の RAM を解放しました。また、挿通スループットが 43% 増加し、照会遅延は 19% 減少することで、高負荷下でも船団がより信頼性高く動作すると同時に、大きなコスト削減を実現しました。

2026/08/28 0:56

小型モデルがやってきました

## Japanese Translation: 本質的なメッセージは、人工知能の最近の進歩により、運用コストが劇的に削減されたため、Luna などのコスト効率の高いモデルが消費者向けサブスクリプションにおいて実現可能になったという点です。以前は、高トークンコスト(旧モデルでタスクを実行する際に約$1 かかっていたのに対し、新しいモデルでは約$0.10 で済むというシナリオが例)が障壁となり、消費者にとって月次 AI プランは数学的に不可能でした。新しい技術により、企業は破格な予算なしに強力な AI にアクセスできるようになり、その結果として消費者向けグレードのサブスクリプションが登場しました。 企業の大部分の仕事は「トークン・スパイラー(大量生成型)」のカテゴリーに属しており、画期的な新しさを優先するよりも速度と応答性を重視しています。日常業務の約 95% は深い発見ではなく実行上のロジスティクスを占めています。Fable などの最先端モデルは稀な研究ブレイクスルー(「IQ 180」)には不可欠ですが、将来の市場はこの高コストのイノベーション用ツールと、標準的な対話向けの低価格で効率的なオプションの間で分かれることになります。現在の成功には、企業環境において安全性を確保し、ロール管理を行い、プロンプトインジェクション攻撃を防ぐための新しい「ハーネス(枠組み)」を構築することにかかっています。この変化により、企業は標準的なタスクのために高価な人間による「革新的思考者」を、応答性の高い AI エージェントで置換できるようになりました。結局のところ、この進化は AI を排他的な贅沢品から、日常業務用の実用的かつ手頃な価格のユーティリティへと変革させ、ついに大衆にとって消費者向けグレードのサブスクリプションが現実的となりました。

2026/08/27 23:08

メカニカル・ムーブメント No.507

## Japanese Translation: 本プロジェクトでは、507 の異なるアニメーションの完全なコレクションを編成することを目的としていますが、アーカイブからいくつかのエントリが現在欠落しています。利用者がこの拡大するライブラリをナビゲートできるよう、色分けされたサムネイルで完成作品と未完成のものを視覚的に区別し、右上に配置されている「prev」と「next」リンクにより、サムネイルページの間の簡単な閲覧が可能になっています。デジタル倉庫は、ヘンリー・T・ブラウンによる元のイラストをクラシックな技術書の参考資料と並べて収録することで歴史的意義を備えています。将来の発展には、507 の完全なセットが達成されるまで新しいアニメーションを順次リリースするものがあります。チームはタイムラインについて定期的に Facebook や Twitter などのソーシャルメディアプラットフォームで情報を共有することで透明性を維持しています。最終的には、ユーザーは現代的なデジタル作品と本物の歴史的アートワークの両方にアクセスできる利点を享受でき、プロジェクト自体に関する情報も「About」ページで入手可能です。