EmbeddingGemma 2:オープンで軽量なマルチモーダル埋め込みモデル

2026/10/07 1:03

EmbeddingGemma 2:オープンで軽量なマルチモーダル埋め込みモデル

RSS: https://news.ycombinator.com/rss

要約▶

Japanese Translation:

EmbeddingGemma 2 は、オンデバイス多模态埋め込みにおいて最も高性能なモデルとして、テキスト、画像、音声、ビデオ、コードを統一空間にネイティブにマッピングする画期的なローカル AI 機能の飛躍を示しています。7.4 億パラメータを有し、商用許諾の Apache 2.0 ライセンス下にある堅牢な Gemma 4 アーキテクチャを基礎とすることで、軽量さを維持しつつもベンチマークスコアで業界トップレベルの成績を収めます。その特徴は、Matryoshka Representation Learning(MRL)によるストレージ効率化であり、ベクトル次元を動的に削減することで最大 6 倍までのスペース削減を可能にします。オンデバイス性能向けに最適化されており(テキストのみウェイトの場合 Google Pixel 11 Pro で約 191MB の RAM を必要とする)、ローカルハードウェア上で直接長形式メディアを処理できる impressive な 8K トークンコンテキストウィンドウを搭載しています。ローカル索引付けにおけるコード性能に著しい向上をもたらすと同時に、埋め込みをローカルで生成することでオフラインクロスモーダル検索を実現しデータプライバシーを確保します。開発者はすぐに Hugging Face や Kaggle を介してモデルを利用でき、MediaPipe、LiteRT、WebGPU などのデプロイメントツールや vLLM、Ollama などのサービングフレームワークを活用し、外部クラウドサーバーに依存せず既存のワークフローへのシームレスな統合が可能です。この進展は、効率的かつオフライン AI リトリバルのための新たな業界標準を確立します。

本文

EmbeddingGemma 2:オンデバイス向けマルチモーダル埋め込みモデルのリリース

概要と背景

  • 最高性能の実現: 「EmbeddingGemma 2」は、テキスト・画像・音声・映像の組み合わせを統一された埋め込み空間にそのままマッピングする仕組みを採用し、オンデバイス向けに最適化されています。
  • 開発の経緯:
    • 昨年に発表された初代「EmbeddingGemma」は、軽量かつ高品質なテキスト埋め込みを実現し、消費向けハードウェアでの情報整理・検索・接続を目的としていました。
    • 2,000 万回以上のダウンロード数を記録し、開発者からはオンデバイス検索ツールやプライバシー重視の RAG パイプライン構築への活用が期待されてきました。

エンジンとアーキテクチャ

  • 基盤モデル: Google DeepMind による新技術「Gemma 4 アーキテクチャ」を採用しています。
  • ライセンス: 商用利用も許可されたApache 2.0 ライセンスの下で提供されます。
  • パラメータ数: 総計7.4 億パラメータ。
  • 多言語・マルチモーダル対応: 単一のネイティブモデルで、以下のすべての入力種別を処理可能です。
    • テキスト
    • コード
    • 画像(ビジョン)
    • 映像
    • 音声

メインの特性

1. パフォーマンスと精度

  • ベンチマークトップクラス: MTEB(テキスト)、MAEB(音声)などのベンチマークにおいて、サブ 1B パラメータモデルとして最良の結果を達成しました。
  • 大規模モデルとの対抗: テキスト・ビジョン・音声のタスクにおいて、多くの大規模モデルと同等かそれ以上の性能を発揮します。

2. モジュール的な設計

  • 柔軟な構成: ワークロードに応じて必要なエンコーダーを組み合わせて使用できます。
    • テキスト専用:最小2.7 億パラメータ。
    • 完全マルチモーダル:オプションのビジョンエンコーダー(1,700 万)と音声エンコーダー(3,000 万)を追加。

3. ストレージ効率化

  • Matryoshka Representation Learning (MRL) の採用: 出力ベクトルの次元を動的に変更可能で、以下の削減を実現します。
    • 768 次元 → 512 / 256 / 128 次元へ短縮可能。
    • ローカルなベクトルデータベースやメモリの使用量を最大 6 分の 1 まで削減。

4. オンデバイス最適化

  • 厳しいリソース環境でも動作: Google Pixel 11 Pro などの量子化適用モデルでの推論サイズは以下の通りです。
    • テキスト専用重み:約 191MB のアクティブ RAM。
    • 完全マルチモーダルモデル:約 567MB のアクティブ RAM。

5. コンテキストウィンドウの拡張

  • 8K トークン対応: 初代モデルより4 倍大型化したコンテキストウィンドウを備えています。
    • 最大 5.5 分の音声データ処理。
    • 29 枚の画像処理。
    • 58 フレームの映像処理。
    • これらの組み合わせもローカルハードウェアで直接処理可能。

コード・ビジョン・音声における性能向上

  • コード検索の大幅改善: 「MTEB Code」スコアが68.76 から 78.68 に向上(9.92 ポイント改善)。
    • ローカルコードベースのインデックス化。
    • セマンティックなコード検索。
    • コーディングエージェントのリトリバルに最適化。
  • 品質の新基準: サブ 1B モデルとして、パラメータあたりの品質において新たな基準を確立しました。
  • サイズ優位性: サイズが倍以上大きな一部の専門モデルよりも高い性能を発揮しています。

オンデバイス検索と RAG パイプラインの実現

  • 完全オフライン動作: データプライバシーの確保、レイテンシ低減、クロスモーダル検索・リトリバルシステムの構築が可能になります。
  • Gemma 4 との連携: 生成モデル「Gemma 4」と組み合わせることで、複雑なマルチモーダルデータを理解するオンデバイス RAG パイプラインを実装できます。
  • 共有リソースによる効率化:
    • テキストトークナイザーと音声エンコーダーを両モデルで共有。
    • 統合されたパイプライン内での同時実行により、合計のメモリフットプリントを抑制。

導入と利用方法 (LiteRT を用いた構築)

モデルのダウンロード

  • Hugging Face: モデル重みを入手可能。
  • Kaggle: モデル重みを入手可能。
  • Google AI Enterprise: Agent Platform Model Garden で近日公開予定。
  • オンデバイス最適化モデル: Hugging Face の LiteRT Community を参照してください。

デプロイメントプラットフォーム

  • クロスプラットフォームアプリ:
    • 転記済みタスク:Google AI Edge MediaPipe。
    • カスタム統合・検索・意思決定:Google AI Edge LiteRT。
  • ブラウザ向け: transformers.js または WebGPU で構築可能です。

開発ツールの選定

モデルを効率的に提供・実行するためのツールチェーンとして以下が推奨されます。

  • フレームワーク:
    transformers
    ,
    sentence-transformers
    ,
    MLX
    ,
    vLLM
  • 推論エンジン:
    llama.cpp
    ,
    SGLang
    ,
    Ollama
  • UI/サーバー:
    LMStudio
  • ベクトルデータベース: 埋め込みベクトルはQdrantで保存推奨。

ファインチューニング

  • 特定のユースケースに合わせた最適化については、Unsloth のガイダンスを参照してください。

まとめ

EmbeddingGemma 2 は、テキスト、コード、画像、音声、映像を一元管理し、プライバシーを守りながらオフラインで高性能な検索と意思決定をオンデバイスで実現する強力なツールです。開発者ガイドや詳細ドキュメントについては公式 Web サイトをご覧ください。

同じ日のほかのニュース

一覧に戻る →

2026/10/07 5:57

Decisions API が公開ベータ版を開始しました

## Japanese Translation: Decisions API は、テキストまたは画像の評価において Responses API より 10 倍の高速化を実現し、gpt-6-luna モデルを専有して動作する専用 POST /v1/decisions エンドポイントを通じて型付けされた結果を返します。現在公開ベータ版で提供中であり、General Availability は近日を予定しています。対応する具体的な回答タイプは 3 つあり、predicates(条件の確率)、choices(固定セットからの選択)、scores(ルーブリック評価)です。機能的には、API は単一のリクエスト内での独立した質問間で入力共有を可能にし、ワークフローを簡略化する一方で、依存関係のある決断は別々の順序実行呼び出しによって取り扱う必要があります。リクエストではテキスト入力またはインライン base64 エンコードされた画像を受け付けるが、ホスト URL および file_id 入力はサポートされていません。コスト効率の向上は、入力トークンのみに対して課金される(100 万トークンあたり 0.1 ドル)モデル採用と出力トークン料金の非課金化を通じて達成されます。また、HIPAA 準拠を米国、欧州、スイスデータセンターで確保するためのゼロデータ保持ポリシーも備わっています。開発者は、偽陽性と偽陰性の間のトレードオフに基づいてルーティング閾値を設定するためにラベル付けされた例を使用することで、コストと精度の最適化が可能です。これにより、条件チェック、固定選択、詳細な評価に対する高速かつ自動化された決定が最小の遅延で可能になります。

2026/10/07 5:33

パラマウント・スカイダンスがワーナー・ブラザーズ・ディスカバリーとの1,110億ドル合併を完了しました。

## Japanese Translation: パラマウント・グローバルは、ワーナー・ブラザース・ディスカバリーとの歴史的な 1,110 億ドル規模の合併を正式に完了させ、去年別の取引で買収した企業であるスカイダンスという名前の新しいメディア会社を創設しました。この組み合わせには、2 つの最大の映画スタジオ、広範なライブ・スポーツ関連資産(CBS スポーツおよび TNT スポーツを含む)、主要なストリーミングプラットフォーム(パラマウント+ および HBO マックス)ならびに CBS や CNN などの主要ニュース事業、さらに深いコンテンツライブラリとブランドが統合されています。 この取引は、合併が競争を著しく減少させ反トラスト法に違反すると主張するカリフォルニア州およびその他の 11 の州からの法的な課題に直面しました。米国地方裁判所の裁判官は 7 月に合併が競争を害する可能性が高いと裁定し、これを受けて各州から和解案の提議が行われました。言論自由およびメディア擁護団体は、和解を拒否するよう裁判所に要請しましたが(和解は訴追した州の住民に対して「実質的な何ら物事もないものを与えるに過ぎない」と主張)、9 月 30 日にアラセリ・マルティネス・オルギン裁判官は、訴訟回避を実現し合理的な事実および法的解決として合意を批准しました。 和解に基づき、パラマウントは国内映画に対する最低限の投資額および配給閾値を満たす必要があり、基本ケーブルチャネルのライセンスリングは各実体の保有に対して個別交渉の下で継続されます。エレン・ケイガン法務長官は差し止め申請を行わず、裁判プロセスは州側の訴訟とマルティネス・オルギン裁判官が和解を受諾したことに中心を置きました。スカイダンスの将来の成功は、これらの投資要件を満たし、さらなる法的混乱なく継続的なライセンス交渉を管理することによって左右されます。

2026/10/07 1:23

OpenTPU – AI から開発されたオープンソース AI アクセラレータ

## 日本語訳: 元のサマリーは強固ですが、キーポイントリストの粒度をより良く反映するために、特定のハードウェア制約、ツール名、およびビルドの区別を統合することで改善できます。以下が改訂版です: **改善されたサマリー:** OpenTPU は、ユーザーが独自の推論ハードウェアを設計し、Intel Core i7 などのホストシステムに PCIe を介して接続された Xilinx Kintex-7 FPGA(具体的には xc7k480t)上にモデルを実行することを可能にするオープンソースの AI アクセラレーターです。包括的なモノリポに含まれており、SystemVerilog デザイン、命令セット、ビット正確なシミュレータ、カーネル言語、コンパイラ、ホストソフトウェアを含み、キャッシュレスアーキテクチャを構築するための重要な教育資源として機能します。该系统は Inspur YPCB-00338 カード上でハードウェアとシミュレータ間のビット正確なトークン一致を実現しており、これらのカードは 2 つの DDR3 チャンネル(ピーク 17.1 GB/s)を有し、キャッシュなしで 133.33 MHz で動作します。データの移動は明示的であり、`opentpu-lens` などのツールを用いて正確な追跡を可能にします。プロダクションイメージでのベンチマークでは、LFM2.5-230M は 82–85% の DRAM 利用率で 85.8 tok/s を達成しました。ビルド B における戦略的な最適化により、FP4 量子化ウェイトと int8 ヘッドを利用することでトークンあたりのバイト数を大幅に削減し、DRAM 使用率を 91–94% に引き上げ、速度をさらに 8–9% 向上させ(総体的には最大で 40–45% の改善)、このアーキテクチャはオンボードメモリの制限に依存せず、PCIe レートで不活性なエクスパートをストレージからストリーミングすることで大規模なミクセル・オブ・エキスパートモデルをサポートします。主要なコマンドラインツールには、推論用の `otpu-chat`、モニタリング用の `otpu-smi`、検証用の `otpu-selftest` が含まれます。今後の作業では、現在の DRAM 利用率の制限を超え、安定性のためにタイミングマージンを最適化する予定です。

EmbeddingGemma 2:オープンで軽量なマルチモーダル埋め込みモデル | そっか~ニュース