AI・機械学習
Embedding Gemma 2 の紹介
EmbeddingGemma 2 (blog.google)
要約
Google DeepMindは、テキスト、画像、音声、動画を統一された埋め込み空間にマッピングする、オープンで軽量なマルチモーダル埋め込みモデル「Embedding Gemma 2」を発表しました。このモデルは、7億4000万パラメータを持ち、オンデバイスでの推論に最適化されており、プライバシーを保護しつつ、クロスモーダル検索やRAGパイプラインを強化します。
全文翻訳
Embedding Gemma 2: オープンで軽量なマルチモーダル埋め込みモデル
2026年10月6日
Embedding Gemma 2は、オンデバイスでのマルチモーダル埋め込みにおいて最も高性能なモデルであり、テキスト、画像、音声、動画の組み合わせをネイティブに統一された埋め込み空間にマッピングします。
Sahil Dua, Research Engineer, Google DeepMind
Henrique Schechter Vera, Research Engineer, Google DeepMind
共有: x.com Facebook LinkedIn メール リンクをコピー
お使いのブラウザは音声要素をサポートしていません。
記事を聴く [[duration]] 分
このコンテンツはGoogle AIによって生成されました。
生成AIは実験的なものです
音声 スピード
音声 スピード 0.75X 1X 1.5X 2X
昨年、Embedding Gemmaを発表し、高品質なテキスト埋め込みのための軽量なオプションを提供し、アプリが消費者向けハードウェア上で直接情報を整理、検索、接続できるようにしました。開発者コミュニティからの反応は私たちの予想をはるかに超えました。2000万ダウンロード以上を記録し、開発者はこれを使用して、よりスマートなオンデバイス検索ツールやプライバシーを重視したRetrieval Augmented Generation (RAG) パイプラインを構築してきました。
本日、Embedding Gemma 2をローンチし、テキストを超えてコード、画像、動画、音声を共有埋め込み空間に統合します。Gemma 4アーキテクチャ上に構築され、商用利用可能なApache 2.0ライセンスの下でリリースされたEmbedding Gemma 2は、7億4000万パラメータを持ち、オンデバイス推論に最適です。音声メモから特定の動画クリップを見つけたり、単一のネイティブマルチモーダルモデルで処理されるテキストクエリに基づいて数時間の音声録音を検索したりするのに役立ちます。
Gemini Embeddingモデルと同じ技術から構築されたEmbedding Gemma 2は以下の特徴を持ちます:
サイズあたりのクラス最高性能:MTEB (Massive Text Embedding Benchmark) CodeやMAEB (Massive Audio Embedding Benchmark) などのベンチマークにおいて、1B未満のマルチモーダルエンベッダーの中でサイズあたりの最先端スコアを達成し、テキスト、ビジョン、音声タスク全体で多くのより大きなモデルに匹敵するか、それを上回ります。
モジュール設計:テキストのみのワークロードにはわずか2億7000万パラメータで済み、完全なマルチモーダルサポートのためにオプションのビジョン(1億7000万)およびオーディオ(3億)エンコーダーを使用できます。
ストレージ効率:Matryoshka Representation Learning (MRL) を使用すると、開発者は出力ベクトルを768次元から512、256、または128次元に動的に切り捨てることができます。これにより、ローカルベクトルデータベースやメモリ使用量のストレージが最大6倍削減されます。
オンデバイスパフォーマンスに最適化:厳しいリソース制約の中で効率的に動作します。量子化により、Google Pixel 11 Proでは、Embedding Gemma 2はテキストのみの重みで約1億9100万MB、フルマルチモーダルモデルで約5億6700万MBのRAMしか必要としません。
拡張コンテキスト対応:8Kトークンのコンテキストウィンドウ(Embedding Gemma 1の4倍)を備えており、ローカルハードウェアで直接最大5.5分の音声、29枚の画像、58本の動画フレーム、またはそれらのインターリーブされた組み合わせを処理できます。
コード、ビジョン、オーディオにおける最先端の品質達成
Embedding Gemma 2は、Embedding Gemmaの強力な多言語テキストパフォーマンスに匹敵する一方で、コードパフォーマンスで9.92ポイントの大幅な向上(MTEB Codeで68.76から78.68へ)を達成しており、ローカルコードベースのインデックス作成、セマンティックコード検索、コーディングエージェントの検索に適しています。画像、動画、ドキュメント、音声全体で、1B未満のモデルにおける品質あたりのパラメータ数において新基準を設定し、サイズが2倍以上の専門モデルさえも凌駕しています。完全な評価メトリクスとモデル情報は、Embedding Gemma 2モデルカードで確認できます。
セマンティック検索、ルーティング、検索を完全にオンデバイスで実現
Embedding Gemma 2は、エッジハードウェアに堅牢な機能をもたらします。ローカルで埋め込みを生成することで、データのプライバシーを確保し、パイプラインの遅延を削減し、開発者が完全にオフラインで動作するクロスモーダル検索と検索を構築できるようにします。
Gemma 4などの生成モデルと組み合わせることで、Embedding Gemma 2は複雑なマルチモーダルデータを理解するオンデバイスRAGパイプラインを可能にします。Embedding Gemma 2はGemma 4上に構築され、そのテキストトークナイザーとオーディオエンコーダーを共有しているため、開発者は両方のモデルを統合パイプラインで、より低い合計メモリフットプリントで一緒に実行できます。
テキストまたは画像を使用して、セマンティック類似性に基づいてメディアライブラリ内のトップマッチを見つけます。Google AI Edge GalleryのInstant Media Searchで試してみてください。
テキストまたは音声クエリを使用して、動画内の特定の瞬間を特定します。Google AI Edge GalleryのVideo Moments Finderで試してみてください。
コンテキスト認識のためのマルチモーダルコンテキストを活用したリアルタイム意思決定エンジンを作成します。MediaPipe Decision Task APIを介して分類、ルーティング、予測機能を実現します。
LiteRTと連携してオンデバイス検索およびRAGシステムを構築する方法については、Google AI Edgeブログ投稿をお読みください。
Embedding Gemma 2で始める
Embedding Gemma 2が、皆様が開発する環境ですぐに動作するように、以下のパートナーと緊密に協力しました:
モデルのダウンロード:モデルの重みはHugging FaceとKaggleで見つかります。Gemini Enterprise Agent Platform Model Gardenでの利用も近日中に開始されます。オンデバイス用に最適化されたモデルについては、Hugging FaceのLiteRT Communityをご覧ください。
オンデバイスデプロイメント:Google AI Edge MediaPipeを使用して、ターンキーの埋め込み、検索、意思決定タスク用のクロスプラットフォームアプリを開発するか、LiteRTを使用してカスタムモデル統合を行います。transformers.jsまたはWebGPUを使用してブラウザ向けに構築します。
お気に入りの開発ツールを使用する:transformers、sentence-transformers、MLX、vLLM、llama.cpp、SGLang、Ollama、LMStudioを使用してモデルを効率的に提供します。Qdrantで埋め込みベクトルを保存します。
ファインチューニング:Unslothのガイダンスに従って、ユースケースに合わせてEmbedding Gemma 2をファインチューニングしてください。
開発者ガイド、ドキュメント、推論およびファインチューニングのガイドをご覧ください。
投稿先: