Googleがマルチモーダル埋め込みモデル「EmbeddingGemma 2」を発表!オンデバイスAI開発が加速

EmbeddingGemma 2とは?
Googleは、オープンで軽量なマルチモーダル埋め込みモデル「EmbeddingGemma 2」を発表しました。これは、テキスト、画像、音声、動画といった複数のモダリティを統一された埋め込み空間にマッピングできる、オンデバイスAIに最適なモデルです。
昨年リリースされたテキスト埋め込みモデル「EmbeddingGemma」の後継にあたり、開発者コミュニティからの2,000万回以上のダウンロードという反響を受けて、今回はテキストだけでなくコード、画像、動画、音声を統合する形に進化しました。
EmbeddingGemma 2で何ができるのか?
EmbeddingGemma 2は、Gemma 4アーキテクチャに基づいて構築され、商用利用可能なApache 2.0ライセンスで提供されます。7億4,000万のパラメータを持ち、オンデバイスでの推論に最適化されています。主な特徴は以下の通りです。
- クラス最高レベルの性能:10億未満のマルチモーダル埋め込みモデルの中で、MTEB CodeやMAEBなどのベンチマークで最高のスコアを達成し、多くの大規模モデルを凌駕または同等の性能を発揮します。
- モジュール設計:テキストのみのワークロードでは2億7,000万パラメータ、オプションのビジョン(1億7,000万)とオーディオ(3億)エンコーダを追加することで、完全なマルチモーダルサポートが可能です。
- ストレージ効率:Matryoshka Representation Learning (MRL) を使用することで、出力ベクトルを768次元から512、256、または128次元に動的に切り詰めることができ、ローカルベクトルデータベースやメモリ使用量を最大6倍削減できます。
- オンデバイス性能の最適化:限られたリソース内で効率的に動作します。量子化により、Google Pixel 11 Proでは、テキストのみの重みで約191MB、フルマルチモーダルモデルで約567MBのアクティブRAMで動作します。
- 拡張されたコンテキスト対応:8Kトークンのコンテキストウィンドウ(EmbeddingGemma 1の4倍)を備え、最大5.5分の音声、29枚の画像、58フレームの動画、またはそれらの組み合わせをローカルハードウェアで直接処理できます。
これにより、音声メモから特定のビデオクリップを見つけたり、テキストクエリに基づいて何時間もの音声録音を検索したりといったことが、単一のマルチモーダルモデルで可能になります。
コード、ビジョン、オーディオにおける品質向上
EmbeddingGemma 2は、EmbeddingGemmaの強力な多言語テキスト性能を維持しつつ、コード性能をMTEB Codeで9.92ポイント向上させました(68.76から78.68へ)。これにより、ローカルコードベースのインデックス作成、セマンティックコード検索、コーディングエージェントの検索に適しています。画像、動画、ドキュメント、音声においても、10億未満のモデルで新たな品質基準を確立し、2倍以上のサイズの専門モデルをも上回る性能を発揮します。
オンデバイスでのセマンティック検索、ルーティング、検索
EmbeddingGemma 2は、堅牢な機能をエッジハードウェアに直接もたらします。ローカルで埋め込みを生成することで、データプライバシーを確保し、パイプラインのレイテンシを削減し、開発者が完全にオフラインで動作するクロスモーダル検索と検索を構築できるようになります。Gemma 4などの生成モデルと組み合わせることで、複雑なマルチモーダルデータを理解するオンデバイスRAGパイプラインが可能になります。
EmbeddingGemma 2はGemma 4に基づいて構築されており、そのテキストトークナイザーとオーディオエンコーダを共有しているため、開発者は両方のモデルを統合されたパイプラインで実行でき、合計メモリフットプリントを低く抑えることができます。
- テキストや画像を使用して、メディアライブラリ内のセマンティックな類似性に基づいて上位の一致を見つけることができます。Google AI Edge GalleryのInstant Media Searchで試すことができます。
- テキストまたは音声クエリを使用して、動画内の特定の瞬間を特定できます。Google AI Edge GalleryのVideo Moments Finderで試すことができます。
- EmbeddingGemma 2をローカルファイル検索に、Gemma 4を文脈推論に組み合わせることができます。Google AI Edge Foresightアプリで試すことができます。
- MediaPipe Decision Task APIを介して、マルチモーダルコンテキストを活用した分類、ルーティング、予測機能により、リアルタイムの意思決定エンジンを作成できます。
EmbeddingGemma 2の入手方法
EmbeddingGemma 2は、開発者がすぐに利用できるよう、以下のプラットフォームで提供されています。
- モデルのダウンロード:モデルの重みはHugging FaceとKaggleで入手可能です。Gemini Enterprise Agent Platform Model Gardenでも近日中に利用可能になる予定です。オンデバイスに最適化されたモデルは、Hugging FaceのLiteRT Communityで確認できます。
- オンデバイス展開:Google AI Edge MediaPipeを使用して、ターンキーの埋め込み、検索、意思決定タスクを行うクロスプラットフォームアプリを開発したり、LiteRTを使用してカスタムモデルを統合したりできます。transformers.jsまたはWebGPUを使用してブラウザ向けに構築することも可能です。
- 開発ツールの利用:transformers、sentence-transformers、MLX、vLLM、llama.cpp、SGLang、Ollama、LMStudioなどのツールを使用してモデルを効率的に提供できます。埋め込みベクトルはQdrantに保存できます。
- ファインチューニング:Unslothのガイダンスに従って、ユースケースに合わせてEmbeddingGemma 2をファインチューニングできます。
詳細については、開発者ガイド、ドキュメント、推論とファインチューニングのガイドを参照してください。


