- Google、デバイス上で動作するオープンなマルチモーダル埋め込み AI モデル「EmbeddingGemma 2」を公開。
- 「EmbeddingGemma 2」では、テキストに加えてコード / 画像 / 動画 / 音声を 1 つのモデルでまとめて扱えるように。
- 音声メモをもとに特定の動画クリップを探したり、テキストで何時間分もの録音を検索したりといった処理を、インターネットに接続することなく端末上だけで実行可能。
Google の AI 研究部門「Google DeepMind」は現地時間 2026 年 10 月 6 日(火)、デバイス上で動作するオープンなマルチモーダル埋め込み AI モデル「EmbeddingGemma 2」を公開しました。
埋め込み AI モデルとは、文章や画像などのデータを、その意味を表す数値に変換する AI モデルです。意味の近いデータを探し出す検索や分類、生成 AI に手元の情報を参照させて回答させる RAG(検索拡張生成)などの土台として使われます。
2025 年に登場した初代「EmbeddingGemma」はテキスト専用でしたが、今回公開された「EmbeddingGemma 2」では、テキストに加えてコード / 画像 / 動画 / 音声を 1 つのモデルでまとめて扱えるようになりました。これにより、音声メモをもとに特定の動画クリップを探したり、テキストで何時間分もの録音を検索したりといった処理を、インターネットに接続することなく端末上だけで実行できます。
「EmbeddingGemma 2」は、Google のオープンモデル「Gemma 4」をベースにしており、パラメータ数は 7 億 4,000 万です。テキストのみの用途であれば 2 億 7,000 万パラメータで動作し、必要に応じて画像用(1 億 7,000 万)と音声用(3 億)の処理部分を追加する仕組みです。量子化した場合、「Pixel 11 Pro」でのメモリ使用量は、テキストのみで約 191MB、すべての機能を使う場合でも約 567MB に抑えられています。
一度に処理できるデータ量は初代の 4 倍となる 8K トークンで、最大 5.5 分の音声、29 枚の画像、58 フレームの動画、またはそれらを組み合わせたデータを扱えます。また、出力するデータのサイズを段階的に小さくすることもでき、端末内に保存する検索用データの容量を最大 6 分の 1 まで削減可能です。
性能面では、初代と同等の多言語テキスト性能を維持しつつ、コード検索の性能を測るベンチマーク「MTEB Code」のスコアが 68.76 から 78.68 へと 9.92 ポイント向上しました。画像や動画、音声でも、10 億パラメータ未満のモデルとしてトップクラスの性能を備えており、2 倍以上の規模を持つ専門モデルを上回る場面もあるとのことです。
さらに、「Gemma 4」と一部の構成要素を共有しているため、2 つのモデルを組み合わせて使う場合でもメモリ使用量を抑えつつ、端末上で完結する RAG を構築できます。なお、Google のオンデバイス AI 体験アプリ「Google AI Edge Gallery」には、「EmbeddingGemma 2」を使った機能として、テキストや画像で写真ライブラリを検索できる「Instant Media Search」と、テキストや音声で動画内の特定の場面を探せる「Video Moments Finder」が追加されています。
「EmbeddingGemma 2」は Hugging Face と Kaggle で公開されており、ライセンスは商用利用も可能な Apache 2.0 です。transformers や Ollama、llama.cpp、LM Studio といった主要な開発ツールにも対応しています。
Source:Google(https://blog.google/innovation-and-ai/technology/developers-tools/embeddinggemma-2/)















コメントを残す