ニュース

写真も動画も声もまとめて0.74Bで検索。ローカルRAG向け「EmbeddingGemma 2」

 録りためた動画の中の“あの場面”を、声で吹き込んだメモから探し出す。こうした検索をインターネットなしで実行できるAIモデル「EmbeddingGemma 2」を、Googleが10月6日(現地時間)に無償公開した。写真や動画、音声、文字、コードを1つのモデルで検索でき、ローカルRAG(検索拡張生成)では、資料を探す処理を受け持つ。オープンウェイト(モデルの重み)はHugging FaceとKaggleからダウンロードでき、Apache 2.0ライセンスの下で商用利用も認められる。

 EmbeddingGemma 2は、写真や動画、音声、文字、コードの意味を数値の並びに変換する、パラメータ数0.74B(7億4,000万)のマルチモーダルAIモデルである。この変換は「埋め込み(Embedding)」と呼ばれ、意味の近いデータをベクトル空間と呼ぶ数値の世界の近い位置にそろえる処理を指す。キーワードが一致しなくても“意味で探す”検索の土台になる技術だ。文章の生成は行なわず、アプリ内の検索や、RAG(手元の資料をAIに探させてから答えさせる仕組み)の検索部分を受け持つ。

 従来の埋め込みモデルの多くは文字専用で、写真は写真用、音声は音声用と、データの種類ごとに別のモデルが必要だった。複数の種類のデータを1つで扱う性質は「マルチモーダル」と呼ばれ、EmbeddingGemma 2は5種類を同じ“ものさし”の上に並べる。このため、声のメモで動画の場面を探す、文字の質問で何時間分もの録音を検索するといった、種類をまたぐ検索が1つのモデルで成立する。

 小ささも持ち味だ。量子化と呼ばれる軽量化を施した場合、スマートフォン「Google Pixel 11 Pro」での使用メモリは文字専用の構成で約191MB、全機能の構成でも約567MBにとどまる。処理が端末の中で完結するため、ネット接続のない場所でも動き、検索対象のファイルが外部に送信されない。

 使わない機能を外して、さらに軽くすることもできる。本体にあたる文字用の部分は0.27B(2億7,000万)で、画像用の0.17B(1億7,000万)と音声用の0.3B(3億)を必要に応じて追加する設計だ。さらに「Matryoshka Representation Learning(MRL)」という学習法も採用した。変換後の数値の個数を768個から128個まで削減でき、検索用データベースの保存容量を最大6分の1に圧縮できる。

コード検索ベンチマーク「MTEB Code」の比較。EmbeddingGemma 2は78.68で、同規模帯の比較モデルを上回った

 性能は同規模帯の首位をうたう。プログラムのコード検索を測るベンチマーク(性能測定テスト)「MTEB Code」は、前世代EmbeddingGemmaの68.76から78.68に伸びた。画像検索の「MIEB(lite)」も64.6で、一回り大きい規模のjina-embeddings-v5-omni-nanoの49.4を大きく上回る。

 もっとも、全勝ではない。多言語の文字検索「MTEB(Multilingual, v2)」は61.4で、jina-embeddings-v5-omni-nanoの65.5に届かない。音声検索の「MAEB」も49.4と、同モデルの50.1に僅差で及ばなかった。得意分野はコード・画像・動画だ。

 生成AI「Gemma 4」と同じ基本設計(アーキテクチャ)を共有する点も実用上の利点だ。EmbeddingGemma 2が端末内のファイルを探し、Gemma 4がそれを基に回答を組み立てるRAGを、外部にデータを出さずに少ないメモリで構築できる。前世代のEmbeddingGemmaは公開から約1年で2,000万ダウンロードを超えており、その後継にあたる。

EmbeddingGemma 2と他モデルのベンチマーク比較表。コード・画像・動画で高スコアの一方、多言語テキストと音声の一部では及ばない

 動作はブラウザやスマートフォンアプリ「Google AI Edge Gallery」の検索デモで試せる。一方、法人向け基盤のGemini Enterprise Agent Platform Model Gardenでの提供は「近日」とだけ案内され、開始日は10月10日時点で公表されていない。

EmbeddingGemma 2の主な仕様

  • 入手先とライセンス: Hugging Faceの「google/embeddinggemma-2」とKaggleから無償でダウンロードできる。ライセンスはApache 2.0で、商用利用も可
  • 規模と構成: パラメータ数は0.74B(7億4,000万)。文字専用なら0.27Bで動き、画像用(0.17B)と音声用(0.3B)の部品を追加できる
  • 扱えるデータ: 文字・コード・画像・音声・動画を1つのベクトル空間で検索。8Kトークンの入力枠で、音声最大5.5分、画像29枚、動画58フレームを一度に処理
  • メモリ使用量: 量子化時のGoogle Pixel 11 Proで、文字専用構成が約191MB、全機能構成が約567MB
  • 実行環境: Google AI EdgeのMediaPipeとLiteRTのほか、transformers、llama.cpp、Ollama、MLX、vLLMなどに対応