AIツール2026年10月更新

EmbeddingGemma 2とは?画像・音声も扱えるGoogleの軽量埋め込みモデル|RAGでの使い方とOpenAI埋め込みとの比較【2026年10月】

公開日: 2026/10/11
EmbeddingGemma 2とは?画像・音声も扱えるGoogleの軽量埋め込みモデル|RAGでの使い方とOpenAI埋め込みとの比較【2026年10月】

この記事のポイント

EmbeddingGemma 2は、テキスト・画像・動画・音声を1つのベクトル空間に変換するGoogle DeepMindのオープンな埋め込みモデルです(740M・Apache 2.0)。仕様、RAGでの使い方とコード、OpenAI埋め込み・Gemini Embedding 2との料金と機能の比較、導入時の注意点を2026年10月時点の公式情報で整理します。

EmbeddingGemma 2は、Google DeepMindが2026年10月6日に公開した、テキスト・コード・画像・動画・音声を1つの共通ベクトル空間に変換する軽量の埋め込みモデルです。重みが公開されていて(Apache 2.0)、スマホやPCの中でオフラインのまま動かせるため、社内文書や写真をクラウドに送らずに検索やRAGを組めます。

この記事でわかること

  • EmbeddingGemma 2の仕様と、前の版(EmbeddingGemma)からの変更点
  • 画像・動画・音声をどう入力するか、どれだけ文脈を使うか
  • RAGに組み込む手順とPythonのコード例、次元の選び方
  • OpenAIのtext-embedding-3、GoogleのGemini Embedding 2との料金・機能の違い
  • float16で結果がおかしくなるなど、導入時につまずきやすい点とセキュリティ上の注意

こんな人に向けた記事です

  • 社内検索やRAGで使う埋め込みモデルを選んでいるエンジニア
  • OpenAIの埋め込みAPIから、自前で動かすモデルへの切り替えを検討している人
  • 写真・動画・音声も含めた検索を、端末内や社内サーバーで完結させたい人

数値は公式のモデルカード・ブログ・料金ページに基づいています。公開から日が浅いモデルなので、対応ツールや提供形態は今後変わる可能性があります。

EmbeddingGemma 2とは:画像・音声も扱える740Mの埋め込みモデル

EmbeddingGemma 2 開発者ガイドのイメージ画像

出典:Google Developers Blog「EmbeddingGemma 2: The Developer Guide」

EmbeddingGemma 2は「文章を書くAI」ではなく、入力を数値の並び(ベクトル)に変えて、意味の近いものどうしを探せるようにするモデルです。Gemma 4をベースに、Gemini Embeddingと同じ技術から作られています。

埋め込みモデルの役割は「意味で探すための索引づくり」です。たとえば「経費精算の締め日は?」という質問と「経費精算は毎月25日締め」という社内規程の一文は、言葉が違っても意味が近いので、ベクトルにすると近い位置に並びます。EmbeddingGemma 2はこれを文章だけでなく、写真・動画・音声にも広げました。文字で写真を探す、音声で動画の場面を探す、といったモダリティをまたいだ検索が1つのモデルでできます。

主な仕様は次のとおりです(Hugging Faceのモデルカード google/embeddinggemma-2 より)。

項目

内容

開発元

Google DeepMind

公開日

2026年10月6日

パラメータ数

740M(テキスト270M+画像エンコーダー170M+音声エンコーダー300M)

対応入力

テキスト(コード含む)・画像・動画・音声・それらの組み合わせ

文脈長

8,192トークン(全モダリティで共有)

出力次元

768(標準)。512・256・128に切り詰め可

対応言語

100以上(テキスト・コード)

必要メモリの目安

量子化版でテキストのみ約191MB、フル構成で約567MB(Pixel 11 Proでの公式計測)

ライセンス

Apache 2.0(商用利用・ファインチューニング・再配布可。Gemmaの禁止用途ポリシーにも従う)

入手先

Hugging Face、Kaggle(端末向け量子化版はLiteRT Community)

学習データのカットオフ

2025年1月

Googleが運営するホスト型API(Model Garden経由)は、現時点では「近日提供」と告知されているだけです。今のところは、重みをダウンロードして自分の環境で動かすのが基本の使い方になります。

前の版(EmbeddingGemma)から変わった点

2025年9月に公開された初代EmbeddingGemmaはテキスト専用でした。公式ブログによると初代のダウンロード数は2,000万を超えており、その後継にあたります。

項目

EmbeddingGemma 2

EmbeddingGemma(初代)

ベース

Gemma 4

Gemma 3

パラメータ数

740M

308M

対応入力

テキスト・画像・動画・音声

テキストのみ

文脈長

8,192トークン

2,048トークン

MTEB(多言語 v2)平均

61.36

61.15

MTEB(コード v1)NDCG@10

78.68

68.76

文章の検索性能(多言語)はほぼ横ばいで、伸びたのはコード検索と、新しく加わった画像・音声です。文脈は4倍の8Kトークンになり、長めの文書を細かく分けずに入れられるようになりました。テキスト用途だけなら、初代から乗り換える一番の理由は「文脈長」と「コード検索」になります。

EmbeddingGemma 2でできること

EmbeddingGemma 2で画像・動画・音声・テキストを端末内で横断検索するイメージ

出典:Google Developers Blog

公式ブログと開発者ブログで紹介されている使い道は、大きく次の5つです。

用途

具体例

組み合わせるもの

端末内のメディア検索

スマホの写真・動画・録音を「海辺で犬が走っている」のような文章で探す

MediaPipe、LiteRT

動画の場面検索

長い動画から、文章や音声で目的のシーンを探す(デモ「Video Moments Finder」)

AI Edge Gallery

オフラインRAG

社内文書をEmbeddingGemma 2で検索し、Gemma 4が回答を書く

Gemma 4、ベクトルDB

コード検索

コーディングエージェントが関連する関数やファイルを探す

MTEBコードで78.68

ゼロショット分類・振り分け

学習データなしで問い合わせをラベルに振り分ける

MediaPipe Decision Task API

窓の杜は、これまで「キャプション生成→文字起こし→テキスト埋め込み」と3段階に分けていた動画検索を、1つのモデルに置き換えられる例を紹介しています。前処理のモデルを減らせるのは、運用の手間の面でも大きい変化です。

画像・動画・音声の入力とトークン消費

画像や音声も、テキストと同じ8,192トークンの枠を使います。1つの入力にどれだけ入るかの目安は次のとおりです(モデルカードより)。

入力

トークン消費

8Kに収まる目安

テキスト

サブワード1つで1トークン

8,192トークン

画像

標準で1枚280トークン(70/140/280/560/1120から選択)

約29枚(70トークン設定なら約114枚)

動画

標準で1フレーム140トークン、1fpsで抜き出し

約58フレーム

音声

1秒25トークン(16kHzモノラル)

約327秒(約5.5分)

テキストの中に <|image|> <|video|> <|audio|> を置くと、文章と画像・音声を混ぜた1つの入力(インターリーブ入力)も作れます。商品説明文と商品写真をまとめて1件として登録する、といった使い方です。

使う部分だけ読み込める

EmbeddingGemma 2はテキスト・画像・音声の部品に分かれていて、要らない部品を外して読み込めます。テキストだけなら実質270Mで、初代と同じくらい軽く動きます。

使う入力

設定(config_kwargs)

実質サイズ

テキストのみ

{"vision_config": None, "audio_config": None}

270M

テキスト+画像

{"audio_config": None}

440M

テキスト+音声

{"vision_config": None}

570M

すべて

{}

740M

EmbeddingGemma 2の強み

強みは「軽さ」「オフライン動作」「1モデルで全部の入力を扱えること」の3つです。

  • 端末内で動く軽さ:量子化(INT4/INT8)済みの版が用意されていて、LiteRTの .litertlm ファイル1つでCPU・GPU・NPUに対応します。Google AI Edgeの開発者ブログでは、MacBook(M5 Pro)のGPUで画像1枚の埋め込みが37.3ミリ秒(毎秒約27枚)と報告されています
  • データを外に出さずに済む:埋め込みを作る段階でクラウドAPIを呼ばないため、社内規程や顧客の写真を外部に送らない設計にできます
  • モダリティをまたいだ検索が1モデルで済む:画像用・音声用に別々のモデルを用意し、ベクトルの空間を合わせる作業が要りません
  • 保存容量を減らせる:MRL(Matryoshka Representation Learning)という学習方法で、768次元を128次元まで切り詰められます。保存容量は最大6分の1です
  • 商用で使いやすいライセンス:Apache 2.0なので、自社製品への組み込みやファインチューニングがしやすい条件です
  • 対応ツールが多い:公式ブログでは、sentence-transformers、transformers、transformers.js(WebGPU)、MLX、vLLM、llama.cpp、SGLang、Ollama、LM Studio、Qdrantなどが対応ツールとして挙げられています。ファインチューニングはUnslothが手順を公開しています

Googleは「1B未満のマルチモーダル埋め込みモデルの中で、MTEB(コード)とMAEB(音声)で最高水準」と発表しています。ただしこれはGoogle自身の発表で、第三者による検証は現時点では確認できていません。

EmbeddingGemma 2の弱み・できないこと

一番大きい注意点は、日本語での性能が公式には公開されていないことです。多言語MTEBの総合値(61.36)はありますが、日本語だけのスコアは出ていません。日本語の社内文書に使うなら、自社データで検索精度を確かめてから採用を決めてください。

ほかの弱みと制約は次のとおりです。

  • 文章は生成しない:出すのはベクトルだけです。RAGで回答文を作るには、Gemma 4などの別のLLMが必要です
  • 8Kトークンを超える入力は分割が必要:長い文書や長い動画はチャンク(小さなかたまり)に切ってから埋め込みます。sentence-transformersでは動画の既定は最大32フレームです
  • 128次元まで減らすとマルチモーダルの精度が大きく落ちる:テキストは256次元でもほぼ維持できますが、画像・動画を含む検索では128次元は避けたほうが無難です
  • llama.cpp(GGUF)版はテキストとコードのみ:画像・動画・音声を使うならsentence-transformersなどPython側の実装を使います
  • 他のモデルとベクトルの互換がない:OpenAIの埋め込みや初代EmbeddingGemmaから移るときは、保存済みデータを全部埋め込み直す必要があります
  • マネージドAPIがまだ無い:SLA付きでGoogleに運用を任せたい場合は、現時点ではGemini Embedding 2などのAPIが候補になります
  • 苦手な表現がある:モデルカードでは、言語による性能差や、皮肉・比喩の扱いが苦手な点が挙げられています

料金と動かすのに必要な環境

Google DeepMindのオープンモデル Gemma シリーズの紹介画像

出典:Google DeepMind「Gemma」

EmbeddingGemma 2のモデル自体は無料です。かかるのは、動かすPC・サーバー・GPUの費用と電気代だけです。Googleのホスト型APIとしての料金は、2026年10月11日時点では発表されていません。

API型の埋め込みモデルは使った分だけ課金されるので、どちらが安いかはデータ量と運用体制で変わります。考え方の目安は次のとおりです。

状況

費用の傾向

文書が数万件程度、更新も少ない

APIの従量課金のほうが安く済むことが多い(OpenAIのtext-embedding-3-smallは100万トークンあたり0.02ドル)

画像・動画・音声を大量に埋め込む

APIはテキストより高い単価が多く、自前で動かすほうが割安になりやすい

すでに社内にGPUサーバーがある

追加費用がほぼ電気代だけになり、EmbeddingGemma 2が有利

利用者の端末内で埋め込みを作る(アプリ組み込み)

サーバー側の埋め込み費用はかからない

動かす環境は、テキストだけなら一般的なPCのCPUでも試せます。公式の計測では量子化版のメモリ使用量が約191MB(テキストのみ)〜約567MB(フル構成)で、スマホでも動く大きさです。大量のデータを一度に埋め込むときはGPUがあると速く終わります。

RAG全体の構築費用(ベクトルDB、生成LLM、開発・運用の人件費)は、埋め込みモデルの費用よりはるかに大きくなるのが一般的です。全体像はRAG導入の費用で整理しています。

このツールを自社のシステムや業務にどう組み込むか、ご提案します

初回相談は無料・30分(オンライン)。要件が決まっていなくても大丈夫です。改修100万円〜・PoC300万円〜(税別)

開発について相談する

RAGでの使い方:手順とコード例

Hugging Faceで公開されているEmbeddingGemma 2のモデルページ

出典:Hugging Face「google/embeddinggemma-2」

RAGでのEmbeddingGemma 2の役割は「質問に関係する資料を探してくること」です。見つけた資料をもとに回答を書くのは別のLLMが担当します。RAG自体の仕組みはRAGとはで詳しく解説しています。

全体の流れは次の5段階です。

段階

やること

使うもの

1. 分割

社内文書を数百〜千トークン程度のチャンクに分ける

自前のスクリプト

2. 埋め込み

各チャンクを「文書用」のプロンプトでベクトル化する

EmbeddingGemma 2

3. 保存

ベクトルと元の文章をベクトルDBに入れる

Qdrantなど

4. 検索

質問を「クエリ用」のプロンプトでベクトル化し、近いチャンクを取り出す

EmbeddingGemma 2+ベクトルDB

5. 回答

取り出したチャンクを添えてLLMに回答させる

Gemma 4などのLLM

公式ドキュメントは、スマホ向けのオフラインRAGではGemma 4 E2Bとの組み合わせを推奨しており、Gemma CookbookにRAGのクイックスタートがあります。社内サーバーで動かすなら、もう少し大きいGemma 4 12Bを回答側に使う構成も考えられます。

インストールと基本のコード

sentence-transformersを使うのが一番手早い方法です(公式のマルチモーダルガイドの手順)。

pip install -U sentence-transformers transformers pillow soundfile torchcodec
import torch
from sentence_transformers import SentenceTransformer

# float16は使わない(bfloat16かfloat32)
model = SentenceTransformer(
    "google/embeddinggemma-2",
    model_kwargs={"torch_dtype": torch.bfloat16},
)

# 検索:質問と文書で別のプロンプトを使う
query_emb = model.encode("経費精算の締め日は?", prompt_name="SearchQuery")
doc_emb = model.encode("経費精算は毎月25日締めです。", prompt_name="Document")
print(model.similarity(query_emb, doc_emb))

# 画像・音声・動画は辞書で渡す(プロンプトは不要)
img_emb = model.encode({"image": "photo.jpg"})

prompt_name="SearchQuery" は task: search result | query: ...、prompt_name="Document" は title: none | text: ... という前置きを自動で付けます。文書にタイトルがある場合は title: 経費精算規程 | text: ... のように自分で整形すると、タイトルの情報も検索に反映されます。

テキストだけを扱うなら、画像・音声の部品を外して読み込むとメモリを節約できます。

model = SentenceTransformer(
    "google/embeddinggemma-2",
    model_kwargs={"torch_dtype": torch.bfloat16},
    config_kwargs={"vision_config": None, "audio_config": None},
)

タスクごとのプロンプト

テキストを埋め込むときは、用途に合ったプロンプトを前に付けます。省くと品質が下がるとモデルカードに明記されています。

用途

クエリ側のプロンプト

文書検索(RAG)

task: search result | query: {質問}

質問応答

task: question answering | query: {質問}

ファクトチェック

task: fact checking | query: {主張}

コード検索

task: code retrieval | query: {説明}

分類

task: classification | query: {テキスト}

クラスタリング

task: clustering | query: {テキスト}

文章の類似度

task: sentence similarity | query: {テキスト}

文書側(共通)

title: {タイトル または none} | text: {本文}

次元の選び方

次元を減らすと保存容量と検索時間が減る代わりに、精度が少し落ちます。モデルカードの数値を見ると、テキストとマルチモーダルで落ち方がかなり違います。

次元

容量

MTEB多言語

MTEBコード

MIEB lite(画像)

MMEB v2全体

768

1

61.36

78.68

64.64

59.01

512

2/3

61.17

77.24

64.32

58.38

256

1/3

60.41

76.18

63.13

56.24

128

1/6

57.89

71.41

59.06

45.65

この表から、次のように決めるのが現実的です。

  • テキスト中心の社内検索:256次元で十分なことが多い。容量は3分の1で、精度の低下は1ポイント程度
  • 画像・動画も含む検索:512か768。128次元ではMMEBが59.01から45.65まで落ちます
  • 件数が少ない(数万件以下):容量の問題が小さいので768のままで構いません

次元を減らすときは、クエリと文書を必ず同じ次元にそろえ、L2正規化をかけます。

q = model.encode("経費精算の締め日は?", prompt_name="SearchQuery",
                 truncate_dim=256, normalize_embeddings=True)
d = model.encode(docs, prompt_name="Document",
                 truncate_dim=256, normalize_embeddings=True)

OpenAI互換のエンドポイントで動かす(テキストのみ)

Unslothのガイドでは、GGUF版(unsloth/embeddinggemma-2-GGUF の embeddinggemma-2-UD-Q4_K_XL.gguf、約176MB)を llama.cpp の llama-server --embeddings --pooling mean で起動し、OpenAI互換の /v1/embeddings で呼ぶ方法が紹介されています。今OpenAIの埋め込みAPIを呼んでいるコードの接続先を変えるだけで試せるので、比較検証には便利です。ただし、この方法はテキストとコードだけで、タスク用のプロンプトは自分で付ける必要があります。

Ollamaについては公式ブログで「対応」とされていますが、2026年10月11日時点でOllamaのライブラリページで確認できるのは初代(テキスト専用・2Kトークン)のタグだけでした。v2のタグ名は公式の案内を確認してから使ってください。

OpenAI埋め込み・Gemini Embedding 2との違い

Gemini Embedding 2を提供するGemini APIの紹介画像

出典:Google AI for Developers「Gemini API」

テキストだけを手軽に安く使うならOpenAIのtext-embedding-3-small、画像・音声も含めてAPIで任せたいならGemini Embedding 2、データを外に出さずに自前で動かしたいならEmbeddingGemma 2が合います。OpenAIには、現時点ではマルチモーダルの埋め込みモデルがありません。

項目

EmbeddingGemma 2

OpenAI text-embedding-3-small

OpenAI text-embedding-3-large

Gemini Embedding 2

提供形態

オープンウェイト(自前で動かす)

API

API

API(Stable)

対応入力

テキスト・画像・動画・音声

テキストのみ

テキストのみ

テキスト・画像・音声・動画・PDF

料金(100万トークンあたり)

0ドル(計算資源は自前)

0.02ドル

0.13ドル

テキスト0.20ドル/画像0.45ドル/音声6.50ドル/動画12.00ドル(Batchは半額、無料枠あり)

標準の次元

768(128まで短縮可)

1536(短縮可)

3072(短縮可)

3072(128〜3072)

最大入力

8,192トークン

8,192トークン

8,192トークン

8,192トークン

データの送り先

自社の端末・サーバー内

OpenAIのAPI

OpenAIのAPI

GoogleのAPI

オフライン動作

できる

できない

できない

できない

運用の手間

サーバーやモデル更新を自分で管理

少ない

少ない

少ない

ファインチューニング

できる(Apache 2.0)

できない

できない

できない

料金は2026年10月11日時点の各社公式料金ページの値です。OpenAIの埋め込みのBatch料金は、公式料金ページ上では確認できなかったため載せていません。

性能について、OpenAIの公式ガイドにはtext-embedding-3-smallが62.3%、3-largeが64.6%というMTEBスコアが載っています。ただ、これは古い版のMTEB(英語)での値で、EmbeddingGemma 2の数値とは評価条件が違います。数字を並べて優劣を決めるのではなく、自社のデータで同じ質問セットを使って比べるのが確実です。

OpenAIから乗り換えるべきか

すでにOpenAIの埋め込みで動いているRAGがあるなら、次のどれかに当てはまるときに検討する価値があります。

  • 機密性の高い文書が多く、外部APIに送ること自体を減らしたい
  • 写真・図面・録音・動画も検索対象に加えたい
  • 埋め込みの量が多く、API料金が無視できない額になっている
  • ネットワークにつながらない現場や端末で検索を動かしたい

逆に、テキストだけで件数もそれほど多くなく、今の精度に不満がないなら、急いで移る理由は小さいです。乗り換えには保存済みデータの再埋め込みと、日本語での精度検証が必要になります。

社内の文書管理や業務システムに埋め込み検索を組み込む場合は、モデル選びより、既存データの取り込みや権限管理の設計に手間がかかることが多いです。新しいモデルを自社の業務システムに組み込む進め方と費用の目安は、既存システムにAIを組み込む方法で解説しています。ChatGPTの標準機能で社内検索を済ませるか、RAGを自作するかで迷っている場合は、ChatGPTの社内検索と独自RAGの比較も参考になります。

国産モデルやファインチューニングという選択肢

日本語の精度を最優先するなら、日本語に強い国産モデルも比較に入れるとよいでしょう。埋め込みやリランキング用のモデルも出しているSB Intuitionsのシリーズは、Sarashina3とはで紹介しています。また、検索精度が足りないときに、埋め込みモデルを自社データで追加学習するか、RAGの設計で補うかの判断はファインチューニングとRAGの比較が参考になります。

導入時の注意点とセキュリティ

技術面で一番つまずきやすいのは、float16で動かすと結果がおかしくなることです。エラーが出ないまま、NaNや品質の劣化が起こるとモデルカードとUnslothのガイドに書かれています。bfloat16かfloat32を指定してください。

ほかに確認しておきたい点をまとめます。

注意点

対策

float16でエラーが出ないまま結果がおかしくなる

bfloat16かfloat32を明示する

次元を切り詰めたのに正規化していない

normalize_embeddings=True でL2正規化する

クエリと文書で次元が違う

両方を同じ truncate_dim にそろえる

プロンプトを付けていない

用途に合ったタスクプロンプトを付ける

GGUF版で画像を入れようとする

画像・音声・動画はsentence-transformersなどを使う

古いベクトルと混ぜる

モデルを変えたら全件を埋め込み直す

日本語の精度が未知数

実際の質問と正解文書のセットを作って検証する

セキュリティ面で押さえておきたい点は次の3つです。

  • 安全性のチューニングがされていない:モデルカードによると、EmbeddingGemma 2は事前学習のみの埋め込みモデルで、出力の検閲などはありません。検索結果のフィルタリングや公平性のテストは、アプリ側で設計する必要があります
  • ベクトルDBも機密データとして扱う:一般にベクトルから元の文章をある程度推測できるとされています。元文書と同じ権限でアクセスを制御するのが安全です
  • 端末内・社内で完結できるのは利点:埋め込みの作成をクラウドに出さないため、外部送信に関する社内規程の確認がAPIより簡単になる場合があります。ただし回答を書くLLMにクラウドのAPIを使えば、そこでデータは外に出ます

Gemmaの禁止用途ポリシーへの準拠も、Apache 2.0のライセンスとは別に求められます。

EmbeddingGemma 2がおすすめな人・おすすめしない人

こんな人におすすめ

  • 社内文書や顧客データを外部のAPIに送らずに検索・RAGを作りたい
  • 写真・図面・録音・動画も同じ仕組みで検索したい
  • スマホアプリやPCアプリに、オフラインで動く検索機能を組み込みたい
  • コード検索を使う開発ツールやコーディングエージェントを作っている
  • 埋め込みの量が多く、API料金を抑えたい
  • 自社データでファインチューニングして精度を上げたい

おすすめしない人

  • サーバーの用意やモデルの更新を自分でやりたくない(OpenAIやGemini EmbeddingのAPIが手軽です)
  • 日本語の検索精度について、公式の評価値がないと採用を決められない
  • テキストだけで件数も少なく、今のAPIの精度とコストに満足している
  • 5分半を超える音声や長い動画を、分割せずに1件として扱いたい
  • SLA付きのマネージドサービスとして使いたい(Model Gardenでの提供開始を待つ必要があります)

よくある質問

EmbeddingGemma 2は日本語で使えますか?

使えます。100以上の言語に対応していて、日本語も入力できます。ただし、日本語だけの評価スコアは公式に公開されていません。社内の実際の質問と、その答えが書かれた文書を数十件ほど用意し、正しい文書が上位に来るかを確かめてから採用を決めるのが安全です。

商用のサービスに組み込んでも大丈夫ですか?

ライセンスはApache 2.0なので、商用利用・改変・再配布ができます。あわせてGemmaの禁止用途ポリシーに従う必要があります。初代のEmbeddingGemmaとは利用条件が異なる可能性があるため、初代から移る場合はそれぞれの規約を確認してください。

GPUがないPCでも動きますか?

テキストだけなら、CPUでも試せる大きさです。量子化版はテキストのみで約191MBのメモリで動くと公式に計測されています。数十万件以上を一度に埋め込むような作業では、GPUがあるほうが時間を大きく短縮できます。

OpenAIの埋め込みで作ったベクトルDBに、EmbeddingGemma 2のベクトルを追加できますか?

できません。モデルが違うとベクトルの空間がまったく違うものになるため、混ぜると検索結果が意味をなさなくなります。乗り換えるときは、保存済みの文書をすべてEmbeddingGemma 2で埋め込み直し、新しいインデックスを作ります。

埋め込みモデルとChatGPTのような生成AIは何が違いますか?

生成AIは文章を書きますが、埋め込みモデルは入力をベクトルに変えるだけで、文章は書きません。RAGでは、埋め込みモデルが関係する資料を探し、生成AIがその資料を読んで回答を書く、という分担になります。

Googleが運営するAPIとして使えますか?

2026年10月11日時点では使えません。Gemini Enterprise Agent PlatformのModel Gardenで「近日提供」と告知されています。APIで画像や音声の埋め込みを今すぐ使いたい場合は、有料のGemini Embedding 2が選択肢になります。Androidアプリ向けにはML Kitでの提供が「数週間以内」と案内されています。

まとめ

EmbeddingGemma 2は、テキスト・コード・画像・動画・音声を1つのベクトル空間に変換できる、Google DeepMindのオープンな埋め込みモデルです。740Mと小さく、量子化版ならスマホでも動き、Apache 2.0で商用にも使えます。

  • 初代からの主な変化は、マルチモーダル対応、文脈長8K、コード検索の向上
  • RAGでは検索側を担当し、回答はGemma 4などのLLMに任せる
  • テキスト中心なら256次元、画像・動画を含むなら512〜768次元が目安
  • float16は使わない。次元をそろえてL2正規化する。プロンプトを付ける
  • OpenAIとの違いは、マルチモーダル対応・オフライン動作・自前運用。日本語の精度は自社データで確かめる

まずはsentence-transformersで自社の文書を少量埋め込み、今使っている埋め込みモデルと同じ質問セットで検索結果を比べてみるのが、判断の近道です。

このツールを自社のシステムや業務にどう組み込むか、ご提案します

開発について相談する

この記事の著者

AI革命

AI革命

編集部

AI革命株式会社の編集部です。最新のAI技術動向から実践的な導入事例まで、企業のデジタル変革に役立つ情報をお届けしています。豊富な経験と専門知識を活かし、読者の皆様にとって価値のあるコンテンツを制作しています。

AI・システム開発は、開始価格を公開しています

既存システムの改修 100万円〜・PoC 300万円〜(税別)。相談内容を送っていただくと、2営業日以内に担当者からご返信します