- 会員限定
- 2026/10/07 03:28 掲載
グーグル、音声や動画も扱う埋め込みAI「EmbeddingGemma 2」公開 端末内でも動作
埋め込みモデルは、文章や画像などを意味の近さに応じた数値の並び(ベクトル)に変換し、検索やRAG(検索拡張生成)に使う技術だ。EmbeddingGemma 2は、グーグルの軽量マルチモーダルAI、Gemma 4と同じアーキテクチャーを土台にした。
構成は必要に応じて選べる。モデルカードによると、テキストだけなら2億7000万パラメータで動き、画像用に1億7000万、音声用に3億パラメータのエンコーダーを追加する仕組みだ。
出力は768次元のベクトルで、Matryoshka Representation Learning(MRL)により512、256、128次元へ縮められる。128次元にすれば、ローカルのベクトルデータベースの保存容量を最大で6分の1に減らせるという。
量子化した場合、スマートフォン「Pixel 11 Pro」で必要なメモリーは、テキストのみの構成で約191MB、マルチモーダル構成の全体で約567MBとしている。入力の長さは8192トークンで、初代の4倍に広がった。音声なら約5.5分、画像なら29枚、動画なら58フレームまで入力できる。
性能面では、コード検索の指標「MTEB Code」のスコアが、初代の68.76から78.68へ9.92ポイント上がったという。グーグルは、音声の指標「MAEB」などで、10億パラメータ未満のマルチモーダル埋め込みモデルとして最高水準の性能を達成したと説明している。
推論には、transformers、sentence-transformers、MLX、vLLM、llama.cpp、SGLang、Ollama、LM Studioが使える。ベクトルの保存にはQdrantを使えるほか、ファインチューニングについてはUnslothが手引きを示している。
初代のEmbeddingGemmaは2025年9月に公開され、ダウンロード数は2000万を超えたという。
では、なぜグーグルは、クラウドで使うマルチモーダル埋め込みモデルをすでに持ちながら、端末内で動く小型のオープンモデルを別に出したのか。背景には、コヒアが9月末に打ち出した競合モデルと、モデルカードに載る数字の読み方がある。
・クラウド版「Gemini Embedding 2」との切り分け方
・コヒア「Embed 5」が示した競合ベンチマーク
・数字を横並びにできない理由と、実機の速度
今すぐビジネス+IT会員に
ご登録ください。
すべて無料!今日から使える、
仕事に役立つ情報満載!
-
ここでしか見られない
2万本超のオリジナル記事・動画・資料が見放題!
-
完全無料
登録料・月額料なし、完全無料で使い放題!
-
トレンドを聞いて学ぶ
年間1000本超の厳選セミナーに参加し放題!
-
興味関心のみ厳選
トピック(タグ)をフォローして自動収集!
AI・生成AIのおすすめコンテンツ
AI・生成AIの関連コンテンツ
PR
PR
PR