- 2026/09/25 12:22 掲載
グーグル「Gemini 3.8 Live」にAIアバター、97言語で口の動き同期 企業向け一般提供
Live Avatarは、音声の対話と映像の生成を組み合わせたもの。画面上のアバターが話す内容に合わせて口の動きを同期させ、自然な表情や会話の受け答えを見せる。対応言語は97にのぼり、会話の途中で言語が切り替わっても口の動きや表情をそれに合わせて変えるとしている。
機能面では、音声から音声を直接生成する方式を採り、ユーザーが話を遮っても文脈を失わずに対話を続けられるとした。また、会話を続けながら裏側でツールやAPIを呼び出す非同期のツール実行や、カメラ映像や画面共有を音声と同時に理解する機能も備える。
安全面では、生成したすべての音声と映像に、人が知覚できない電子透かし「SynthID」を埋め込む。参照画像から独自のアバターを作る機能は、許可リストと確認手続きを経た企業に限って提供する。利用できるエンドポイントは米国とEUで、処理能力を事前に確保するプロビジョンドスループットなど企業向けの運用機能にも対応する。
グーグルは前週に音声対話モデル「Gemini 3.8 Live」と「Gemini 3.8 Live Extended Thinking」を発表したばかり。顧客対応の窓口にAIを置く企業にとっては、音声だけでなく映像で応対する選択肢が加わることになる。
AI・生成AIのおすすめコンテンツ
AI・生成AIの関連コンテンツ
PR
PR
PR