新規会員登録再開のお知らせ

新規会員登録を9月14日9:30より再開いたしました。ログアウト状態になっている方はお手数ですが再度ログインをお願いいたします。

  • 2026/09/17 10:15 掲載

グーグルが音声AI「Gemini 3.8 Live」発表、“考えながら話す”97言語対応の新モデル

会員(無料)になると、いいね!でマイページに保存できます。
グーグルが音声AIの新モデル「Gemini 3.8 Live」と上位版「Extended Thinking」を発表した。推論しながら同時に話せる点が特徴で、音声品質の指標では首位に立った。97言語を自動で聞き分け、会話を止めずに裏側でAPIを呼び出せる。文字起こし専用モデルも併せて公開した。
グーグルが音声AI「Gemini 3.8 Live」発表、“考えながら話す”97言語対応の新モデルの画像
(画像:Google)
 グーグルが音声AIの新モデル「Gemini 3.8 Live」と、上位版の「Gemini 3.8 Live Extended Thinking」を発表した。いずれもGemini APIとGoogle AI Studioから同日利用できる。

 最大の特徴は、考える処理と話す処理を同時に走らせる点だという。従来の音声AIは、発話を受けてから推論を終えるまでの沈黙が生まれやすかった。上位版は推論の途中経過を言葉で伝えながら応答を組み立てるため、込み入った問い合わせでも会話が途切れにくいとする。

 性能指標では、調査会社Artificial Analysisの「Speech to Speech Quality Index」で上位版が82.6を記録し、首位に立った。音声で与えた課題をやり遂げられるかを測るτ-Voiceでは68.6%、銀行業務を模したτ-Voice-bankingでは35.1%。音声の推論力を見るBig Bench Audioは97.7%だった。

 実務寄りの機能も加わった。会話を止めずに裏側でツールやAPIを呼び出す非同期のファンクションコール、カメラ映像などをほぼリアルタイムで解釈する視覚的な文脈理解、注文番号や型番といった英数字の聞き取り精度の向上である。97言語に対応し、会話の途中で言語が切り替わっても自動で判別するという。

 また、Googleは8月に公開した文字起こし専用モデル「Gemini 3.5 Transcribe」についても、今回の発表で機能や性能を改めて紹介した。85以上の言語に対応し、単語誤り率はストリーミングで4.0%、非ストリーミングで2.6%。社内用語や商品名を最大1000語まで登録し、認識を寄せる機能も持つ。

 開発者向けのAPIに加え、法人向けのGemini Enterpriseでは限定プレビューとして提供する。一般利用者向けにもSearch LiveやGemini Liveアプリ、Google WorkspaceのドキュメントやGmail、Keepへ順次組み込まれる。LiveKitやPipecat、Vercelなど音声基盤を手がける企業との連携も明らかにした。生成した音声にはすべて電子透かし「SynthID」を埋め込むという。

Googleで見つけやすく

評価する

いいね!でぜひ著者を応援してください

  • 0

会員(無料)になると、いいね!でマイページに保存できます。

共有する

  • 0

  • 0

  • 0

  • 0

  • 0

関連タグ タグをフォローすると最新情報が表示されます
あなたの投稿

    PR

    PR

    PR

処理に失敗しました

投稿したコメントを
削除しますか?

あなたの投稿コメント編集

通報

このコメントについて、
問題の詳細をお知らせください。

ビジネス+ITルール違反についてはこちらをご覧ください。

通報

報告が完了しました

コメントを投稿することにより自身の基本情報
本メディアサイトに公開されます

基本情報公開時のサンプル画像
報告が完了しました

」さんのブロックを解除しますか?

ブロックを解除するとお互いにフォローすることができるようになります。

ブロック

さんはあなたをフォローしたりあなたのコメントにいいねできなくなります。また、さんからの通知は表示されなくなります。

さんをブロックしますか?

ブロック

ブロックが完了しました

ブロック解除

ブロック解除が完了しました

機能制限のお知らせ

現在、コメントの違反報告があったため一部機能が利用できなくなっています。

そのため、この機能はご利用いただけません。
詳しくはこちらにお問い合わせください。

ユーザーをフォローすることにより自身の基本情報
お相手に公開されます

基本情報公開時のサンプル画像