- 2026/09/24 08:35 掲載
グーグルが音声生成AI「Gemini 3.8 TTS」を発表、2,000種類の声を自然言語で設計
最も大きく変わったのは声の選択肢。従来の30種類から2,000種類以上に広げたうえ、Flash TTSでは役柄やなまり、声質を文章で指示するだけで新しい声を作れるようにした。対応するのは100を超える言語と方言で、メキシコのスペイン語やケベックのフランス語、スコットランドの英語といった地域差も再現できるという。
声を複製する機能も加わった。本人の声か権利を持つ声であれば、30秒のサンプル音声から一貫した声質を再現できる。ただし悪用を防ぐため、声の持ち主による口頭の同意録音が参照音声と一致しなければ作成できない仕組み。生成した音声にはすべて電子透かし技術「SynthID」とC2PAの来歴情報が埋め込まれる。
性能面では、Hume AIの音声デザインのベンチマークで71.4点を獲得して首位に立った。なまりの再現でも60.8点で首位。品質の総合指標ではFlash TTSが1位、Flash-Lite TTSが2位を占めた。人間が聞き比べるVoice Arenaの評価では、日本語やブラジルのポルトガル語、ベトナム語、ヒンディー語などで上位に入ったとしている。
提供先は、開発者向けがGemini APIとGoogle AI Studio。一般の利用者向けにはFlash TTSがGemini Notebookで、Flash-Lite TTSが動画編集のGoogle Vidsで使える。企業向けのGemini Enterpriseは近く対応する予定。LiveKitやVercelといった開発基盤が相次いで対応するほか、FigmaやHeyGenなどが自社サービスへの組み込みを進めるという。料金は今回の発表では示されていない。
グーグルはGemini Audioの系列で、70カ国語超に対応するライブ翻訳や文字起こしのモデルを相次いで投入してきた。今回はその音声出力側を強化した格好だ。
AI・生成AIのおすすめコンテンツ
PR
PR
PR