Googleが新音声モデル「Gemini 3.8 Live」を発表
Googleは2026年9月15日、音声対話向けの新モデル「Gemini 3.8 Live」と、より複雑なマルチステップタスク向けの「Gemini 3.8 Live Extended Thinking」を発表しました。前者はスケールとコスト効率を最適化したモデル、後者は複雑な作業に対応するために構築されたモデルと位置づけられています。
両モデルとも視覚入力をほぼリアルタイムで処理でき、97言語に対応します。言語は自動検出されるほか、会話の途中で切り替えることも可能です。また、対話を中断することなくバックグラウンドでツールやAPIの呼び出しを実行できる点も特徴です。Extended Thinking版はさらに、推論(reasoning)と発話を同時に行える仕組みを備えています。
性能面では、Artificial AnalysisのSpeech to Speech Quality Indexで総合1位(スコア82.6)を獲得したとされるほか、Big Bench Audioで97.7%、エージェント的タスク完了の指標であるτ-Voiceで68.6%を記録したと報告されています。
生成される音声には、悪用防止のためSynthIDによる電子透かしが付与されます。両モデルは開発者・エンタープライズ・一般ユーザー向けに順次提供される予定です。