
グーグルは、リアルタイムの対話に特化した新世代の音声モデル「Gemini」を発表しました。このモデルには二つのバージョンがあり、一方はユーザーとの日常的な会話を想定して設計されており、もう一方は人工知能による複数のステップを必要とするより複雑な問い合わせに対応します。
Gemini 3.8 Liveは迅速な音声対話に重点を置いており、Gemini 3.8 Live Extended Thinkingは、より多くの処理時間を要する多段階のタスク向けに設計されています。いずれの場合でも、ユーザーはモデルの処理が終わるのを黙って待つ必要はありません。GeminiはバックグラウンドでAPIやその他のツールにアクセスできます。
基本となるGemini 3.8 Liveは、ほぼリアルタイムでビデオストリームを解析し、会話中に97の対応言語へ自動的に切り替えることも可能です。
Extended Thinkingはさらに進んでおり、要求されたタスクの複雑な部分を並行して実行しながら、進行状況をユーザーに随時伝えます(例えば、情報の確認中や外部サービスへのアクセス中であることを通知します)。グーグルのデモでは、このモデルが紙に描かれたスケッチをReactコンポーネントに変換したり、レストランの予約を行ったり、問題解決を支援したりしました。
グーグルはGemini 3.8 Live Extended Thinkingの音声モデルに関するベンチマークテストの結果も公表しました。このニューラルネットワークは、Artificial Analysisの音声品質指標(Speech-to-Speech Quality Index)で82.6点、τ-Voiceテストで68.6%、τ-Voice-bankingテストで35.1%、Big Bench Audioテストで97.7%のスコアを記録しています。
Gemini 3.8 Liveは現在、Search Liveサービスの一環として世界中で提供されています。Extended Thinkingモデルは、Docs、Gmail、Keepを利用するWorkspaceのサブスクリプションユーザーに向けて段階的に展開されており、開発者はGemini Live APIを通じて両モデルを利用できます。なお、グーグルはすべてのニューラルネットワーク生成音声にSynthIDの透かしを付加しています。