Googleは、対話型の音声AIモデル「Gemini 3.8 Live」と、より複雑なタスク向けの「Gemini 3.8 Live Extended Thinking」を発表しました。開発者向けのGemini API、Google AI Studio、企業向けプライベートプレビューなどで順次提供され、カスタマーエクスペリエンス領域にも広がる予定です。
今回のポイントは、単に自然に話せる音声AIではなく、会話を続けながら視覚入力やツール実行を扱える点にあります。コールセンター、店舗接客、現場支援のように「話しながら確認する」業務で、AIの役割がFAQ応答から実作業の補助へ移りつつあります。
リアルタイム会話とツール実行を両立する
Googleによると、Gemini 3.8 Liveは視覚的な入力をほぼリアルタイムで処理し、97言語を自動検知して切り替えられます。さらに、バックグラウンドでツールやAPIを実行している間も、ユーザーへの応答を止めず会話を継続できる設計です。
Extended Thinkingは、複数ステップの判断が必要な場面を想定したモデルです。AIが推論と発話を同時に行うことで、顧客の説明を聞きながら在庫確認、本人確認、手続き案内などを進めるような体験に近づきます。
項目 | 発表内容 |
|---|---|
対象モデル | Gemini 3.8 Live / Gemini 3.8 Live Extended Thinking |
特徴 | リアルタイム音声、視覚入力、ツール実行、多言語切替 |
評価 | Speech to Speech Quality Indexで82.6、Big Bench Audioで97.7%と説明 |
安全対策 | 生成音声にSynthIDウォーターマークを埋め込み |
日本企業にとっての実務上の意味
日本の企業では、コールセンターの人手不足、多言語対応、応対品質のばらつきが課題になっています。音声AIが会話中にCRM、予約、請求、FAQ、社内ナレッジへアクセスできれば、一次対応の自動化だけでなく、オペレーター支援にも使いやすくなります。
一方で、音声AIは誤応答が直接顧客体験に響きます。導入時は応対可能範囲、本人確認、録音・同意、エスカレーション条件、ログ監査を明確にする必要があります。特に金融、医療、公共サービスでは、AIが判断してよい範囲と人間へ戻す基準を先に決めることが重要です。
競争軸は「自然さ」から「業務完了率」へ
これまで音声AIは、遅延の少なさや話し方の自然さが注目されてきました。今後は、会話を通じてどれだけ安全に業務を完了できるかが評価軸になります。音声AIは、顧客接点のインターフェースを変えるだけでなく、企業の業務設計そのものを見直すきっかけになりそうです。
参考:Google公式ブログ / AI Watch

.png&w=384&q=75)