OpenAIは、新世代の音声モデル「GPT-Live」を発表した。全二重アーキテクチャにより、AIが聞きながら話し、必要に応じて背後のフロンティアモデルへ検索や推論を委ねられる点が特徴だ。
音声AIは「ターン制」から連続対話へ
従来の音声AIは、音声認識、言語モデル、音声合成を順に呼び出す方式や、ユーザーの発話終了を待って応答するターン制が中心だった。GPT-Liveは入力処理と出力生成を連続的に行い、話す、待つ、割り込む、ツールを呼ぶといった判断を細かく行う。
OpenAIはGPT-Live-1とGPT-Live-1 miniをChatGPTユーザー向けに展開し、API提供も予定している。発表では、ChatGPT VoiceとAPIで生成される対応音声にSynthID透かしを含め、検証ツールやAPIで来歴確認を進めることも示された。
提供 | GPT-Live-1 / GPT-Live-1 miniをChatGPTに展開 |
|---|---|
特徴 | 全二重、連続対話、背後モデルへの委任 |
安全対応 | 対応音声にSynthID透かし、検証APIを提供 |
企業利用で何が変わるか
コールセンター、教育、商談支援、現場作業のハンズフリー支援では、自然な割り込みや確認が生産性に直結する。単なる音声チャットではなく、会話を維持しながら検索、要約、タスク実行を背後で進める設計は、音声エージェントの実装範囲を広げる。
注意点
自然さが増すほど、録音データの扱い、本人確認、誤認識時の責任、生成音声の真正性管理が重要になる。業務導入では、利用目的、保存期間、ログ監査、オペレーターへの引き継ぎ条件を明確にしたい。
参考:OpenAI公式発表

.png&w=384&q=75)

