OpenAIは、新しい音声モデルGPT-Liveを発表した。GPT-Liveはフルデュプレックス構成を採用し、相手の発話を聞きながら同時に応答を生成できる。会話中に短く相づちを打つ、すぐ返す、黙って待つ、必要なら背後のモデルに深い作業を任せるといった自然な対話を目指す。
音声AIの課題は「賢さ」だけではなかった
従来の音声AIは、音声認識、LLM、音声合成を順番につなぐカスケード方式や、発話の終わりを待つターン制が中心だった。これらは会話の遅さ、割り込みの不自然さ、短い沈黙を発話終了と誤認する問題を抱えていた。
GPT-Liveは連続的に入力を処理しながら、話す、聞く、待つ、割り込む、ツールを呼ぶといった判断を何度も行う。さらに、検索や複雑な推論が必要な場合はGPT-5.5など背後のモデルへ委任し、会話の流れを保つ。
提供形態 | GPT-Live-1とGPT-Live-1 miniをChatGPTへ順次展開 |
|---|---|
API | 今後提供予定、企業・開発者は通知登録可能 |
技術的特徴 | フルデュプレックス、連続対話、深い作業の委任 |
想定用途 | 会議支援、教育、接客、通訳、長時間作業支援 |
業務用途では「会話の間」が価値になる
会議中の議事メモ、営業ロールプレイ、問い合わせ対応、研修、現場作業支援では、AIの回答精度だけでなく会話のテンポが重要だ。人間が考えている間に黙って待てる、必要なときだけ確認できるAIは、チャット型AIより自然に業務へ入り込める。
一方で、音声は文字より誤解が起きやすい。会議や接客で使う場合は、録音同意、要約の確認、顧客への説明、発言ログの扱いを明確にしなければならない。
注意点
自然な声で話すAIほど、利用者は過信しやすい。重要な判断や契約、医療・法務・金融の助言では、音声AIの返答をそのまま実行せず、記録された根拠と人間の確認を挟むべきだ。
参考:OpenAI発表

.png&w=384&q=75)

