OpenAIは、新世代の音声モデル「GPT-Live」を発表した。音声を聞きながら話せる全二重アーキテクチャを採用し、ChatGPT Voiceをより自然で、長い作業にも対応しやすい体験へ更新する。
GPT-Liveの特徴
GPT-Liveは、ユーザーの発話を聞きながら相づちを打ち、必要な場面では静かに待つなど、人間同士の会話に近いテンポを目指す。従来の音声AIが「音声認識→LLM→音声合成」を順番に処理していたのに対し、会話の流れを保ちやすい設計になっている。
複雑な質問、Web検索、深い推論が必要な場合は、裏側で最新のフロンティアモデルへ処理を委任する。OpenAIによると、ローンチ時点ではGPT-5.5が背景モデルとして使われ、今後の新モデルに応じて更新される。
提供モデル | GPT-Live-1 / GPT-Live-1 mini |
|---|---|
展開 | ChatGPTユーザー向けに順次提供 |
API | 今後提供予定 |
背景モデル | ローンチ時点でGPT-5.5 |
ビジネスで何が変わるか
音声AIが自然に割り込み、待ち、長い作業を維持できるようになると、会議支援、現場作業、コールセンター、教育、移動中の業務支援で使い方が広がる。特にキーボードを使いにくい場面では、音声がAIエージェントの入口になる。
ランキングで読まれている共有エージェントや業務AIの流れを考えると、次の焦点は「テキストで指示するAI」から「話しながら仕事を進めるAI」へ移る可能性がある。音声UIは、AIを使う人と使わない人の差を縮める実用的なインターフェースになり得る。
注意点
自然な相づちは便利だが、AIが理解したように聞こえることと、正しく判断していることは別だ。医療、金融、法務、採用などの高リスク領域では、記録、確認、最終承認を人間が担う設計が必要になる。
参考:OpenAI公式発表

.png&w=384&q=75)


