OpenAI、割り込みを80%削減する全二重音声モデル「GPT-Live-1」を発表
OpenAIは、自然な全二重会話を実現する音声モデル「GPT-Live-1」を発表しました。音声認識・言語モデル・音声合成を個別に連結する従来方式ではなく、単一の統合アーキテクチャで「聞く」と「話す」を同時に行います。
詳細
- 割り込みへの対応: ターンが完全に終わるのを待つのではなく、音声を同時並行的に処理することで、ターン制の音声システムと比較して割り込みを約80%削減
- 会話の自然さ: 背景雑音・沈黙・傍らの会話などがあっても、対話の流れを崩さずに対応できる
- ツールへの委任: 複雑な推論タスクはGPT-6 Astraなどのバックエンドモデルに委任しつつ、ライブ会話自体は途切れることなく継続
- カスタマイズ性: システムプロンプトを通じてトーン・話すペース・会話スタイルを調整可能。対象顧客はカスタムボイスをリクエストできる
- ベンチマーク: Full Duplex BenchのスコアはGPT-Realtime-2.1比で30ポイント向上。GPT-6 Astraと組み合わせた音声エージェントの知能を測るTau3では1位を記録
- 電話対応: 電話ベースのアプリケーション向けに全二重音声エージェントに対応。レストラン予約、カスタマーサポート、語学指導、口座情報検索やアカウント操作を伴う銀行業務などでの活用例を提示
- 料金と提供状況: 音声フロントエンド部分の料金は1分あたり0.05ドルで、APIから即座に利用可能
その後
「GPT-Live-1」は、単体の音声ボットとしてではなく、GPT-6 Astraのような推論モデルと組み合わせて使うことを明確に想定した音声フロントエンドです。OpenAIは、迅速な会話処理とバックエンドでの高度な推論という役割分担を軸に、自社の音声スタックを構築しようとしていることがうかがえます。