OpenAIがChatGPTのリアルタイム音声に対応するAPIを公開:1分5セント
OpenAIはGPT-Live-1 APIを公開しました。これはChatGPTが現在使っているリアルタイム音声モデルです。聞いて話すことが同時にでき、音声を直接理解し、通常の会話を処理できるほか、割り込み、間(沈黙)、背景ノイズにも対応します。複雑な推論やツール呼び出しが必要な場合、GPT-Live-1はタスクをGPT-6 Astra、Luna、またはサードパーティのモデルに任せ、結果を受け取った後にユーザーとの会話を続行できます。開発者はバックエンドで接続するモデルを自分で決められます。従来の「音声→文字→大規模言語モデル→文字→音声」と比べて、GPT-Live-1は中間のモデル受け渡しを減らし、リアルタイム対話をより自然につなげます。GPT-Live-1の料金は1分あたり0.05ドルで、バックエンドのモデル利用料は別途です。