OpenAI は、ChatGPT と同じ GPT-Live-1 音声モデルを開発者に公開します。 API の料金は 1 分あたり 0.05 米ドルです。

📅 2026-09-11

要約:

OpenAI は最近、ChatGPT 音声機能に現在使用されている GPT-Live-1 を開発者に正式に公開すると発表しました。開発者は、API を介してこの音声モデルを独自のアプリケーションやビジネス プロセスに統合し、リアルタイムでユーザーの声を聞き、同時に応答できる全二重音声アシスタントを構築できるようになりました。このモデルの音声フロントエンド価格は 1 分あたり 0.05 米ドルで、複雑な推論のバックグラウンドで使用されるモデルは、対応するモデル価格に応じて別途請求する必要があります。

1789093911_chatgpt_voice.webp

GPT-Live-1 は、OpenAI が今年発表した新世代のリアルタイム音声モデルです。最大の特徴は全二重アーキテクチャです。従来の音声 AI は通常、音声認識、言語モデル推論、音声合成の 3 つのステップを順番に完了する必要があります。ユーザーが話し終えた後にのみ、システムは処理を開始して回答を生成できます。一方、GPT-Live-1 は、ユーザーの会話を聞きながら音声出力を生成できるため、中断、一時停止、エコー、および素早い往復会話をより自然に処理できます。

これは、ユーザーが AI が完全に話し終わるのを待ってから話し続ける必要がないことを意味します。ユーザーが気が変わったり、情報を追加したり、直接中断したりした場合、GPT-Live-1 は進行中の会話に応じてその動作を適時に調整できます。モデルは、いつ話し続けるべきか、いつ一時停止すべきか、いつ聞き続けるべきか、いつツールを呼び出すべきかを伝えることもできます。

OpenAI は、このアーキテクチャにより音声対話の遅延が大幅に削減され、従来の「音声認識 + 大規模言語モデル + 音声合成」パイプラインで実際の会話で発生しがちな接続の問題を解決できると述べています。 GPT-Live-1 自体が入力オーディオと出力オーディオの両方を処理するため、開発者は複数の独立したモデル間の複雑な切り替えを調整する必要がなくなりました。

OpenAI が公開したテストでは、全二重ベンチ テストにおける GPT-Live-1 のパフォーマンスは、特にターンテイキングの遅延とインタラクティブな動作の点で、GPT-Realtime-2.1 のパフォーマンスよりも 30 パーセント高かったです。中程度の推論強度で GPT-6 Astra と組み合わせた場合、GPT-Live-1 は Tau3 テストでも 1 位を獲得しました。 Tau3 は主に、音声エージェントがエンドツーエンドのタスクを完了する能力を評価するために使用されます。

GPT-Live-1 のもう 1 つの重要な特徴は、GPT-Live-1 がすべての複雑な推論作業を担当しないことです。 OpenAI は、リアルタイムのリスニング、スピーキング、インタラクションを担当する音声モデルを、深い推論を担当するバックグラウンド モデルから分離します。ユーザーが検索、複雑な分析、または長いタスクを必要とする質問をした場合、GPT-Live-1 はユーザーとの自然な音声コミュニケーションを維持しながら、これらのタスクをバックグラウンド モデルに引き渡すことができます。

そのため、開発者は特定のビジネス ニーズに基づいてバックエンド モデルを自由に選択できます。たとえば、予約や注文の更新などの多数の単純なタスクには、より高速で低コストのモデルを使用できます。複雑な顧客の問題については、より強力な推論モデルによって処理できます。このアーキテクチャにより、開発者は応答性、推論能力、使用コストの間のバランスを見つけることができます。

OpenAI は、この分離された設計により、GPT-Live-1 は、ユーザーが長時間無言で待機するのではなく、バックグラウンドでタスクを実行しながらユーザーとの通信を継続できると述べています。モデルは、バックグラウンドでより複雑な作業を完了しながら自然な会話を継続し、タスクが完了すると結果を現在の会話に戻すことができます。

実用的なアプリケーションはすでに登場し始めています。 OpenAI によって実証された初期の例には、Yelp Host や Hatch などの音声サービス、言語学習プラットフォーム Speak などがあります。初期の評価では、以前のターンベース音声システムと比較して、GPT-Live-1 は言語学習者により多くの考える時間を与え、ユーザーに対するシステムのプロアクティブな中断の回数を 80% 近く削減できることが判明しました。

企業の場合、この機能は、顧客サービス、電話による顧客サービス、予約、および継続的な音声対話が必要なその他のシナリオに特に適しています。 GPT-Live-1 は電話シナリオをネイティブにサポートしているため、開発者はこれを使用して、レストランの予約、カスタマー サポート、リアルタイム通信を必要とするその他のビジネスなどの電話に応答して処理できる全二重音声エージェントを構築できます。

GPT-Live-1 は、ネイティブ自動音声認識の書き起こしテキストとモデル応答テキストも提供し、キーワード バイアス機能をサポートしながら、英数字の組み合わせの理解を強化します。従来の意味でのターンベースのモデルではありませんが、ネイティブでターン検出をサポートしています。したがって、開発者がユーザーがいつ話し終え、いつシステムが応答を開始するかを明確に制御する必要がある場合でも、明確な対話のターンを中心にアプリケーションを設計できます。

GPT-Live-1 は、ノイズの多い背景環境のシーンにも最適化されています。このモデルは、ユーザーの音声、背景雑音、沈黙をより適切に区別できます。周囲の音によって会話が頻繁に中断されることも、ユーザーがちょっと考えているときに常に通知することもありません。この機能は、実際の環境における電話通話、カスタマー サービス、モバイル音声アシスタントにとって特に重要です。

OpenAI は、GPT-Live-1 で利用できるサウンドの選択も拡張しました。以前に利用できたリアルタイム音声の数は比較的限られていましたが、新しいバージョンではより多様な音声が提供され、より豊富な範囲のアクセント、方言、言語をカバーしています。 OpenAIは、今後数か月以内に利用可能な音声と言語を追加し続けると述べています。

モデルのデプロイに関して、開発者はすべてのタスクを GPT-Live-1 に引き渡す必要はありません。 OpenAI は、リアルタイムの音声対話を担当するフロントエンドとしてこれを使用し、バックグラウンド モデルとエージェント フレームワークを通じてより複雑な作業を引き受けたいと考えています。このアプローチにより、開発者はさまざまなタスクの実際のニーズに応じてさまざまなモデルを組み合わせることができます。

たとえば、開発者は GPT-Live-1 にユーザーの音声リクエストの受信、自然な会話の維持、割り込みの処理を担当させ、複雑な推論を必要とする質問をバックグラウンド モデルに引き渡すことができます。バックグラウンド モデルが作業を完了すると、GPT-Live-1 は結果を自然音声応答に変換します。このメカニズムは、外部ツールを呼び出す必要があるアプリケーションにも適用されます。

OpenAI は、GPT-Live-1 と Codex などのツールを組み合わせる方法も実証しました。開発者は、音声モデルにユーザーが提案したタスクを受信させ、関連するコンテキストを Codex などのバックグラウンド ツールに転送して処理し、処理結果を GPT-Live-1 に返すことができます。GPT-Live-1 は音声を介してユーザーと通信し続けます。

価格に関しては、GPT-Live-1 は現在、OpenAI API を通じて正式に入手可能であり、音声フロントエンドの料金は 1 分あたり 0.05 ドルです。これはリアルタイム音声層のコストのみであることに注意することが重要です。開発者が GPT-Live-1 にバックグラウンド推論モデルを装備する場合、バックグラウンド モデルを呼び出すコストは、対応するモデルの価格設定に基づいて個別に計算する必要があります。

これは、多数の音声通話を必要とするビジネス アプリケーションの場合、実際のコストは 1 分あたり 0.05 ドルではなく、音声接続時間とバックグラウンド モデルの推論消費量で構成されることを意味します。ただし、開発者はさまざまなバックエンド モデルを選択することで、タスクの複雑さに応じて全体のコストを制御できます。

GPT-Live-1 のオープンは、OpenAI が ChatGPT 音声モードの背後にあるコア テクノロジーを消費者向け製品から開発者エコシステムまでさらに拡張していることも意味します。以前は、GPT-Live-1 は主に ChatGPT の音声対話機能として存在していました。開発者は同様のテクノロジーを直接使用して、独自の音声アプリケーションやエージェントを構築できるようになりました。

技術的な観点から、OpenAI は、GPT-Live-1 が「AI の会話を可能にする」ことを解決するだけでなく、AI が継続的でリアルタイムの中断可能な自然な会話に真に参加できるようにすることを望んでいます。 OpenAI は、聞く、話す、リアルタイムの対話、深い推論を分割することで、音声遅延の短縮、より自然な会話エクスペリエンス、および強力なバックグラウンド タスク処理機能を同時に実現しようとします。

音声エージェントが単純な音声質疑応答から、電話によるカスタマー サービス、予約、言語教育、業務処理、タスクを完了するためにツールを自律的に呼び出す機能などの複雑なタスクに徐々に移行するにつれて、リアルタイム音声モデルの重要性も高まっています。 GPT-Live-1 のオープン API は、開発者が ChatGPT で使用される現世代のリアルタイム音声テクノロジーを自分の製品に直接組み込むことができることを意味します。また、1 分あたり 0.05 米ドルの音声レイヤーの価格により、この機能が正式に商用アプリケーションの段階に入ることが可能になります。

関連タグ

関連記事

コメント

0/500
Captcha (click to refresh)
コメントなし