OpenAIは月曜日のDev Dayに複数のAPIアップデートをリリースし、最新の言語モデルGPT-5 Pro、新しいビデオ生成モデルSora 2、およびより合理化され安価な音声モデルを正式に発表した。

この一連の取り組みは、AI エージェント開発者向けの「AgentKit」ツールや、ChatGPT 内でアプリケーションを作成できる新機能の開始など、開発者を OpenAI エコシステムにさらに誘致することを目的としています。
OpenAIの最高経営責任者(CEO)サム・アルトマン氏は、GPT-5 Proの登場により、金融、法律、医学などの分野で「高い精度と深い推論」を必要とする開発者が集まるだろうと述べた。アルトマン氏はまた、音声インタラクションが急速に人々がAIとインタラクションする主要な方法になりつつあるため、今回OpenAIがAPI向けに「gpt-realtime mini」音声モデルの新バージョンを発表したことも強調した。この新しいモデルは、小型で安価であるだけでなく (以前のハイエンド音声モデルの価格のわずか 30%)、「同じ音声品質と表現力」を維持し、低遅延のオーディオ ストリーミング インタラクションをサポートします。
さらに、OpenAI 開発者エコシステムのクリエイターは、API プレビュー バージョンを通じて Sora 2 にアクセスできるようになりました。 OpenAIは先週、新世代のオーディオおよびビデオジェネレーターSora 2と、それをサポートする「TikTok風の」ショートビデオアプリケーションSoraをリリースした。ユーザーは、プロンプトの言葉に基づいて自分自身や友人の短いビデオを生成し、アルゴリズムが推奨する動的ストリームを通じて共有できます。
Altman 氏は、「開発者は、Sora 2 と同じ高品質ビデオ生成モデルをアプリケーションで使用できるようになりました。」と述べています。前世代と比較して、Sora 2 は、よりリアルで物理的に一貫したシーン パフォーマンス、サウンドと画像の同期、および大幅に改善されたクリエイティブ コントロールを備えており、細心のカメラ スケジュールから様式化されたビジュアルまでの新機能をカバーしています。例えば、携帯電話の視野を「映画レベルの広角」まで拡大し、映像、環境音、環境音、同期効果などとの整合性が高いダイナミックな視聴覚体験を体験できます。
Sora 2は、広告のクリエイティブアイデアの初稿に使用できるコンセプト開発ツールとして位置付けられており、玩具デザイナーがスケッチを製品コンセプトに変えるなどの用途にも使用できます。アルトマン氏は例として、これはOpenAIがバービーメーカーのマテル社と提携しておもちゃのデザインやコンテンツ作成の舞台裏のプロセスに生成AIを導入する典型的なシナリオであると指摘した。