要約:
OpenAI は、現地時間 9 月 29 日に開催された DevDay イベントで GPT-6.1 Sol を正式にリリースしました。 GPT-6 Solの発売からわずか1週間が経ち、再びバージョンアップして新モデルが登場しました。 OpenAIは、エージェントプログラミング、コンピュータ操作、専門的な作業などのタスクにおけるGPT-6.1 Solの機能は主力のGPT-6 Astraに近いが、標準入出力トークンの価格は後者のわずか5分の1であると述べた。

今回、OpenAI が予想どおり GPT-6.1 Astra を起動しなかったことは注目に値します。 Wall Street Journalは以前、OpenAIが内部テスト中にセキュリティ上の問題が発見されたため、GPT-6.1 Astraのリリース計画をキャンセルしたと報じた。 OpenAI は、このモデルが欺瞞の傾向が高く、タスクの実行中にユーザーの許可なしに勝手に前進する可能性が高いことを研究者が発見したため、最終的にこのバージョンを当初の計画通りに展開しないことを決定しました。
前世代の GPT-6 Sol と比較して、GPT-6.1 Sol では、プログラミングとコードのデバッグ、ドキュメントの理解、複数ステップのワークフローの実行など、複雑なタスクにおいて多くの改善が加えられています。 OpenAIによると、これらの機能の一部では、新モデルの性能はすでにGPT-6 Astraの性能に近づいているという。
事実の正確さの点では、GPT-6.1 Sol も向上しています。 OpenAI が発表した内部テスト データによると、推論強度が低い場合、GPT-6 Sol の事実誤認を含む回答の割合は 11.4% であるのに対し、GPT-6.1 Sol は 7.7% に低下しており、その低下は明らかです。 OpenAI はまた、GPT-6.1 Sol と GPT-6 Astra のエラー率の差は、すべての推論設定で 1.9% 以内であると述べました。
OpenAI は、単純に回答精度を向上させるだけでなく、GPT-6.1 Sol によってユーザーの意図とセキュリティ制限に従う点で改善が加えられたことも強調しました。同社の内部評価によると、新しいモデルは、困難なタスクに直面したときに壊れた検索ツールを無視する可能性が低く、ユーザーが明示的に指定した制約を遵守する能力が高く、完了する不正な操作の数が減少します。
セキュリティ テストで、OpenAI はまた、自動セキュリティ レビューアをバイパスしようとする GPT-6.1 Sol の動作は観察されなかったと述べました。これは GPT-6 Astra および以前の GPT-6 Sol のパフォーマンスと一致しています。
このリリースには、GPT-6 シリーズの異なるモデル間の位置を再調整するという OpenAI の試みも反映されています。 GPT-6 Astra は以前、同社の最も有能なフラッグシップ モデルとして位置づけられていましたが、Sol はより効率を重視した実用的な役割を担っています。 GPT-6.1 Sol の目標は、Astra を完全に置き換えることではなく、運用コストを大幅に削減しながら、プログラミング、コンピューター操作、専門的な作業を行う必要があるより多くのユーザーに、フラッグシップ モデルに近い機能を提供することです。
価格は、このアップグレードにおける最も重要な変更の 1 つです。 OpenAIは、GPT-6.1 Solの標準入力および出力トークン価格はGPT-6 Astraのわずか5分の1であると述べた。これは、大量のコード、ファイル、または長時間実行されるエージェント タスクを処理する必要がある開発者や企業ユーザーにとって、モデルの機能が主力バージョンに近い場合、ランニング コストを大幅に削減できることを意味します。
GPT-6.1 Sol は、9 月 29 日から ChatGPT Work および Codex の Plus、Pro、Business、Enterprise、Edu ユーザーに正式に公開され、関連する開発者およびエンタープライズ ユーザーへの提供も開始されます。ただし、このモデルは現在通常の ChatGPT では利用できず、OpenAI は一般の ChatGPT ユーザーに公開する具体的な時期をまだ発表していません。
GPT-6.1 Sol のリリースは、GPT-6 Sol のリリースからわずか 1 週間離れています。これは、OpenAI が現在 GPT-6 シリーズのイテレーション速度を加速していることも示しています。これまでの GPT-6 Sol および Luna リリースでは、OpenAI は推論効率、キャッシュ テクノロジ、モデル アーキテクチャの最適化による使用コストの削減を重視してきましたが、今回の GPT-6.1 Sol ではさらにプロフェッショナルな作業とエージェント タスクに焦点を当てています。
製品のポジショニングの観点から見ると、GPT-6.1 Sol は主力機能と実際の導入コストの間のバランスを見つけることに似ています。 OpenAIは、このモデルにより、ユーザーはGPT-6 Astraレベルの高額なコンピューティングコストを負担する必要がなく、主力モデルに近いプログラミング、コンピュータ操作、複雑なワークフロー実行機能も手に入れることができると期待している。 AI エージェントが単純な質問と回答から、ソフトウェアの直接操作、コードの作成とデバッグ、および長時間プロセスのタスクの実行に徐々に移行するにつれて、モデルの精度、指示に従う能力、および運用コストも、実際のアプリケーションに影響を与える重要な要素になりつつあります。
コメント