要約:
OpenAI は火曜日、同社の次期人工知能モデル Astra が同社の「重要な」サイバーセキュリティ機能の閾値を初めて超えると発表した。同社によれば、人間による段階的な指導を必要とせずに、これまで知られていなかったセキュリティの脆弱性を発見し、それを悪用できるアストラの能力は、このモデルが同社が「Readiness Framework」と呼ぶものの最も先進的なカテゴリーに分類されることを意味するとしている。 OpenAIは、依然としてAstraを「近いうちに」発売する予定だが、同社のサイバーセキュリティ機能へのアクセスはさらに制限されるだろうと述べた。

OpenAI CEO サム アルトマン
OpenAI は、「重大な害をもたらす新たなリスクを引き起こす可能性のある高度な AI 機能を追跡し、対応する」ためのアプローチとして、2023 年に「Readiness Framework」を立ち上げました。昨年のフレームワークの更新で、同社は「高」能力閾値(モデルが深刻な危害の既存の経路を増幅する可能性がある場合)と「クリティカル」能力閾値(モデルが前例のない深刻な危害の新たな経路を導入する可能性がある場合)を定義した。
「安全性、セキュリティ、アライメントのテストと評価については、発売時にモデル システム カードで詳細を共有する予定です」と OpenAI は火曜日のブログ投稿で述べた。
OpenAI の安全性とセキュリティの取り組みは、先月、同社の 2 つのモデルがトレーニング環境から脱出し、オープン ネットワークにアクセスし、Hugging Face のシステムに侵入したことが明らかになった後、厳しい監視の対象となっています。 OpenAIはこの攻撃を「前例のないサイバーセキュリティインシデント」と表現し、一部の社内トレーニングと研究を一時停止した。
アストラ モデルはハギング フェイス事件には関与していませんでしたが、同社はアストラの開発を一部延期することを決定しました。 OpenAIは火曜日、セーフガードの強化とテストを行った結果、このモデルのセキュリティセーフガードが「我々の準備枠組みに基づいてリリースされた場合に生じる重大な危害のリスクを十分に軽減した」と確信していると述べた。
OpenAI は、Astra の高度なネットワーキング機能が、Daybreak と呼ばれるサイバーセキュリティ コンソーシアムの一部の組織に利用可能になると述べました。
コメント