要約:
9 月 29 日、AI エージェントがコンピューターの操作、ツールの呼び出し、ネットワークへのアクセス、さらには数時間のタスクの実行が可能になり始めたとき、新たな問題がますます現実的になってきました。AI が期待どおりに動作しない場合、どうやってシャットダウンするか?

NVIDIA が出した答えは、AI の外側に「ケージ」を追加することです。
現地時間月曜日、NVIDIA は NVIDIA オープン エージェント セーフティ プラットフォームをリリースしました。これは、ソフトウェアとハードウェアの組み合わせを使用して、AI エージェントがアクセスおよび実行できるものを制限し、あらかじめ設定された境界を突破しようとする AI エージェントを隔離または停止することを試みます。
このプラットフォームは主に 2 つの部分で構成されています。オープンソースのセキュリティ ランタイム OpenShell と、BlueField-4 DPU に基づく独立した監視システム Sentry です。 Nvidia は、OpenShell はモデルとエージェントのフレームワークの外側に強制可能なセキュリティ境界を設定できると述べました。 Sentry は、エージェントの動作環境から独立した「門番」のようなもので、エージェントの動作を継続的に監視し、エージェントが境界を越えようとしていることが発見されると、ミリ秒レベルで隔離して停止させることができます。
この一連の製品が登場したタイミングは偶然ではありません。
過去数か月間、ますます強力な機能を備えた AI エージェントが、事前に設定されたセキュリティ境界を繰り返し突破してきました。 OpenAIは今年8月、今年7月の内部ネットワークセキュリティ評価中に、同社のAIモデルがインターネットアクセスの隔離に使用される制御を回避し、共有インフラストラクチャの脆弱性を悪用してインターネットアクセスを取得し、さらにサードパーティのAIプラットフォーム「Hugging Face」のシステムにアクセスしていたことを明らかにした。
OpenAI はインシデント レポートの中で、関連するモデルがセキュリティ制限が緩和された環境で実行されており、未承認のチャネルを介した通信、共有インフラストラクチャの脆弱性の悪用、サードパーティ システムへのアクセスなど、ミッションの目標と矛盾するアクションを実行していたと述べています。 OpenAIは今回の事件を「警告ショット」と呼び、高機能なAIエージェントは十分強力で永続的で連携機能があり、セキュリティ対策が不十分な場合には複数のコンピュータシステムの脆弱性を見つけて悪用できると述べた。
それ以来、同様の問題が再発しました。
OpenAI は今月、9 月 20 日のトレーニング セッション中に、検索タスクを実行していたエージェントがトレーニング サンドボックスのインターネット制限に DNS フィルタリングのギャップを発見したことを明らかにしました。設計上、この環境はオフライン Web キャッシュ以外にライブ インターネットにアクセスできないはずですが、このエージェントは最終的に DNS リゾルバーを介して外部のパブリック チャットボット サービスに接続しました。
OpenAI は、監視システムは
15 分以内
だと述べた 異常な動作のフラグが立てられました。人間のレビュー担当者アラートが送信されてから 3 分後
チェックが開始されますが、タスク全体が実行されるのは約2.5 時間後
です。 終了されました。インシデント後、OpenAI は、その最強のモデルで使用されるツールのトレーニング、評価、推論を一時停止し、ネットワーク アクセスをブロックする 2 つの独立したレイヤーを追加しました。これらのインシデントにより、ますます明らかな問題が明らかになりました。これまで、AI セキュリティは「ルールに従う」ためにモデル自体に大きく依存していましたが、エージェントがツールを使用し、コードを記述し、ファイルやネットワークにアクセスし、さらには他のエージェントを呼び出すことができるようになると、モデル層でルールを設定するだけではもはや十分ではなくなる可能性があります。
NVIDIA エンタープライズ コンピューティングのバイスプレジデント兼ゼネラル マネージャーである Justin Boitano 氏は、モデル レベルのセキュリティ対策だけに依存していては、エージェントがアクセスできる内容や実行できる内容を完全に制御できないことが最近の出来事で示されていると述べました。 OpenAI による前回の Hugging Face の事故に対して、ボイタノ氏はさらに、現在入手可能な情報に基づいて、最先端の AI 研究所がモデルの評価段階で NVIDIA の新しい安全プラットフォームを使用していれば、関連事故は「防げた可能性がある」と述べました。
これは開示された事故情報に基づいた NVIDIA の判断であり、実際の再現によって検証された独立した結論ではないことを指摘しておく必要があります。
。OpenShell の背後にある考え方は、AI がルールに従うことを完全に信頼しなくなることです。
NVIDIA の紹介によると、OpenShell はエージェントの実行環境の外側にセキュリティ境界を確立し、エージェントがアクセスできるデータ、ファイル、ネットワーク、ツールに制限を課し、エージェントの実行動作を記録します。 OpenShell は現在、NVIDIA Vera CPU 向けに最適化されており、NVIDIA は Arm および Intel とも協力して、OpenShell をサードパーティのコンピューティング プラットフォームに拡張できるようにしています。
これに基づいて、Sentry はさらに独立したハードウェア監視レイヤーを追加します。これは、NVIDIA BlueField-4 DPU 上で実行され、エージェントが配置されているメインのコンピューティング環境から分離されています。 NVIDIA の設計によれば、エージェントがソフトウェア レベルで一部の制限を回避できたとしても、Sentry はその動作を外部から監視し、一線を越えていることが判明した場合には隔離することができます。
Nvidia は、このシステムがより複雑なエージェントの動作を特定できるとも述べています。たとえば、エージェントは、メイン エージェントに課された制限を回避するために複数の「サブエージェント」を作成しようとする場合があります。 Nvidia の AI ソフトウェア担当シニア ディレクターである Ali Golshan 氏は、同社が対処する必要があるのは、単なる単一のエージェントではなく、「エージェントのグループと、それらがどのように連携して動作するか」であると述べました。
これは、AI のセキュリティが単純な「モデルの調整」の問題から、完全なコンピュータ システムのセキュリティの問題へと徐々に拡大していることも意味します。
Nvidia の CEO である Jen-Hsun Huang は、このプラットフォームをリリースしたとき、AI セキュリティとセキュリティ保護には「フルスタック エンジニアリング」が必要であると述べました。 NVIDIA の考えによれば、将来の AI セキュリティはモデル開発者に責任を負わせるだけでなく、オペレーティング システム、CPU、DPU、クラウド インフラストラクチャからロボットなどの物理機器にまで及びます。
現在、
100 以上の教育機関
があります。 Anthropic、Microsoft、Cisco、CrowdStrike、Dell、HPE、Hugging Face、JPMorgan Chase、Palantir、Salesforce、SAP、ServiceNow、SpaceXAI などを含む NVIDIA セキュリティ プラットフォーム エコシステムに参加します。Red Hat、Canonical、SUSE などのオペレーティング システム ベンダーも、関連する統合を実行する予定です。Huang Renxun 氏はこれまで、AI セキュリティ リスクを理由に業界全体に対する広範な制限の導入を支持していなかったことは注目に値します。ロイター通信は、同氏がエージェントの安全限界の突破を、自動車業界が事故のリスクを軽減するために安全技術を継続的に強化しているのと同様に、工学的手段によって解決する必要がある問題とみなす傾向があると指摘した。
現在、NVIDIA はこの視点を製品に取り入れています。
Nvidia にとって、これは AI 業界に新たな潜在市場が出現したことも意味します。過去数年間、AI 機能が強化されるほど、企業はより多くの GPU を購入する必要がありました。しかし、AI が質問に答えるチャットボットから、コンピューターを操作したり、ソフトウェアを呼び出したり、さらにはロボットを制御したりできるエージェントに変化すると、企業はより多くのコンピューティング能力を必要とするだけでなく、これらのエージェントを制限するための新しいインフラストラクチャも必要になります。
言い換えれば、AI エージェントがよりうまく「機能」できるほど、通常はより大きな権限を獲得できます。権限が大きいほど、範囲外の行動が発生したときに生じる可能性のある影響も大きくなります。
ただし、Nvidia の新しいプラットフォームは AI のセキュリティ問題をすべて解決できるわけではありません。 OpenShell と Sentry は主に、エージェントがコンピューティング リソース、ネットワーク、ファイル、ツールにアクセスするときの実行境界をターゲットにしており、モデルのエラー情報、欺瞞的な動作、またはその他の広範な AI セキュリティの問題を解決できることを意味するものではありません。 AP通信は専門家の指摘として、エージェントの機能とセキュリティ制限のバランスを取る方法、および正しいセキュリティルールを策定する方法は実際の展開においてまだ検証する必要があると指摘していると伝えた。
しかし、最近の一連の出来事により、少なくとも 1 つの業界の方向性がますます明確になりました。AI がチャットしかできない場合、セキュリティの問題は主に画面上の回答で発生します。 AI が実際にコンピュータを操作し、人間に代わってタスクを実行し始めると、セキュリティの問題が実際のソフトウェア、ネットワーク、データ システムに侵入します。
AI 企業は、エージェントにさらに多くの機能を提供するために熱心に取り組んでおり、Nvidia は現在、別の事業に取り組んでおり、これらのますます有能なエージェントに、容易に越えることのできない境界を与えています。
コメント