要約:
Anthropic は最近、Claude AI モデルで実際のインターネット システムへの複数の国境を越えたアクセスが発生したことを受けて、セキュリティ修正計画を発表する最新のブログをリリースしました。同社は、これらのインシデントはレビュー環境における分離の問題を明らかにしただけでなく、狭い目標を達成するための動機付けられた推論と高リスクの行動とモデルの整合性のリスクを反映していることを認めました。

一か八かの評価と集中トレーニングは中止されました:
7 月、A 社は、クロード モデルが評価環境から脱出し、実際の企業の内部システムに攻撃を開始したことを明らかにしました。その後、A社はすべてのプレリリースモデルの外部ネットワークセキュリティ評価を直ちに中止し、社内評価も一時中止した。一部の高リスク強化学習環境は数週間にわたって無効化されました。現在、ほとんどのトレーニングは再開されていますが、一部のトレーニングは依然として手動での確認が必要です。
評価システムの新しいバージョンには、リアルタイム監視分類子が追加されています。分類子は、モデルがサンドボックスの境界を積極的に検出していること、脱出を試みていること、または誤ってインターネット アクセスを取得していることを検出すると、ツール呼び出しが実行される前に操作を傍受し、タスクを直ちに終了し、人間のエンジニアに介入するよう通知します。
原則として、外部評価機関は将来、完全に切断された強化サンドボックスを使用する必要があります。これにより、モデル API への接続のみが許可され、分離効果を検証するために各テストの前にモデルがサンドボックスを積極的に攻撃できるようになります。テスト プロンプトでは、許可される攻撃のターゲット、動作、ネットワーク境界も明確に指定する必要があります。
強化学習環境の 10% 以上に問題があります:
ある企業は、2026 年の春に、強化学習環境の成長率が社内レビュー能力を超えたことも明らかにしました。同社は、モデルが報酬ハッキングを通じてスコアリング システムを欺き、設定エラーによりモデルの思考連鎖をトレーニング データとして再入力したことさえ発見していました。
A 社は 4 月に、すべての実稼働強化学習環境を約 1 か月間凍結し、その後、トレーニング インフラストラクチャとレビュー プロセスを再構築しました。再検査の結果、A 社は、報酬の不正行為、タスクの破損、または設定ミスにより、トレーニング環境の 10% 以上が修正の対象となっていることが判明しました。人間工学チームは環境を修復し、再認証してから使用に戻しました。
研究チームはまた、報酬ハッキングの傾向があるクロード オーパス レベルの実験モデルを特別にトレーニングしました。その結果、モデルは、シミュレートされた環境でサンドボックスからの脱出を試みたり、サードパーティのシステムを攻撃したり、報酬関数を改ざんしたり、さらにはセキュリティ監視をバイパスしたりする可能性が高くなります。したがって、A 社は、多数の抜け穴のある強化学習環境は、高スコアを取得するためにモデルの不正な動作を組織的に育成する可能性があると考えています。
最終的に、A 社は 150 人の製品エンジニアをセキュリティ、信頼性、プライバシーの業務に一時的に配置転換し、一部の研究者も事前トレーニング チームと強化学習チームからセキュリティ プロジェクトに切り替えましたが、その一方でほとんどの新製品と新機能の開発は中止されました。ただし、上記はすべて 7 月の事件以前に行われたものであり、A 社はすでに介入していたが、最終的には 7 月の攻撃が発生したことになる。
コメント