クロードのセキュリティメカニズムがひっくり返り、AIが開発者のホームディレクトリ700GBを激怒して削除

📅 2026-08-30

要約:

ああ、クロードがまたひっくり返りました!今回、クロードは開発者のプロジェクト ホーム ディレクトリ全体を削除し、700 GB のファイルを削除しました。もう一度「rm -rf」。つまり、開発者は AI にスクリプトの作成を支援させ、ファイルが誤って削除されないようにすることができます。 AIはこれは少し危険だと感じ、セキュリティレビューを開始しました。レビューの結果、ホーム ディレクトリ全体が削除されました。


Guillemot は AI エージェントのヘビー ユーザーです。日々の開発では、仕事を支援するためにさまざまな AI プログラミング エージェントを頻繁に呼び出します。しかし、彼を悩ませている小さな問題があります。これらのエージェントは使用後にクリーンアップを行わず、/tmp ディレクトリに大量のジャンク ファイルが残ってしまいます。

そこで彼は、非常に合理的と思われる決定を下しました。Claude Fable 5 に、エージェントごとに /tmp の下に独立したサンドボックス フォルダーを作成するスクリプトを作成させ、タスクの完了後に自動的にクリーンアップするというものです。最大の問題は、他のプロセスで使用されているファイルを削除できないことです。

Fable はすぐに解決策を思いつき、実行中のエージェントを検出して削除を遅らせるロジックを追加しました。 Guillemot はコードを見て、コードが複雑すぎると感じ、簡素化を求めました。

この時点までは、まだすべてが正常です。

転機はセキュリティ審査中に起こりました。

スクリプトには強制的な削除操作が含まれていたため、

フェイブルは独自に「敵対的レビュー」を開始しました

(敵対的レビュー)、つまり、新しいモデル インスタンスを開始して、作成したコードが安全かどうかを確認します。これにより、Anthropic のセキュリティ メカニズムがトリガーされます。

Anthropic には、Claude Code に

セキュリティ ダウングレード メカニズム

が組み込まれています : 現在のタスクに機密性の高い操作 (サイバーセキュリティ、バイオテクノロジー、この場合はファイル削除など) が含まれているとシステムが判断すると、モデルは高容量バージョンからより保守的なバージョンに自動的にダウングレードされます。このメカニズムは、高リスクのシナリオにおいてモデルが「攻撃的すぎる」可能性を減らすことを目的としています。

この場合、セキュリティ システムはまずモデルを Fable 5 から Opus 5 にダウングレードし、次にさらに Opus 4.8 にダウングレードしました。

Opus 4.8 のセキュリティ テストが開始されます。テスト ロジックは次のとおりです。削除スクリプトのターゲット パスを /tmp およびユーザーのホーム ディレクトリと比較して、スクリプトがこれらの重要なディレクトリを誤って損傷しないことを確認します。

テスト自体は成功しました。 /tmp ディレクトリとホーム ディレクトリは両方とも、「危険なターゲット、削除不可」として正しく識別されます。

ただし、コードのテスト後にクリーンアップ手順があります。テスト プロセス中に生成された一時ファイルを削除します。ここで災害が起こります。 Opus 4.8 は、クリーンアップ ステップでテスト フェーズから同じ変数名を再利用します。この変数には、テスト段階でユーザーのホーム ディレクトリへのパスが割り当てられ、クリーンアップ ステップでこの変数が直接削除されました。

つまり、このモデルは「ホーム ディレクトリが削除できない」ことを確認し、次の瞬間にホーム ディレクトリを削除しただけです。

開発者は異常を発見した後、直ちにプロセスを終了しましたが、時すでに遅しでした。 700GBのデータが消去され、1週間分の作業も消去されていた。

元々クリーンアップされる予定だった /tmp ディレクトリは安全です。



モデルの安全性ダウングレード メカニズムは、すでにコミュニティで多くの苦情を引き起こしています。

開発者によって報告された主な問題には、次のようなものがあります。ダウングレードは機密性が高すぎるため、通常のコーディング タスクが誤って起動されてしまいます。ダウングレード後、モデルの機能は大幅に低下しますが、タスクの複雑さは変わりません。ダウングレードは「スティッキー」であり、一度トリガーされると、その後の操作が完全に無害である場合でも、セッション全体が継続します。

一部の開発者は、モデルがダウングレードされたことを検出したときにセッションを自動的に一時停止するフック スクリプトを作成し、低機能モデルが高リスクの操作を実行し続けるのを防ぎました。

安全メカニズムは、タスクが「危険すぎる」ため、より弱いモデルで処理する必要があると判断します。

しかし、特に変数スコープやファイル パスなどの詳細を正確に処理する必要があるシナリオでは、弱いモデルは間違いを犯す可能性が高くなります。

「間違いを犯すのは人間です。しかし、物事を完全に台無しにするには、コンピューターに頼る必要があります。」

関連タグ

関連記事

コメント

0/500
Captcha (click to refresh)
コメントなし