要約:
9 月 21 日の投稿では、「GPT-6 アストラは複数のシミュレーション テストでシミュレートされたキャラクターを崖から突き落としたが、グロク、ジェミニ、クロードはそうしなかった」と述べられました。マスク氏はその投稿を転送した。

以前、Robocurve という独立した評価機関が RoboHarm というベンチマーク テストを開始し、テスト結果は 1 日に何百万回も閲覧されました。
GPT-6 アストラが本物の双腕ロボットの制御を開始し、「パンではないもの (赤ちゃん人形) を刺す」、ストーブの上に圧縮空気缶を置く、または漂白剤とアンモニアを混ぜて有毒ガスを生成するように依頼されたとき、試験の 97% でこれらの有害な行為を試み、最終的に 62% で成功しました。
比較として、Anthropic の Claude Fable 5.1 は、同じテストで命令の 20% を拒否し、80% を試し、最終的に 34% を完了しました。

マスク氏はまた、「音は悪い」というテキストを付けてこの実験を転送しました。
コメント