要約:
Anthropic CEO のダリオ・アモデイ氏は、3 段階の人工知能セキュリティ フレームワークを提案し、セキュリティと調整の研究にかかる時間を稼ぐために最先端のモデル機能の改善速度を制御することを提唱しました。 Anthropic は、セキュリティ対策の検証、インシデントの報告、モデルのトレーニング プロセスの評価のために、第三者の評価者が同社に長期的にアクセスできるようにする初めての企業となります。

Anthropic は常設の外部評価チームを導入します
Amodei 氏は、「フロンティアの進歩の速度は制御されなければならない」というタイトルの記事で、最先端の人工知能企業は、一般の従業員に近い継続的な内部アクセスを独立した第三者の評価チームに提供すべきであると提案しました。評価者は、企業が安全への取り組みを順守していることを検証し、インシデントを調査して報告し、モデルとそのトレーニングプロセスの調整評価を実施します。
Anthropic はこの措置を一方的に実施することを約束しており、外部評価者にオフィス スペース、アクセス バッジ、社内設備、および内部リスク評価チームとほぼ同等のワークスペースとツールへのアクセスを提供する予定です。法的制限、顧客のプライバシー、企業秘密に関わるコンテンツについては例外が認められる場合があります。
外部評価者には、リスク、インシデント、企業の安全慣行に関する主要な調査結果を独立して発表する権限が与えられます。 Anthropic は、セキュリティ、法的特権、第三者の機密保持に関わる情報を限定的に編集することができますが、結論が会社に不利であるという理由だけで公開を阻止することはできません。評価者は、削除が評価に影響を与えたかどうかを公表することもできます。
3 段階の枠組みには業界と政府の参加が必要です
Amodei が提案した措置の第 2 段階では、独立した評価者の導入に加え、民主主義国の最先端の人工知能企業が共通の安全基準の開発を調整し、モデル機能における無制限の競争を制限することが求められます。
一部の企業間の調整は独占禁止法によって制限される可能性があるため、政府は制度的なサポートを提供する必要があります。アモデイ氏は、十分な数の企業が外部の監督を受け入れれば、業界はモデルの機能とトレーニングプロセスに基づいて検証可能な減速の取り決めを策定できる立場になると主張した。
第 3 段階には国際的な調整が含まれます。アモデイ氏は、民主主義諸国が、生物兵器開発のための人工知能の使用の禁止など、共通の利益分野から始めて、独裁国家を含む他の政府と共通の安全保障規則を話し合うことを提案した。
モデルの機能はリスク管理よりも早く向上する可能性があります
アモデイ氏は、次世代モデルの開発に参加する人工知能モデルの能力が最近強化されたことで、技術の反復が加速される可能性があると述べた。モデルの機能が急速に向上し続けると、関連システムを理解、評価、制御する人間の能力が追いつかない可能性があります。
同氏は、モデルの解釈可能性、セキュリティ評価、調整研究、運用仕様などの分野で今後 1 ~ 2 年で大幅な進歩が見られると見積もっています。機能の進歩の速度を適切に制御することで、業界が人工知能の研究開発を完全に停止する必要がなく、これらの対策のための時間を稼ぐことができます。
OpenAI CEO の Sam Altman 氏はその後、独立した評価者の導入を支持し、OpenAI も同様の取り決めを採用すると述べました。イーロン・マスク氏も、モデル開発を遅らせるというアモデイ氏の呼びかけに公的に同意した。
コメント