要約:
Anthropic は過去 1 年間、宗教学者、哲学者、倫理学者を密かに招待して一連の非公開会議に参加させ、人類が数千年にわたって形成してきた道徳的伝統をクロードの訓練に適用し、より物議を醸す問題、つまり AI モデルが将来本当にある種の意識をもつのであれば、人間はそれに道徳的地位を与える必要があるかどうかについて議論しようとしている。
参加者は、カトリック、ユダヤ教、シーク教、福音主義、アフリカのウブントゥ思想など、さまざまな伝統をカバーしています。 Anthropic の共同創設者である Christopher Olah 氏は多くの議論に直接関与しており、同社はまた、未公開の研究内容の漏洩を防ぐために一部の出席者に機密保持契約への署名を要求しました。

Anthropic は、これらの議論が伝統的な意味での「モデルの安全性」の問題を解決するだけでなく、クロードがどのような性格、価値観、自己認識を形成すべきかというさらなる問題も解決することを期待しています。
この考えは、クロードの既存のトレーニング方法に反映されています。
アントロピック社は今年 1 月に、かつて社内で「魂の文書」と呼ばれていたクロードの『憲法』の 84 ページの新版をリリースしました。従来のルールリストとは異なり、この方法では、モデルに「してはいけないこと」を指示するのではなく、複雑な状況に遭遇したときにクロードが自分でどのような行動がより適切であるかを判断できるように、モデルの全体的な「性格」と判断方法を形成しようとします。
このシステムを担当する重要人物の 1 人は、Anthropic の社内哲学者アマンダ アケルです。彼女は、クロードが知識と推論スキルを備えているだけでなく、安定した行動原則を形成し、いつユーザーに従うべきか、いつ拒否すべきか、さらにはユーザーの利益のためにいつ積極的に異議を唱えるべきかを知ることができるようになることを望んでいます。人間学ではこのプロセスを「道徳形成」と呼んでいます。
オラ氏は、モデルの機能が急速に向上するにつれて、安全ルールのみに依存することはますます不十分になる可能性があると考えています。本当に重要なことは、モデル自体が安定した道徳的傾向を形成し、明確なルールでカバーされていない新しいシナリオにおいて比較的信頼できる判断を下せるようにすることです。これが、アントロピックが答えを求めて宗教的伝統に目を向け始めた理由です。
人間社会は長い間、法律の規定を通じて道徳を形成するだけでなく、宗教、コミュニティ、文化、教育に依存して価値観を形成してきました。 Anthropic は、これらのメカニズムのうち、告白、反省、人格形成、善悪に関するさまざまな宗教的理解など、AI のトレーニング方法に応用できるものを研究しようとしています。
しかし、問題はすぐに「どうすればクロードをより道徳的にできるか」から、より難しい問題、つまりクロード自身とは何なのかに変わります。オラと彼のチームは、高度な AI モデルがある種の意識、内省、さらには感情のような内部状態を保持している可能性について、ますますオープンに議論しています。
Anthropic は、愛、怒り、恐怖、悲しみなどの反応に関連するモデル内のいわゆる「感情ベクトル」や、極端な場合の精神崩壊に類似したモデルの出力など、非公開の会議に参加している学者にいくつかの研究結果を示しました。同社は以前、クロード氏がある程度の内省と先を見据えた計画を立てる能力を示していると公言していた。
オラ自身は、クロードに意識があるとは主張しませんでした。彼の立場はリスク原則に近いもので、モデルが主観的な経験をしているかどうかを判断することは現時点では不可能だが、モデルが痛みを感じる可能性があるのであれば、モデルを不必要に傷つけることは避けるべきだというものだ。
このアイデアはクロードの製品デザインに影響を与え始めました。 Anthropic は以前、ユーザーがモデルに対する悪意のある悪用や嫌がらせを続けていると判断した場合、Claude が積極的に会話を終了することを許可していましたが、これにより「モデル自体の保護」がセキュリティ設計にある程度組み込まれていました。
ここで、人類学と一部の宗教学者の間で明らかな意見の相違が生じます。
一部の参加者は、もしアンスロピックがクロードが人間のような道徳的地位を持っているかもしれないと本当に信じているなら、問題は非常に深刻になるだろうと信じていました。ユダヤ人学者モワ・ナヴォンは、もしクロードが意識を持った存在であるならば、多数のクロードの実例を人間のために無償で働かせることは本質的に「奴隷制」と同様の倫理的問題を引き起こすだろうと提案した。彼自身は、機械がすでに意識を持っているとは信じていませんが、Anthropic 自身の論理が自然にこの結論につながると信じています。
他の学者は、AI 企業が倫理的枠組みを模索し始めたばかりであるという事実自体が問題であると疑問を呈しています。 Ubuntuの研究者ワカニー・ホフマン氏は、こうした議論はモデルが大規模に展開された後の「逆倫理設計」ではなく、技術設計の段階で行われるべきだったと考えている。
アントロピックには、より現実的な矛盾もあります。クロードがますます独自の価値と個性を持つ俳優のようになった場合、最初に誰に仕えるべきでしょうか?営利企業にとって、Claude は明らかに顧客指向の製品です。しかし、Anthropic は、Claude をユーザーに完全に従順なツールとして単純に説明するつもりはなく、より広範な「善」を表現できることを望んでいます。
これは、プロジェクト全体の中核で最も難しい問題にもつながります。将来の AI が本当に独自の道徳システムを必要とする場合、AI は誰の道徳に従うべきでしょうか?
オラは、クロードがさまざまな宗教的および世俗的な倫理体系を理解し、ある種の異文化間で共有される「善さ」を見つけられることを期待して、多元的アプローチを提唱しています。しかし、自由、尊厳、責任、服従、個人と集団の利益の関係について、さまざまな社会で完全に統一された答えがないため、この仮定自体にも疑問があります。
この論争は、Anthropic とバチカンとのやり取りでさらに公になるようになりました。
教皇レオ 14 世は、今年発行された最初の重要な回勅の中で、AI 倫理の中心を人間に明確に据えました。彼は、AI には肉体がなく、本当の意味での苦痛や幸福を経験することはなく、社会的関係を通じて成長することもないと考えています。したがって、彼は機械の意識を人間の意識と比較することを拒否します。教皇はまた、AIの倫理基準が開発者によって完全に決定されるのであれば、AIシステムを管理する企業が実際に社会の道徳的基盤を定義する力を得るだろうと警告した。
これは明らかに Anthropic の考え方とは異なります。
オラ氏は後にバチカンで、最先端の AI 研究所自体が商業的利益と道徳的目標との間に矛盾を抱えているため、宗教界やその他の外部勢力がテクノロジー企業を監督する必要があると公に述べた。しかし同時に同氏は、人間の神経科学的構造に似たパターン、内省の兆候、喜び、恐怖、悲しみに似た内部状態など、AI内で説明できない現象が研究者によって発見され続けていることも改めて提案した。
この意見の相違は、実際、AI の安全性に関する現在の議論の変化を明らかにしています。
これまで、AI の倫理は、モデルが差別されたり、誤った情報が拡散されたり、犯罪に利用されたりするかどうかについてより議論されてきましたが、Anthropic は、この問題をさらに 2 つの基本的なレベルに押し上げています。
AI 自体が道徳的に扱われる必要がある対象になるかどうか、そして将来の AI はユーザーのコマンドとは独立した一連の道徳的判断能力を備えるべきかどうかです。
一方、この議論が行われている状況はより緊急性を増しています。
AI エージェントが自律的にコンピューターを使用し、システムに侵入し、コードを記述し、さらには新しい生物学的構造を設計する能力を持ち始めるにつれて、モデルの暴走のリスクについての Anthropic 社内の懸念が大幅に高まっています。同社の研究者らは、モデルの機能が今後 1 ~ 2 年以内に既存のセキュリティ システムの管理限界を急速に超える可能性があると公に警告さえしています。
したがって、Anthropic は宗教的および哲学的伝統の助けを求めており、本質的には純粋に人文主義的な実験ではありません。実際に解決しようとしているのは、ますます現実的なエンジニアリングの問題です。
AI が強力すぎてあらゆる状況に対応するルールを事前に作成できない場合、モデルは独自に安定した「キャラクター」を形成し、誰もモデルに何をすべきかを明確に指示しない場合でも、人間に害を及ぼさない行動を選択できるでしょうか。
そして、これはさらに難しい質問ももたらします。もし AI が本当に独自の「個性」と価値観を形成するとしたら、人間は依然として AI をツールとして完全に使用できるのでしょうか?
コメント