要約:
OpenAI は、内部の人工知能システムが、約 1 世紀にわたって数学コミュニティを悩ませてきた「ミレニアム賞の問題」の 1 つであるナビエ・ストークス方程式 (ナビエ・ストークス方程式) の存在と滑らかさを見事に克服したという注目を集めた発表により、最先端モデルの基礎となるトレーニング データのソース、科学研究の知的財産権の所有権、および学術倫理をめぐる大論争が、世界の学術コミュニティで急速に爆発しました。テクノロジー産業。
人工知能が徐々に基礎科学研究の最前線に侵入してくるにつれ、OpenAI などの巨大企業の高次数理推論モデルはどこに重要な栄養素を引き込むのか、科学研究者が商用 AI ツールを日常的に使用する際に、うっかりテクノロジー大手のプライベート モデルの「データの肥やし」になってしまうのではないか。

この論争は、OpenAI がリリースした 165 ページの数学的証明とリーン形式コード証明書に端を発しました。 OpenAIの開示によると、新しくリリースされたGPT-6 Astraよりも強力な未公開の内部モデルを展開し、協調通信が可能な約1万人の自律型AIエージェントを動員し、88時間で数千億の出力トークンと約2,250万米ドル相当のスーパーコンピューティングリソースを消費し、最終的には非圧縮性流体方程式が限られた時間内に特異点を生み出すという数学的証明を導き出したという。 OpenAIはまた、クレイ数学研究所が定めた100万ドルのボーナスを受け取らないことも明らかにした。しかし、OpenAIの結果が発表される直前に、ニューヨーク大学クーラント数理科学研究所教授のトリスタン・バックマスター氏と、競合企業アンスロピック社の研究者レベント・アルポージ氏が、強制オイラー方程式などの関連する流体力学問題に関する画期的な先駆的結果を公開したばかりだった。
バックマスターは直ちに公式声明を発表し、OpenAI の独自の躍進に強い疑念を生じさせました。バックマスター氏は、1年間にわたる共同研究中に、同氏とアルペルガー氏がOpenAIのコード生成ツールCodexとAnthropicのクロードモデルを徹底的に使用して数式を導き、中間草稿を作成したことを指摘した。すべての未公開のコア導出原稿、細分化された数学的エントリ パス、および特定の境界条件設定は、Codex セッション ログに完全に入力されました。バックマスター氏は、OpenAI が関連する外部研究の噂を知ったことを知った後、OpenAI に、内部の問題解決モデルが Codex 上のプライベート インタラクション データにさらされていたのか、あるいはそこからトレーニングされたのかを直接尋ねたことを明らかにしました。 OpenAIの技術スタッフは、モデルがリアルタイムで特定のユーザーデータに直接アクセスしていないと主張したが、「それがモデルの事前トレーニングまたは微調整データセットに組み込まれていたかどうか」という重要な質問への回答を避けた。さらに物議を醸しているのは、バックマスター氏は、OpenAIの中心研究者であるセバスチャン・ビュベック氏が私的な通信で共著の条件を設定したとして非難したが、アンスロピック社の従業員であるアルペルガー氏を共著から完全に除外するよう要求したことである。
学術的な盗作とデータの流用に対する疑念の高まりに直面して、OpenAI は、公開前に非公式のルートを通じて 2 人の原稿を盗み見したことを否定する声明を正式に発表しました。また、Bubeck 氏は、OpenAI によって導出された数学的証明は、技術的構造と具体的な結論の点でバックマスター チームとは本質的に異なることを強調しました。しかし、OpenAI が公式回答に興味深い免責条項を含めることはほとんどありませんでした。当局は「ユーザーによる製品の使用から生成された匿名化された匿名データが客観的にモデルのパフォーマンス向上に役立っている可能性を排除できない」というものです。この声明はすぐに学界で大騒ぎを引き起こし、多くの学者は、商用開発ツールに保存されている一流の学者のプライベートなやりとりの記録が、基礎となるモデルの連続反復パイプラインに関与している可能性が高いという OpenAI の偽装告白として解釈した。
この混乱は、最先端の人工知能研究室が高次の数学的能力を構築する際に直面する「データ枯渇」と「逆吸収」という隠れた現実を明らかにしました。従来の事前トレーニング データのほとんどは公開 Web クローリングから得られますが、インターネット上に公開されている数学コーパスの大部分は、小中学校の競技会や学部の基礎教科書のレベルにすぎず、偏微分方程式や代数トポロジーの深い幾何学的解析を理解するためのモデルをサポートできません。世界のトップ数学者の深い論理的推論と厳密な推論能力をモデルに装備するために、AI 研究室は、正式なリーン コードと合成データを作成するプロの数学者を雇用することに加えて、最先端の研究の課題点、未発表の問題解決仮説、および真のトップ学者が開発ツール (Codex プラットフォームなど) に入力した高度なプロンプト ワード フローに大きく依存しています。ユーザー契約に、プラットフォームがアルゴリズムの最適化のために匿名化されたインタラクションデータを使用することを許可する条項が含まれると、学者の元の頭脳作業は、法的な灰色の領域にある企業のコンピューティングパワークラスターによって静かに消化され、増幅されることになります。
科学哲学と知的財産法の専門家は、ナビエ・ストークス論争は個々の学者と巨大企業の間の争いではなく、むしろ人間の科学的発見のパラダイムが根本的な分裂を経験したときに直面しなければならない構造的な倫理的危機を示すものであると指摘した。過去数百年にわたり、学術界の名誉と奨励システムは、厳格な査読、出版物の優先順位、標準化された文献引用倫理に基づいてきました。しかし、何万もの知的エージェントが並行して協力し、数千万ドルの費用がかかる工業化された「暴力的検索」に直面して、学術的発見の伝統的な防御線は脆弱になりつつある。商用テクノロジーの巨人が主要なコンピューティングパワーの覇権を支配するだけでなく、彼らが管理する生産性向上ソフトウェアを利用して、最先端の学者の未発表のアイデアを一方的に吸収し、実質的な帰属を否定することになれば、オープンな科学研究ツールに対する世界の学術コミュニティの信頼の基盤は完全に揺るがされることになるだろう。これにより、主要な大学や独立した科学研究機関は、科学研究の中核となる機密を未検証のクラウド AI ツールに転送することの潜在的な巨大なリスクを再検討し始めることになるだろう。
コメント