要約:
過去数か月間、OpenAI と Anthropic は交互に主力モデルを推し進めてきましたが、Google は異常に沈黙しているように見えました。 Flash はほぼ 3 週間ごとに更新され、3.6、3.7、3.8 と継続的に更新されていますが、最高の機能制限を表す Pro については動きはありません。この二日間、大型モデルのブラインドテストアリーナアリーナに突如gemini-3.8-flashという名前のモデルが現れました。

開発者は作業を開始するとすぐに、何かが間違っていることに気づきました。本物の Gemini 3.8 Flash がリリースされました。どのレベルにすべきかは誰もが知っています。しかし、この「3.8 Flash」では、コードの記述、SVGの作成、エージェントの実行のパフォーマンスが明らかに一段階跳ね上がりました。


実際のテストを数回行った後、推測はすぐに広がりました。
このモデルは、ラベルの裏に隠された Google の次世代フラッグシップ、Gemini 4 Pro となる可能性があります。
その直後、さらに誇張されたベンチマーク比較画像が広まり始めました。コーディング、エージェント、推論、複数のスコアで GPT-6 アストラとクロード・フェイブルが以下にランク付けされました。

つい数日前、最も重要な AI 企業のいくつかが、速度を緩める時期が来たかどうかについて公然と議論していました。いま、減速の音はまだ地に届かず、新たな競争が始まる。
この「神レベルのモデル」と思われる Gemini 4 Pro の背後には、さらに危険なキーワードがあります。
RSI。

Gemini 4 Pro の漏洩の疑い
9 月 2 日に、Google は Gemini 3.8 Flash を正式にリリースしました。関係者によると、これは Gemini 3 シリーズの最新世代の Flash であり、ソフトウェア エンジニアリング、エージェント タスク、および複雑な複数ステップの推論が大幅に改善されています。 3.7 Flash から 3.8 Flash まで、わずか 3 週間しかかかりませんでした。
そのため、同じ名前の gemini-3.8-flash を持つ別のモデルが Arena に登場したとき、開発者はすぐに異常に気づきました。
本物の 3.8 Flash はすでに存在しており、誰もがすぐに参照できるようになっています。そしてこのモデルは明らかに強そうに見えますが、それは明らかにProモデルにしかない強さです。

普及のきっかけとなった実際のテストの最初のバッチは、SVG、Web ページ、3D シーンに焦点を当てていました。
開発者の Harshith は、SVG を使用して横向きの飼い猫を描画し、その結果を GPT-6 Astra Max と Gemini 3.8 Flash の正式バージョンと組み合わせるよう依頼しました。 Arena のこのバージョンには、概要、プロポーション、細部の完全性の点で、公式 3.8 Flash との明らかなギャップがあります。

左から右へ: 「4 Pro」、Astra、3.8 Flash
X ネチズン @thtbee_ は、この疑わしい Gemini 4 Pro モデルを複数の角度から継続的にテストしました。
ボクセル スタイルの塔のモデルは 8 分間実行され、インタラクティブ 3D シーンの完全なセットが直接生成されました。


エアバス H145 ヘリコプターは、非常に詳細な完全な 3D 表示ページを構築するのにわずか 10 分しかかかりませんでした。しかし、このネチズンは、ページの下部にある UI 要素が「少し見た目が悪い」と述べました。


Web デザインに関しては、モデルを使ってモノクロ テーマの Web サイトを作成するのに約 14 分かかりました。全体的に非常にきれいで完成したものでした。過去にジェミニがよく苦情を言われていたデザインセンスの問題が、今回ようやく修正されたようだ。


別のネチズン @Mr_Salio は、この疑わしい Gemini 4 Pro モデルを直接使用してゲームを作成しました。完成したグラフィックは十分に滑らかで、世界生成やゲームデザインも非常に完成度が高い。


さらに重要な手がかりは、開発者の Qwinah から得られます。
彼は、Gemini 4 Pro のバックエンドへの「ゴースト ルーティング」に成功したと主張し、疑わしい内部端末情報のスクリーンショットを投稿しました。
彼によると、このモデルの内部ロゴには G4P-ARGON と VIA_3.8_FLASH が直接表示されています。最大出力は 256K に達し、コンテキスト ウィンドウは 1,000 万トークンを超え、セッション間の永続メモリ、API を使用しないネットワーキング、バックエンドの自動コンパイルとスクリプトの実行、さらには物理ロボット制御機能も備えています。

この情報が真実であれば、それは明らかに通常の Flash アップグレードではなくなります。
同時に、Gemini 4 Pro ベンチマーク比較表もコミュニティで流通し始めました。

画像のデータによると、Gemini 4 Pro は、DeepSWE v1.1 ソフトウェア エンジニアリング テストで 88.7%、ターミナル エージェントの Terminal-Bench 2.1 テストで 95.3%、専門家レベルの知識推論テスト HLE-Verified で 72.1%、コンピュータ操作エージェント テスト OSWorld 2.0 で 86.8% のスコアを獲得しました。
さらに誇張されているのは、実際の知識労働を測定する GDPval-AA v2 では、2000 年のマークを直接突破する 2064 Elo と書かれていることです。
これらのデータが真実であれば、Gemini 4 Pro は単に「ファブルを殴り、アストラを蹴る」だけで、最先端モデルの頂点に一気に立つことができます。
しかし、誇張すればするほど、より注意が必要になります。
このベンチマーク テーブルは、Qwinah によって「掘られた」と思われるバックエンドのスクリーンショットと完全には一致していないことに注意してください。ベンチマーク表の比較項目として使用されているAstraのスコアが公式データと一致していません。どちらの資料も Google、Arena、または関連ベンチマークによって正式に承認されておらず、依然としてコミュニティ内で流通している情報にすぎません。
確認できる唯一のモデルは gemini-3.8-flash という名前のモデルですが、これは Gemini 3.8 Flash のパフォーマンスと完全に一致しません。
しかし、誰もがすぐに Gemini 4 Pro を指摘する非常に重要な理由がもう 1 つあります。それは、Google の Pro モデルには長い間空白があったからです。
Gemini 3.5 Pro はまだ正式に発売されておらず、Gemini 4 はすでにトレーニングに参加することが確認されています。過去数か月間、Flash は世代から世代へと進化してきましたが、Pro ラインには真の意味での機能の上限を示す新しいモデルは存在しませんでした。
今、明らかに異常な能力を持つ「3.8 フラッシュ」が突然アリーナから出現しました。
その結果、推測は自然にますます合理的になってきています。Google は実際の大規模アップグレードを 3.5 Pro に任せるつもりはなく、直接 Gemini 4 Pro に任せるつもりなのかもしれません。

Gemini 4 Pro の後ろ、
より重要なキーワードは RSI
Gemini 4 Pro がまだコミュニティ内の噂にすぎないとすれば、さらに注目すべきことは、
Google がモデル開発への AI 参加の速度を大幅に加速していることです。
この Gemini 4 Pro の噂では、RSI というキーワードが繰り返し言及されています。


RSI は Recursive Self- Improvement の略で、再帰的な自己改善を意味します。簡単に言えば、AIはより強力なAIを作ることに参加し始め、より強力なAIは次世代モデルの開発をさらに加速させます。
このサイクルが実行されると、加速されるのはモデルの能力自体だけではありません。
モデルの進化の速度も、モデル自体によって加速され始めます。
ロイターは今年 8 月、Google の共同創設者である Sergey Brin 氏がここ数カ月 Gemini のスピードアップを推進しており、重要な方向性の 1 つとして再帰的な自己改善を挙げていることを明らかにしました。
Google はこのクローズド ループを達成したことを公には発表していませんが、モデルの評価、改善の方向性の発見、実験の実行、結果のモデル開発プロセスへのフィードバックなど、本来研究者に属していたタスクの多くをエージェントに引き渡しています。
Gemini 3.8 Flash が 9 月 2 日にリリースされたとき、Google は公式説明の中で、長時間実行されているエージェント ループが「基礎となるモデルを再帰的に評価し、改善している」とも述べました。

Google DeepMind 研究者の姚舜宇 (テンセントの姚舜宇ではありません) は、月面着陸したアームストロング氏の言葉を使って、3.8 Flash リリース後のこのアップデートについて説明しています。
「これはモデルにとっては小さな一歩ですが、RSI にとっては大きな一歩です。」

つい最近、Google も新しい論文のタイトルに「RSI」を含めました。
9 月 14 日、Google、GDM、その他のチームは Dream-RSI をリリースしました。これは、探索戦略の継続的な改善を通じてエージェントが再帰的な自己改善を達成できるようにする方法を特に研究しています。アルゴリズム エンジニアリング、数学的最適化、GPU カーネル タスクにおいて、この方法は探索効率が高く、探索コストが低いことがわかります。
まさにこのため、Gemini 4 Pro の噂はすぐに RSI と結び付けられました。
コミュニティ内の憶測は「Gemini 4 Pro は非常に強い」というだけに留まらず、Google が社内でどの程度 RSI を達成したかについても疑問を抱いています。
RSI のこの道を進んでいるのは明らかに Google だけではありません。
米国時間 9 月 17 日、Anthropic は一連の社内 AI 研究開発自動化データを公開しました。
人類関係者らは、これらの指標を公開した理由は、最先端の研究所における AI 研究開発のどの程度が AI 自体によって完了し始めているかを外部の世界が知る必要があると考えているためであると述べました。

データによると、今年 8 月の時点で、クロードは人類 AI の研究開発タスクの 26% を主導できています。つまり、人間は高レベルの目標を与えて監督するだけでよく、クロードは基本的にタスクをエンドツーエンドで完了できます。今年2月と3月ではこの割合は1%未満だった。
同時に、Anthropic 内の AI 研究開発タスクの 90% 以上は、少なくとも AI コラボレーションの段階に入っています。
中国では、Zhipu の創設者兼主任研究員である Tang Jie 氏も最近、次のように述べています。「再帰的な自己改善にはまだ程遠いですが、モデル最適化システム、システム サービス モデルという最小のサイクルが現れてきました。」

Tang Jie の X に関する長い記事、最初だけが切り取られています
Zhipu によって開示されたエンジニアリングの実践では、GLM-5.3 によって駆動されるインフラ エージェントが、GLM-5.3-Flash 推論インフラストラクチャの設計、デバッグ、最適化に参加しました。このシステムは10万個以上の国産AIチップのクラスター上で稼働する。最初の実行からすべての実稼働トラフィックを引き継ぐまでにわずか 2 週間しかかかりませんでした。これにより、エンドツーエンドのスループットが初期レベルの 3.2 倍に増加しました。

「速度を落として」は最終的に警告だけを残す
つい数日前、アモデイは最先端の AI 企業に対し、「減速」に協力するよう呼び掛けました。
彼が注意すべき最初の症状として挙げたのは RSI でした。
モデルの進歩自体はもちろん良いことですが、問題は、AI が次世代 AI の製造に参加し始めた場合、モデルの進歩の速度はますます速くなる可能性がありますが、人間によるモデルの理解、評価、制御の速度は同時に加速されない可能性があることです。
そこで、Amodei 氏は、能力が特定のしきい値を超える前に、第三者による評価、共通の安全基準、減速メカニズムを事前に確立する必要があると繰り返し強調してきました。
RSI が実際に正のフィードバックを形成すると、モデルはブレーキの「安全な距離」を超えている可能性があるためです。
リスクに関しては、いくつかの最先端の研究室が確かに合意に達しています。
アルトマン氏は「最先端の AI の開発ペースを落とす」ことに公に同意し、OpenAI も同様の従業員権限を持つ独立した審査員を導入すると約束した。マスク氏は「ダリオ氏は正しい」と述べた。ハサビス氏はまた、これは正しい方向だが、その方法については引き続き議論する必要があると述べた。
しかし、この取り組みでは、一人で減速しても意味がないとも述べています。 AIの研究開発がAIによって加速され続けるのであれば、将来本当に効果的な減速や停止を実現するには、独立した評価者の導入や、最先端の研究機関が共同で能力の閾値や安全対策を設定し、必要に応じて研究開発のペースを落とすよう調整できるようにするなど、一連の共通ルールの確立が必要となる。
しかし、さまざまな競争上の理由により、これまで共通のルールは確立されていませんでした。
「注意すべきだ」ということはすでに誰もが口を揃えて言えるのですが、「具体的にどのように減速するのか、誰が最初に減速すべきなのか、他の国も減速すべきなのか」となると、コンセンサスはすぐに消えてしまいます。
研究室間では最も直接的なモデルの競争があり、国家間では AI の競争がさらに激しくなります。どの国でも単独でペースを緩めれば、相手に優位な立場を明け渡すリスクを負うことになる。どこかの国が単独で制限を課した場合、相手側の動きが加速し続けることを懸念するだろう。
したがって、いくつかの最先端の AI 研究室は、言動に多少の一貫性のない行動をとっています。
Google 側には、Arena で匿名でテストされた疑いがある前述の Gemini 4 Pro があります。
人類側では、Opus 5.2 のグレースケールの痕跡も最近コミュニティに現れ始めています。一部の Claude Code ユーザーは、実行ステータスとリクエストのルーティング情報を通じて新しい claude-opus-5-2 モデルのロゴを確認し、一部のリクエストが次世代 Opus に対してグレースケール化されているのではないかと疑っていました。

OpenAI に関しては、バックグラウンド モデル リストに gpt-6-sol というモデル名を見たという人や、新しいモデルにグレースケールされたのではないかと疑ったという人もいます。広く流通しているニュースによると、GPT 6 Sol は来週リリースされるか、米国時間 9 月 29 日の Dev Day にリリースされる可能性があります... つまり、それは遠くないことです。

3 つの最先端の AI 研究所による次のモデルでは、コミュニティでのテストの痕跡が示され始めています。
これまでのところ、このラウンドの「減速イニシアチブ」の最も確実な結果は、どの企業も実際に減速したということではなく、最も重要な AI 企業が事前にリスクについて公に話し合ったことです。
モデルの速度は低下していません。
しかし、少なくとも、いつか何かが起こった場合、彼らは「私たちは彼らに警告した」と言うことができます。
コメント