ソラは人工知能の世界で新年の「王様」になった。 OpenAIは2月16日、テキストだけで動画を自動生成できるSoraラージモデルをリリースした。これは、テキスト モデル ChatGPT およびイメージ モデル Dall-E に続く、もう 1 つの非常に破壊的な大型モデル製品です。
テキストで生成されたビデオは、Sora から始まったわけではありません。不完全な統計によると、昨年末の時点で、Runway、Pika、StableVideoDiffusion を含む 20 以上の同様の製品が世界中で出現しました。しかしSoraの登場が革命的な衝撃をもたらしたのは間違いなく、その優れた性能はほぼ類似製品を「潰す」レベルに達していた。
OpenAIがSoraを立ち上げた後、中国と米国の間のAI格差はどのように進化するのでしょうか?この一歩は「自然の溝」なのか、それとも「接近した一歩」なのか?
ソラ
破壊的な「世界モデル」
AIの差は広がるのか?
ソラが示した破壊性は多面的に反映されています。直接出力できる映像は最長60秒で、複雑かつ繊細な背景環境、ダイナミックで変化に富んだカメラの動き、多彩なキャラクターの演技、ワンショットから最後までのシームレスなドッキングや複数のカメラの切り替えなどが映像に含まれています。キャラクターの微妙な表情の変化から、動物の鮮やかな姿勢シミュレーションまで、偽物と本物に見えるだけで十分です。
OpenAIが公開した動画では、おしゃれな女性が騒がしく賑やかな東京の街を歩いている。背景の建物、街路、ポートレートはすべて高度な一貫性を維持しています。さまざまなショットのモンタージュでも、明らかな歪みはありません。
Sora によって生成されたビデオは、光、影、色の変化、カメラの動き、さらにはテクスチャ構造の微妙な変化に至るまで、高品質であるとコメントする人もいます。現実世界の物理法則をシミュレートすることもできます。例えば、「一杯のコーヒーの中で激しい戦いを繰り広げる二隻の海賊船」という動画では、コーヒーの流体力学やリアルな光と影の描写だけでなく、レイトレーシングやチルトシフト撮影技術などを強力なスキルで使っています。
OpenAIは「Soraは現実世界のモデルを理解してシミュレーションできる基盤となる。この機能は汎用人工知能(AGI)実現の重要なマイルストーンになると信じている」と強調した。
Sora の出現は、中国と米国の間の AI 格差がさらに拡大しているかどうかについての激しい議論を引き起こしました。 360社の周宏宜氏は、国内の大型モデルの開発レベルはGPT-3.5に近いものの、GPT-4.0と比べるとまだ1年半程度の差があると指摘した。
Zhou Honyi 氏は、OpenAI にも未公開の秘密兵器がある可能性があると考えています。 「中国と米国の間のAI格差は依然として拡大している可能性がある。」
同時に、業界関係者の多くは、中国と米国のAI開発における根本的な違いは技術自体にあるわけではないのではないかと述べた。
OpenAI
データは「秘密兵器」です
ゲームエンジンが鍵になるかも
「IT Times」の記者は、OpenAI が発表した技術レポートによると、Sora の強力な機能は 2 つの点に起因していると指摘しました。1 つは、Transformer ベースの拡散モデル (DiffusionModel) の使用です。もう 1 つは、さまざまな種類のビジュアル データを統一フォーマット、つまりピクセル パッチ (パッチ) に変換することで、大量のデータを優れた品質とコスト効率の高いコンピューティング能力で利用できるようにすることです。
OpenAIは技術報告書の中で、トレーニングソースや具体的な詳細については明らかにしていない。業界関係者は、Sora の成功にはデータが最も重要な要素の 1 つである可能性が高いと考えています。
「重要な点は、OpenAI が十分なデータを持っているということだと思います。」 LogenicAIの共同創設者であるLi Bojie氏は、OpenAIが生成モデルの分野でブレークスルーを達成できる主な理由は、データの質と量における大きな利点にあると「IT Times」記者に語った。
浙江大学の百人才能プログラムの研究者で博士指導者の趙君博氏も本紙のインタビューで、ソラがトレーニングにどのようなデータを使用したかについては、サークル内では依然として異なる意見があると述べた。ゲーム エンジンによって生成された大規模なデータが使用されているのではないかと推測されています。「この種のデータはゲーム エンジンから吐き出される可能性がありますが、それがどのように収集され、どのように生成および処理され、最終的にパイプライン化された事前トレーニングのためにどのように Sora に供給されるのかは実際にはわかりません。」
OpenAIは、Sora版『Minecraft』の20秒間のデモビデオを2本公開した。研究者が「Minecraft」(「Minecraft」ゲーム)という単語を含むプロンプトをソラに提供すると、ソラは「Minecraft」ゲームに非常によく似た HUD、高忠実度のレンダリング ワールド、およびゲーム ダイナミクスをレンダリングし、プレイヤー キャラクターを制御することもできます。
昨年8月にOpenAIが史上初の買収を正式に発表したことは注目に値する。買収対象となったのは、オープンソース版「Minecraft」を制作するスタートアップ企業Globalilluminationだった。 Li Bojie氏は、Sora版「Minecraft」の実証結果から判断すると、OpenAIによるGlobalilluminationの買収がSoraのデータ蓄積に一定の貢献をしたのではないかと推測した。
コンピューティング能力の点では、Sora モデルのトレーニングに OpenAI が使用する GPU カードの数は比類のないものではありませんが、十分なハードウェア リソースがあれば、他社が OpenAI の成功を再現することは依然として困難です。主なボトルネックは、大規模で高品質のビデオ データを取得して処理する方法にあります。
「IT Times」の記者は、OpenAI が Globalillumination の買収と同時に、AI モデルをトレーニングする革新的な方法を発表したことに注目しました。これにより、大量のデータにラベルを付けるトレーニング プロセスが節約されることが期待されています。
当時、OpenAIが発表したVPT「ビデオ事前トレーニングモデル」により、AIは『Minecraft』で石のツルハシをゼロから構築することを学習できるようになった。当初、このプロセス全体は、ハードコア プレーヤーが完了するまでに少なくとも 20 分かかり、合計 24,000 回の操作が必要でした。研究者らはまず、キーボードやマウスの操作のビデオや記録を含む、アウトソーシング業者のゲームプレイデータに注釈を付けるために大量のデータを収集した。次に、これらのデータを使用して逆ダイナミクス モデル (IDM) を作成し、ビデオの各ステップでキーボードとマウスがどのように動くかを推定します。
このようにして、タスク全体がはるかに単純になり、目標を達成するために必要なデータが以前よりもはるかに少なくなります。この研究は 2022 年 6 月に発表され、記事ではこの研究が 1 年間実施されたとも述べられています。つまり、OpenAI は少なくとも 2021 年からこの研究を実施していることになります。
「世界で最も大量のデータを保有する Google のような企業でさえ、大規模なモデルをトレーニングする場合、必ずしも OpenAI よりも優れたトレーニング データを持っているとは限りません。」一方で、国内企業ではデータの蓄積や活用においてまだ一定の格差がある可能性がある。Li Bojie 氏は、OpenAI の先行者利益が初期のデータ障壁を決定し、後から市場に参入する企業が追いつくのをより困難にしていると考えています。
一方で、後発企業は、ポリシーの変更やその他の制限により、以前は利用可能であった一部の重要なデータを取得できなくなる可能性があります。その一方で、AI によって生成されたコンテンツがインターネットにますます氾濫するにつれて、元の実世界のデータが「汚染」され、高品質で偏りのないトレーニング データを取得することがますます困難になっています。
これは GPT-4 の状況と似ています。その成功は強力なコンピューティング能力のサポートと切り離すことができませんが、核となる競争上の優位性は依然として大規模で高品質のデータ セットです。他の多くの企業は、十分なコンピューティング リソースを持っていたにもかかわらず、同じサイズと品質のデータ セットを構築して活用する際に課題に直面しており、そのため同様の最先端のモデルをタイムリーにフォローアップすることができませんでした。
国産AI
大きなテキスト モデルで大きな進歩が見られました
大規模なマルチモーダル モデル間には大きなギャップがある
OpenAIは技術レポートの中で、Soraが複雑なシーンの物理を正確にシミュレートするのが難しい可能性があることを認めた。原因と結果の関係を理解していない可能性があります。また、キューの空間的な詳細が混乱する可能性もあります。特定のカメラの軌跡をたどるなど、時間の経過とともに発生するイベントを正確に記述するのが難しい場合があります。
「Sora は本質的に比較的小規模なモデルです。」 Li Bojie 氏は、Sora の出現のより大きな意義は、世界モデルの構築の重要性を証明し、業界に正しい研究の道筋を示すことであると考えています。ただし、将来の開発トレンドは依然として GPT-5 のようなエンドツーエンドのマルチモーダル大規模モデルに向かっており、複雑なプロットやロジックを含むコンテンツをよりよく理解して生成できます。
李伯潔氏は「ITタイムズ」記者に対し、国内外の大規模AIモデル開発における現在のギャップは主にマルチモーダルモデルの開発に反映されていると語った。中国では、一部の企業がテキスト モデルで GPT-3.5 のレベルに到達、またはそれを超える目覚ましい成果を上げており、GPT-4 に追いつくために懸命に取り組んでいます。これは、単一のテキスト処理分野における国内企業の進歩の強さとスピードを示しています。
しかし、マルチモーダルモデルの研究開発に関しては、大型モデルの開発に注力している多くの国内企業は、マルチモーダル技術の重要性を十分に認識しておらず、関連する研究開発に十分な人的資源、物的資源、資金的資源を投資していない可能性があります。Li Bojie 氏は、市場は一般に GPT-4 などのテキスト モデルのパフォーマンスが優れていると信じているため、テキスト処理に重点を置き、マルチモーダル モデルの構築と開発を無視していると考えています。
さらに、国内企業はイノベーションの道を探る際に、コンピューティング能力や人材密度の制約など、リソースの制約を受ける可能性があります。膨大なコンピューティングリソースと優秀な人材が集中しているOpenAIなどの欧米企業と比較して、中国企業は独自のイノベーションにおいて大きな課題に直面している。したがって、国内企業は国際リーダーの実証済みの技術ルートをたどる傾向があります。この戦略は比較的堅牢かつ効率的であり、技術的なギャップを急速に縮めることができます。
位置合わせ
外国製の大型モデルは値段が高すぎる
国内の応用シナリオはチャンスです
業界の多くの人々は、Sora は基礎となる基本的な技術原則の点で大きな進歩を遂げていないと考えています。 GF Securitiesの分析によると、Soraは、暴力の美学のもとでのもう一つの重要な「量的変化」である同じ技術原則に基づいたChatGPTに似ていると理解されるかもしれない。
Zhongke Deep Intelligence の創設者兼 CEO である Cheng Weizhong 氏はメディアのインタビューで、Sora アルゴリズムは重要性の点で大きな進歩ではないと述べた。一方では、Sora は極端な暴力的な美学を使用し、フレーム間のタイミングの一貫性の問題を解決するために大量のコンピューティング能力を使用します。つまり、Sora では、拡散モデルを使用して同じフレームの生成を解決するだけでなく、フレーム間のタイミング生成を解決するためにも拡散モデルを使用します。これにより、Sora のビデオ生成コストは短期間では削減できないことがわかります。 「錯覚」問題を解決する能力がなければ、真に制御可能で使用可能なビデオを生成するには、短期的には非常にコストがかかることになります。
こうした制限は、後発企業にとってはチャンスとなる可能性もあります。
「今と同じように、GPT-4 が最も強力であることに誰もが同意しますが、実際に会社を立ち上げてみると、GPT-4 は高すぎるため、数日間は使い続けることができないことがわかります。そのため、社内で実際に使用しているモデルのほとんどは GPT-4 ではないか、オープンソースの大型モデルを使用しています。7B が使用できる場合は 70B は必要ありません。70B が使用できる場合は GPT-4 は必要ありません。価格の違い100 倍以上になる可能性があり、コストは非常に重要な要素です。」李伯傑氏が明らかにした。
その言葉の通り、GPT-4 は強力ですが、実際にはコストが大きな問題となっており、企業は実際のアプリケーションにおいて、オープンソース モデルや小規模な商用モデルなど、よりコスト効率の高いソリューションを選択するよう促されています。 Sora ビデオの生成に関して、Li Bojie 氏は、ビデオのコストは数ドルから数十ドルの範囲であると見積もっています。一般に普及するには、コストを現在のレベルの 1% まで下げる必要があります。生成品質と論理的一貫性を向上させながらコストを削減することは、早急に解決する必要がある重要な課題です。
実際、AI テクノロジーの発展に伴い、コンテンツ制作のあらゆる側面が影響を受け始め、大きな変化を遂げています。
Mixlab Unbounded Community のプロダクト マネージャーであり、ComfyUI 中国語愛好家コミュニティの創設者である PM Xiong 氏は、IT Times の記者に対し、地元市場のニーズに応えて、Baidu Wenxinyiyan などの国内で開発された大規模な事前トレーニング モデルは、普遍的なアプリケーション シナリオを満たす上で非常に優れた実用性を示していると語った。しかし、複雑なニーズに対応する場合、海外大型上位モデルとのギャップは依然としてある。ただし、既存の制作ツールのニーズのほとんどについては、特にアプリケーション シナリオが徐々に豊富になり、大規模な国産モデルの実装が加速しているため、現在のオープンソース モデルと国内商用モデルは、基本的に使用可能で満足のいくサービスをすでに提供できます。
首相のアンクル・シオン氏は、昨年上半期、AIはコンテンツ制作において一部の単純な吹き替え作業のみを行っており、低品質の映画やテレビの解説の大量制作などの場面でAIが利用されていたことに気づいた。しかし、下半期にはアニメーション作品の描き直しなど、コンテンツ制作の重要な部分にAI技術がさらに浸透しました。通常のチームは、作品の品質を向上させ、制作コストを削減するために AI テクノロジーを使用し始めました。一方で、映画やテレビ業界では AI ベースの分析ツールや補助ツールが徐々に普及しており、本来のクリエイティブ プロセスが変化し、プロの映画やテレビ作品が AI 生成を通じてコストを削減し、制御性を向上できるようになりました。
このプロセスにおいて、オープンソース コミュニティの力を過小評価することはできません。 Xiong Shu首相は、OpenAIのモデルの一部は完全なオープンソースではないものの、その研究結果や論文発表は世界の科学研究チームやオープンソースコミュニティに大きなインスピレーションを与えていると指摘した。同様の機能や技術的な詳細を含む論文が公開されると、多くのオープンソース チームや開発者がモデルのオープンソース バージョンをすぐにフォローアップし、再現し、改善し、リリースすることになります。たとえば、GPT シリーズの成功により、多くのオープンソース プロジェクトが同様の言語モデルを構築するようになりました。継続的な最適化と反復の後、これらのモデルのパフォーマンスは、特定の特定のタスクに関しては、クローズドソースの高度なモデルに徐々に近づいたり、それに匹敵したりする可能性があります。
Li Bojie 氏はまた、汎エンターテイメント アプリケーションの分野では、国内企業が豊かな生態系とアプリケーション シナリオを活用することでアプリケーション レベルで追いつくことができ、海外に進出することで市場を拡大する機会があると考えています。