メディアの報道によると、Apple は最近、利用可能な DRAM 容量を超えるデバイス上で LLM (Large Language Model) を実行できる方法を紹介する文書を発表しました。この新しい研究では、2 倍のメモリ サイズで LLM を実行する容量が制限されたデバイスをサポートし、GPU 推論速度を数十倍に高めることができます。同メディアによると、iOS18に生成AIを統合するというAppleの計画が加速する可能性があるという。
この新しい研究では、メモリ使用効率を大幅に向上させることで、容量が限られたデバイスでも 2 倍のメモリ サイズで LLM を実行できるようになり、GPU 推論速度を数十倍に高めることができます。
この論文によると、LLM の集中的な計算とメモリ要件は、DRAM 容量にとって大きな課題です。この論文では、フラッシュ メモリから転送されるデータ量の削減と、よりスムーズなデータ ブロックの読み取りという 2 つの主要な領域で最適化されるフラッシュ メモリ ベースの推論コスト モデルを構築しています。
これは、この画期的な研究が LLM の適用性とアクセシビリティを拡大し、生成 AI を iOS18 に統合するという Apple の計画が加速する可能性があることを意味します。
LLM は携帯電話でも実行できますか?
一般的にDRAMは「メモリ」と呼ばれることが多く、フラッシュ(フラッシュメモリ)はハードディスクのことを指します。
データを計算するとき、CPU は通常、DRAM を「中間ブリッジ」として使用して、ハードディスクからメモリにデータをコピーし、メモリ上でデータ処理を実行します。これにより、速度が何百万倍にも向上します。
しかし、容量の点では、DRAM はハードドライブよりも一桁小さいです。 LLM の実行中は、大量のデータを同時に処理する必要があるため、容量が限られているデバイスにとっては大きな課題となります。
しかし、この論文で提案された新しいフレームワークは限界点を見つけたようです。このフレームワークは、モデル パラメータをフラッシュ メモリに保存し、必要に応じてデータを DRAM に転送するように設計されており、LLM 実行時にデータ処理量が DRAM の空き容量を超える問題を解決します。
具体的には、Apple は主に 2 つのテクノロジーを使用しています。
(1) 「ウィンドウ処理」テクノロジー: 以前にアクティブ化されたニューロンを再利用してデータ送信を削減します。
(2) 「ルート・アンド・ロウ・バンドリング」技術:フラッシュメモリのデータ特性に応じて、データブロックへのアクセス順序をカスタマイズし、フラッシュメモリから読み出すデータブロックのサイズを増加させます。
この論文では、70 億のパラメータ モデルではパラメータを半精度浮動小数点形式でロードするために 14 GB 以上のメモリが必要であり、これはほとんどのネットワーク エンドポイントの能力を超えていると述べています。しかし、このフレームワークを使用すると、データ転送を最小限に抑え、フラッシュ メモリのスループットを最大化することができるため、データ負荷が軽減され、メモリの使用効率が向上します。
研究結果によると、従来のロード方法と比較して、このフレームワークは DRAM の 2 倍のサイズのモデルをサポートし、推論速度を CPU と GPU でそれぞれ 4 ~ 5 倍、20 ~ 25 倍向上させることができます。研究チームは記事の最後で次のように結論付けています。
「この画期的なテクノロジーは、リソースが限られた環境に高度な LLM を導入する場合に特に重要であり、それによって LLM の適用性とアクセシビリティを拡大します。」
携帯電話大手がAIを狙う
AIトレンドのもと、大手携帯電話メーカーは「人工知能+携帯電話」の展開を始めています。
以前の市場ニュースによると、AppleはiOS18にAIを導入し、主にSiriや通信アプリケーションでのインテリジェントな質問応答や文章生成などの機能を導入するとのことです。さらに、Apple は Apple Music、Page、Keynote、Xcode などのアプリケーションにおける AI の可能性も模索しています。
サムスンは 11 月初旬に生成 AI モデル SamsungGauss を発表しました。報道によると、このモデルは2024年初めに発売される携帯電話「Galaxy S24」シリーズに搭載される予定だという。サムスンのラップトップやタブレットにもこのモデルが組み込まれる可能性がある。
GoogleのGeminiモデル(Gemini)もGoogleの製品に統合される予定だ。 11 月、Google は Gemini 1.0 が Google 製品に段階的に導入されることを正式に発表しました。 Gemini Pro は高度な推論と計画のために Bard に統合されます。 Gemini Nano は、Pixel8 Pro スマートフォンの機能のサポートを提供します。