要約:
一部の大手人工知能企業は、2028 年を目標に、1,000 億パラメータの大規模言語モデルを継続的に実行できるデバイスの開発を携帯電話業界に奨励しています。しかし、このアイデアは 2 つの実際的な課題に直面しています。1 つ目は、このような大規模なモデルを実行するには大量のメモリが必要であること、2 つ目は、人工知能データセンターが世界的なメモリ生産能力をめぐって競争しているため、消費者向けメモリの供給が逼迫し、価格が上昇し続けることです。

クアルコムの CEO であるエイモン氏は、Fireside Alpha とのインタビューで、人工知能業界の最前線にある一部の企業が、数千億のパラメータ モデルを継続的に実行できる携帯電話を検討していると述べました。同氏はこれらの企業の具体的な名前は明らかにしなかったが、関連する声明は、モバイルデバイスに対する人工知能企業の期待が変化していることを示している:将来、携帯電話はもはやクラウドAIサービスを時々呼び出す単なる端末ではなく、大規模なモデルをローカルで継続的に実行し、タスクをアクティブに処理できるパーソナルコンピューティングデバイスになる可能性がある。
しかし、Amon の声明は、クアルコムが公式に発表した製品ロードマップではなく、業界の顧客が提案した目標を説明するものでした。現時点では、クアルコムは 2028 年にこの目標を達成できる完全なハードウェア ソリューションをまだ提供しておらず、それまでに対応する機能を備えた商用携帯電話を発売するという約束もしていません。
技術的な観点から見ると、1,000 億パラメータ モデルは、現在一般的なオンデバイス AI モデルよりも携帯電話ハードウェアに対する要件がはるかに高くなります。大規模な言語モデルのパラメーターによって、モデルが保存して呼び出す必要がある多数の値が決まります。通常、これらのデータは、プロセッサが推論中にすぐにアクセスできるようにメモリに保存する必要があります。
例として、1,000 億個のパラメータを持つモデルを取り上げます。 4 ビット量子化が使用される場合、各パラメーターは理論的には 4 ビットのストレージのみを必要とするため、モデル パラメーター自体のみで約 50GB のメモリが必要になります。実際の操作では、オペレーティング システム、他のアプリケーション、コンテキスト キャッシュ、推論中の一時データ用のスペースも予約する必要があります。したがって、50 GB は、モデルをスムーズに実行するために携帯電話に必要な全メモリ容量ではありません。
モデルがさらに 2 ビットに量子化されると、各パラメーターに必要なのは 2 ビットのみとなり、モデル パラメーターの理論上のストレージ要件は約 25GB に削減できます。ただし、このソリューションでも携帯電話には現在の主流製品をはるかに超えるメモリ容量が必要であり、非常に低精度の量子化により、特に複雑な推論タスクにおいて、モデルの出力品質が著しく損なわれる可能性があります。
パラメータの数がモデルの全機能を直接決定するわけではないことに注意してください。さまざまなモデルのトレーニング データ、アーキテクチャ、トレーニング方法、推論テクニックはすべて、最終的なパフォーマンスに影響します。特定のタスクに関しては、小規模で最適化されたモデルが大規模なモデルよりも優れたパフォーマンスを発揮する可能性は十分にあります。したがって、当面は携帯電話機が1000億パラメータモデルを直接実行できないとしても、大型モデルに近い実際の使用体験を提供できないわけではない。
現在、スマートフォンのメモリ構成と、数千億のパラメータ モデルに必要な容量との間には、依然として明らかなギャップがあります。過去には、一部の Android フラッグシップ携帯電話には 24GB LPDDR5X メモリが搭載されていました。しかし、メモリの供給不足と価格の高騰により、携帯電話メーカーは高メモリ バージョンの商品価値を再評価し始めました。一般の消費者にとって、メモリ容量の増加はハードウェアのコストの増加を意味し、携帯電話メーカーにとっては、ユーザーが大規模なローカル AI モデルの実行に追加料金を支払う意思があるかどうかを判断するのは困難です。
これは矛盾を生み出します。人工知能企業は、携帯電話にますます強力なローカル コンピューティング機能が搭載されることを望んでいますが、この目標を達成するために必要なメモリはより高価になり、入手が困難になりつつあります。
世界的なメモリ供給は逼迫しており、これは人工知能データセンターの急速な拡大と密接に関係しています。大手テクノロジー企業は、大量の DRAM、高帯域幅メモリ、高速ストレージ デバイスを必要とする AI サーバーへの投資を続けています。メモリメーカーも、生産を手配する際に需要が高く利益が高い人工知能関連製品にますます注目している。したがって、家庭用電子機器に必要な従来のメモリは供給圧力にさらされています。
スマートフォンに使用される低電力 DRAM と AI アクセラレータに使用される高帯域幅メモリは、製品構造や製造要件が異なりますが、依然として半導体業界全体の生産能力の割り当てや市場の需給の変化の影響を受けます。 AIインフラストラクチャからのメモリ需要が高まるほど、家電メーカーが価格と供給の面で以前の状況を維持することが難しくなる。
この圧力は携帯電話の製造コストに反映されています。市場調査会社カウンターポイント・リサーチが以前に発表した分析によると、2026年第2四半期にはスマートフォンのメモリ価格が前四半期から80%以上上昇した。さまざまな価格帯の携帯電話の間では、メモリのコストの上昇が全体の材料コストに大きな影響を与えています。
カウンターポイントは、ミッドレンジ携帯電話の部品表コストが前年比約 52% 増加し、メモリが部品表コスト全体の約 40% を占めていると指摘しました。ハイエンド携帯電話も影響を受けており、一部の主力携帯電話ではDRAMがシステムレベルのチップを超えて最も高価な単一コンポーネントとなっている。
これは、携帯電話メーカーが 1,000 億のパラメータ モデルに 50 GB 以上のメモリを構成できるかどうかを検討する必要があるだけでなく、より現実的な質問、つまり消費者はこれらのメモリにお金を払うつもりか? にも答えなければならないことを意味します。
大規模なモデルを実行するだけの場合、携帯電話のメモリを現在一般的な 12GB または 16GB から 64GB 以上に増やす必要があり、マシン全体のコストが大幅に増加する可能性があります。より強力なプロセッサー、高度なパッケージング、熱設計と相まって、最終製品の価格は一般消費者が受け入れられる範囲からさらに遠ざかる可能性があります。
クアルコムとアップルは、チップ アーキテクチャとパッケージング技術の観点からこの問題を軽減しようとしています。関連レポートによると、Apple A20 Proとクアルコムの新世代Snapdragonフラッグシッププラットフォームは、データアクセス効率を向上させ、プロセッサとメモリ間のデータ転送オーバーヘッドを削減することを期待して、大規模モデルの動作にさらに役立つチップ設計とメモリ構成方法を模索しているとのこと。
ただし、カプセル化とデータ アクセスの効率が向上しても、物理メモリ要件が自動的になくなるわけではありません。プロセッサがメモリをより効率的に利用できる場合でも、1,000 億パラメータ モデル自体は依然として大量のパラメータ データを保存する必要があります。この規模のモデルを携帯電話に真に適応させるには、業界はモデル圧縮、推論アーキテクチャ、ストレージ アクセスにおいてさらなる進歩を遂げる必要があるかもしれません。
考えられる解決策の 1 つは、より根本的な定量化テクノロジーです。パラメーターごとに使用されるビット数を減らすことにより、モデルをより小さなメモリ空間で実行できます。ただし、定量化にはコストがかかります。複雑な論理的推論を必要とするタスクの場合、数値精度が低すぎるとモデルのパフォーマンスが大幅に低下する可能性があります。したがって、メモリ使用量とモデルの品質のバランスをどのように取るかが、エンドサイド AI の重要な研究方向になります。
もう 1 つのソリューションは、MoE アーキテクチャであるハイブリッド エキスパート モデルです。推論ごとにモデル全体を呼び出す必要がある従来の集中型アーキテクチャとは異なり、MoE モデルは、特定のタスクに基づいて計算に参加するエキスパート ネットワークの一部を選択します。適切に設計すれば、トークンが処理されるたびにアクティブ化する必要があるのは、モデル内の少数のパラメーターのみです。
エキスパート オフロード テクノロジをさらに採用すると、システムは現在必要なエキスパートを DRAM に保持し、不要なエキスパートをフラッシュ メモリに一時的に保存できます。推論プロセスに他の専門家が必要な場合、関連するデータがフラッシュ メモリからメモリに読み込まれます。
このアプローチでは、モデルが DRAM に常駐する必要があるデータの量を同時に削減できますが、ストレージ アクセスとデータ転送のオーバーヘッドが増加します。携帯電話に使用されるUFSフラッシュメモリは、アクセス速度や遅延特性がDRAMとは大きく異なります。モデルがフラッシュ メモリからパラメータを頻繁に読み取る場合、推論速度に影響が出る可能性があります。
Apple は以前、デバイスの内蔵ストレージを使用して大規模な言語モデルを実行するソリューションを研究しました。このタイプの技術は、DRAM 容量への依存を軽減すると期待されていますが、携帯電話で十分な低遅延、高スループット、許容可能なエネルギー消費を実現できるかどうかについては、さらなる検証が必要です。
さらに、大型モデルを継続的に実行すると、熱放散やバッテリー寿命の問題も発生します。携帯電話の内部スペースは限られており、デスクトップコンピュータやサーバーのような大規模な冷却システムを搭載することができません。プロセッサーが高強度の AI 推論を長時間実行すると、チップ温度が上昇し続け、その後周波数低減メカニズムがトリガーされ、パフォーマンスが低下する可能性があります。
この問題は、24 時間体制で動作する必要があるエージェントにとって特に深刻です。従来のチャットボットは通常、ユーザーがリクエストを行った後にタスクの処理を開始しますが、新世代の AI エージェントは継続的に情報を監視し、コンテキストを分析し、適切なタイミングで積極的に操作を実行する必要がある場合があります。電話機で大型モデルを 24 時間稼働させる必要がある場合は、メモリを常に利用できる必要があるだけでなく、プロセッサの電力消費とバッテリ消費も厳密に制御する必要があります。
したがって、将来の携帯電話が 1,000 億のパラメータ モデルを正常にロードできたとしても、それは理想的な速度で動作し続けることができるという意味ではありません。モデルが本当にメモリに常駐できるかどうか、1 秒あたりに処理できるワード数、動作中に発生する熱の量、バッテリー寿命に与える影響などはすべて、実際の使用価値を測定するための重要な指標です。
1,000 億のパラメータ モデルを携帯電話に直接接続する場合と比較して、より現実的な解決策は、抽出され最適化された中規模のモデルを実行することかもしれません。
モデルの抽出では、通常、大規模なモデルの機能を利用して小規模なモデルをトレーニングします。これにより、後者はパラメータのスケールを大幅に削減しながら、特定のタスクにおいて大規模なモデルのパフォーマンスを可能な限り維持できます。 Wccftech は、適切に抽出された 200 億から 300 億のパラメータ モデルは、特定のタスクでは 1,000 億のパラメータ モデルのパフォーマンスに近づく可能性があり、したがって将来のスマートフォンにおけるローカル AI の主力となるのに適していると考えています。
このソリューションの利点は、非常に大きなメモリ容量に依存する必要がなく、非常に強力な推論機能を提供できることです。携帯電話メーカーにとって、単にいくつのパラメータを収容できるかを追求するのではなく、モデルのアーキテクチャ、定量化、蒸留、推論の最適化を通じて、限られたハードウェア リソースでより良い実際のエクスペリエンスを達成する方が良いと考えています。
もちろん、モデルによってパフォーマンスは大きく異なり、すべてのタスクにおいて 200 ~ 300 億のパラメーター モデルが 1,000 億のパラメーター モデルを置き換えることはできません。複雑な推論、専門知識、長いコンテキストの処理などの機能は、依然として特定のモデルのトレーニングとアーキテクチャ設計に依存しています。しかし、製品化の観点から見ると、日常的なタスクのほとんどを妥当な消費電力とコストで完了できることの方が、純粋なパラメータスケールを追求するよりも価値があるかもしれません。
クアルコム CEO の声明は、スマートフォン業界が新たな成長の方向性を模索していることも反映しています。従来のハードウェア アップグレードの限界的なメリットが徐々に減少する中、携帯電話メーカーは AI エージェントを使用してデバイスの使用方法を再定義したいと考えています。
将来のスマートフォンは、もはやユーザーがアプリケーションを開いてコマンドを入力するのを待つだけのデバイスではなく、ユーザーの承認の範囲内で継続的にニーズを理解し、タスクを調整し、さまざまなサービスを呼び出すことができるパーソナルアシスタントになる可能性があります。このようなシステムには、より強力なローカル推論機能に加えて、より効率的なメモリ管理、低電力コンピューティング、およびセキュリティ メカニズムが必要です。
しかし、業界の目標と最終製品の間にはまだ距離があります。エーモンは具体的なパートナー企業の名前を公表しておらず、完全なハードウェアのロードマップや量産スケジュールも明らかにしていない。 2028 年は、クアルコムが認めた製品リリース日というよりも、一部の AI 企業がこの機能の実現を望んでいる目標時期として理解するのが適切です。
現在の技術状況から判断すると、2028 年に携帯電話で数千億のパラメータ モデルを実行することは完全に不可能ではありませんが、その実装方法は、人々が想像する「完成したモデルをすべて携帯電話のメモリに読み込む」というものとは異なる可能性があります。より積極的な量子化、MoE アーキテクチャ、エキスパート オフロード、専用メモリ設計、およびモデルの蒸留はすべて、目標達成の一部となる可能性があります。
同時に、世界的なメモリの供給と価格の傾向は、この方向の商業的な実現可能性に直接影響します。消費者向け DRAM の供給が AI データセンターによって長期間にわたって圧迫されれば、64GB 以上のメモリを搭載した携帯電話の製造が技術的に可能であっても、メーカーはそのような製品を大規模に発売することに消極的になる可能性があります。
したがって、1,000 億パラメータの携帯電話というクアルコムのビジョンは、チップのパフォーマンスだけでなく、モデルのサイズ、メモリ容量、製造コスト、放熱、バッテリー寿命、消費者の需要の間の包括的なバランスの面でも解決する必要があります。一般のユーザーにとって、将来最も注目すべきことは、携帯電話が 1,000 億個のパラメータを持つモデルを実行できるかどうかではなく、価格を大幅に上げたり、バッテリー寿命を大幅に犠牲にしたりすることなく、信頼性が高く、高速で、本当に役立つローカル AI サービスを提供できるかどうかかもしれません。
コメント