世界的な AI コンピューティング能力競争は、大きな技術的転換点を迎えています。先日、Googleが新たなAIメモリ圧縮技術「TurboQuant」を発表し、業界で大きな注目を集めました。この技術により、モデルの精度を犠牲にすることなく、生成AI推論段階で最もリソースを多く消費する「キーバリューキャッシュ」(KVキャッシュ)のスペース要件をオリジナルの1/6に削減し、計算速度を8倍に向上できるとしている。
この画期的なテクノロジーは、メモリ需要が崖から落ちるのではないかという市場全体の懸念も引き起こしました。マイクロン、サンディスク、ウエスタンデジタルなどストレージ関連の米国株が急落した。
TurboQuant とは一体何ですか?
LLM (Large Language Model) 推論プロセス中、長いテキストを処理するために、システムは AI の「ポータブル ノートブック」のような KV キャッシュに過去の会話情報を保存する必要があります。会話の長さが長くなると、このノートブックに保存する必要がある情報がすぐに AI GPU の高帯域幅メモリ (HBM) を圧倒し、AI の動作における最大のボトルネックになります。
Google の TurboQuant テクノロジーの中心的な利点は、従来のメモリ圧縮テクノロジーによって生成される「メモリ ノイズ」 (オーバーヘッド) を解決することです。このテクノロジーは 2 つの重要な部分で構成されています。
PolarQuant (極座標定量化): 従来のベクトルは XYZ 座標でマークされており、操作が煩雑でした。 Google は代わりに、「極座標」ロジックを使用して、複雑な方向を「半径」と「角度」に単純化します。これは、本来「東に 3 キロメートル、北に 4 キロメートル歩く」というラベルが付けられるはずだった情報を、「37 度の角度で 5 キロメートル歩く」に簡略化するようなものです。この幾何学的構造の変換により、データ処理の負荷が大幅に軽減されます。

QJL (Quantized Johnson-Lindenstrauss): これは、非常に合理化された 1 ビットの数学的補正メカニズムです。圧縮プロセスで残留誤差を正確に修正するために追加の 1 ビットのみが使用されるため、モデルが 3 ビットのみに圧縮された場合でも、LongBench などの多くのベンチマーク テストで「精度損失ゼロ」を達成できます。

△Llama-3.1-8B-Instruct モデルでは、TurboQuant は LongBench ベンチマーク テストで強力な KV キャッシュ圧縮パフォーマンスを実証し、さまざまな圧縮方法を上回りました (ビット幅は括弧内に示されています)。
Google は、競争力の中核となったこの一連のテクノロジーを完全にオープンソース化することを選択しました。これにより、Gemini などの大規模モデルの検索効率が最適化されるだけでなく、他の大規模モデルのメモリへの依存が軽減され、エンドサイド AI の開発を加速する道が開かれます。
実際の測定によると、NVIDIA H100 アクセラレータでは、TurboQuant のパフォーマンスが非圧縮ソリューションと比較して最大 8 倍向上し、モデルを再トレーニングせずに直接マウントできます。 AI導入のコスト削減と効率化を実現する「魔法の兵器」ともいえる。

△NVIDIA H100 アクセラレータでは、TurboQuant は、キー/値キャッシュ内のアテンション ロジック値の計算においてパフォーマンスが大幅に向上し、さまざまなビット幅レベルで高度に最適化された JAX ベースラインを上回りました。

△TurboQuant は強力な検索パフォーマンスを示し、さまざまな最先端の量子化ベースラインと比較して、GloVe データセット (d=200) で最高の 1@k 再現率を達成します。
Cloudflareの最高経営責任者(CEO)Matthew Princeらは、TurboQuant Googleの「DeepSeekの瞬間」と呼び、DeepSeekと同様に、結果の面で競争力を維持しながら、極めて高い効率の向上を通じてAIの運用コストを大幅に削減することが期待されると考えている。
メモリ要件は減少しますか、それとも要件が増加しますか?
市場全体のメモリ需要の急激な減少に対する懸念を引き起こした TurboQuant テクノロジーに関して、業界の専門家や研究機関もまったく異なる見解を示しています。
ウェルズ・ファーゴのアナリスト、アンドリュー・ロシャは次のように指摘した。「コンテキスト ウィンドウ(コンテキスト ウィンドウ)がますます大きくなる場合、KV キャッシュの爆発的な成長は、もともとメモリ需要を押し上げる保証でした。しかし、TurboQuant はこのコスト曲線に直接攻撃しています。一度広く採用されると、データ センターのメモリ容量の仕様要件には大きな疑問が残ることになります。」
しかし、著名な投資銀行モルガン・スタンレーと調査機関リンクス・エクイティ・ストラテジーズは全く異なる見解を示した。
モルガン・スタンレーは、「効率の向上が全体の成長を促進する」という経済法則を市場が無視した可能性があると考えている。AI コンピューティングに必要なメモリ コストが元の 1/6 に削減されると、これまではメモリが高価すぎてオンラインにできなかった AI アプリケーション (長いテキストの翻訳、複雑なコード生成など) の需要が大爆発し、代わりに圧縮されたメモリ ギャップを埋めるか、それを超えることになるでしょう。
これはジェボンのパラドックスで、技術の進歩によって資源の利用効率が向上する(1回の使用に必要な量が減る)にもかかわらず、コストの削減によって需要が増加すると、資源の消費速度は低下するどころか増加するというものです。
モルガン・スタンレーのアナリスト、ジョセフ・ムーア氏とそのチームは、木曜日に発表された投資家向けノートの中で次のように述べている:「GoogleのTurboQuantがメモリ使用量をオリジナルの1/6に削減するとの報告があるが、これは彼らが全体的なメモリ使用量ではなくKVキャッシュについてのみ言及していることを無視している。
「GoogleのGemini 3と2.5 Proの両モデルには100万トークンのコンテキストウィンドウがあることは注目に値しますが、GoogleはGemini 1.5 Proを使用して最大1000万トークンのコンテキストウィンドウをテストし、非常に良好な結果を達成したことを明らかにしましたが、推論コストが高かったため、最終的にモデルをリリースしませんでした」とムーア氏は述べた。 「その結果、この種のイノベーションやその他のテクノロジーが登場するにつれてコストが削減され、このテクノロジーはよりスマートでコンピューティング集約型の製品を提供するために使用されると予想されます。」
モルガン・スタンレーはさらに、TurboQuantは主に「トレーニングフェーズ」のモデルの重みではなく、「推論フェーズ」のキャッシュを最適化していると指摘した。したがって、AI コア トレーニングをサポートする HBM (高帯域幅メモリ) 調達ロジックへの影響は比較的限定的です。
対照的に、TurboQuant は、携帯電話やラップトップなどの端末デバイスへの人工知能の展開にとってより意味があります。モバイル デバイスのメモリは限られているため、この種の効率的な圧縮技術により、より強力な AI モデルを携帯電話上で実行できるようになり、さまざまな端末デバイスのメモリ仕様の包括的なアップグレードが促進されます。
Lynx Equity Strategies によると、AI プロバイダーには、トークン コンテキストの長さが増加するにつれて生じる推論のボトルネックに対処するためのイノベーションが必要ですが、供給の制約により、今後 3 ~ 5 年間メモリとフラッシュの需要が減少することはありません。