グーグルの研究チームはこのほど、新たなベクトル量子化圧縮アルゴリズム「TurboQuant」を正式に発表しました革新的なPolarQuantおよびQJL技術により、大規模言語モデルの推論過程で必要となるキー・バリュー・キャッシュのメモリ要件を少なくとも6倍削減し、NVIDIA H100 GPU上でアテンション計算の速度を最大8倍向上させると同時に、複数の長文コンテキストに関するベンチマークにおいて精度損失ゼロを実現しています
大規模言語モデルは長文シーケンスを処理する際、アテンション計算を高速化するためにキーとバリューのベクトルから構成されるキャッシュを維持する必要がありますが、コンテキスト長が増加するにつれてこの領域のメモリ消費は爆発的に増加し、推論効率や展開規模の制約となる主要なボトルネックとなっています従来のベクトル量子化手法はデータを圧縮できるものの、量子化定数を別途保存する必要があり、その分のメリットが一部相殺されてしまうという課題がありました
TurboQuantは、2段階のトレーニング不要な圧縮フレームワークを採用することで、この問題を巧みに解決しますまずPolarQuantによる極座標角度圧縮を施し、ベクトルをランダムに回転させたうえでデカルト座標を極座標形式へ変換することで、従来の量子化に必要な境界正規化のための追加メモリを不要にします続いてQJL 1ビット誤り訂正技術を用い、ジョンソン–リンデンストラウス変換による次元削減と極めて簡潔な符号による量子化を実施さらに、バイアスのない推定器を活用してアテンションスコアの算出時に余分なメモリ負荷を伴わない誤差補正を行いますこれら二つの技術を組み合わせることで、TurboQuantはキー・バリュー・キャッシュを約3ビット相当まで圧縮しつつ、内積推定のバイアスフリーかつ高精度な特性を維持できます
グーグルチームによるGemmaやMistralなどのオープンソースモデルでの検証結果では、TurboQuantはLongBenchをはじめとする長文コンテキストタスクにおいて総合的に優位性を示し、検索タスクにおいては完璧な下流スコアを達成するとともに、メモリ圧縮率を少なくとも6倍に引き上げています本技術はモデルの再訓練や微調整を必要とせず、既存の大規模言語モデルにそのまま適用可能であり、vLLMやTensorRTといった主流の推論フレームワークへの統合が期待されていますこれによりAIの導入コストが大幅に削減され、長文コンテキスト向けアプリケーションの実装が加速することが見込まれます