LeapQuant、線形注意の推論を1.47倍高速化
米UCバークレー校などの研究チームが、線形注意型LLMの再帰状態を8ビットに量子化しても精度を保つ手法LeapQuantを開発した。長文推論の費用を下げ、実運用の採算改善に資する成果である。

研究の概要
近年の大規模言語モデル(LLM)では、標準的な注意機構の一部を線形注意に置き換えた混合設計が広がっている。Gated DeltaNet(GDN)やKimi Delta Attention(KDA)がその代表例である。線形注意は過去の文脈を固定サイズの再帰状態に圧縮するため、長文処理の計算量を大幅に抑えられる。一方で、この状態を推論のたびに読み出して更新する処理が、新たな性能上の制約となっていた。
状態を低ビット化すれば負荷は減るが、従来は品質の劣化が避けられなかった。原因は、丸め誤差がトークンごとに累積することと、状態内の一部の行や列に外れ値が存在することの二点にある。
LeapQuantは追加学習を必要としない手法で、二つの工夫で課題に対処する。第一に、ウィンドウ単位の量子化である。複数トークンを飛び越え、ウィンドウの末尾でのみ状態を量子化する。ウィンドウ内の出力は、固定された低ビット状態と、高精度で保持した更新分から計算する。これにより誤差の累積を抑える。
第二に、個々の量子化で生じる誤差の低減である。状態の大きな外れ値を「補償トークン」と呼ぶ少数の高精度要素として保持し、通常のトークンと同じ更新経路に載せる。残る成分は量子化の前に平滑化する。
Qwen、Kimi、GLMの各モデル群で評価した結果、8ビット量子化でもFP32基準と同等の精度を維持した。速度はカーネル単位で平均2.05〜3.70倍、エンドツーエンドの推論で1.47倍に向上した。測定にはNVIDIAのB200、RTX PRO 6000、RTX 5090を用いている。
ビジネスへの示唆
最大の恩恵を受けるのは、長文入力を大量に処理する業務である。法務部門の契約書レビュー、金融機関の有価証券報告書や決算資料の分析、コールセンターの長時間通話記録の要約などが該当する。こうした用途では、推論コストとレイテンシーがそのまま業務のKPIに直結する。
注目すべきは、速度向上が最上位のデータセンター向けGPUに限られない点である。RTX 5090のような消費者向けGPUでも効果が確認されており、自社サーバーやオンプレミス環境でLLMを運用する企業にとって、導入の敷居を下げる材料となる。機密性の高い医療記録や社内文書を外部に出せない医療・製造業でも、現実的な選択肢が広がる。
影響が見込まれる主な指標は次のとおりである。
- 1リクエストあたりの推論コスト(GPU時間)
- 応答レイテンシーと同時処理可能なユーザー数
- 状態保持に要するGPUメモリ使用量
端到端で1.47倍の高速化は、同一のハードウェアで処理件数を増やすか、必要なGPU台数を減らすかの選択を可能にする。クラウド利用料を抑えたいAI基盤部門やIT部門にとって、投資対効果の試算に直接使える数値である。
また、追加学習が不要である点も実務上重要である。既存の公開モデルに後付けで適用できるため、モデルの再学習に伴う費用や検証工数が発生しない。ただし、自社業務の固有データでの精度確認は、導入前に欠かせない。
今後の展望
線形注意を採用するモデルが増えるほど、再帰状態の効率化の価値は高まる。今後は推論エンジンへの統合が進むかが焦点となる。本研究の評価は現時点で特定のモデル群とGPU世代に限られており、より低いビット幅への拡張や、エージェント型の長時間対話のような状態が長く保持される用途での検証が課題として残る。
AIの運用費が事業採算を左右する局面が増えるなか、精度を保ったまま推論を軽くする技術は、導入拡大の実質的な鍵を握るとみられる。企業は、モデルの性能だけでなく推論効率の観点からも選定基準を見直す時期に来ている。
関連トピック
同セクションの記事
衛星画像の作物識別、新モデルが精度で先行
英研究チームは衛星画像の時系列から作物を区分けする新モデル「PAtteRNS」を開発した。主要データで既存手法を上回り、区画境界の精度も高い。データ設計の欠陥も指摘した。

STEPQuant、推論メモリを最大68.7%削減
中国の研究チームは、線形注意モデルの再帰状態を6ビットで圧縮する量子化手法STEPQuantを開発した。精度をほぼ維持し、同時処理時のサービング総メモリを最大68.7%減らす。

生成AIの意味確定と非局所性が同時期に発生
生成モデルで意味クラスが確定する時期と、局所的な文脈だけでは生成できなくなる時期が重なる理由を、理論的に証明した研究が登場した。モデル設計や推論効率の指針となる。
