AI×経営戦略10/1(木)STEPQuant、推論メモリを最大68.7%削減中国の研究チームは、線形注意モデルの再帰状態を6ビットで圧縮する量子化手法STEPQuantを開発した。精度をほぼ維持し、同時処理時のサービング総メモリを最大68.7%減らす。
AI×経営戦略6/26(金)LLM量子化、コスト削減に落とし穴AIモデルの軽量化技術「量子化」がメモリ使用量を最大85%削減する一方、推論時間とエネルギー消費を増大させることが実証研究で判明した。企業のAI導入コスト試算に再考を迫る結果である。