TACO、30B級LLMを単一GPUで微調整可能に
研究チームが、LLMの全パラメータ微調整でオプティマイザ状態を174分の1に削減する手法TACOを発表した。80GBのGPU1枚で30B級モデルを扱え、調達費の抑制につながる可能性がある。

研究の概要
Jichao Jiang氏らの研究チームは、大規模言語モデル(LLM)の全パラメータ微調整に必要なメモリを大幅に削減する新しい最適化手法「TACO」を、論文公開サイトarXivで発表した。
全パラメータ微調整では、モデルの重みや勾配に加え、AdamWなどのオプティマイザが保持する状態が大量のGPUメモリを占める。この状態量が、1枚のGPUに載せられるモデルの規模を制約してきた。既存の対策は、状態の圧縮、一次勾配の放棄、更新の幾何の変更の三つに大別される。更新の幾何を変える手法でも、密な状態は残る。行列単位で更新するMuonはメモリを抑えられるが、AdamWで事前学習されたモデルを微調整すると、性能が劣化する場合がある。
TACOはMuonの作用素ノルムによる最急降下の考え方を引き継ぎ、さらに推し進めた手法である。次元を正規化した1→1作用素ノルムの下で、厳密な最急降下方向を求める。具体的には、二次元の重み行列の各列について、絶対値が最大の要素の符号だけを選ぶ。更新は三値で、各列に非ゼロ要素が1つだけ残る。一次勾配は保持したまま、永続的な状態は列ごとの少数の低精度勾配成分にとどまる。
OPT-13Bでの実験では、永続的なオプティマイザ状態がAdamW8bit比で174分の1(27.7GBから0.16GB)になった。学習時のピークメモリは2.9分の1(80.6GBから27.5GB)に減り、精度と実行時間は同等だったという。複数のモデルファミリーとタスクで、30〜32B規模のモデルを80GBのH100 1枚で全パラメータ微調整できることも示された。
ビジネスへの示唆
最大の影響は、自社専用LLMの開発に必要なGPU投資の水準が下がり得る点である。従来は30B級の全パラメータ微調整に複数GPUの構成が前提となりやすかった。単一GPUで足りるなら、小規模な計算環境でも着手できる。
機密データを社外に出せない業種で、特に効果が見込まれる。金融機関は融資審査書類や社内規程、医療機関は診療記録の要約、製造業は設備保全記録や技術文書、法務部門は契約書の知識を、それぞれ自社内のサーバー上で学習させる場合である。クラウド上の大規模クラスタに頼らずに済めば、データ管理上の説明も簡素になる。
影響を受ける部署と指標は、次のように整理できる。
- 情報システム・MLOps部門:GPU調達費、学習1回あたりのコスト、同時に回せる実験数
- データサイエンス部門:モデル改良の反復サイクルの短縮、開発リードタイム
- 経営企画・DX推進部門:AI投資の回収期間、内製化比率
精度と実行時間が同等と報告されている点も重要である。メモリ削減が品質低下や学習時間の増加と引き換えでないなら、既存の学習手順を大きく変えずに、コスト面の利点だけを得られる可能性がある。ただし、これらの効果は論文の実験条件に基づく数値であり、自社環境での削減幅は個別の検証が必要である。
今後の展望
本論文は査読前のプレプリントである。評価の中心はOPT-13Bなどの公開モデルとベンチマークであり、業務特化データでの再現性や、より長期の学習での安定性は今後の確認事項である。主要な学習フレームワークへの実装が進むかどうかも、普及の鍵となる。
企業にとっては、すでに自社データでの微調整を検討している部門が、小規模な検証から始める価値がある。メモリ制約で見送っていた30B級モデルの全パラメータ微調整が、現実的な選択肢になるかを見極める段階にある。モデルの大型化が続くなか、計算資源の効率化は、AI活用の費用対効果を左右する要素であり続けるだろう。
関連トピック
同セクションの記事
複数教師の蒸留、学習の落とし穴を解明
複数のRL教師の能力を1つの小型モデルへ統合する蒸留で、損失の平均化方式や数値精度が成果を左右することが判明した。AI開発の品質管理と計算コストに直結する知見である。

OmniSeek、音声映像を能動的に探索
長い音声付き映像から、必要な場面を自ら選んで見聞きする推論AI「OmniSeek」が登場した。映像と音声の両方を根拠とする推論を促し、監視や会議分析の精度向上に道を開く。

ループ型AI、推論精度向上と計算半減を両立
米研究チームが、ループ型Transformerの途中計算を活用し追加学習なしで推論精度を高める手法LoopCDを開発した。ループ数を半減しても同等以上の精度を保ち、演算量を最大48.2%削減した。
