LESSERがデータ選別の計算費用を削減
大規模言語モデルの追加学習用データを選ぶ際、出力層の勾配だけで全勾配に近い性能を保てることが判明した。特徴抽出の演算量はSFTで9.7分の1に減り、AI開発費の抑制に直結し得る。

研究の概要
大規模言語モデルの追加学習(ポストトレーニング)では、どのデータを使うかが下流タスクの性能を大きく左右する。有力な手法の一つが勾配ベースのデータ選択であり、少量の検証用データと勾配の向きが近い学習データを優先して採用する。ただし、全パラメータの勾配を求めるには候補データ一件ごとに逆伝播が必要である。候補が膨大になると計算が現実的でなくなることが課題であった。
Lyuxin David Zhang氏らの研究チームは、出力層の勾配だけでもデータ選択に十分有効であることを見いだした。出力層の勾配は順伝播の計算だけで得られるため、費用が小さい。これを既存の選択手法に組み込める差し替え型の仕組みとして実装したのが「LESSER」である。特徴抽出に要する演算量は、教師あり微調整(SFT)の評価で9.7分の1、強化学習(RL)の評価で3.0分の1に減った。下流タスクの性能は、全勾配を用いた場合に近い水準を保ったという。
注目されるのは、出力層勾配と全勾配で個々のデータの順位が異なる場合でも、選ばれたデータの束(バッチ)としては勾配の向きが揃っていた点である。個々の順位の厳密さより、集合としての方向性が学習効果を左右することを示唆している。
ビジネスへの示唆
自社データでモデルを調整する企業にとって、最大の効果は「良質なデータを選ぶ工程」の費用低減である。従来は候補データを絞り込む段階で多くのGPU時間を要したため、大量の社内文書や対話ログを持っていても、選別を断念して手作業や無作為抽出に頼る例が少なくなかった。LESSERはこの工程を軽くし、保有データを網羅的に評価する道を開く。
影響が大きいと見られる業種と部門は次のとおりである。
- 金融:コールセンター記録や社内規程を用いた応答モデルの調整。AI開発部門と顧客対応部門が対象
- 製造:保守マニュアルや不具合報告から、有用な事例だけを選んで学習させる品質保証・保全部門
- 医療・法務:機密性が高く、少量の高品質データで調整したい文書作成支援の現場
管理すべき指標は、データ選別あたりのGPU使用時間、モデル改善サイクル一巡のリードタイム、検証データでの正答率や応答品質である。選別費用が下がれば、同じ予算で試行回数を増やせるため、改善サイクルの短縮と開発費の圧縮を両立しやすい。強化学習を用いる推論特化モデルの開発でも、3.0分の1という削減は無視できない水準である。
もっとも、示された削減幅は特徴抽出の工程に限られ、学習全体の費用が同じ比率で下がるわけではない。導入時には、自社の候補データ規模のうち選別工程が全体費用に占める割合を見極める必要がある。また、検証用データの質が選別結果を左右する構造は変わらないため、現場の評価基準を反映した少量の検証セットを整備する作業が欠かせない。
今後の展望
LESSERは既存の選択手法を包む形で使えるため、すでに勾配ベースの選別を採り入れている開発チームには移行の障壁が低い。一方、本研究は論文公開の段階にあり、より大規模なモデルや業務固有のデータで同様の傾向が得られるかは、今後の検証を待つ必要がある。
モデルの大型化とともに、計算資源の確保は企業のAI戦略における制約となっている。モデルを大きくする競争から、データを賢く選んで少ない計算で成果を出す競争へと関心が移る中、選別工程の効率化は投資対効果を左右する要素になる見通しである。AI開発を担う部門は、データ選別をコスト項目として可視化し、手法の見直しを検討する時期に入ったといえる。
関連トピック
同セクションの記事
4B型LM、GM級の棋力で指し手を説明
研究チームが、40億パラメータで一般的なグランドマスター級に指し、手と計画を自然言語で説明するチェスLM「Queen」を発表した。専門エンジンと言語モデルを融合する手法で、業務AIの説明可能性向上に道を開く。

ViTのレジスタ、意味情報を担うと解明
DINOv2の内部トークンを分析した研究で、レジスタ由来の特徴を壊すと表現が48.17%変化し、外れ値由来では0.31%にとどまった。画像AIの解釈性と軽量化に資する知見である。

分散最適化で新手法GATE、収束を保証
中央サーバーなしで各拠点が協調し最適解を求める分散最適化で、通信網の構造から計算の分担まで一体設計する新手法GATEが提案された。線形収束も理論的に保証され、設計指針となる。
