ループ型AI、推論精度向上と計算半減を両立
米研究チームが、ループ型Transformerの途中計算を活用し追加学習なしで推論精度を高める手法LoopCDを開発した。ループ数を半減しても同等以上の精度を保ち、演算量を最大48.2%削減した。

研究の概要
研究チームは、同じ計算ブロックを繰り返し実行して少ないパラメータで高い性能を狙う「ループ型Transformer」に着目した。この方式では各ループが同じ次トークンに対する中間表現を生むが、従来の復号は最終ループの出力のみを使い、途中の状態を捨てていた。
研究チームは、浅いループほど計算量が少なく予測が弱いという性質に注目した。これは、強い予測と弱い予測の組が、補助モデルや追加学習なしで得られることを意味する。そこで、最終予測と早い段階のループの予測を対比させ、トークン選択を導く「コントラスティブデコーディング」を適用する枠組みLoopCDを提案した。
LoopCDには二つの方式がある。LoopCD-Logitsは出力の確率空間で対比を行い、出力計算を1回追加する。LoopCD-Hiddenは内部の隠れ状態の空間で対比を行い、出力側の追加負荷がゼロである。いずれもモデルの再学習を必要としない。
四つのループ型モデル群で検証した結果、全ループ実行時に安定した改善が確認された。Ouro-2.6B-Thinkingの数学試験問題AIME 2024のpass@1は**61.88%から73.33%に上昇した。HuginnのコーディングベンチマークHumanEvalのpass@1は22.56%から31.71%**に向上した。
さらに、この精度向上を計算削減に転用できる点が重要である。ループ数を半分にしても、ガイドなしの全ループ基準と同等以上の精度を維持し、順伝播の演算量(FLOPs)を**22.5%から48.2%**削減した。
ビジネスへの示唆
最大の影響を受けるのは、生成AIを自社サービスとして提供するクラウド事業者やSaaS企業のインフラ部門である。推論コストは売上原価の大半を占めるため、演算量の2割から5割の削減は、1リクエスト当たりの原価や、GPU稼働率、レイテンシーといったKPIに直結する。
開発現場では、ソフトウェア開発部門のコード生成支援への応用が考えられる。HumanEvalでの改善幅は約9ポイントであり、コードレビューの手戻り率やテスト通過率の改善につながる可能性がある。金融機関のリスク分析や、製造業の設計検証など、段階的な推論を要する業務でも、同じ精度で応答時間を短縮できれば、処理件数当たりのコスト削減が見込める。
導入面での利点は、追加学習が不要なことである。既存のループ型モデルに復号処理の変更だけで適用でき、データ整備や再学習の費用が生じない。オンデバイスAIを手がける機器メーカーにとっても、少ないパラメータと少ない演算量の組み合わせは、消費電力や搭載コストの低減という製品KPIに寄与する。
- 対象部門:AI基盤・MLOps、プロダクト開発、クラウド調達
- 主なKPI:推論単価、応答遅延、GPU稼働率、タスク正答率
今後の展望
留意すべき点は、検証対象が研究用のループ型モデルに限られることである。市場の主流である非ループ型の大規模モデルには、そのまま適用できない。また、報告された数値は公開ベンチマークでの結果であり、企業固有の業務データでの効果は個別の検証が必要となる。
ただし、ループ型は少ない記憶容量で高い推論力を得る設計として関心が高まっている。復号側の工夫で精度と効率を同時に改善できるという示唆は、推論時の計算配分を最適化する流れを後押しするとみられる。企業は、モデル選定の際に学習済みの規模だけでなく、推論時の運用設計も含めた総コストで比較する視点が求められる。
関連トピック
同セクションの記事
複数教師の蒸留、学習の落とし穴を解明
複数のRL教師の能力を1つの小型モデルへ統合する蒸留で、損失の平均化方式や数値精度が成果を左右することが判明した。AI開発の品質管理と計算コストに直結する知見である。

OmniSeek、音声映像を能動的に探索
長い音声付き映像から、必要な場面を自ら選んで見聞きする推論AI「OmniSeek」が登場した。映像と音声の両方を根拠とする推論を促し、監視や会議分析の精度向上に道を開く。

DMAD、高速画像生成の蒸留を簡素化
中国・米国の研究チームが、拡散モデルを少ステップで動かす蒸留手法DMADを発表した。補助モデルを不要とし、1~4ステップで教師モデルを上回る品質を示し、生成コストの削減に道を開く。
