AI×経営戦略読了 約4

新手法CliffCompaction、費用を最大5割削減

長時間動作するコーディングAI向けの文脈圧縮手法「CliffCompaction」が、性能を維持したまま費用を最大50%削減した。並列試行の効率も高まり、開発現場のAI運用費に影響する可能性がある。

新手法CliffCompaction、費用を最大5割削減
広告

研究の概要

Trang Nguyen氏、Tim Dettmers氏らの研究チームは、長時間稼働するコーディングエージェント向けの自動圧縮技術「CliffCompaction」を開発し、arXivで公開した。エージェントは複雑な課題で数百万トークン規模の文脈を扱う。しかしコンテキストウィンドウには上限があり、セッションをまたいだ圧縮が避けられない。同手法は、文脈長に上限を設けた条件下で費用を最大**50%**削減した。一方で、ベンチマーク「Terminal-Bench」では性能を維持または改善したという。

設計の核心は、圧縮後の情報の忠実性を保つ点にある。内容の切り詰めと削除のみを行い、言い換えや書き直しは一切しない。さらに「圧縮の圧縮」を行わない。各回の圧縮は原本のみを対象とし、前回の圧縮結果は破棄する。これにより、要約を重ねるたびに情報が変質する「文脈ドリフト」の蓄積を防ぐ。

この性質によって、100万トークンを超えるセッションでも継続的な学習が成り立つ。GPU向けカーネル最適化の評価「KernelBench」では、CUDAカーネルの高速化倍率が200ステップ後に2.23倍、400ステップ後に3.58倍へ達した。この結果は、専用の探索アルゴリズムや訓練済みエージェントを上回る。汎用の圧縮技術でありながら最高水準を記録した点が特徴である。

ビジネスへの示唆

最大の影響は、AI開発支援の運用費に及ぶ。1回の試行あたりの費用が下がるため、複数の試行を並列で走らせて最良の結果を採る「テスト時スケーリング」の費用対効果が改善する。論文によれば、Terminal-Benchで10ポイント超の上積みを、フルコンテキストでの実行2回分に満たない費用で実現した。並列試行の条件下では、Kimi K2.6がOpus 4.7に並んだ。さらにOpus 4.6とGPT-5.3 Codexを、より低い費用で上回った。高価な最上位モデルへの依存を減らし、モデル選定の自由度を高める材料となる。

影響が大きいと見込まれる部門と指標は次のとおりである。

  • ソフトウェア開発部門:エージェント1タスクあたりのAPI費用、タスク完遂率、レビュー待ち時間
  • 情報システム・SRE部門:障害調査や大規模移行など長時間作業の自動化率、トークン消費量
  • 半導体・HPC・AI基盤部門:GPUカーネル最適化の工数、推論単価、スループット

AIモデルの学習・推論基盤を抱える企業では、カーネル最適化の自動化が計算資源の単価に直結する。金融のレガシーシステム刷新や、製造業の組み込みソフト保守など、大規模コードベースを扱う業種でも、長期タスクの採算改善が見込まれる。

導入の障壁は低い。実装はスキャフォールド非依存のAPIプロキシとして公開されており、Claude CodeやCodexなど既存のハーネスに組み込める。自社のエージェント基盤を作り直さずに、プロキシ層を加えるだけでトークン費用の削減を試せる。

今後の展望

ただし、示された数値はあくまで論文が用いたベンチマーク上の結果である。社内の独自コードベースや業務で同等の削減率が得られるかは、別途の検証を要する。50%という削減幅も「最大」である点に留意が必要である。切り詰めと削除のみの方式は、重要情報を落とすリスクと表裏一体でもあり、失敗時の挙動を監視する体制が求められる。

もっとも、エージェントの稼働時間が数時間から数日へ伸びるなかで、文脈管理は運用費と品質を左右する共通課題となる。企業はまず限定的な開発タスクで費用当たりの成果を測定し、そのうえでモデル構成と並列度を見直すことが求められる。

関連トピック

出典: CliffCompaction: Cost-Efficient Compaction for Long-Horizon Coding Agents, Trang Nguyen, Eulrang Cho, Bingqing Chen, Tim Dettmers, arXiv:2609.26779v1

本記事はAIにより執筆され、Affectosphere Group が監修しています。

同セクションの記事

広告