AI×経営戦略読了 約4

CodeMidasがコードから訓練課題を生成

研究チームは、既存のソースコードだけから強化学習用の訓練課題を自動生成する手法CodeMidasを開発した。5,545件の課題で学習したAIエージェントは、全5ベンチマークで性能が向上した。

CodeMidasがコードから訓練課題を生成
広告

研究の概要

Bowen Ye氏らの研究チームは、既存のソースコードを唯一の入力として、AIコーディングエージェントの強化学習用環境を自動構築する手法「CodeMidas」を発表した。強化学習でコーディングエージェントを鍛えるには、多様な課題と、成否を確実に判定する検証器が欠かせない。従来はオープンソースのイシューやコミットといった開発の副産物から課題を抽出するのが主流であり、取り出せる課題の範囲に限界があった。

CodeMidasは、環境構築の全工程にエージェントの計算資源を割り当てる。エージェントがコードベースを探索して実装済みの機能から振る舞いの仕様を作成し、元のコードの実行結果に基づいてテストを構築する。さらに、実行チェックと解答の繰り返し試行(ロールアウト)によって、候補課題を検証し選別する。

得られたデータセットは、3,185のオープンソースコードベース、23のプログラミング言語、15の技術領域にまたがる5,545件の訓練課題である。MiMo-V2.5をGRPOで訓練したところ、五つのベンチマーク全てで性能が向上した。イシュー修復のDeepSWEで+11.7%、プログラム全体の構築を問うProgramBenchで**+17%**、ターミナル作業のTerminal-Bench v2.1で+8.5%である。

高品質な訓練課題の数を増やすほど性能が上がることも、比較実験で確認された。軌跡分析では、訓練後のエージェントがコードベースの探索を増やし、より多様な自己検証を行うようになったという。

ビジネスへの示唆

本手法の意義は、エージェント訓練の素材を課題履歴からコードそのものへ広げた点にある。課題の供給源が開発履歴の量に縛られなくなるため、AIコーディング製品を手がけるAI企業、開発者向けSaaS事業者、クラウド事業者にとって、訓練データの調達コストの構造を変え得る。

利用企業側では、次の部門とKPIへの波及が考えられる。ただし以下は論文が実測した数値ではなく、成果を踏まえた見通しである。

  • 社内開発部門:プルリクエストの受け入れ率、障害修正のリードタイム、レビュー工数
  • 品質保証部門:テスト作成工数、テストカバレッジ
  • 情報システム・運用部門:定型的なターミナル作業の自動化率、保守コスト

金融の基幹システム、製造業の組込みソフト、システムインテグレーターなど、長年蓄積したコード資産を抱える業種では、イシュー履歴が乏しくても課題を作れる点が有利に働く可能性がある。自社リポジトリから専用の訓練環境を生成できれば、自社の言語や開発規約に適応したエージェントを育てる道が開ける。ただし、論文が示したのはオープンソースコードでの結果であり、社内コードへの適用可否は別途検証が必要である。

今後の展望

課題も残る。パイプラインの全段階でエージェントの計算資源を投じる設計であり、導入企業には生成コストと得られる性能向上の対効果を見極める作業が求められる。評価はベンチマーク上の改善であり、実際の開発現場での生産性向上とは切り分けて捉える必要がある。オープンソースコードを訓練に用いる際のライセンス確認も、実務上の論点として残る。

それでも、訓練課題の数を増やせば性能が伸びるという結果は、コードベースを訓練資源として扱う流れを後押しする。導入を検討する企業は、まず自社のコード資産の棚卸しと、検証に使えるテストの整備状況の把握から着手するのが現実的である。

関連トピック

出典: CodeMidas: Scaling Agentic Coding RL Environments from Code Itself, Bowen Ye, Lei Li, Shicheng Li, Zihao Yue, Linghao Zhang, Hanglong Lv, Yuanxin Liu, Wenhan Ma, Hao Tian, Rang Li, Jinhao Dong, Yikai Zhao, Xiangwei Deng, Hailin Zhang, Liang Zhao, Qi Liu, Lingpeng Kong, Tong Yang, Fuli Luo, arXiv:2609.22068v1

本記事はAIにより執筆され、Affectosphere Group が監修しています。

同セクションの記事

広告