CodeMidasがコードから訓練課題を生成
研究チームは、既存のソースコードだけから強化学習用の訓練課題を自動生成する手法CodeMidasを開発した。5,545件の課題で学習したAIエージェントは、全5ベンチマークで性能が向上した。

研究の概要
Bowen Ye氏らの研究チームは、既存のソースコードを唯一の入力として、AIコーディングエージェントの強化学習用環境を自動構築する手法「CodeMidas」を発表した。強化学習でコーディングエージェントを鍛えるには、多様な課題と、成否を確実に判定する検証器が欠かせない。従来はオープンソースのイシューやコミットといった開発の副産物から課題を抽出するのが主流であり、取り出せる課題の範囲に限界があった。
CodeMidasは、環境構築の全工程にエージェントの計算資源を割り当てる。エージェントがコードベースを探索して実装済みの機能から振る舞いの仕様を作成し、元のコードの実行結果に基づいてテストを構築する。さらに、実行チェックと解答の繰り返し試行(ロールアウト)によって、候補課題を検証し選別する。
得られたデータセットは、3,185のオープンソースコードベース、23のプログラミング言語、15の技術領域にまたがる5,545件の訓練課題である。MiMo-V2.5をGRPOで訓練したところ、五つのベンチマーク全てで性能が向上した。イシュー修復のDeepSWEで+11.7%、プログラム全体の構築を問うProgramBenchで**+17%**、ターミナル作業のTerminal-Bench v2.1で+8.5%である。
高品質な訓練課題の数を増やすほど性能が上がることも、比較実験で確認された。軌跡分析では、訓練後のエージェントがコードベースの探索を増やし、より多様な自己検証を行うようになったという。
ビジネスへの示唆
本手法の意義は、エージェント訓練の素材を課題履歴からコードそのものへ広げた点にある。課題の供給源が開発履歴の量に縛られなくなるため、AIコーディング製品を手がけるAI企業、開発者向けSaaS事業者、クラウド事業者にとって、訓練データの調達コストの構造を変え得る。
利用企業側では、次の部門とKPIへの波及が考えられる。ただし以下は論文が実測した数値ではなく、成果を踏まえた見通しである。
- 社内開発部門:プルリクエストの受け入れ率、障害修正のリードタイム、レビュー工数
- 品質保証部門:テスト作成工数、テストカバレッジ
- 情報システム・運用部門:定型的なターミナル作業の自動化率、保守コスト
金融の基幹システム、製造業の組込みソフト、システムインテグレーターなど、長年蓄積したコード資産を抱える業種では、イシュー履歴が乏しくても課題を作れる点が有利に働く可能性がある。自社リポジトリから専用の訓練環境を生成できれば、自社の言語や開発規約に適応したエージェントを育てる道が開ける。ただし、論文が示したのはオープンソースコードでの結果であり、社内コードへの適用可否は別途検証が必要である。
今後の展望
課題も残る。パイプラインの全段階でエージェントの計算資源を投じる設計であり、導入企業には生成コストと得られる性能向上の対効果を見極める作業が求められる。評価はベンチマーク上の改善であり、実際の開発現場での生産性向上とは切り分けて捉える必要がある。オープンソースコードを訓練に用いる際のライセンス確認も、実務上の論点として残る。
それでも、訓練課題の数を増やせば性能が伸びるという結果は、コードベースを訓練資源として扱う流れを後押しする。導入を検討する企業は、まず自社のコード資産の棚卸しと、検証に使えるテストの整備状況の把握から着手するのが現実的である。
関連トピック
同セクションの記事
多段検索の誤答を予測し保留する手法を提案
多段検索型の質問応答で、確信を持った誤答の危険を追加のLLM呼び出しなしで推定し、回答を保留する手法RegimeAbstainが提案された。回答範囲を5割に絞る条件で、MuSiQueの確信的誤答率は39.5%から20.6%に低下した。

AIエージェント、監督場面で価値が損なわれる
AIエージェント利用者の投稿7万3093件を分析した研究で、成果物の場面では価値が満たされる一方、監督の場面では6つの価値群すべてで満たされにくいと判明した。企業は成果の精度に加え、費用・権限・監督の設計を問われる。

MintActが画面操作を1モデルに統合した
研究チームは、スマートフォン、PC、ウェブの画面操作や部品の特定、ツール利用を単一で担う視覚言語モデル群「MintAct」を発表した。専門モデルに匹敵する性能を示し、業務自動化の基盤として注目される。
