LLMの実行時挙動推論、最高精度37%にとどまる
研究チームは、実在するPythonリポジトリ12件から480問を作成した新ベンチマーク「SWE-Flux」を公表した。5種のLLMのうち最高の正答率は37%で、プログラム実行時の挙動の理解に課題が残ることが示された。

研究チームは、大規模言語モデル(LLM)がプログラムの実行時の挙動をどこまで推論できるかを測る評価基準「SWE-Flux」を開発し、論文として公開した。従来のリポジトリ単位の質問応答ベンチマークは静的なコード理解が中心で、採点にもLLMによる評価が使われることが多かった。実行推論を扱う既存の評価も、コード断片や関数単位にとどまっていた。
研究の概要
SWE-Fluxは、実在するPython開発リポジトリ12件から480問を収録する。正解は人手で書いたものでも、LLMが判定したものでもなく、計測コードを仕込んだテスト実行から自動的に採取した値である。出題範囲は制御フロー、ループ、プログラム状態、データフロー、例外、プログラム不変条件で、単一テストに関する問いと複数テストにまたがる問いの双方を含む。
5種類のLLMで評価した結果、最高の正答率は**37%**だった。不変条件、手続き内の制御フロー、例外、単純なループといった局所的な挙動には比較的強い。一方で、データフロー、手続き間にまたがる実行、正確な状態の推論、テストスイート全体での集計には苦戦した。
さらに研究チームは、入力を摂動させることで新しい問題を自動生成できることも示した。選定した問題の**約90%**で有効な派生問題を得られ、それらは評価対象モデルにとって大幅に難しかったという。
ビジネスへの示唆
本結果は、AIコーディング支援の導入を進める企業にとって、期待値の設定に直結する。コード生成や要約で高い性能を示すモデルでも、実際に動かしたときに変数の値がどう変わり、例外がどこで発生するかを正確に追えるとは限らない。障害の原因調査や不具合修正をAIに一任する運用は、現時点では慎重な設計が求められる。
影響が想定される部門と指標は次のとおりである。
- ソフトウェア開発部門:障害解析やデバッグでの平均復旧時間(MTTR)、AIが提示した修正案の採用率
- 品質保証部門:欠陥流出率、コードレビューの所要時間
- 金融・製造・通信などの情報システム部門:レガシーシステムの保守工数、仕様調査にかかる時間
- 調達・IT企画部門:AIツール選定における評価コストと導入後の効果検証
実務上の使い分けとしては、局所的な挙動の確認や例外の説明はAIの得意領域とみなし、関数間にまたがるデータの流れや複雑な状態遷移の判断は人間のレビューを残す方針が合理的である。AIによる自動修正を本番に反映する場合は、テスト実行結果による検証工程を必須とすることで、誤った推論に起因する手戻りを抑えられる。
ベンチマークの作り方そのものも、企業に応用の余地がある。SWE-Fluxは、計測付きのテスト実行から正解を自動採取するため、人手による作問や、LLMによる採点に依存しない。同様の仕組みを自社のリポジトリに適用すれば、自社コードベースを対象にした再現性の高いモデル比較が可能になると考えられる。入力の摂動で派生問題を作れるため、公開ベンチマークの内容を事前に学習したモデルによる過大評価も避けやすい。ベンダー選定や、モデル更新時の回帰確認に活用できる可能性がある。
今後の展望
今回の対象はPythonの12リポジトリ、480問に限られる。他の言語や、より大規模で複雑な業務システムに結果がそのまま当てはまるかは、今後の検証課題である。
一方、最も高い精度でも4割に届かないという事実は、実行時挙動の理解がLLMの改善余地の大きい領域であることを示す。実際にコードを実行して得た情報をモデルに参照させる設計など、実行環境と連携する開発支援ツールの需要が高まる可能性がある。生成AIを開発現場に組み込む企業は、コード生成の品質だけでなく、実行時挙動を踏まえた検証能力を評価軸に加えることが望ましい。
関連トピック
同セクションの記事
正答率の高いAIほど規則の順序を区別
数学規則の並べ替えで答えが変わらない問題でも、正答率の高い言語モデルほど並び順を内部で区別して表現していることが、16モデルの分析で分かった。答えの一致だけでは推論の中身を測れない可能性を示す。

反発型自己注意、カオスと局所化の相を解明
研究チームは、値写像を負にした最小のトランスフォーマーで、カオスや注意の凝縮が生じる条件を理論的に整理した。疎な注意が動的挙動を持続させうる点は、AIの安定運用を考える上で示唆に富む。

トランスダクティブ学習の誤差上界を改善
Yingzhen Yang氏が、手元の未ラベルデータの予測精度を扱うトランスダクティブ学習で、従来より鋭い誤差上界を導出した。必要なラベル数の理論的な見積もり精度が高まる。
