KaliBenchがAIのコマンド生成力を測定
Kali Linux上のコマンド生成力を測る新ベンチマーク「KaliBench」が公開された。ヒントなしの条件では完全一致精度が42%を超えるオープンモデルはなかった。専用の報酬による学習で8Bモデルが685B級に迫った。

研究の概要
大規模言語モデル(LLM)をサイバーセキュリティ業務に適用する動きが広がっている。しかし、アナリストの意図をコマンドラインの呼び出しに正確に変換できるかを直接測る指標は乏しかった。既存の評価は知識を問う試験か、端から端までを自律実行させる課題に偏っていた。コマンドライン操作では、わずかな構文の誤り、フラグと値の対応違い、引数の順序の入れ替えだけで実行が無効になる。
研究チームが公開した「KaliBench」は、Kali Linux上で自然言語をコマンドに変換する能力を評価するデータセットである。8,504組の問い合わせとコマンドの対を収録し、対象は1,642種類のツール、23の能力区分、5つのセキュリティ工程に及ぶ。ツールの解説文書を根拠に構築し、決定的な正規化と別名を考慮した判定を採用したため、再現性のある採点ができる。作成後は、LLMによる検証、隔離環境での端末実行、人手による修正を組み合わせた多段階の検証を経ている。
評価は3つのモードで行い、汎用モデルとセキュリティ特化モデルを含む24構成のオープンウェイトモデルを対象とした。ツールのヒントを与えない条件では、完全一致の精度が**42%**を超えたモデルはなかった。一方、KaliBenchから得た報酬を用いた教師あり微調整と、検証可能な報酬による強化学習を施すと、80億パラメータのモデルが6,850億パラメータの混合専門家モデルに匹敵する性能に達した。報酬は実行環境を動かさずに算出できるため、学習の費用と安全面の負担を抑えられる。
ビジネスへの示唆
直接の関係者は、セキュリティ運用センター(SOC)、レッドチーム、脆弱性診断を担う部門である。コマンドの誤りは診断漏れや再作業に直結する。AI支援ツールの導入を判断する際は、知識試験の成績ではなく、実際のコマンド生成精度を確認する必要がある。42%という上限は、現状のモデルを人手の確認なしに診断作業へ組み込む危うさを示している。
小型モデルの性能向上は、費用とデータ管理の面でも意味が大きい。診断対象の機密情報を外部のクラウドAIへ送れない金融機関や重要インフラ事業者でも、自社の計算資源で動かせる8B級モデルを調整して使える余地が広がる。導入効果を測る指標としては、次の項目が想定される。
- 診断1件あたりの作業時間と、コマンド誤りによる再実行率
- 若手アナリストの習熟に要する期間
- 推論基盤の運用費と、外部へ送信するデータ量
調達部門やセキュリティサービスの発注側にとっても、共通の物差しを得る意義がある。ベンダーの提案を同一データでの完全一致率で比較する運用が可能になり、性能の主張を検証しやすくなる。社内で独自モデルを育てる企業は、自社の診断手順に合わせた追加データを加えることで、精度を段階的に高められる。
今後の展望
課題も残る。本研究の評価対象はオープンウェイトモデルであり、商用の大規模モデルとの比較は要約からは確認できない。また、完全一致率は実務での有用性と一致するとは限らない。複数の正解が存在し得る作業や、診断の計画立案を含む工程は、別途の評価が必要である。
さらに、攻撃手法の自動化に使えるという二重用途の側面がある。防御側の効率化と悪用の抑止をどう両立させるかは、モデルの公開方針や利用規約、社内の権限管理を含む統治の問題となる。企業は導入に際し、実行環境の隔離と人間による承認工程を前提にすべきである。
検証可能な報酬という手法は、セキュリティに限らず、手順が厳密に定まる業務へ応用できる可能性がある。ネットワーク機器の設定やクラウド基盤の運用など、コマンド操作が中心の分野でも、同様の評価と学習の枠組みが広がるかが注目される。
関連トピック
同セクションの記事
VISTA、AIの行動効率を人間超えに高める
MITなどの研究チームは、視覚記憶を備えた補助基盤「VISTA」を開発した。ARC-AGI-3で、Claude Opus 5.0の行動効率が40.68から100.00に向上した。

着想源の論文検索、AIは著者に及ばず
スタンフォード大などの研究チームは、研究着想の源となった先行論文をAIが探せるかを測るベンチマークを公開した。最高性能のエージェントでも再現率は0.51にとどまり、R&D現場での検索支援の限界が示された。

埋め込み予測で画像生成の学習計算を3分の1に
画像生成の拡散Transformerに、ステップごとに更新する予測埋め込みを条件として与える手法NEPAが提案された。ImageNetでFID1.32を達成し、学習計算量は従来REPAの約3分の1である。
