MintActが画面操作を1モデルに統合した
研究チームは、スマートフォン、PC、ウェブの画面操作や部品の特定、ツール利用を単一で担う視覚言語モデル群「MintAct」を発表した。専門モデルに匹敵する性能を示し、業務自動化の基盤として注目される。

研究の概要
MintActは、画面上の操作対象を特定するUIグラウンディング、モバイル・デスクトップ・ウェブをまたぐ複数手順のナビゲーション、画像を手がかりにしたツール利用の3能力を、単一の視覚言語モデルに統合したモデル群である。規模は2B、4B、8Bの3種類を用意した。研究チームは、環境、データ、学習手順の設計を工夫することで、全能力において領域別の専門モデルに匹敵する性能を得たと報告している。
性能面では、PC操作エージェントの代表的な評価基準であるOSWorld-Verifiedで48.9を記録した。同程度のモデルサイズの範囲では、幅広いベンチマークで最高水準に達したという。
技術面の特徴は学習基盤にある。仕組みの異なる領域別のバックエンド上で数百の環境インスタンスを同時に稼働させ、操作履歴データの収集とオンライン強化学習の双方に利用する。さらに非同期型の強化学習の枠組みにより、領域間の学習データの配分を明示的に制御した。環境からのフィードバックにノイズが混じる場合や、学習中の方策にずれが生じる場合でも、学習が安定するよう設計されている。
ビジネスへの示唆
画面越しに操作するエージェントの価値は、APIが整備されていない業務システムを、人間と同じ画面から扱える点にある。1つのモデルがモバイル、デスクトップ、ウェブの各環境を横断できれば、部門ごとに別々の自動化ツールを導入してきた企業は、運用の一本化を検討できる。想定される適用先と指標は次のとおりである。
- 金融・保険のバックオフィス:申込内容の転記や照会業務における、1件当たりの処理時間と入力ミス率
- 製造の生産管理部門:基幹システムや生産管理画面への入力作業に要する工数
- 人事・経理部門:勤怠、給与、経費精算システムの定型操作の自動化率
- 開発・品質保証部門:画面操作テストの作成と実行にかかるリードタイム
モデルが2Bから8Bと比較的小さい点も実務上の意味を持つ。推論に必要な計算資源が抑えられるため、推論コストの低減や、機密データを社外に出さない自社環境での運用が選択肢に入る可能性がある。ただし、論文の要旨はこうした導入形態の検証を示していない。
また、OSWorld-Verifiedのスコアは48.9にとどまる。この水準は、人手による業務を完全に置き換えるには十分でないとみられる。当面は、担当者による確認を挟んだ半自動運用から始め、誤操作率や再作業率を測定しながら適用範囲を広げる手順が現実的である。
今後の展望
今回の成果で注目すべきは、モデル自体に加え、複数領域の環境を大規模に並列稼働させて強化学習を回す基盤を整えた点である。実際の企業システムは画面構成や操作手順が固有であるため、汎用モデルを自社業務へ適応させる際には、社内環境を再現した検証用環境の整備が競争力を左右する可能性がある。
一方で、課題も残る。社内システムへの適応度、操作権限の管理、誤操作時の責任分界といった論点は、要旨からは読み取れない。導入を検討する企業は、対象業務を絞った試験運用で処理時間の短縮幅と誤り率を確認し、費用対効果を見極める必要がある。領域別の専門モデルを個別に維持する負担が軽くなるかどうかが、今後の普及の分かれ目となる。
関連トピック
同セクションの記事
多段検索の誤答を予測し保留する手法を提案
多段検索型の質問応答で、確信を持った誤答の危険を追加のLLM呼び出しなしで推定し、回答を保留する手法RegimeAbstainが提案された。回答範囲を5割に絞る条件で、MuSiQueの確信的誤答率は39.5%から20.6%に低下した。

AIエージェント、監督場面で価値が損なわれる
AIエージェント利用者の投稿7万3093件を分析した研究で、成果物の場面では価値が満たされる一方、監督の場面では6つの価値群すべてで満たされにくいと判明した。企業は成果の精度に加え、費用・権限・監督の設計を問われる。

CodeMidasがコードから訓練課題を生成
研究チームは、既存のソースコードだけから強化学習用の訓練課題を自動生成する手法CodeMidasを開発した。5,545件の課題で学習したAIエージェントは、全5ベンチマークで性能が向上した。
