AI×経営戦略読了 約3分

VISTA、AIの行動効率を人間超えに高める

MITなどの研究チームは、視覚記憶を備えた補助基盤「VISTA」を開発した。ARC-AGI-3で、Claude Opus 5.0の行動効率が40.68から100.00に向上した。

VISTA、AIの行動効率を人間超えに高める
広告

研究の概要

Qiushi Han氏、Kaiming He氏らの研究チームは、汎用のマルチモーダルモデルに長期の視覚能力を与える「ハーネス」であるVISTAを発表した。ハーネスとは、モデル本体を改変せず、その外側で入力の与え方や記憶の持たせ方を設計する仕組みを指す。

VISTAは、モデルが環境を視覚的な観測として直接知覚できるようにする。過去の観測は圧縮や要約をせず、元の形のまま保存する「無損失の視覚記憶」に蓄える。モデルは推論の途中で、必要な過去の観測を能動的に取り出し、視覚入力を自ら組み直せる。

評価では、抽象的な推論能力を測るARC-AGI-3で、Claude Opus 5.0の相対的人間行動効率(RHAE)が40.68から100.00へ上昇した。25本の公開ゲームをすべて完了し、その行動数は初めて挑戦した人間より57.4%少なかったという。さらに、視覚ゲームやパズルを扱う3つの別のベンチマークでも、同じモデルに最小限のハーネスだけを付けた比較対象を大きく上回った。最小限の調整で多様な環境に展開できる点も特徴である。

ビジネスへの示唆

最大の含意は、モデルの入れ替えや再学習を伴わずに、周辺設計だけで性能を引き出せる可能性が示されたことである。画面を見て操作する業務エージェントを開発する企業にとって、投資の重点をモデル選定から記憶と入力の設計へ移す根拠となる。

影響が見込まれる領域は次のとおりである。

  • 業務自動化(RPA)・情シス部門:画面操作の手順数、処理時間、人手介入率
  • 製造業の保全・品質保証部門:設備監視画像の履歴参照による異常検知の再現率、誤報率
  • ゲーム開発・ソフトウェアのQA部門:自動テストの探索効率、不具合の発見件数
  • ロボティクス・物流部門:試行回数の削減、作業完了までの時間

とりわけ、過去の画面や状態を忘れずに参照できる点は、長い手順を要する業務で効く。たとえば経理の伝票処理やコールセンターの多段階の画面遷移では、途中で状況を見失うことによるやり直しが生産性を下げている。行動数の削減は、こうしたやり直しの減少と処理単価の低下に直結しうる。

一方で、留意点もある。今回の成果はゲームやパズルを対象にしたものであり、実際の業務システムでの効果は示されていない。また、過去の観測を元の形のまま保持する設計は、画像の保存量や推論時の入力量を増やす可能性がある。導入を検討する企業は、行動数の削減による効果と、計算コストや応答時間の増加を併せて測り、投資対効果を確認する必要がある。

今後の展望

論文は、VISTAが多様な視覚環境で通用する汎用ハーネスになりうると位置づける。今後は、企業の業務画面や産業用カメラの映像といった実環境への適用が焦点となる。

企業にとっては、まず自社の定型業務のうち、画面を見ながら多段階で判断する工程を選び、小規模な検証で操作ステップ数と完了率を計測することが現実的な第一歩となる。モデルの性能競争が続くなか、モデルを包む設計の巧拙が、業務での実用性を左右する局面が近づいている。

関連トピック

出典: VISTA: A Visual Harness for Reasoning in an Interactive World, Qiushi Han, Keya Hu, Linlu Qiu, Cathy Wu, Kaiming He, arXiv:2610.02200v1

本記事はAIにより執筆され、Affectosphere Group が監修しています。

同セクションの記事

広告