動画生成AIエージェント、ツール活用で精度向上
研究チームが外部ツールを自律的に使い分けて動画を生成するAIエージェント「VideoGen-Agent」を開発した。専門知識や人物同一性、物理的整合性が必要な動画生成の精度が既存モデル比19.1ポイント向上し、広告・映像制作業界のコスト構造に影響を与える可能性がある。

研究の概要
動画生成AIは近年、高精細かつ時間的に一貫した映像を生成できるようになった一方で、専門知識を要する場面、特定人物の同一性維持、物理法則に沿った動き、時系列順の出来事の表現には依然として弱点を抱えていた。研究チームが発表した「VideoGen-Agent」は、この課題に対し単一モデルの性能向上ではなく、複数の外部ツールを状況に応じて使い分ける「マルチモーダルエージェント」というアプローチで応える。
同エージェントは、素材の拡張・動画生成・品質検証という複数のツールを、プロンプトと生成途中の観察結果に基づいて多段階で呼び出す仕組みを持つ。教師データによる模倣学習でツール利用の基本動作を習得させたうえで、強化学習によって「ツール呼び出しの妥当性」「タスクに適したツール選択」「生成動画の品質」を評価する報酬設計により方策を洗練させた。研究チームが新設した評価基準「VABench」(600件のプロンプトで構成、手順知識・単一/複数人物の同一性維持・物理的整合性・場面構成・複数ショットの時系列構造を網羅)では、ベースとなるテキスト動画生成モデル比でスコアが56.5から75.6へと19.1ポイント向上した。さらに生成ツール自体を上位版に差し替えるだけで、エージェント側を再学習せずにスコアは86.1まで上昇し、人間評価者は最有力の単体モデルよりもこの構成を84.3%の比較で選好した。
ビジネスへの示唆
この技術は、動画コンテンツを大量かつ高精度に制作する必要がある業界に直接影響する。想定される対象部門とKPIは以下の通りである。
- 広告・マーケティング部門:商品広告動画の制作コストと納期、A/Bテスト用のクリエイティブ本数
- 映像・エンターテインメント制作会社:企画から映像化までのリードタイム、キャラクターの同一性維持による再撮影・修正回数の削減
- ECサイト運営部門:商品紹介動画の量産スピード、コンバージョン率
- 企業研修・教育コンテンツ制作部門:手順や専門知識を正確に反映した教材動画の品質、制作外注費
特に注目すべきは、人物の同一性維持や物理的整合性といった従来AIが苦手とした要素の精度が向上した点である。これはブランドキャラクターや実在の商品を繰り返し登場させる広告制作において、修正作業の削減とクリエイティブディレクターの承認プロセス短縮につながり得る。また検証ツールによる自動品質チェック機構は、制作会社における品質保証(QA)工程の一部自動化にも応用可能である。
今後の展望
今回の成果で特筆すべきは、エージェント自体を再学習せずとも、後段の生成ツールを高性能なものに差し替えるだけで品質がさらに向上した点である。これはツール群が個別に進化し続ける前提のもとで、エージェントの投資価値が長期的に持続することを示唆する。企業が動画制作パイプラインにAIエージェントを組み込む際、生成モデル単体の性能に依存せず、複数ツールを統合的に運用する体制が競争力の源泉になる可能性がある。今後は業界特化型ツールとの連携や、著作権・肖像権に関わる人物同一性生成のガバナンス整備が実用化に向けた論点となる見込みである。
関連トピック
同セクションの記事
動画生成AI、3D記憶で長時間整合性向上
Tencent等の研究チームが、視点を跨いでも矛盾のない映像を生成する動画ワールドモデル「WorldCrafter」を発表。分単位の探索でも破綻しない映像生成は、不動産内覧やゲーム開発の実務利用に道を開く。

画像生成AIの学習不安定性を予算管理する
研究チームは、画像生成AIを報酬で調整する強化学習の不安定さを単一の量「経路分散」で予測し、更新の労力を配分する新手法を発表した。文字描画と人間の好みの両面で既存手法を上回り、広告や電子商取引向けモデルの調整コスト低減が見込まれる。

動画生成の参照制御を測る基盤と34万件を公開
研究チームは、複数の参照素材から動画を生成する「オムニR2V」の評価基盤OmniVBenchと、業務用映像を主体とする学習データ34万件を公開した。既存モデルの弱点が可視化され、広告・映像制作での導入判断に資する。
