WanPEが動画生成の脚本精度を向上
研究チームが、動画生成AIの指示文を映画監督レベルの絵コンテへ自動変換する3970億パラメータのモデル「WanPE」を開発した。30秒動画で人間評価が50.86ポイント向上し、広告・映像制作業務の効率化に直結する。

研究の概要
近年の動画生成AIは30秒規模の長尺動画を高精度に生成できるまでに進化したが、その品質は入力される指示文(プロンプト)の巧拙に大きく左右される。ユーザーが書く簡潔な指示だけでは、カメラワークや照明、音響、複数ショットにまたがる展開といった映画的な演出情報が欠落しがちで、生成結果は単調になりやすいという課題があった。
研究チームは、この課題を解決するプロンプト強化モデル「WanPE」を開発した。パラメータ数は3970億に達し、105万本の実写映像から学習データを構築した点が特徴である。同モデルは、既存の完成映像を分析して背後にある演出意図を逆算する「逆構築(reverse construction)」という手法でショット単位の撮影計画を生成し、さらに独自の強化学習手法「SC-GRPO」により、複数ショットや時間経過を通じてユーザーの本来の要望を一貫して反映させる仕組みを持つ。
評価にあたっては、5秒から30秒までの動画を対象に、約1.1万件の人手によるペア比較評価から成る新ベンチマーク「WanPEval」を構築した。動画生成モデル「Wan3.0」に組み込んだ結果、素のユーザー入力と比べて人間評価スコアが5〜15秒の動画で10.66〜18.84ポイント、30秒の長尺動画では50.86ポイントという大幅な改善を記録した。5〜15秒の領域では既存の商用サービスをすべて上回り、30秒領域でも競合の「Seedance 2.5」に匹敵する性能を示している。
ビジネスへの示唆
この成果は、動画コンテンツ制作を担う複数の業界・部門に実務的な影響を与える。広告代理店のクリエイティブ制作部門や企業のマーケティング部門では、これまで専門のディレクターや脚本家が担ってきたショット割り・カメラワーク設計の初期工程をAIが代替できる可能性が出てきた。想定される効果は次の通りである。
- 広告制作:CM素材の企画から初稿映像までの制作リードタイム短縮
- ECサイト運営:商品紹介動画量産時のクリエイティブ制作コスト削減
- メディア・エンタメ企業:ショート動画コンテンツの品質向上による視聴完了率・エンゲージメント率の改善
- 人材育成:非専門人材でも映画的演出を含む指示が作成可能になることによる制作人員の裾野拡大
特に長尺(30秒)動画での改善幅が大きい点は、SNS向けショート動画広告やブランデッドコンテンツの内製化を検討する企業にとって重要な意味を持つ。従来は長尺になるほど演出の一貫性維持が難しく専門スタジオへの外注が前提だったが、プロンプト強化技術の実用化が進めば、内製比率を高めコンテンツ制作コストの構造そのものを見直す動きにつながり得る。
今後の展望
研究チームは、逆構築による学習手法が従来の順方向書き換えより明確に優れ、SC-GRPOがモデル規模によらず意味的整合性を保つことをアブレーション実験で確認したとしている。今後、こうしたプロンプト強化技術が商用動画生成サービスに標準搭載されれば、企業のマーケティング・広告部門はAIが提案する演出案を土台に人間が編集・監修する分業体制へと移行していくとみられる。制作現場における「脚本設計」工程の自動化がどこまで進むかが、映像制作業界全体のコスト構造と雇用形態を左右する焦点となりそうだ。
同セクションの記事
GMM推定に新手法、EMより頑健と実証
仏研究チームが成分数未知のガウス混合モデルを安定推定する新アルゴリズムを開発。従来のEMアルゴリズムより過大指定に強く、クラスタリング業務の試行錯誤コスト削減が期待される。

欠損に強い感情分析手法SemMSAが登場
研究チームは、映像・音声・言語の一部が欠けても人の感情を推定できる手法SemMSAを提案した。SIMS、MOSI、MOSEIの3ベンチマークで最高水準の性能を示し、顧客対応や市場調査での実用化が焦点となる。

新手法HARMONY、1枚の写真から室内3D生成
Shufan Sun氏らの研究チームは、室内の1枚の画像から物体の位置関係まで整合した3Dシーンを復元する枠組み「HARMONY」を発表した。不動産や小売などで3D化の工程を簡素化する可能性がある。
