動画生成AI、手順を自ら判断し実行する新手法
研究チームが、初期画像と目標だけから次の行動を決めて動画化し、結果を見て完了まで進める世界モデル「WorldGuide」を発表した。手順書や研修動画の制作を変える可能性がある。

Ankan Deria氏らの研究チームは、初期画像とタスクの目標だけから、手順の長い作業を動画として生成し完遂する世界モデル「WorldGuide」を提案した。従来の動画生成AIは、もっともらしい映像を作れても、長い手順では途中の生成結果に応じて次の行動を修正できなかった。論文はこの課題を「視覚的な世界空間における閉ループのタスク実行」として定式化している。
研究の概要
評価のため、チームは約5.9万本のステップ注釈付き動画、245タスク、27の手順カテゴリからなる「WorldGuide-Bench」を新たに構築した。同ベンチマークでのタスク成功率は33.33%であり、参照用の行動計画を与えられた有力な動画モデルMiniMax-H3の29.90%を上回った。VideoCraft-Benchでは、目標のみを条件とするMiniMax-H3の32.73%に対し47.69%を記録した。計画と学習済みの実行を結びつける意義を示す結果である。
しくみをやさしく
仕組みは二つの役割で構成される。第一はPlanner(計画役)で、ここまでの映像の進み具合を見て、次の原子的行動か、タスク完了かを予測する。原子的行動とは、これ以上分けられない最小の動作を指す。第二はExecutor(実行役)で、その行動に対応する短い動画クリップを生成する。生成された結果は次の入力に戻り、Plannerが再び次の一手を決める。この循環が閉ループである。料理に例えれば、レシピを読み上げる人と手を動かす人が、仕上がりを見ながら交互に作業を進める構造である。
要点は、PlannerとExecutorを同じステップ単位の手順デモで学習している点にある。従来の閉ループ方式は、外部の学習済み実行器や間接的な検証に頼ることが多く、「何をすべきか決めること」と「映像として実現すること」の間にずれが残っていた。さらに階層的な視覚メモリが過去の履歴を圧縮して保持するため、作業が長くなっても、AIが一度に扱う情報量(トークン)の増加に上限を設けられる。
ビジネスへの示唆
最も身近な用途は、手順が決まった作業の「見本映像」づくりである。たとえば製造業の生産技術部門では、新しい組立工程のたびに作業標準書と教育動画を撮影・編集している。外食・小売の店舗運営部門では、調理や陳列、開閉店作業の研修動画が同様の手間を生んでいる。保守・点検部門の点検手順の可視化も該当する。
読者に問いたいのは、自部署に「手順は決まっているが、毎回人が撮影して説明資料にしている業務」があるか、そしてそれに誰がどれだけ時間を割いているか、である。動くKPIとしては、教育コンテンツの制作リードタイム、新人の立ち上がり期間、手順逸脱に起因する不良や再作業、現場からの手順に関する問い合わせ件数が挙げられる。
- 製造:作業標準書の更新工数、手順ミスによる手戻り
- 店舗運営:研修準備の負荷、店舗間のオペレーションのばらつき
- 人事・教育:研修素材の制作コスト、習熟までの期間
ただし論文の成功率は3割台から4割台後半であり、完全な自動化には至っていない。出力を人が確認する前提で使う技術と捉えるのが現実的である。
現場での導入イメージ
仮に導入支援に入るなら、次の流れを提案する。
- 棚卸し:動画で手順を伝えている業務を洗い出し、制作頻度、更新頻度、担当者の手間を可視化する。到達点は、効果が出やすい業務の候補を3つ程度に絞り込める状態である。
- 差し込み先の設計:新しいツールを増やさず、既存の手順書管理や研修用の動画配信基盤、社内の文書検索(RAG)に、生成した動画案を載せる形を優先する。到達点は、現場が普段の導線のまま案を確認できる状態である。
- 小さく試す(PoC):一部署で数週間、既存の手順を「目標文と初期画像」から動画案にして、熟練者が妥当性を判定する。到達点は、担当者が「撮影前の叩き台として使える」と実感できる水準の見極めである。
- 運用と横展開:承認の基準、危険作業を対象外とするルール、修正履歴の残し方を整え、他部署へ広げる。到達点は、更新のたびに撮り直さず、差分だけ直せる運用の定着である。
全体として目指すのは、手順の知識が撮影の都合に縛られず、変更に合わせて素早く映像化される職場である。
今後の展望
本研究は、動画生成を単なる映像制作から「行動の計画と実行の検証」へ広げた点に意義がある。将来は、ロボットの動作計画や作業シミュレーションへの応用も視野に入る。一方で成功率の向上と、実作業との整合性の検証が課題として残る。
関連トピック
この記事のアイデアを、あなたの現場で試してみませんか。 どのくらいのコストで作れて、どのくらい手間やコストが減るかを一緒に試算し、試作から導入まで伴走します。
導入を相談する →同セクションの記事
ロボット学習、成功境界に絞り効率化
米研究チームは、ロボットの強化学習で習熟度の「境界」にある課題へ学習を集中させる手法SGSを開発した。100万超の並列環境でも効果が出て、組立や脚式移動の自動化に道を開く。

文脈で動作を止める安全フィルタが登場
米研究チームは、人型ロボットの動作生成AIに追加学習なしで後付けできる安全フィルタ「CSF」を発表した。状況次第で意味が変わる動作の危険を、自然言語の規則から抑える。

世界モデルDreamTrueが失敗映像を学び欠陥率を低減
ロボットの動作から未来の映像を予測する世界モデル「DreamTrue」が、人手評価の相互作用の欠陥率を48.12%から6.25%へ下げた。実機で試す前に映像で動作を検証できる可能性を示す。
