GenCine、3D上で撮影と動きを統合制御
米研究チームは、1枚の画像から3Dシーンを作り、カメラと被写体の動きを同時に指定できる動画生成システムGenCineを発表した。広告や映像制作の工程短縮に直結する技術である。

研究の概要
ジョンズ・ホプキンス大学のアラン・ユイル氏らの研究チームは、動画生成AIで被写体とカメラの動きを3次元で一体的に制御する手法「Generative Cinematographer(GenCine)」を発表した。論文は2026年10月にarXivで公開された。
従来の制御可能な動画生成は、被写体の動きを2次元の軌跡や疎なドラッグ操作で指定してきた。しかし同じ2次元軌跡でも、実際の3次元の動きは複数通りありうる。カメラと被写体が同時に動く場面では、この曖昧さが特に大きく、意図と異なる映像が生成されやすかった。
GenCineは、1枚の静止画を編集可能な3Dシーンの骨組みへ変換する。制作者はカメラの経路を指定したうえで、前景の領域に「3Dモーションハンドル」を設定して動かす。複数のハンドルで被写体の各部位を独立に動かせるため、物理シミュレータやカテゴリー固有の事前知識を使わずに、部分ごとの剛体運動による近似として非剛体の動きを表現できる。
これらの操作は、各フレームでの制御領域の位置、ハンドルごとに固定した色、背景と同じ世界座標系での3次元位置を記録したガイダンスマップに変換される。これを事前学習済みの動画モデル「Wan」に与える。学習では、実動画から動きを復元した制御情報と、合成動画の正解ジオメトリを併用した。追加学習は軽量なガイダンス分岐とLoRAアダプターに限られる。
実験では、カメラに対して一貫した動き、視点変化時の幾何的整合性の向上、多様な実写シーンでの高い制御性が報告されている。
ビジネスへの示唆
最も影響を受けるのは広告・映像制作業界である。商品カットの撮影では、カメラワークや被写体の動きの試行ごとに撮り直しが発生する。静止画1枚から動きを設計できれば、撮影・再撮影コストと、絵コンテから映像確認までのリードタイムの削減が見込まれる。
影響が想定される部門と指標は次のとおりである。
- マーケティング部門:商品画像からの動画広告の制作本数、A/Bテストの回転数、1本当たりの制作単価
- EC事業部門:商品ページの動画化率、コンバージョン率、返品率
- ゲーム・アニメ制作部門:プリビズ(撮影前の映像設計)の工数、修正差し戻し回数
- 不動産・建築分野:内見用の動画生成にかかる制作期間
特に、カメラが動く場面で被写体の位置関係が破綻しにくい点は、商品の形状や配置の正確さが求められる用途で重要である。ブランド側が意図しない動きの生成が減れば、法務・ブランド管理部門による確認工数の低減にも寄与しうる。
また、追加学習が軽量で、既存の動画生成モデルに適用する構成である。自社で基盤モデルを一から開発せず、既存資産に制御機能を付加する戦略を採る企業にとって、導入障壁は相対的に低い。
今後の展望
実用化に向けた課題は残る。1枚の画像から復元する3D構造の精度に生成品質が左右されるほか、部分ごとの剛体近似では、布や毛髪など複雑な変形の再現に限界がある可能性がある。商用利用では、基盤モデルのライセンスや学習データの権利関係の確認も必要となる。
それでも、動画生成の制御を「プロンプトによる指示」から「3D空間での演出」へ移す流れは、制作現場の職能を変えうる。映像ディレクターやモーションデザイナーの作業は、生成の試行錯誤から演出設計へと比重を移すとみられる。企業は、制作ワークフローのどの工程で3D制御型の生成を試験導入するかを、早期に検討する段階にある。
関連トピック
同セクションの記事
GALA、アバター動作を最大千分の一に削減
3Dガウシアンアバターの動作計算を線形近似へ蒸留する手法GALAが登場した。CPU負荷を最大3桁削減し、モバイルで60fpsを実現する。メタバースや接客分野の導入費用を左右し得る。
拡散モデルが自己参照画像を生成
米研究者らが、学習済みの画像生成AIに手を加えず、エッシャー「プリント・ギャラリー」風の自己参照構図を生成する手法を提案した。画像と歪みを同時に生成する点が特徴である。

動画内文字の編集、評価基準を整備
動画内の看板やラベルの文字を、背景の動きを保ったまま差し替える技術の評価基準「ViTeX-Bench」が公開された。広告やEC、多言語展開の制作工程を変え得る基盤として注目される。
