動画生成AI、遅延を約11分の1に短縮
研究チームが、動画生成AIの内部表現を圧縮しつつ品質を保つ手法GRACEを発表した。トークン数を8分の1、遅延を11.1分の1に減らし、動画制作の計算コストを下げる道を開く。

研究の概要
動画生成AIの多くは、動画を小さな潜在表現に圧縮するオートエンコーダーと、その潜在表現上でノイズを除去しながら映像を作る拡散トランスフォーマー(DiT)で構成される。DiTが扱うトークン数が少ないほど生成は速くなるため、圧縮率の高いオートエンコーダーが有効とされてきた。ただし課題が二つある。圧縮を強めると復元品質が落ち、補うにはチャンネル数を増やす必要があるが、これがDiTの学習収束を遅らせる。また、圧縮後の潜在表現は元のDiTが学習したものと異なるため、DiTを一から再学習するか、高いコストで適応させなければならない。
GRACEは、事前学習済みオートエンコーダーを圧縮しつつ、事前学習済みDiTとの互換性を保つ二段階の枠組みである。Wan2.1-I2V-14Bに適用した結果、480x832x81の条件でトークン数を8分の1、遅延を11.1分の1に削減した。生成品質の評価指標VBenchでは、圧縮前のパイプラインと同等だったと報告されている。
しくみをやさしく
第一段階はオートエンコーダーの圧縮である。元のエンコーダーが出す潜在表現を「基本潜在」として固定し、強い圧縮で失われる情報だけを「残差潜在」として別に学習する。元の写真を下書きとして残し、足りない細部を付箋で追記する方式にたとえられる。
さらに、圧縮後の潜在表現を凍結したDiTの特徴空間で元の潜在表現と照合する。見た目の復元精度だけを追うと、潜在表現がDiTの学習した分布から外れてしまう。そこで「生成モデルにとって自然か」を基準に最適化し、生成に向いた圧縮を狙う。
第二段階はDiTの適応である。軽量なファインチューニングに加え、非対称ノイズ除去を用いる。基本潜在を残差より先に除去し、全体の骨格を先に固めてから細部を詰める順序である。DiTを作り直さず、既存資産を活かせる点が特徴である。
ビジネスへの示唆
恩恵が大きいのは、動画を繰り返し大量に生成する業務である。たとえばマーケティング部門で、EC商品の静止画から商品紹介動画を作り、訴求やトーンの異なる複数案を試す作業が該当する。今回の対象モデルは画像から動画を生成するI2V型であり、こうした用途と相性がよい。生成待ちの時間が短くなれば、1案あたりの試行回数を増やしやすくなる。
自部署に置き換えると、問うべきは次の二点である。動画や画像の生成・修正のうち、いま誰がどれだけ待ち時間と手間をかけているか。生成コストの制約で、試せていない案はどれだけあるか。
影響が見込まれる部署と指標は次のとおりである。
- マーケティング・広告運用:動画クリエイティブの制作リードタイム、検証できる案の数
- EC・商品企画:商品動画1本あたりの制作コスト、掲載までの日数
- 映像・ゲーム制作:プレビュー確認の待ち時間、GPU稼働コスト
- 教育・研修:教材動画の更新頻度と制作工数
計算量が減れば、同じ設備でより多くの生成をこなす、あるいは設備投資を抑える、という選択肢が生まれる。
現場での導入イメージ
仮に導入支援に入るなら、次の流れを提案する。
- 棚卸し:動画生成に関わる業務を洗い出し、生成待ち、再生成の回数、GPU費用が詰まりどこに集中しているかを可視化する。目指す到達点は、効果を測るべき業務と指標が部署内で共有された状態である。
- 差し込み先の設計:新しいツールを増やさず、いま使っている生成基盤や社内の制作フローの推論部分を、圧縮版へ置き換える形を優先する。GRACEは既存DiTとの互換性を重視した設計であり、この方針と整合する。目指す到達点は、担当者の操作が変わらず裏側だけが速くなる状態である。
- 小さく試す(PoC):一部署、数週間の範囲で、同じ入力に対し圧縮前後の出力を並べて比べる。評価は数値指標に加え、現場担当者の「使える品質か」「待たずに済むか」という実感で確かめる。目指す到達点は、品質と速度の許容ラインを現場の言葉で決めることである。
- 運用と横展開:合格基準、再生成の判断ルール、コスト記録の方法を文書にし、他部署へ広げる。目指す到達点は、生成コストと待ち時間を継続的に管理できる運用体制である。
全体として目指すのは、動画生成が「待つもの」から「その場で試せるもの」に変わり、企画と検証の回転が上がる状態である。
今後の展望
留意点もある。報告されている結果は特定のモデルと解像度の条件に基づく。自社の素材や用途で品質が保たれるかは、別途の検証が要る。VBenchは汎用の評価指標であり、ブランドの一貫性や商品の再現性といった業務固有の基準は、各社が独自に設ける必要がある。圧縮版の入手可否や利用条件も、導入前に確認すべき事項である。
それでも、モデルを大きくして品質を上げる流れに対し、既存モデルを賢く圧縮して実用速度に近づける流れは、利用企業のコスト構造に直結する。動画生成を業務に組み込む企業にとって、推論効率は競争力を左右する要素となりつつある。
関連トピック
この記事のアイデアを、あなたの現場で試してみませんか。 どのくらいのコストで作れて、どのくらい手間やコストが減るかを一緒に試算し、試作から導入まで伴走します。
導入を相談する →同セクションの記事
動画編集AI、挿入物を人の動作に連動させる
動画に後から加えた物体が、持ち上げられるなど元映像の動作と噛み合うよう編集するAI「ALIVE」が登場した。撮り直しに頼ってきた広告・研修動画の制作工程を変える可能性がある。

画像生成AIの内部を言葉で読み解く手法
画像生成AIの内部状態に自然言語で質問し、生成途中の絵の中身を読み取る手法が提案された。内部情報を品質改善にも使えると示した点で、制作現場の品質管理に影響しうる。

GenCine、3D上で撮影と動きを統合制御
米研究チームは、1枚の画像から3Dシーンを作り、カメラと被写体の動きを同時に指定できる動画生成システムGenCineを発表した。広告や映像制作の工程短縮に直結する技術である。
