DMAD、高速画像生成の蒸留を簡素化
中国・米国の研究チームが、拡散モデルを少ステップで動かす蒸留手法DMADを発表した。補助モデルを不要とし、1~4ステップで教師モデルを上回る品質を示し、生成コストの削減に道を開く。

研究の概要
Zhengming Yu氏らの研究チームは、画像・動画生成に用いる拡散モデルを少ないステップで動作させる新たな蒸留手法「DMAD」を発表した。従来の代表的手法であるDMD(分布マッチング蒸留)は、生徒モデルの分布に追従させる補助的な拡散モデルを別途保持する必要があり、メモリと計算の負担が大きかった。
DMADは分布マッチングを分類問題として捉え直した点に特徴がある。共有の骨格ネットワークに2つの識別器ヘッドを設け、実データおよび教師モデルの生成物を生徒モデルの生成物と区別させる。識別器の出力に対する線形損失で生徒を訓練するため、補助モデルのスコア推定が不要となる。研究チームは、識別器が最適の場合にこの損失がDMDの分布マッチング勾配を再現することを理論的に示した。さらに、実データと教師生成物の識別器出力の差に応じてノイズ水準ごとの教師の監督強度を調整する「ギャップに基づく再重み付け」も導入した。
評価結果はImageNet-64x64で1ステップのFID 1.04、SDXLの4ステップでCOCO-10KにおいてFID 14.47、Wan2.1-T2V-14Bの4ステップで動画評価VBenchの総合スコア85.15である。いずれも比較対象の少ステップ手法に加え、多ステップの教師モデルをも上回る最良値という。音声付き動画を生成するMiniMax-H3-33Bでは、4ステップの生徒モデルが、同種手法のDMD2に対し79.1%、rCMに対し**84.6%**の人間評価での選好率を得た(引き分けを除く)。
ビジネスへの示唆
生成AIの運用では、推論時の計算量がそのままコストと遅延に直結する。ステップ数を数十から1~4に圧縮しつつ品質を維持できれば、影響は広範な業務に及ぶ。
- 広告・マーケティング部門: 多数のバナーや動画クリエイティブを生成する場合、1本当たりの生成単価と制作リードタイムが低下する。A/Bテストの試行回数を増やせるため、クリック率やコンバージョン率の改善サイクルを短縮できる。
- EC・小売の商品企画部門: 商品画像の背景差し替えや着用イメージ生成を、ほぼリアルタイムで提供できる可能性がある。
- メディア・映像制作: 14B~33B級の大規模動画モデルを4ステップで動かせれば、試作映像の確認待ち時間が短縮される。音声付き動画の生成にも適用が確認されたことは、短尺コンテンツ制作の内製化を後押しする。
- 情報システム・クラウド運用部門: GPU稼働時間と電力の削減が見込まれる。1リクエスト当たりの推論コスト、スループット、GPU利用率が主要なKPIとなる。
加えて、訓練側の負担軽減も実務上の意義が大きい。補助拡散モデルの保持が不要になるため、蒸留に要するメモリ量と計算資源が減る。自社データで基盤モデルを高速化したい企業にとって、蒸留の初期投資を抑えられる点は利点である。ただし、論文が示す削減効果は主に品質指標であり、訓練コストや推論コストの具体的な削減率は、導入前に自社環境で検証する必要がある。
今後の展望
研究チームはコード、モデル、デモを公開しており、企業が検証に着手しやすい環境が整っている。今後は、リアルタイム対話型の画像編集や、ライブ配信向けの動画生成など、遅延が事業価値を左右する用途への展開が焦点となる。
一方で、評価は公開ベンチマークと人間評価が中心であり、自社ブランドの表現や特定ドメインでの品質、著作権・安全性への配慮は別途確認を要する。識別器を用いる学習は不安定になりやすいとされ、実運用での再現性も見極めが必要である。高速化と品質の両立を示した今回の成果は、生成AIの採算性を左右する推論コスト競争を一段と加速させる可能性がある。
関連トピック
同セクションの記事
複数教師の蒸留、学習の落とし穴を解明
複数のRL教師の能力を1つの小型モデルへ統合する蒸留で、損失の平均化方式や数値精度が成果を左右することが判明した。AI開発の品質管理と計算コストに直結する知見である。

OmniSeek、音声映像を能動的に探索
長い音声付き映像から、必要な場面を自ら選んで見聞きする推論AI「OmniSeek」が登場した。映像と音声の両方を根拠とする推論を促し、監視や会議分析の精度向上に道を開く。

ループ型AI、推論精度向上と計算半減を両立
米研究チームが、ループ型Transformerの途中計算を活用し追加学習なしで推論精度を高める手法LoopCDを開発した。ループ数を半減しても同等以上の精度を保ち、演算量を最大48.2%削減した。
