埋め込み予測で画像生成の学習計算を3分の1に
画像生成の拡散Transformerに、ステップごとに更新する予測埋め込みを条件として与える手法NEPAが提案された。ImageNetでFID1.32を達成し、学習計算量は従来REPAの約3分の1である。

研究の概要
Sihan Xu氏らの研究チームは、画像生成で広く使われる拡散Transformer(DiT)の条件付け方式を見直した論文を公表した。従来のDiTは、クラスラベルやテキストプロンプトを一度だけ埋め込みに変換し、ノイズ除去の全ステップで同じ条件を使い回す。研究チームはこの固定条件の代わりに、予測された埋め込みを条件に使えるかを検証した。
中核となるのが、系列の次の連続的な埋め込みを予測するNext-Embedding Predictive Autoregression(NEPA)である。画像生成では、ノイズ画像の後に続くのが最終的なクリーン画像であるため、その埋め込みは「条件とノイズ画像の次の埋め込み」と位置づけられる。研究チームはこれらを一括で予測するMulti-Embedding Predictionを設計した。さらにEmbedding Conditioned Generationでは、DiT生成器がこの予測を条件として受け取り、予測自体をノイズ除去の各ステップで再計算する。これにより、条件信号が現在のノイズ状態に応じて変化する。
実験はクラス条件付きImageNet 256×256で行われ、生成器の条件、Multi-Embedding Predictionの設計、両モデルの規模拡張を検証した。表現整合を用いる既存手法REPAと組み合わせた最終モデルNEPA-DiT-XLは、FID 1.32を記録した。学習計算量はREPAの約3分の1にとどまる。一方、NEPAモデルが各サンプリングステップに第二のネットワークとして加わるため、推論時の計算負荷は増える。
ビジネスへの示唆
最大の意義は、高品質な画像生成モデルの学習コストを引き下げる可能性を示した点にある。自社で生成モデルを学習・微調整する企業では、GPU調達費や学習期間が主要なコスト項目である。学習計算が約3分の1になれば、モデル開発部門の試行回数を増やし、開発サイクルを短縮できる余地が生まれる。
影響が見込まれる部門とKPIは次のとおりである。
- 広告・マーケティング部門:クリエイティブ生成モデルの内製化にかかる学習コスト、バナー1点あたりの制作単価、制作リードタイム
- EC・小売の商品企画部門:商品画像やバリエーション生成の品質(FID等の画質指標)と、A/Bテストの実施回数
- ゲーム・映像制作のアセット制作部門:コンセプトアート生成の反復速度と外注費
- AI基盤・MLOps部門:学習あたりのGPU時間、クラウド計算費、モデル更新頻度
ただし、推論時にはステップごとに追加ネットワークを実行するため、画像1枚あたりの生成時間と推論コストは増加する。学習費の削減と推論費の増加はトレードオフであり、生成量の多いサービスほど総保有コストの試算が不可欠である。学習は一度、推論は継続的に発生するため、大量配信型の用途では推論側の負担が利益を圧迫する可能性がある。逆に、基盤モデルを頻繁に再学習・特化させる用途では、学習側の削減効果が優位になりやすい。
今後の展望
今回の検証はクラス条件付きのImageNetに限られており、テキストから画像を生成する実務的な設定での有効性は、論文の範囲では示されていない。商用のテキスト画像生成や高解像度化、動画生成へ適用した際に同程度の効率改善が得られるかが、次の焦点となる。
企業にとっては、当面は研究動向の監視と小規模な検証が現実的である。自社の画像生成ワークロードについて、学習費と推論費の比率を把握したうえで、条件付け方式の改良が総コストに与える影響を評価する体制を整えることが求められる。推論時の追加ネットワークを軽量化できれば、導入のハードルは大きく下がる見通しである。
関連トピック
同セクションの記事
VISTA、AIの行動効率を人間超えに高める
MITなどの研究チームは、視覚記憶を備えた補助基盤「VISTA」を開発した。ARC-AGI-3で、Claude Opus 5.0の行動効率が40.68から100.00に向上した。

着想源の論文検索、AIは著者に及ばず
スタンフォード大などの研究チームは、研究着想の源となった先行論文をAIが探せるかを測るベンチマークを公開した。最高性能のエージェントでも再現率は0.51にとどまり、R&D現場での検索支援の限界が示された。

KaliBenchがAIのコマンド生成力を測定
Kali Linux上のコマンド生成力を測る新ベンチマーク「KaliBench」が公開された。ヒントなしの条件では完全一致精度が42%を超えるオープンモデルはなかった。専用の報酬による学習で8Bモデルが685B級に迫った。
