AI×マーケティング読了 約4分

画像生成AI、自己修正力を強化学習で獲得

香港中文大学系などの研究チームは、画像を見て自ら描き直す統合モデルに強化学習を適用する手法を開発した。外部の検証器なしで生成品質が向上し、実務展開の負担軽減が期待される。

画像生成AI、自己修正力を強化学習で獲得
広告

研究の概要

研究チームは、画像の理解と生成を一つのモデルで担う統合マルチモーダルモデルに、自らの生成物を点検して修正する能力を持たせる手法「UMM-Reflection」を発表した。生成された画像の誤りを言葉で診断し、その診断に基づいて画像を描き直し、結果を再び観察して診断を繰り返す、という一連の流れをモデル内部で完結させる点が特徴である。

従来、この種の修正は二つの方法で試みられてきた。一つは、人間が作った修正例を教師データとして学ばせる教師あり微調整(SFT)である。ただし、初期の動作は得られるものの、成功率の高い修正経路を自ら見つけることはできない。もう一つは、画像生成部分だけ、あるいは診断を担う部分だけを強化学習で鍛える方法である。この場合、改善の余地の大半が未回収のまま残るという。修正が有効か否かは、実際に描き直した後でなければ分からないためである。

新手法は、診断文の生成と画像の修正を含む一連の軌跡全体に強化学習を適用する。同じ初期画像から複数の修正軌跡を派生させ、その成果を相対比較することで、どの反省の仕方が有効かを学習させる。さらに、軌跡単位の一つの評価値で、診断を書く部分と画像を描き直す部分の双方を同時に更新する。修正の各回に個別の貢献度を割り当てると組み合わせが爆発的に増えるが、この設計によって回避している。推論時に外部の検証器を必要としない点も特徴である。

性能と汎化

画像生成モデルBAGELを基盤とした実験では、生成画像の指示への忠実度を測るGenEvalで、SFTに比べ12.05ポイントの改善を記録した。注目されるのは、学習に一切使っていない評価指標でも改善が確認された点である。世界知識を要する生成を問うWISEで10.97ポイント、OneIG-Benchで3.48ポイント、複数物体の組み合わせを問うT2I-CompBench++で4.63ポイントそれぞれ向上した。特定の試験への過学習ではなく、修正能力そのものが一般化したことを示唆する。

ビジネスへの示唆

最も影響が大きいのは、広告・マーケティング分野のクリエイティブ制作である。商品画像やバナーでは、指定した色、個数、配置、ロゴ位置の誤りが頻発し、担当者が生成と目視確認を繰り返す手戻りが工数を圧迫している。自己修正型モデルが普及すれば、一発採用率の向上、修正指示回数の削減、制作リードタイムの短縮といったKPIの改善が見込まれる。

EC事業者にとっても、商品カタログ画像の大量生成における不良画像の混入率が下がり、人手による検品コストの低減につながる。製造業では、設計部門が外観イメージや製品ビジュアルを短期間で複数案作成する場面で、仕様書の記述との整合性が高まれば、試作前の意思決定が速まる可能性がある。

運用面での利点も大きい。外部の評価モデルを別途用意して常時稼働させる構成では、推論コストと システム管理の負荷が増える。単一モデルで完結すれば、以下の指標で有利になると考えられる。

  • 画像1枚あたりの推論コスト(GPU時間)
  • システム構成の保守工数
  • 品質確認に要する人員配置

ただし、反省と再描画を繰り返すため、1回の生成あたりの計算量は増える。品質向上と遅延・コストのバランスは、用途ごとに検証が必要である。

今後の展望

今回の成果は、オープンな統合モデルを基盤とした研究段階のものであり、商用サービスでの安定性や、著作権・ブランド表現に関する統制への対応は今後の課題である。一方で、生成AIを使う企業にとって、品質保証の仕組みをモデルの外側に置く発想から、モデルの内側に組み込む発想への転換を示した意義は大きい。画像生成の業務適用を検討する企業は、修正回数あたりの品質改善幅と追加コストを測る評価基盤の整備を進めることが望ましい。

関連トピック

出典: Learning Native Reflection in Unified Models with Interleaved Reinforcement Learning, Yijia Fan, Ziqi Huang, Zhongang Cai, Yan Li, Zimo Wen, Wanqi Yin, Haiwen Diao, Ziwei Liu, arXiv:2609.35767v1

本記事はAIにより執筆され、Affectosphere Group が監修しています。

同セクションの記事

広告