AI×製造読了 約4分

MoSE3、全画素の6自由度運動を推定

研究チームが単眼動画から全画素の回転と並進を世界座標系で直接推定するAIモデル「MoSE3」を発表した。点追跡では得られなかった部位の回転や剛体のまとまりを捉え、ロボットや映像制作への応用が見込まれる。

MoSE3、全画素の6自由度運動を推定
広告

研究の概要

動的な場面の動きを捉える手法としては、動画内の各画素が3次元空間でどう動くかを追う「3D点追跡」が主流であった。ただし点追跡が与えるのは、画素ごとの3自由度の並進軌跡にすぎない。対象部位がどれだけ回転したか、どの画素が一つの物体として一緒に動くかは分からない。

Jiahuan Cheng氏らの研究チームは、単眼のRGB動画から全画素の**6自由度剛体変換(SE(3))**を世界座標系で出力するフィードフォワード型モデル「MoSE3」を提案した。この種のモデルとしては初であるとしている。回転、並進、物体のグルーピングを一度に得られる点が特徴である。

回転は曲がった多様体上にあり、通常の回帰手法には適さない。SE(3)の正解注釈を集めることも難しい。そこで同モデルは、3D点軌跡と「剛性埋め込み」という二つの中間表現を同時に学習する。続いて、軟らかく分けた剛体クラスタごとに変換を微分可能な形で当てはめ、SE(3)を復元する。これにより、端から端までの学習と教師付けが可能になった。

データ不足に対しては、関節を持つ物体と物理的な相互作用を含む大規模合成データセットArt-Kubricを新たに構築した。密なSE(3)と剛性のラベルを備える。評価では、剛体・関節物体の両ベンチマークで、画素・部位・物体の3水準すべてで最高精度のSE(3)推定を達成した。3つのデータセットを通じた3D点追跡の平均精度も最高である。合成の運動データのみで学習しながら、実世界の動画にも高い汎化性を示したという。

ビジネスへの示唆

以下は論文が示す能力から導かれる応用の見通しであり、個別の導入効果は実証されていない。

製造・物流分野では、ロボットによるピッキングや組立工程が候補となる。扉、レバー、アームなど関節を持つ対象の動きを、特殊なセンサーや3Dモデルなしに単眼カメラで把握できれば、生産技術部門や物流センターの自動化担当者は、把持の成功率やライン停止時間といった指標の改善を検討できる。

自動車や建設機械の分野では、可動部の挙動を映像から定量化できる。品質保証部門は、検査工数の削減や不具合の検出率向上に役立てる余地がある。

映像制作、AR・VR、ゲームの分野では、動画から部位ごとの回転と動きを取り出せる。モーションキャプチャ機材や手作業のリギング(骨格設定)への依存を下げ、制作期間と外注費を抑える可能性がある。

医療・リハビリやスポーツの分野では、関節の回転角を通常のカメラ映像から推定する用途が考えられる。

主に影響を受ける部門と指標は次のとおりである。

  • 生産技術・ロボット開発:把持成功率、サイクルタイム
  • 品質保証:検査工数、不良検出率
  • コンテンツ制作:制作リードタイム、外注コスト
  • 研究開発:訓練データの注釈コスト

合成データだけで実映像へ汎化した点は、実機での注釈収集に要する費用と期間を抑えられることを示唆する。高コストな実環境データ取得に頼らない開発モデルは、投資判断にも影響し得る。

今後の展望

論文要旨からは、推論速度や計算資源の要件、工場や屋外など厳しい撮影条件での頑健性は読み取れない。現場導入に向けては、リアルタイム処理の可否、遮蔽や反射の多い環境での精度、非剛体の扱いなどの検証が課題となる。

一方で、点の軌跡から剛体の運動へと表現を引き上げる流れは、ロボットの世界モデルや動画生成モデルの制御性向上にもつながる。Art-Kubricのような合成データが公開され、学習と評価の基盤が整えば、企業が自社の対象物に合わせて追加学習する道も開ける。映像から物体の動きを構造として読み取る技術の実用化競争は、今後本格化する公算が大きい。

出典: MoSE3: Learning World-Space SE(3) at Every Pixel, Jiahuan Cheng, Zhiyi Li, Tian Xia, Ruojin Cai, Yilun Du, Qianqian Wang, arXiv:2610.03716v1

本記事はAIにより執筆され、Affectosphere Group が監修しています。

同セクションの記事

広告