AI×製造読了 約4分

反実仮想動画で人型ロボの搬送技能を量産

米研究チームが、少数の実映像から数百本の多様な動画を生成しヒューマノイドに物体搬送を学習させる手法PRISMを開発した。実機での追加調整は不要で、物流現場の導入コスト低減につながる。

反実仮想動画で人型ロボの搬送技能を量産
広告

研究の概要

カリフォルニア大学バークレー校のピーター・アビール氏、ジテンドラ・マリク氏、スタンフォード大学のC・カレン・リュー氏らの研究チームは、人型ロボットに物体の運搬といった移動しながらの操作技能を習得させる枠組み「PRISM」を発表した。人間の動作映像を模倣させる手法は汎用ロボットへの有望な道とされてきたが、全身が明瞭に映り、物体との接触が遮られていない高品質な映像を多様に集める負担が、規模拡大の障壁となっていた。

PRISMはこの障壁を、映像の「水増し」によって解消する。まず、少数の実映像を入力として、動画から動画を生成するV2V技術により、物体の種類や大きさ、状況を変えた「反実仮想」の人物・物体相互作用動画を数百本規模で作り出す。次に、接触位置を基準とする独自のリアル・トゥ・シム処理により、映像から人と物体の動きを再構成する。生成動画には不整合が含まれるが、これを物理的に成立する軌道へ変換して補正する。

同じカテゴリー内で物体の形状や大きさが多様な映像を学習に用いることで、単一の方策が未知の物体にも対応できるようになる。実機実験では、実世界での追加学習なしに、機体搭載の深度センサーのみを使って、箱、樽、ゴミ箱、ボールを持ち上げ、運び、降ろす動作を実現した。対象は未学習の個体、異なる寸法、異なる初期配置を含む。

ビジネスへの示唆

最も直接的な影響を受けるのは、物流・倉庫業である。入出荷や仕分けの現場では、箱やカゴ車、ドラム缶など形状の異なる荷物を扱う。従来は対象物ごとに遠隔操作データを収集する必要があり、データ取得の工数が導入の律速となっていた。少数の映像から学習データを増殖できれば、新規品目ごとの教示工数と立ち上げ期間の短縮が期待できる。

製造業では、工場内の部品コンテナや資材の搬送工程が候補となる。無人搬送車が通れない段差や狭い通路でも、人型機体が荷を運べれば、ライン間搬送の省人化に寄与する。施設管理や小売のバックヤードでも、ゴミ箱の回収や商品ケースの移動といった定型作業の自動化が視野に入る。

導入企業が注目すべき指標は次のとおりである。

  • 新規物体への対応に要するデータ収集工数と教示期間
  • 未学習の物体に対する把持・搬送の成功率
  • 現場での再調整に要する停止時間と保守コスト
  • 1時間当たりの搬送件数と人件費の削減率

ロボット開発を担う研究開発部門にとっては、実機を使ったデータ収集費用を、生成AIの計算資源費用に置き換えられる点が重要である。遠隔操作者の確保や実機稼働の制約から解放されるため、開発サイクルの高速化に資する。一方、現場担当者の映像を教師データとして使う場合は、撮影対象者の同意や映像の取り扱いに関する社内規程の整備が要る。

今後の展望

今回の実証は、箱や樽などの搬送という比較的単純な動作に限られる。生成動画の品質が低い場合の軌道補正の限界や、重量物・壊れやすい物体への対応、複数工程を組み合わせた長時間作業への拡張は、今後の検証課題である。また、使用したセンサーが深度のみであるため、照明や床面の条件が異なる実環境での頑健性も確認を要する。

もっとも、動画生成モデルの性能向上は急速に進んでおり、映像の水増し手法の精度は今後も高まる公算が大きい。ロボット基盤モデルの学習データ不足は業界共通の課題であり、生成映像を活用する発想は、人型ロボットの事業化を目指す企業の投資判断に影響を与えるとみられる。現場の実映像を少量蓄積し、自社の対象物に合わせて拡張する運用体制の構築が、先行導入の鍵となる。

関連トピック

出典: Counterfactual Video Generation Enables Scalable Humanoid Loco-Manipulation, Zihan Wang, Zhen Wu, Pieter Abbeel, Rocky Duan, Jitendra Malik, Carmelo Sferrazza, C. Karen Liu, Guanya Shi, Angjoo Kanazawa, arXiv:2609.38172v1

本記事はAIにより執筆され、Affectosphere Group が監修しています。

同セクションの記事

広告