米大学とMeta、長尺動画の全点3D追跡に成功
カーネギーメロン大学やMetaの研究チームが、動画内の全ての点を1000フレーム超にわたり3D空間で追跡できるAI「TrackEverything」を発表した。ロボット操作やAR/VR、自動運転の認識精度向上に直結する基盤技術として注目される。
研究の概要
米カーネギーメロン大学やMeta Reality Labs等の研究者らは、動画中の全ての点を3次元空間で長時間にわたり追跡できる新手法「TrackEverything」を発表した。論文はプレプリントサーバーarXivに公開された。
従来の点追跡技術には、少数の指定点を長時間追跡するか、全ての点を短い動画区間でのみ追跡するかという二者択一の制約があった。研究チームはこの課題を、動画を「3次元世界の2次元投影」と捉え直すことで解決した。動画をワールド座標系における永続的な3Dシーン軌跡として表現し、モデルの計算量を動画の長さではなく、シーン固有の物理的な形状の複雑さに依存させる設計とした。
技術の核心は3点ある。第一に、スライディングウィンドウの境界でボクセル化に基づく重複除去処理を行い、同一表面の繰り返し観測による軌跡の冗長な蓄積を防ぐ。第二に、各点の到達地点と静止・動的の分類を予測する処理と、動的な点のみに絞って密な軌跡を復元する軽量処理とを分離した。第三に、メモリを大量消費する4D相関ボリュームに代えて、シーン点群上で効率的に特徴を取得する「3D WAFT」を導入した。
これにより、TrackEverythingは40GBのGPUメモリで1000フレームを超える動画の全可視点を追跡できる、初の3Dトラッカーとなった。ベンチマークTAPVid-3Dでは、短い動画区間でオープンソースの全フレーム密3Dトラッカーを精度指標APDで20%以上上回り、長時間動画でも追跡点数がはるかに多いにもかかわらず最先端のスパーストラッカーに匹敵する性能を示した。
ビジネスへの示唆
本技術は、映像から3次元世界の動きを長時間・低コストで復元できる点で、複数の産業に実用上の意味を持つ。
- ロボティクス: 倉庫のピッキングロボットや組立ラインのロボットが対象物を見失わずに3D追跡できれば、把持成功率や工程停止時間の改善が見込める
- AR/VR: 共同著者にMeta Reality Labsの研究者が名を連ね、ヘッドセット向け空間認識やアバター表示の安定化に直結する。仮想オブジェクトのドリフト低減はアプリ滞在時間などのKPI向上につながる
- 自動運転: 車載カメラ映像から歩行者や他車両の3D軌跡を長時間安定して追跡できれば、ADAS認識部門の誤検知率低減に寄与しうる
- 製造業の外観検査: ベルトコンベア上を流れる部品の3D位置を連続追跡することで不良検知率の向上が期待できる
- 映像制作・スポーツ分析: マーカーレスでの選手動作解析やVFX制作のコスト削減にもつながる可能性がある
今後の展望
研究チームは40GBのGPUメモリという制約下での実装を強調しており、既存のクラウドGPUインスタンスでも運用可能な実用性を意識した設計であることがうかがえる。一方で、1000フレームを超えるさらに長時間の映像や、屋外の広域環境への適用可能性は今後の検証課題として残る。
企業が本技術を業務に組み込む際には、既存の2Dベース画像認識パイプラインを3D軌跡データへ置き換える際の再学習コストや、リアルタイム性が求められる用途での処理速度の検証が必要となる。今後、ロボティクスやAR/VR各社による実証実験の進展が、商用化の速度を左右するとみられる。
同セクションの記事
小型AIの誤答、外部検証層が全件阻止
産業設備の試運転作業でAIが根拠のない設定案を捏造しても、外部の検証機構が全件を却下できることが実験で示された。ただし実運用では146件中1件の誤採用も記録され、限界も明らかになった。

コーディングAI、ロボ計画で人手超え
米欧研究チームが、汎用のタスク・動作計画(TAMP)問題にコーディングAIエージェントを適用し、従来の手作業設計プランナーを上回る成功率を達成した。ロボット制御ソフトの自動生成に道を開く成果である。

OmniFabric、単一画像から衣服3D素材を生成
研究チームは、1枚の衣服画像から照明や影を含まない高品質なテクスチャを縫製パターン上に合成する手法OmniFabricを発表した。物理シミュレーションや再照明に耐える3D衣服資産の量産に道を開く技術である。
