お客様のご来店を歓迎します!
mechb2b業界ニュース初めて予測世界モデルを人型歩行に導入:サツマイモWM-LOCOロボットの現場を梅の杭で歩かせる
人型ロボットが梅の杭、断橋、狭踏面階段などの複雑な地形に直面したとき、本当にその前に横たわっている試練は、「足元を見る」ことだけではない。
しかし、まばらで離散的で幾何学的に制限された足の踏み場では、足の裏が数センチずれると踏み外してしまう可能性があります。ロボットが瞬間的に誤った選択をすると、調整が間に合わず、体のバランスが崩れてしまうことがよくあります。
重要な問題が浮かび上がった。ロボットは現在の一歩を踏み出す前に、その一歩が自分をどのような未来に導くのかを事前に判断することができるだろうか。
この問題を解決するために、サツマイモロボットアルゴリズムチームはWM-LOCOと略称するWorld Model Augmented VisualLocomotionを提案した。
WM-LOCOは、将来の視覚と運動状態予測に向けた世界モデルを人型ロボットの複雑な地形歩行に導入し、シミュレーションでエンドツーエンドの合同訓練を行い、zero-shot真機移動を実現した。これは、シミュレーションで訓練されたポリシーをソリッドロボットに直接配置することができ、二次調整を必要としないことを意味します。
WM-LOCOアーキテクチャ図:左側はPPO戦略、右側は循環世界モデル、両者はエンコーダを共有し、エンドツーエンドの共同訓練
簡単に言えば、過去のロボットは「目の前で見た」ことに基づいて次のステップを決めることが多かった。WM-LOCOはロボットに「未来を予測して、次のステップを決める」ことを学ばせた。
  
従来の視覚強化学習では、通常、現在および履歴の視覚情報をロボット本体の状態とともに戦略ネットワークに入力し、各関節制御命令をリアルタイムで出力する。
このような観測履歴に基づく戦略は、ロボットがすでに経験している情報を「見る」ことができ、連続する複数フレームの画像や本体状態履歴を入力することで、ロボットがこれまでどのように動き、地形がどのように変化したかを判断し、それに基づいて現在の動作を生成することができる。
しかし、問題は、ポリシーが利用する常に「過去型」の情報であり、「ある動作がもたらす可能性のある将来の状態変化」を明示的に学習することはできないということだ。この制限は平地と規則的な地形では明らかではないが、梅の杭、断橋、狭踏面階段などのような足の踏み場が厳格に制限された地形に直面すると、観測履歴に基づいて意思決定を行う短板が急激に拡大される。
複雑な地形歩行のため、相互に相関しない1ステップ動作の単純な重ね合わせではありません。
今実行可能に見える動作では、次の瞬間にロボットが歩けない状態に陥る可能性があります。
したがって、ロボットは「これまでに何が起こっていたのか」を理解するだけでなく、この動作を実行すると、次に何が起こる可能性があるのかを予断する必要があります。
  二、戦略に「未来」への理解を入れる
WM-LOCOは、ロボットの人工機械負荷深度視覚と本体感知情報を同時に受信し、循環式世界モデルを通じて、隠れた空間の中でロボット、動作と環境の間の動的関係を学習し続けている。
強調しなければならないのは、この世界モデルの目的は、人が見るための未来のビデオを生成することではなく、よりコンパクトでリアルタイム制御に適した未来の状態特性を学習することである。WM-LOCOは、各時点で3つの質問に答えてみます。
ロボットと地形は今どんな状態ですか。
動作を実行した後、視覚と体の状態はどのように変化しますか。
この変化は次の安定した歩行に有利ではないでしょうか。

学習観測再構築、潜在状態遷移、タスクフィードバック予測を通じて、世界モデルは徐々に未来の運動傾向を含む動的特徴を抽出し、そしてこれらの情報をPPO戦略にフィードバックする。
これにより、戦略的に得られるのは現在の深さ画像中の階段、障害物、足を踏み入れる領域だけでなく、歴史的な運動軌跡だけでなく、ロボットの身体状態が次にどのように変化するかに関する展望的な情報も含まれている。

これはWM-LOCOと通常のマルチフレーム入力ポリシーの核心的な違いです。観測歴史の主な支援策は「過去に何があったのか」を理解すること、世界モデルは、観測、動作と未来の状態との動的関係をさらに学習し、戦略が「次に何が起こるか」を推論できるようにする。
これにより、戦略の決定は歴史情報だけに依存するのではなく、将来に向けた予測能力を本当に備えている。
  三、エンド・ツー・エンドの訓練、煩わしい流れに別れを告げる
ロボットを複雑な地形に通過させるために、多くの技術ルートはシステムを知覚、定住点計画、軌跡生成、教師戦略、底辺制御などの複数のモジュールに分割する。
一部の案では、まず完全な地形真値を用いて「オンフック」の教師戦略を訓練し、知識蒸留を通じて、機上センサーを用いた学生戦略に能力を移行する必要がある。このようなスキームのコストは、トレーニングリンクがより長く、人手による設計が多く、データ構築コストがより高く、複数のモジュール間の誤差が段階的に伝達され、階層的に増幅される可能性があることにあります。
対照的に、WM-LOCOはより直接的で簡潔なパスを選択しました。世界モデルと歩行戦略は、同じトレーニング中にエンド・ツー・エンドで最適化されます。
全体のシステムは、あらかじめ計画された足端軌跡に依存せず、教師-学生式多段階蒸留を必要とせず、複雑な多専門家構造を必要とせず、複数の独立モジュールを個別に訓練する必要もない。
世界モデルによって学習された動的情報も、再構築のために再構築するのではなく、戦略がより良い次の意思決定を行うのを支援するという目標に直接サービスします。
  四、より高い成功率、より自然な足取り
同じ視覚入力とタスク設定の下で、アルゴリズムチームはWM-LOCOをベースラインPPO戦略と比較した。
足の踏み場がますますまばらになり、狭くなり、不連続になるにつれて、2つの方法は明らかな差を示した。歴史を観測する純PPO戦略だけに依存すると、早期に足を踏み入れたり、頻繁に打診したり、左右の足のリズムが合わなかったり、局所的な動作が可能で、その後も続けられない問題が発生しやすくなります。一部の高難度地形では、単純PPOでは安定した通過能力を形成することさえ困難である。
世界モデルを導入すると、梅花杭、断橋、狭踏面階段、丸木橋などの複雑なシーンでのロボットの成功率は著しく向上し、シミュレーションでは100%に近づいた。一方、ロボットは突発的な修正と躊躇的な足並みを減らすことができます。

本機では、同一セットの重みをzero-shot方式でUnitree G 1に配置した:踏み石、階段、隙間の3種類の地形を各10回テストし、平均成功率は93.3%だった。その中の0.8メートルの幅の隙間は、ロボットが完全な「足を振る―渡る―着地する」動作で一歩踏み出す―安全上、チームはより広い隙間をテストし続けなかったが、これは現在公開されている仕事では珍しい真機の乗り越え距離となった。
  五、真機現場検証:Demoだけではない
市販の作業では、スクリーニングされたdemoビデオが一般的に示されており、実際の環境におけるアルゴリズムの安定性を完全に反映することは困難であることが多い。
現場展示は全く違います。ロボットは、実際のセンサノイズ、デバイス状態の変化、光干渉、およびやり直せない単回運転に直面する必要があります。いかなる感知や制御ミスも、観客の前に直接さらされる。
最近の旭日S 600メディアコミュニケーション会では、WM-LOCOを搭載した人型ロボットが現場で公開真機展示を終えた。アルゴリズムはリアルロボット、リアルセンサー、旭日S 600計算プラットフォーム上でリアルタイムに動作し、視覚知覚、世界モデリングから全身運動制御までの完全な閉ループを完成した。
ビデオdemoを主な展示形式とする複雑な地形走行のデモと比べて、公開現場運行はアルゴリズムの安定性、リアルタイム性と配置信頼性に対してより高い要求を提出し、WM-LOCOの工事信頼性、真実配置可能性と高い成功率をさらに検証した。
世界モデルは未来を生成するだけでなく、ロボットが未来を理解するのにも役立ちます。
ロボットが観測履歴に基づいて意思決定を行い、さらに能動的に動作結果を予測すると、その走行ロジックも変化します。まず未来を予測してから、次のステップを踏み出します。
 (抜粋)
最新情報