Generalistは、1つのロボティクス基盤モデルが多様なハンドにまたがって拡張できると主張する

ロボティクスのスタートアップであるGeneralistは、同社の具身体基盤モデルGEN-1が現在、標準的なグリッパーを超えて、5本指のハンド、専用ツール、カスタムのアクチュエーション構成まで含む幅広いロボットエンドエフェクタをサポートしていると述べている。この発表は、物理AIにおける中心的な野心を示している。すなわち、世界との多様な関わり方にまたがって一般化できる単一の基盤モデルを構築し、各操作インターフェースを一から学習し直すのではなくすることだ。

The Robot Reportによれば、GeneralistはGEN-1が、1つの基盤となるモデルで大きく異なるembodimentをまたいで移転する感覚運動ポリシーを学習できるよう訓練されたと述べている。実用的には、同社はロボットに特定のグリッパーの操作方法だけでなく、ロボットの「手」が変わっても役立つ再利用可能な物理的理解の構築方法を教えようとしていることになる。

この概念は、言語や画像システムにおける大規模基盤モデルの役割を想起させる。広範な事前学習は、後で専門化できる適応可能な能力を生み出すことを目的としている。しかしロボティクスでは問題がさらに難しい。ハードウェアは大きく異なり、センサー位置は変わり、アクチュエーション方式も変化し、ミスの物理的結果は即座に現れる。Generalistの主張は、多様なツールとハンド構成にまたがってデータを拡張することで、この断片化の一部を克服できるというものだ。

同社の主張は、データ規模とembodimentの多様性に立脚している

Generalistは、GEN-1が50万時間を超える実世界の相互作用データを含む社内ロボティクスデータセットで事前学習されていると述べた。同社はさらに、そのデータセットが、市販ツール、3Dプリント部品、2本指グリッパーのカスタム改造、商用ユースケースに着想を得たフォームファクタを含む、幅広いエンドエフェクタを網羅していると説明している。合計で約9,000種類のバリエーションがあるという。

この幅広さが同社の提案の核心だ。1つのハンド設計に最適化するのではなく、Generalistは異なるエンドエフェクタを同じ物理世界への異なるインターフェースとして扱っている。5本指のハンド、テープディスペンサー、ヘラ、ドライバーは、それぞれ異なる制御問題を生み出すかもしれないが、いずれもモデルに幾何、力、摩擦、接触、運動制約を露出させる。こうしたインターフェースが多様であるほど、モデルの基礎にある「物理的常識」はより強くなると同社は考えている。

これは、すべてのツールが同じように制御しやすくなるという意味ではない。The Robot Reportで述べられている例では、各デバイスが独自の行動語彙を持ち込む。トングはコンプライアンスとばねのダイナミクスをもたらす。スクレーパーやヘラは、物体をつかむ問題を、表面に対する分散接触の管理へと変える。テープディスペンサーでは、張力と配置の協調が必要になる。箱切りナイフやピーラーでは、制約された経路に沿って制御された力を加える必要がある。これらはハードウェアの見た目の変化ではなく、タスクそのものの構造を変えてしまう。

Generalistのテーゼは、このような多くのインターフェースをまたいで学習することで、モデルが一般的な物理原理とツール固有の詳細を切り分けられるようになるというものだ。もしそれが実際に成り立つなら、embodiment間の移転が歴史的に難しく高価だったロボティクスにとって、大きな前進になるだろう。

エンドエフェクタの柔軟性が重要な理由

この発表の重要性は、学術的なものだけではない。商用ロボティクスでは、ロボットに取り付けられたハンドやツールが、実行できる仕事を決めることが多い。倉庫作業、軽量製造、研究室自動化、食品ハンドリング、表面仕上げ、サービス業務には、それぞれ異なる物理要件がある。狭い種類のグリッパーでしかうまく動かないモデルは、導入の柔軟性を制限し、ハードウェアが変わるたびに統合コストを押し上げる。

対照的に、エンドエフェクタをまたいで適応できる基盤モデルは、開発サイクルを簡素化できる可能性がある。ツールごとに別々の制御スタックを構築する必要を減らし、新しいタスク領域でロボットを試しやすくし、ある操作構成から別の構成へ移る際のデータ負担を下げられるかもしれない。この分野で部分的な進展でも価値があるのは、ロボティクスの持続的なボトルネックの1つが、能力が訓練時の厳密な条件の外では脆弱なままであることだからだ。

Generalistの枠組みは、AIロボティクスにおける大規模事前学習への広い移行も反映している。すべての挙動を手作業で設計したり、狭く限定されたポリシーを学習させたりするのではなく、大規模で多様な実世界データセットが、より再利用可能な表現を生み出すと企業は賭けている。もちろん課題は、システムがデモ環境を離れ、実運用でのばらつきに直面しても、その表現が信頼できる性能を出せるほど堅牢であることを示す点にある。

確定していることと、なお企業の主張であること

入手可能なソース資料は、いくつかの具体的な点を裏づけている。GeneralistはGEN-1が幅広いエンドエフェクタをサポートすると述べていること、訓練データが50万時間超の実インタラクションデータに達すること、そしてモデルが約9,000種類のエンドエフェクタ変種に触れていることだ。同社はまた、この多様性が異なるツールやembodimentをまたいで移転可能な感覚運動表現の構築に役立つと主張している。

一方で、ソースが独立して示していないのは、その移転性能が競合と比べてどれほど優れているか、新しいハードウェアにどれだけの追加調整が必要か、あるいは本番導入の信頼性要求の下でもこの手法が成立するかどうかだ。これらは、特に発表がソース文中の比較ベンチマーク研究ではなく企業共有の例を通じて行われている場合、あらゆるロボティクス基盤モデルの主張にとって重要な問いである。

それでも、この更新が注目に値するのは、この分野で最も難しい実務上の問題の1つに焦点を当てているからだ。ロボット学習が単一のマニピュレータ設計に強く結びついたままなら、有用な自動化のスケールアップは依然として高コストで遅いままだろう。共有モデルが多くのembodimentをまたいで能力を維持できれば、ロボットシステムは再利用しやすくなり、産業横断で経済的にも実用的になる可能性がある。

より一般的な物理知能へ向かう一歩

Generalistは事実上、新しいハンドが増えるたびに、モデルは同じ世界を別の方法で理解できるようになると主張している。野心的な表現だが、先端ロボティクスの多くが向かっている方向をよく捉えている。すなわち、単一タスクの制御器から離れ、ハードウェアの変化に耐えられる、より広い物理知能へ向かうということだ。

GEN-1が画期的なプラットフォームになるかどうかは、この発表を超えた結果次第だ。それでも、同社の最新更新は重要な競争前線を示している。具身体AIにおける次の飛躍は、より大きなモデルだけでなく、実際のツール、実際の接触、実際の作業という厄介な多様性をまたいで学習した内容を運べるモデルから来るのかもしれない。

この記事はThe Robot Reportの報道に基づいています。元記事を読む

Originally published on therobotreport.com