人の行動データで事前学習した人型ロボット向けモデルが、現地データや追加適応なしで未見の30家庭にまたがる3作業を実行した。Figure AIの比較評価では、ゼロショット成功率が9%から56%へ上昇した。
未見の家庭で全身を使う3作業を評価
人型ロボット向けモデルHelix 2.5は、居間の片付け、タオル畳み、ベッドメーキングを、未見の30家庭で実行した。Figure AIは、各家庭でデータを収集せず、fine-tuningや環境への適応も加えない条件で評価したとしている。
3作業では、対象物を見つける知覚から、室内を移動する歩行、姿勢の調整、物体操作までを一つの方策でつなぐ。タオルや寝具のような変形する物体も扱うため、片腕だけの固定作業ではなく、両手協調と全身制御が必要になる。
人の行動による事前学習が成功率を押し上げた
Helix 2.5は、人の行動を収録したデータセットIndexだけを使い、ランダム初期化から事前学習された。この事前学習済みモデルを初期値として使う方策と、同じ作業指定データから一から学習する方策を比べることで、人の行動による事前学習の寄与を切り分けた。
比較では、モデル構造、最適化、ハイパーパラメーター、作業指定データ、評価条件を固定した。Figure AIのblind evaluationでは、一から学習した方策の成功率が9%だったのに対し、Index事前学習済み方策は56%に達した。
全工程の完了と固定checkpointで成否を判定
成功判定は作業の一部分ではなく、全工程の完了を基準とした。居間では13~15個の玩具をすべて籠へ入れ、タオル畳みでは全タオルを畳んで籠へ収め、ベッドメーキングでは枕と掛け布団の角を所定位置へ置いて表面を整える必要があり、部分点は与えられなかった。
評価用の家庭と物体は作業指定データから除かれ、各作業には30家庭を通じて同じ固定checkpointが使われた。評価環境で得たrolloutデータや成績は、重みの適応にもcheckpointの選択にも利用されなかったため、56%という結果は評価先での再学習を含まない。
一つの基盤モデルから3方策へ展開
単一のIndex事前学習済み基盤モデルは、居間の片付け、タオル畳み、ベッドメーキングという3つの作業方策へ適応された。共通の事前学習を起点にしながら、歩行と物体操作、硬い物体と変形する物体、両手協調を含む異なる作業を個別に指定する構成となる。
Figure AIの比較では、Helix 2.5は同じ作業を行う従来のHelix 02方策と同等の成功率を、半分の作業固有データで達成した。Helix 02が収集先の環境で評価されたのに対し、Helix 2.5の評価範囲は、作業指定データに含まれない30家庭へ広がった。