AI

Isaac ROS 5.0、AIエージェントが使える環境設定・物体操作ツールを追加

この記事のポイント

  1. 実現したこと

    開発者とAIエージェントが、ロボット開発のセットアップと操作に再利用可能なスキルを使えるようになった。

  2. 実現の仕組み

    FoundationStereoファインチューニングスキルが、知覚モデルを使用するカメラ、環境、用途に合わせる作業を支援する。

  3. 得られた結果

    NVIDIAによると、FoundationPoseのエージェント向け推論ライブラリは物体の位置と向きの認識・追跡を最大5.5倍高速化した。

  4. 従来との違い

    対応基盤にROS LyricalとUbuntu 24.04が加わり、Jetson Orin NanoからJetson Thorまでをサポートする構成になった。

ステレオカメラの深度情報から物体の姿勢を推定し、ロボットアームが把持配置する流れを示すイラスト
AI生成画像

GPUアクセラレーション対応のロボット開発パッケージIsaac ROS 5.0は、セットアップ、知覚モデルの調整、ピックアンドプレースをAIエージェント向けの再利用可能な作業として追加した。対応するROS、Ubuntu、Jetson環境も広がった。

セットアップと操作を再利用可能なスキルに分ける

NVIDIAのロボット開発パッケージIsaac ROS 5.0は、セットアップ用と操作用のスキルを追加した。開発者だけでなくAIエージェントも、これらを再利用可能な作業手順として利用できる。

エージェント向け文書は、AIエージェントがIsaac ROSのツールと作業手順を理解できるように構成されている。スキルと文書を組み合わせることで、開発作業の対象と、その実行方法の両方をAIエージェントへ渡す構成となる。

カメラ条件に合わせてステレオ知覚モデルを調整する

FoundationStereoファインチューニングスキルは、ステレオ知覚モデルを開発者のカメラ、使用環境、ロボット用途へ適応させる作業をAIエージェントが支援できるようにする。固定されたモデルをそのまま使うのではなく、実際のセンサー構成に合わせる工程を独立したスキルとして扱う。

調整した知覚処理の先では、物体姿勢推定モデルFoundationPoseが物体の位置と向きを認識し、追跡する。NVIDIAによると、新しいエージェント向け推論ライブラリによって、この認識・追跡処理を最大5.5倍高速化したという。

検出から姿勢出力までを把持配置スキルへ接続する

ピックアンドプレース処理は、単独で利用できるAIエージェント向けスキルになった。このスキルは物体検出、深度推定、姿勢出力を一つの作業の中で接続する。

検出した物体に深度情報を加え、位置と向きを示す姿勢出力へ変換することで、その出力を把持と配置の処理へ渡せる。知覚処理と操作処理を個別に組み立てる構成に加え、一連の処理を再利用可能な単位として選べるようになった。

ROSのデータ経路をJetsonのGPU実行へつなぐ

Isaac ROS 5.0は、ROS LyricalとUbuntu 24.04に対応した。NVIDIAはOpen Source Robotics Allianceと協力し、GPUを含む異なる計算ハードウェアでロボットソフトウェアを効率よく動かすための標準データ処理インターフェースをROS Lyricalへ提供した。

このインターフェースでは、CUDAがGPUアクセラレーションの実装例となる。共通のデータ経路からGPU処理へ接続することで、ROSアプリケーションが計算ハードウェアごとに異なる高速化機能を利用するための入口をそろえる。

ロボット上の実行環境は、NVIDIA Jetson Orin NanoからJetson Thorまでを対象とする。開発時に組み立てた知覚、ナビゲーション、AIモデル、アプリケーションロジックを、処理規模に応じたJetsonプラットフォームへ配置できる構成となった。