内視鏡映像から器具を分割するアプリを、AI開発エージェントが既存モデルを再利用して構築した。NVIDIAは、段階的な測定と最適化により、描画処理量が50.5%向上したと報告している。
既存の器具分割モデルを開発の出発点に
MONAIの内視鏡器具分割モデルは、映像フレームを器具とそれ以外の2種類に分ける。NVIDIAのアプリ集HoloHubには、このモデルと内視鏡サンプル映像を使う既存のアプリがあり、新しいアプリを作る際の動作確認にも利用された。
開発者の確認を挟む反復工程
NVIDIAの開発例では、エンジニアが各段階の目標と制約を決め、AI開発エージェントが実装したコード、出力、テストを確認してから次の目標を設定した。エージェントが使うHoloscan CLIは「./HoloHub」から呼び出せるため、エンジニアも同じ手段で実行結果を確認できた。
映像から分割マスクまで処理を接続
新しいアプリは、MONAIの既存モデル、サンプル映像、前処理、推論処理を再利用し、モデルの重みを変更せずに構築された。映像の再生から前処理、TensorRTによる推論、分割結果の後処理、実行時の測定、HoloVizによる表示までを接続している。
再生した各フレームで推論と分割マスクの後処理を実行し、フレームから得た測定値を映像に重ねて表示した。この表示結果を開発者が確認し、次の段階で測定機能を加える対象を定めた。
300フレームの測定を経て描画処理量を改善
アプリには、測定を繰り返すためのbenchmarkモードが追加された。このモードは300フレームを画面外で処理し、表示を見て判断する工程に測定結果を加える。
NVIDIAが報告した最適化前後の比較では、描画処理量が50.5%向上し、平均アプリケーション経路遅延が33.6%低下した。これらは器具分割モデル自体の精度ではなく、構築したアプリの処理性能を示す結果だ。
開発手段を組み合わせた条件の処理量
CLI、開発スキル、文書を組み合わせた条件では、最初のアプリ構築に要したエージェントの処理時間は約40分で、トークン使用量は1100万だった。この値は内視鏡映像の処理速度とは別に、アプリを作る工程で記録されたものだ。