ゲーム画面からゲームパッド操作を予測するAIモデルNitroGenが、1000超のゲームにまたがる4万時間のプレー映像で学習された。追加学習によって、学習時に含まれなかったゲームにも適応できる。
4万時間のプレー映像を操作の学習データにする
NVIDIAは、ロボット向け基盤モデルIsaac GR00Tのアーキテクチャを使い、ゲーム操作向け基盤モデルNitroGenを開発した。学習には、1000超のゲームにわたる4万時間のプレー映像を用いた。
映像と操作の組はインターネット上の動画から集められ、モデルは行動模倣によって画面と操作の対応を学ぶ。この学習によって、複数のゲームに共通して使う操作モデルを構成した。
画面画像をスティックとボタンの操作へ変換する
公開モデルは256×256ピクセルのRGB画像を入力とする。構成にはSigLip2のVision TransformerとDiffusion Matching Transformerを組み合わせ、入力画像からゲームパッド操作を予測する。
出力は二つのスティックの連続値と17個のボタンの二値状態に対応する。モデルが参照できるのは直近の1フレームであり、画面から次の操作を出す構成だ。
複数ジャンルで戦闘・移動・探索を評価する
NVIDIAは、アクションRPG、プラットフォームゲーム、ローグライク、オープンワールドゲームなどでNitroGenを評価した。戦闘、移動、探索にわたるゲーム内動作を確認したとしている。
少数の例しかない新しい環境では、事前学習済みのNitroGenを出発点とする条件も調べた。NVIDIAによると、この条件での性能は従来の最良手法より最大52%高かった。
未学習のゲームにはモデルを追加学習する
多ゲームで学んだモデルは、学習時に含まれなかったゲームへ追加学習で適応できる。新しいゲームで少数の例から始める評価は、この使い方に対応する。
映像から操作を予測する学習済みモデルを出発点にできることが、ゲームごとに利用する際の技術的な変化となる。