複数カメラの映像から判断理由と走行軌道を生成する自動運転向け基盤モデルAlpamayo 2 Superが、商用利用可能になった。NVIDIAはモデル重みを公開し、開発者が自社のデータに合わせて調整できる条件を設けた。
モデル重みの商用利用と再配布を認める
NVIDIAが公開した自動運転向け基盤モデルAlpamayo 2 Superは、車両開発での商用利用に対応する。モデル重みにはopenmdw-1.1ライセンスが適用され、開発者はファインチューニングや派生モデルの作成、商用再配布ができる。
先行するAlpamayoモデルは当初、研究開発向けに導入されていた。ライセンスの適用対象はモデル群全体へ広がり、既存モデルも商用利用の対象となる。
複数カメラの入力を判断理由と走行軌道へつなぐ
約340億パラメータのモデルは、視覚言語モデルの基盤部と、走行動作を生成する拡散モデルの専門部を組み合わせる。入力には複数カメラの時系列画像と車両自身の移動履歴を使い、車両の周囲と直前までの動きを処理する。
公開コードの推論経路では、視覚言語モデルの基盤部が判断理由のテキストを生成する。その出力に続いて動作生成部が将来の走行軌道をサンプリングし、状況の説明と経路の生成を一つのモデル内で扱う。
経路に加えて運転意図を出力する
走行場面に対する出力には、予定する経路、判断理由を示すChain-of-Causation、譲る・車線変更する・停止するといった意図を表すメタアクションが含まれる。Chain-of-Causationは、モデルがその行動を選ぶ理由を文章で示す出力だ。
公開仕様の走行軌道は、0.1秒から6.4秒先までを0.1秒間隔の64点で表す。開発者は経路だけでなく、その経路につながる判断理由と運転意図も確認できる。
判断理由を学習用ラベルにも変換する
モデルは判断理由の自動ラベル付けにも対応する。走行映像に判断の根拠を付けることで、開発者は車両データを学習や検証に使うための注釈を生成できる。
視覚質問応答では、回答をカメラ画像中の特定領域に対応付ける。走行場面についての回答と画像上の位置を結び、モデルが参照した対象を確認できる。
自動運転の推論評価で約40モデル中の首位
NVIDIAの評価では、Alpamayo 2 Superは自動運転の推論能力を測るLingoQAで、評価対象となった約40モデル中の首位だった。判定指標Lingo-Judgeのスコアは79.2点となっている。
同じくNVIDIAが実施したLingo-Judge評価では、Qwen2.5-VL 72Bを17.0点、Gemini 2.5 Proを15.1点、GPT-4oを23.2点上回った。これらはNVIDIAによるベンチマーク上の比較結果である。