AI

AI基盤Vera Rubinの推論処理量、GB200比で最大4.8倍

この記事のポイント

  1. 実現したこと

    AI開発企業Cognitionが、CoreWeave上のVera Rubinで本番ワークロードを実行し始めた。

  2. 実現の仕組み

    強化学習向けのRL Rolloutsは、稼働中の推論環境へ新しい学習済みチェックポイントを読み込み、再デプロイを省く。

  3. 得られた結果

    Cognitionの初期試験では、コード生成モデルSWE-2の総トークン処理量がGB200 NVL72比で最大4.8倍になった。

  4. 従来との違い

    隔離実行サービスCoreWeave Sandboxesが一般提供へ移行し、ツール呼び出しや強化学習ごとに新しい実行環境を提供する。

AI推論を担うデータセンターの計算ラックと、エージェントのツール実行に使う独立した実行環境を描いた編集イラスト。
AI生成画像

AI計算基盤Vera Rubin NVL72がクラウド上の本番処理に入った。NVIDIAが紹介したCognitionの初期試験では、ソフトウェア開発課題を解くSWE-2の推論で、総トークン処理量がGB200 NVL72の最大4.8倍になった。

本番ラックを受け取り、顧客向けクラスターを稼働

AIクラウド事業者CoreWeaveは、NVIDIAのAI計算システムVera Rubin NVL72をCoreWeave Cloudで提供し始めた。構成には、AI向けEthernetネットワークのSpectrum-X 102.4Tを組み合わせる。

NVIDIAによると、最初の本番ラックは9月に到着し、顧客向けの本番クラスターは数日で立ち上がった。そのクラスターを使うAI開発企業Cognitionが、Vera Rubinで本番ワークロードを実行する最初の顧客となった。

ソフトウェア開発課題でGB200と推論処理量を比較

Cognitionは、AIソフトウェアエンジニアDevinの学習、強化学習、本番推論をCoreWeave上で実行している。新しい計算基盤の推論性能を調べるため、評価用の課題群FrontierCodeから一部の課題を抽出し、AIエージェントに解かせた。

このソフトウェア開発を想定した負荷を使い、CognitionはVera Rubin NVL72と比較対象のAI計算システムGB200 NVL72を測定した。NVIDIAが紹介した初期試験では、コード生成モデルSWE-2の推論における総トークンスループット、すなわち単位時間当たりのトークン処理量が最大4.8倍になった。この数値は、試験対象のワークロードにおける総処理量の比較を示す。

推論と並行するコード実行をCPUの隔離環境で支える

エージェントが利用する計算資源には、推論に加えてツールやコードの実行環境も含まれる。CoreWeaveの隔離実行サービスCoreWeave Sandboxesは一般提供を開始し、ツール呼び出し、強化学習、評価ごとに新しいCPUまたはGPU実行環境を提供する。

CoreWeaveは、この実行基盤にAIエージェント向けプロセッサーNVIDIA Vera CPUも提供する予定だ。NVIDIAが示す構成は1ラック当たり128個のCPU、11,264コアで、1環境に1コアを割り当てれば11,000を超える環境の同時実行に対応する。

Vera CPUと隔離実行サービスを組み合わせる構成では、実行環境をハードウェアで隔離する。これらの環境は、支援対象の学習ジョブと並行して動作する。

学習済みモデルを稼働中の推論環境へ受け渡す

CoreWeaveは、モデルとエージェントを継続的に改善するための統合環境CoreWeave Forgeも立ち上げた。この環境は、機械学習開発ツールのWeights & Biases、OpenPipeの追加学習に関する専門技術、オープンソースのノートブックプロジェクトmarimoを結ぶ。

推論側では、オープンソースの推論フレームワークNVIDIA Dynamoがマネージド推論サービスと、強化学習向けサービスRL Rolloutsを支える。非公開プレビュー段階のRL Rolloutsは、学習済みモデルの保存状態であるチェックポイントを稼働中のデプロイメントへ読み込む。この受け渡しにより、再デプロイせずに強化学習を継続する。