AI

AI推論基盤Vera Rubin、電力当たり処理量はGB300の最大30倍

この記事のポイント

  1. 実現したこと

    AgentXは、記録済みのコーディングエージェント作業を再生し、AI推論基盤の処理能力を評価する。

  2. 実現の仕組み

    再生時に会話の蓄積、入出力の長さ、推論時間、ツールの待ち時間を維持する。

  3. 得られた結果

    NVIDIAの測定では、Vera Rubin NVL72が利用者当たり毎秒160トークンの条件で、GB300 NVL72の最大30倍のメガワット当たり処理量を示した。

  4. 従来との違い

    固定長の入出力を使う従来の評価は保守扱いとなり、AgentXはセッション中に変動する要求を測る。

コーディングエージェントの可変な作業列を二つの推論サーバーに再生し、電力当たりの処理量を比較する図
AI生成画像

AIエージェントの作業記録を再生する評価で、推論基盤Vera Rubin NVL72がGB300 NVL72の最大30倍のメガワット当たり処理量を示した。NVIDIAによるプレビュー測定の結果で、利用者当たり毎秒160トークンの条件に限られる。

固定長の要求では捉えにくいエージェントの負荷

AIエージェントの作業では、モデルへの要求の長さがターンごとに変わり、会話が進むにつれてコンテキストが蓄積する。ツールの実行中にはモデルへの要求が途切れるため、一定の長さの入力と出力を繰り返す評価とは負荷の形が異なる。

NVIDIAが示した従来のInferenceX評価には、入力8,000トークン・出力1,000トークンの固定長シナリオがある。このシナリオは保守扱いへ移され、エージェントのセッションで生じる変動を測る役割はAgentXが担う。

作業記録をターンごとに再生するAgentX

SemiAnalysisのオープンソース評価スイートInferenceXに含まれるAgentXは、コーディングエージェントの推論負荷を対象とする。記録済みのClaude CodeセッションをAIPerfクライアントでターンごとに再生し、評価対象のシステムへ同じ作業の流れを与える。

再生時には、各セッションのコンテキストと入出力の長さに加え、記録された推論時間やツール呼び出しの待ち時間も維持する。要求が途切れる間隔まで含めることで、セッションの進行に伴うKVキャッシュの容量負荷を再現する。

対話速度をそろえて電力当たり処理量を測る

AgentXは同時実行数を変え、利用者への応答速度と、確保したメガワット当たりの持続的な処理量との関係を測る。処理量だけを増やした条件ではなく、対話速度も指定した条件で推論基盤を比較できる。

利用者が受け取る出力の速度を表す指標の一つは、出力トークン数を要求送信から最終トークン到着までの時間で割って求める。最初のトークンを待つ時間も含むため、生成が始まってからの速度だけでは分からない応答の遅れが反映される。

Vera Rubinの測定値と確認段階

NVIDIAが測定したVera Rubin NVL72の数値は、SemiAnalysisの確認を待つプレビュー結果である。AgentXのDeepSeek V4-Pro負荷で利用者当たり毎秒160トークンにそろえたとき、メガワット当たり処理量はGB300 NVL72の最大30倍だった。

この倍率は、記録済みのエージェント作業を再生し、指定した対話速度を満たす条件で比較した値を示す。対象は推論基盤に確保した電力当たりの処理量であり、個々の要求が30倍速く完了したという測定値ではない。