GPUとラックの消費電力に応じて電力余力を再配分することで、固定電力枠内のAI推論処理量が増加した。Lambdaの検証では、19ノードを16ノード分の電力予算で動かし、トークン処理量を24%向上させた。
16ノード分の電力枠で19ノードを稼働
NVIDIAによると、AIクラウド事業者のLambdaは、動的電力配分ソフトウェア「NVIDIA DSX MaxLPS」をBlackwell世代のサーバーで検証した。初の導入環境検証には、5ラック、19ノードで構成するクラスタを使用した。
比較の基準は、16ノードを全出力で動かすための電力予算だった。電力予算を増やさずに19ノードを稼働させたことで、同じ電力枠へ3ノード分の計算資源が追加された。
使われていない電力余力をノード間で移す
静的な電力設定は、各ノードが上限まで電力を使うことを前提として容量を確保する。しかし、実際の消費量が上限に届かない時間には、割り当てた電力余力が使われずに残る。
NVIDIA DSX MaxLPSは、GPUとラック単位の消費電力を継続的に監視する。得られた消費状況とワークロードの種類に基づき、余っている電力を必要なノードへ動的に再配分する。
学習と推論の異なる電力特性を配分へ反映
AIの学習処理と推論処理は、同じGPUを使っても消費電力の特性が異なる。両方が同じ計算基盤で動く場合、各ノードに固定した上限を与えるだけでは、クラスタ全体の電力枠を使い切れない時間が生じる。
NVIDIA DSX MaxLPSは、ワークロードごとの電力特性を動的な配分へ反映する。学習と推論が混在する環境でも、クラスタ全体の上限を保ちながら、処理を実行しているノードへ電力余力を振り向ける。
毎秒約500万トークンまで処理量が増加
Lambdaの測定では、クラスタ全体のトークン処理量が毎秒約400万から約500万へ増えた。固定した電力予算に対する増加率は24%だった。
稼働ノードの追加と処理量の増加により、電力当たり性能も23%向上した。電力供給の上限を変えず、クラスタ内の配分方法を変えることで得られた結果である。