AI

AI基盤の動的電力配分、固定電力枠でトークン処理量を24%増加

この記事のポイント

  1. 実現したこと

    動的電力配分ソフトウェアのNVIDIA DSX MaxLPSは、学習と推論が混在するAI計算基盤の電力配分を固定電力枠内で最適化する。

  2. 実現の仕組み

    GPUとラックの消費電力を継続的に監視し、ワークロードの種類に応じて使われていない電力余力をノード間で再配分する。

  3. 得られた結果

    Lambdaの検証では、クラスタ全体のトークン処理量が毎秒約400万から約500万へ増え、24%向上した。

  4. 従来との違い

    16ノードを全出力で動かす場合と同じ電力予算で、稼働ノード数が19へ増えた。

固定電力枠の中で複数のAI計算ラックへ電力余力を動的に再配分する様子を描いた技術イラスト
AI生成画像

GPUとラックの消費電力に応じて電力余力を再配分することで、固定電力枠内のAI推論処理量が増加した。Lambdaの検証では、19ノードを16ノード分の電力予算で動かし、トークン処理量を24%向上させた。

16ノード分の電力枠で19ノードを稼働

NVIDIAによると、AIクラウド事業者のLambdaは、動的電力配分ソフトウェア「NVIDIA DSX MaxLPS」をBlackwell世代のサーバーで検証した。初の導入環境検証には、5ラック、19ノードで構成するクラスタを使用した。

比較の基準は、16ノードを全出力で動かすための電力予算だった。電力予算を増やさずに19ノードを稼働させたことで、同じ電力枠へ3ノード分の計算資源が追加された。

使われていない電力余力をノード間で移す

静的な電力設定は、各ノードが上限まで電力を使うことを前提として容量を確保する。しかし、実際の消費量が上限に届かない時間には、割り当てた電力余力が使われずに残る。

NVIDIA DSX MaxLPSは、GPUとラック単位の消費電力を継続的に監視する。得られた消費状況とワークロードの種類に基づき、余っている電力を必要なノードへ動的に再配分する。

学習と推論の異なる電力特性を配分へ反映

AIの学習処理と推論処理は、同じGPUを使っても消費電力の特性が異なる。両方が同じ計算基盤で動く場合、各ノードに固定した上限を与えるだけでは、クラスタ全体の電力枠を使い切れない時間が生じる。

NVIDIA DSX MaxLPSは、ワークロードごとの電力特性を動的な配分へ反映する。学習と推論が混在する環境でも、クラスタ全体の上限を保ちながら、処理を実行しているノードへ電力余力を振り向ける。

毎秒約500万トークンまで処理量が増加

Lambdaの測定では、クラスタ全体のトークン処理量が毎秒約400万から約500万へ増えた。固定した電力予算に対する増加率は24%だった。

稼働ノードの追加と処理量の増加により、電力当たり性能も23%向上した。電力供給の上限を変えず、クラスタ内の配分方法を変えることで得られた結果である。