AI

MLPerfで同じXeon 6構成のLlama推論が2.4倍、ソフトウェア最適化だけで向上

この記事のポイント

  1. 実現したこと

    4基のIntel Arc Pro B70を搭載した1ノードで、言語モデル、音声認識、E2E-RAGを含む5種類のAIワークロードを実行した。

  2. 実現の仕組み

    E2E-RAGでは、Xeonが検索までの各段階を処理し、Arc Pro B70がLarge Language Modelの生成を受け持った。

  3. 得られた結果

    同じ2基のXeon 6980Pを使ったLlama 3.1 8BのServerスループットは、471.54 tokens/sから1,139.51 tokens/sへ2.4倍になった。

  4. 従来との違い

    Xeon 6の評価対象は2 SKUから5 SKUへ、CPU推論の結果数は24件から35件へ増えた。

同一サーバー上でCPUとGPUが推論処理を分担し、データフローで接続される概念図
AI生成画像

同じIntel Xeon 6のシリコンとソケット数を維持したまま、Llama 3.1 8BのServerスループットが2.4倍になった。Intelは、MLPerf Inference v6.1で確認した差をソフトウェア改善だけによるものとしている。

同一のXeon構成でServer性能が2.4倍に

Intelの測定では、2基のIntel Xeon 6980PでLlama 3.1 8Bを動かしたServerスループットが、MLPerf Inference v6.0の471.54 tokens/sからv6.1の1,139.51 tokens/sへ上昇した。同じCPUとソケット数を使った比較で、処理量は2.4倍になった。

Offlineスループットも1,229.56 tokens/sから1,916.74 tokens/sへ増え、伸び率は56%となった。ServerとOfflineの両シナリオで、ハードウェア構成を維持したまま測定値が上昇した。

ハードウェアを固定してソフトウェアの差を測る

Intelは、Xeon 6980Pの世代間比較でシリコンとソケット数を変えず、性能向上をソフトウェアの改善だけで達成したとしている。ハードウェア条件をそろえたことで、v6.0からv6.1までの変化はソフトウェアスタックの更新として示された。

測定ノードは、128コアのIntel Xeon 6980Pを2基、96GBのDDR5 MRDIMMを24枚搭載し、総メモリー容量を2,304GBとした。ディスクリートアクセラレーターは使わず、CPUだけでLlama 3.1 8Bの推論を処理した。

Arc Pro B70でも同一システムの性能が上昇

GPU側では、Intel Arc Pro B70を4基搭載した同一システムでgpt-oss-120Bを比較した。Intelの測定では、Server性能が951.67 tokens/sから1,296.87 tokens/sへ36%、Offline性能が1,536.90 tokens/sから1,956.40 tokens/sへ27%向上した。

4基のGPUは合計128GBのVRAMを備える。この1ノード構成は、Llama 3.1 8B、Llama 2 70B、gpt-oss-120B、Whisper、E2E-RAGの提出結果を得ており、言語生成だけでなく音声認識と検索拡張生成まで評価対象を広げた。

E2E-RAGをCPUとGPUの処理段階へ分割

新設されたE2E-RAGベンチマークでは、Intel Xeon 6787Pと4基のIntel Arc Pro B70を組み合わせたシステムで1回の測定が行われた。検索から生成までを通すワークロードを、CPUとGPUの異なる処理段階へ割り当てた。

Xeonは埋め込み、再ランキング、ベクトル検索、Small Language Modelを処理する。その出力を受けるArc Pro B70はLarge Language Modelの生成を担当し、CPUとGPUが一つの検索拡張生成パイプラインを分担した。

Xeonの評価対象とパートナー提出が拡大

Intel製品を使った顧客・パートナーのClosed部門提出結果は、Intel自身の提出を除いてv6.0の29件からv6.1の39件へ増加した。Oracle、Red Hat、Quanta Cloud Technology、Supermicroが新しい組み合わせの提出に加わった。

Xeon 6の評価対象も2 SKUから5 SKUへ増え、CPU推論の結果数は24件から35件となった。Intelによると、この提出結果群で単独のサーバーCPUとして掲載されたのはIntel Xeonだけだった。