同じIntel Xeon 6のシリコンとソケット数を維持したまま、Llama 3.1 8BのServerスループットが2.4倍になった。Intelは、MLPerf Inference v6.1で確認した差をソフトウェア改善だけによるものとしている。
同一のXeon構成でServer性能が2.4倍に
Intelの測定では、2基のIntel Xeon 6980PでLlama 3.1 8Bを動かしたServerスループットが、MLPerf Inference v6.0の471.54 tokens/sからv6.1の1,139.51 tokens/sへ上昇した。同じCPUとソケット数を使った比較で、処理量は2.4倍になった。
Offlineスループットも1,229.56 tokens/sから1,916.74 tokens/sへ増え、伸び率は56%となった。ServerとOfflineの両シナリオで、ハードウェア構成を維持したまま測定値が上昇した。
ハードウェアを固定してソフトウェアの差を測る
Intelは、Xeon 6980Pの世代間比較でシリコンとソケット数を変えず、性能向上をソフトウェアの改善だけで達成したとしている。ハードウェア条件をそろえたことで、v6.0からv6.1までの変化はソフトウェアスタックの更新として示された。
測定ノードは、128コアのIntel Xeon 6980Pを2基、96GBのDDR5 MRDIMMを24枚搭載し、総メモリー容量を2,304GBとした。ディスクリートアクセラレーターは使わず、CPUだけでLlama 3.1 8Bの推論を処理した。
Arc Pro B70でも同一システムの性能が上昇
GPU側では、Intel Arc Pro B70を4基搭載した同一システムでgpt-oss-120Bを比較した。Intelの測定では、Server性能が951.67 tokens/sから1,296.87 tokens/sへ36%、Offline性能が1,536.90 tokens/sから1,956.40 tokens/sへ27%向上した。
4基のGPUは合計128GBのVRAMを備える。この1ノード構成は、Llama 3.1 8B、Llama 2 70B、gpt-oss-120B、Whisper、E2E-RAGの提出結果を得ており、言語生成だけでなく音声認識と検索拡張生成まで評価対象を広げた。
E2E-RAGをCPUとGPUの処理段階へ分割
新設されたE2E-RAGベンチマークでは、Intel Xeon 6787Pと4基のIntel Arc Pro B70を組み合わせたシステムで1回の測定が行われた。検索から生成までを通すワークロードを、CPUとGPUの異なる処理段階へ割り当てた。
Xeonは埋め込み、再ランキング、ベクトル検索、Small Language Modelを処理する。その出力を受けるArc Pro B70はLarge Language Modelの生成を担当し、CPUとGPUが一つの検索拡張生成パイプラインを分担した。
Xeonの評価対象とパートナー提出が拡大
Intel製品を使った顧客・パートナーのClosed部門提出結果は、Intel自身の提出を除いてv6.0の29件からv6.1の39件へ増加した。Oracle、Red Hat、Quanta Cloud Technology、Supermicroが新しい組み合わせの提出に加わった。
Xeon 6の評価対象も2 SKUから5 SKUへ増え、CPU推論の結果数は24件から35件となった。Intelによると、この提出結果群で単独のサーバーCPUとして掲載されたのはIntel Xeonだけだった。