Technology

100万トークンのAttentionカーネルで全領域参照比最大7.6倍のプリフィル高速化

この記事のポイント

  1. 実現したこと

    長文AIモデルのQwen3.8-Flash-Nextは、26万2144トークンを標準で扱い、YaRNにより100万トークンまでコンテキストウィンドウを拡張できる。

  2. 実現の仕組み

    Gated DeltaNetが履歴を固定サイズの再帰状態へ圧縮し、Qwen Sparse Attentionが関連領域をマイクロブロック単位で選ぶ。

  3. 得られた結果

    100万トークンの公開ベンチマークでは、Qwen Sparse AttentionのAttentionカーネルがfull attention比でプリフィルを最大7.6倍、デコードを最大4.9倍高速化した。

  4. 従来との違い

    疎なAttentionの領域選択が、長文ほど負荷の増すトークン単位の索引付けから、マイクロブロック単位の重要度判定へ変わった。

長文AIモデルの履歴を圧縮する層と、関連するマイクロブロックだけを選ぶAttention処理を抽象的に示した編集イラスト
AI生成画像

履歴を固定サイズへ圧縮し、必要な領域だけをブロック単位で参照する長文AIモデルが登場した。100万トークン条件の公開ベンチマークでは、Attentionカーネルのプリフィルがfull attention比で最大7.6倍高速になった。

圧縮層と検索層を3対1で配置

NVIDIAが技術検証した長文AIモデルのQwen3.8-Flash-Nextは、Gated DeltaNetとQwen Sparse Attentionを組み合わせたマルチモーダルMixture of Experts(MoE)モデルである。4層のうち3層をGated DeltaNet、残る1層をQwen Sparse Attentionとし、履歴の保持と元の系列からの検索を分担させる。

モデル本体は1250億パラメータで、これに510億パラメータのN-gram embeddingsを加え、トークンごとに60億パラメータを有効化する。ネイティブなコンテキストウィンドウは26万2144トークンで、YaRNを使うと100万トークンまで拡張できる。

Gated DeltaNetが履歴を固定サイズへ圧縮

長いコンテキストの推論では、Attentionの計算量に加え、過去のキーとバリューを保持するKVキャッシュのメモリ使用量が増える。Gated DeltaNetは入力を順番に処理しながら、過去のコンテキストを固定サイズの再帰状態へ継続的に圧縮する。

再帰状態は、それまでの履歴を後続トークンの処理へ引き渡す。状態の大きさが系列長に応じて増えないため、Gated DeltaNet層では系列が長くなってもKVキャッシュが増大しない。

マイクロブロック単位で参照領域を選択

固定サイズの状態による履歴保持を補うQwen Sparse Attentionは、入力系列をマイクロブロックへ集約する。各ブロックの重要度を推定し、関連性の高い領域だけをAttention計算の対象に選ぶ。

従来の疎なAttentionで使われるトークン単位のインデクサーは、コンテキストが長くなるほど計算負荷が増える。Qwen Sparse Attentionは選択単位をブロックへ移すことで、Attention計算とインデックス作成の負荷を削減する。

100万トークン条件で二つの性能比較

NVIDIAが紹介したAlibabaの公開ベンチマークでは、100万トークンの処理において、Qwen Sparse AttentionのAttentionカーネルがfull attentionに対し、プリフィルを最大7.6倍、デコードを最大4.9倍高速化した。この倍率はモデル全体ではなく、Attentionカーネルを比較した値である。

別のオンラインサービング試験では、100万トークンのコンテキストと90%のプレフィックスキャッシュヒット率を条件とした。この条件でQwen3.8-Flash-Nextは、Qwen3.7-Plusの8.6倍のプリフィルスループットを達成した。

72基のGPUを結ぶ基盤で推論性能を測定

ラックスケールの推論基盤NVIDIA GB300 NVL72は、72基のNVIDIA Blackwell Ultra GPUを一つのプラットフォームへ統合する。72基のGPUからなるNVIDIA NVLinkドメインは毎秒130TBのall-to-all通信に対応し、MoEのExpert間で発生するデータ移動をラック内で処理する。

NVIDIAの測定では、この基盤上のQwen3.8-Flash-Nextが、GPU当たり毎秒1万6000トークン超、ユーザー当たり毎秒200トークン超を記録した。この値はGB300 NVL72上の推論性能であり、前節のAttentionカーネル比較やキャッシュ条件付きサービング試験とは測定対象が異なる。

ローカル実行から微調整と推論展開まで対応

Qwen3.8-Flash-Nextは、NVIDIA DGX Station、NVIDIA DGX Sparkクラスター、4基のNVIDIA RTX PRO 6000 Blackwell Max-Q Workstation Edition GPUを搭載したワークステーションでも動作する。ラックスケール基盤に限らず、これらのローカルなNVIDIAハードウェアでもモデルを試せる構成となっている。

PyTorchベースの微調整ライブラリNVIDIA NeMo AutoModelは、既存のHugging Faceチェックポイントを変換せずに読み込み、full SFTとLoRAによる微調整に対応する。NVIDIA NeMo RLは強化学習レシピを提供し、推論側ではSGLang、vLLM、TokenSpeedがNVIDIAアクセラレーテッドプラットフォーム向けのオープンソースレシピを提供する。