AI

Falcon-40Bの4ビット量子化モデルを公開

この記事のポイント

  1. 実現したこと

    Falconの量子化済みモデルを、公開されたモデルIDで推論ソフトウェアに指定できる。

  2. 実現の仕組み

    元のモデルをgptqで量子化し、その処理にWikiText-2を用いた。

  3. 得られた結果

    Hugging Faceは、ビット幅4ビット、グループサイズ128の派生モデルを公開した。

  4. 従来との違い

    元のfalcon-40bから、gptq量子化を施したfalcon-40b-gptqが派生した。

モデルの重みが量子化され、二系統の推論処理へ分配される流れを描いた編集イラスト
AI生成画像

Falcon-40Bをgptqで4ビット量子化したモデル「falcon-40b-gptq」が公開された。Hugging Faceは元モデルとの関係と量子化条件を明示し、推論ソフトウェアで使うための設定を用意した。

Falconの元モデルから量子化版を作成

Hugging Faceが公開した言語モデル「falcon-40b-gptq」は、「tiiuae/falcon-40b」を厳密に複製したうえでgptq量子化を施した派生版だ。モデルの出自を元のFalconに結び付けながら、量子化済みのモデルを別の識別子で提供している。

gptqの量子化条件は4ビットとグループサイズ128

量子化にはWikiText-2を使い、ビット幅を4ビット、グループサイズを128に設定した。gptqはモデルの重みを量子化する手法で、この二つの数値は公開された派生版の量子化条件を特定する。

推論ソフトウェアには2シャードで指定

この量子化版はHugging Faceの推論ソフトウェア「text-generation-inference」での利用を想定している。起動例ではモデルIDに「huggingface/falcon-40b-gptq」を設定し、シャード数を2に指定する。これにより、どの公開モデルを推論処理へ読み込むかが設定上明確になる。

コンテナ起動時にもgptqを明示

Dockerを使う起動例では、text-generation-inferenceのバージョン0.8を指定し、量子化方式として「gptq」を渡す。公開されたモデルIDと量子化方式を組み合わせて、量子化済みの派生版を推論ソフトウェアへ指定する構成だ。