AI

画像生成・編集パイプラインのメタデータ98行を公開、処理区分と自動クラスを対応付け

この記事のポイント

  1. 実現したこと

    画像生成・編集パイプラインごとに、処理区分と対応する自動クラスを一つのレコードで照合できる。

  2. 実現の仕組み

    pipeline_class、pipeline_tag、auto_classの3列が、クラス名、処理区分、自動クラスを行単位で結び付ける。

  3. 得られた結果

    98行に2種類の処理タグと3種類の自動クラスが収録され、Dataset Viewerに表示されている。

  4. 従来との違い

    default設定のtrain分割に、自動変換されたParquetファイルを参照する経路が加わった。

画像生成・編集パイプラインの対応関係を抽象化した三列のメタデータ構造と、複数の画像処理経路を示す編集イラスト
AI生成画像

画像生成・編集パイプラインのクラス名、処理区分、対応する自動クラスを同じレコードで照合できる98行のメタデータ表が公開されている。Hugging Faceは、ブラウザ上のDataset Viewerと自動変換されたParquetでデータを提供する。

3列でクラス名と処理区分を結ぶ

Hugging Faceが公開するデータセット「huggingface/diffusers-metadata」は、画像パイプラインの対応関係を98行にまとめている。表を構成するのは、pipeline_class、pipeline_tag、auto_classの3列である。

pipeline_classには、AuraFlowPipelineやFluxPipelineなどのクラス名が入る。同じレコードに残る2列が、そのクラスの処理区分と対応する自動クラスを示す。

処理タグを3種類の自動クラスへ対応付ける

pipeline_tagの値は、テキストから画像を生成するtext-to-imageと、画像を入力に使うimage-to-imageの2種類である。各レコードは、個別のパイプラインをいずれかの処理区分へ対応付ける。

auto_classには、AutoPipelineForText2Image、AutoPipelineForImage2Image、AutoPipelineForInpaintingの3種類がある。この値をクラス名と処理タグに並べることで、パイプラインごとの3項目を一つのレコードとして確認できる。

defaultのtrain分割をブラウザで表示

データセットの設定はdefault、分割はtrainである。Dataset Viewerは、この分割に含まれる98行を表示する。

ブラウザ上では、3列の値とレコードごとの組み合わせを閲覧できる。行数と列構成は、データセットの公開画面にも明示されている。

自動変換でParquetファイルを追加

Parquetへの変換コミットでは、default/train/0000.parquetが追加された。コミット上のファイルは、3031バイトのGit LFSオブジェクトとして記録されている。

このコミットを作成したparquet-converterは、Hugging Faceのdatasets-serverチームが運用するボットアカウントである。データセットリポジトリへParquetファイルを追加する処理を担っている。

モデルツリーに残る学習データとしての利用表示

Hugging Face上の公開モデル「sumitng/samm」では、モデルツリーの学習データ一覧にhuggingface/diffusers-metadataが含まれている。この一覧により、少なくともリポジトリのメタデータ上で同データセットの利用が明示されている。

huggingface/diffusers-metadataには、ライセンスとしてapache-2.0が表示されている。表の列構成、配布される分割、ライセンスを同じ公開ページで確認できる。