画像生成・編集パイプラインのクラス名、処理区分、対応する自動クラスを同じレコードで照合できる98行のメタデータ表が公開されている。Hugging Faceは、ブラウザ上のDataset Viewerと自動変換されたParquetでデータを提供する。
3列でクラス名と処理区分を結ぶ
Hugging Faceが公開するデータセット「huggingface/diffusers-metadata」は、画像パイプラインの対応関係を98行にまとめている。表を構成するのは、pipeline_class、pipeline_tag、auto_classの3列である。
pipeline_classには、AuraFlowPipelineやFluxPipelineなどのクラス名が入る。同じレコードに残る2列が、そのクラスの処理区分と対応する自動クラスを示す。
処理タグを3種類の自動クラスへ対応付ける
pipeline_tagの値は、テキストから画像を生成するtext-to-imageと、画像を入力に使うimage-to-imageの2種類である。各レコードは、個別のパイプラインをいずれかの処理区分へ対応付ける。
auto_classには、AutoPipelineForText2Image、AutoPipelineForImage2Image、AutoPipelineForInpaintingの3種類がある。この値をクラス名と処理タグに並べることで、パイプラインごとの3項目を一つのレコードとして確認できる。
defaultのtrain分割をブラウザで表示
データセットの設定はdefault、分割はtrainである。Dataset Viewerは、この分割に含まれる98行を表示する。
ブラウザ上では、3列の値とレコードごとの組み合わせを閲覧できる。行数と列構成は、データセットの公開画面にも明示されている。
自動変換でParquetファイルを追加
Parquetへの変換コミットでは、default/train/0000.parquetが追加された。コミット上のファイルは、3031バイトのGit LFSオブジェクトとして記録されている。
このコミットを作成したparquet-converterは、Hugging Faceのdatasets-serverチームが運用するボットアカウントである。データセットリポジトリへParquetファイルを追加する処理を担っている。
モデルツリーに残る学習データとしての利用表示
Hugging Face上の公開モデル「sumitng/samm」では、モデルツリーの学習データ一覧にhuggingface/diffusers-metadataが含まれている。この一覧により、少なくともリポジトリのメタデータ上で同データセットの利用が明示されている。
huggingface/diffusers-metadataには、ライセンスとしてapache-2.0が表示されている。表の列構成、配布される分割、ライセンスを同じ公開ページで確認できる。